Capability Framework
三类能力协同, 避免单点安全失效
研发、管理、安全保障等能力必须共同作用。研发能力负责把约束嵌入智能体执行过程, 管理能力明确谁能授权、智能体能自主决定什么, 安全保障能力持续发现数据投毒、隐私泄露、算法篡改和供应链风险。
任务规划与行为围栏
建设显式和隐式标识、提示与工具输入校验、任务分解约束、输出检查、敏感操作二次确认等内生安全技术。
授权边界与责任机制
明确用户授权、智能体自主决策、人工审批和例外处置边界, 对身份、策略、行为和结果形成可追溯记录。
数据、模型与供应链防护
监测数据投毒、隐私泄露、模型篡改、恶意插件和依赖风险, 建立持续测试、情报共享和事件响应能力。
监控评估与持续改进
用越权率、敏感数据拦截率、异常调用发现时间和审计覆盖率等指标评估控制有效性。
Control Matrix
智能体关键风险与控制矩阵
| 风险域 | 研发控制 | 管理控制 | 安全保障 |
|---|---|---|---|
| 数据安全 | 输入脱敏、输出检测、加密存储 | 分类分级、用途限定、保留期限 | 泄露检测、异常下载告警 |
| 权限管理 | 最小权限令牌、工具白名单 | 授权审批、定期复核、职责分离 | 越权检测、会话阻断、审计追踪 |
| 行为控制 | 任务围栏、高风险动作确认 | 自主决策分级、人工接管规则 | 行为基线、异常序列检测 |
| 模型与供应链 | 模型签名、组件锁定、来源校验 | 供应商准入、变更审批 | 投毒评估、完整性监测、情报共享 |
Roadmap
从边界梳理到持续运营的建设路径
- 01盘点智能体资产: 明确模型、知识库、工具、接口、账号和数据流向。
- 02划分决策等级: 按风险定义自动执行、二次确认、人工审批和禁止执行的操作。
- 03嵌入技术控制: 在输入、规划、调用、输出和存储节点配置验证与拦截。
- 04建立审计证据: 关联用户授权、策略版本、调用参数、工具响应和最终结果。
- 05持续攻击验证: 定期开展提示注入、数据泄露、越权调用和供应链风险测试。
Assessment
能力成熟度评估要点
评估不只检查制度是否存在, 还要验证控制是否真正阻断风险。建议从覆盖度、有效性、响应速度和证据完整性四个维度评分。
覆盖度关键资产与调用链全部纳管
有效性攻击模拟能够触发预期控制
可追溯授权、行为、结果证据完整
梳理智能体授权与风险边界
从资产、数据、工具和高风险动作建立第一版控制清单。
