智能体安全不是只给模型加提示词, 而是把身份、授权、工具、审计、回滚和人工确认组合成可验证的控制体系。
限定工具和数据范围
智能体能调用哪些系统、读取哪些数据、执行哪些动作, 都应通过白名单和最小权限控制。涉及资金、账号、配置和外部发送的动作需要更高等级确认。
防范提示词注入和越权
对外部文档、网页、用户输入和检索结果进行可信度标记, 避免未经验证的内容直接改变系统指令。关键工具调用前应检查上下文、用户授权和业务规则。
记录行为链路
审计日志应覆盖用户请求、模型规划、工具调用、数据读取、输出内容和人工确认。出现异常时, 团队需要能还原智能体为何执行某个动作。
把智能体纳入组织治理
研发能力负责安全架构和控制实现, 管理能力负责授权边界和责任划分, 安全保障能力负责红队测试、异常监控和应急处置。
落地检查清单
- 工具调用有白名单
- 关键动作有人审或强确认
- 输入来源有可信标记
- 行为审计可还原链路
方案建议将本文控制项写入软件安全建议方案, 并分别指定研发负责人、管理审批人和安全保障复测人, 形成可追溯闭环。
常见问题
这类文章适合放在项目方案还是组织基线?
通用规则建议进入组织级软件安全基线, 项目方案只保留与当前系统风险、业务范围和上线节奏直接相关的控制项。
如何判断措施是否真正落地?
看是否同时具备责任人、执行记录、工具或人工验证结果、例外审批和复盘改进记录。缺少证据的措施不宜作为已完成项。