规模化不是增加更多模型调用, 而是把场景准入、数据权限、工具执行、质量评测和责任机制固化为可复用的工程能力。
先识别试点与生产系统的差距
试点通常由少量人员使用固定样例, 关注答案是否令人满意。生产环境面对的却是持续变化的输入、复杂权限、外部工具故障和明确的服务等级要求。一个能回答问题的原型, 还没有解决身份继承、调用幂等、失败补偿、成本控制与审计追溯。
因此, 立项时应同时定义业务指标和系统指标。业务指标可以是工单一次解决率、报告准备时间或人工复核工作量; 系统指标则包括任务成功率、错误执行率、响应时延、单次任务成本和人工接管比例。只有两类指标同时改善, 才说明智能体产生了可持续价值。
用任务边界替代宽泛的“智能化”目标
优先选择输入、输出和责任人都清晰的任务, 例如查询订单状态、汇总指定数据或生成待审核草稿。对于付款、删除、审批、对外发送等高影响动作, 智能体应只准备参数或建议, 由确定的授权主体确认后执行。
建立分层自主等级
- 建议级: 智能体生成答案或操作建议, 不直接改变业务状态。
- 辅助执行级: 在白名单工具和参数约束内执行, 高风险步骤必须确认。
- 受控自主级: 仅在低风险、可回滚、监控充分的任务中自动闭环。
每个等级都要绑定允许的数据范围、工具集合、成本上限和异常处理方式, 不能只依靠系统提示描述边界。
把共性控制沉淀到智能体平台
规模化阶段不宜让每个项目重复实现身份、知识检索、工具注册、提示模板和日志。平台层应提供统一的模型接入、版本管理、权限透传、敏感信息检测、工具网关、会话追踪与评测接口。业务团队负责场景流程, 平台团队维护共性控制和运行基线。
工具调用尤其需要结构化约束。平台应校验调用者身份、参数类型、资源范围和授权时效, 为写操作提供幂等键与回滚路径。模型输出只能作为候选参数, 不能绕过业务系统原有的鉴权与校验。
以评测和运营推动持续改进
上线前建立覆盖正常任务、边界输入、权限差异、提示注入和依赖故障的评测集。上线后从真实失败中补充样本, 按模型、提示、知识库、工具和策略版本重放评测。这样才能区分模型波动与工程缺陷, 避免凭个别对话判断质量。
落地检查场景有明确责任人和退出条件; 高风险动作存在确定性授权; 全链路可追踪到模型、知识和工具版本; 质量、成本与业务收益按同一周期复盘。