RAG系统的质量链路由内容、解析、切分、索引、召回、重排和生成共同组成。治理必须能定位每一环的版本与责任。
从知识源准入开始控制质量
文档进入知识库前应明确所有者、适用范围、生效日期、保密等级和更新周期。重复、失效或互相冲突的文件会让模型得到多个看似合理的答案, 这类问题无法仅靠向量检索解决。
解析流程需要保留标题层级、表格关系、页码和来源链接, 并对扫描件、复杂表格与异常编码做质量检查。每个内容块都应携带文档版本、章节路径、权限标签和更新时间, 使答案可以引用并追溯到原文。
切分与召回应围绕问题类型设计
固定字符数切分虽然简单, 却可能把定义与条件、表头与数据拆开。更可靠的方法是先按章节和语义边界切分, 再根据问答、制度、手册等内容类型设置不同长度与重叠策略。检索时可组合关键词和向量召回, 用重排模型筛除语义接近但上下文错误的片段。
不要只看召回数量
应分别测量目标证据是否进入候选集、是否排在可用位置, 以及生成答案是否忠实于证据。增加召回数量可能引入噪声并抬高上下文成本, 最优值需要通过真实问题集验证。
让检索严格继承业务权限
知识库不能因为内容被向量化就失去原有访问控制。查询时应把用户、部门、项目、地域和数据等级转换为确定性的过滤条件, 在召回阶段排除无权内容。生成层的提示约束只能作为补充, 不能承担鉴权职责。
对涉及个人信息或商业敏感字段的答案, 还应执行输出检测与最小化处理。日志记录检索标识和策略结果即可, 不应为排障再次复制完整敏感内容。
用分层评测形成改进闭环
评测集应包含标准问法、口语表达、信息不足、冲突资料、无答案问题和越权问题。指标至少覆盖检索命中率、引用正确性、答案忠实度、拒答准确性、权限拦截率、延迟与成本。线上低评分、人工改写和无结果查询应定期回流, 但进入基准集前需人工确认。
质量检查文档有明确所有者与有效期; 答案可追溯到具体版本和章节; 检索权限与源系统一致; 每次索引、模型或策略变更都经过同一组基准测试。