RAG / Knowledge Engineering

RAG知识库质量治理方法

高质量答案首先来自可治理的知识源, 而不是不断调整提示词。

2026年7月22日阅读约6分钟
RAG系统的质量链路由内容、解析、切分、索引、召回、重排和生成共同组成。治理必须能定位每一环的版本与责任。

从知识源准入开始控制质量

文档进入知识库前应明确所有者、适用范围、生效日期、保密等级和更新周期。重复、失效或互相冲突的文件会让模型得到多个看似合理的答案, 这类问题无法仅靠向量检索解决。

解析流程需要保留标题层级、表格关系、页码和来源链接, 并对扫描件、复杂表格与异常编码做质量检查。每个内容块都应携带文档版本、章节路径、权限标签和更新时间, 使答案可以引用并追溯到原文。

切分与召回应围绕问题类型设计

固定字符数切分虽然简单, 却可能把定义与条件、表头与数据拆开。更可靠的方法是先按章节和语义边界切分, 再根据问答、制度、手册等内容类型设置不同长度与重叠策略。检索时可组合关键词和向量召回, 用重排模型筛除语义接近但上下文错误的片段。

不要只看召回数量

应分别测量目标证据是否进入候选集、是否排在可用位置, 以及生成答案是否忠实于证据。增加召回数量可能引入噪声并抬高上下文成本, 最优值需要通过真实问题集验证。

让检索严格继承业务权限

知识库不能因为内容被向量化就失去原有访问控制。查询时应把用户、部门、项目、地域和数据等级转换为确定性的过滤条件, 在召回阶段排除无权内容。生成层的提示约束只能作为补充, 不能承担鉴权职责。

对涉及个人信息或商业敏感字段的答案, 还应执行输出检测与最小化处理。日志记录检索标识和策略结果即可, 不应为排障再次复制完整敏感内容。

用分层评测形成改进闭环

评测集应包含标准问法、口语表达、信息不足、冲突资料、无答案问题和越权问题。指标至少覆盖检索命中率、引用正确性、答案忠实度、拒答准确性、权限拦截率、延迟与成本。线上低评分、人工改写和无结果查询应定期回流, 但进入基准集前需人工确认。

质量检查文档有明确所有者与有效期; 答案可追溯到具体版本和章节; 检索权限与源系统一致; 每次索引、模型或策略变更都经过同一组基准测试。