答案摘要:企业知识库 RAG 回答不准时,先检查正确资料是否存在且可见,再依次定位文档解析、切片、检索召回、重排、提示词生成和权限过滤。聚匠科技通常为每个问题保留检索片段、引用、模型与知识版本,用固定评测集判断错误发生在哪一层,不把所有问题都归因于大模型。
先把“回答不准”分成四种错误
第一种是知识缺失:资料库里没有有效答案,模型只能拒答或使用通用知识。第二种是检索失败:正确资料存在,但切片、关键词、向量或权限导致没有召回。第三种是生成偏差:片段已经正确返回,模型却忽略证据、混合多个版本或输出了超出资料的结论。第四种是业务口径错误:资料本身过期、互相冲突或未经审核。
这四种错误的修复方法不同。缺资料要补内容,检索失败要调整解析与召回,生成偏差要优化证据约束和拒答,业务口径错误则必须由资料负责人确认。直接更换更大的模型,可能让表达更流畅,却不会自动修复错误制度或越权检索。
用一条问题追踪完整 RAG 链路
| 环节 | 需要保留的证据 | 常见异常 |
|---|---|---|
| 问题处理 | 原问题、改写问题、意图与关键词 | 问题被错误改写或丢失限定条件 |
| 权限过滤 | 用户、部门、知识范围和过滤条件 | 正确文档被过滤或敏感文档越权命中 |
| 检索召回 | 候选片段、分数、文档与版本 | 召回无关内容或漏掉正确片段 |
| 重排选择 | 重排前后顺序与最终上下文 | 正确片段被挤出上下文 |
| 答案生成 | 提示词、模型、引用和最终回答 | 忽略证据、混用版本或没有拒答 |
排查时选择一个已经知道标准答案的问题,查看每一层输入和输出。如果正确片段从未进入候选集,重点检查解析、切片和召回;如果候选集有正确内容但重排后消失,检查重排模型与排序规则;如果上下文正确但答案错误,再看提示词、模型和输出约束。
资料、切片与版本检查清单
- 标准答案是否存在于当前生效资料,而不是聊天记录或员工记忆里。
- PDF、表格、扫描件和附件是否解析完整,标题与表头有没有丢失。
- 切片是否保留章节、产品、地区、时间和适用对象等上下文。
- 旧制度、草稿和重复文件是否被停用,正式版本是否有生效时间。
- 用户角色能否读取正确资料,权限变更是否同步到索引。
- 答案是否展示来源、版本和引用片段,便于人工复核。
知识库更新不能只覆盖原文件。解析结果、向量索引、检索缓存和应用缓存都要关联版本,发布失败时能够回滚。涉及多个部门时,应给资料设置责任人和复核周期,避免技术团队独自判断业务制度是否有效。
建立固定问题集而不是凭感觉调参数
评测集至少包含可直接回答、需要组合多段资料、无答案应拒答、旧版本冲突、无权限资料、长表格和口语化提问。每条问题记录标准要点、允许引用的资料、禁止出现的信息和是否需要转人工。模型、切片、嵌入、重排或提示词变更后复跑同一批样本,才能判断改善与退化。
线上 Badcase 也要按原因归类,而不是只保存用户差评。可以在 企业知识库 RAG 建立资料与评测流程,在 AI 客服系统 配置拒答和转人工;敏感资料可通过 私有化部署 保留原文、索引和日志。
哪些做法先不要直接上线
没有标准问题集就反复调 TopK、相似度阈值或提示词,很难判断参数是否对所有问题有效;没有引用和版本号就让模型直接回答,也无法追踪错误来源。资料尚未审核、权限模型未完成、扫描件解析质量不稳定时,应先限制用户范围或转人工。
RAG 的目标不是让所有问题都得到答案,而是让有依据的问题可引用、无依据的问题能拒答、无权限的问题不泄露。上线前至少验证一个正常问答和一个无答案或越权场景,并保留检索证据和最终结果。