RAG 评测与拒答:证据问题
将有道云笔记中的面试提纲改写为评测设计问题,尚未在真实知识库上验证。数值门槛、样本配比和框架能力均不能直接照搬。
适用范围
用于有检索证据、需区分可回答与不可回答的知识问答。指标定义依赖实际标注粒度(文档、片段或事实)、检索前 k 条、语料版本和访问权限;模型、嵌入、重排器或索引变化后,应重跑基线。
先把样本与证据定清楚
- 为每个问题标注可接受答案、支持它的原文位置、知识库版本和判定理由;同时保留无答案、证据不足、问题含糊及文档互相冲突的样本。
- 真实问题可从经脱敏的使用记录抽样,但先审查权限与代表性;模型合成的问题要人工核验,避免把生成的错误前提带入标准答案。
- 对图片、表格和多段推理问题单独分层,防止总体得分掩盖某一类证据缺失。
分层归因,而非只给总分
| 层次 | 要核查的问题 |
|---|---|
| 解析与索引 | 源证据是否存在、可被解析,且进入了当前版本索引? |
| 检索与排序 | 相关证据是否进入前 k 条,还是被无关片段挤出?相关集合若标注不全,召回率只能作为样本估计。 |
| 生成与引用 | 答案中的每个可核查断言能否指回证据?引用是否支持该断言、是否与证据相矛盾? |
| 拒答与路由 | 无证据时是否拒答;证据仅覆盖一部分时是否说明缺口;问题含糊时是否先澄清?同时记录错误拒答。 |
检索召回率的分母是该问题的已标注相关项,不是全库文档数;若相关项集合不完整,不能把离线分数当作全库真实召回率。答案的证据支持度也不能只靠关键词重合判断。
自动评审要校准
评审模型可辅助分批检查,但应与人工判例对照。对比两个系统时隐藏系统身份、交换展示顺序,并检查长答案偏好;对有争议和高风险的样本保留人工复核。检索分数或模型自报置信度只能作为待校准信号,不能直接用原文示例阈值决定拒答。
未验证与待核查
尚无固定的评测集、人工一致性数据或拒答成本模型。下一步需要确定标注单元、样本分层、误答与误拒的代价、实际版本,以及人工评审的复核规则,再在当前系统上比较检索、生成与拒答各层表现。原笔记提及的特定样本量和比例没有适用性证据。
来源
主要来自有道导出中的一份学习路线笔记的第三至第四模块 Q4–Q7;另一份目录型笔记只提供质量、噪声鲁棒性和负面拒识等主题,没有独立实验结果。未采用原文中的模拟项目效果或固定阈值。
关联:RAG 与向量数据库、RAG 生产链路资料。