多模态 RAG:图文绑定与溯源核查
从有道云笔记的多模态 RAG 问题中提炼的设计检查项。原文是面试学习材料,其中的项目叙述和效果数字不能视作真实案例;以下也不是已验证的实现方案。
适用范围
面向同时包含正文、图片、表格或流程图的文档检索。具体解析器、嵌入模型、索引与页面格式未限定版本;更换任何一项后,都要重新验证定位、召回和引用是否仍正确。
设计时要回答
- 图片属于哪里? 解析时能否保留文档 ID、版本、页码或位置、标题层级、图片 ID,以及与正文的关联依据?扫描件、浮动图片和跨页图表能否识别为不确定绑定,而非强行挂到最近段落?
- 图中的信息怎样进入索引? 文字截图可先试 OCR;图表与流程图还需检查结构、方向或数值是否被正确表达。图片描述应带上原图定位,且与人工可见内容核对,不能把模型生成的描述当作原文事实。
- 是否需要两路召回? 文本描述索引与视觉向量索引是可比较的候选方案。应在同一组图文问题上比较文本基线、视觉检索及融合方案的命中、延迟和成本,再决定是否增加视觉索引;查询编码方式也要与各索引兼容。
- 答案能回到证据吗? 返回的文字片段、图片预览和页码应指向同一版本的源文档。文档更新或重建索引后,旧引用是否失效、重定向或标记过期,需要事先定义。
评测切面
- 分开抽取纯文本问题、图内文字问题、图形关系问题及图文联合问题;记录证据定位是否正确,而非只看答案措辞。
- 人工检查一批图片与段落的绑定错误、解析遗漏和无依据的图像描述,再按文档类型统计,决定复核队列的优先级。
- 对无法确认来源的答案,检查系统是否指出证据不足,而不是展示一个看似精确但定位错误的引用。
未验证与待核查
这些是待实测的问题,不保证双路召回优于文本基线,也没有可通用的绑定置信度阈值。需选定实际文档格式、解析器和模型版本,建立带源位置的标注集,记录定位正确率、召回、延迟与成本;涉及权限的文档还需验证引用和预览是否继承访问控制。
来源
有道导出中的一份学习路线笔记第二模块 Q2–Q3。仅提取图文处理与核查思路,未采纳文中的模拟企业项目、人数或效果数字。
关联:RAG 与向量数据库、RAG 生产链路资料。