Appearance
12.5.2 多模态 RAG 和文本 RAG 的核心差别是什么?
先给结论:多模态 RAG 的核心难点不是“能看见图片”,而是“能把图片和文本对齐,并检索到正确的证据”。
文本 RAG 的对象是“可直接编码为文本的语义”,而多模态 RAG 需要处理“视觉语义 + 文本语义”的对齐问题。
核心差别
- 编码方式不同:文本直接编码,图像需要视觉编码器
- 对齐要求更高:图片与文本必须在同一语义空间对齐
- 检索粒度更难:图像检索单位可能是“整图”或“局部区域”
- 解释成本更高:需要把视觉证据转为可解释文本
多模态 RAG 的最小落地流程
可以按下面步骤构建:
- 图片/文本分别编码
- 建立共享向量空间或跨模态索引
- 检索得到图像或图像片段
- 视觉证据转文本(caption/摘要)
- 用文本证据生成答案
最小示意(伪代码):
python
def multimodal_rag(query):
image_hits = image_retriever(query)
captions = caption(image_hits)
return generate(query, captions)重点不是“图片怎么编码”,而是“图片证据必须可解释,否则无法支撑答案”。
什么时候值得用多模态 RAG
只要用户问题依赖视觉证据,就应考虑多模态:
- “这个图里的趋势是什么?”
- “图片中的设备型号是什么?”
- “表格截图里某列的数值是多少?”
常见误区
误区一:多模态只需要更强模型
没有检索与对齐,多模态模型也会“看得见但找不到”。流程和索引才是关键。
误区二:图像检索等于图像理解
检索解决“找证据”,理解解决“解释证据”。你需要两个步骤,而不是一个模型。
误区三:把图片 OCR 成文本就够了
OCR 只能处理文字,不能处理图像结构与视觉语义。它是补充,不是替代。
自检清单
- 是否有清晰的跨模态对齐方式?
- 视觉证据是否被转为可解释文本?
- 检索粒度是否适合问题(整图 vs 局部)?
一句话总结
多模态 RAG 的本质是“跨模态对齐 + 可解释证据”。只有能检索到、也能解释的视觉证据,才是真正可用的 RAG。