Skip to content

2.1 为什么 RAG 首先是数据问题 ​

很多人第一次做 RAG,最容易先把注意力放在模型上:

  • 用哪个大模型
  • Prompt 怎么写
  • 要不要上更贵的模型

但真正做一段时间后你会发现,RAG 的第一性问题往往不是“模型够不够强”,而是“系统到底拿到了什么知识,以及这些知识能不能被正确找到和使用”。

RAG 不是把一堆材料塞给模型就结束了。它的前提是:这批材料本身要尽量干净、结构清楚、边界明确、可被切分、可被过滤、可被更新。

这一节真正想帮你建立的,是一个和很多初学者直觉相反的认识:

RAG 的上限,往往不是先被模型卡住,而是先被知识准备质量卡住。

如果知识本身有问题,后面无论是 Prompt、重排还是换更强模型,收益都会很快碰到天花板。

这一节最值得先建立的判断 ​

在继续往后学之前,你最好先把这几个判断立住:

  • “有资料”不等于“有可用知识”
  • “资料最新”不等于“系统一定会优先用最新版本”
  • “模型很强”不等于“系统会自动避开错误、过期或无权限的资料”
  • “Demo 能回答”不等于“线上真实数据下也能稳定回答”

只有先接受这几个事实,后面你才不会一遇到效果问题就本能地先怀疑模型。

学这一节时,可以一直带着两个问题看 ​

  1. 如果系统答错了,问题更可能先出在知识本身,还是出在模型表达?
  2. 如果想让系统稳定回答,应该先补模型能力,还是先补知识准备和检索基础?

这一节的几篇文章,基本都是围绕这两个问题展开的。

这一节会回答什么问题 ​