Appearance
2.1 为什么 RAG 首先是数据问题
很多人第一次做 RAG,最容易先把注意力放在模型上:
- 用哪个大模型
- Prompt 怎么写
- 要不要上更贵的模型
但真正做一段时间后你会发现,RAG 的第一性问题往往不是“模型够不够强”,而是“系统到底拿到了什么知识,以及这些知识能不能被正确找到和使用”。
RAG 不是把一堆材料塞给模型就结束了。它的前提是:这批材料本身要尽量干净、结构清楚、边界明确、可被切分、可被过滤、可被更新。
这一节真正想帮你建立的,是一个和很多初学者直觉相反的认识:
RAG 的上限,往往不是先被模型卡住,而是先被知识准备质量卡住。
如果知识本身有问题,后面无论是 Prompt、重排还是换更强模型,收益都会很快碰到天花板。
这一节最值得先建立的判断
在继续往后学之前,你最好先把这几个判断立住:
- “有资料”不等于“有可用知识”
- “资料最新”不等于“系统一定会优先用最新版本”
- “模型很强”不等于“系统会自动避开错误、过期或无权限的资料”
- “Demo 能回答”不等于“线上真实数据下也能稳定回答”
只有先接受这几个事实,后面你才不会一遇到效果问题就本能地先怀疑模型。
学这一节时,可以一直带着两个问题看
- 如果系统答错了,问题更可能先出在知识本身,还是出在模型表达?
- 如果想让系统稳定回答,应该先补模型能力,还是先补知识准备和检索基础?
这一节的几篇文章,基本都是围绕这两个问题展开的。