Skip to content

第 2 章 数据接入与知识库准备 ​

本章目标:理解为什么 RAG 的起点不是“先选一个模型”,而是“先把知识准备成可被正确检索、正确过滤、正确使用的形态”。

如果把 RAG 看成一条链路,这一章讨论的是链路最靠前、但也最容易被低估的部分:

  • 数据从哪里来
  • 数据适不适合进知识库
  • 数据进入前要怎么清洗和标准化
  • 数据进入后怎么处理权限、更新和失效

很多 RAG 系统后面效果不稳,问题并不在生成模型,而在更前面的知识准备阶段就已经埋下了。

建议阅读顺序 ​

  1. 2.1 为什么 RAG 首先是数据问题
  2. 2.2 数据源类型与接入方式
  3. 2.3 知识库数据清洗与标准化
  4. 2.4 权限、时效性与知识治理

主题模块 ​

学完这一章后,你应该建立的判断 ​

  • 资料多,不等于知识库好
  • 能上传,不等于能检索
  • 能检索,不等于能稳定回答
  • 能回答,不等于能上线

进一步说,这一章真正想帮你建立的,不只是“知识库要认真做”这种泛泛认识,而是更具体的判断力:

  • 什么数据值得进主知识库,什么数据应该先进待处理区
  • 什么问题更像文档问答,什么问题更像查询、过滤或工具调用
  • 什么噪声会系统性污染检索结果,什么短文本虽然短但其实不能删
  • 为什么权限、版本、时效、多租户这些边界必须提前进入数据和检索链路

如果这些判断还没有建立,后面即使开始做切块、向量化、重排和生成,也很容易在前面的数据问题上反复返工。

阅读这一章时,建议一直带着 4 个问题 ​

  1. 这批数据到底是不是“适合当前 RAG 链路”的数据? 很多系统的问题不是模型不行,而是把不该直接入库的数据也一并塞进来了。

  2. 这些数据是否已经被整理成可检索、可过滤、可更新的形态? 如果还没有,那后面的索引和召回通常不会稳。

  3. 这批数据的边界清不清楚? 这里的边界包括来源、版本、权限、时效、租户,而不只是正文文本。

  4. 如果系统答错,我能不能快速判断问题出在数据、检索还是模型? 这是把 RAG 从“能跑 Demo”推到“能稳定排障”的关键一步。

只有把数据质量、结构质量、权限约束和时效管理都处理好,后面的 Chunk、索引、检索、重排和生成才有稳定发挥的基础。

关联章节 ​