Skip to content

2.3 知识库数据清洗与标准化 ​

把数据接进来,只完成了第一步。接下来真正决定知识库质量的,是清洗与标准化。

这一层做得好,后面检索更容易准,生成更容易稳;这一层做得差,系统就会长期在噪声、重复和版本混乱里挣扎。

这一节的重点,不只是告诉你“要清洗”,而是让你建立一个更具体的认识:

  • 到底什么算噪声
  • 什么内容应该保留,什么内容应该删掉
  • 为什么同样是“资料”,有些进入知识库会帮忙,有些只会添乱
  • 为什么字段标准化会直接影响权限、更新和治理

也就是说,这一节不是在讲简单的数据预处理,而是在讲:怎样把原始资料真正变成“适合进入 RAG 的知识形态”。

这一节真正想帮你建立的,是一个很实用的认识:

清洗和标准化不是“导入前顺手做一下”,而是决定知识库信噪比和治理基础的关键环节。

很多系统后面效果不稳,不是因为模型太弱,而是因为前面的原始资料从来没有被真正整理成“适合检索、适合过滤、适合更新”的形态。

这一节会回答什么问题 ​

学这一节时最值得带着的问题 ​

  1. 如果一批资料只能“人能看懂”,但“系统用不好”,问题通常出在哪?
  2. 我现在的知识库里,哪些内容其实不应该和正文一起进入索引?
  3. 如果后面要做权限、时效和多租户治理,现在的数据字段准备够不够?

带着这些问题往下看,你会更容易把“清洗”理解成 RAG 基础能力,而不是导入前的小修小补。

读完这一节后,你最好还能更稳地判断:

  • 当前问题更像噪声清理问题,还是字段治理问题
  • 某批数据是该直接入主知识库,还是先进待处理区
  • 某个清洗动作到底是在提升系统信噪比,还是只是在表面上“删了很多东西”