Appearance
2.3 知识库数据清洗与标准化
把数据接进来,只完成了第一步。接下来真正决定知识库质量的,是清洗与标准化。
这一层做得好,后面检索更容易准,生成更容易稳;这一层做得差,系统就会长期在噪声、重复和版本混乱里挣扎。
这一节的重点,不只是告诉你“要清洗”,而是让你建立一个更具体的认识:
- 到底什么算噪声
- 什么内容应该保留,什么内容应该删掉
- 为什么同样是“资料”,有些进入知识库会帮忙,有些只会添乱
- 为什么字段标准化会直接影响权限、更新和治理
也就是说,这一节不是在讲简单的数据预处理,而是在讲:怎样把原始资料真正变成“适合进入 RAG 的知识形态”。
这一节真正想帮你建立的,是一个很实用的认识:
清洗和标准化不是“导入前顺手做一下”,而是决定知识库信噪比和治理基础的关键环节。
很多系统后面效果不稳,不是因为模型太弱,而是因为前面的原始资料从来没有被真正整理成“适合检索、适合过滤、适合更新”的形态。
这一节会回答什么问题
学这一节时最值得带着的问题
- 如果一批资料只能“人能看懂”,但“系统用不好”,问题通常出在哪?
- 我现在的知识库里,哪些内容其实不应该和正文一起进入索引?
- 如果后面要做权限、时效和多租户治理,现在的数据字段准备够不够?
带着这些问题往下看,你会更容易把“清洗”理解成 RAG 基础能力,而不是导入前的小修小补。
读完这一节后,你最好还能更稳地判断:
- 当前问题更像噪声清理问题,还是字段治理问题
- 某批数据是该直接入主知识库,还是先进待处理区
- 某个清洗动作到底是在提升系统信噪比,还是只是在表面上“删了很多东西”