Skip to content

2.2 数据源类型与接入方式 ​

RAG 的知识来源远不只是 PDF 文档。

在真实业务里,知识可能来自帮助中心、企业 Wiki、数据库、代码仓库、工单系统、CRM、报表平台,甚至来自图片、表格和扫描件。

不同数据源接入进来之后,并不会自动变成同一种知识。它们在结构、更新方式、权限模型和解析难度上差别很大。

这一节最重要的目标,不是让你记住“有哪些数据源”,而是让你建立一个更实用的判断:

不同数据源,不应该默认走同一条 RAG 处理链路。

有些数据适合走文档检索,有些更适合走字段查询和工具调用;有些可以直接切块进索引,有些必须先做 OCR、版面分析和结构恢复。

学这一节时,最值得先想清楚的事 ​

在真正接数据之前,最好先问自己:

  • 这类数据的核心价值到底是“解释说明”,还是“实时查询”
  • 它的语义主要藏在段落里,还是藏在字段、表格、关系和版面里
  • 它更像知识文档,还是更像事实系统
  • 它适不适合直接进入主知识库,还是应该先经过结构化处理

如果这些问题还没想清楚,就很容易把所有数据都压扁成“普通文本”,然后在后面为不稳定的召回和回答买单。

这一节会回答什么问题 ​

这一节真正想帮你建立的判断 ​

读完这一节后,你至少应该更稳地判断:

  • 什么数据适合主打检索增强问答
  • 什么数据更适合查询、过滤和工具调用
  • 什么复杂格式如果解析质量不过关,就不该急着入库