Appearance
2.2 数据源类型与接入方式
RAG 的知识来源远不只是 PDF 文档。
在真实业务里,知识可能来自帮助中心、企业 Wiki、数据库、代码仓库、工单系统、CRM、报表平台,甚至来自图片、表格和扫描件。
不同数据源接入进来之后,并不会自动变成同一种知识。它们在结构、更新方式、权限模型和解析难度上差别很大。
这一节最重要的目标,不是让你记住“有哪些数据源”,而是让你建立一个更实用的判断:
不同数据源,不应该默认走同一条 RAG 处理链路。
有些数据适合走文档检索,有些更适合走字段查询和工具调用;有些可以直接切块进索引,有些必须先做 OCR、版面分析和结构恢复。
学这一节时,最值得先想清楚的事
在真正接数据之前,最好先问自己:
- 这类数据的核心价值到底是“解释说明”,还是“实时查询”
- 它的语义主要藏在段落里,还是藏在字段、表格、关系和版面里
- 它更像知识文档,还是更像事实系统
- 它适不适合直接进入主知识库,还是应该先经过结构化处理
如果这些问题还没想清楚,就很容易把所有数据都压扁成“普通文本”,然后在后面为不稳定的召回和回答买单。
这一节会回答什么问题
这一节真正想帮你建立的判断
读完这一节后,你至少应该更稳地判断:
- 什么数据适合主打检索增强问答
- 什么数据更适合查询、过滤和工具调用
- 什么复杂格式如果解析质量不过关,就不该急着入库