Appearance
3.3 Metadata 设计
前两节主要讨论的是 chunk 本身。这一节要继续往前走一步:当 chunk 被切出来以后,系统到底还需要知道关于这个 chunk 的哪些信息?
答案就是 metadata。
很多人第一次做 RAG,会把 metadata 理解成“顺手带几个字段”。但真正做到检索、过滤、权限、更新和治理时,很快就会发现:metadata 不是附属信息,而是让 chunk 真正变成“可检索、可过滤、可追溯知识对象”的关键一层。
这一节真正想帮你建立的,是一个非常重要的认识:
很多看起来像检索不准、过滤不稳、引用不清的问题,本质上经常不是模型问题,而是 metadata 设计没有做完整。
学这一节时,最值得先建立的判断
- metadata 不是“额外说明”,而是系统理解 chunk 边界、来源和治理条件的基础
- 文本负责表达“说了什么”,metadata 负责表达“它是谁、从哪来、什么时候有效、谁能用”
- 没有 metadata,很多过滤、排序、聚合、引用和治理能力都很难稳定做出来
- metadata 设计不是字段越多越好,而是要和检索、过滤、更新、权限这些真实需求对应起来
这一节会回答什么问题
- 什么是元数据(Metadata)?
- 为什么 Metadata 对 RAG 很重要?
- 常见的 Metadata 有哪些?
- Metadata Filter 在检索阶段怎么用?
- 为什么很多企业 RAG 效果差,本质上是 Metadata 设计不完整?
读完这一节后,你最好能更稳地判断:
- 一个 chunk 除了文本本身,还应该带哪些关键信息
- 当前系统的问题更像是文本问题,还是 metadata 问题
- metadata 应该在哪些阶段真正进入检索和回答链路