Appearance
第 9 章 RAG 评测体系与错误归因
先给结论:RAG 一旦进入真实系统,就不能只问“答案看起来对不对”,而必须进一步问:证据有没有找回来、答案有没有忠于证据、评测样本是否代表真实问题,以及错误到底卡在链路的哪一层。
很多团队在做 RAG 时,最容易忽略的一件事是:
- 系统能跑,不等于系统可评
如果没有一套分层评测和错误归因视角,你很容易遇到这些问题:
- 回答不稳,但不知道是检索问题还是生成问题
- 总分看起来还行,但某类关键问题持续失败
- 每次调优都做了很多动作,但不知道哪一步真正有效
- 离线评测不错,线上用户却不断遇到新问题
所以这一章要解决的,不只是“怎样打分”,而是:
- 怎样建立一套真正能支持诊断和调优的评测框架
本章最值得先建立的判断
- RAG 评测不能只看最终答案,要分层看检索、生成和端到端表现
- 检索评测回答的是“证据有没有回来”,生成评测回答的是“证据有没有被忠实使用”
- 评测集本身也是系统的一部分,样本设计不对,后面的分数就会失真
- 错误分型和归因不是收尾动作,而是调优的前提条件
建议阅读顺序
主题模块
这一章读完后,你应该获得什么
读完这一章后,你最好能更稳地判断:
- 一个失败回答应该先查检索层,还是先查生成层
Recall@K、MRR、NDCG这类指标能说明什么,不能说明什么- 什么叫 groundedness / faithfulness,为什么它们对 RAG 很关键
- 为什么一套没有任务分层和线上回流的评测集很快会失真
- 为什么没有错误分桶时,RAG 调优很容易沦为随机试参
关联章节
- 这一章是 第 10 章 RAG 调优方法论 的前置基础。
- 线上监控、回归报警和生产故障定位问题,也会在 第 11 章 生产级 RAG 工程实践 继续展开。