Skip to content

第 9 章 RAG 评测体系与错误归因 ​

先给结论:RAG 一旦进入真实系统,就不能只问“答案看起来对不对”,而必须进一步问:证据有没有找回来、答案有没有忠于证据、评测样本是否代表真实问题,以及错误到底卡在链路的哪一层。

很多团队在做 RAG 时,最容易忽略的一件事是:

  • 系统能跑,不等于系统可评

如果没有一套分层评测和错误归因视角,你很容易遇到这些问题:

  • 回答不稳,但不知道是检索问题还是生成问题
  • 总分看起来还行,但某类关键问题持续失败
  • 每次调优都做了很多动作,但不知道哪一步真正有效
  • 离线评测不错,线上用户却不断遇到新问题

所以这一章要解决的,不只是“怎样打分”,而是:

  • 怎样建立一套真正能支持诊断和调优的评测框架

本章最值得先建立的判断 ​

  • RAG 评测不能只看最终答案,要分层看检索、生成和端到端表现
  • 检索评测回答的是“证据有没有回来”,生成评测回答的是“证据有没有被忠实使用”
  • 评测集本身也是系统的一部分,样本设计不对,后面的分数就会失真
  • 错误分型和归因不是收尾动作,而是调优的前提条件

建议阅读顺序 ​

  1. 9.1 为什么不能只看最终回答
  2. 9.2 检索层评测
  3. 9.3 生成层与忠实性评测
  4. 9.4 评测集构建
  5. 9.5 错误分型与归因

主题模块 ​

这一章读完后,你应该获得什么 ​

读完这一章后,你最好能更稳地判断:

  • 一个失败回答应该先查检索层,还是先查生成层
  • Recall@K、MRR、NDCG 这类指标能说明什么,不能说明什么
  • 什么叫 groundedness / faithfulness,为什么它们对 RAG 很关键
  • 为什么一套没有任务分层和线上回流的评测集很快会失真
  • 为什么没有错误分桶时,RAG 调优很容易沦为随机试参

关联章节 ​