Skip to content

9.1 为什么不能只看最终回答 ​

先给结论:只看最终回答,最多只能告诉你“系统现在好像行不行”,却很难告诉你“问题到底出在哪一层”。而 RAG 本来就是一条多阶段链路,所以评测也必须拆层看。

很多人第一次做 RAG 评测时,最自然的想法是:

  • 直接看最后回答对不对

这当然不是错,端到端结果一定要看。但如果只停留在这一步,很快就会遇到一个实际问题:

  • 你知道它答错了
  • 但你不知道为什么错

对于一个链路型系统来说,这会直接导致调优失焦。因为同样一个“答案不对”,背后可能对应完全不同的问题:

  • 检索没召回
  • 重排没把关键证据顶上来
  • 上下文组织失败
  • Prompt 约束不清
  • 生成阶段误用了证据

如果这些问题都只用一个“最终对错”来表示,后面的优化基本只能靠猜。

学这一节时,最值得先建立的判断 ​

  • 端到端结果重要,但它只是总体现象,不是完整诊断
  • RAG 评测要服务调优,所以必须能指向具体环节
  • 同样一个最终错误,可能来自完全不同的链路问题
  • 一个系统要想稳定提升,必须建立“端到端 + 分层”结合的评测视角

这一节会回答什么问题 ​

读完这一节后,你最好能更稳地判断:

  • 当前评测体系是在看现象,还是已经能支持定位
  • 一个端到端低分,后面到底该优先查检索、生成还是上下文构造
  • 为什么真正有工程价值的 RAG 评测,不能只停留在“答案像不像对”