Appearance
9.1 为什么不能只看最终回答
先给结论:只看最终回答,最多只能告诉你“系统现在好像行不行”,却很难告诉你“问题到底出在哪一层”。而 RAG 本来就是一条多阶段链路,所以评测也必须拆层看。
很多人第一次做 RAG 评测时,最自然的想法是:
- 直接看最后回答对不对
这当然不是错,端到端结果一定要看。但如果只停留在这一步,很快就会遇到一个实际问题:
- 你知道它答错了
- 但你不知道为什么错
对于一个链路型系统来说,这会直接导致调优失焦。因为同样一个“答案不对”,背后可能对应完全不同的问题:
- 检索没召回
- 重排没把关键证据顶上来
- 上下文组织失败
- Prompt 约束不清
- 生成阶段误用了证据
如果这些问题都只用一个“最终对错”来表示,后面的优化基本只能靠猜。
学这一节时,最值得先建立的判断
- 端到端结果重要,但它只是总体现象,不是完整诊断
- RAG 评测要服务调优,所以必须能指向具体环节
- 同样一个最终错误,可能来自完全不同的链路问题
- 一个系统要想稳定提升,必须建立“端到端 + 分层”结合的评测视角
这一节会回答什么问题
读完这一节后,你最好能更稳地判断:
- 当前评测体系是在看现象,还是已经能支持定位
- 一个端到端低分,后面到底该优先查检索、生成还是上下文构造
- 为什么真正有工程价值的 RAG 评测,不能只停留在“答案像不像对”