Appearance
9.3 生成层与忠实性评测
先给结论:生成层评测关注的,不是“模型说得顺不顺”,而是“模型有没有忠实使用证据、有没有答对当前问题、有没有把材料外推测说成事实”。这一步决定的是检索收益有没有真正兑现成可靠回答。
上一节的检索层评测主要在回答:
- 证据找没找回来
而这一节更关注:
- 证据找回来之后,模型有没有用对
这两件事不能混在一起。因为真实系统里经常会出现一种典型现象:
- 检索层看起来没什么问题
- 但最终回答仍然不稳
这时很多问题就已经不在“找证据”,而在:
- 如何围绕证据生成答案
- 如何判断答案有没有超出证据边界
学这一节时,最值得先建立的判断
- 生成层评测的重点不是语言流畅度,而是证据忠实性和任务完成度
- “有来源”不等于“忠于来源”,“像有依据”也不等于“真的有依据”
- 幻觉不是唯一生成问题,半忠实、半完整、答非所问同样重要
LLM-as-a-Judge很有用,但它是评测工具,不是绝对真理
这一节会回答什么问题
读完这一节后,你最好能更稳地判断:
- 当前回答的问题更像“没证据”,还是“有证据但没忠实使用”
- 忠实性、groundedness、幻觉判断之间到底是什么关系
- 什么时候可以用模型来评模型,什么时候必须回到人工抽检和错误样本