Skip to content

9.3.1 怎么评估回答是否忠于检索内容? ​

先给结论:评估回答是否忠于检索内容,核心不是看它“像不像相关答案”,而是看答案里的关键结论,是否都能被当前提供的材料直接支持。换句话说,忠实性评测真正要检查的是“结论和证据之间的支撑关系”。

很多系统最容易犯的错,不是完全没证据,而是:

  • 证据在
  • 回答也看起来相关
  • 但关键结论已经悄悄超出了证据边界

所以“忠于检索内容”不是一个感觉判断,而应该拆开看。

一、先看答案里的关键结论是什么 ​

不要直接拿整段回答做模糊判断。

更稳的做法通常是先问:

  • 这段回答真正表达了哪些关键结论

例如一段回答里可能同时包含:

  • 一个主结论
  • 一个适用范围
  • 一个限制条件
  • 一个补充说明

忠实性检查不能只看主结论对不对,还要看:

  • 这些附带判断是不是也被材料支持

因为很多错误就藏在这些附带部分。

二、再看这些结论能不能被材料直接支持 ​

这里最关键的问题不是:

  • 材料是不是大体相关

而是:

  • 材料能不能直接支持这个具体结论

常见的非忠实情况包括:

  • 材料只支持“部分”,回答说成了“全部”
  • 材料只支持“可以”,回答说成了“必须”
  • 材料只支持背景解释,回答把它当成了明确规则
  • 材料根本没提,回答却补出了一段细节

所以真正要审的,不是“相关性”,而是“支撑力度”。

三、要特别注意边界信息 ​

很多不忠实回答,不是主体错,而是边界错。

特别容易出问题的地方包括:

  • 适用范围
  • 生效时间
  • 例外条件
  • 版本限定
  • 用户类型限定

模型非常容易:

  • 抓住主规则
  • 漏掉限制条件

这时回答会显得“差不多对”,但实际上并不忠实。

四、一个更实际的检查框架 ​

判断回答是否忠于检索内容时,可以先用这三步:

  1. 划出答案里的关键结论
  2. 在上下文里找每个结论的证据支撑
  3. 检查是否存在超范围推断或遗漏边界

如果某个结论:

  • 找不到明确支撑 或
  • 只能靠模糊联想成立

那它就不该被当成忠实回答。

一个最小示意 ​

python
answer = "所有企业用户都可以申请该权限。"
context = "在部分企业客户场景下,可申请此权限。"

这类回答的问题不在于完全离题,而在于:

  • 它把“部分”扩大成了“所有”

这就是典型的不忠实。

五、为什么只看“有没有引用”不够 ​

很多系统会要求来源引用,这当然有帮助。但仅仅“带了引用”还不够,因为:

  • 引用相关来源 不等于
  • 回答被来源准确支持

所以忠实性评测不能只停留在:

  • 有没有来源编号

而要继续看:

  • 答案和来源之间的语义支撑关系是否成立

一个常见误区 ​

很多人会把“忠于检索内容”理解成:

  • 模型只能逐句复述材料

这也不准确。忠实并不等于机械复述。模型当然可以:

  • 归纳
  • 重写
  • 压缩表达

但前提是:

  • 这些归纳和重写不能超出证据支持范围

一句话总结 ​

评估回答是否忠于检索内容,关键不是看答案像不像相关结果,而是看答案中的每个关键结论是否都能被当前材料支持,尤其要检查它有没有扩大原文含义、忽略边界条件,或混入材料外推测。