Appearance
9.3.1 怎么评估回答是否忠于检索内容?
先给结论:评估回答是否忠于检索内容,核心不是看它“像不像相关答案”,而是看答案里的关键结论,是否都能被当前提供的材料直接支持。换句话说,忠实性评测真正要检查的是“结论和证据之间的支撑关系”。
很多系统最容易犯的错,不是完全没证据,而是:
- 证据在
- 回答也看起来相关
- 但关键结论已经悄悄超出了证据边界
所以“忠于检索内容”不是一个感觉判断,而应该拆开看。
一、先看答案里的关键结论是什么
不要直接拿整段回答做模糊判断。
更稳的做法通常是先问:
- 这段回答真正表达了哪些关键结论
例如一段回答里可能同时包含:
- 一个主结论
- 一个适用范围
- 一个限制条件
- 一个补充说明
忠实性检查不能只看主结论对不对,还要看:
- 这些附带判断是不是也被材料支持
因为很多错误就藏在这些附带部分。
二、再看这些结论能不能被材料直接支持
这里最关键的问题不是:
- 材料是不是大体相关
而是:
- 材料能不能直接支持这个具体结论
常见的非忠实情况包括:
- 材料只支持“部分”,回答说成了“全部”
- 材料只支持“可以”,回答说成了“必须”
- 材料只支持背景解释,回答把它当成了明确规则
- 材料根本没提,回答却补出了一段细节
所以真正要审的,不是“相关性”,而是“支撑力度”。
三、要特别注意边界信息
很多不忠实回答,不是主体错,而是边界错。
特别容易出问题的地方包括:
- 适用范围
- 生效时间
- 例外条件
- 版本限定
- 用户类型限定
模型非常容易:
- 抓住主规则
- 漏掉限制条件
这时回答会显得“差不多对”,但实际上并不忠实。
四、一个更实际的检查框架
判断回答是否忠于检索内容时,可以先用这三步:
- 划出答案里的关键结论
- 在上下文里找每个结论的证据支撑
- 检查是否存在超范围推断或遗漏边界
如果某个结论:
- 找不到明确支撑 或
- 只能靠模糊联想成立
那它就不该被当成忠实回答。
一个最小示意
python
answer = "所有企业用户都可以申请该权限。"
context = "在部分企业客户场景下,可申请此权限。"这类回答的问题不在于完全离题,而在于:
- 它把“部分”扩大成了“所有”
这就是典型的不忠实。
五、为什么只看“有没有引用”不够
很多系统会要求来源引用,这当然有帮助。但仅仅“带了引用”还不够,因为:
- 引用相关来源 不等于
- 回答被来源准确支持
所以忠实性评测不能只停留在:
- 有没有来源编号
而要继续看:
- 答案和来源之间的语义支撑关系是否成立
一个常见误区
很多人会把“忠于检索内容”理解成:
- 模型只能逐句复述材料
这也不准确。忠实并不等于机械复述。模型当然可以:
- 归纳
- 重写
- 压缩表达
但前提是:
- 这些归纳和重写不能超出证据支持范围
一句话总结
评估回答是否忠于检索内容,关键不是看答案像不像相关结果,而是看答案中的每个关键结论是否都能被当前材料支持,尤其要检查它有没有扩大原文含义、忽略边界条件,或混入材料外推测。