Skip to content

9.2 检索层评测 ​

先给结论:检索层评测的核心,不是为了把指标背下来,而是为了判断“关键证据有没有被找回来、排在什么位置、是否被噪声挤掉”。不同指标关注的是同一问题的不同侧面,所以不能只盯一个分数。

很多人第一次做检索评测时,会很自然地问:

  • 到底该看哪个指标

更稳的理解通常是:

  • 不同指标不是在重复说同一件事,而是在回答不同问题

例如:

  • Recall@K 更关心有没有把正确证据带进候选池
  • Precision@K 更关心前 K 条里有多少是真的有用
  • MRR 更关心第一条正确结果出现得够不够靠前
  • nDCG 更关心整体排序质量和高相关结果的前置程度

所以这一节最重要的,不是死记定义,而是学会:

  • 当系统出现某种检索问题时,应该先看哪类指标

学这一节时,最值得先建立的判断 ​

  • 检索评测不是“哪个指标最权威”,而是“哪个指标最适合当前问题”
  • 召回、准确、排序位置,本来就是三类不同问题
  • 单个指标升高,不代表整体检索体验一定变好
  • 线上系统真正关心的不是漂亮分数,而是证据能否稳定进入后续链路

这一节会回答什么问题 ​

读完这一节后,你最好能更稳地判断:

  • 当前检索系统的问题更像“没找到”,还是“找到了但排得不行”
  • 该优先补覆盖,还是优先补前排质量
  • 为什么很多检索调优失败,不是因为没指标,而是因为指标和问题没对齐