Appearance
9.2 检索层评测
先给结论:检索层评测的核心,不是为了把指标背下来,而是为了判断“关键证据有没有被找回来、排在什么位置、是否被噪声挤掉”。不同指标关注的是同一问题的不同侧面,所以不能只盯一个分数。
很多人第一次做检索评测时,会很自然地问:
- 到底该看哪个指标
更稳的理解通常是:
- 不同指标不是在重复说同一件事,而是在回答不同问题
例如:
Recall@K更关心有没有把正确证据带进候选池Precision@K更关心前 K 条里有多少是真的有用MRR更关心第一条正确结果出现得够不够靠前nDCG更关心整体排序质量和高相关结果的前置程度
所以这一节最重要的,不是死记定义,而是学会:
- 当系统出现某种检索问题时,应该先看哪类指标
学这一节时,最值得先建立的判断
- 检索评测不是“哪个指标最权威”,而是“哪个指标最适合当前问题”
- 召回、准确、排序位置,本来就是三类不同问题
- 单个指标升高,不代表整体检索体验一定变好
- 线上系统真正关心的不是漂亮分数,而是证据能否稳定进入后续链路
这一节会回答什么问题
读完这一节后,你最好能更稳地判断:
- 当前检索系统的问题更像“没找到”,还是“找到了但排得不行”
- 该优先补覆盖,还是优先补前排质量
- 为什么很多检索调优失败,不是因为没指标,而是因为指标和问题没对齐