Skip to content

10.2 召回率、准确率与成本的平衡 ​

先给结论:RAG 调优很少存在“只升不降”的优化。很多时候,召回率、准确率、延迟和成本会一起被同一个参数牵动。真正成熟的优化,不是盲目把某一个指标拉到最高,而是知道哪种取舍更符合当前系统目标。

这是 RAG 调优里最现实的一层难点。因为一旦系统开始进入真实使用场景,你几乎一定会遇到这样的冲突:

  • 想多召回一些,结果噪声也变多了
  • 想提高准确率,结果召回面变窄了
  • 想让答案更稳,结果上下文更长、延迟更高
  • 想把效果拉满,结果成本迅速上升

所以这一节真正要解决的不是“怎么把所有指标都拉高”,而是:

  • 当指标之间发生拉扯时,应该怎样做判断

学这一节时,最值得先建立的判断 ​

  • 单独优化某一个指标,往往会对别的指标带来副作用
  • 召回率高不等于最终效果一定更好,噪声过多时反而可能伤害准确率
  • TopK、Rerank、上下文长度这几个旋钮,本质上是在一起工作的
  • 效果、延迟和成本的平衡,不是纯技术问题,也和系统目标、流量规模、用户容忍度有关

这一节会回答什么问题 ​

读完这一节后,你最好能更稳地判断:

  • 为什么一些“看起来能提高召回”的动作,最后反而让回答更差
  • TopK、Rerank 和上下文长度到底应该一起看,而不是单独调
  • 不同阶段的系统,为什么不应该用同一套成本和延迟目标