Appearance
10.2 召回率、准确率与成本的平衡
先给结论:RAG 调优很少存在“只升不降”的优化。很多时候,召回率、准确率、延迟和成本会一起被同一个参数牵动。真正成熟的优化,不是盲目把某一个指标拉到最高,而是知道哪种取舍更符合当前系统目标。
这是 RAG 调优里最现实的一层难点。因为一旦系统开始进入真实使用场景,你几乎一定会遇到这样的冲突:
- 想多召回一些,结果噪声也变多了
- 想提高准确率,结果召回面变窄了
- 想让答案更稳,结果上下文更长、延迟更高
- 想把效果拉满,结果成本迅速上升
所以这一节真正要解决的不是“怎么把所有指标都拉高”,而是:
- 当指标之间发生拉扯时,应该怎样做判断
学这一节时,最值得先建立的判断
- 单独优化某一个指标,往往会对别的指标带来副作用
- 召回率高不等于最终效果一定更好,噪声过多时反而可能伤害准确率
TopK、Rerank、上下文长度这几个旋钮,本质上是在一起工作的- 效果、延迟和成本的平衡,不是纯技术问题,也和系统目标、流量规模、用户容忍度有关
这一节会回答什么问题
读完这一节后,你最好能更稳地判断:
- 为什么一些“看起来能提高召回”的动作,最后反而让回答更差
TopK、Rerank和上下文长度到底应该一起看,而不是单独调- 不同阶段的系统,为什么不应该用同一套成本和延迟目标