Appearance
5.2 向量检索的工作方式
这一节开始真正进入“向量检索怎么跑起来”这件事。
前一节已经讲清楚了:
- Embedding 是什么
- 它为什么能提供语义表示
- 它在 RAG 里主要负责语义召回信号
接下来要继续往前走一步:当用户问题和知识块都变成向量以后,系统到底怎样从一堆候选中找回“更接近”的内容。
这一步如果理解得不稳,后面很容易出现几种常见误判:
- 把相似度分数当成“答案正确率”
- 觉得
Top K越大越好 - 看到向量检索能工作,就以为它可以单独解决所有召回问题
这一节就是要把这些误解先拆开。
学这一节时,最值得先建立的判断
- 向量检索找的是“更接近的候选”,不是直接判断“最终答案对不对”
Top K是召回范围参数,不是越大越好,也不是固定万能值- 相似度分数更像排序信号,不能直接当成业务正确率
- 只做向量检索通常不够,因为真实问题还涉及术语、边界、版本和权限
这一节会回答什么问题
读完这一节后,你最好能更稳地判断:
- 向量检索到底是在做最近邻搜索,还是在做业务判断
Top K调大调小时,系统会发生什么变化- 相似度分数应该怎样看,哪些时候不能过度相信
- 什么时候该在向量检索外,再加 BM25、过滤和多路召回