Skip to content

6.1 为什么用户问题不能直接拿去检索 ​

这一节要先讲清一个经常被忽视的问题:

  • 用户说出来的问题,并不一定就是最适合检索系统使用的查询

很多 Demo 在这里都会直接省略中间层:

  • 用户一提问
  • 系统立刻把整句原样拿去搜

这种做法有时能跑通,但在真实系统里经常会遇到:

  • 问得绕一点就搜不准
  • 带上下文、省略指代时就飘
  • 同一个意思换个说法,结果差很多

这就说明,检索之前往往还需要一层:

  • 查询理解

学这一节时,最值得先建立的判断 ​

  • 用户问题是交流语言,不一定是检索语言
  • 原始提问里常常混着背景、情绪、上下文、省略和冗余描述
  • 查询理解的目标不是把问题“改漂亮”,而是把它变成更适合召回的输入
  • 很多检索不稳的问题,根因并不在索引,而在用户问题根本没被处理好

这一节会回答什么问题 ​

读完这一节后,你最好能更稳地判断:

  • 哪类原始提问特别不适合直接原样检索
  • 查询理解到底是在补什么
  • 什么问题看起来像检索器不行,其实是查询输入本身就不对