Skip to content

11.4.4 冷启动阶段没有日志、没有评测集时,系统该如何起步? ​

先给结论:冷启动阶段最重要的不是追求高性能,而是建立可控性。更稳的起步方式是:先限定范围、先保守输出、先做最小评测和最小观测,再逐步扩大覆盖。

冷启动意味着:

  • 没有稳定评测集
  • 没有历史日志
  • 对风险缺乏清晰边界

这时如果直接开放全量生成,风险会非常高。

一、先限制场景和范围 ​

冷启动阶段最稳的策略是:

  • 只选少量高价值、低风险的场景上线

例如:

  • FAQ
  • 低风险产品说明
  • 内部知识查询

避免一开始就覆盖高风险业务或复杂场景。

二、优先保守输出 ​

在早期阶段,应该让系统倾向于:

  • 给出证据
  • 允许拒答

而不是强行生成结论。这样可以避免:

  • 早期误答造成信任破坏

三、建立最小评测集 ​

冷启动也必须有评测集,但不需要很大。最小可行的做法是:

  1. 先收集 30-50 个高价值问题
  2. 为每个问题补上证据范围
  3. 明确正确答案或判定规则

这样你至少能有一套:

  • 可重复的基线评测

四、建立最小日志与观测 ​

即使没有完整观测体系,也要保证:

  • 请求可追溯
  • 检索结果可回溯
  • 生成结果可复盘

最小日志至少应包含:

  • 原始问题
  • 检索结果
  • 最终上下文
  • 生成回答

这是后续优化的基础。

五、用“灰度 + 人工复核”过渡 ​

冷启动阶段最稳的上线方式通常是:

  • 小流量灰度
  • 关键场景人工复核

这样可以在风险可控的情况下逐步积累:

  • 失败样本
  • 评测集
  • 观测数据

六、逐步扩张的顺序 ​

更稳的扩张顺序通常是:

  1. 扩问题类型
  2. 扩用户范围
  3. 扩生成覆盖

而不是一开始就扩流量和覆盖面。

一个最小冷启动流程示意 ​

python
cold_start = [
    "limit_scope",
    "retrieval_first",
    "build_small_eval_set",
    "log_key_fields",
    "gray_release_with_review",
    "expand_step_by_step"
]

一句话总结 ​

冷启动阶段最重要的是建立可控性。先限定范围、先保守输出、先做最小评测和日志,再逐步扩张,才能在真实风险下稳步上线。