Appearance
11.4.4 冷启动阶段没有日志、没有评测集时,系统该如何起步?
先给结论:冷启动阶段最重要的不是追求高性能,而是建立可控性。更稳的起步方式是:先限定范围、先保守输出、先做最小评测和最小观测,再逐步扩大覆盖。
冷启动意味着:
- 没有稳定评测集
- 没有历史日志
- 对风险缺乏清晰边界
这时如果直接开放全量生成,风险会非常高。
一、先限制场景和范围
冷启动阶段最稳的策略是:
- 只选少量高价值、低风险的场景上线
例如:
- FAQ
- 低风险产品说明
- 内部知识查询
避免一开始就覆盖高风险业务或复杂场景。
二、优先保守输出
在早期阶段,应该让系统倾向于:
- 给出证据
- 允许拒答
而不是强行生成结论。这样可以避免:
- 早期误答造成信任破坏
三、建立最小评测集
冷启动也必须有评测集,但不需要很大。最小可行的做法是:
- 先收集 30-50 个高价值问题
- 为每个问题补上证据范围
- 明确正确答案或判定规则
这样你至少能有一套:
- 可重复的基线评测
四、建立最小日志与观测
即使没有完整观测体系,也要保证:
- 请求可追溯
- 检索结果可回溯
- 生成结果可复盘
最小日志至少应包含:
- 原始问题
- 检索结果
- 最终上下文
- 生成回答
这是后续优化的基础。
五、用“灰度 + 人工复核”过渡
冷启动阶段最稳的上线方式通常是:
- 小流量灰度
- 关键场景人工复核
这样可以在风险可控的情况下逐步积累:
- 失败样本
- 评测集
- 观测数据
六、逐步扩张的顺序
更稳的扩张顺序通常是:
- 扩问题类型
- 扩用户范围
- 扩生成覆盖
而不是一开始就扩流量和覆盖面。
一个最小冷启动流程示意
python
cold_start = [
"limit_scope",
"retrieval_first",
"build_small_eval_set",
"log_key_fields",
"gray_release_with_review",
"expand_step_by_step"
]一句话总结
冷启动阶段最重要的是建立可控性。先限定范围、先保守输出、先做最小评测和日志,再逐步扩张,才能在真实风险下稳步上线。