Generation-verification gap
模型能生成正确答案的频率,高于它能稳定选中该答案的频率。
一句话
会做 ≠ 会挑。
当前理解
这是 CS329A 前半的总开关。Course Overview 点名 generator-verifier gap:模型很容易生成大量看起来像回事的 traces,有没有用取决于反馈。创意写作能拿到的反馈很薄,人类反馈成为瓶颈;有硬反馈的域才能持续改进。
Test-Time Compute Scaling 把缝画清楚:绿线 majority vote 大约在 10 或 50 个样本后平台;蓝线 coverage(完美选择器)远高于绿线。MATH 比 GSM8K 更明显。最难的题可能在 1,000 或 10,000 次采样里只对 1–3 次——多数票按定义抓不住稀有事件。Reward model 打分也填不满这条缝。反复采样证明「空间里经常有解」;系统能不能用,取决于能不能把它捞出来。
Verifier 把有效区间拉长一个数量级。OpenAI 2021 的 outcome verifier:majority vote 大约 50 次以内就跟不上 coverage;这篇大约到 400 还能涨,到 800 因为分不开「很像的一对一错」而回落。工程上停在 100 样本。同一设定下「大 generator + 小 verifier」优于反过来——生成通常比验证难,参数应留给 generator;Pareto 切点随基座变强会不会翻,课上当作开放课题 Robust Verification。
没有完美 verifier。Weaver 把现成 ORM / PRM / LLM-as-judge 当弱信号,先滤掉太差的,再学权重集成。核心假设:每个 verifier 抓住正确性的不同独立侧面;全员对每个样本打同一分,集成学不到新东西。论文数字(不是本课复现):难题约 40% → 70% 以上、贴近 o3-mini;Llama 3.1 8B Instruct + ≤8B verifier 池平均约 70%,接近 70B 的 majority vote;同一套打到 70B 级平均 86.2%。蒸馏到约 4 亿参数可保住大池 97% 准确率、测试时算力少 99%+。
代码域可以把测试当 verifier,不必一上来训 RM。AlphaCode 把同一缝量化成 10@k vs pass@k:无限提交 >40%,只交 10 份大约 30%,selection 吃掉约 10 个点 Self-Improvement and Deep Research Agents。没有可靠 verifier,Train-time RL for reasoning 环闭不上 Train-Time Scaling / Scaling RL。没有环境信号时只能 LLM-as-judge,又滑回这个问题 Learning from Feedback with Tools/Code。
结课把验证侧再拆一刀:LLM-as-judge 会把数学上无效的证明判成对,也可能捏造不存在的错误,所以 DeepSeekMath-V2 加 meta-verifier。没有多样的正确样本,后面的 verifier 也无票可投 Future Research Areas。
来源
- Course Overview — 点名 generator-verifier gap;硬反馈域才能持续改进
- Test-Time Compute Scaling — 命名 generation-verification gap;majority vote 平台;Monkeys 每题 10,000 样本可做项目
- Robust Verification — ORM / PRM / Weaver 主文
- Learning from Feedback with Tools/Code — 无环境则滑回 verifier;测试是代码域最好的检查器
- Planning and Multi-Step Reasoning — LATS 的分来自动作结果,对照 Math-Shepherd 给推理轨迹打分
- Train-Time Scaling / Scaling RL — 没有 verifier,train-time 环闭不上
- Self-Improvement and Deep Research Agents — 10@k;聚类 / scoring model 是交之前的 selection
- Future Research Areas — meta-verifier;多样正确样本是 gap 的生成侧
- CS329A course site — 阅读清单 B 组;站点标题 Shrinking the Generation-Verification Gap 是否即 Weaver [需要验证]
常见混淆
- Gap 不是「模型笨」,是评分器弱。缩小 gap 不等于提高 pass@k:coverage 可以不变、selection 变好。
- Majority vote、ORM、PRM、弱 verifier 集成、单元测试、聚类,都是 selection 的不同实现,不要混成同一种 verifier。
- Coverage 曲线还在涨时,系统准确率可能已经掉——02/03 的 800 样本回落是 selection 精度,不是 coverage 饱和。
- 过测试 ≠ 真对。代码单测覆盖不全时,verifier 本身是失败模式。
开放问题
- 不可验证域(创意、主观质量)有没有非 LLM-judge 的 verifier?奖励模型稍偏,RL 就会 reward hacking。
- 跨模型家族的 verifier 是否系统性更差?讲者说没看到专项研究。
- 「大 generator + 小 verifier」的 Pareto 切点,随基座变强会不会翻?
- Verifier 自己会幻觉(捏造不存在的错误,或放行无效证明)。meta-verification 能压多少,09 只在定理证明上给了 early evidence。
来源
- Agentic Evaluations and Long Horizon Tasks · source-summary
- Course Overview · source-summary
- CS329A course site · source-summary
- CS329A Self-Improving AI Agents · collection
- Future Research Areas · source-summary
- Learning from Feedback with Tools/Code · source-summary
- Planning and Multi-Step Reasoning · source-summary
- Robust Verification · source-summary
- Self-Improvement and Deep Research Agents · source-summary
- Test-time compute · concept
- Test-Time Compute Scaling · source-summary
- Train-Time Scaling / Scaling RL · source-summary
来源 raw/collections/cs329a/01-course-overview.md · 更新 2026-09-04 · confidence: high