Test-time compute
不改权重,推理时多花算力来提高正确率。
一句话
模型已经「会」,差的是在测试时把正确答案搜出来,并交得出那一个。
当前理解
预训练 + 微调是「直到一年 / 一年半以前」的主叙事。之后 inference 本身变成前线:固定参数,只换生成与选择方式。Course Overview 用 infinite monkey / Large Language Monkeys 给直觉——对同一题并行反复采样,再用 verifier 挑对的那条。数学和代码上,样本从 1 拉到 10,000,较小开源模型的 coverage 可超过单次更强的 GPT-4o;有的题 10,000 个解里只有 3–4 个对。o1 在 AIME 上展示 pass@1 对 test-time compute 的 log-linear,以前这种形状只在训练算力上见过。
三条常用旋钮,不要只拧一根:
| 旋钮 | 做什么 | 课上的锚 |
|---|---|---|
| 并行采样 | 同一输入独立生成多次 | pass@k = 1−(1−p)^k;coverage 对 k 可拟合成 exponential power law,70M–70B 同形态 Test-Time Compute Scaling |
| 串行修订 | 顺着一条链改,直到可交 | Snell:较易的题最优是串行 token 远多于并行;最难两箱配比很难说 |
| 推理时架构 | 生成 / critic / ranker / fusion / 单测 编成可搜索的层 | Archon:Fusion 可以超过 Oracle 选择;开源组合 pass@1 平均超过当时 GPT-4o / Claude 3.5 Sonnet 14.1%(论文数字) |
有硬 checker 的域(形式化证明、单测、KernelBench 输出对照、语言互译等价性)适合「多采样再过滤」。SWE-bench 上样本从 1 拉到 1,000,课上展示的 DeepSeek coverage 可超过 Claude 3.5 和 o1 preview。没有 checker,majority vote 大约 10 或 50 个样本后平台,出现 Generation-verification gap。
易 / 中题上,额外 test-time compute 可以比继续放大预训练更划算;最难题仍然更吃更大、预训练更充分的模型。这被标成仍在进行中的观察。树搜索 = 混并行和串行,用 Process reward models 剪枝。
同一逻辑在后几讲换皮:LATS 在 HotPotQA 上加轨迹就涨 Planning and Multi-Step Reasoning;AlphaCode 的 solve rate 对样本数仍 log-linear,但量的是 10@k 不是 pass@k,selection 吃掉约 10 个点 Self-Improvement and Deep Research Agents。Train-time RL 是把滤出来的正确输出写进权重,不是替代 test-time;o1 那张「test-time 总更好」的图被当场认为可疑 Train-Time Scaling / Scaling RL。
结课仍不懂:为什么同一问题问一遍又一遍,正确答案会冒出来;成功轨迹怎么蒸馏回模型;反复采样 / 修订 / 工具调用需要什么样的高吞吐低延迟基础设施 Future Research Areas。
来源
- Course Overview — Monkeys 直觉;coverage 对 k 的 log-linear;o1 的 pass@1 图
- Test-Time Compute Scaling — Monkeys / Snell / Archon 主文
- Robust Verification — 有 verifier 后 best-of-n 有效区间大约到 400,工程锚点约 100
- Learning from Feedback with Tools/Code — 接在 test-time 两讲之后;RLEF 的 solve rate 仍随采样预算(log 横轴)上升
- Planning and Multi-Step Reasoning — LATS 把测试时算力换成更好的多步解
- Train-Time Scaling / Scaling RL — 与 train-time 对照;两边加算力都涨 pass@1
- Self-Improvement and Deep Research Agents — AlphaCode 百万采样;10@k;按难度切预算
- Future Research Areas — 原理未解;TTS 基础设施;不可验证域需要近乎即时的 verifier
- CS329A course site — 站点把 scaling test-time compute 列为自改进技术
常见混淆
- 不是 fine-tuning。权重不动。把滤出来的轨迹再训,已经跨进 Train-time RL for reasoning。
- 不是「越长越好」:没有 verifier 的长 CoT 会 overthink;思考很短的题硬上 SPRINT 的 plan-and-execute,可能比 RFT 更差。
- pass@k 高只说明搜索空间里有解,不说明你交得出那一个。AlphaCode 无限提交 >40%,只交 10 份大约 30%。
- 温度不是越高越好。课上说通常超过约 1.2 就变成乱码。
- 「再砸推理优于再训更大模型」只对易 / 中题;最难题结论相反。
开放问题
- 样本数 / 并行–串行配比能否按题难度自动调?第一讲认为当时还没有这样的公开工作。
- 没有形式化 verifier 的域,test-time scaling 的上限在哪?
- 为什么反复采样能把正确答案问出来?成功轨迹蒸馏回模型的最佳实践是什么?结课列为未解。
来源
- Agentic Evaluations and Long Horizon Tasks · source-summary
- Course Overview · source-summary
- CS329A course site · source-summary
- CS329A Self-Improving AI Agents · collection
- Future Research Areas · source-summary
- Learning from Feedback with Tools/Code · source-summary
- Planning and Multi-Step Reasoning · source-summary
- Robust Verification · source-summary
- Self-Improvement and Deep Research Agents · source-summary
- Test-Time Compute Scaling · source-summary
- Train-time RL for reasoning · concept
- Train-Time Scaling / Scaling RL · source-summary
来源 raw/collections/cs329a/01-course-overview.md · 更新 2026-09-04 · confidence: high