检索知识库

按标题、类型或正文检索

Jikipedia
总目
JikipediaAICS329ATest-time compute
Concept

Test-time compute

不改权重,推理时多花算力来提高正确率。

type · conceptstatus · compiledAItest-timesamplinginference

一句话

模型已经「会」,差的是在测试时把正确答案搜出来,并交得出那一个。

当前理解

预训练 + 微调是「直到一年 / 一年半以前」的主叙事。之后 inference 本身变成前线:固定参数,只换生成与选择方式。Course Overview 用 infinite monkey / Large Language Monkeys 给直觉——对同一题并行反复采样,再用 verifier 挑对的那条。数学和代码上,样本从 1 拉到 10,000,较小开源模型的 coverage 可超过单次更强的 GPT-4o;有的题 10,000 个解里只有 3–4 个对。o1 在 AIME 上展示 pass@1 对 test-time compute 的 log-linear,以前这种形状只在训练算力上见过。

三条常用旋钮,不要只拧一根:

旋钮做什么课上的锚
并行采样同一输入独立生成多次pass@k = 1−(1−p)^k;coverage 对 k 可拟合成 exponential power law,70M–70B 同形态 Test-Time Compute Scaling
串行修订顺着一条链改,直到可交Snell:较易的题最优是串行 token 远多于并行;最难两箱配比很难说
推理时架构生成 / critic / ranker / fusion / 单测 编成可搜索的层Archon:Fusion 可以超过 Oracle 选择;开源组合 pass@1 平均超过当时 GPT-4o / Claude 3.5 Sonnet 14.1%(论文数字)

有硬 checker 的域(形式化证明、单测、KernelBench 输出对照、语言互译等价性)适合「多采样再过滤」。SWE-bench 上样本从 1 拉到 1,000,课上展示的 DeepSeek coverage 可超过 Claude 3.5 和 o1 preview。没有 checker,majority vote 大约 10 或 50 个样本后平台,出现 Generation-verification gap

易 / 中题上,额外 test-time compute 可以比继续放大预训练更划算;最难题仍然更吃更大、预训练更充分的模型。这被标成仍在进行中的观察。树搜索 = 混并行和串行,用 Process reward models 剪枝。

同一逻辑在后几讲换皮:LATS 在 HotPotQA 上加轨迹就涨 Planning and Multi-Step Reasoning;AlphaCode 的 solve rate 对样本数仍 log-linear,但量的是 10@k 不是 pass@k,selection 吃掉约 10 个点 Self-Improvement and Deep Research Agents。Train-time RL 是把滤出来的正确输出写进权重,不是替代 test-time;o1 那张「test-time 总更好」的图被当场认为可疑 Train-Time Scaling / Scaling RL

结课仍不懂:为什么同一问题问一遍又一遍,正确答案会冒出来;成功轨迹怎么蒸馏回模型;反复采样 / 修订 / 工具调用需要什么样的高吞吐低延迟基础设施 Future Research Areas

来源

常见混淆

  • 不是 fine-tuning。权重不动。把滤出来的轨迹再训,已经跨进 Train-time RL for reasoning
  • 不是「越长越好」:没有 verifier 的长 CoT 会 overthink;思考很短的题硬上 SPRINT 的 plan-and-execute,可能比 RFT 更差。
  • pass@k 高只说明搜索空间里有解,不说明你交得出那一个。AlphaCode 无限提交 >40%,只交 10 份大约 30%。
  • 温度不是越高越好。课上说通常超过约 1.2 就变成乱码。
  • 「再砸推理优于再训更大模型」只对易 / 中题;最难题结论相反。

开放问题

  • 样本数 / 并行–串行配比能否按题难度自动调?第一讲认为当时还没有这样的公开工作。
  • 没有形式化 verifier 的域,test-time scaling 的上限在哪?
  • 为什么反复采样能把正确答案问出来?成功轨迹蒸馏回模型的最佳实践是什么?结课列为未解。

来源 raw/collections/cs329a/01-course-overview.md · 更新 2026-09-04 · confidence: high