检索知识库

按标题、类型或正文检索

Jikipedia
总目
JikipediaAICS329ATrain-time RL for reasoning
Concept

Train-time RL for reasoning

把成功的推理轨迹写进权重,而不是每次推理再搜一遍。

type · conceptstatus · compiledAIrlstarreasoning

一句话

STaR / GRPO / DAPO 这一族能转起来,当且仅当 base 模型偶尔已经能做对,并且奖励没饱和。

当前理解

三个范式不要混:预训练吃互联网;微调 / RLHF / RLAIF 吃偏好数据、做出 chatbot;Test-time compute 是采样、投票、组合输出。把 test-time 滤出来的正确输出再 fine-tune,就是 train-time scaling Train-Time Scaling / Scaling RL。o1 在 AIME 上 train-time compute 和 test-time compute 两边加算力,pass@1 都涨;能闭环是因为数学可验证。课上读图:GPT-3.5(被认为约 175B)在 AIME 上几乎 5%;DeepSeekMath 7B 做 train-time scaling 到 51.7%,再加 tricks 到 60%;DAPO 打在 Qwen-32B 上约 50%。小模型靠训练时缩放,可以在推理基准上打过更大的预训练模型。

方法何时用课上的机制与数字
STaR约 100 条带推理的例子、没有 RL 基础设施对的 rationale 做 SFT;错的把答案当 hint 再合理化,样本里不再出现 hint。GPT-J 6B:相对直接 SFT 报到 51.7%、只用 70%–87% 数据。CommonsenseQA 约 86% 数据到 72.5%。GSM8K 上 rationalization 并不涨点——题太简单。完全不会的题,给答案也启动不了
GRPO(DeepSeekMath)显存紧、还要上 RL先 code→math 挖 OpenWebMath,arXiv 继续训几乎不帮。组内 A = (r−mean)/std,丢掉 critic。MATH 46.8% → 51.7%。涨的是 majority@k(32 次采样),pass@k 没涨:「更一致,不是从根本上更聪明」
DAPO推理链明显变长 = 题明显变难朴素 GRPO 在 Qwen-32B 上 AIME 约 30%。补丁累加:overlong filtering 36 → 非对称 clip 38 → soft overlong 41 → token-level loss 42 → dynamic sampling 50,超过 DeepSeek-R1 蒸馏到 Qwen-32B。监控:回复长度、熵、组内全对比例

正确抽象不是「有没有数据」,是 有没有能 hill-climb 的数据。全 0 或全 1 的组 advantage 为零。Dynamic sampling 丢掉这些组,维护有效 batch。曲线不动,先怀疑 reward model 饱和。推理模型多出来的 token 在可验证域对非 thinking 的 GPT-4o win rate >50%;个人写作 / 改文本增益小。

前几讲已经把 RL 接进 verifier 和工具:Math-Shepherd 拿 PRM 做 PPO Robust Verification;RLEF 用执行反馈做代码 PPO,SFT 吃域内轨迹、RL 对稍新的题更有泛化(仍有争论)Learning from Feedback with Tools/Code;SWiRL 离线多步 RL,过程过滤比结果过滤更帮,合成数据 100 → 10,000 时域外 MATH / GSM8K 也涨 Planning and Multi-Step Reasoning。AlphaCode 2 的对照:能 RL 就把能力写进权重,测试时不必采那么多次;也可用 STaR 式 rationalization 把推理嵌进模型 Self-Improvement and Deep Research Agents

结课三处断裂:单模型合成数据几轮到几十轮模式崩塌(高温不够);验证会幻觉;训练题还靠人选题。Absolute Zero 一类让同一模型既出题又解题,proposer 奖励对准中等难度(solver 成功率 = 0 则奖 0,否则 1−平均成功率),只在自提出的代码任务上 hill-climb,数学基准也涨 Future Research Areas。讲师估计去年 RL 相对预训练大约 1% vs 99%,后来也许到 5%;Grok-4 声称 50% RL 并没有对应的大跳——瓶颈是奖励不够强、奖励有噪声。

来源

常见混淆

  • 训练时 RL 不是 test-time sampling 的替代;两者常叠用。o1 那张「test-time 总更划算」的图被当场认为可疑。
  • Rationalization(给了答案再写过程)不等于模型真的先想出来;训练样本里不出现 hint,是在假装它直接解出来。
  • majority@k 涨 ≠ pass@k 涨。只有前者,等于更稳,不是更会解新题。
  • RL 不会从零注入从没见过的知识(例如从没见过微积分);它是把已经会的事在设计空间里搜得更好。
  • 「数据少」是错抽象。AIME 题量很小也能爬;该问的是有没有非零、非饱和的梯度。

开放问题

  • 为什么多数时候只涨 majority@k、不涨 pass@k?
  • 回溯 / 自评 / 自纠正是新涌现,还是本来就会、只是统计上更常出现?
  • 几乎没有从失败里学的好方法;失败样本至今多半被滤掉。
  • 奖励饱和之后还能不能涨?主观任务的奖励如何避免模型钻漏洞?
  • 持续学习如何不再是「离线攒经验再异步微调」?结课认为这是刚放开的时代。

来源 raw/collections/cs329a/01-course-overview.md · 更新 2026-09-04 · confidence: high