Process reward models
给推理过程的每一步打对错,而不只看最终答案。
一句话
过程监督让搜索能早剪枝,但标注贵,而且逐步看起来对也可能最终错。
当前理解
第一讲只预告 outcome reward model vs process reward model。第二讲把它嵌进搜索:ORM 看最终答案打一个分,做 best-of-n;PRM 给每一步打 0–1 分(不是 per-token,是 per-step),配合 beam search——每层少样本,留 top 分支再展开。现成 PRM 可以借邻近任务的,不必从头训 Test-Time Compute Scaling。
第三讲是主文。Let's Verify Step by Step:ORM 只看整解最终对错,PRM 的最终分是各步概率的乘积,更能压「过程胡写、答案碰巧对」。开源 PRM800K(80 万步级人类标签);优先标 convincing wrong(最终对、中间错)比随机抽有效 2.6 倍。基座 GPT-4:PRM 优于 ORM 和 majority vote;有些题正确样本频率不到 5%,PRM 仍能把那次对的捞出来。数据效率:给 ORM 标 100 个整解,大约只相当于给 PRM 标 1 条逐步解。PRM 也会伤人:某一步「看起来对」但对最终答案没贡献,会给错的 credit。新做法常 ORM + PRM 合用 Robust Verification。
人工逐步标注太贵。Math-Shepherd 用最终答案回标中间步:从当前步 rollout N 条,hard = 任一条到正确终点,soft = 到终点的比例。N=4 已是他们最好的点。三个失败模式:N 太小看不到稀有正确路径;难题所有 rollout 都错,几乎没有正信号;错步碰巧到正确终点仍会被标成对。无人类逐步标注时,MATH 上超过 PRM800K verifier。拿 Mistral-7B 对这个 PRM 做 PPO,比用 ORM 做 RL 高一截;提升幅度略小于纯测试时 scaling。
用 PRM 微调 generator 有独特坑:模型可能学会停推理、专产 PRM 爱的短答案。只拿 PRM 打分、不改 generator,相对安全。RLEF 的「公开测试迭代 vs 只要最终过」被明确连回 PRM vs ORM,按域还没有统一答案 Learning from Feedback with Tools/Code。
第五讲把过程奖励从数学步挪到工具步。SWiRL 的 LLM-as-a-Judge 打的是「这条工具 query 好不好」,不是工具返回好不好——这是逐步的 process reward。反直觉:只做过程过滤比「只留最终答案对的轨迹」更帮 RL;SFT 则要过程+结果都对 Planning and Multi-Step Reasoning。STaR 只按最终答案滤,中间可以有无效步;后续可以叠 PRM Train-Time Scaling / Scaling RL。
结课:现有 RL 默认「最终答案对上 ground truth」已把 AIME 一类打到饱和,但答案对 ≠ 推理对。定理证明上 LLM-as-judge 会放行无效证明,PRM 又很难建,所以 DeepSeekMath-V2 走人标「证明哪里有洞」+ meta-verifier Future Research Areas。
来源
- Course Overview — 预告 ORM vs PRM
- Test-Time Compute Scaling — PRM + beam;可借现成 PRM
- Robust Verification — Let's Verify / PRM800K / Math-Shepherd / Weaver 主文
- Learning from Feedback with Tools/Code — 代码多回合修 vs 一次写对,连回 PRM vs ORM
- Planning and Multi-Step Reasoning — Math-Shepherd 对照 LATS;SWiRL 的逐步 process reward
- Train-Time Scaling / Scaling RL — STaR 中间无效步;rationalization 不再过滤
- Future Research Areas — PRM 难建;meta-verifier
- CS329A course site — Let's Verify、Math-Shepherd 在阅读清单
常见混淆
- PRM 不是思维链本身。CoT 是生成格式,PRM 是评分器。
- 逐步全绿 ≠ 答案对。逐步「看起来对」也可能对最终没贡献。
- Hard/soft estimate 不是人类逐步标注的替代保证:从未做对的难题没有正样本。
- 测试时用 PRM 打分,和用 PRM 做 RL 改 generator,失败模式不同。后者会诱使停推理。
开放问题
- ORM vs PRM 在固定测试时算力下谁赢,讲者说没有干净控制。
- 哪些域上 PRM 会伤害最终正确率?自动标注引入的虚假正步骤,09 用 meta-verification 压,仍限于验证相对容易的域。
- 用 PRM 微调 generator 时,如何避免「专产短答案」?人类会把跳步标低,自动标注这个坑更真。
来源
- Course Overview · source-summary
- CS329A course site · source-summary
- CS329A Self-Improving AI Agents · collection
- Future Research Areas · source-summary
- Learning from Feedback with Tools/Code · source-summary
- Planning and Multi-Step Reasoning · source-summary
- Robust Verification · source-summary
- Test-time compute · concept
- Test-Time Compute Scaling · source-summary
- Train-Time Scaling / Scaling RL · source-summary
来源 raw/collections/cs329a/01-course-overview.md · 更新 2026-09-04 · confidence: high