检索知识库

按标题、类型或正文检索

Jikipedia
总目
JikipediaAICS329AProcess reward models
Concept

Process reward models

给推理过程的每一步打对错,而不只看最终答案。

type · conceptstatus · compiledAIprmverifier

一句话

过程监督让搜索能早剪枝,但标注贵,而且逐步看起来对也可能最终错。

当前理解

第一讲只预告 outcome reward model vs process reward model。第二讲把它嵌进搜索:ORM 看最终答案打一个分,做 best-of-n;PRM 给每一步打 0–1 分(不是 per-token,是 per-step),配合 beam search——每层少样本,留 top 分支再展开。现成 PRM 可以借邻近任务的,不必从头训 Test-Time Compute Scaling

第三讲是主文。Let's Verify Step by Step:ORM 只看整解最终对错,PRM 的最终分是各步概率的乘积,更能压「过程胡写、答案碰巧对」。开源 PRM800K(80 万步级人类标签);优先标 convincing wrong(最终对、中间错)比随机抽有效 2.6 倍。基座 GPT-4:PRM 优于 ORM 和 majority vote;有些题正确样本频率不到 5%,PRM 仍能把那次对的捞出来。数据效率:给 ORM 标 100 个整解,大约只相当于给 PRM 标 1 条逐步解。PRM 也会伤人:某一步「看起来对」但对最终答案没贡献,会给错的 credit。新做法常 ORM + PRM 合用 Robust Verification

人工逐步标注太贵。Math-Shepherd 用最终答案回标中间步:从当前步 rollout N 条,hard = 任一条到正确终点,soft = 到终点的比例。N=4 已是他们最好的点。三个失败模式:N 太小看不到稀有正确路径;难题所有 rollout 都错,几乎没有正信号;错步碰巧到正确终点仍会被标成对。无人类逐步标注时,MATH 上超过 PRM800K verifier。拿 Mistral-7B 对这个 PRM 做 PPO,比用 ORM 做 RL 高一截;提升幅度略小于纯测试时 scaling。

用 PRM 微调 generator 有独特坑:模型可能学会停推理、专产 PRM 爱的短答案。只拿 PRM 打分、不改 generator,相对安全。RLEF 的「公开测试迭代 vs 只要最终过」被明确连回 PRM vs ORM,按域还没有统一答案 Learning from Feedback with Tools/Code

第五讲把过程奖励从数学步挪到工具步。SWiRL 的 LLM-as-a-Judge 打的是「这条工具 query 好不好」,不是工具返回好不好——这是逐步的 process reward。反直觉:只做过程过滤比「只留最终答案对的轨迹」更帮 RL;SFT 则要过程+结果都对 Planning and Multi-Step Reasoning。STaR 只按最终答案滤,中间可以有无效步;后续可以叠 PRM Train-Time Scaling / Scaling RL

结课:现有 RL 默认「最终答案对上 ground truth」已把 AIME 一类打到饱和,但答案对 ≠ 推理对。定理证明上 LLM-as-judge 会放行无效证明,PRM 又很难建,所以 DeepSeekMath-V2 走人标「证明哪里有洞」+ meta-verifier Future Research Areas

来源

常见混淆

  • PRM 不是思维链本身。CoT 是生成格式,PRM 是评分器。
  • 逐步全绿 ≠ 答案对。逐步「看起来对」也可能对最终没贡献。
  • Hard/soft estimate 不是人类逐步标注的替代保证:从未做对的难题没有正样本。
  • 测试时用 PRM 打分,和用 PRM 做 RL 改 generator,失败模式不同。后者会诱使停推理。

开放问题

  • ORM vs PRM 在固定测试时算力下谁赢,讲者说没有干净控制。
  • 哪些域上 PRM 会伤害最终正确率?自动标注引入的虚假正步骤,09 用 meta-verification 压,仍限于验证相对容易的域。
  • 用 PRM 微调 generator 时,如何避免「专产短答案」?人类会把跳步标低,自动标注这个坑更真。

来源 raw/collections/cs329a/01-course-overview.md · 更新 2026-09-04 · confidence: high