Synthesis
CS329A 主线
九讲可以压成三句话:模型常常已经会;缺的是验证;有验证才能在测试时搜、在训练时学、在环境里改。
结论摘要
自改进不是神秘的自我意识,是一条可工程化的环:
生成 → 验证 → 选择或更新 → 再生成。
环上缺任何一块都会假装成「agent」:没有验证的采样是抽奖;没有环境的规划是作文;没有能 hill-climb 的数据的 RL 是过拟合。
要点
| 阶段 | 缺了会怎样 | 课里的抓手 |
|---|---|---|
| Coverage | 再搜也没有正确答案 | 更大模型、更好预训练、分解题目 |
| Selection | 正确答案在堆里但交不出去 | ORM/PRM、测试、聚类 |
| Interaction | 只会说不会做 | ReAct、执行反馈、按需检索 |
| Write-back | 每次推理从零搜 | STaR、数学 RL、合成轨迹 |
| Eval | 短题满分、长活崩盘 | 时间视野、80% 阈值、引用可验证 |
依据
- Course Overview
- Test-Time Compute Scaling
- Robust Verification
- Learning from Feedback with Tools/Code
- Train-Time Scaling / Scaling RL
- Agentic Evaluations and Long Horizon Tasks
风险与未知
字幕是课堂口语,数字(+14.1%、7 个月翻倍、66.6 vs 82.1)都转述论文,引用前要核对。YouTube 九讲不等于完整学期(缺客座与项目课)。
建议下一步
- 抽 1–2 篇核心论文进 raw(Monkeys、Let's Verify、ReAct、STaR)做二次编译。
- 用这套概念页去对照自己正在写的 agent:反馈从哪来、评测用 50% 还是 80%。
来源 wiki/collections/cs329a.md · 更新 2026-09-04 · confidence: high