Collection
CS329A Self-Improving AI Agents
斯坦福 2025 秋的自改进 agent 课。YouTube 九讲 + 官方站点。人看 HTML 教材,不必再把字幕过一遍。
- 01Course Overview斯坦福 CS329A 第二轮开场:预训练缩放还在,但主线已经挪到 post-training、test-time compute,以及「有 verifier 才能自改进」的 agent。status · compiled
- 02Test-Time Compute Scaling不改权重、只在推理时砸算力,coverage 往往还能涨;majority vote 捞不出长尾上的稀有正确答案。真正要设计的是 verifier,以及怎么把生成、修订、融合编成一套推理架构。status · compiled
- 03Robust Verification采样证明搜索空间里往往已经有正确答案;验证决定能不能把它捞出来,以及生成过程中能不能导航。status · compiled
- 04Learning from Feedback with Tools/Code让模型碰到真实环境:工具、代码执行、以及用章程做自我批判。三篇论文的差别不在「要不要反馈」,而在反馈从哪来。status · compiled
- 05Planning and Multi-Step Reasoning多步任务不是把 Chain-of-Thought 再拉长,而是推理、行动、搜索要合在同一条轨迹里:想清楚约束,用工具碰到环境,再根据观察改计划。树搜索把备选路径摊开;合成数据把「何时并行、何时换工具、何时停」写进权重。status · compiled
- 06Train-Time Scaling / Scaling RL测试时是把已有能力搜出来;训练时 RL 是把成功轨迹写进权重。两者都能抬 pass@1,但训练时缩放要有可验证信号、非零成功,以及还没饱和的奖励。status · compiled
- 07Self-Improvement and Deep Research Agents解往往已经在模型的输出空间里。本讲问的是怎么把它筛出来:竞赛代码的百万级采样(AlphaCode / AlphaCode 2),以及推理中途遇到知识缺口再去检索的 deep research(Search-o1)。status · compiled
- 08Agentic Evaluations and Long Horizon Tasks单跳问答的准确率无法描述「能否值守两小时把活干完」。本讲把 agent 评测换成三条尺子:专业人类要花多久(METR 时间视野)、对行业专家的胜率(GDPVal)、综述是否覆盖关键事实且引用可验证(DeepScholar-Bench)。50% 能做和 80% 能做完,是两种产品。status · compiled
- 09Future Research Areas结课把九讲收成一条弧:verifier 驱动的自改进,走到开放式探索、工具工作流、记忆/检索和评测。然后指出环还没合上的三件事——推理链不够多样、验证会幻觉、训练题还靠人选题——再加一条效率轴:多数真实查询其实很简单,intelligence per watt 会把流量从云端赶到本地。status · compiled
- 10CS329A course siteStanford CS329A 官方站点(Autumn 2025)。它是日历、评分、作业节奏和阅读清单的权威源;YouTube 九讲是课的视频子集,不是这份大纲的全文。status · compiled
这是什么
讲师 Aakanksha Chowdhery、Azalia Mirhoseini。对象:能通过与自己、与环境交互而持续改进的 LLM agent。站点把领域切成四段——自改进技术、外部能力(tool / code / memory)、agentic workflow 里的规划、以及 robust evaluation——九讲按「反馈从哪来」把这四段走完。
Playlist 是课的视频核心;完整日历、作业、项目节点、34 条阅读在 CS329A course site。站点抽取缺教师名、客座行和按讲次的课表,日期以原站为准。
怎么读
- 先读本页「主线」和 CS329A 主线,建立九讲递进,不要按论文名随机跳。
- 再按覆盖表读 source-summary。每讲已按 Depth standard 重写:没看过视频也应能重建论证。需要原话或时间戳时再打开
raw/collections/cs329a/。 - 概念页是跨讲复利层,比单讲摘要更适合以后查询。
- 截止日期、作业题面、哪一讲读哪篇:打开
https://cs329a.stanford.edu/,不要用 10 的扁平抽取当课表。
主线
预训练三维缩放(compute / 数据 / 参数)仍压 test loss,约 2024 年起显出饱和。ChatGPT 相对 GPT-3 的跃迁主要来自 instruction tuning 和 RLHF,不是又一个更大的 base。课从此把舞台让给 post-training + inference。
九讲不是并列专题,是一条「反馈从哪来」的递进:
- Test-time 先证明空间里有解。 Large Language Monkeys:固定权重、反复采样,较小开源模型的 coverage 可超过单次更强的 GPT-4o;有的题 10,000 个样本里只有 3–4 个对。o1 在 AIME 上展示 pass@1 对 test-time compute 的 log-linear。并行采样、串行修订、Archon 把生成 / critic / fusion 编成可搜索的推理架构——权重仍不动。
- 卡住的是 selection,不是生成。 Majority vote 大约 10–50 个样本后平台;有 ORM 大约到 400 还能涨。Generation-verification gap 把课从「再采一次」推进到「怎么验」:过程监督(PRM)比只看最终答案密,Weaver 用弱 verifier 集成缩小缝。没有 verifier,采样只是在堆更自信的错。
- 模型内部验不了,就让行动碰到环境。 ReAct 把 Thought / Action / Observation 交错;代码域最好的 verifier 是单元测试(RLEF 的公开测试迭代 + 私有测试给 PPO);没有硬环境时,Constitutional AI 用人写的原则当软监督。合法动作要当成分类,否则模型会发明非法 action。
- 单步反馈不够走多步。 规划拆成 reason → act → search。LATS 把 ReAct 接到 MCTS;SPRINT 把长思考里独立块并行掉;SWiRL 离线合成多步「推理+工具」轨迹再 RL,训练时不跑活工具。过程过滤(逐步被 judge 判好)比「只要最终答案对」更利于 RL,且合成数据会迁到没当主任务的基准。
- 搜出来的正确轨迹,可以写进权重。 Train-time scaling 的最小闭环:同一套采样 + 过滤,留下的再当监督。STaR 用正确答案当 verifier、错题合理化;DeepSeekMath 先 code→math 挖语料再 GRPO;DAPO 把长链上的熵崩、长度失控写成配方。RL 常只抬 majority@k,不抬 pass@k——更稳,不是突然会解新题。Base 的 pass@k 已经是 0,环启动不了。
- 同一逻辑落到可交作业的系统。 AlphaCode 每题采 100 万再过滤/聚类,量的是 10@k 不是 pass@k,selection 吃掉约 10 个点;AlphaCode 2 换基座和 scoring model,100 次采样 ≈ 旧系统 100 万次。开放域没有等价 checker,Search-o1 在知识缺口处检索,并在工具内抽取,而不是开头 RAG 一次。
- 然后才问系统能不能上岗。 METR 用专业人类耗时 × 成功率当尺子:50% 视野大约每七个月翻倍(Claude 3.7 约 59 分钟),80% 短一截(约 15 分钟)。GDPVal 对专家的 win rate 更像线性;DeepScholar-Bench 现有系统总分不超过 19%。视野翻倍 ≠ 能干几天几周的真活。
- 环还没合上。 单模型合成数据会模式崩塌;LLM-as-judge 会放行无效证明,所以要 meta-verifier;训练题仍靠人选题,Absolute Zero 一类让模型自己出可执行任务。另加效率轴:多数真实查询其实很简单,intelligence per watt 会把流量从云端赶到本地。
站点概述的顺序(constitutional AI 写在自改进第一项)和阅读清单顺序不完全一致;机制和数字以九讲摘要为准。
关键概念
- Test-time compute — 课的第一刀:不改权重,用采样 / 修订 / 推理架构把已经在空间里的解搜出来。
- Generation-verification gap — 前半的总开关:会做 ≠ 会挑;verifier 质量就是 sampling 和 RL 两条路的上限。
- Process reward models — 把监督从最终答案加密到逐步,让搜索能早剪枝,也能把 PRM 送进 RL。
- Tool use and execution feedback — 模型内部验不了时,用工具、测试、章程当环境反馈;ReAct 是积木,不是已经自动的 agent。
- Train-time RL for reasoning — 把成功轨迹写进权重,抬 pass@1;转得起来当且仅当 base 偶尔能做对、奖励没饱和。
- Long-horizon agent evaluation — 课的最后一把尺:专业人类要花多久、以多高成功率做完,而不是单跳准确率。
读完应该记住的
- 先问反馈从哪来,再谈 agent。有单测 / 最终答案核对,走 sampling + filter;没有硬 verifier,先设计 judge / 工具 / 人类,不要把 Monkeys 直接搬到创意写作。
- pass@k / coverage 高只说明搜索空间里有解。系统交得出那一个,取决于 selection:majority vote、ORM、PRM、聚类、scoring model、或单元测试。
- 训练时 RL 启动不了,通常是 base 的 pass@k 已经是 0,或组内全 0 / 全 1、没有能 hill-climb 的数据。
- majority@k 涨不等于会解新题。DeepSeekMath 的 GRPO 被课上读成「更一致,不是从根本上更聪明」。
- 80% 长程成功比 50% 短题准确率更接近能用。METR 的指数故事和 GDPVal 的线性胜率测的不是同一根轴。
- 合成数据可以迁移:SWiRL 在 GSM8K + SymPy 上训,HotPotQA 也涨,反过来也成立;09 的自出题飞轮只在代码任务上爬,数学基准也动。
- Fusion 可以超过 Oracle 选择;先过滤再融合,通常优于把全部回答一股脑塞进去。
- 今天多数生产系统仍是人手搭的静态 workflow。搜索空间定义得清才可以不再手写;会计 / 金融 / 法律的步骤仍是领域知识。
来源 raw/collections/cs329a/01-course-overview.md · 更新 2026-09-04 · confidence: high