CS329A course site
Stanford CS329A 官方站点(Autumn 2025)。它是日历、评分、作业节奏和阅读清单的权威源;YouTube 九讲是课的视频子集,不是这份大纲的全文。
这是什么
https://cs329a.stanford.edu/ 的 HTML 抽取,落在 raw/collections/cs329a/10-cs329a-course-site.md。学期 Autumn 2025。课名在站点概述里写成覆盖 self-improving AI agents:能通过与自己、与环境交互而持续改进的系统。
站点给的学习方式有四条,并行而不是「听完再做」:
- 读最新研究论文。
- 每堂课讨论 suggested readings。
- 做一项原创研究项目。
- 听受邀的 academic / industry speakers,应用指向三类:coding agents、STEM 里的 research assistants、机器人里的 autonomous systems。
抽取质量决定本页能信什么。Instructors / Course Assistants 两个标题在 raw 里是空的,人名没进来。Schedule 被压成 34 条论文标题,没有日期、没有讲次名、没有 required / optional 标记。Grading 里每条成绩都重复了一遍截止日期。本页把清单和数字全留下,但不把抽取结果当成已对齐的课表。核对截止日期、客座、哪一讲读哪篇,打开原站。
本页不是视频,没有时间戳。
核心要点
课要覆盖什么(概述自己的顺序)
站点第一段把领域切成四段,后面的阅读清单大体按这个顺序堆:
- LLM 自改进技术:constitutional AI、using verifiers、scaling test-time compute、把 search 和 LLM 合起来、train-time scaling with RL。
- 给 LLM 加外部能力:tool use、code、memory;再用 multimodal interaction 编排这些能力。
- agentic workflow 里的 multi-step reasoning 和 planning。
- 建 robust evaluation frameworks 的困难(单独成段,不是附录)。
概述把 constitutional AI 写在自改进技术的第一项;抽取到的论文列表里,Constitutional AI: Harmlessness from AI Feedback 排在 ReAct / RLEF 之后。这是「宣传顺序」和「阅读顺序」不一致,不是笔误能消掉的。multimodal 和 robotics 出现在概述和「向客座学什么」里,34 条阅读里看不到对应篇名。
上课与沟通
- 周一 / 周五 4:30 PM–5:50 PM PT,Autumn 2025,Skilling Auditorium。
- 从第一讲起就是 in-person。
- 不允许旁听(Audits are not allowed)。
- 一般问题先读课程文档;问题在 office hours 或 EdStem 问。
成绩(抽取数字加总为 100%)
| 项 | 比重 | 抽取到的时间 |
|---|---|---|
| Homework 1 | 15% | Due Oct 13;发布 Oct 3 |
| Homework 2 | 15% | Due Oct 23;发布 Oct 13 |
| Homework 3 | 20% | Due Nov 7;发布 Oct 23 |
| Project Proposal | 2.5% | Due Oct 10 |
| Midterm presentation + Report | 10% | 5–10 分钟展示:Oct 24、Oct 27、Oct 31 |
| Final project | 35% | Due Dec 10 |
| Poster | 2.5% | Dec 12 |
作业合计 50%。项目相关(proposal + midterm + final + poster)合计 50%。研究生 seminar 把「做作业练直觉」和「做原创研究」对半切开。
Proposal 截止 Oct 10,早于 HW1 截止 Oct 13:立项在第一份作业交掉之前就要完成。
期中展示落在三个日期,和周一 / 周五课表对齐:Oct 24(五)、Oct 27(一)、Oct 31(五)。每位 5–10 分钟。
三份作业在练什么
站点只给范围,不给题面:三份作业用来建立 self-improvement、multi-step reasoning、tool use 的直觉。发布日卡在上一份截止日上——HW2 发布 = HW1 截止,HW3 发布 = HW2 截止——节奏紧,不像「做完一份再发下一份」。
研究项目
- 2 到 4 人一组。
- 必须是 original research。
- 范围:课上讨论过的方向,以及与 agent workflows 相关的 benchmarks。
- 学生会拿到 API credits 做开发。
Late policy 里出现 project milestone 这个词,评分表里没有单独一项叫 milestone。期中 presentation + report 是否就是 milestone,抽取无法确认。[需要验证]
Late policy(全文都是硬规则)
- 全学期 4 个 free late days。
- 单次作业最多用 2 个,不扣分。
- 能用在:assignments、project proposal、project milestone。
- 不能用在 final project report。
- 超出部分:每个额外 late day 25% penalty。
- No exceptions to this policy.
阅读清单规模
Schedule 抽取到 34 条标题。带作者/年份的只有一部分(Brown、Saad-Falcon、Snell、Cobbe、Lightman、Wang、Yao、Zhou、Prasad、Zelikman、Lu、Packer)。其余只剩论文名或报告名。不要补作者。
机制 / 论证
站点不是一篇论文,但它有一条明确的领域论证,以及一套用分数和截止日期写成的激励结构。阅读清单是这条论证的书目;评分表是这条论证的权重。
1. 自改进被定义成「交互」,不是「再预训练一次」
概述第一句:agents continuously improve themselves through interaction with themselves and the environment。后面列的技术都是在给这条定义找反馈从哪来:
| 反馈从哪来 | 站点点名的技术 | 对应 wiki 概念 |
|---|---|---|
| 模型按原则评自己 | constitutional AI | Tool use and execution feedback |
| 另有一个模型/规则挑对错 | verifiers | Generation-verification gap、Process reward models |
| 不改权重、推理时多花算力 | scaling test-time compute | Test-time compute |
| 在输出空间里搜 | combining search with LLMs | 见 07 讲 |
| 把成功轨迹写进权重 | train-time scaling with RL | Train-time RL for reasoning |
| 行动碰到真实环境 | tool use、code | Tool use and execution feedback |
| 跨步记住状态 | memory | 阅读清单后段;09 讲点到记忆,未展开篇名 |
| 多步任务怎么走 | planning / multi-step reasoning | 05 讲 |
| 怎么知道系统变好了 | robust evaluation | Long-horizon agent evaluation |
「与自己交互」覆盖 constitutional AI、verifier、test-time search、train-time RL。「与环境交互」覆盖工具、代码、记忆、规划。评测单独成段:没有稳健的评价框架,前面那些环无法声称在改进。
这和 CS329A Self-Improving AI Agents 的主线(预训练缩放 → 测试时采样 → verifier → 工具 → 规划 → 训练时 RL → 搜索型 agent → 长程评测)同构。站点是这份地图的官方目录;九讲是其中已经有视频的那些节点。
2. 阅读清单按主题重建(顺序跟抽取,分组跟概述)
下面「wiki 落点」来自已编译的九讲摘要,不是站点表格——站点表格结构已经丢了。主文 = 该讲沿三/四篇走的核心论文;点到 = 正文提过但不是主文;未展开 = 只有站点标题。
A. Test-time compute / 反复采样
| 抽取标题 | 作者/年(仅 raw 有的) | wiki 落点 |
|---|---|---|
| Large Language Monkeys: Scaling Inference Compute with Repeated Sampling | Brown et al. 2024 | Test-Time Compute Scaling 主文 |
| Archon: An Architecture Search Framework for Inference-Time Techniques | Saad-Falcon et al. 2024 | 02 主文 |
| Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters | Snell et al. 2024 | 02 主文 |
| How Do Large Language Monkeys Get Their Power (Laws)? | — | 未展开。标题像 Monkeys 的缩放律续作,不要当成 02 已讲的同一篇 |
02 把 KernelBench 当 Monkeys 文里的 CUDA 基准例子;站点后段把 KernelBench: Can LLMs Write Efficient GPU Kernels? 又列成独立阅读。
B. Verifiers / 缩小 generation-verification gap
| 抽取标题 | 作者/年 | wiki 落点 |
|---|---|---|
| Shrinking the Generation-Verification Gap with Weak Verifiers | — | 03 主文第四篇课上称 Weaver(弱 verifier 集成)。站点标题对得上主题,是否同一篇 [需要验证] |
| Training Verifiers to Solve Math Word Problems | Cobbe et al. 2021 | 03 主文第一篇。03 摘要写成 Solve Math Problems(少 Word),按 Cobbe 2021 当同一篇 |
| Let's Verify step by step | Lightman et al. 2023 | 03 主文第二篇(PRM vs ORM) |
| Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations | Wang et al. 2023 | 03 主文第三篇 |
这一组是课的枢纽:有 verifier,test-time 采样和 train-time RL 才转得起来。见 Generation-verification gap、Process reward models。
C. 工具、代码执行、constitutional AI
| 抽取标题 | 作者/年 | wiki 落点 |
|---|---|---|
| ReAct: Synergizing Reasoning and Acting in Language Models | Yao et al. 2022 | Learning from Feedback with Tools/Code 主文 |
| RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning | — | 04 主文 |
| Constitutional AI: Harmlessness from AI Feedback | — | 04 主文。概述里它排在自改进技术第一项,阅读里跟工具讲放在一起 |
D. 规划 / 多步推理(含离线合成轨迹)
| 抽取标题 | 作者/年 | wiki 落点 |
|---|---|---|
| SWiRL: Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use | — | Planning and Multi-Step Reasoning 主文;01 / 09 也点到 |
| Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models | Zhou et al. 2023 | 05 主文(LATS + MCTS) |
| SPRINT: Enabling Interleaved Planning and Parallelized Execution in Reasoning Models | — | 05 主文 |
| ADaPT: As-Needed Decomposition and Planning with Language Models | Prasad et al. 2024 | 未展开 |
| Wider or Deeper? Scaling LLM Inference-Time Compute with Adaptive Branching Tree Search | — | 未展开。标题同时吃 test-time compute 和树搜索,挂在 02 还是 05 不知道 |
SWiRL 在概述技术列表里不出现,但插在 constitutional AI 和 LATS 之间。05 把它当「训练环里不跑活工具、离线合成多步轨迹再 RL」的主文。
E. Train-time RL
| 抽取标题 | 作者/年 | wiki 落点 |
|---|---|---|
| STaR: Bootstrapping Reasoning With Reasoning | Zelikman et al. 2022 | Train-Time Scaling / Scaling RL 主文 |
| DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models | — | 06 主文(含 GRPO) |
| DAPO: An Open-Source LLM Reinforcement Learning System at Scale | — | 06 主文 |
F. 搜索型 coding / 科研 agent / 系统搜索
概述里的「combining search with LLMs」和三类应用(coding、STEM 助手、机器人)主要堆在这里。机器人仍没有对应篇名。
| 抽取标题 | 作者/年 | wiki 落点 |
|---|---|---|
| Automated design of agentic systems | — | 未展开 |
| The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery | Lu et al. 2024 | 未展开。08 把 METR 的 RE-Bench 说成接近「课上已讲的 AI scientist」,不等于 09 把 Lu et al. 当主文 |
| AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithms | — | Future Research Areas 点到(开放式探索、不必每步有标量奖励) |
| Competition-Level Code Generation with AlphaCode | — | Self-Improvement and Deep Research Agents 主文 |
| AlphaCode 2 Technical Report | — | 07 主文 |
| Search-o1: Agentic Search-Enhanced Large Reasoning Models | — | 07 主文 |
| CodeMonkeys: Scaling Test-Time Compute for Software Engineering | — | 01 / 03 点到 Code Monkeys(生成代码再生成单测当 verifier)。站点拼成 CodeMonkeys,是否同一篇 [需要验证] |
| KernelBench: Can LLMs Write Efficient GPU Kernels? | — | 02 用作有完美 verifier 的 CUDA 基准,不是 02 三篇主文之一 |
| Improving Parallel Program Performance with LLM Optimizers via Agent-System Interfaces | — | 未展开 |
G. 记忆 / 长上下文 / RAG 服务
概述明确写了 memory。九讲里 09 把「无限上下文的替代(记忆)」列为开放问题,但下面三篇在已编译摘要里都没有展开。
| 抽取标题 | 作者/年 | wiki 落点 |
|---|---|---|
| Cartridges: Lightweight and general-purpose long context representations via self-study | — | 未展开 |
| MemGPT: Towards LLMs as Operating Systems | Packer et al, 2023 | 未展开 |
| CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion | — | 未展开 |
这是站点和 playlist 最大的内容差之一:记忆有书目,没有对应视频摘要。
H. 长程 / 经济 / 综述评测
| 抽取标题 | 作者/年 | wiki 落点 |
|---|---|---|
| Measuring AI Ability to Complete Long Tasks | — | Agentic Evaluations and Long Horizon Tasks 主文(课上称 METR 时间视野)。站点标题没写 METR,是否同一篇按主题高度同构,引用前对原文 [需要验证] |
| GDPVal: Evaluating AI Model Performance on Real-World Economically Valuable Tasks | — | 08 主文 |
| DeepScholar-Bench: A Live Benchmark and Automated Evaluation for Generative Research Synthesis | — | 08 主文 |
3. 评分在强化什么
50% 作业 / 50% 研究,不是「听讲座课」。作业三份的主题(self-improvement、multi-step reasoning、tool use)覆盖前半学期的技术积木,但没有单独一份作业叫 evaluation 或 train-time RL——这两块更可能进项目。
时间轴(按抽取日期,未核对原站):
Oct 3 HW1 发布
Oct 10 Project Proposal 截止
Oct 13 HW1 截止 = HW2 发布
Oct 23 HW2 截止 = HW3 发布
Oct 24 / 27 / 31 期中 5–10 分钟展示 + report
Nov 7 HW3 截止
Dec 10 Final project 截止(不能用 late days)
Dec 12 Poster
Proposal 插在 HW1 窗口正中:先定研究问题,再继续交作业。期中展示紧挨 HW2 截止,三天上课日连着做 5–10 分钟报告。Final 不能用 late days,Poster 在 final 后两天——抽取没说 poster 能不能迟交。
Late days 的设计:4 天总量、单次上限 2、final report 禁用、额外每天 25%。25% × 2 天已经是半份作业;再多就不是「缓交」而是实质性失败。政策写明 no exceptions。
4. 站点 vs YouTube 九讲:谁是谁的子集
| 站点(本 raw) | Playlist 九讲 | |
|---|---|---|
| 身份 | 大纲 / 日历 / 评分 / 书目 | 视频论证 |
| 已抽取到的 | 概述、后勤、34 条标题、评分、late/audit/EdStem | 01–09 完整字幕 |
| 明确有、抽取里没有的 | 教师名、助教名、客座姓名与日期、按讲次的日历行、作业题面 | — |
| 九讲有、站点抽取没列成标题的 | — | 例如 03 的 Weaver 这个名字、07 的 Search-R1、06 的 GRPO 细节 |
| 站点有书目、九讲摘要未展开的 | ADaPT、Wider or Deeper、Automated design of agentic systems、AI Scientist 全文、Cartridges / MemGPT / CacheBlend、并行程序 LLM optimizer、Monkeys Power (Laws) | — |
整理知识时:机制和数字以九讲摘要为准;截止日期、分组、作业发布日以原站表格为准,不要用本页的抽取日期代替打开网页。补论文原文时,用本页标题去搜,不要只靠字幕口述的短名。
5. 概述里还没被书目接住的承诺
- multimodal interaction:概述写了,34 条标题里没有明显的 multimodal 论文。
- autonomous systems in robotics:写在客座应用里,书目没有机器人论文。
- invited academic and industry speakers:概述承诺了,Schedule 抽取没有客座行。
- orchestrating AI capabilities:没有单独篇名,可能被 Archon / Automated design of agentic systems / Agent-System Interfaces 覆盖,抽取无法证明。[需要验证]
这些不是编译器该补上的阅读,是抽取缺口。
可操作
- 要日期、客座、哪一讲读哪篇:打开
https://cs329a.stanford.edu/,不要用本页的扁平列表当课表。 - 要补论文 PDF:按上表「抽取标题」精确搜索。作者年份只在 raw 写了的那些条上可信;没写的不要猜。
- 站点标题和课上口头短名会对不齐:Weaver vs Shrinking the Generation-Verification Gap;METR vs Measuring AI Ability to Complete Long Tasks;Code Monkeys vs CodeMonkeys。引用前对原文。
- 若用这门课当项目地图:选题范围是课上方向 + agent workflow benchmarks;记忆 / 不可验证域 / 评测框架是书目有、视频薄的缝。
- 旁听不存在。问题走 EdStem 或 office hours,先读文档。
- late days 先留给 proposal / 作业 / milestone;final report 按 Dec 10 死线排。
术语
| 词 | 在本页的意思 |
|---|---|
| self-improving AI agents | 能通过与自己、与环境交互持续改进的 agent;本课对象 |
| suggested readings | 每堂课讨论的指定阅读;抽取里只剩标题,不见「哪一天」 |
| constitutional AI | 人写原则,模型自评自改(站点把它列为自改进技术,阅读挂在工具讲附近) |
| verifiers | 用来挑对错或给过程打分的模型/规则 |
| test-time compute | 不改权重、推理时加算力 |
| train time scaling with RL | 用 RL 把能力写进权重 |
| tool use / code / memory | 给 LLM 接环境、解释器、可读写状态 |
| agentic workflows | 多步推理 + 规划要跑在上面的那种流程 |
| Homework 1/2/3 | 15% / 15% / 20%;练 self-improvement、multi-step reasoning、tool use 直觉 |
| Project Proposal | 2.5%,Due Oct 10 |
| Midterm presentation + Report | 10%;5–10 分钟;Oct 24 / 27 / 31 |
| Final project | 35%,Due Dec 10,禁用 late days |
| Poster | 2.5%,Dec 12 |
| late days | 全学期 4 个,单次最多 2;额外每天罚 25% |
| project milestone | late policy 允许迟交的项;评分表无独立一行 |
| EdStem | 课程问答平台 |
| API credits | 项目开发用的接口额度 |
| Skilling Auditorium | 上课教室 |
不确定 / 待验证
- 教师 / CA 姓名:本 raw 为空。Course Overview 和 CS329A Self-Improving AI Agents 写了 Aakanksha Chowdhery、Azalia Mirhoseini,那是视频和 collection 页的来源,不是本站点抽取。[需要验证] 以原站 Staff 为准。
- Grading 每条截止日期在 raw 里出现两次(先「Homework 1 (15%) Due Oct 13」,再单独「Due Oct 13」)。当作 HTML 重复,不是两份作业。日期本身仍以原站为准。
- Schedule 丢失了讲次、日期、required vs optional。上文按概述主题分组,不是官方课表。
project milestone与 midterm presentation + report 是否同一件事。[需要验证]- Poster 是否享受 late days:政策只说不能用于 final project report,没提 poster。
- Shrinking the Generation-Verification Gap with Weak Verifiers 是否即 03 的 Weaver;Measuring AI Ability to Complete Long Tasks 是否即 METR 那篇;CodeMonkeys 是否即课上的 Code Monkeys。[需要验证]
- How Do Large Language Monkeys Get Their Power (Laws)? 完整书目信息缺失。
- 客座名单、假期、第一讲具体日期:抽取没有。
- multimodal / robotics 是否出现在未抽到的日历行(客座或 optional reading)。[需要验证]
- 作业三份与三个主题是否一一对应(HW1=self-improvement, HW2=multi-step, HW3=tool use),站点只说三份作业共同覆盖这三个直觉。
相关
- CS329A Self-Improving AI Agents
- Test-time compute
- Generation-verification gap
- Process reward models
- Tool use and execution feedback
- Train-time RL for reasoning
- Long-horizon agent evaluation
- Course Overview
- Test-Time Compute Scaling
- Robust Verification
- Learning from Feedback with Tools/Code
- Planning and Multi-Step Reasoning
- Train-Time Scaling / Scaling RL
- Self-Improvement and Deep Research Agents
- Agentic Evaluations and Long Horizon Tasks
- Future Research Areas
来源 raw/collections/cs329a/10-cs329a-course-site.md · 更新 2026-09-04 · confidence: medium