检索知识库

按标题、类型或正文检索

Jikipedia
总目
JikipediaAICS329ACS329A course site
Webweb · web:303434aea0310b680c868b5eb4c6a2c75268a060

CS329A course site

Stanford CS329A 官方站点(Autumn 2025)。它是日历、评分、作业节奏和阅读清单的权威源;YouTube 九讲是课的视频子集,不是这份大纲的全文。

type · source-summarystatus · compiledAIcs329asyllabus

这是什么

https://cs329a.stanford.edu/ 的 HTML 抽取,落在 raw/collections/cs329a/10-cs329a-course-site.md。学期 Autumn 2025。课名在站点概述里写成覆盖 self-improving AI agents:能通过与自己、与环境交互而持续改进的系统。

站点给的学习方式有四条,并行而不是「听完再做」:

  1. 读最新研究论文。
  2. 每堂课讨论 suggested readings。
  3. 做一项原创研究项目。
  4. 听受邀的 academic / industry speakers,应用指向三类:coding agents、STEM 里的 research assistants、机器人里的 autonomous systems

抽取质量决定本页能信什么。Instructors / Course Assistants 两个标题在 raw 里是空的,人名没进来。Schedule 被压成 34 条论文标题,没有日期、没有讲次名、没有 required / optional 标记。Grading 里每条成绩都重复了一遍截止日期。本页把清单和数字全留下,但不把抽取结果当成已对齐的课表。核对截止日期、客座、哪一讲读哪篇,打开原站。

本页不是视频,没有时间戳。

核心要点

课要覆盖什么(概述自己的顺序)

站点第一段把领域切成四段,后面的阅读清单大体按这个顺序堆:

  1. LLM 自改进技术:constitutional AI、using verifiers、scaling test-time compute、把 search 和 LLM 合起来、train-time scaling with RL。
  2. 给 LLM 加外部能力:tool use、code、memory;再用 multimodal interaction 编排这些能力。
  3. agentic workflow 里的 multi-step reasoning 和 planning。
  4. robust evaluation frameworks 的困难(单独成段,不是附录)。

概述把 constitutional AI 写在自改进技术的第一项;抽取到的论文列表里,Constitutional AI: Harmlessness from AI Feedback 排在 ReAct / RLEF 之后。这是「宣传顺序」和「阅读顺序」不一致,不是笔误能消掉的。multimodal 和 robotics 出现在概述和「向客座学什么」里,34 条阅读里看不到对应篇名。

上课与沟通

  • 周一 / 周五 4:30 PM–5:50 PM PT,Autumn 2025,Skilling Auditorium
  • 从第一讲起就是 in-person。
  • 不允许旁听(Audits are not allowed)。
  • 一般问题先读课程文档;问题在 office hours 或 EdStem 问。

成绩(抽取数字加总为 100%)

比重抽取到的时间
Homework 115%Due Oct 13;发布 Oct 3
Homework 215%Due Oct 23;发布 Oct 13
Homework 320%Due Nov 7;发布 Oct 23
Project Proposal2.5%Due Oct 10
Midterm presentation + Report10%5–10 分钟展示:Oct 24、Oct 27、Oct 31
Final project35%Due Dec 10
Poster2.5%Dec 12

作业合计 50%。项目相关(proposal + midterm + final + poster)合计 50%。研究生 seminar 把「做作业练直觉」和「做原创研究」对半切开。

Proposal 截止 Oct 10,早于 HW1 截止 Oct 13:立项在第一份作业交掉之前就要完成。

期中展示落在三个日期,和周一 / 周五课表对齐:Oct 24(五)、Oct 27(一)、Oct 31(五)。每位 5–10 分钟。

三份作业在练什么

站点只给范围,不给题面:三份作业用来建立 self-improvement、multi-step reasoning、tool use 的直觉。发布日卡在上一份截止日上——HW2 发布 = HW1 截止,HW3 发布 = HW2 截止——节奏紧,不像「做完一份再发下一份」。

研究项目

  • 2 到 4 人一组。
  • 必须是 original research
  • 范围:课上讨论过的方向,以及与 agent workflows 相关的 benchmarks。
  • 学生会拿到 API credits 做开发。

Late policy 里出现 project milestone 这个词,评分表里没有单独一项叫 milestone。期中 presentation + report 是否就是 milestone,抽取无法确认。[需要验证]

Late policy(全文都是硬规则)

  • 全学期 4 个 free late days。
  • 单次作业最多用 2 个,不扣分。
  • 能用在:assignments、project proposal、project milestone。
  • 不能用在 final project report。
  • 超出部分:每个额外 late day 25% penalty。
  • No exceptions to this policy.

阅读清单规模

Schedule 抽取到 34 条标题。带作者/年份的只有一部分(Brown、Saad-Falcon、Snell、Cobbe、Lightman、Wang、Yao、Zhou、Prasad、Zelikman、Lu、Packer)。其余只剩论文名或报告名。不要补作者。

机制 / 论证

站点不是一篇论文,但它有一条明确的领域论证,以及一套用分数和截止日期写成的激励结构。阅读清单是这条论证的书目;评分表是这条论证的权重。

1. 自改进被定义成「交互」,不是「再预训练一次」

概述第一句:agents continuously improve themselves through interaction with themselves and the environment。后面列的技术都是在给这条定义找反馈从哪来:

反馈从哪来站点点名的技术对应 wiki 概念
模型按原则评自己constitutional AITool use and execution feedback
另有一个模型/规则挑对错verifiersGeneration-verification gapProcess reward models
不改权重、推理时多花算力scaling test-time computeTest-time compute
在输出空间里搜combining search with LLMs见 07 讲
把成功轨迹写进权重train-time scaling with RLTrain-time RL for reasoning
行动碰到真实环境tool use、codeTool use and execution feedback
跨步记住状态memory阅读清单后段;09 讲点到记忆,未展开篇名
多步任务怎么走planning / multi-step reasoning05 讲
怎么知道系统变好了robust evaluationLong-horizon agent evaluation

「与自己交互」覆盖 constitutional AI、verifier、test-time search、train-time RL。「与环境交互」覆盖工具、代码、记忆、规划。评测单独成段:没有稳健的评价框架,前面那些环无法声称在改进。

这和 CS329A Self-Improving AI Agents 的主线(预训练缩放 → 测试时采样 → verifier → 工具 → 规划 → 训练时 RL → 搜索型 agent → 长程评测)同构。站点是这份地图的官方目录;九讲是其中已经有视频的那些节点。

2. 阅读清单按主题重建(顺序跟抽取,分组跟概述)

下面「wiki 落点」来自已编译的九讲摘要,不是站点表格——站点表格结构已经丢了。主文 = 该讲沿三/四篇走的核心论文;点到 = 正文提过但不是主文;未展开 = 只有站点标题。

A. Test-time compute / 反复采样

抽取标题作者/年(仅 raw 有的)wiki 落点
Large Language Monkeys: Scaling Inference Compute with Repeated SamplingBrown et al. 2024Test-Time Compute Scaling 主文
Archon: An Architecture Search Framework for Inference-Time TechniquesSaad-Falcon et al. 202402 主文
Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model ParametersSnell et al. 202402 主文
How Do Large Language Monkeys Get Their Power (Laws)?未展开。标题像 Monkeys 的缩放律续作,不要当成 02 已讲的同一篇

02 把 KernelBench 当 Monkeys 文里的 CUDA 基准例子;站点后段把 KernelBench: Can LLMs Write Efficient GPU Kernels? 又列成独立阅读。

B. Verifiers / 缩小 generation-verification gap

抽取标题作者/年wiki 落点
Shrinking the Generation-Verification Gap with Weak Verifiers03 主文第四篇课上称 Weaver(弱 verifier 集成)。站点标题对得上主题,是否同一篇 [需要验证]
Training Verifiers to Solve Math Word ProblemsCobbe et al. 202103 主文第一篇。03 摘要写成 Solve Math Problems(少 Word),按 Cobbe 2021 当同一篇
Let's Verify step by stepLightman et al. 202303 主文第二篇(PRM vs ORM)
Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human AnnotationsWang et al. 202303 主文第三篇

这一组是课的枢纽:有 verifier,test-time 采样和 train-time RL 才转得起来。见 Generation-verification gapProcess reward models

C. 工具、代码执行、constitutional AI

抽取标题作者/年wiki 落点
ReAct: Synergizing Reasoning and Acting in Language ModelsYao et al. 2022Learning from Feedback with Tools/Code 主文
RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning04 主文
Constitutional AI: Harmlessness from AI Feedback04 主文。概述里它排在自改进技术第一项,阅读里跟工具讲放在一起

D. 规划 / 多步推理(含离线合成轨迹)

抽取标题作者/年wiki 落点
SWiRL: Synthetic Data Generation & Multi-Step RL for Reasoning & Tool UsePlanning and Multi-Step Reasoning 主文;01 / 09 也点到
Language Agent Tree Search Unifies Reasoning Acting and Planning in Language ModelsZhou et al. 202305 主文(LATS + MCTS)
SPRINT: Enabling Interleaved Planning and Parallelized Execution in Reasoning Models05 主文
ADaPT: As-Needed Decomposition and Planning with Language ModelsPrasad et al. 2024未展开
Wider or Deeper? Scaling LLM Inference-Time Compute with Adaptive Branching Tree Search未展开。标题同时吃 test-time compute 和树搜索,挂在 02 还是 05 不知道

SWiRL 在概述技术列表里不出现,但插在 constitutional AI 和 LATS 之间。05 把它当「训练环里不跑活工具、离线合成多步轨迹再 RL」的主文。

E. Train-time RL

抽取标题作者/年wiki 落点
STaR: Bootstrapping Reasoning With ReasoningZelikman et al. 2022Train-Time Scaling / Scaling RL 主文
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models06 主文(含 GRPO)
DAPO: An Open-Source LLM Reinforcement Learning System at Scale06 主文

F. 搜索型 coding / 科研 agent / 系统搜索

概述里的「combining search with LLMs」和三类应用(coding、STEM 助手、机器人)主要堆在这里。机器人仍没有对应篇名。

抽取标题作者/年wiki 落点
Automated design of agentic systems未展开
The AI Scientist: Towards Fully Automated Open-Ended Scientific DiscoveryLu et al. 2024未展开。08 把 METR 的 RE-Bench 说成接近「课上已讲的 AI scientist」,不等于 09 把 Lu et al. 当主文
AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithmsFuture Research Areas 点到(开放式探索、不必每步有标量奖励)
Competition-Level Code Generation with AlphaCodeSelf-Improvement and Deep Research Agents 主文
AlphaCode 2 Technical Report07 主文
Search-o1: Agentic Search-Enhanced Large Reasoning Models07 主文
CodeMonkeys: Scaling Test-Time Compute for Software Engineering01 / 03 点到 Code Monkeys(生成代码再生成单测当 verifier)。站点拼成 CodeMonkeys,是否同一篇 [需要验证]
KernelBench: Can LLMs Write Efficient GPU Kernels?02 用作有完美 verifier 的 CUDA 基准,不是 02 三篇主文之一
Improving Parallel Program Performance with LLM Optimizers via Agent-System Interfaces未展开

G. 记忆 / 长上下文 / RAG 服务

概述明确写了 memory。九讲里 09 把「无限上下文的替代(记忆)」列为开放问题,但下面三篇在已编译摘要里都没有展开。

抽取标题作者/年wiki 落点
Cartridges: Lightweight and general-purpose long context representations via self-study未展开
MemGPT: Towards LLMs as Operating SystemsPacker et al, 2023未展开
CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion未展开

这是站点和 playlist 最大的内容差之一:记忆有书目,没有对应视频摘要。

H. 长程 / 经济 / 综述评测

抽取标题作者/年wiki 落点
Measuring AI Ability to Complete Long TasksAgentic Evaluations and Long Horizon Tasks 主文(课上称 METR 时间视野)。站点标题没写 METR,是否同一篇按主题高度同构,引用前对原文 [需要验证]
GDPVal: Evaluating AI Model Performance on Real-World Economically Valuable Tasks08 主文
DeepScholar-Bench: A Live Benchmark and Automated Evaluation for Generative Research Synthesis08 主文

3. 评分在强化什么

50% 作业 / 50% 研究,不是「听讲座课」。作业三份的主题(self-improvement、multi-step reasoning、tool use)覆盖前半学期的技术积木,但没有单独一份作业叫 evaluation 或 train-time RL——这两块更可能进项目。

时间轴(按抽取日期,未核对原站):

Oct 3   HW1 发布
Oct 10  Project Proposal 截止
Oct 13  HW1 截止 = HW2 发布
Oct 23  HW2 截止 = HW3 发布
Oct 24 / 27 / 31  期中 5–10 分钟展示 + report
Nov 7   HW3 截止
Dec 10  Final project 截止(不能用 late days)
Dec 12  Poster

Proposal 插在 HW1 窗口正中:先定研究问题,再继续交作业。期中展示紧挨 HW2 截止,三天上课日连着做 5–10 分钟报告。Final 不能用 late days,Poster 在 final 后两天——抽取没说 poster 能不能迟交。

Late days 的设计:4 天总量、单次上限 2、final report 禁用、额外每天 25%。25% × 2 天已经是半份作业;再多就不是「缓交」而是实质性失败。政策写明 no exceptions。

4. 站点 vs YouTube 九讲:谁是谁的子集

站点(本 raw)Playlist 九讲
身份大纲 / 日历 / 评分 / 书目视频论证
已抽取到的概述、后勤、34 条标题、评分、late/audit/EdStem01–09 完整字幕
明确有、抽取里没有的教师名、助教名、客座姓名与日期、按讲次的日历行、作业题面
九讲有、站点抽取没列成标题的例如 03 的 Weaver 这个名字、07 的 Search-R1、06 的 GRPO 细节
站点有书目、九讲摘要未展开的ADaPT、Wider or Deeper、Automated design of agentic systems、AI Scientist 全文、Cartridges / MemGPT / CacheBlend、并行程序 LLM optimizer、Monkeys Power (Laws)

整理知识时:机制和数字以九讲摘要为准;截止日期、分组、作业发布日以原站表格为准,不要用本页的抽取日期代替打开网页。补论文原文时,用本页标题去搜,不要只靠字幕口述的短名。

5. 概述里还没被书目接住的承诺

  • multimodal interaction:概述写了,34 条标题里没有明显的 multimodal 论文。
  • autonomous systems in robotics:写在客座应用里,书目没有机器人论文。
  • invited academic and industry speakers:概述承诺了,Schedule 抽取没有客座行。
  • orchestrating AI capabilities:没有单独篇名,可能被 Archon / Automated design of agentic systems / Agent-System Interfaces 覆盖,抽取无法证明。[需要验证]

这些不是编译器该补上的阅读,是抽取缺口。

可操作

  • 要日期、客座、哪一讲读哪篇:打开 https://cs329a.stanford.edu/,不要用本页的扁平列表当课表。
  • 要补论文 PDF:按上表「抽取标题」精确搜索。作者年份只在 raw 写了的那些条上可信;没写的不要猜。
  • 站点标题和课上口头短名会对不齐:Weaver vs Shrinking the Generation-Verification Gap;METR vs Measuring AI Ability to Complete Long Tasks;Code Monkeys vs CodeMonkeys。引用前对原文。
  • 若用这门课当项目地图:选题范围是课上方向 + agent workflow benchmarks;记忆 / 不可验证域 / 评测框架是书目有、视频薄的缝。
  • 旁听不存在。问题走 EdStem 或 office hours,先读文档。
  • late days 先留给 proposal / 作业 / milestone;final report 按 Dec 10 死线排。

术语

在本页的意思
self-improving AI agents能通过与自己、与环境交互持续改进的 agent;本课对象
suggested readings每堂课讨论的指定阅读;抽取里只剩标题,不见「哪一天」
constitutional AI人写原则,模型自评自改(站点把它列为自改进技术,阅读挂在工具讲附近)
verifiers用来挑对错或给过程打分的模型/规则
test-time compute不改权重、推理时加算力
train time scaling with RL用 RL 把能力写进权重
tool use / code / memory给 LLM 接环境、解释器、可读写状态
agentic workflows多步推理 + 规划要跑在上面的那种流程
Homework 1/2/315% / 15% / 20%;练 self-improvement、multi-step reasoning、tool use 直觉
Project Proposal2.5%,Due Oct 10
Midterm presentation + Report10%;5–10 分钟;Oct 24 / 27 / 31
Final project35%,Due Dec 10,禁用 late days
Poster2.5%,Dec 12
late days全学期 4 个,单次最多 2;额外每天罚 25%
project milestonelate policy 允许迟交的项;评分表无独立一行
EdStem课程问答平台
API credits项目开发用的接口额度
Skilling Auditorium上课教室

不确定 / 待验证

  • 教师 / CA 姓名:本 raw 为空。Course OverviewCS329A Self-Improving AI Agents 写了 Aakanksha Chowdhery、Azalia Mirhoseini,那是视频和 collection 页的来源,不是本站点抽取。[需要验证] 以原站 Staff 为准。
  • Grading 每条截止日期在 raw 里出现两次(先「Homework 1 (15%) Due Oct 13」,再单独「Due Oct 13」)。当作 HTML 重复,不是两份作业。日期本身仍以原站为准。
  • Schedule 丢失了讲次、日期、required vs optional。上文按概述主题分组,不是官方课表。
  • project milestone 与 midterm presentation + report 是否同一件事。[需要验证]
  • Poster 是否享受 late days:政策只说不能用于 final project report,没提 poster。
  • Shrinking the Generation-Verification Gap with Weak Verifiers 是否即 03 的 Weaver;Measuring AI Ability to Complete Long Tasks 是否即 METR 那篇;CodeMonkeys 是否即课上的 Code Monkeys。[需要验证]
  • How Do Large Language Monkeys Get Their Power (Laws)? 完整书目信息缺失。
  • 客座名单、假期、第一讲具体日期:抽取没有。
  • multimodal / robotics 是否出现在未抽到的日历行(客座或 optional reading)。[需要验证]
  • 作业三份与三个主题是否一一对应(HW1=self-improvement, HW2=multi-step, HW3=tool use),站点只说三份作业共同覆盖这三个直觉。

相关

来源 raw/collections/cs329a/10-cs329a-course-site.md · 更新 2026-09-04 · confidence: medium