Future Research Areas
结课把九讲收成一条弧:verifier 驱动的自改进,走到开放式探索、工具工作流、记忆/检索和评测。然后指出环还没合上的三件事——推理链不够多样、验证会幻觉、训练题还靠人选题——再加一条效率轴:多数真实查询其实很简单,intelligence per watt 会把流量从云端赶到本地。
这是什么
CS329A Self-Improving AI Agents 第九讲(结课),片长约 68 分钟(duration_s: 4062)。Aakanksha Chowdhery 先做学期回顾,再讲三篇「自改进还差什么」的论文;Azalia Mirhoseini 后半讲 intelligence per watt(IPW) 和本地推理。客座(post-training、多模态 agent、机器人、推理、符号方法)只点到,不当主线。
本讲不引入新的完整算法课,而是把已讲过的环拆成三个还没做完的瓶颈,再问:自改进变贵之后,智能按瓦特怎么算。
- Multi-agent finetuning — 单模型合成数据会模式崩塌;从同一 base 微调出多个 generation / critic agent,把多样性「免费」做进生成端。
- DeepSeekMath-V2 — 定理证明不能只看最终答案;加 meta-verifier,检查 verifier 指出的问题是否真的存在。
- 模型自己出题(问答里点名为 Absolute Zero)— 在可执行的编码范式里,同一模型既提出任务又求解,打破「专家选题」的数据墙。
- Intelligence per watt — 与 Professor Ray、John Hennessy 等合作;问本地小模型能吃掉多少真实流量。
素材:raw/collections/cs329a/09-future-research-areas.md。
核心要点
- 前半学期的主循环:test-time scaling + train-time scaling,根本环由 verifier、奖励、RL / 搜索驱动,主战场是数学和代码。00:00:05
- 然后是 open-endedness:不每步都靠标量奖励,只要探索空间可定义就让模型去逛;课上点名 AlphaEvolve 一类。00:00:45 00:01:02
- 再往后是端到端工具工作流;多步真实任务还要知识库,于是出现检索和记忆。规划、多步推理、下一代评测是同一条路上的能力。00:01:22 00:01:35
- Agent 是 LLM 的推广:有目标、与环境交互、收集反馈、纠正步骤。当前多数场景仍是人手写 workflow(编排 LLM、verifier / LLM-as-judge、工具调用、并行搜索);coding agent 开始出现「工作流自己往前开」的迹象。00:02:25 00:03:03 00:03:34
- 自改进要同时有 任务生成、解答、验证。课上把下一步收成三问:推理链如何保持多样、验证如何不靠人类专家、训练题如何不再静态由人挑选。00:05:17 00:05:38 00:05:56
- 单模型合成数据(rejection sampling、STaR、带推理链的迭代 SFT)几轮到几十轮就会停:同一 LLM 即使高温,对同一批 prompt 的回答仍然长得像。预训练数据之所以多样,是因为它是人类在很长尺度上写出来的。00:07:22 00:07:45 00:08:13
- Multi-agent finetuning:多个 generation agent 出多样初解,critic agent 评估/修订;生成端先多样,再辩论、汇总、多数票,等于「免费」的 majority vote。生成器从同一 base微调。单 agent 微调准确率崩或不再涨;多 agent 在 MATH 上能连涨,并向邻近的 GSM8K 迁移。Llama 对这套更敏感。具体分数课上没念。00:08:47 00:10:36 00:13:11 00:13:50
- 现有 RL 默认「最终答案对上 ground truth」就给奖,已经把 AIME 一类基准打到饱和;但答案对 ≠ 推理对。定理证明要逐步严格推导。LLM 常写出数学上无效的证明,再被问「这证明对不对」时会把错的判成对——LLM-as-judge 在这里失灵。PRM 又很难建。00:15:47 00:16:13 00:16:33
- DeepSeekMath-V2:人在没有参考解答的情况下标证明里的问题,再训 verifier;上面再加 meta-verifier。八轮迭代里 pass@1 的 proof score 继续爬;best@32 在 IMO shortlist 2024 上 proof score 接近 42%。基座是 DeepSeek-V3 系。仍限于验证相对容易的域。00:17:54 00:20:15 00:20:47 00:22:26
- 第三篇:同一模型既出题又解题,目标是不再依赖人类 prompt。编码域里用 deduction / abduction / induction 三种可执行任务;proposer 奖励是「中等难度」(solver 成功率 = 0 则奖 0,否则
1 − 平均成功率)。无人类 curated prompt,编码基准上称 SOTA,并超过用「数万条专家样本」训出来的模型;只在自提出的代码任务上 hill-climb,数学基准也涨。更大模型吃这套飞轮更明显。00:23:43 00:27:13 00:29:48 00:31:23 - 与 SWiRL 同构:模型在 A 任务上造的合成数据,也能抬 B 任务。SWiRL 是带检索的多跳问答,后来连 Python / 数学工具调用一起变好,反过来也成立。00:31:49
- 真正难的是不可验证或验证极慢的域:芯片仿真可能要几天拿一个奖励,湿实验要进实验室;创造性写作几乎没有客观奖励,奖励模型稍偏,RL 就会 reward hacking。RL / test-time scaling 需要近乎即时的 verifier——可以等分钟、或许一小时,不能在成百上千步迭代里等几天。00:35:11 00:36:27
- 需求侧:课上称现在是 LLM 的 mainframe 时代——ChatGPT / Gemini 等大模型几乎全在云上跑。Google Cloud 算力服务约 20 个月 1200×;NVIDIA 约 同比 10×;服务当前需求大约要 250 GW 数据中心。00:41:16 00:41:55
- ChatGPT 用户大规模查询里,约 77% 是实用指导、问信息、写作。本地模型在本研究里定义为 ≤20B active parameters。2023 年以来约 2 年,它们能答对的聊天查询比例约 3.1×;当前能覆盖约 88.7%。用户会问更难的题,但主体仍是小模型打得动的简单查询。00:43:12 00:44:13 00:49:19
- 本地加速器显存自 2012 约 126×;MacBook 可以到约 100 GB,量化后能塞很大的模型。Apple M4 Max 的 IPW 比 B200 低约 1.5×(云端芯片为 LLM 极度优化,本地芯片还要兼顾别的负载)。智能效率约 5.3× / 两年:其中 3.1× 来自更好的模型,1.7× 来自硬件(3.1×1.7≈5.3)。00:44:44 00:49:50 00:50:40
- 开放问题:test-time scaling 为什么反复提问会把正确答案问出来、成功轨迹怎么蒸馏回模型、持续学习如何不再是「离线攒经验再异步微调」、高吞吐低延迟的 TTS 系统、本地/云混合路由、以及把能量当成优化目标。00:52:17 00:56:50
机制 / 论证
学期弧:从 verifier 环走到真实工作流
课不是从「再介绍一篇新算法」起,而是先把 agent 定义说回第一讲:LLM 本身往往还撑不起完整目标,所以人把 LLM、verifier、工具、搜索编成 workflow;系统要能多步规划、走错了自己改,并在能力上持续改进——这才叫 self-improving agent。00:02:25 00:03:57
弧的顺序:
verifier + 奖励 + RL/搜索(数学、代码)
→ open-endedness / AlphaEvolve(探索空间可定义,不必每步标量奖励)
→ 工具驱动的端到端工作流
→ 多步真实任务 ⇒ 检索 + 记忆
→ 规划 / 多步推理 / 下一代评测
客座被收在工具/合成数据伞下:符号方法可以给合成数据加结构。Azalia 确认这是「full coverage」,不另开清单。00:01:55 00:02:09
评测本身在第八讲已经换成时间视野和长程成功率,见 Agentic Evaluations and Long Horizon Tasks、Long-horizon agent evaluation。本讲不再复述 METR / GDPVal 数字。
为什么还要三篇论文:环的三处断裂
Test-time 的多样本 + majority vote、train-time 把反馈写进权重,课上都讲过;限制仍是窄域(数学、代码)。要跨域泛化,推理链必须够多样,否则自改进环会在自己的轨迹上过拟合。00:04:57 00:05:17
三处断裂对应三篇:
| 断裂 | 现状 | 本讲的抓手 |
|---|---|---|
| 多样性 | 单模型合成数据几轮后崩 | 多 generator / critic,从同一 base 微调 |
| 验证 | ORM 看最终答案;PRM 难建;LLM-as-judge 会放行无效证明 | 人标「证明哪里有洞」→ verifier + meta-verifier |
| 任务从哪来 | SL 靠人写 traces;RLVR 靠专家出题 | 模型自己出可执行任务,按中等难度做课程学习 |
第二块才是效率:智能按什么计——按准确率,还是按瓦特。00:06:26
Multi-agent finetuning:多样性必须发生在生成端
预训练是互联网尺度数据的压缩;指令微调要人对「好/坏回复」做偏好。替代路径是合成数据:生成候选、滤掉错的(rejection sampling),只对好的做迭代 SFT。STaR 以及「把推理链也写进这个环」都是变体,课上已经讲过。00:07:00 00:07:33
失败模式具体是:用一个 LLM 给一批 prompt 出解,解会非常相似;涨点在几轮或几十轮后停。高温不够。直觉对策是多个「有点专长」的 agent。00:07:45 00:08:27
算法骨架(不必背伪代码,要记住信息流):
- n 个 generation agent 各自给出初解。
- 汇总:用模型摘要,或直接拼接所有回复。
- critic agent 对这套更新后的答案做批判(不是只批某一个 agent)。
- 各 generator 带着「别人怎么说 + critic 怎么说」再生成一轮,形成辩论。
- 再 majority vote、再汇总,轨迹拿去微调 generator 和不同的 critic。
生成器目标:给定问题出好答案。筛选规则:输出与 majority vote 对齐,再拿 (prompt, response) 做 SFT。穷人版:直接换不同模型、不同 prompt,实践中也有人这么干。00:10:36 00:11:00
Critic 的训练数据是轨迹混合物:有的一开始就对,有的是在辩论过程中被纠正。它学的是对照正确与错误,而不只是打一个标量分。00:11:30
看什么图:横轴是微调迭代次数;纵轴是 NLL(课上当作性能代理)或 embedding dissimilarity(越高越多样)。开源模型(必须开源才能微调)上,多 agent 能继续涨,单 agent 会崩或平台;MATH 上多样性在迭代中保持;对 GSM8K 这种邻近域也更高。Llama 比图上另一个开源模型更吃这套。课上强调:这是偏旧的工作,GSM8K 绝对数字不高,论证的是迁移方向不是分数本身。00:12:38 00:13:50 00:14:10
落到自改进:喂回模型的推理链必须多样;多模型/多 agent 是一种生成办法,不是唯一办法。这直接回扣 Generation-verification gap——没有多样的正确样本,后面的 verifier 也无票可投。
DeepSeekMath-V2:验证器自己会幻觉,所以要元验证
数学题、定理证明通常只看最终结果,配 ORM:对上 ground truth 就算过。第三讲已经问过:推理链是错的,会不会把模型带偏?PRM 难建。00:14:54 00:15:31
RL 用「最终答案匹配」已经让 AIME 等数学基准饱和。定理证明要的是逐步严格推导,最终数字给不了这个信号。更糟的是:LLM 在定量推理语料上训出来,仍会写数学上无效的证明;再让它当 judge,它会宣称这些证明有效。人类专家能看出「下一步并不从前一步推出」或中间有推理缺口。00:16:02 00:16:53
DeepSeekMath-V2 不把赌注押在「再训一个普通奖励模型」上,而是训 verifier / meta-verifier:
- 人不看参考解答,只在证明里标问题。
- 用这些数据训 LLM 去找洞、再改。
- 架构在熟悉的 generator–verifier 环上加第三块:meta-verifier 审查 verifier 的分析是否成立。
- Verifier 按课上说的量表给证明打分(0.5 和 1),再拿去改进 generator;generator 出更难的证明,反过来改进 verifier。
- 一旦「如何发现错误证明」的数据够了,这类标注可以自动化,不再每条都靠人。00:17:07 00:18:06 00:18:35
为什么必须有 meta-verification:verifier(此处是 LLM-as-judge)可能在推理链其实错的时候仍给出「对」的分数,也可能捏造不存在的错误。Meta-verification 问两件事:指出的问题是否存在?分数是否从这些问题推出来?再让专家标这份评价的质量。只加这一块,评价质量就涨。00:18:55 00:19:09
结果(开源、DeepSeek-V3 基座;客座讲过 Gemini 侧的 IMO 版本,本篇是近期开源对照):
- 迭代优化,课上顺口把这类 RL 环说成常建在 TRPO 上(见「不确定」)。
- 评在 IMO 题和 CNML 题(字幕原词)。
- 8 轮,只看 pass@1,proof score 继续爬。
- best@32(32 份证明里挑最好)在 IMO shortlist 2024 上 proof score 接近 42%。00:20:15 00:20:47
洞察:更好的证明应拿到更高验证分;generator 要学会区分高质量证明和有缺陷证明;self-verification 才能让改进环转起来。泛化到别的域,清单是:
- LLM verifier 必须能在没有参考解答时找问题;
- 必须有 meta-verification,压低幻觉出来的 issue;
- 给 generator 额外激励,用故意的、可检查的推理去最大化质量。
验证仍然是瓶颈;这只是在「验证相对容易」的域里把瓶颈自动化。不可验证域后面单独谈。00:21:15 00:22:08 00:22:47
模型自己出题:可执行编码范式里的课程学习
当前栈的数据墙:监督阶段靠人写 reasoning traces;有可验证奖励的 RL 靠专家出问答对——数学要数学家,IMO 要 IMO 专家,编码要强软件工程师。模型一旦开始超过人,专家和题目都会变成限制。00:23:43 00:24:09
这篇「还不太有人用、但很有苗头」的工作把摆锤甩到另一端:不需要外部数据源,不需要人类 prompt,同一个模型既提出任务又解决任务。可行域先选编码,因为环境能跑程序。00:24:30 00:25:03
任务三类,都挂在「程序可执行」上:
| 类型 | 课上的说法 |
|---|---|
| deduction | 生成 program + input,环境执行得到 output(「平常那种出程序再配输入」) |
| abduction | 说和 deduction 类似,也是生成 program 和 inputs、环境算 output;和 deduction 的形式差在哪,字幕没讲清 |
| induction | 从已有 program 采样,生成新 inputs,外加一段自然语言描述该函数;环境执行,判断是否朝正确方向 |
Proposal 阶段按这三类造任务,并用奖励筛选「哪些题值得练」;solution 阶段做验证 + accuracy reward,对模型做联合更新,而不是只更新解题的一侧。00:25:19 00:25:32
Proposer 还被 past-generated examples 条件化(显式写进 prompt),用来保多样性。00:26:43
任务选择的奖励几乎就是课程学习:
- solver 成功率 = 0(完全不会)→ 奖励 0
- 成功率非 0 → 奖励 =
1 − 平均成功率
于是既平凡(成功率≈1,奖励≈0)又不可能(成功率=0,奖励=0)的题都被丢掉,留下「有时会有时不会」的中等难度。模型变强后,proposer 应学会出更难的题。00:27:13 00:27:47
垃圾题防御(编码抽象里才好做):跑 program integrity、看执行是否报错、做 safety check、同一输入多次跑必须得到同一输出(确定性)。通过校验才进训练管线,防止 proposer 黑进一堆无意义任务。00:28:14
缓冲:每个 seed triplet(课上用 identity function 打比方:input、output、program)进 task buffer;proposer 可从 buffer 里采参考;buffer 还记这道题成功/失败多少次。课程在时间上演化。00:28:48 00:29:06
为什么值得兴奋:人确实能写很多代码数据,但终究有墙。这里几乎是在任务层做合成数据。声称:没有人类 curated prompt,编码基准 SOTA,并超过用数万条专家样本训的模型。涌现:复杂度指标随时间上升;环设对时,程序和答案的多样性上升;proposer 在训练过程中出越来越难的题。课上把 proposer 与 solver 说成略带对抗的博弈,但整体互相抬。00:29:22 00:30:13 00:30:28
反直觉迁移:只在自提出的代码任务上 hill-climb,编码和数学基准都强;更大模型相对小模型增益更大。课上说数学侧「其实可以用领域里别的结果解释」,本讲没展开。00:31:04 00:31:34
问答里学生把它叫成 Absolute Zero 论文,并问「环境是不是就是 post-training 的数据」。见本节末尾 Q&A。01:04:00
合成数据会迁移:和 SWiRL 是同一件事
Azalia 把上面的迁移和第五讲的 SWiRL(step-by-step RL + 合成数据)并在一起:模型给自己造训练数据,提升的不只是造数据的那个任务,还会迁移。SWiRL 主任务是带检索的多跳问答;合成数据 + RL 之后,模型在别的工具调用(Python、数学题)上也变好,反过来也成立。另一条重复观察:更大的模型更会吸收这种 data flywheel,也更会泛化——SWiRL 里尤其显在 RL 优化一侧。00:31:49 00:32:35
Aakanksha 收三句话:真泛化需要多样推理链(怎么造仍开放);验证要尽量不卡在人类专家(建奖励模型本身就很难);prompt 侧能被人策展的数据就那么多,必须打破这堵墙。00:33:07
Azalia 加一条可做的研究:把可验证域上的合成数据飞轮推到多远,模型会不会在没有自动验证的域里也变聪明,从而少要甚至不要不可验证域的标注?这是很吃算力的实验。00:34:05
不可验证域:慢仿真、主观评价、把难题拆到模型现在会的粒度
有人问:哪些应用根本不是可验证问题?课上给的不是哲学清单,是延迟和主观性:
- 科学发现;芯片设计里跑几天的仿真,才换来一个奖励;化学湿实验要进实验室看产物。
- RL fine-tuning 和 test-time scaling 需要 verifier 几乎即时;可以等几分钟,或许一小时。若 RL 要成百上千步,不能每步等几天或等人在环里打分。00:35:11 00:35:53
- 真正不可验证的,来自创造性或任何带主观性的度量。创意写作很难写精确奖励;当然可以学一个奖励模型,但模型稍偏,RL / agent 就会 reward hacking。00:36:27
学生问芯片设计、生物这类慢验证,人在怎么做。Azalia:离线攒大量仿真/实验数据,另训一个奖励模型,预测仿真结果,再把这个 RM 塞进 RL 环当 verifier。RM 的泛化是数据量的函数,不准就会出问题。00:37:28 00:38:16
Aakanksha 把问题拉回已经在做的 KernelBench(斯坦福、Azalia 实验室,Test-Time Compute Scaling 用过:CUDA 生成,输出对照即 verifier)。编译能否通过、对不对,有信号;但课堂项目要读 performance profile,在系统变复杂时改那些还没优化的部分——这更难。常见工程办法:模型也许会做单核优化,就把问题拆成子问题,让模型对着知识库和参考解看每一块。她说自己几乎是在描述一个进行中的课堂项目:模型还没到能一口吃下的能力,所以要把题拆到它现在能做的粒度。00:38:32 00:39:17
Intelligence per watt:多数真实查询其实很简单
后半讲换轴。合作方:Professor Ray、John Hennessy,以及「一大队合作者」。看的是模型侧趋势 × 硬件加速器侧趋势:未来推理负载长什么样、需要多大模型、需要什么样的加速器。00:40:28
Mainframe 时代:ChatGPT、Gemini 以及其它大模型几乎全在云上;专有模型根本拿不到权重,开源里更大的那些也还是云上伺候。需求爆炸的数字:
- Google Cloud 算力服务约 20 个月 1200×
- NVIDIA 约 同比 10×,课上说这些数字明确由 AI 驱动
- 服务当前需求大约要 250 GW 数据中心,而且还在炸
- Google 侧处理的 token:字幕记「去年 2 月 160 trillion,今年 10 月 1.3 billion」,并说这是史上增长最快的算力需求之一——两个数方向矛盾,见「不确定」。00:41:16 00:42:35 00:42:56
同一大规模 ChatGPT 用户数据:约 77% 请求是 practical guidance、问信息、写作。这类任务往往不需要最强前沿模型,小的、本地的模型就够。用户会随 chatbot 变强而问更难的题,但分布的主体仍在简单一侧。00:43:12 00:44:13
并行的硬件趋势:2012 至今,本地加速器 GPU 显存约 126×。现在的 MacBook 可以到约 100 GB 内存,量化后能本地放下很大的模型。于是可以问:本地推理能不能把现在几乎全打到 H100 / TPU / GP200 / GP300 上的流量重新分配。00:44:44 00:45:48
新指标 intelligence per watt:
- 能力:模型能覆盖多少单轮和推理类查询(百分比)
- 本研究的「本地模型」:20B active parameters 或更少
- 效率:在本地硬件上每瓦特能拿到多少有用算力
- 短定义:平均任务准确率 / 完成该任务的平均功耗 00:46:23 00:47:30
实验盘:超过 20 个本地模型(点名 Qwen、GPT-OSS、Gemma3);企业加速器 + 本地加速器;约 100 万 条来自 ChatGPT 的查询,外加推理基准 Natural Reasoning、MLU Pro、SuperGPQA;指标包括准确率、能量、延迟、算力。这批跨模型、跨硬件的度量会开源。00:47:54 00:48:24
三条发现:
- 本地模型已经很能打,而且涨得快。2023 年以来约两年,能解决的聊天查询比例约 3.1×;在前面那类查询上现在约 88.7%。00:48:49
- 本地加速器效率落后企业芯片。例:Apple M4 Max 的 IPW 比 B200 低约 1.5×。B200 为语言模型极度优化;M4 还要跑别的负载。设计这些本地芯片时,并没有假定 LLM 会在本地跑,芯片主战场仍是云端。00:49:35 00:50:21
- 智能效率约 5.3× / 两年 = 更好模型的 3.1× × 硬件变省的 1.7×。两条趋势一起,指向越来越多流量可以在笔记本、未来在手机上解决。00:50:40 00:51:32
还没做完的研究
在 IPW 观察和整学期内容之上,Azalia 列的开放问题分成两簇。
自改进 / post-training 簇 00:52:17
- Test-time scaling 的原理,以及合成数据飞轮。 现在的做法是 RL:采数据,再微调。但还不懂:为什么同一问题问一遍又一遍,正确答案会冒出来?把成功轨迹蒸馏回模型的最佳实践是什么?从飞轮到持续学习有一条很清楚的缝。
- 持续学习。 人是边做事边变强;模型多半是 agent 先离线攒经验,过一段时间再微调,不是边走边学。如何把正/负经验和解题过程更自然地写回模型,而不是当前这套异步「造数据 → 微调」?
- 高吞吐、低延迟的 test-time scaling 基础设施。 反复采样、对上一代做来回修订、工具调用,和主流 chatbot 的单轮来回不是同一种负载。系统/推理优化会越来越值钱。实验室做过一些(字幕作 hydrogen token SRS)。预训练本讲几乎没碰(Aakanksha 是预训练专家,课的重心在 post-training 和 TTS);中间那截——微调、在线学习、TTS 连起来的合成数据飞轮和持续学习——被认为是刚放开的时代。00:55:46 00:56:25
IPW / 效率簇 00:56:50
- 混合推理 serving:按需要和复杂度,在本地模型和云端模型/加速器之间平滑切流量。
- 面向本地加速器的新架构和 kernel,做节能推理;相对云端加速器,这里被关注得少得多。
- 能量会变成最值钱的资源。 IPW、把能量/功率测准、为它优化,今天还很少被当成优化目标,预期会变主流。
Q&A:记忆、改权重、环境算不算数据
持续学习是做长期记忆,还是改 LLM 本身? 00:59:22
Aakanksha:长期记忆是人的类比;但在那之前,多步推理里从成功/失败里学、把技能写进权重或一部分权重、「学会学习」,这些能力现在都没有。机器人何时能看视频学会做事,而不是被喂大量任务演示?00:59:54 01:00:23
Azalia:in-context learning 是一条路。思想实验:假如有无限上下文,模型能完美访问其中每一段并从中学习,持续学习也许就解决了——正负例子全塞进上下文,同时记住、同时推理。现实没有这个。即使到一百万、几百万 token,模型对 ICL 数据的推理能力也会衰减。课上讲过的 cartridges 是另一条:不改权重、不微调,把长期上下文塞进 activation / KV cache,抬有效上下文。持续学习不必等于微调;把有效上下文大幅拉长,本身就是长期记忆的一种做法。01:00:45 01:01:35 01:02:18
跟问:实践上不断改权重容易,还是改 memory store 容易?看应用。知识库:最简单的版本是维护一个数据库,让 LLM 学会去查,那就改库。但若要教的是在新域上推理,旁边挂一个记忆系统往往不够,改权重更对口。机器人、跨 embodiment 泛化(周一那次课)是技能迁移:只加记忆、不改权重,不会发生。01:02:37 01:03:24 01:03:37
Absolute Zero 里环境像是 post-training 的数据。有没有论文让 agent 自己创造环境? 01:04:00
窄智能时代可以为游戏建仿真,当玩具任务的环境。现在环境重要,是因为它们是真实世界任务的 proxy。与其找一篇「agent 自己造环境」的论文,不如问:你要表示的是哪一组任务?若容易仿真,用 agent 造还是用软件造都直截了当。真正的问题是:它是不是模型与真实世界交互、拿反馈的合理代理。游戏的探索空间有限,更容易用代码表示。01:04:19 01:04:51
收场:领域变得很快,现在讲的东西下次开课就会变成历史;但基本技术仍值钱,新东西还是叠在上面。两人说备课过程中自己也在学,因为题目太新。01:05:52 01:06:12 01:06:33
可操作
- 选题先问三件事是否至少改了一件:多样性(推理链从哪来)、验证(含 meta-verification,或不靠人的自动验证)、任务从哪来(模型出题 / 课程学习)。不要再做一篇「对 MATH 再采样一次」除非 verifier 或多样性变了。
- 自改进环按课上的三件套检查:任务生成、解答、验证。缺验证就只能在可执行域转;缺多样性就会在自己的轨迹里过拟合。
- 可验证域上把合成数据飞轮推满,再测不可验证域有没有零标注增益——课上点名这是很吃算力、但值得做的实验。
- 慢仿真(芯片、湿实验):离线数据训 surrogate 奖励模型,当 RL 环里的 verifier;同时记住 RM 不准会直接污染训练。
- 模型还吃不下的硬问题(KernelBench 从「编译通过」到「读 performance profile 改未优化部分」):拆成它现在会的子问题,配参考解和知识库,不要幻想端到端一口吃。
- 产品流量:先量查询复杂度。主体若是指导/信息/写作,优先考虑 ≤20B 本地模型 + 难查询再上云的混合路由,而不是默认前沿大模型。
- 持续学习先分清要迁的是知识还是技能:知识更新库;新域推理、机器人跨本体,改权重。不要假定「加一个 memory 模块」等于学会学习。
- Agent 自造环境:只在仿真是真实反馈的合理 proxy 时有意义;游戏那种有限空间容易,开放真实世界不容易。
术语
| 词 | 意思 |
|---|---|
| open-endedness | 探索空间可定义时,不靠每步标量奖励的开放探索;课上点名 AlphaEvolve |
| rejection sampling | 生成许多解,滤掉错的,只对留下的做 SFT |
| multi-agent finetuning | 多个 generation / critic agent(常从同一 base 微调)用辩论+多数票制造多样推理链 |
| meta-verification | 检查 verifier 指出的问题是否存在、分数是否从这些问题推出;用来压幻觉 issue |
| self-verification | DeepSeekMath-V2 把 generator–verifier–meta-verifier 收成可自动转的环 |
| proof score | 该讲读 DeepSeekMath-V2 图时用的证明质量指标;pass@1 与 best@32 分开报 |
| proposer / solver | 同一模型的出题侧与解题侧;奖励对准中等难度,形成演化的课程 |
| task buffer | 存放 seed triplet(program, input, output)及成败计数,供 proposer 采样参考 |
| intelligence per watt (IPW) | 平均任务准确率 / 完成该任务的平均功耗;本地模型在本研究里 ≤20B active parameters |
| synthetic data flywheel | 模型生成数据再训练自己,并可向未当作主任务的域迁移 |
| cartridges | 不改权重,把长期上下文打进 activation / KV cache,抬有效上下文 |
| Absolute Zero | 问答里对学生点名的「模型自己出题」那篇;正文讲解时没报完整书名 |
不确定 / 待验证
- 结课引用的论文完整书目、作者、venue,字幕里没有。Multi-agent finetuning 只以方法名出现;第三篇只在问答里叫 Absolute Zero。以 slide / 课程阅读清单为准。
- DeepSeekMath-V2 的 verifier 量表课上说「0.5 和 1」,未说明是 {0, 0.5, 1} 还是只有两档。
- 「CNML problems」为字幕原词,可能是竞赛/基准缩写被听错。[需要验证]
- 课上说该类 RL 环「常建在 TRPO 上」,紧接着是 DeepSeek-V3 基座。第六讲同类工作用的是 GRPO;此处可能是 ASR 把 GRPO 听成 TRPO。[需要验证]
- Google token 量「去年 2 月 160 trillion → 今年 10 月 1.3 billion」与「史上增长最快」在方向上冲突,几乎可以肯定是数量级或单位听错。只保留两个原数字,不把增长倍数写进正文。[需要验证]
- 推理基准「MLU Pro」按口型/字幕记录;语境是和 Natural Reasoning、SuperGPQA 并列的推理基准,是否即 MMLU-Pro 未在本讲核对。
- 「hydrogen token SRS」是 Azalia 实验室 TTS 系统工作的字幕转写,正确论文名未给出。
- Abduction 与 deduction 的形式差,本讲口播几乎说成同一件事;不要用库外的 Absolute Zero 论文定义来补。
- Multi-agent finetuning 在 MATH / GSM8K 上的绝对准确率、用的是哪两个/三个开源模型(只明确 Llama 更敏感)、embedding dissimilarity 的具体数值,课上都没念。
- 「超过用数万条专家样本训练的模型」未给对手模型名和基准表。
- Professor Ray 的全名本讲未说。
- 250 GW、1200×、10×、126×、100 GB、3.1×、88.7%、5.3×、1.7×、1.5×、77%、20B、42%、8 轮、best@32 均按口播记录,未对照 slide。
相关
- CS329A Self-Improving AI Agents
- Test-time compute
- Generation-verification gap
- Process reward models
- Tool use and execution feedback
- Train-time RL for reasoning
- Long-horizon agent evaluation
- Test-Time Compute Scaling
- Robust Verification
- Planning and Multi-Step Reasoning
- Train-Time Scaling / Scaling RL
- Agentic Evaluations and Long Horizon Tasks
来源 raw/collections/cs329a/09-future-research-areas.md · 更新 2026-09-04 · confidence: high