检索知识库

按标题、类型或正文检索

Jikipedia
总目
JikipediaAICS329ASelf-Improvement and Deep Research Agents
Lecture 07YouTube · 72 分钟 · yt:Uni9dqyuuDM

Self-Improvement and Deep Research Agents

解往往已经在模型的输出空间里。本讲问的是怎么把它筛出来:竞赛代码的百万级采样(AlphaCode / AlphaCode 2),以及推理中途遇到知识缺口再去检索的 deep research(Search-o1)。

type · source-summarystatus · compiledAIcs329aalphacodesearchdeep-research

这是什么

CS329A Self-Improving AI Agents 第七讲,片长约 72 分钟(duration_s: 4347)。前几讲已经把 test-time 采样、verifier、工具反馈和 train-time RL 铺开;本讲把同一套「搜索空间里有解」的判断,落到两个可交作业的系统:

  1. 代码侧搜索 — AlphaCode(约 2022,自训 encoder-decoder)和 AlphaCode 2(Google,微调 Gemini Pro)。作业 2 的 HumanEval 式采样是简化版;竞赛题才是完整难度。
  2. Deep research 侧搜索 — Search-o1:在大推理模型(large reasoning model)的长链里,按知识缺口触发检索,并在检索工具内部做抽取。作业 3 会用到。课末点到但没讲完的对照是 Search-R1(用 RL 教模型去搜,而不是靠 prompting 闭环)。

素材:raw/collections/cs329a/07-self-improvement-and-deep-research-agents.md

核心要点

  • 本讲两种 search:代码里海量采样再筛;deep research 式、嵌进推理的检索。主线同一句:解在搜索空间里,难的是从模型输出里 curate 出答案。00:00:05 00:00:44
  • 竞赛编程不是 Copilot 式补全一行。输入是题面 + 样例 I/O 契约,输出是一整份能过隐藏测例的程序。比 HumanEval「补全这个函数」更长、更要先读懂题再选算法。00:01:11 00:02:47
  • AlphaCode 发布时(课上说将近四年前)在 10 场比赛里排到参赛者的 top 54%,被讲成第一次展示 AI 能超出窄任务、端到端做竞赛题。00:02:17
  • 自训配方:GitHub 代码约 700GB 做 next-token;微调用 GOLD(高似然 token 加权、低似然降权,提高 precision)以及 value conditioning / prediction。先是 encoder-decoder,AlphaCode 2 再试 decoder-only。00:05:17 00:05:51 00:06:38
  • 每题采 100 万 份程序(一半 Python、一半 C++),随机化题目标签和 rating、高温采样。先用题面自带测例过滤,再按语义等价聚类;Codeforces 不能交 100 万份,所以必须先做 selection。00:06:47 00:08:20
  • 线上:10 场、每场约 5,000 人;假定每题交 10 份,平均排名 54.3,相对近六个月选手大约赢过 28%。跨场次很不稳(课上点到 contest 1623 / 1618 较好,1613 / 1615 差约 20%)。方差来自题是否 in-distribution,也来自 selection 瓶颈。00:09:38 00:10:48 00:12:15
  • 本设定量的是 10@k 不是 pass@k:就算生成了 k(可到 100 万),也只交 10 份。9B < 41B < 41B+clustering;采样从 1k → 10k → 100k → 1M,solve rate 仍近似 log-linear。更好模型斜率更陡(41B vs 3 亿参数)。无限次提交的 pass@k 可到 >40%,只交 10 份大约 30%——selection 吃掉约 10 个点。00:14:01 00:15:26 00:18:06 00:18:38
  • 再采样 10× 若聚类多样性不再增加,coverage 就饱和。把样本砸到万亿量级去翻倍,课上认为不如先把基座做强(AlphaCode 2 那条轴)。00:19:47 00:21:31
  • 失败:用 loss 当 solve rate 的代理很差(一题有很多解);动态规划、constructive algorithms 弱;one-shot 搞不定更难题,需要多步。00:23:06 00:24:22
  • AlphaCode 2 不从头预训练,微调 Gemini Pro;多组超参(难度、tag)得到一族生成模型;另训 scoring model(0–1 正确性,当 reward model)。数据:CodeContests V2(开源)做生成微调,另一份人工加标注的高质量集做打分。采样改成 只出 C++,随机化温度和 metadata。00:25:06 00:26:55 00:28:54
  • 执行测例后丢掉约 95%(不编译或不正确),剩约 50 个候选(转写 “50 case samples”),取最大的 10 个簇,每簇用 scoring model 挑一份再交。00:29:23
  • 100 次采样的 AlphaCode 2 ≈ AlphaCode 100 万次的 solve rate;同为 100 万次时,AlphaCode 2 43%、AlphaCode 25%(约 2×)。对人:AlphaCode 大约赢过 46%;AlphaCode 2 总体约 第 85 百分位(expert / candidate / master 一带);只看 top-2 解可到 99.5%00:30:21 00:30:51 00:38:06
  • 易题不必每次都采 100 万;难题才需要并行多样性。要把推理写进权重:训练里加 CoT / STaR 式 rationalization;复杂题拆子问题加 hint,而不是一次生成完整解;闭环形态接近逐步采样 + 回溯的树搜索。00:41:21 00:43:53 00:44:31 00:45:32
  • 普通 RAG:开头检索一次、整篇塞进提示。复杂题每一步要的信息不同,多步推理上 RAG 会受苦。Search-o1:推理中看到知识缺口(GPQA 链上的 perhaps / alternatively / wait)就发查询,并在工具内部分析文档、只回写相关片段。00:47:08 00:48:44 00:49:46
  • 直接推理和 RAG 的 pass@1 不随文档数上升;Search-o1 可以,因为多文档被当成并行 refinement。GPQA 上物理 / 生物较能打平专家对角线,化学仍有明显空间。多跳 HotpotQA / 2Wiki / MusiQue / Bamboogle 上,标准 RAG 甚至 Agentic RAG 会饱和,Search-o1 常是表上加粗的最高值。01:00:07 01:01:57 01:04:44
  • 模型对错误答案过度自信:约 50% 正确时,聚合 logprob 仍可能报约 80% 把握,且很难被纠正。这被点名为可做课题。01:10:26 01:11:56

机制 / 论证

两种 search,同一句主线

代码域有测试,所以搜索 = 大规模采样 + 执行过滤 + 交之前的 selection。开放域问答没有等价 checker,所以检索必须嵌进推理,并且要把文档压成能继续想的片段,否则上下文被噪声填满。00:00:05 00:46:31

竞赛编程为什么比补全难一个数量级

日常 coding agent 多是补当前这一行,开发者容易接,成功率也高(课上举 Copilot 一类)。竞赛题给你的是自然语言题面和一组输入输出契约:这些输入必须得到那些输出。要做的是端到端写出能过隐藏测例的程序,不是把程序员已经想好的步骤码出来。00:01:11 00:01:55 00:03:16

相对 HumanEval:题面更长、解更长,还要先从 docstring / 题面判断解法。AlphaCode 的历史位置:约四年前、10 场比赛、top 54%,课上把它说成「AI 第一次在这类端到端问题上展示出超出窄任务的泛化」。00:02:17 00:02:47

AlphaCode 流水线:自训时代的百万采样

这是大模型现成可调用之前的工作,所以他们自己预训练,数据和权重后来在 AlphaCode 2 里被替换掉。00:03:50

阶段做什么
预训练GitHub 代码约 700GB,next-token;课上也提到 masked LM loss;初始是 encoder-decoder
微调数据含 CodeContests(竞赛题+解)。GOLD:微调时给高似然 token 更高权重、低似然更低权重,让「更有意义的模式」概率更高,改善 precision。另有 value conditioning and prediction(课上点名,未展开公式)
采样每题 100 万份,半 Python 半 C++;prompt 里随机化 tag / rating;高温,换多样性
过滤只留通过题面自带测例的程序
聚类句法不同、语义等价。另训一个「由题面预测测例输入」的模型,给未见过的题造新输入,用来判断等价
提交只能向 Codeforces 交子集(目标约 10 份/题)。平台比正确性和效率,并跟人类选手排名
内部信号CodeContests 作者集另有 hold-out test,避免只看线上

关键设计:以前几讲的闭环是「模型吐什么就测什么」。这里在执行完整评测之前先做 selection——因为 100 万份交不出去。00:04:43 00:04:59 00:07:26 00:08:20

聚类的意义不是好看,是:你只能交 10 份,交重复解没有用。竞赛题很难,同一语义簇交两次几乎不涨点。00:17:09 00:17:24

线上成绩,以及为什么不同场次差 20%

活评流程:生成 → 用样例测例过滤 → 聚类得到提交集 → 交到 Codeforces。10 场、每场约 5,000 人;每题 10 次提交时平均排名 54.3;相对近六个月选手大约处于赢过 28% 的位置。表上还有 best / estimated / worst ranking。排名同时看对错和效率。00:09:05 00:09:38 00:10:13

学生问:contest 1623、1618 不错,1613、1615 差约 20%,为什么。讲者把问题抛回去,归纳两条:

  1. 题是否落在训练分布附近(不同场次输入不同)。
  2. 大规模采样管的是「有没有正确解」;选出该交哪几份,在不同场次上也可以是瓶颈。存在几乎正确但不完全正确的程序。00:12:15 00:12:36

10@k:coverage 和 selection 必须拆开画

作业 2 用的 pass@k:生成 k 份,全部拿去测隐藏测例,看覆盖了多少题。它量的是采样的 search / coverage。00:14:01

AlphaCode 这条曲线是 10@k:生成了 k 份(可到 100 万)也只交 10 份。它同时量过滤/聚类好不好。没有这一步,你根本测不了隐藏测例上的最终系统。00:14:31 00:14:45

课上读图:

  • 模型:9B、41B、41B+clustering;验证集和测试集都画。
  • 横轴采样预算:10@1k → 10k → 100k → 1M。更大模型一直更好;更多样本一直更好;最后一行 41B+clustering 再好一截。00:15:26 00:16:13 00:16:40
  • 即使过了 selection,solve rate 对样本数仍是 log-linear,和反复采样的 pass@k 同形态。更好模型斜率更陡:紫色 41B 压过底部的 3 亿参数模型。00:18:06 00:18:20
  • 只交 10 份时会被卡住:无限次提交(合成设定)大约 >40%,10@k 大约 30%。过滤和聚类是明确瓶颈。00:18:38 00:19:09

学生:log-linear 若延续到约 1 万亿样本,会不会再翻倍?讲者:让模型变强是比把 k 拉到夸张更省事的轴,AlphaCode 2 会看到同样 100 万预算下高得多的点;基座不够强会先撞墙。若成本吃得消,继续砸样本可以当项目想法。但有一个常被忽略的前提:多样性要随 k 一起涨。聚类就是在量多样性;再 10× 若簇不再变多,就不会再涨。00:19:31 00:20:05 00:21:12 00:21:31

为什么仍是 log-linear?课上指回 Large Language Monkeys 一类推导(Azalea 那讲);本讲要强调的是:过了 selection 这条趋势还在00:22:00 00:22:19

AlphaCode 的收获和翻车点

能靠采样+过滤+聚类拿到高 coverage。他们还反查训练集,生成代码有 novelty,不是在抄现成解——课上称为 OOD 泛化。00:22:52 00:23:06

不 work 的地方:

  • 训练目标是 loss,loss 往往是 solve rate 的差代理(能解这题的程序很多)。
  • 动态规划、constructive algorithms 这类域不强。
  • 百万采样不实用;有时间上限时,必须在生成过程中就给可接受解排序,而不是假设无限次尝试。
  • 更难题需要更多步。one-shot 这一套不够,多步会更好。00:23:17 00:23:48 00:24:22

AlphaCode 2:换基座、换多样性、换打分

约一年后。假说:不要自己预训练,用现成 LLM。这是 Google 的工作,基座换成 Gemini Pro,再为竞赛编程定制。不是只做 prompting,而是微调。00:24:38 00:25:06 00:25:27

三处相对 AlphaCode 的系统改动:

  1. 一族生成模型:微调时改超参(难度、tag 等),把 CodeContests V2 切成不同切片,得到多个中间 AlphaCode 2 模型,专门为了采样多样性。转写里偶尔说成 “AlphaGo 2”,按上下文是口误。
  2. 学出来的 scoring model:不再只靠「句法不同、语义等价」这种启发式。用另一份人工多标注、质量更高的数据,让模型给代码打 0–1 正确性分,当作 reward model,提交前选候选。
  3. 数据升级:生成侧用开源的 CodeContests V2(题和解质量更高、筛过);打分侧用单独的高质量集。00:25:36 00:26:36 00:27:10 00:28:10

采样侧:跨模型分摊预算,但语言从「Python+C++ 对半」改成 只出 C++;温度和 metadata 继续随机化。每份输出在测例上执行,不正确或不编译的丢掉,大约 95% 被滤掉,剩约 50 个候选;再聚成最大的 10 簇,每簇用 scoring model 挑最好的一份去交。评测协议与 AlphaCode 相同。00:28:54 00:29:23 00:30:07

结果(横轴每题采样预算,纵轴 solve rate):

  • AlphaCode 2 到 100 个样本,就达到 AlphaCode 100 万样本的 solve rate。
  • 预算再加大,solve rate 仍涨。
  • 同为 100 万样本:AlphaCode 2 43%,AlphaCode 25%,课上说整系统几乎 2×。归因是更好的基座 + 更多样的解 + 更好的打分,不是单纯把 k 加大。00:30:21 00:30:51 00:31:05

对人百分位:AlphaCode 2 总体大约第 85 百分位(expert 和 candidate / master 之间);AlphaCode 大约赢过 46%;若只取 top-2 解,可到赢过 99.5%。一年内主要靠系统而不是把样本数再翻几个数量级。00:38:06 00:38:51

课堂里拆开的代价问题

学生:95% 浪费在不编译或烂解上,能不能更好采样/提示?课上对照作业 1 的 self-refinement:AlphaCode 是并行搜再聚类;若对已有解收反馈再改,样本数可以降,墙钟时间会升。反馈从哪来,要自己设计。另一条是 train-time RL:模型在训练环里变强,测试时就不必采那么多次。00:31:27 00:32:38 00:33:10

日常 thinking 模型大约几十次采样;课上转写提到 OpenAI「一个月研究员」量级会把采样推到数千到数十万。正确读法是「如何从零搭一个能在输出空间里搜到解的系统」:一族模型生成、另一族打分,已是某种 multi-agent;蒸进一个模型就变成 large reasoning model。00:34:17 00:34:54 00:35:28

Scoring model 为什么不直接吃 CodeContests V2?污染:打分器不该看生成器同一批题,但又需要同分布数据。它学的是「两份解更该选哪份」。两套数据混在一起微调也做得到;多阶段微调若不混入前一阶段数据,后一阶段会忘前面的东西。00:36:20 00:37:16 00:37:39

仍贵、仍偏代码、仍有大量算力死在坏语法上。这是课上明确留下的限制。00:39:04 00:39:18

按题难度改搜索;把推理写进权重

讲者当堂两问。

任务复杂度。 学生:先用一个模型判 easy / medium / hard,简单题从简单题库里多采。讲者澄清:改的是采样侧还是训练侧?回答偏向采样。另一人:简单题可以少采。讲者同意,并接回 test-time compute:简单题用更少样本就能有 coverage,不必每题 100 万;初始解再加几轮 refinement 往往就够。并行海量采样的真正收益,是逼出不同解法,不是把同一份解修到能交。00:40:10 00:41:21 00:42:18

如何把推理嵌进模型。 学生 Geoffrey:在训练数据里加「这题用什么算法」的 hint。更一般的版本:程序员写之前会先想;把这条 chain of thought 写进训练集。或用已讲过的 STaR:先生成解,把答案当 hint,再让模型补推理,把推理嵌进去。00:43:41 00:43:53

复杂题:拆成子问题,给子问题 hint,而不是一次生成完整解。00:44:31

学生追问顺序分解:第一步对了、第二步死了怎么办?讲者:最终要在多步上闭环,形态接近树搜索——先采第一步是否大致对,再采第二步,并允许回溯。有常见解题套路时可以自动化;OOD 模式可能仍要 human in the loop(上一讲的 scientist 式工作)。00:45:10 00:45:32 00:46:06

Search-o1:知识缺口会顺着推理链传播

后半转向 deep research agent。基座是 large reasoning model。作业 3 会用。00:46:55

推理很强,但有知识截止日期:昨天的事权重里没有。长链还会用 perhaps、alternatively、wait 这类词把缺口说出来——课上点名 GPQA 上 especially 明显。缺口若不补,会传完整条链,最终答案的把握被拖低。00:47:08 00:47:28 00:48:13

朴素工具用法:查询 → 搜索 → 文档进提示 → 再生成。这就是 RAG:开头检索一次。问天气也许一次够;多部分的复杂题,推理到一半才知道还缺什么。RAG 相对直接推理通常有提升,但在多步推理上会受苦。00:48:32 00:48:58 00:49:31

Search-o1 两处不同:

  1. 边想边查:看到知识缺口就生成 search query / tool call,单次推理会话里可多轮取文档。
  2. 文档内再推理:不把检索结果整篇倾倒进提示;分析文档、抽出相关 chunk,只把这些片段接回推理链。00:49:46 00:50:07 00:50:19

化学例子:三种接法,三种错法

题:一串反应后,product 3 有多少个碳原子。00:50:40

做法发生了什么
Vanilla 推理遇到不熟的术语就用权重里的猜测往下走。猜错会级联;最终把握低
检索后整篇塞进链(Agentic RAG 的朴素形态)不熟就 web search,把 Wikipedia / 网页塞回去。10 篇文档对模型太长、噪声太多,仍算错(课上对比 product 3 的碳数 10 vs 14
Search-o1同样触发搜索,但在文档里判断哪段有用、抽出相关结构/公式,再干净地接回推理,课上这个例子走到正确答案

人的类比:不是把所有参考文献堆桌上,而是做笔记。00:51:10 00:52:08 00:52:28 00:53:06 00:56:50 00:59:31

学生:模型怎么知道该搜哪个词?讲者:做真实应用时,关键实体往往不该信任权重,而应抽实体再查。00:53:59 00:54:25

Agentic RAG 与「检索工具内部的多步」

Agentic RAG:生成过程中,在不确定的 token 处插入特殊 token,中间夹 search query,检索工具把文档插回推理链。大推理模型是在「想」的过程里调用工具。00:55:05 00:55:25 00:55:39

文档又长又噪。长上下文理解不够时,10–20 篇会把推理打散。Search-o1 的 reason-in-documents 模块:对每篇估相关性,结合当前 query、此前推理、抽出的 chunk,再 append 回提示。抽取发生在检索工具函数内部,不是主推理环外面另贴一层。00:55:56 00:56:16 00:56:39

学生:如何暂停此前推理、如何改错?讲者:假定有 state / memory buffer(当前要答的 search query + 此前推理),幻灯结构里并不显式。00:57:18 00:57:30

学生:能不能只改 Agentic RAG 的提示,让模型先摘要再继续,效果是否等同?讲者:留给作业 3。那种假说等于假定模型在该上下文长度上仍能好好推理。点到近期论文 Agentic Context Engineering:限制来自「上下文里塞得下、且模型还推理得好的东西」;理想是直接吞长上下文,课上说希望年底前更接近。00:58:37 00:58:55 00:59:13

文档数是另一根缩放轴;GPQA 与多跳

图:物理 / 化学 / 生物 / overall,纵轴 pass@1,横轴文档数。直接推理和 RAG:文档变多,准确率不涨。Search-o1:文档变多可以涨——前提是多抓到的文档里真有相关信息,再被摘要进上下文。课上把这叫相对 iterative refinement 的 parallel refinement01:00:07 01:00:25 01:00:51

GPQA(难):把 Search-o1 叠在推理模型上,和人类专家比。先说物理、化学有时能打平甚至超过专家,生物几乎能打。随后纠正读图方式:看对角线(物理学家解物理,不要跨科乱比)。按对角线,物理、生物较好,化学没那么好,化学仍有 headroom。不要读成「已经超过人类专家」,只是在这类题上有竞争力。01:01:05 01:01:57 01:02:33 01:02:51

学生:化学差是否因为公式/结构差一个键性质就变了、难保真?讲者:可能;建议自己在 GPQA 化学分段上测。也可能训练数据弱、偏 OOD。不同科目上模型专长本来不齐。01:03:06 01:03:38

多跳问答特别吃这套。标准 RAG、甚至 Agentic RAG,在 HotpotQA、2Wiki、MusiQue、Bamboogle 上容易饱和、到不了当时 SOTA;Search-o1 在很多行上是加粗最高值。价值是跨多篇文档做多跳,而不只是单次检索。01:04:22 01:04:44 01:04:59

学生问检索的 precision / recall。讲者:可以没取到对的文档;论文主声称是——即使多篇只是松散相关,把它们全部倒进上下文,也是在要求模型做太多。瓶颈被放在「塞进上下文之后怎么推理」,不是先假设检索完美。01:05:18 01:05:35 01:06:01

增益从哪来;Search-R1 没讲

Takeaway:不确定性下降;文档质量和抽出的知识都变好。多轮里先搞清「自己不知道什么」,再构造下一跳搜索;文档放进去后若仍出现不确定词,就再搜。推理链里 perhaps / wait / likely 这类量化不确定的词,在这套做法里明显变少(论文分析了推理链)。01:06:18 01:06:40 01:07:07 01:07:19

搭 deep research:只做 RAG 不够,只 tool-call 把文档抓回来也不够。要多轮,还要能判断留哪一段。大推理模型对「很多文档直接进上下文」缩放差;更大的模型通常更好。01:07:41 01:07:59 01:08:12

Search-R1 vs Search-o1:Search-o1 用 prompting 闭环;Search-R1 用 RL 教模型去搜。本讲时间不够,只留作业外阅读。01:08:29 01:08:45

生成概率和正确性对不齐

学生:1000 次生成的 token 概率和正确性有没有相关?RAG 之后呢?讲者:对输出 token 的 logprob 做有意义的聚合(不要只求和,要用平均或某种几何积)。常见模式是过自信:大约 50% 正确时,仍可能报约 80% 把握。纠正时模型会坚称自己对、不肯改。校准差。有工作做第二遍估置信、或 RL / RLHF 让低置信答案少往外吐;不同实验室行为不同,外人只能看到「幻觉」。01:09:03 01:10:05 01:10:26 01:10:44 01:10:58

观察模式:答案若真对,模型也较常能做对;答案若不对,模型仍可能很有把握。知道自己知道什么,是活跃方向,适合当课题。01:11:43 01:11:56 01:12:15

可操作

  • 代码 agent:把 pass@k(覆盖)和 10@k / 实际可提交多样性分开画。聚类多样性不再涨时,再加 k 是浪费。
  • 采样预算按难度切:易题少采 + refinement;难题才砸并行多样性。不要每题默认 100 万。
  • 95% 废样本是真成本。能执行就先滤编译/测例;有反馈就 self-refine;能 RL 就把能力写进权重,降低测试时 k。
  • Scoring / reward model 不要和生成器吃同一批题;要同分布、比的是「两份里选哪份」。多阶段微调记得混入旧数据,否则忘。
  • Deep research:不要只在开头 RAG 一次。在 perhaps / wait / 不熟实体处触发搜索。检索工具内部先抽取再写回,不要把 10–20 篇原文堆进上下文。
  • 加文档预算前,先确认模型能在长上下文上推理;不能的话,抽取步骤是在买缩放,不是文风问题。作业 3 可以拿「只改提示做摘要」当对照。
  • 过自信可当课题:聚合 logprob、画校准、看错答案上的固执。不要把高 logprob 当成对。

术语

意思
pass@k生成 k 份并全部评测时,至少一份过隐藏测例的题比例;量 coverage
10@k生成 k 份但只交 10 份时的解题率;量过滤/聚类/打分
GOLDAlphaCode 微调正则:高似然 token 加权、低似然降权,改善 precision
CodeContests / CodeContests V2竞赛题+解;V2 开源,AlphaCode 2 用来微调生成模型
scoring model给代码样本打 0–1 正确性的模型,当提交前的 reward model
Agentic RAG推理中途用特殊 token 触发检索,把文档插回链
Search-o1按知识缺口检索,并在工具内抽取相关片段再继续推理
Search-R1用 RL 教模型去搜(本讲未展开)
GPQA课上用来展示推理链不确定词、以及 Search-o1 vs 专家的基准
HotpotQA / 2Wiki / MusiQue / Bamboogle多跳问答基准;RAG / Agentic RAG 易饱和

不确定 / 待验证

  • 「50 case samples」:滤掉 95% 后的剩余量。若预算是 100 万,5% 应为约 5 万;50 更像较小预算下的剩余。可能是 50k 的转写。00:29:36
  • AlphaCode 的 top 54%、平均排名 54.3、赢过近六个月 28%、后来又说赢过 46%——来自不同幻灯,不要合成一个数。
  • GPQA 化学:先说物理/化学有时超过专家,后来说看对角线时化学明显更弱。以「有竞争力、化学仍有空间、不是已经超过人类专家」为准。01:01:25 01:02:33
  • 碳原子例子是 Search-o1 的演示,不代表该系统已解决化学推理。
  • Search-R1、Agentic Context Engineering 只点名,细节以论文为准,本讲没讲。
  • 「OpenAI 一个月研究员」的采样规模来自课堂转写,原文含糊,不要当官方数字。
  • GOLD、value conditioning 的公式与论文原名,课上未展开。

相关

来源 raw/collections/cs329a/07-self-improvement-and-deep-research-agents.md · 更新 2026-09-04 · confidence: high