检索知识库

按标题、类型或正文检索

Jikipedia
总目
JikipediaAICS329AAgentic Evaluations and Long Horizon Tasks
Lecture 08YouTube · 75 分钟 · yt:8JAqLnTaZu4

Agentic Evaluations and Long Horizon Tasks

单跳问答的准确率无法描述「能否值守两小时把活干完」。本讲把 agent 评测换成三条尺子:专业人类要花多久(METR 时间视野)、对行业专家的胜率(GDPVal)、综述是否覆盖关键事实且引用可验证(DeepScholar-Bench)。50% 能做和 80% 能做完,是两种产品。

type · source-summarystatus · compiledAIcs329aevalmetrlong-horizon

这是什么

CS329A Self-Improving AI Agents 第八讲,片长约 75 分钟(duration_s: 4518)。课堂开场几乎没人在项目里认真跑 agent 评测;有人用的是多跳问答,有人用雇主内部 Wiki 做问答再喂给 coding agent。本讲要回答的是:相对 chatbot / 单次 QA,agentic evaluation 难在哪。00:00:05 00:00:55

三条工作:

  1. METR 的时间视野(time horizon)——任务长度用专业人类完成时间校准,再问模型在给定成功率下能做多长。
  2. GDPVal(OpenAI 近期基准)——真实、有经济价值的职业任务,对十年以上行业专家的 win rate。
  3. DeepScholar-Bench(Stanford,live benchmark)——生成式研究综述:读一堆论文,写 related work,且引用可验证。讲者自己写论文时一直想把这活交给模型。00:01:38 00:02:19

四五年前「模型能写出任何解释」就算大事;现在要预报经济影响和安全影响。Chatbot、问答、单次从上下文里抽答案的传统基准正在迅速饱和。能力轴问「多长、多复杂的任务」;经济轴问「人类现在在做的活,模型能不能做」。METR 与 GDPVal 都正当,洞察相近,但画出的趋势很不一样。00:02:35 00:03:50

素材:raw/collections/cs329a/08-agentic-evaluations-and-long-horizon-tasks.md

核心要点

  • 通用锚点改成 专业人类要花多久,再叠加可靠性:50% 成功还是 80% 成功。聊天能撑很久,不等于能把一个长任务可靠做完。00:04:48 00:05:18
  • METR 三套任务共约 170 道,从 1 秒到 8 小时:SWAA 约 66 道(1–30 秒原子动作)、HCAST 约 97 道(1 分钟–30 小时的软件/研究工程)、RE-Bench 约 7 道(最长约 8 小时的 ML 研究,接近课上已讲的 AI scientist)。00:05:42 00:06:20
  • 人类基线:约 5 年 经验的熟练从业者,只记成功尝试的完成时间,难度用 几何平均。专家常低估难度——他们已经被「怎样算做成」驯化过,这和模型觉得难不难不必相关。00:11:54 00:12:16
  • 任务越长,模型越难盯住目标。SWAA 成功率偏高;HCAST 从约 0.8 散到 0;RE-Bench 偏低。有论文宣称 RE-Bench 在进步,但按人类耗时它仍是更难的一档。00:12:42 00:13:15
  • 50% 时间视野:2019 GPT-2 约 2 秒;2023 GPT-4 约几分钟(课上后来说到 8 分钟);2025 Claude 3.7 Sonnet 约 59 分钟。拟合叙事:大约每 七个月翻倍。50% 等于把活交给 intern、只有一半时候交得回来。00:13:46 00:14:20 00:15:10
  • 80% 时间视野仍在翻倍,但短一截:课上先读图约 8–10 分钟,随后点名 Claude 3.7 的 80% 是 15 分钟(对 50% 的 59 分钟)。要上岗,缺的是可靠性,不是「偶尔能做一小时」。00:20:27 00:21:02 00:22:11
  • 驱动加长视野的能力:更好的逻辑推理、代码生成、工具使用(ReAct 一类)、少重复、从错误里恢复、记得最终目标和自己走到哪。课堂补充:context engineering、compaction window、复杂题先规划再按新数据 re-plan、用户说「这段不对」就重做、对 codebase 的 memory。00:15:10 00:16:27 00:18:04
  • GPT-4(非推理)与 o1(推理)的失败模式同类:规划差、选错工具、心算/推理错、没搞清成功标准就提前放弃、重复循环。循环在 GPT-4 上很重,o1 上轻一些。论文偏旧,模式仍熟。00:22:41 00:23:51
  • METR 的缺口:脏任务、没有唯一正确答案时更差;SWE-bench 趋势相似,但标注者低估耗时,且模型见过大多数 GitHub 仓库,翻倍时间会被估短;内部 PR 上,没上下文的 contractor 比 maintainer 慢 5–18 倍,模型表现贴 contractor——低上下文的人,不是熟手。00:25:21 00:26:16 00:26:48
  • GDPVal:>10 年经验的专业人士出题;约 9 个部门、GDP 顶部约 5%44 个职业、约 1,320 道任务,开放 gold 集 200 或 220 道在 Hugging Face。O*NET 里计算机/数字任务约 60% 进了集;平均可到约 7 小时,有的要几周;gold 子集平均约 $400/任务;约 70% 要跟参考文件互动;约 89% 被专家评为规定清楚。00:33:26 00:34:01 00:34:39
  • 对专家的 win rate(浅色=胜+平,深色=只计胜):GPT-4o(2024)约 12.4% → 约 25 → 30 多 → Claude Opus 4.1 约 47.6。相对 METR 的指数翻倍,这更像 线性。测的不是同一根轴,不是谁把谁证伪。00:35:38 00:36:22 00:37:17
  • GPT-5 被委派时:约一半任务「能交差但低于应有水准」,约 20% 真比人好,约 29% 差或灾难。人类评分者自己就不一致。试 n 次并按上一轮改:相对无助专家,GPT-5 约 1.6× 成本改善、1.4× 速度;成功子集上仍低于专家薪资的 10%00:39:47 00:40:20 00:41:10
  • 短任务(几小时内)、规定清楚、上下文都写进提示时,模型能做;一抽掉提示里的上下文,win rate 只掉几点,但模型开始不知道该干什么。人在架构问题,模型在执行。评测量的是「聪明且被喂饱上下文的人」,不是「嵌在工作里自己找上下文的人」。00:45:34 00:46:55
  • DeepScholar-Bench:近期 arXiv、PhD 难度、22 个领域、每月用新论文重跑(抗污染:只用某大模型训练截止日期之后的论文)。三轴:知识综合、检索质量、引用可验证性。人类一致性约 70–80%。现有系统 没有一个超过 19%00:53:02 00:53:32 00:55:25
  • OpenAI deep research 写得连贯,但几乎所有模型都漏关键事实;文献重要性一律 <12.5%;DeepScholar base 引用 precision 可到 90%,OpenAI deep research 可验证性更低。即使把「该读的论文」塞齐,关键事实覆盖仍约 50%。没有系统同时擅长综合质量与可验证性。00:55:40 00:56:12 00:57:29
  • 综述类任务在 METR 上大约 30 分钟–8 小时,当前能力约 50 分钟,质量仍可能差(约 50% 成功)——图上看着能做,不等于做得好。2028–2031 的 METR 外推是「约一个月的任务」;GDPVal 的线性胜率和 DeepScholar 的引用缺口会反驳「视野翻倍 = 能干几天几周的真活」。01:01:13 01:06:46
  • 高置信:孤立、规定好的任务,尤其软件工程和 ML 研究(计算机科学家在自动化自己的工作),强模型能写出很整齐的输出,即使细节不全对。低置信:提示里没有的上下文、含糊提示、对抗环境、95% 可靠性、软件/知识工作之外的泛化、从知识库里找出全面且重要的来源并核验。01:04:37 01:05:25
  • Last mile 是数据问题 也是 模型能力问题。法律/金融研究这类宽类采用更快;很窄的任务两边都难。机器人/具身:一批创业公司的假说是 补数据,叠在现有模型上,而不是再堆同一套文本 agent 技巧。01:13:35 01:14:52

机制 / 论证

为什么准确率不够,要用人类时间当尺子

Chatbot 三五年前多轮几次就丢上下文;今天对话可以很长。这只回答了「交互能撑多久」,没有回答「一件有截止条件的活,模型能不能做完、做完有多稳」。METR 把两问绑在一起:任务时长 × 成功率。时长的通用锚是:这件事如果交给该领域的专业人类,要花多久。00:04:32 00:05:04

课堂例子用来对齐直觉:写论文的 literature review 往往数小时,落在 HCAST 或 RE-Bench;核对 BibTeX 是分钟级、偏 HCAST;重构代码库可从数小时到数天,更靠近 RE-Bench,而且必须有人查正确性。00:07:42 00:08:12 00:09:32

METR 怎么从任务走到「时间视野」

流程:收任务并 vet → 人类跑出耗时与主观难度、agent 跑出是否可靠完成 → 用足够多的点拟合 成功率 vs 人类时间 → 读出某模型在 50% / 80% 处对应的时长,再按模型发布日期画趋势。00:06:56 00:07:22

套件里的具体题(用来理解「一秒 vs 八小时」不是修辞):

例子人类耗时量级
找到一个 shell script约 3 秒
Wikipedia 调研偏研究、更长
在仿真输入文件里找并修 bug约 10 分钟
JSON 数据 munging(一种格式转到另一种)中等
实现 CUDA backtesting / 自定义 CUDA kernel,并瞄准性能约 8 小时、可到数十小时

00:11:12

专家少、贵。通常只请少数专家,看 inter-rater / inter-human agreement:差得远就补点,大体一致就往下走。学生问「一个人评 vs 一百次采样的分布」——课上的工程答案是:用一致性决定要不要再采,而不是幻想每人每题都有大样本。00:10:09

50% 的操作定义(Q&A):每个任务多次 agent run,该任务成功率 = 成功尝试的比例;再按视野把点画出来。约 97 道 HCAST 上,并不是「每道题都必须 ≥50%」那种更严的全称量化。某任务 50% ≈ 交卷像抛硬币。01:11:06 01:12:09

50% 视野的指数故事,和 80% 为什么短一截

发布日期为横轴、50% 成功对应的人类任务时长为纵轴:GPT-2 两秒 → GPT-4 八分钟 → Claude 3.7 Sonnet / o1 到数小时量级,课上把 2025 的 Claude 3.7 读成 59 分钟。七个月翻倍。可靠性不高:你把活交给 intern,他只有一半时候干完。00:13:46 00:14:35

80% 才接近「回来时多半是做成的」。灰线 50%、蓝线 80%。2025 最新模型若只看 50% 可以吹到 59 分钟;要 80%,课上先读到仍在几分钟到十几分钟,约 8–10 分钟,随后给出 Claude 3.7 的 15 分钟。差距就是系统层还没做完的可靠性。部署到中等复杂的真活,仍会撞可靠性墙。00:20:12 00:22:11 00:22:27

视野变长,是因为哪些机制真的进了模型

课上点名的能力清单,对应本课前几讲已经铺过的机制:推理变好、代码生成变好、工具用起来(ReAct 等)、减少无意义重复、长任务中必然出现的错步之后能恢复,以及「最终目标 + 现在走到哪」的状态/记忆。00:15:10 00:15:59

课堂把产品层补全:

  • Context engineering:跨时间步把上下文结构搭好,工具才跟得上。00:16:27
  • Claude 撞到上下文尽头时的 compaction window00:17:05
  • Cursor 一类产品用用户日志 / 在线补全反馈改工作流(Claude Code 是否同样回传,课上没钉死)。00:17:25
  • 问题很复杂时,coding agent 会显式规划;执行中再触发 re-plan,减少盲目试错。00:18:04
  • 用户把「这段有问题」贴回去,模型重做——和作业不合格被打回同一结构。00:19:02
  • Memory:对 codebase / 环境的原子记忆,更新先验,下次还在同一仓库里才知道世界长什么样。00:19:32

失败分析(GPT-4 vs o1)把「为什么 80% 上不去」说具体:不会把任务拆步;工具选错;推理/心算出错;重复同一高概率动作(失败了还做);没形成「怎样算成功」就放弃。作业里的自迭代也是同一纪律:先标失败模式,再改循环。00:22:50 00:24:46

METR 量到的是「低上下文的人」

基准永远不完美。METR 的贡献是第一次认真量时间视野。它没解决的:

  1. 脏任务(没有单一正确答案、有复杂度)上更差;若脏是系统的,趋势在不同类别里仍可能类似。00:25:39
  2. SWE-bench:曲线形态像 METR 主图,但标注者低估人类时间;模型又见过大多数 GitHub 仓库 → 相对「完全没见过的仓库」,翻倍时间会被估得更短。00:25:53
  3. 内部代码库 PR:没上下文的 contractor 比 maintainer 慢 5–18 倍;模型从没见过该库,表现贴 contractor。有用,但定位是低上下文外包,不是领域专家。00:26:30

这直接接到后文 GDPVal:真活往往是上下文密集的。你量的若是「把专家脑子里的上下文写进题面之后能不能做」,会高估「嵌在工作里的人」。

GDPVal:问题从「能不能做」换成「对专家有没有赢」

委托给模型,输出够不够好?胜率直接对行业专家。任务来自十年以上经验的专业人士,职业面很宽:房地产、政府、制造、专业/科学/技术服务、医疗、金融、零售、批发、信息(含影视剪辑)。模型已经多模态,所以题面也是多模态;不会门门都强。00:27:40 00:28:16

用来建立直觉的题(全是真职业交付物,不是考试题):

  • 制造工程师:为流水线设计电缆卷筒支架的 3D 模型
  • 金融/投资分析:做竞争格局(偏研究)
  • 注册护士:看组织影像,写会诊报告
  • 影视剪辑:按脚本做 intro reel
  • 客服:给不满客户起草回复邮件
  • 礼宾:一家四口行程
  • 审计:多张采购订单之间的定价不一致
  • 房产经纪:新盘销售手册
  • 康乐:优化 vendor fair 摊位布局

00:29:06

主观,所以指标是 pairwise win rate,不是「唯一正确答案」。学生问为什么医疗侧是 RN / NP 而不是医生、信息科学为什么不写作曲:课上把「模型现在能不能」和「伦理/合规上该不该用」分开;作曲验证太主观,这套题更偏向「交付物是否清楚」。00:32:12 00:32:44 00:33:13

线性胜率在反驳什么

同一张图从 GPT-4o 的 12.4% 走到 Claude Opus 4.1 的 47.6%。有人问:这是不是打脸 METR 的指数?课上的回答:轴不同。指数故事让人脑补「现在一小时 → 接下来几小时 → 再接下来几天」;GDPVal 按职业钉死「几小时 / 几天 / 几周的真活」,可靠性只有那么一点,所以看起来更线性、更现实。00:36:35 00:37:17

模型特长(课上对照,未把「美学那一方」的模型名钉死):一方更强在美学、文档排版、PDF / 表格 / 演示文稿;GPT-5 更强在指令遵循、正确计算、纯文本。失败模式里指令遵循是大头:答应去看参考数据,实际不看,用幻觉覆盖;还有格式错误。GPT-5 的指令遵循错误更少。00:38:18 00:38:45

「可接受但低于应有水准 / 真更好 / 坏或灾难」≈ 50% / 20% / 29%,再叠加评分者不一致——「模型进步」有一部分会被人类之间的分歧吃掉。00:40:00

自改进课的本分:naive 一次,或并行/串行试 n 次、按上一轮修。GDPVal 这张表说,n 次循环在成本和速度上相对无助专家有 1.6× / 1.4×;即便成功,仍远低于专家薪资的 10%。有些职业已经能整段接走,但不是整张职业表。00:40:34 00:41:24

职业切片、短任务、以及提示里写尽的上下文

聚合数字会骗人,要看职业。接近或达到「平均人类专家」(不是该领域最强的人)的:counter and rental clerks、real estate brokers、shipping/receiving/inventory clerks、buyers and purchasing agents、computer and IT managers、software developers。学生立刻质疑「软件开发者的十年经验」:课上认为这里更像仓库维护,而不是工业/机械工程师那种十年手感;软件真正值钱的是把 codebase 吃透。00:42:16 00:43:19

极强的切片:政府行政服务经理、合规官、医疗与健康服务经理、私人财务顾问、客服。零售一线主管、编辑、调查/侦探式研究、新闻分析、批发/制造销售代表也偏强。政府 / 零售 / 批发在部门级接近 parity;按时长,几小时内的短任务更好,更长就下降。00:41:41 00:43:59 00:45:11

把提示里的上下文拿掉:win rate 只低几点,但模型开始不会判断该干什么。真活里,人类把脑子里的上下文写全、剩下是推理和工具调用,模型能做;「该解决什么、上下文怎么用、什么必须进上下文」仍要人编排。和 METR 的 maintainer vs contractor 是同一条缝:有领域知识的人更快;这套评测基本没在量「先去把上下文找齐」。00:45:49 00:47:10

近端含义:专业工作流里 AI 辅助已经在发生;人负责架构、模型执行,再加监督,成本上说得通。要按任务类型换模型,不是一个模型打天下。00:47:27

学生问美元价值可不可靠(「AI 现在能做 10 万美元的活」这类句子)。讲者不以美元为中心:他们打的是 GDP 顶部约 5%;知识工作是高薪区,模型擅长的是 deep research、代码生成、多源信息。基准的贡献是:每个职业里到底哪些任务可量化地交给模型,以前只有叙事,没有任务清单。00:48:02 00:49:44

「模型赢了人」时先看提示:把专家头里的上下文写进提示之后能做,不等于职场里「该优先做什么、资源往哪放」已经自动化。00:50:54

DeepScholar-Bench:知识库任务为什么单独成尺

课堂早先点名要 AI 写 literature review,这里就 benchmark 它。产业原型已经一串:OpenAI deep research、Gemini deep research、Perplexity、Stanford 的 Storm、OpenScholar;作业 3 也做过 deep research agent。仍然难。00:51:34 00:52:19

三轴不是「文章好不好读」:

在问什么
知识综合组织是否连贯,关键事实 / nugget 有没有被写进去
检索质量参考文献是否相关;是否命中重要、高权威来源(citation counts / reference coverage)
可验证性引用是否支撑声称;声称是否有引用垫底(precision vs coverage)

00:53:32

Gold 来自 PhD 认为「这篇综述应该打到的论文」。Related work 不是列书单:你要声称「我的工作和这些论文的差别」,同意一套话题之后,每一句仍要被引用托住。00:59:45 01:00:16

分数为什么低:现有系统总分不超过 19%——和动辄 70–80% 就饱和的基准相反,这里有作业/项目空间。OpenAI deep research 综合写得好,关键事实仍系统性遗漏(好英文 ≠ 好覆盖)。检索「还行」,但全面且重要的来源大家都差,文献重要性 <12.5%。DeepScholar base 可把引用 precision 做到约 90%,OpenAI deep research 可验证性更低。失败不在文笔:找不到全面来源;找到相关文档也认不出奠基论文(只会判断是否相关,不会判断是否重要);检索对了也不会高效抽出关键信息;把完美来源塞齐,关键事实覆盖仍约 50%。没有系统在综合质量与可验证性上同时出色。00:55:10 00:56:34 00:57:51

所以 agent 评测的第三问:不是只有「多长」和「值多少钱」。只要必须去查参考数据,专家头里的奠基文献、抽取、引用的 precision–recall,模型都还没有。

三篇合读,以及每条基准故意没量的东西

研究综述在 METR 尺上是长视野(30 分钟–8 小时),当前能力约 50 分钟,但那个视野上的质量可以仍差。它有经济价值(金融研究等),缺口是多步推理、全面搜集、综合时仍保持可验证、以及从多次工具调用里做 context engineering——作业 3 把多个 agent 调用拼起来时已经碰到。01:01:13 01:02:03

基准是「今天能测的切片」,不是世界:

基准它量了它故意/结构性没量
METR单 agent、自动打分的时长×成功率多智能体;惩罚错误;资源/成本约束;主观打分
GDPVal对专家的胜率、经济任务题面被写得极清楚;one-shot(不能来回改);默认模型里已有隐性知识
DeepScholar-Bench检索 + 综合 + 引用专家头里常驻的来源清单与抽取速度

01:02:56 01:03:36 01:04:11

需要三套指标一起看:时长、经济价值、综合质量;并且仍要拿能做这些活的人来校验。视野变长 ≠ 输出可靠或质量高。01:08:00

课堂收尾:外推、last mile、具身

有人把七个月翻倍比成摩尔定律。课上的拆法:SWE-bench Verified 在编码上确实涨得猛,编码还会继续涨;但大量任务不是「提一个 PR」这种形态,后面会一直难。类比 Waymo:前面容易,最后 20% 难。分布式系统被点名为计算机科学里模型很难做对的一类。01:08:31 01:09:11

讲者自己的工作两年后会怎样:时间线快到一年都难预报。AI scientist(自己提假说、跑实验、走完整环)仍是目标;课上把 AGI 说成「模型能自己训出下一代模型、人不必再在环里」。现在更像 AI co-scientist:知识库强、适合当 brainstorming 搭档,还没到闭环。长尾可靠性的 last mile 极难。01:09:57 01:10:44

计算机科学这门职业不会消失:要从原理上推理,并且给模型喂上下文——模型还不会自己把该干的活找出来。01:13:13

长尾卡在哪:数据 模型能力都有。宽类(法律研究、金融研究)采用更快;非常具体的任务两边都难。机器人 / 具身:一批创业公司的主假说是数据采集,叠在现有模型上补缺口。01:13:35 01:14:52

可操作

给自己的 agent 写评测时,不要只报 pass@1 / 单跳准确率。至少写清:

  1. 人类耗时锚:这题专业人类要多久(秒 / 分钟 / 小时)。没有锚就无法谈 horizon。
  2. 成功阈值:50% 还是 80%(或你真正能上岗的数,比如 95%——课上认为还没到)。两条曲线不要混报。
  3. 失败模式分类:规划崩了、工具选错、推理错、提前放弃、重复循环、答应看参考却不看、漏关键事实、引用不支撑声称。先标失败再改循环。
  4. 上下文条件:提示里是否已经写尽专家头里的东西。若写尽,你量的是执行;若没写,你量的是「自己找活」。少上下文时 win rate 小跌、行为大崩。
  5. 试 n 次:并行采样或按上一轮串行修,是 GDPVal 里已经看见的成本/速度杠杆;把它当成系统,而不是单次生成。
  6. 知识库任务另开三轴:关键事实覆盖、来源重要性、引用可验证性。文笔流畅不能当分数。
  7. 按任务类型换模型:排版/PDF/演示 vs 指令遵循/计算/纯文本,不是同一赢家。
  8. 人机分工:人架构「要解决什么」,模型执行工具调用;把模型当低上下文 contractor,需要的仓库知识自己补。

选题:软件工程和 ML 研究上小时级任务已经有显著进度;last mile、脏任务、内部仓库、具身数据,才是还空着的坑。

术语

意思
time horizon模型在给定成功率(50% / 80%)下,能完成的、以专业人类耗时计的任务长度
SWAA / HCAST / RE-BenchMETR 三套任务:原子秒级、分钟到数十小时的软工/研究工程、最长约 8 小时的 ML 研究
GDPValOpenAI 的经济任务基准;指标是对十年以上行业专家的 win rate
O*NET职业任务分类;GDPVal 主要收其中计算机/数字任务
DeepScholar-BenchStanford 的 live 生成式综述基准(related work + 可验证引用)
win rate成对偏好里模型相对专家胜(或胜+平)的比例
last mile从「能做」到长尾上可靠做完;课上认为极难
contractor vs maintainer无仓库上下文的人 vs 熟手;模型更像前者,可慢 5–18 倍

不确定 / 待验证

  • METR / GDPVal / DeepScholar-Bench 的正式论文题、年份、图表数字,课上是转述;引用前对原文。尤其 59 分钟、15 分钟、7 个月翻倍、47.6、19%、12.5%、90% precision、50% 关键事实覆盖。
  • 80% 视野课上先说约 8–10 分钟,后说 Claude 3.7 为 15 分钟;字幕里还有一句含糊的「five weeks shorter」,未说明是翻倍周期还是视野本身。00:21:02 00:22:11
  • GDPVal 开放集是 200 还是 220 道,讲者两说;gold 任务均价约 $400,以及「cvLancer」上还有更高价任务,名称与口径需对原文。00:34:01 00:34:54
  • 2028–2031「约一个月的任务」是 50% 视野外推,课上自己用 GDPVal / DeepScholar 反驳「因此就能做真的一个月级工作」。01:06:46
  • 50% 成功率的聚合:讲者对「先每题多次,再对 97 题取平均」回答「大致如此」,不是论文方法节的逐行复述。01:12:09
  • GDPVal 里「更强在美学/排版/PDF」的模型名,字幕用 it,没有钉死是 Claude Opus 4.1。00:38:18

相关

来源 raw/collections/cs329a/08-agentic-evaluations-and-long-horizon-tasks.md · 更新 2026-09-04 · confidence: high