Long-horizon agent evaluation
用「专业人类要花多久、模型以多高成功率做完」来度量 agent,而不是单跳准确率。
一句话
50% 能做和 80% 能做完,是两种产品。
当前理解
Chatbot 能撑很久的对话,不等于能把一件有截止条件的活可靠做完。第一讲把长程评测放在课的主轴末环;第八讲换成三条尺子 Agentic Evaluations and Long Horizon Tasks。
METR 时间视野。 任务长度用专业人类完成时间校准,再读模型在 50% / 80% 成功率处对应的时长。三套任务共约 170 道:SWAA 约 66 道(1–30 秒原子动作)、HCAST 约 97 道(1 分钟–30 小时的软件/研究工程)、RE-Bench 约 7 道(最长约 8 小时的 ML 研究)。人类基线:约 5 年经验的熟练从业者,只记成功尝试,难度用几何平均。专家常低估难度。
50% 视野:2019 GPT-2 约 2 秒;2023 GPT-4 约 8 分钟;2025 Claude 3.7 Sonnet 约 59 分钟。拟合叙事:大约每 七个月翻倍。50% 等于把活交给 intern、只有一半时候交得回来。80% 仍在翻倍,但短一截:课上先读图约 8–10 分钟,随后点名 Claude 3.7 的 80% 是 15 分钟。要上岗,缺的是可靠性,不是「偶尔能做一小时」。驱动加长视野的能力对应前几讲:更好的推理和代码、工具使用、少重复、从错误里恢复、记得最终目标和自己走到哪。GPT-4 与 o1 的失败模式同类:规划差、选错工具、心算错、提前放弃、重复循环。
METR 量到的更像低上下文的人:内部 PR 上,没上下文的 contractor 比 maintainer 慢 5–18 倍,模型表现贴 contractor。脏任务、没有唯一正确答案时更差。SWE-bench 趋势相似,但标注者低估耗时,且模型见过大多数 GitHub 仓库,翻倍时间会被估短。
GDPVal。 十年以上行业专家出题;约 9 个部门、GDP 顶部约 5%、44 个职业、约 1,320 道任务。对专家的 win rate:GPT-4o(2024)约 12.4% → Claude Opus 4.1 约 47.6。相对 METR 的指数翻倍,这更像线性——轴不同,不是谁证伪谁。GPT-5 被委派时:约一半「能交差但低于应有水准」,约 20% 真比人好,约 29% 差或灾难。人类评分者自己就不一致。试 n 次并按上一轮改:相对无助专家约 1.6× 成本改善、1.4× 速度;成功子集上仍低于专家薪资的 10%。把提示里的上下文拿掉:win rate 只低几点,但模型开始不知道该干什么。人在架构问题,模型在执行。
DeepScholar-Bench。 生成式研究综述,22 个领域,每月用新论文重跑。三轴:知识综合、检索质量、引用可验证性。现有系统没有一个超过 19%。OpenAI deep research 写得连贯,但几乎所有模型都漏关键事实;文献重要性一律 <12.5%;DeepScholar base 引用 precision 可到 90%。即使把该读的论文塞齐,关键事实覆盖仍约 50%。综述在 METR 尺上大约 30 分钟–8 小时,当前能力约 50 分钟,质量仍可能差——图上看着能做,不等于做得好。
2028–2031 的 METR 外推是「约一个月的任务」;GDPVal 的线性胜率和 DeepScholar 的引用缺口会反驳「视野翻倍 = 能干几天几周的真活」。高置信:孤立、规定好的任务,尤其软件工程和 ML 研究。低置信:提示里没有的上下文、含糊提示、对抗环境、95% 可靠性、从知识库里找出全面且重要的来源并核验。Last mile 是数据问题也是模型能力问题 Future Research Areas。站点把 robust evaluation 单独成段,不是附录 CS329A course site。
来源
- Course Overview — 主轴最后一环「长程评测」;静态 workflow vs 开放环
- Agentic Evaluations and Long Horizon Tasks — METR / GDPVal / DeepScholar-Bench 主文
- Future Research Areas — 评测已换成时间视野;本讲不再复述数字;last mile
- CS329A course site — 阅读清单 H 组;Measuring AI Ability to Complete Long Tasks 是否即 METR 那篇 [需要验证]
常见混淆
- 视野翻倍不是「智能翻倍」,是特定任务分布上的拟合曲线。METR 的指数和 GDPVal 的线性测的不是同一根轴。
- 职业薪资权重 ≠ 任务难度。GDPVal 打的是 GDP 顶部约 5% 的知识工作切片。
- 50% 成功不是「每道题都必须 ≥50%」的全称量化;约 97 道 HCAST 上是先每题多次再聚合。
- 文笔流畅不能当综述分数。综合质量与引用可验证性没有系统同时出色。
- 评测量的是「聪明且被喂饱上下文的人」,不是「嵌在工作里自己找上下文的人」。
开放问题
- 如何把引用可验证性做成和单元测试一样硬的奖励?DeepScholar 把完美来源塞齐,关键事实覆盖仍约 50%。
- Last mile 课上明确说是数据和算法都有;宽类(法律 / 金融研究)采用更快,很窄的任务两边都难。
- 95% 可靠性课上认为还没到。METR 故意没量:多智能体、惩罚错误、资源/成本约束、主观打分。
- 具身 / 机器人:一批创业公司的假说是补数据叠在现有模型上,而不是再堆同一套文本 agent 技巧。
来源
- Agentic Evaluations and Long Horizon Tasks · source-summary
- Course Overview · source-summary
- CS329A course site · source-summary
- CS329A Self-Improving AI Agents · collection
- Future Research Areas · source-summary
来源 raw/collections/cs329a/08-agentic-evaluations-and-long-horizon-tasks.md · 更新 2026-09-04 · confidence: high