Tool use and execution feedback
让模型的行动碰到真实环境,用环境返回的观察当监督。
一句话
测试和编译器是最好的 verifier;没有环境时只能自我批判。
当前理解
纯 CoT 的步骤来自模型内部,没有外部反馈。Chatbot 问「今天气温多少」只能靠过期内部知识胡编,除非真的发出 search call。课把「验证信号」从模型内部换成环境交互,三条监督来源不同:环境观察、编译器/测试、原则文本 Learning from Feedback with Tools/Code。
ReAct(frozen PaLM + few-shot):Thought 是中间抽象(不改环境),Action 碰环境,Observation 回来再想,顺序是 thought₁ → act₁ → thought₂ → act₂。只行动不如有推理;但它并不总赢过纯 CoT——FEVER 上赢,HotpotQA 上不总赢;和 CoT self-consistency 互相 fallback 才稳定超过。WebShop 上 ReAct 66.6 vs 人类专家 82.1;多步里任一步错,后面全塌(error cascade)。合法动作要当成分类:给出 valid action subset,不要让模型自由发明字符串。不要赌模型知道自己不知道——它们通常 overconfident、校准差,要迫使它调用能落地的工具。
RLEF:写代码 → 跑公开测试 → 把失败栈喂回去再试,直到过或耗尽回合;私有测试才给 PPO 奖励。这就是 coding agent 的内环。只把「错误解 + 执行反馈」塞给 base model 不够;要在 CodeContests 上按回合训练看反馈,才会修错、并泛化到其他代码基准。Llama 3.1 上 solve rate 随采样预算(log 横轴)上升。简单题 binary pass/fail 转得动;难题需要 error trace。Ablation:RLEF 的 wrong output 更少、timeout 更多。整库塞不进窗口时,先搜/摘要再打补丁跑测试(SWE-bench),不要一上来生成全文件。
Constitutional AI:人写 16 条原则 → critique → revision → SFT,再拿 AI 反馈训 preference model 做 RL。单独加修订轮次:无害性升、有用性降;Constitutional RL + CoT 才走到 helpfulness–harmlessness 的最佳 Pareto。自我纠正不只是安全对齐;模型自评常过自信,多模型共识有时更稳。
把 ReAct 推广成 agent,等于手写 workflow。会计 / 金融 / 法律的步骤空间仍高度 domain-specific。搜索空间定义得清(游戏)才能全自动搜;开放环境必须先收集观察。
第五讲把工具接到多步:训练环里现场调工具又慢又会挂,SWiRL 改成离线合成轨迹再 RL。Gemma-2-27B 在 HotPotQA / GSM8K 上造大约 50k 量级数据;GSM8K + SymPy 训完,HotPotQA 从 65 → 71,HotPotQA + 搜索则 65 → 73,并能反过来帮 GSM8K + Python——学的是「分步想、何时调工具」,不是某一把具体工具 Planning and Multi-Step Reasoning。Claude Sonnet 4.5 的 system card 鼓励至少 100 次工具调用:只给工具不够,还要 nudging 才会够勤快地 act。LATS 没处理不可逆动作(付款、下单)。
检索也是工具。普通 RAG 开头检索一次;Search-o1 在 perhaps / wait / 不熟实体处触发搜索,并在工具内部抽取相关片段再写回,不要把 10–20 篇原文堆进上下文 Self-Improvement and Deep Research Agents。长程评测里,工具使用被点名为视野变长的能力之一;GPT-4 与 o1 的失败模式都包括选错工具、重复循环 Agentic Evaluations and Long Horizon Tasks。可验证域(数学最终答案、execution feedback、单测)才容易把工具环折回 Train-time RL for reasoning Train-Time Scaling / Scaling RL。
来源
- Course Overview — agent = 目标 → 行动 → 环境反馈;编码 agent 循环;tool / search 积木
- Test-Time Compute Scaling — 反复采样之外点名 tool use 为后续方向
- Learning from Feedback with Tools/Code — ReAct / RLEF / Constitutional AI 主文
- Planning and Multi-Step Reasoning — LATS 接 ReAct;SWiRL 离线工具轨迹;nudging
- Train-Time Scaling / Scaling RL — execution feedback 是可验证闭环;code→math 帮 tool use
- Self-Improvement and Deep Research Agents — Search-o1:检索当按需工具
- Agentic Evaluations and Long Horizon Tasks — 工具使用驱动时间视野;失败模式含选错工具
- Future Research Areas — 端到端工具工作流;SWiRL 迁移
- CS329A course site — 站点把 tool use / code / constitutional AI 列入大纲
常见混淆
- 工具调用 ≠ agent。没有对观察的反馈环,只是 API wrapper。
- Constitutional AI 的「自我批判」是软环境,替代不了测试。
- ReAct 不总赢 CoT。知识密集任务上要和 self-consistency 互为 fallback。
- 看见错误解本身不会让 base 变强;RLEF 要按回合训练「看见这类反馈之后怎么改」。
- 给了工具不等于会用。Sonnet 4.5 还要在系统提示里 nudging 次数。
开放问题
- 跨域工作流能否不再手写?课上的答案是:搜索空间定义得清才可以;会计 / 金融 / 法律仍要领域知识。
- 非法动作约束应该在解码还是在训练?本讲只要求测试时把合法动作做成分类。
- 不可逆动作(付款、下单)如何接「执行再打分」?LATS 论文没处理。
- Search-R1(用 RL 教模型去搜)对照 Search-o1 的 prompting 闭环,07 没讲完。
来源
- Agentic Evaluations and Long Horizon Tasks · source-summary
- Course Overview · source-summary
- CS329A course site · source-summary
- CS329A Self-Improving AI Agents · collection
- Future Research Areas · source-summary
- Learning from Feedback with Tools/Code · source-summary
- Long-horizon agent evaluation · concept
- Planning and Multi-Step Reasoning · source-summary
- Self-Improvement and Deep Research Agents · source-summary
- Train-Time Scaling / Scaling RL · source-summary
来源 raw/collections/cs329a/01-course-overview.md · 更新 2026-09-04 · confidence: high