CAST:面向可靠长程工具调用智能体的批评感知监督训练框架 CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents
将轨迹级成败转化为动作级批评监督,让8B小模型的多试次可靠性超过120B大模型
前置知识
pass^k 可靠性指标
τ-Bench 提出的跨试次可靠性度量:对每个任务独立采样 $n$ 次、成功 $c$ 次,则 $\text{pass}^k = \mathbb{E}_{task}\left[ \binom{c}{k} / \binom{n}{k} \right]$,即随机抽 $k$ 次执行全部成功的概率。它惩罚“偶尔成功”的不稳定智能体,$k$ 越大对一致性要求越高。
本文的核心主张是提升跨试次可靠性,所有主要结论都围绕 pass^1 与 pass^4 的差距展开,不懂这个指标就无法理解为什么 4B 模型能“赢”120B 模型。
Actor–Critic 与语言批评模型
强化学习中的 actor-critic 架构由策略(actor)负责输出动作、价值网络(critic)负责评估动作好坏。语言智能体领域出现了“文本批评”变体:critic 不输出标量价值,而是生成自然语言的理由与判断,用于指导 actor 修改行为,如 Reflexion、Natural-Language Actor-Critic。
CAST-Critic 本质上是一个被显式监督训练出来的语言版 critic,论文反复对比它和“直接用提示词让 GPT-4.1 当 critic”的差别,这是理解全文贡献的主线。
拒绝采样微调(RFT)
最简单的基于成功信号的优化方法:让模型对任务集采样大量轨迹,只保留任务奖励为 1 的成功轨迹,再用监督微调(SFT)在这些轨迹上训练模型。它不需要奖励模型或复杂的 RL 算法,但监督信号只有轨迹级的 0/1 结果。
RFT 是本文最重要的优化基线,CAST 的增益必须与 RFT 对比才能说明“动作级批评监督”确实比“只学成功轨迹”多给了模型东西。
τ-Bench 与 τ-Trait 基准
τ-Bench 模拟客服场景:智能体与模拟用户多轮对话,须遵守领域政策(policy)文档,并通过 API 工具查询/修改数据库状态,含 Retail(零售退换货)与 Airline(机票预订)两个域。τ-Trait 在此基础上加入人格化用户模拟,扩展出 Telecom 与 Telehealth 两个域,用于测鲁棒性与个性化。
论文所有训练与评测都在这四个域上进行:Retail 作域内训练环境,其余三个域作域外泛化测试,任务量、工具数等细节直接决定实验解读。
部分可观测性与特权信息
智能体在时刻 $t$ 只能看到历史 $h_t$、当前观测 $o_t$ 与工具集 $K$,看不到未来观测 $o_{t+1},\dots,o_T$,也看不到环境的隐藏状态;而评测/标注方可能掌握特权信息 $\Omega$(如真值动作序列)。“用当时可获得的信息做判断”是公平衡量动作质量的前提。
CAST 方法的合法性根基在于:验证器只允许使用步骤 $t$ 的局部上下文 $c_t=(h_t,o_t,a_t,K)$ 判断动作,绝不偷看未来;而训练标注时教师可使用特权信息 $\Omega$,这一信息不对称是全文最精巧的设计。
研究动机
LLM 智能体正被部署到长程、交互式、有状态的环境中(订机票、办退货、电信业务办理等),此时单个错误动作——比如给错误的订单退款——会造成不可逆的任务失败,必须在执行前拦截。这类失败不是每次运行都出现,而是在重复试验中随机暴露:τ-Bench 的数据显示,即使是 Qwen3-32B 这种较强的模型,在 Retail 上 pass^1 能到 33%–35%,pass^4 却跌到 8.2%–13.1%,GPT-OSS-120B 的 Retail pass^4 更是只有 5.9%,说明单次成功率完全不等于可靠性。更棘手的是验证问题:即便前沿模型也难以解释长而缠绕的轨迹中某个动作为什么错,尤其当错误由领域专属政策决定时。现有补救手段各有硬伤:基于提示词的批评智能体(如让 GPT-4.1 当 critic)严重过度悲观,把 46.8% 的正确动作也标记为有问题,把 Qwen3-32B 的平均 pass^4 从 11.5% 反而拖到 3.4%–6.3%,让智能体陷入不必要的修改循环;Reflexion/Self-Refine 这类自修正框架的批评是事后的,且未形式化“动作发生时智能体到底知道什么”;GRPO 等 RL 方法降低了推理开销,但单次成功率的提升不等于跨试次可靠性;文本版 actor-critic 通常联合优化 actor 和 critic,critic 得不到足够的监督,不知道中间动作为何不可靠。
本文的目标是本文的目标是把稀疏的轨迹级成败信号(任务 reward $Y(\tau)\in\{0,1\}$)转化为密集的、动作级的结构化验证监督。具体而言:训练一个批评模型 CAST-Critic,它能在动作执行之前、仅利用该时刻可得的上下文(历史、观测、候选动作、工具集),判断动作是否有效并给出结构化理由;再把这个批评模型作为“标注器”去为新的交互提供细粒度验证反馈,构造批评增强的训练数据,优化出策略模型 CAST-Policy。最终希望同时提升 pass^1(单次成功率)与 pass^4(跨试次可靠性),在域内 Retail 和域外 Airline/Telecom/Telehealth 上都有效,并且与 IRMA、FAMA 这类需要大参数辅助模型的重型 agentic 框架相比,显著降低 token 消耗与推理延迟。
与已有工作不同的是,本文的独特切入是“带信息约束的动作级验证形式化 + 教师-学生信息不对称”。与 Reflexion、Self-Refine 的事后批评不同,CAST 把验证严格限制在动作发生时刻的局部信息 $c_t=(h_t,o_t,a_t,K)$ 上,正式定义了动作验证器 $g(h_t,o_t,a_t,K)\rightarrow(e_t,y_t)$,杜绝了批评者偷看未来观测或真值意图的“作弊”行为——这使批评信号在部署时真实可得。与联合优化 actor-critic 的方法(NLAC、非对称 Actor-Critic)不同,CAST 分两阶段解耦:先用拥有特权信息 $\Omega$(如真值动作轨迹)的教师验证流程离线合成高质量理由,训练好 critic 后再让它反哺 policy。与 RFT 只知道“哪条轨迹成功”不同,CAST 的监督信号包含“哪一步、因何类错误(幻觉/政策违规/工具误用)有问题”的解释。这种把稀疏结果蒸馏成可解释动作级监督的思路,是论文区别于测试时框架与重型 RL 流水线的核心位置。
核心方法
直觉上,长程任务中的轨迹大部分步骤其实是对的,失败往往由个别“当时看起来合理”的动作触发级联且不可逆的后果(例如未确认就执行换货)。所以与其只优化最终结果,不如在每个动作执行前做一次“可解释的安检”。技术路线分三阶段(对应 Figure 2):第一阶段采集轨迹——用教师策略(Qwen3-32B,ReAct 模式,温度 0.7)在 τ-Bench Retail 训练集的 500 个任务上各跑 5 次,由 Qwen2.5-72B-Instruct 扮演用户,得到成败混合的经验缓冲 $B$;第二阶段构造标注——对 $B$ 中每条轨迹的每个动作 $a_t$,运行多智能体验证流程 $V$(此阶段允许使用特权信息 $\Omega$),生成结构化理由 $e_t$ 和二值标签 $y_t$,得到数据集 $A_{critique}=\{(h_t,o_t,a_t,K,e_t,y_t)\}$,共 2500 条批评增强经验;第三阶段两步训练——先微调出 CAST-Critic $C_\theta$,再部署它为新一轮交互提供验证反馈,只保留任务成功的批评增强轨迹去 SFT 出 CAST-Policy $\pi_\phi$。推理时 CAST-Policy 既可与 CAST-Critic 搭配做显式批评引导的交互,也可作为独立的高效工具调用智能体运行。
核心创新有三点。其一,把“动作验证”形式化为信息受限的函数 $g(h_t,o_t,a_t,K)\rightarrow(e_t,y_t)$:$y_t$ 表示动作在该时刻可得信息下是否有效,$e_t$ 是结构化理由;验证绝不使用未来观测 $o_{t+1},\dots,o_T$,这保证了训练出的批评能力可以无损迁移到部署时刻,而 Reflexion 类方法做不到。其二,教师-学生的信息不对称设计:标注时教师验证器 $V(h_t,o_t,a_t,K,\Omega)\rightarrow(e_t,y_t)$ 可以利用特权信息 $\Omega$(如真值动作轨迹),从而给出学生仅凭 $c_t$ 无法判定但可以学会的可靠标签。其三,把动作失败分解为三类可检查的成分——幻觉 $f_{hall}$(参数无依据)、政策违规 $f_{domain}$(违反领域规则)、工具误用 $f_{tool}$(选错工具),并定义 $y_t=\mathbb{1}[\neg f_{hall}\wedge\neg f_{domain}\wedge\neg f_{tool}]$,用多智能体流水线分别核查。与 RFT 的本质区别是监督粒度:RFT 只有“轨迹成功与否”,CAST 还有“哪一步、为什么错”;与 prompted critic 的本质区别是校准:CAST-Critic 是被训练过的,知道什么时候不该拦。
方法步骤详情
完整流程如下。第一步轨迹采集:输入 500 个 Retail 训练任务,Qwen3-32B 以 ReAct 模式、温度 0.7 每任务采样 5 条轨迹(Qwen2.5-72B 模拟用户),输出经验缓冲 $B$。第二步代理式验证标注:对每个动作 $a_t$,规则提取 agent 从政策文档中检索与当前观测相关的条款,工具提取 agent 圈定本步候选工具;随后幻觉检查 agent、政策违规检查 agent、工具误用检查 agent 并行评估(提示词明确规定只能使用 $t$ 时刻前出现过的信息);orchestrator agent 汇总三个检查结果,产出最终 $(e_t,y_t)$。标注模型用 Qwen3.5-27B 与 Qwen3.5-122B-A10B 各试过,后者质量更高。第三步批评模型学习:微调 Qwen3-4B/8B 得到 CAST-Critic,输入 $(h_t,o_t,a_t,K)$、输出 $(\hat{e}_t,\hat{y}_t)$,损失为 $\mathcal{L}_{critique}(\theta)=\lambda_{exp}\mathcal{L}_{exp}(\theta)+\lambda_{ver}\mathcal{L}_{ver}(\theta)$,其中 $\mathcal{L}_{exp}$ 是理由生成损失、$\mathcal{L}_{ver}$ 是验证分类损失。第四步批评增强策略优化:再用 CAST-Critic 陪跑 500 任务×5 次收集批评增强轨迹缓冲 $B_C$(历史被增广为 $\tilde{h}_{t+1}=h_t\oplus(a_t,\hat{e}_t,\hat{y}_t)$),筛选 $B^{+C}=\{\tau\in B_C\mid Y(\tau)=1\}$,用 SFT 优化 $\mathcal{L}_{policy}(\phi)=-\sum_\tau\sum_t \log\pi_\phi(a_t\mid\tilde{h}_t,o_t,K)$。第五步推理:策略提议 $\bar{a}_t$,Critic 给出 $(\hat{e}_t,\hat{y}_t)$,接受则 $a_t=\bar{a}_t$,否则按反馈修改后再执行。微调超参:学习率 $5\times10^{-6}$、3 epochs、总 batch 16、AdamW、cosine 调度、最长序列 32768,4 卡 H100 单节点。
技术新颖性
技术新颖性体现在四个维度。验证时机上,区别于 Reflexion(需要终局奖励、事后整段反思)与 Self-Refine(需要成品输出),CAST 在每个动作执行前逐点验证,并且是第一波把“验证者信息集”写进问题定义的工作——$c_t$ 之外的任何信息都不许用。监督来源上,区别于生成式验证器(把奖励建模当下一词预测)与过程监督 RL(用 LLM judge 做回合级信用分配),CAST 用特权信息合成带解释的标签,先独立训好 critic、再用它制造 policy 的训练数据,是清晰的解耦两阶段设计,避免联合优化下 critic 缺乏监督的通病。错误类型学上,幻觉/政策违规/工具误用三分法配合专用检查 agent,使理由 $e_t$ 结构化、可检查、可被 actor 执行(Figure 9 显示批评后纠正率达 82–88%)。工程与评测对齐上,论文的目标函数明确对准 pass^k 可靠性而非单次成功率,并证明 4B/8B 的批评家能同时压低误报(46.8%→11.4–13.6%)并保持检出,这与“直接提示前沿模型当 critic 会帮倒忙”的现象形成鲜明对照,也解释了为什么小模型组合能超过 120B 大模型。
实验结果
实验覆盖 Retail(域内)与 Airline、Telecom、Telehealth(域外), backbone 为 Qwen3-4B/8B。发现一(域内可靠性,Table 1):Policy-4B 对 Base-4B 提升 pass^1 18.9 点(7.2%→26.1%)、pass^4 10.4 点(6.1%→16.5%);与 RFT-4B 的 pass^1 基本持平(26.1% vs 27.6%)但 pass^4 高 4.3 点,说明批评监督带来的正是“跨试次可靠”这一 RFT 给不了的东西;Policy-8B 对 RFT-8B/Base-8B 分别 +2.4/+15.9 点 pass^1、+2.6/+9.6 点 pass^4。发现二(小胜大):Policy-4B/8B 的 Retail pass^4 分别比 Qwen3-32B 最好设置(FC 13.1%)高 3.4/1.7 点;Policy-4B 的 Retail pass^4 16.5% 超 GPT-OSS-120B(5.9%)达 10.6 点,Telehealth pass^4 30.0% 超 21.0% 达 9 点;CAST-Critic-8B 平均 pass^4 19.5% vs GPT-OSS-120B 16.9%(+2.6 点、参数少 15 倍)。发现三(域外泛化):域外平均 pass^1 +3.7%、pass^4 +5.1%;8B+Critic-8B 在 Telecom 达 pass^1/3/4=38.9/27.8/27.8%,远超 Base-8B(31.9/9.7/5.6)与 RFT-8B(29.2/12.5/11.1)。发现四(批评质量,Table 3):GPT-4.1、Q3-235B、Q2.5-72B 当 critic 反而把 Qwen3-32B 平均 pass^4 从 11.5% 拖到 6.0/3.4/6.3%,而 Critic-4B/8B 提到 15.9/19.5%;误报率 46.8%→13.6%/11.4%,正确动作放行率 24.0%→62.2%/64.7%。发现五(错误类型,Figure 9):幻觉检测显著优于 GPT-4.1(约 73–76% vs 69%),政策违规相当、工具误用有竞争力;批评后纠正率 82–88%,GPT-4.1 仅约 40–45%。发现六(对比框架):超 PALADIN(Critic-8B pass^1/3/4 各 +20.9/+15.3/+14.9 点)、超 EvoTool(+2.6/+4.5/+4.3 点)、超 IRMA(Airline pass^1 +3.0、Retail pass^4 +4.5),token 与延迟在现有 agentic 框架范围内。发现七(消融):验证轮数非单调最优——Q3-32B 3 轮、Policy-4B 4 轮最佳;Policy 对批评的抵抗率约为未微调模型的一半(Retail 13% vs 26%)。发现八(案例):Retail 任务 52 上 Qwen3-8B 四次全败(0/4,过早执行不可逆换货),CAST-Policy-8B 四次全胜(4/4)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| τ-Bench Retail(域内) | pass^1 | Policy-8B 30.0% | Base-8B 14.1%;RFT-8B 27.6% | +15.9 / +2.4 个百分点 |
| τ-Bench Retail(域内) | pass^4 | Policy-4B 16.5% | GPT-OSS-120B 5.9%;Base-4B 6.1% | +10.6 / +10.4 个百分点 |
| 四域平均(Retail/Airline/Telecom/Telehealth) | avg pass^4 | CAST-Critic-8B(配 Qwen3-32B)19.5% | GPT-OSS-120B 16.9% | +2.6 个百分点(参数少 15 倍) |
| Qwen3-32B 演员 + 批评智能体 | avg pass^4 | +CAST-Critic-8B 19.5% | ReAct 无批评 11.5%;GPT-4.1 批评 6.0% | +8.0 / +13.5 个百分点 |
| τ-Trait Telecom(域外) | pass^4 | Policy-8B+Critic-8B 27.8% | Base-8B 5.6%;RFT-8B 11.1% | +22.2 / +16.7 个百分点 |
| 批评反馈后动作纠正率(幻觉/政策违规/工具误用) | correction rate | CAST-Critic 82–88% | GPT-4.1 约 40–45% | 约 +40 个百分点 |
局限与改进
作者承认两点局限:其一,critic 与 policy 都只用监督微调训练,优化稳定但没有让 policy 在与 critic 的 on-policy 交互中学习,未来可把学到的 critic 当作 RL 反馈模型;其二,CAST 只验证当前动作,不显式建模动作的下游后果,批评数据缺少前瞻性(forward-looking)理由。我自己的观察还有几条:其一,训练只用 Retail 单域,跨域增益不均衡且存在负迁移迹象——Airline 上 Policy-8B 单独 pass^1 仅 9.5%,低于 Base-8B 的 13.5%,说明 Retail 风格的政策遵循可能干扰机票域行为;其二,推理时 Policy+Critic 的组合并非总是有益,4B 在域内 Retail 的 pass^4 从单独的 16.5% 掉到搭配后的 9.6%,说明“何时该信任批评”尚未解决;其三,标注流水线依赖特权信息与强教师模型,论文未报告数据合成的实际成本与失败标注的人工抽检质量;其四,Telecom 仅 18 个任务、Telehealth 仅 20 个任务,pass^4 这类高阶统计在如此小的任务池上方差极大,个别大数字(如 Telecom 27.8%)的显著性存疑;其五,用户模拟器固定为 Qwen2.5-72B,轨迹多样性与标签质量都受其行为分布制约。
独立分析的弱点
弱点一:SFT-only 的两阶段训练使 critic 的反馈分布与 policy 实际探索分布存在偏移,policy 也学不出“如何与批评对话”的策略——域内 Policy+Critic 反而掉点(Retail pass^4 16.5%→9.6%)就是症状;改进方向是把 critic 作为过程奖励模型接入 GRPO/迭代式 RL,或用 DAgger 式滚动收集纠正数据。弱点二:批评理由只看当前步,无法表达“这个动作现在做太早”这类时序问题——案例研究中 Qwen3-8B 的失败恰恰是过早执行不可逆换货,而三分法(幻觉/政策违规/工具误用)并未显式覆盖确认时机类错误;改进方向是引入前瞻性 rollout(用环境模拟器采样 $k$ 步后果)生成后果感知理由。弱点三:单域(Retail)训练导致域外增益不均甚至负迁移(Airline Policy-8B pass^1 9.5% < Base 13.5%);改进方向是多域混合训练、政策条件化提示或域自适应微调。弱点四:验证预算固定且非单调有效(2–5 轮消融显示最优轮数依 actor 而变),实践中需要学习“何时调用 critic、修复几轮”的自适应门控,否则 token 开销不可控。弱点五:critic 与 policy 同源同规模(都是 Qwen3),存在相关误差与“共谋”风险,可探索异构 critic 或对抗式验证。弱点六:标注质量完全依赖 Qwen3.5-122B 教师的判断,缺labels 噪声估计与消融(如仅用 $y_t$ 不用 $e_t$ 训练的对照)来定量说明理由 $e_t$ 的独立贡献。
未来方向
作者提出的方向有二:把学到的 CAST-Critic 用作强化学习的反馈/奖励模型,让 policy 通过 on-policy 探索学到更自适应的纠正策略;在批评数据生成中引入前瞻性理由,刻画局部动作对后续状态与任务结果的影响。基于本文成果还可延伸:其一,把批评能力内化——将 Critic 蒸馏进 Policy 的思维链(隐式自我批评),消除推理时双模型串联的 token 与延迟开销,论文 Figure 7 显示 Policy-4B 用更少 token 就能吸收验证反馈,说明内化有可行性;其二,多域联合训练与持续学习,修复 Airline 上的负迁移;其三,自适应验证预算——按动作风险等级(是否不可逆写操作、金额大小)动态决定是否验证与修复轮数;其四,与结构化状态跟踪(如 LedgerAgent 式显式状态)结合,把“政策违规”检查从文本推理升级为状态机断言;其五,安全攸关场景的白名单机制:对退款、支付类不可逆工具强制双人(actor+critic)确认;其六,标注侧用真实政策文档与更强教师扩展到医疗、金融等更多行业域,并做标签噪声建模以量化 $e_t$ 的贡献。
复现评估
复现门槛中等偏易,资源需求明确。有利条件: backbone 全部开源可得(Qwen3-4B/8B、教师 Qwen3-32B、用户模拟器 Qwen2.5-72B-Instruct、对比模型 GPT-OSS-120B);基准公开(τ-Bench 与 τ-Trait);附录 A 给出完整超参(学习率 $5\times10^{-6}$、3 epochs、总 batch 16、AdamW、cosine、序列长 32768、4×H100 单节点);附录 E 公开了多智能体验证的全部系统提示词(工具提取、规则提取、三类检查器、最终裁决、批评 agent),这是最实用的部分。不确定与困难处:论文未声明训练数据(2500 条批评增强经验)与代码是否开源,需自行重跑数据合成——即 500 任务×5 轨迹的 τ-Bench 环境交互加逐动作 agentic 标注,其中标注依赖 Qwen3.5-27B 与 Qwen3.5-122B-A10B 两个较新的教师模型,获取成本与 API 费用不低;pass^k 评测本身要跑大量重复试验(每任务 $n$ 次),Telecom/Telehealth 各只有 18/20 个任务,小样本方差需要多 seed 才能得到稳定结论。总体估计:一个有 4×H100 预算、能搭起 τ-Bench 环境的小团队可在数周内复现主干结果,但精确复刻标注质量需要反复对齐教师提示词。
论文图表
以模型参数量(4B/8B/32B/120B/235B)为横轴、四域平均 pass^4 为纵轴的 teaser 图。CAST-Critic-8B 达到约 19.5% 的平均 pass^4,超过 GPT-OSS-120B 的 16.9%(+2.6 个百分点、参数少 15 倍),而 Qwen3-4B/8B 的基础模型平均 pass^4 仅 9.1%/12.8% 左右,Q3-235B 约 27.0%。
一图概括论文卖点:批评感知训练让小模型在可靠性指标上越过更大模型,是全文结论的视觉摘要。