← 返回 2026-08-25

ARC:开放式真实世界交互中的公平相对优势比较 ARC: Fair Relative Advantage Comparison in Open-Ended Real-World Interaction

Yongqi Tong, Tan Li Hui Faith, Choy Zhen Wen Marcus, Zhou Jin, Kewei Fu, Jiang-Ming Yang, Jianshe Li, Xin Zhang 📅 2026-08-13 👍 16 2026-08-30 18:30
LLM智能体 人机交互 优势估计 奖励模型 工具调用 强化学习

用策略条件化分组消除开放式智能体RL中跨策略比较偏差

前置知识

GRPO(组相对策略优化)

一种无需价值网络的组相对 RL 后训练方法:对同一提示 $x$ 采样 $N$ 个响应,用组内奖励中心化(或标准化)得到优势 $\hat{A}_i = r_i - \bar{r}$,再按策略梯度更新。GRPO 及其变体(DAPO 等)是当前 LLM 数学推理与智能体训练的主流配方。

ARC 的全部改动都发生在组相对 RL 的优势计算环节,理解'组内比较'的前提假设是理解其奖励公平问题的必要条件。

优势估计的方差分解

策略梯度中优势是随机变量,方差越大梯度估计噪声越大、样本效率越低。经典结果(Greensmith et al. 2004)指出可用基线消减方差;组相对方法用组均值当基线,但只有当组内样本'可比'时,中心化才能剔除共同成分、只留下质量差异。

论文定理 5.1–5.3 把组内优势方差分解为策略内 $\sigma^2_{intra}$ 与策略间 $\sigma^2_{inter}$ 两项,ARC 的全部理论收益来自消除后者。

奖励模型偏见与奖励黑客

奖励模型常依赖与任务质量无关的虚假属性(长度、格式、语气风格),策略会在优化中利用这些漏洞刷分(reward hacking),导致奖励上升而真实能力不升。在开放式交互中,这类偏见对不同交互策略并不均匀,危害更隐蔽。

论文将跨策略比较导致的偏差形式化为 $\delta$-奖励公平问题,正是 RM 偏见在组相对框架下的具体表现。

熵正则化与熵坍缩

在策略梯度目标中加入熵奖励 $-\beta H(\pi_\theta)$ 可维持输出分布随机性、鼓励探索。多通道生成(潜在推理 + 用户可见回复 + 工具调用)中若不加约束,策略可能收敛到重复输出空洞 `` 块的退化解,即熵坍缩。

ARC 的训练目标除策略条件分组外还带熵正则项,作者观察到 $\beta=0$ 时多通道格式会退化。

τ-bench / τ²-bench

面向多轮工具调用智能体的评测基准:τ-bench 覆盖 airline、retail 客服场景,τ²-bench 加入 telecom 并引入双控环境(用户可中途改变需求)。指标为通过率,考察工具调用、状态跟踪与对话管理能力。

ARC 的主结果全部在这两个基准上报告,是判断其域内增益是否可信的直接依据。

TTFT(首 token 延迟)

Time-to-first-token,从用户发出消息到看到第一个可见输出的时间,是交互式系统的核心体验指标。think-then-act 式智能体必须等隐式推理与工具链全部完成才输出,TTFT 高达数秒。

INTER3 框架把响应性变成接口属性,将 TTFT 从 4.91s 压到 1.27s,这是论文第二条主线(交互框架)的关键数字。

研究动机

以 GRPO 为代表的组相对 RL 隐含假设:同组 rollout 处于'局部可比较'的响应区域,中心化奖励 $\hat{A}_i = r_i - \bar{r}$ 反映的是质量差异。但开放式真实交互不满足这一前提:面对同一个对话状态,智能体直接回答、先向用户澄清、执行工具时同步播报进度、或在不可逆操作前做对齐确认,都可能是合适的行为,且没有唯一标准答案。奖励模型对长度、风格等虚假属性的偏好并非在整组内均匀分布——当一组 rollout 覆盖截然不同的行为模式时,它们落在 RM 偏好地形的不同区域,中心化奖励会同时吸收质量差异与区域特定的偏好,优势估计因此被'哪种交互风格更讨 RM 喜欢'所污染。作者将此形式化为奖励公平问题:对同一提示下质量相同但策略不同的响应 $y_i, y_j$,若 $|R(x,y_i)-R(x,y_j)| \le \delta$ 不成立($\delta>0$),则跨策略比较不公平。在 τ-bench 这类多轮客服工具调用任务上,这意味着 RL 可能把策略推向 RM 偏好的交互风格,而非上下文最合适的行为。

本文的目标是论文的目标分两层。(1) 方法层:形式化并修复开放式交互 RL 中的不公平优势比较——提出 ARC(Advantage Regularization via Conditioning),通过'策略条件化 rollout 分组'把组内比较收缩到同一交互策略家族内进行,并配合混合奖励与熵正则的稳定训练目标,且不改动底层优化器(可与 PPO/DAPO/GRPO 叠加)。(2) 系统与数据层:现有 think-then-act 框架把用户可见输出推迟到隐藏执行结束,ReAct 式框架把推理/行动/通信混在一条流里,两者都产生不了'同一任务、多种合法策略'的可观测交互数据。作者因此构建 INTER3 通道分离交互框架——`` 标签内文本流式发给用户、标签外为潜在推理、工具调用为结构化内部动作——并从真实部署 trace、公共数据集与教师模型合成轨迹构建 86,796 条策略标注语料 INTER3-86K(57.9K SFT + 28.9K RL),最终在 Qwen3-8B 上验证 ARC 对 τ/τ² 工具使用基准的增益。

与已有工作不同的是,独特切入角度在于 ARC 与 hint/guidance 类 RL 方法(SAGE、Scaf-GRPO、LUFFY、ExGRPO)目的相反:那些方法注入辅助信息是为了'让答案更容易找到'——揭示解法结构、赋予特权轨迹、改善探索;ARC 注入策略指令不是为了降低任务难度,而是为了定义一个更干净的比较类,使组相对优化的比较单元从'整组混合行为'收缩为'单一策略条件组'。理论上作者证明:策略间方差 $\sigma^2_{inter}$ 在标准采样下无法靠过采样消除(定理 5.1),而条件化可将其从中心化优势方差中整体去除(定理 5.2)。架构上,INTER3 把响应性从解码行为变成接口属性,使进度更新、澄清、对齐检查成为一等公民、可控制可标注,为 ARC 提供了观测策略多样性并据其分组的现实底座——方法(公平比较)与系统(策略可观测)互为前提,这是以往工作未曾同时覆盖的。

核心方法

直觉版:两个 rollout 都成功完成任务,但一个静默执行工具后一步作答,另一个边执行边向用户播报进度——标准 GRPO 把它们放进同一组中心化,谁的优势更高取决于 RM 更喜欢哪种风格,而非任务完成质量。ARC 的做法是:训练时给每个样本配一条策略指令 $s^*$(来自四大家族:Progress Update、Clarify First、Alignment Check、Direct Answer),只在 $\pi_\theta(\cdot\mid x,s^*)$ 内采 $M$ 个 rollout、组内中心化计算优势、更新参数;目标函数加熵正则 $\beta H(\pi_\theta)$ 防止三通道(推理/可见回复/工具调用)生成的熵坍缩。推理时移除指令,模型自主选择策略。技术底座是 INTER3:`` 标签内文本流式发给用户,标签外为潜在推理,工具调用为结构化内部动作;实现只需给 tokenizer 加特殊 token 并后处理抽取可见片段,TTFT 从 think 基线 4.91s 降到 1.27s,中断、澄清、进度播报成为可标注的一等事件。

核心创新是'改变组相对优化的比较单元'。设奖励分解为 $r=\mu_s(x)+\epsilon$,标准采样下优势方差 $\mathrm{Var}[\hat{A}_i]=(\sigma^2_{inter}+\sigma^2_{intra})(1-1/N)$,策略间项来自不同策略的奖励均值偏移(RM 风格偏好),过采样无法消除;条件化采样后 $\mathrm{Var}[\hat{A}_i\mid s^*]=\sigma^2_{intra}\cdot(1-1/N)$,均值偏移被整体吸收。在理想化的梯度估计假设下,达到精度 $\varepsilon$ 的 rollout 需求从含 $(\sigma^2_{intra}+\sigma^2_{inter})$ 降为只含 $\sigma^2_{intra}$,样本效率比 $n_{std}/n_{ARC}=1+\sigma^2_{inter}/\sigma^2_{intra}$。与 hint-based RL 的本质区别:辅助指令用于公平比较而非降低任务难度,收益来自更干净的对比信号而非更强提示;作者也强调这些定理是估计器层面的风格化刻画,非收敛保证。

方法步骤详情

(1) 策略指令分配:双教师模型(Qwen3-235B-Instruct、Qwen3.5-27B)独立预测每个样本的策略+置信度;一致且置信度 $>0.85$ 直接采纳,分歧但置信差 $\Delta>0.15$ 取高置信方,否则三名标注员多数投票;RL 时指令注入 system prompt。(2) 数据底座:SFT 集 57.9K 由 Qwen3.5-397B-A17B 把 ToolMind 34.2K、Musique 17.2K、KnightsAndKnaves 6.2K 重写为 INTER3 交错格式;RL 集 28.9K 取自 ToolMind 工具子集并附加策略 prompt。(3) 组内采样与优势:对每个 $(x,s^*)$ 采 $M$ 个 rollout,组内中心化 $\hat{A}_i=r_i-\bar{r}$。(4) 更新:最小化 $\mathcal{L}=-\sum_i \hat{A}_i\log\pi_\theta(y_i\mid x,s^*)-\beta H(\pi_\theta)$;用 GRPO 训练 Qwen3-8B,共享同一 SFT 热启动与奖励构造。

技术新颖性

新颖性有四层。(1) 问题层:首次把'组内跨策略比较'形式化为 $\delta$-奖励公平问题,并证明 $\sigma^2_{inter}$ 是过采样不可消除的估计误差源——恰好解释标准 GRPO 在多策略环境中奖励中期达峰后回落(图 5),而 ARC 同预算下稳定。(2) 方法层:ARC 是 rollout 构造期的干预,不修改优化器,与 PPO/DAPO/GRPO 正交可叠加;实验显示对组相对类骨干增益最大(GRPO +5.37),与'消除组相对估计特有偏差'的机制自洽。(3) 系统层:INTER3 通道分离使'交互策略'成为显式、可标注、可分组的变量,填补 think-then-act 与 ReAct 都无法产出此类数据的空白,并顺带把响应性做成接口属性(TTFT 4.91s→1.27s)。(4) 经验层:训练-推理错位被证明是特性而非缺陷——训练保留指令、推理移除反而最优(无提示 41.73 > 匹配 39.85 > 随机 39.58),线性/常数移除课程(27.28/26.97)都不如不移除(29.59),说明指令是训练期方差控制装置而非需内化的提示。

Overview of ARC
Figure 1: Overview of ARC
Standard think-then-answer (left) completes reasoning and tool execution before answering, resulting in high TTFT and no steering, whereas INTER3 (right) interleaves reasoning, answering, and tool use, allowing real-time steering and faster TTFT.
Figure 2: Standard think-then-answer (left) completes reasoning and tool execution before answering, resulting in high TTFT and no steering, whereas INTER3 (right) interleaves reasoning, answering, and tool use, allowing real-time steering and faster TTFT.
Left: INTER3 strategy distribution in the RL training dataset. Right: data domain composition of the full training set (SFT + RL).
Figure 4: Left: INTER3 strategy distribution in the RL training dataset. Right: data domain composition of the full training set (SFT + RL).

实验结果

主结果(表 3):GRPO 28.09→GRPO+ARC 33.46(+5.37),τ-airline 31.33→44.00、τ-retail 40.29→50.00、τ²-airline 36.67→48.00、τ²-telecom 17.84→21.05;域外 AIME 2026 31.67→40.83。增益依赖骨干:PPO +1.08、DAPO +1.31,说明 ARC 与组相对目标协同最好。INTER3 把 TTFT 从 think 基线 4.91s 降到 1.27s。4B 案例(表 4):GRPO+ARC 平均 34.23 vs 4B GRPO 22.33,较 noThink 22.38 提升 53%。图 5:GRPO 奖励中期达峰后回落而 ARC 同预算稳定,格式奖励均饱和。消融:指令不移除最优 29.59 > 线性 27.28 > 常数 26.97(表 5);策略扩展从单策略 21.74 到全四策略 29.59(+36.1%),τ 类 +99%、τ² 类 +71%(表 6)。图 7:移除提示 41.73 优于匹配 39.85 与随机 39.58。

INTER3 strategy taxonomy used for ARC conditioning, analysis, and data construction
Table 1: INTER3 strategy taxonomy used for ARC conditioning, analysis, and data construction
Inter-86K summary statistics
Table 2: Inter-86K summary statistics
Main results. ARC delivers clearest gains on in-domain tool use, especially on GRPO
Table 3: Main results. ARC delivers clearest gains on in-domain tool use, especially on GRPO
Qwen3-4B case study. ARC remains effective at smaller scale
Table 4: Qwen3-4B case study. ARC remains effective at smaller scale
Curriculum learning over strategy-instruction removal does not improve ARC
Table 5: Curriculum learning over strategy-instruction removal does not improve ARC
Strategy scaling ablation
Table 6: Strategy scaling ablation
Training reward curves for GRPO and ARC
Figure 5: Training reward curves for GRPO and ARC
Training-time instruction removal underperforms the default ARC setup
Figure 6: Training-time instruction removal underperforms the default ARC setup
Domain-instruction interaction analysis. Inference-time strategy hints show no uniformly superior deployment interface.
Figure 7: Domain-instruction interaction analysis. Inference-time strategy hints show no uniformly superior deployment interface.
查看结构化数据
任务指标本文基线提升
τ-bench airline(GRPO 骨干) 通过率 44.00(GRPO+ARC) 31.33(GRPO) +12.67
τ-bench retail(GRPO 骨干) 通过率 50.00(GRPO+ARC) 40.29(GRPO) +9.71
τ²-bench airline(GRPO 骨干) 通过率 48.00(GRPO+ARC) 36.67(GRPO) +11.33
τ²-bench retail(GRPO 骨干) 通过率 45.61(GRPO+ARC) 40.64(GRPO) +4.97
τ²-bench telecom(GRPO 骨干) 通过率 21.05(GRPO+ARC) 17.84(GRPO) +3.21
AIME 2026(域外推理,GRPO 骨干) 准确率 40.83(GRPO+ARC) 31.67(GRPO) +9.16
11 项指标平均(GRPO 骨干) 平均分 33.46(GRPO+ARC) 28.09(GRPO) +5.37
11 项指标平均(PPO 骨干) 平均分 28.57(PPO+ARC) 27.49(PPO) +1.08
11 项指标平均(DAPO 骨干) 平均分 29.92(DAPO+ARC) 28.61(DAPO) +1.31
Qwen3-4B 工具使用五任务 平均分 34.23(GRPO+ARC 4B) 22.33(4B GRPO) +11.90(较 4B noThink 约 +53%)
交互响应性 vs think 基线 TTFT(越低越好) 1.27s(INTER3) 4.91s(think-then-act) -74%

局限与改进

作者承认四点局限:(1) 策略抽象粗糙,四家族九策略难以覆盖真实交互中更细腻、上下文相关的行为;(2) 域范围有限,最强结果集中在工具使用,其他域泛化未验证;(3) 方法依赖归一化交互 trace 与策略标签,可能携带标注偏差与部署特有模式;(4) 理论是 $r=\mu_s(x)+\epsilon$ 风格化的估计器层面刻画,非完整收敛理论。我的补充:其一,骨干依赖性强,PPO/DAPO 增益小且部分域外指标反降(PPO+ARC 的 AIME 从 30.83 跌至 19.17),公平比较收益与优化动力学的耦合机制未被完全解释;其二,实验限于 Qwen3 家族 8B/4B,数据重写教师单一(Qwen3.5-397B-A17B),跨模型家族有效性存疑;其三,τ²-telecom 绝对值仍仅 21.05,最难域未真正解决;其四,标注阈值(0.85/$\Delta$0.15)是工程性选择,缺乏标签噪声敏感性分析;其五,策略分布极不均衡(Progress Update 75.3% vs Alignment Check 2.5%),小策略族的组内统计表现未被单独报告。

独立分析的弱点

独立分析的弱点:(1) 指令-策略错配风险——训练时策略由标注管道分配,若'先澄清再执行'被误标为 Progress Update,ARC 会在错误条件组内比较,且论文未报告标注准确率上限;改进方向是软条件(策略 embedding 加权)或按策略一致性过滤 rollout。(2) 推理期可控性缺失——移除指令后模型自主选策略,没有机制保证高风险场景(不可逆操作)一定触发 Alignment Check;改进方向是约束解码或基于操作可逆性的动态触发。(3) 奖励构造不透明——'hybrid reward'组成放在附录,主文归因依赖格式奖励饱和等间接证据。(4) 策略分布极不均衡(75.3% vs 2.5%)下的组预算分配未讨论,低频策略条件组的组内统计可能不稳。(5) 理论假设策略与质量独立,当某策略系统性更优时,条件化可能引入跨组不可比的新问题——ARC 保证组内公平而非跨组可比。

未来方向

未来方向:作者明确提出验证 ARC 在工具使用之外域的泛化、构建更细粒度、更上下文敏感的策略抽象,以及把风格化的方差/样本效率分析推进为更完整的理论刻画。基于其成果可延伸的:(1) 策略空间连续化——从离散四家族走向可学习的层次化策略表示,用对比目标自动构造比较类,摆脱 taxonomy 人工设计;(2) 在线策略发现——从部署 trace 中聚类涌现的新交互模式并动态扩充条件族,而非固定封闭集合;(3) 与过程奖励模型结合——在策略条件组内再按步骤级信号细分,进一步压低 $\sigma^2_{intra}$;(4) 低频高风险策略的保障机制——对 Alignment Check/Clarify First 设置优势下限或数据重加权,抵消 2.5% 数据量的劣势;(5) 将 INTER3 的通道分离协议(`` 流式 + 结构化工具事件)推广为标准化 agent 交互数据格式,推动社区建立'同任务多策略'公开基准;(6) 从理论上研究策略条件化与 KL 正则、clip 机制(DAPO 类)的相互作用,解释为何 GRPO 受益最大而 PPO/DAPO 增益有限。

复现评估

复现评估:作者承诺开源 ARC 实现与 INTER3-86K 数据集(框架代码与数据集各有发布链接,论文写作时尚未放出)。数据侧,SFT 集 57.9K 可由公开数据(ToolMind、Musique Long Content、KnightsAndKnaves 等)加 Qwen3.5-397B-A17B 重写复现,但需大规模教师模型推理算力;RL 集 28.9K 的策略标注需 Qwen3-235B-Instruct 与 Qwen3.5-27B 双模型标注加人工复核,推理与人力成本不低;来自支付平台客服真实部署的在线 trace 部分外部无法获得。训练侧需多轮工具调用的 GRPO 基础设施(工具沙箱、异步流式运行时、`` 后处理),8B 模型属中高算力门槛,论文未披露 GPU 数量与训练时长。评测需 τ/τ²-bench 全套及 AIME/GPQA-D/HMMT/IFBench/ArenaHard 六个域外基准。综合判断:待代码与数据发布后,学术实验室复现主干结果难度中等偏上,完全复现含真实部署数据的设置不可行。