← 返回 2026-07-31

Beacon:让多模态大模型懂得何时与如何使用视觉工具进行智能体推理 Beacon: Knowing When and How to Perform Agentic Visual Reasoning

Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying 📅 2026-07-30 👍 52 2026-08-05 19:06
RLVR 多模态大语言模型 工具调用 强化学习 智能体视觉推理 视觉工具使用

让多模态大模型学会按需调用视觉工具,既不过度也不漏用,真正提升能力。

前置知识

智能体视觉推理(Agentic Visual Reasoning)

指多模态大语言模型(MLLM)在回答问题时,不直接给出答案,而是主动生成中间操作(通常是 Python 代码)来裁剪、标注、旋转图像,或执行像素级计算与数值运算,把中间结果作为视觉证据再继续推理。它把模型从「只看图说话」升级为「边看边操作边思考」的智能体范式。

本文研究的就是这种范式本身——模型能不能判断什么时候需要这种工具、用得好不好,这是全文的出发点。

GRPO(Group Relative Policy Optimization)

一种基于组内相对优势的强化学习算法(DeepSeekMath 提出)。它对同一个问题采样一组(如 8 条)回答,用组内奖励的均值和标准差做归一化得到优势值 $A_i = (R_i - \mu_G)/(\sigma_G + \epsilon)$,再用 PPO 风格的裁剪目标更新策略。它不需要单独训练价值网络,是当前训练推理模型的主流基线。

Beacon 的 RL 阶段就以 GRPO 为基础,再叠加自适应奖励和提示引导机制,理解 GRPO 才能看懂作者如何改造奖励信号。

RLVR(RL with Verifiable Rewards)

指用可验证的正确性信号(如数学题答案对错、选择题是否命中)作为奖励的强化学习方法。它的优点是奖励客观、无需人工标注偏好;但致命局限是——一旦某个难题所有采样回答都答错,组内奖励几乎相同,模型学不到东西,难题被「浪费」。

本文提出的 HCE 机制正是为了破解 RLVR 这一根本缺陷,把本来无信号的难题回收成有用的训练信号。

Mode Adaptiveness(推理模式自适应)

本文定义的关键维度,衡量模型能否根据每个问题判断「纯文本推理够不够」,从而决定要不要调用工具。它用两个子指标刻画:$MA_{text}$(简单题里不调工具的比例,越高越好)和 $MA_{tool}$(难题里调工具的比例,越高越好)。两者平均得到 $MA_{mean}$,一个总是调或从不调工具的模型只能得 50%。

这是论文的核心评估维度,也是现有模型暴露出最大问题的地方——大多数模型 MA 接近甚至低于 50% 的随机基线。

Tool Effect(工具效应:增益与危害)

本文定义的另一个维度,衡量工具用得好不好。Tool-Gain 统计「纯文本解不出但靠工具做对」的样本比例,Tool-Harm 统计「本可纯文本解出却因工具做错」的样本比例。两者之差 $\Delta TE$ 越大,说明工具真正扩展了能力而非制造噪声。

论文发现现有模型 Tool-Gain 和 Tool-Harm 几乎抵消($\Delta TE \approx 0$),这就是「工具白用」问题的量化体现,也是 Beacon 要解决的核心矛盾。

研究动机

智能体视觉推理的目标本应是「真正提升复杂任务成功率」,但作者对 Thyme、DeepEyes-V2、CodeV、Metis 这四个代表性模型做了系统评估后,发现两个严重问题。第一是缺乏推理模式自适应:在工具可用提示下,这些模型要么几乎从不调工具(Thyme 在 HRBench4K 上工具调用率仅 12.77%、在 MathVista 上低至 0.10%),要么几乎无脑全调(DeepEyes-V2 调用率常年 98%–99%),$MA_{mean}$ 普遍在 50% 的「随机基线」附近甚至更低,说明它们并没有针对每个问题的难度做模式选择。第二是工具的净收益几乎为零:把模型在「纯文本可解(text-easy)」的简单题上引入的错误(Tool-Harm)和它在「纯文本解不出(text-hard)」难题上的斩获(Tool-Gain)相抵后,$\Delta TE$ 接近 0(如 CodeV 平均 +0.07%、Metis 平均 +0.04%),意味着工具带来的提升被它制造的错误基本抵消,开启工具相比纯文本推理几乎没有净增益。这戳破了「加上工具就更强」的表象。

本文的目标是本文要训练一个名为 Beacon 的智能体视觉推理模型,同时达成三个可量化的目标。其一,在 13 个跨任务基准上取得开源模型里的最高平均分,并且相比基座 Qwen3-VL-8B-Instruct 有显著、稳定的整体提升。其二,显著改善 Mode Adaptiveness——让模型在简单题上少调工具、在难题上多调工具,使 $MA_{mean}$ 明显超过 50% 的随机基线。其三,让工具真正产生价值——把 $\Delta TE$(Tool-Gain 减 Tool-Harm)做正、做大,即工具在难题上的增益要明显超过它在简单题上引入的危害。简而言之,目标不是「让模型多用工具」,而是「让模型知道何时用、用得对」,从而获得真正的能力扩展,而非表面指标。

与已有工作不同的是,已有工作大多只盯着聚合准确率这一个数字,既不分析模型是不是在按需调工具,也不区分工具带来的增益和危害,因而无法揭示「工具白用」这一本质问题。少数意识到该问题的方法(CodeDance、AdaTooler-V、Metis)各有硬伤:CodeDance 用组级准确率决定优化方向,但奖励不区分某条轨迹是否真的调了工具,会错误惩罚成功的工具调用;AdaTooler-V 用教师模型 Qwen2.5-VL-72B 离线打标签,存在策略-教师分布不匹配且受限于教师能力;Metis 简单地「鼓励少调工具」,缺乏任务依赖性,会压制真正需要工具的难题。Beacon 的独特切入点是:用「在线、模式条件化」的方式判断每个问题是否需要工具(基于当前策略自己 5 次采样的表现,而非固定教师),再配一个「软偏好」奖励而非硬禁止;同时正面解决 RLVR 在难题上无信号的痼疾。这种「同时优化何时用 + 如何用」的双维度视角是已有工作没有的。

核心方法

Beacon 走「SFT 先学工具,RL 再学取舍」的两阶段路线。直觉是:先让模型学会「写代码操作图片」的基本技能,再用强化学习教会它「什么时候该写、什么时候不该写」以及「遇到最难的题如何破局」。SFT 阶段用高质量数据合成流水线,由 Gemini 3.1 Pro 为基座 Qwen3-VL-8B-Instruct 解不出的难题生成代码辅助推理轨迹并二次精炼,使模型掌握裁剪、画线、画框、旋转、数值计算等约 5 类代码动作。RL 阶段以 GRPO 为骨架,叠加两个核心创新:Necessity-Aware Adaptive Reward(NAAR)用「在线、模式条件化」的软偏好奖励引导按需调工具;Hint-Guided Capability Expansion(HCE)用专家生成的不含答案的提示帮模型在最难的题上发现成功轨迹,再把能力迁移回无提示策略。训练超参上,SFT 跑 4 个 epoch、峰值学习率 $1\times10^{-5}$;RL 跑 1 个 epoch、学习率 $1\times10^{-6}$、rollout 组大小 128,在 64 张 H200 上完成。

全文核心思想是把「何时用工具」和「如何把工具用出真效果」拆成两个独立目标分别攻克。对「何时」,NAAR 提出在线、模式条件化的软偏好奖励 $R_{adaptive}$:若一组 rollout 至少有一条纯文本回答正确($I_{text}(G)=1$),正确纯文本回答拿满分 1,正确代码回答只拿 0.25——既不归零(保留学习信号、不与准确率目标冲突),又鼓励少调工具;若整组无正确纯文本回答($I_{text}(G)=0$),正确代码回答拿满分 1,鼓励用工具破题。这区别于 CodeDance 组级标签、AdaTooler-V 教师离线标签和 Metis 一刀切少调。对「如何」,HCE 直击 RLVR 全错组无信号死穴:先用 Gemini 3.1 Pro 解出难题提炼成不含答案提示,再让策略在「问题+提示」下重采样,优化时却用原始无提示问题算重要性采样比 $\rho^h_{i,t}=\pi_\theta(y_{i,t}|x,\tau_{i,<t})/\pi_{\theta_{old}}(y_{i,t}|x_h,\tau_{i,<t})$,把提示学到能力蒸馏回无提示策略,推理时无需提示。

方法步骤详情

完整流程分三步。第一步数据构造:从 16 个开源数据集(Geometry3K、OlympiadBench、AgentVista、MMMU、Vero 等)按多样性/质量/难度筛选,让基座对每样本采 5 次保留至多答对 2 次的难题;用 Gemini 3.1 Pro 生成代码辅助轨迹只留答对的再精炼,从 212,353 条筛出 15,705 条 SFT 数据;RL 数据在 SFT 模型上重评、保留答对不超 3 次的难题共 15,709 条。第二步冷启动 SFT:用标准交叉熵损失,把 `` 间代码输出 mask 掉,并掺入正确纯文本轨迹防偏向和遗忘。第三步 RL:每问题先采 8 条正常 rollout,全错则触发 HCE——专家两阶段生成提示,策略在 $x_h=x\oplus h$ 下再采 8 条;总奖励 $R(y_i;G)=0.1R_{format}+0.9R_{adaptive}$,format 检查代码块后是否跟 observation、答案是否包在 ``;优势组内归一化、裁剪 $\epsilon=0.2$ 更新,并过滤准确率或模式优势为零的组。

技术新颖性

技术新颖性体现在三处对比。第一,奖励设计对比:NAAR 是「在线标签」——每个问题是否需要工具由当前策略自己的 5 次表现动态决定,随训练演化,避免了 AdaTooler-V 依赖固定教师、CodeDance 仅看组级准确率却不看单条轨迹是否真调工具的缺陷。第二,软偏好 vs 硬禁止:正确的代码回答在「可纯文本解题」时只降权到 0.25 而非归零,巧妙避免自适应目标与任务准确率目标冲突,这是 Metis「一刀切鼓励少调」做不到的。第三,能力扩展机制:HCE 首次把「专家提示 + 离线到在线的重要性采样」用于智能体视觉推理的难题回收——约 40% 的全错组被成功转化,这是常规 RLVR 完全无能为力的部分。论文还诚实地报告了失败的更激进方案(强制纯文本 rollout 致代码使用率崩塌),说明软偏好这一平衡点来之不易。整体上,Beacon 是首个同时在 MA 和 TE 两个维度上同时显著改进的工作。

Illustration of the RL process of Beacon(NAAR 与 HCE 示意)。
Figure 4: Illustration of the RL process of Beacon(NAAR 与 HCE 示意)。

实验结果

在 13 个跨任务基准上核心发现四点。其一整体最强:Beacon-8B 在 13 项中 11 项第一,平均比基座 Qwen3-VL-8B-Instruct 高 6.07 分;感知/空间类平均 66.05、量化/组合/智能体类平均 50.73,均超次优开源 Metis(64.57/47.46),ChartQAPro 较基座 +16.82。其二推理模式自适应最佳:Beacon 平均 $MA_{mean}$ 达 58.83%,明显高于 DeepEyes-V2 50.17%、CodeV 46.19%、Metis 52.66%,$MA_{tool}$ 高达 94.75%,而 $MA_{text}$ 仅 22.91%。其三工具真正有效:Beacon 平均 Tool-Gain 9.29、Tool-Harm 6.15,$\Delta TE$ 达 +3.14 为唯一明显正值,$\Delta Acc$ +1.96%。其四消融:单独 NAAR 把 $MA_{mean}$ 推到 59.68 最高,单独 HCE 把 $\Delta TE$ 提到 +2.96,约 40% 全错组被 HCE 回收。

Comparison on high-resolution visual search, spatial, and perceptual reasoning benchmarks.
Table 1: Comparison on high-resolution visual search, spatial, and perceptual reasoning benchmarks.
Comparison on quantitative, diagrammatic, compositional, and agentic visual reasoning benchmarks.
Table 2: Comparison on quantitative, diagrammatic, compositional, and agentic visual reasoning benchmarks.
反映 Mode Adaptiveness 与 Tool Effect 的指标(HRBench4K/BLINK/BabyVision/MathVista/TIRBench 五数据集)。
Table 3: 反映 Mode Adaptiveness 与 Tool Effect 的指标(HRBench4K/BLINK/BabyVision/MathVista/TIRBench 五数据集)。
Component-wise ablation study of Beacon.
Table 4: Component-wise ablation study of Beacon.
Beacon 的自适应工具调用行为、13 基准平均性能与工具增益/危害。
Figure 2: Beacon 的自适应工具调用行为、13 基准平均性能与工具增益/危害。
训练组构成与全错组的转化比例。
Figure 7: 训练组构成与全错组的转化比例。
查看结构化数据
任务指标本文基线提升
13 基准平均(感知+空间+量化+组合+智能体) Average Acc. Beacon-8B 开源最优 Metis-8B / Qwen3-VL-8B-Instruct 13 中 11 项第一,较基座 +6.07 分
高分辨率视觉搜索与感知推理(V*/HRBench/VisualProbe/RealWorldQA/BLINK/BabyVision) Avg. Acc. 66.05 Metis 64.57 / 基座 60.57 比次优开源 Metis +1.48,比基座 +5.48
量化/图表/组合/智能体推理(ChartQAPro/MathVista/MathVision/VisualPuzzles/GameQA/TIRBench) Avg. Acc. 50.73 Metis 47.46 / 基座 43.97 比次优开源 Metis +3.27,比基座 +6.76
ChartQAPro(图表问答) Acc. 58.48 基座 41.66 / Metis 52.79 较基座 +16.82,较次优开源 +5.69
工具净效应(5 数据集平均) ΔTE = Tool-Gain − Tool-Harm +3.14% Metis +0.04% / CodeV +0.07% / Thyme +0.06% 工具净收益几乎独占性地为正
推理模式自适应(5 数据集平均) MAmean 58.83% Metis 52.66% / CodeV 46.19% / DeepEyes-V2 50.17% 明显超过 50% 随机基线与全部对手
工具可用 vs 纯文本准确率增益 ΔAcc +1.96% Thyme +0.73 / Metis −0.54 唯一显著正增益

局限与改进

作者承认与读者可见的局限并存。其一,Beacon 在简单题上仍有过度调用工具的倾向,$MA_{text}$ 仅 22.91%(远低于 Thyme 的 92.95%),说明「少调工具」这一面还没完全学好,依赖靠 Tool-Harm 的容忍度来维持净收益。其二,整个数据流水线深度依赖闭源强模型 Gemini 3.1 Pro 做 SFT 轨迹生成、精炼和 HCE 提示生成,论文也承认这是基于该教师的分布;一旦离开 Gemini,复现质量和上界都不可控。其三,答案判定同样依赖 Gemini 3.1 Pro / Gemini 3 Flash 做语义裁决,评测本身有闭源依赖,跨论文严格可比性存疑。其四,RL 训练成本高昂(64 张 H200、单组 8 条 rollout、还要为全错组并行跑最多 3 次专家尝试和 15 次专家工具调用),且提示生成依赖专家在线可用。其五,评估仍以最终答案对错为核心奖励,对中间推理过程质量、工具调用合理性缺乏过程级监督。其六,论文为预印本「Work in progress」,代码/模型权重标注将放出但截至阅读时未必可用,部分超参与细节(如提示模板细节)需以正式版为准。

独立分析的弱点

第一,过度调用工具的系统性倾向。Beacon 的 $MA_{text}$ 仅 22.91%,在 BLINK、MathVista 等本可纯文本解题的简单题上仍有 78%–79% 的工具调用率,BLINK 上 Tool-Harm 达 11.15%。改进方向:在奖励里加入显式「调用成本」项,或对简单题的代码调用给予更强负惩罚,把延迟/算力作为软约束,让模型在边际收益低于阈值时收手。第二,强教师依赖。SFT 轨迹、精炼、HCE 提示三处都靠 Gemini 3.1 Pro,存在能力天花板与分布不匹配风险。改进方向:用自我蒸馏或在线拒绝采样逐步替换教师,或多教师集成降低单一偏差。第三,提示泄漏风险与可迁移性。HCE 靠专家提示回收难题,若提示隐含答案线索会造成训练-测试不一致。改进方向:加提示-答案无关性校验、用模型自生成提示(self-hint)形成自举闭环。第四,工具集单一,主要围绕图像操作,缺检索、外部知识、多图证据融合等更丰富工具,可扩展工具库与组合调用。第五,评测闭源化(用 Gemini 裁决答案)使跨论文严格对比困难,建议建立规则可复现的官方评测协议。

未来方向

作者未明确给出独立「Future Work」章节,但从论文设计可延伸出若干方向。其一,作者提到 hint 的 `tool_steps` 和 `subgoals` 字段目前只用作训练提示,未来可作为细粒度过程监督或奖励信号——这指向「过程级奖励」的强化学习,把奖励从「答案对错」细化到「每个工具步骤是否有效」。其二,HCE 的提示生成可从依赖外部强教师演进为策略自生成(self-generated hints),形成自举式能力扩展,摆脱对闭源模型的依赖。其三,工具调用成本与延迟可纳入奖励,让模型学会在「收益」与「开销」间权衡,实现真正按需、按预算的推理。其四,可将 NAAR+HCE 框架推广到视频、长文档、具身决策等需要更长程工具调用的场景,验证其通用性。其五,结合论文 E.1 中失败的「强制纯文本 rollout」教训,未来可探索更精细的在线难度估计(如用 pass@k 曲线而非单次成败)来稳健地标注是否需要工具,避免训练-测试分布错配。

复现评估

复现难度中等偏高。有利条件:基座 Qwen3-VL-8B-Instruct 开源;框架用成熟的 Megatron(SFT)与 VeRL(RL),论文给出关键超参(SFT 4 epoch、lr $1\times10^{-5}$、cosine 调度、128 micro-batch 累积;RL 1 epoch、lr $1\times10^{-6}$、组大小 128、PPO 裁剪 $\epsilon=0.2$、关闭 KL/entropy、最大序列 30,720 token、至多 12 次工具调用、冻结视觉编码器);数据来源(Geometry3K、OlympiadBench、AgentVista、MMMU、Vero 等 16 个)多为公开;评估基于开源 VLMEvalKit,并给出系统与 hint 生成提示模板。不利条件:SFT 轨迹、精炼、HCE 提示三处强依赖闭源 Gemini 3.1 Pro,答案裁决也用 Gemini,离开它难严格复现上界;RL 需 64 张 H200,算力门槛高。结合闭源依赖,整体属「方法可复现、上界难复现」层级。