Beacon:让多模态大模型懂得何时与如何使用视觉工具进行智能体推理 Beacon: Knowing When and How to Perform Agentic Visual Reasoning
让多模态大模型学会按需调用视觉工具,既不过度也不漏用,真正提升能力。
前置知识
智能体视觉推理(Agentic Visual Reasoning)
指多模态大语言模型(MLLM)在回答问题时,不直接给出答案,而是主动生成中间操作(通常是 Python 代码)来裁剪、标注、旋转图像,或执行像素级计算与数值运算,把中间结果作为视觉证据再继续推理。它把模型从「只看图说话」升级为「边看边操作边思考」的智能体范式。
本文研究的就是这种范式本身——模型能不能判断什么时候需要这种工具、用得好不好,这是全文的出发点。
GRPO(Group Relative Policy Optimization)
一种基于组内相对优势的强化学习算法(DeepSeekMath 提出)。它对同一个问题采样一组(如 8 条)回答,用组内奖励的均值和标准差做归一化得到优势值 $A_i = (R_i - \mu_G)/(\sigma_G + \epsilon)$,再用 PPO 风格的裁剪目标更新策略。它不需要单独训练价值网络,是当前训练推理模型的主流基线。
Beacon 的 RL 阶段就以 GRPO 为基础,再叠加自适应奖励和提示引导机制,理解 GRPO 才能看懂作者如何改造奖励信号。
RLVR(RL with Verifiable Rewards)
指用可验证的正确性信号(如数学题答案对错、选择题是否命中)作为奖励的强化学习方法。它的优点是奖励客观、无需人工标注偏好;但致命局限是——一旦某个难题所有采样回答都答错,组内奖励几乎相同,模型学不到东西,难题被「浪费」。
本文提出的 HCE 机制正是为了破解 RLVR 这一根本缺陷,把本来无信号的难题回收成有用的训练信号。
Mode Adaptiveness(推理模式自适应)
本文定义的关键维度,衡量模型能否根据每个问题判断「纯文本推理够不够」,从而决定要不要调用工具。它用两个子指标刻画:$MA_{text}$(简单题里不调工具的比例,越高越好)和 $MA_{tool}$(难题里调工具的比例,越高越好)。两者平均得到 $MA_{mean}$,一个总是调或从不调工具的模型只能得 50%。
这是论文的核心评估维度,也是现有模型暴露出最大问题的地方——大多数模型 MA 接近甚至低于 50% 的随机基线。
Tool Effect(工具效应:增益与危害)
本文定义的另一个维度,衡量工具用得好不好。Tool-Gain 统计「纯文本解不出但靠工具做对」的样本比例,Tool-Harm 统计「本可纯文本解出却因工具做错」的样本比例。两者之差 $\Delta TE$ 越大,说明工具真正扩展了能力而非制造噪声。
论文发现现有模型 Tool-Gain 和 Tool-Harm 几乎抵消($\Delta TE \approx 0$),这就是「工具白用」问题的量化体现,也是 Beacon 要解决的核心矛盾。
研究动机
智能体视觉推理的目标本应是「真正提升复杂任务成功率」,但作者对 Thyme、DeepEyes-V2、CodeV、Metis 这四个代表性模型做了系统评估后,发现两个严重问题。第一是缺乏推理模式自适应:在工具可用提示下,这些模型要么几乎从不调工具(Thyme 在 HRBench4K 上工具调用率仅 12.77%、在 MathVista 上低至 0.10%),要么几乎无脑全调(DeepEyes-V2 调用率常年 98%–99%),$MA_{mean}$ 普遍在 50% 的「随机基线」附近甚至更低,说明它们并没有针对每个问题的难度做模式选择。第二是工具的净收益几乎为零:把模型在「纯文本可解(text-easy)」的简单题上引入的错误(Tool-Harm)和它在「纯文本解不出(text-hard)」难题上的斩获(Tool-Gain)相抵后,$\Delta TE$ 接近 0(如 CodeV 平均 +0.07%、Metis 平均 +0.04%),意味着工具带来的提升被它制造的错误基本抵消,开启工具相比纯文本推理几乎没有净增益。这戳破了「加上工具就更强」的表象。
本文的目标是本文要训练一个名为 Beacon 的智能体视觉推理模型,同时达成三个可量化的目标。其一,在 13 个跨任务基准上取得开源模型里的最高平均分,并且相比基座 Qwen3-VL-8B-Instruct 有显著、稳定的整体提升。其二,显著改善 Mode Adaptiveness——让模型在简单题上少调工具、在难题上多调工具,使 $MA_{mean}$ 明显超过 50% 的随机基线。其三,让工具真正产生价值——把 $\Delta TE$(Tool-Gain 减 Tool-Harm)做正、做大,即工具在难题上的增益要明显超过它在简单题上引入的危害。简而言之,目标不是「让模型多用工具」,而是「让模型知道何时用、用得对」,从而获得真正的能力扩展,而非表面指标。
与已有工作不同的是,已有工作大多只盯着聚合准确率这一个数字,既不分析模型是不是在按需调工具,也不区分工具带来的增益和危害,因而无法揭示「工具白用」这一本质问题。少数意识到该问题的方法(CodeDance、AdaTooler-V、Metis)各有硬伤:CodeDance 用组级准确率决定优化方向,但奖励不区分某条轨迹是否真的调了工具,会错误惩罚成功的工具调用;AdaTooler-V 用教师模型 Qwen2.5-VL-72B 离线打标签,存在策略-教师分布不匹配且受限于教师能力;Metis 简单地「鼓励少调工具」,缺乏任务依赖性,会压制真正需要工具的难题。Beacon 的独特切入点是:用「在线、模式条件化」的方式判断每个问题是否需要工具(基于当前策略自己 5 次采样的表现,而非固定教师),再配一个「软偏好」奖励而非硬禁止;同时正面解决 RLVR 在难题上无信号的痼疾。这种「同时优化何时用 + 如何用」的双维度视角是已有工作没有的。
核心方法
Beacon 走「SFT 先学工具,RL 再学取舍」的两阶段路线。直觉是:先让模型学会「写代码操作图片」的基本技能,再用强化学习教会它「什么时候该写、什么时候不该写」以及「遇到最难的题如何破局」。SFT 阶段用高质量数据合成流水线,由 Gemini 3.1 Pro 为基座 Qwen3-VL-8B-Instruct 解不出的难题生成代码辅助推理轨迹并二次精炼,使模型掌握裁剪、画线、画框、旋转、数值计算等约 5 类代码动作。RL 阶段以 GRPO 为骨架,叠加两个核心创新:Necessity-Aware Adaptive Reward(NAAR)用「在线、模式条件化」的软偏好奖励引导按需调工具;Hint-Guided Capability Expansion(HCE)用专家生成的不含答案的提示帮模型在最难的题上发现成功轨迹,再把能力迁移回无提示策略。训练超参上,SFT 跑 4 个 epoch、峰值学习率 $1\times10^{-5}$;RL 跑 1 个 epoch、学习率 $1\times10^{-6}$、rollout 组大小 128,在 64 张 H200 上完成。
全文核心思想是把「何时用工具」和「如何把工具用出真效果」拆成两个独立目标分别攻克。对「何时」,NAAR 提出在线、模式条件化的软偏好奖励 $R_{adaptive}$:若一组 rollout 至少有一条纯文本回答正确($I_{text}(G)=1$),正确纯文本回答拿满分 1,正确代码回答只拿 0.25——既不归零(保留学习信号、不与准确率目标冲突),又鼓励少调工具;若整组无正确纯文本回答($I_{text}(G)=0$),正确代码回答拿满分 1,鼓励用工具破题。这区别于 CodeDance 组级标签、AdaTooler-V 教师离线标签和 Metis 一刀切少调。对「如何」,HCE 直击 RLVR 全错组无信号死穴:先用 Gemini 3.1 Pro 解出难题提炼成不含答案提示,再让策略在「问题+提示」下重采样,优化时却用原始无提示问题算重要性采样比 $\rho^h_{i,t}=\pi_\theta(y_{i,t}|x,\tau_{i,<t})/\pi_{\theta_{old}}(y_{i,t}|x_h,\tau_{i,<t})$,把提示学到能力蒸馏回无提示策略,推理时无需提示。
方法步骤详情
完整流程分三步。第一步数据构造:从 16 个开源数据集(Geometry3K、OlympiadBench、AgentVista、MMMU、Vero 等)按多样性/质量/难度筛选,让基座对每样本采 5 次保留至多答对 2 次的难题;用 Gemini 3.1 Pro 生成代码辅助轨迹只留答对的再精炼,从 212,353 条筛出 15,705 条 SFT 数据;RL 数据在 SFT 模型上重评、保留答对不超 3 次的难题共 15,709 条。第二步冷启动 SFT:用标准交叉熵损失,把 `` 间代码输出 mask 掉,并掺入正确纯文本轨迹防偏向和遗忘。第三步 RL:每问题先采 8 条正常 rollout,全错则触发 HCE——专家两阶段生成提示,策略在 $x_h=x\oplus h$ 下再采 8 条;总奖励 $R(y_i;G)=0.1R_{format}+0.9R_{adaptive}$,format 检查代码块后是否跟 observation、答案是否包在 ``;优势组内归一化、裁剪 $\epsilon=0.2$ 更新,并过滤准确率或模式优势为零的组。
技术新颖性
技术新颖性体现在三处对比。第一,奖励设计对比:NAAR 是「在线标签」——每个问题是否需要工具由当前策略自己的 5 次表现动态决定,随训练演化,避免了 AdaTooler-V 依赖固定教师、CodeDance 仅看组级准确率却不看单条轨迹是否真调工具的缺陷。第二,软偏好 vs 硬禁止:正确的代码回答在「可纯文本解题」时只降权到 0.25 而非归零,巧妙避免自适应目标与任务准确率目标冲突,这是 Metis「一刀切鼓励少调」做不到的。第三,能力扩展机制:HCE 首次把「专家提示 + 离线到在线的重要性采样」用于智能体视觉推理的难题回收——约 40% 的全错组被成功转化,这是常规 RLVR 完全无能为力的部分。论文还诚实地报告了失败的更激进方案(强制纯文本 rollout 致代码使用率崩塌),说明软偏好这一平衡点来之不易。整体上,Beacon 是首个同时在 MA 和 TE 两个维度上同时显著改进的工作。
实验结果
在 13 个跨任务基准上核心发现四点。其一整体最强:Beacon-8B 在 13 项中 11 项第一,平均比基座 Qwen3-VL-8B-Instruct 高 6.07 分;感知/空间类平均 66.05、量化/组合/智能体类平均 50.73,均超次优开源 Metis(64.57/47.46),ChartQAPro 较基座 +16.82。其二推理模式自适应最佳:Beacon 平均 $MA_{mean}$ 达 58.83%,明显高于 DeepEyes-V2 50.17%、CodeV 46.19%、Metis 52.66%,$MA_{tool}$ 高达 94.75%,而 $MA_{text}$ 仅 22.91%。其三工具真正有效:Beacon 平均 Tool-Gain 9.29、Tool-Harm 6.15,$\Delta TE$ 达 +3.14 为唯一明显正值,$\Delta Acc$ +1.96%。其四消融:单独 NAAR 把 $MA_{mean}$ 推到 59.68 最高,单独 HCE 把 $\Delta TE$ 提到 +2.96,约 40% 全错组被 HCE 回收。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 13 基准平均(感知+空间+量化+组合+智能体) | Average Acc. | Beacon-8B 开源最优 | Metis-8B / Qwen3-VL-8B-Instruct | 13 中 11 项第一,较基座 +6.07 分 |
| 高分辨率视觉搜索与感知推理(V*/HRBench/VisualProbe/RealWorldQA/BLINK/BabyVision) | Avg. Acc. | 66.05 | Metis 64.57 / 基座 60.57 | 比次优开源 Metis +1.48,比基座 +5.48 |
| 量化/图表/组合/智能体推理(ChartQAPro/MathVista/MathVision/VisualPuzzles/GameQA/TIRBench) | Avg. Acc. | 50.73 | Metis 47.46 / 基座 43.97 | 比次优开源 Metis +3.27,比基座 +6.76 |
| ChartQAPro(图表问答) | Acc. | 58.48 | 基座 41.66 / Metis 52.79 | 较基座 +16.82,较次优开源 +5.69 |
| 工具净效应(5 数据集平均) | ΔTE = Tool-Gain − Tool-Harm | +3.14% | Metis +0.04% / CodeV +0.07% / Thyme +0.06% | 工具净收益几乎独占性地为正 |
| 推理模式自适应(5 数据集平均) | MAmean | 58.83% | Metis 52.66% / CodeV 46.19% / DeepEyes-V2 50.17% | 明显超过 50% 随机基线与全部对手 |
| 工具可用 vs 纯文本准确率增益 | ΔAcc | +1.96% | Thyme +0.73 / Metis −0.54 | 唯一显著正增益 |
局限与改进
作者承认与读者可见的局限并存。其一,Beacon 在简单题上仍有过度调用工具的倾向,$MA_{text}$ 仅 22.91%(远低于 Thyme 的 92.95%),说明「少调工具」这一面还没完全学好,依赖靠 Tool-Harm 的容忍度来维持净收益。其二,整个数据流水线深度依赖闭源强模型 Gemini 3.1 Pro 做 SFT 轨迹生成、精炼和 HCE 提示生成,论文也承认这是基于该教师的分布;一旦离开 Gemini,复现质量和上界都不可控。其三,答案判定同样依赖 Gemini 3.1 Pro / Gemini 3 Flash 做语义裁决,评测本身有闭源依赖,跨论文严格可比性存疑。其四,RL 训练成本高昂(64 张 H200、单组 8 条 rollout、还要为全错组并行跑最多 3 次专家尝试和 15 次专家工具调用),且提示生成依赖专家在线可用。其五,评估仍以最终答案对错为核心奖励,对中间推理过程质量、工具调用合理性缺乏过程级监督。其六,论文为预印本「Work in progress」,代码/模型权重标注将放出但截至阅读时未必可用,部分超参与细节(如提示模板细节)需以正式版为准。
独立分析的弱点
第一,过度调用工具的系统性倾向。Beacon 的 $MA_{text}$ 仅 22.91%,在 BLINK、MathVista 等本可纯文本解题的简单题上仍有 78%–79% 的工具调用率,BLINK 上 Tool-Harm 达 11.15%。改进方向:在奖励里加入显式「调用成本」项,或对简单题的代码调用给予更强负惩罚,把延迟/算力作为软约束,让模型在边际收益低于阈值时收手。第二,强教师依赖。SFT 轨迹、精炼、HCE 提示三处都靠 Gemini 3.1 Pro,存在能力天花板与分布不匹配风险。改进方向:用自我蒸馏或在线拒绝采样逐步替换教师,或多教师集成降低单一偏差。第三,提示泄漏风险与可迁移性。HCE 靠专家提示回收难题,若提示隐含答案线索会造成训练-测试不一致。改进方向:加提示-答案无关性校验、用模型自生成提示(self-hint)形成自举闭环。第四,工具集单一,主要围绕图像操作,缺检索、外部知识、多图证据融合等更丰富工具,可扩展工具库与组合调用。第五,评测闭源化(用 Gemini 裁决答案)使跨论文严格对比困难,建议建立规则可复现的官方评测协议。
未来方向
作者未明确给出独立「Future Work」章节,但从论文设计可延伸出若干方向。其一,作者提到 hint 的 `tool_steps` 和 `subgoals` 字段目前只用作训练提示,未来可作为细粒度过程监督或奖励信号——这指向「过程级奖励」的强化学习,把奖励从「答案对错」细化到「每个工具步骤是否有效」。其二,HCE 的提示生成可从依赖外部强教师演进为策略自生成(self-generated hints),形成自举式能力扩展,摆脱对闭源模型的依赖。其三,工具调用成本与延迟可纳入奖励,让模型学会在「收益」与「开销」间权衡,实现真正按需、按预算的推理。其四,可将 NAAR+HCE 框架推广到视频、长文档、具身决策等需要更长程工具调用的场景,验证其通用性。其五,结合论文 E.1 中失败的「强制纯文本 rollout」教训,未来可探索更精细的在线难度估计(如用 pass@k 曲线而非单次成败)来稳健地标注是否需要工具,避免训练-测试分布错配。
复现评估
复现难度中等偏高。有利条件:基座 Qwen3-VL-8B-Instruct 开源;框架用成熟的 Megatron(SFT)与 VeRL(RL),论文给出关键超参(SFT 4 epoch、lr $1\times10^{-5}$、cosine 调度、128 micro-batch 累积;RL 1 epoch、lr $1\times10^{-6}$、组大小 128、PPO 裁剪 $\epsilon=0.2$、关闭 KL/entropy、最大序列 30,720 token、至多 12 次工具调用、冻结视觉编码器);数据来源(Geometry3K、OlympiadBench、AgentVista、MMMU、Vero 等 16 个)多为公开;评估基于开源 VLMEvalKit,并给出系统与 hint 生成提示模板。不利条件:SFT 轨迹、精炼、HCE 提示三处强依赖闭源 Gemini 3.1 Pro,答案裁决也用 Gemini,离开它难严格复现上界;RL 需 64 张 H200,算力门槛高。结合闭源依赖,整体属「方法可复现、上界难复现」层级。
论文图表
用「天气」「数蓝色弹珠」「羽毛球得分」三个例子对比三类模型:纯文本 MLLM 在难题上答错;传统智能体 MLLM 在简单题上也无脑裁剪、徒增开销甚至答错;Beacon 能对简单题直接作答、对难题自适应地调用并正确使用工具。直观展示「何时用」和「如何用」两个目标。
一张图就讲清了全文核心矛盾和论文卖点,是理解动机的最佳入口。