← 返回 2026-08-06

ToolArtist: 面向智能体式图像生成的工具使用统一多模态模型 ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun, Fengwei Teng, Chengwei Qin, Xiaobin Hu, Jun Xu, Shuicheng Yan 📅 2026-08-05 👍 56 2026-08-11 18:30
Emu3.5 GRPO 后训练 开放世界生成 强化学习 智能体式图像生成 检索增强生成 统一多模态模型

让统一多模态模型自主推理、调用工具并原生生成图像。

前置知识

统一多模态模型 (Unified Multimodal Model, UMM) 与 Emu3.5

UMM 把文本与图像都表示成离散 token,统一在同一个自回归序列里用 next-token prediction 建模,公式为 $p_\theta(x) = \prod_{j=1}^{L} p_\theta(x_j \mid x_{<j})$,其中 $x_j \in \mathcal{V}_\text{text} \cup \mathcal{V}_\text{visual}$。Emu3.5 是这一路线的代表,把图文交错数据统一训练,既能理解图像、也能原生生成图像(不依赖外部扩散生成器)。ToolArtist 正是后训练在 Emu3.5 上构建的。

本文的「完全智能体」要求模型自己产出图像 token $v_t$,而不是委托给外部生成器;这只有在 UMM 这种原生自回归多模态框架里才成立。不理解 UMM,就无法理解为什么 ToolArtist 能把『画图』变成与『思考、调工具』并列的动作。

智能体式图像生成与两类既有范式

智能体式图像生成指把『理解指令、搜索证据、决定画什么、最终出图』组织成一个 agent 与世界交互的过程。已有方法分两类:(1) UMM-based 工作流范式:给 UMM 加上工具调用,但推理→搜索→生成的顺序预先固定;(2) 提示优化智能体(Prompt Optimization Agent):用一个搜索 agent 把用户指令改写成 grounded prompt,再交给外部生成器。两者中『生成』都不是模型可自由发起的动作。

ToolArtist 的核心立场是『生成必须是同一 policy 的自主动作』,这是对上述两类范式的根本性反驳。看懂这两类范式才知道 ToolArtist 在反对什么、又填补了什么空缺。

ReAct(Reasoning + Acting)交互范式

ReAct 是让 LLM 交替输出「思考 $r_t$」和「动作 $a_t$」的通用 agent 范式:$(r_t, a_t) \sim \pi_\theta(\cdot \mid H_{t-1})$。动作可以是调用工具,也可以是给出最终答案。模型基于完整历史 $H_t$ 决定下一步,可多轮迭代。ToolArtist 把这一范式扩展到多模态,新增了『画图』动作 $a_t \in \mathcal{A}_\text{draw}$。

论文把图像生成形式化为 $A_\theta = (\pi_\theta, \mathcal{T}, \mathcal{W})$ 这一 ReAct 实例,并定义了『画图不终止交互、画完还能再搜再改』。必须先吃透 ReAct 的 history-conditioned 决策结构,才能理解 RAD-GRPO 的奖励如何沿轨迹反向传播到推理与工具使用。

GRPO(Group Relative Policy Optimization)

GRPO 是 DeepSeek 提出的免 critic 的强化学习算法:对每个 prompt 采样一组 $B$ 条轨迹,用组内相对优势 $\hat{A}_i = \frac{\hat{R}_i - \text{mean}(\{\hat{R}_b\})}{\text{std}(\{\hat{R}_b\}) + \varepsilon}$ 代替基线估计,配合 clip 比率 $\rho_{i,j}(\theta)$ 与 KL 正则,目标形如 $\mathbb{E}\big[\frac{1}{B}\sum_i \frac{1}{L_i}\sum_j M_{i,j} \min(\rho_{i,j}\hat{A}_i, \text{clip}(\rho_{i,j}, 1-\epsilon, 1+\epsilon)\hat{A}_i) - \beta \widehat{D}_{KL}^{i,j}\big]$。

本文提出的 RAD-GRPO 是 GRPO 的多模态扩展:同一轨迹级优势 $\hat{A}_i$ 同时优化推理 token、工具调用 token 和原生图像 token。不熟悉 GRPO 的 advantage 归一化与 KL 约束,就难以理解作者如何把『最终图像好坏』的奖励传回搜索与推理过程。

WISE 与 WorldGenBench-Humanities 评测基准

WISE 含 1000 条 prompt、覆盖 25 个子域,分文化常识、时空推理、自然科学三大类,用 LLM-as-judge 的 WiScore(图文一致 0.4、真实性 0.3、美学 0.3 加权)评分。WorldGenBench-Humanities 覆盖 244 个国家地区、732 条 prompt,按大洲组织,对每张图用『知识清单满足度』KCS 打分(如合适服饰、当地建筑、地标、植被、海岸线、可读标签等)。

论文几乎所有核心数字都在这两个基准上(WISE 0.79、WorldGenBench 22.10)。读 Table 1 时必须先理解 WiScore 与 KCS 的口径,才能判断 ToolArtist 相对 Unify-Agent 15.58、GenSearcher 13.66 的领先究竟意味着什么。

策略支持掩码(Policy-Support Masking)

在 agent 轨迹序列里,token 分两类:模型自回归生成的(思考 $r_t$、动作 $a_t$,含工具调用和图像 token)属于集合 $\mathcal{T}$;用户指令 $q$ 和环境返回的观测 $o_t$ 属于 $\mathcal{O}$。第 $j$ 个序列化 token 的掩码 $M_j = \mathbb{I}[y_j \in \mathcal{T}]$。训练目标只对 $\mathcal{T}$ 计损失,$\mathcal{O}$ 仅作条件上下文。

这是 ToolArtist 把 SFT 与 RL 都对齐到『只学习策略自己生成的行为』的关键。没有这个掩码,模型会把搜索返回的网页文本也当作要模仿的输出,从而把 agent 退化成复读机。看懂掩码才能看懂 SFT 损失 $\mathcal{L}_\text{SFT}$ 与 GRPO 目标里的 $M_{i,j}$。

研究动机

现代 T2I 模型(FLUX、SD3.5、PixArt 等)在结构、细节、美学上已经非常出色,但在『开放世界图像生成』上仍然不可靠。WISE 与 WorldGenBench 等基准表明,一旦请求需要复杂语义理解、多跳推理、长尾知识、严格事实约束或时效性信息,模型常常产出『视觉上合理但事实错误』的图。例如 WorldGenBench-Humanities 中 1955 年索科特拉岛采集龙血树脂的场景,需要正确的传统刮刀、龙血树、海岸线、当地牲畜等十多项清单项;FLUX.1-schnell 在 WISE 上仅 0.40、SD-XL 仅 0.43、PixArt 仅 0.47,而 WorldGenBench-Humanities 上多数通用生成器均值仅 9-13 分。根本原因在于关键信息往往不在用户 prompt 里,也无法可靠地固化在模型静态参数中,必须主动从外部世界获取。

本文的目标是本文的具体目标是构建一个『完全智能体』(fully agentic)的图像生成模型,让『推理、调用外部工具、原生生成图像』这三件事统一在同一个 UMM policy 下,由模型自己决定何时搜索、何时画图、画得不好要不要再改。作者想证明:把整个开放世界图像生成流程交给一个统一的 agent policy,比任何『固定工作流』或『只把一部分流程交给 agent』的方案都更好。在数值上,作者瞄准在 WISE 与 WorldGenBench-Humanities 上同时超过开源 UMM 与现有『部分智能体化』的方法,并在物理学、化学等知识密集型类别上接近甚至接近闭源前沿模型。

与已有工作不同的是,已有工作的独特盲点是『生成从来不是 agent 的自主动作』。工作流范式(如 Unify-Agent)把『理解→搜索→证据聚合→合成』预设成固定流水线,搜索与生成的顺序写死;提示优化范式(如 GenSearcher)则让 agent 在生成前终止,把合成委托给外部生成器。两者都没学到从『识别知识缺口→选工具→用证据→产出最终视觉输出』的完整决策链。ToolArtist 的切入点恰恰是把『画图』提升为与工具调用并列的、policy 可以自由发起并迭代的原生动作,画完不终止交互,还能继续搜、继续改。这种『把生成嵌入 agent loop』的设计在 T2I 领域此前是没有的。

核心方法

整体思路是『SFT 初始化 + RL 精修』两阶段后训练一个 UMM(Emu3.5)。直觉上,先让一个带搜索工具和外部生成器(gemini-3-pro-image-preview)的『教师 agent』走一遍完整的多轮搜索-生成轨迹,再把这条轨迹『翻译』成 UMM 能直接学的格式——具体是隐藏掉外部生成器调用,但保留它生成的图像,让图像以原生 visual-caption span $g_t$ + visual-token span $v_t$ 的形式出现在序列里。这样教师『调外部工具画图』的行为就被转换成了『UMM 自己原生画图』的监督。技术路线上:SFT 用 7,132 条高质量轨迹建立推理-搜索-画图的基础能力;RL 用新设计的 RAD-GRPO 在真实在线交互上端到端优化整条 policy,通过双重奖励把结果级反馈反向传给推理、工具使用和图像生成。

核心创新是『把原生图像生成变成 agent policy 的一个动作』,而非外部委托或预设阶段。这有三个本质区别:第一,与提示优化范式相比,ToolArtist 的最终视觉 caption $g_t$ 和图像 token $v_t$ 都由 UMM 自己产出($a_t = (g_t, v_t)$),不交给独立生成器;第二,与工作流范式相比,搜索与画图的出现顺序、次数、是否发生都由 policy 在演化上下文中决定,没有固定流程;第三,画完图后图像留在多模态历史里,policy 可以检视自己画的结果、发现缺失或错误、再调搜索、再改图——这实现了真正的『自我修订』闭环。这种『reason-act-draw 一体化』是 RAD-GRPO 能把奖励传到全链路的前提。

方法步骤详情

训练分四步。(1) Rollout:教师 agent 按用户指令做多轮交互,调用 TextSearch(Google + Jina/LLM Reader 摘要并兜底)、ImageSearch(过滤不可下载页面、用 LLM Reader 判断相关性、返回可用参考图与来源摘要)和外部图像生成器,得到交替的『推理→搜索→再推理→画图』原始轨迹,搜索是增强版以稳定证据质量。(2) Convert:把原始轨迹改写成 UMM 监督样本——搜索返回的文本和图像保留在上下文里;外部生成步骤不再当工具输出,而是改写成『原生多模态生成』:调生成器的 prompt 写成 caption span,后接对应图像 token;若轨迹在终图前失败、或图像加载/分词/上下文长度校验失败,整条样本丢弃。(3) SFT:对转换后的 $D_\text{SFT}=\{(x_i,y_i)\}_{i=1}^N$,目标 $\mathcal{L}_\text{SFT}(\theta) = -\mathbb{E}\frac{\sum_j M_{i,j}\log P_\theta(u_{i,j}\mid u_{i,<j})}{\sum_j M_{i,j}}$,只监督 $\mathcal{T}$ 中的推理与动作 token。(4) RAD-GRPO:对每个 prompt 在线采样 $B$ 条与环境交互的轨迹,用意图奖励 $R_I$、质量奖励 $R_Q$(忠实度 0.1、视觉正确性 0.4、文字准确性 0.4、美学 0.1 加权,无文字任务文字项退回 0.5)、格式奖励、画图信号、长度惩罚、不画图惩罚合成最终奖励 $\hat{R}_i$,再用 token-归一化 GRPO 目标优化,KL 项把策略拉回冻结的 SFT 参考策略。推理时 policy 自主决定交互路径并终止于最后一次画图。

技术新颖性

技术新颖性集中在四处。第一,把『原生图像生成』首次明确纳入 agent 的动作空间,并设计了『生成不终止交互、画完可继续搜与改』的多轮修订语义,这是对工作流与提示优化范式的根本性突破。第二,提出轨迹转换(convert)机制:通过隐藏外部生成器调用、保留生成结果作为原生 visual-token span,把教师『用外部工具画图』的蒸馏难题转化为 UMM 自生成监督,避免了显式策略蒸馏的复杂性。第三,提出 RAD-GRPO——首个为 UMM agentic 图像生成设计的 token-归一化 GRPO,用同一轨迹级优势 $\hat{A}_i$ 同时优化推理、搜索与图像 token,配合意图+质量双重奖励把结果反馈传到全链路。第四,设计了配套的『策略支持掩码』使 SFT 与 RL 都只学习 policy 自身生成的行为,并辅以画图信号与不画图惩罚防止策略坍缩为『只搜索不画图』,这些都是 agentic 多模态 RL 工程上的首次系统化处理。

Post-training data and policy trajectory.
Figure 3: Post-training data and policy trajectory.
Distribution of retained SFT trajectories.
Figure 6: Distribution of retained SFT trajectories.

实验结果

核心发现分三层。第一层是主表(Table 1):在 WISE 上 ToolArtist 取得 Overall 0.79,超过 Unify-Agent 0.77、GenSearcher-Qwen-Image 0.77 等所有 agentic 基线;在知识密集的 Physics 0.81、Chemistry 0.79 上接近闭源 Nano Banana(0.86/0.85),仅在 Time 0.62、Space 0.75 落后于 Nano Banana 的 0.80/0.89 与 Unify-Agent 的 0.75/0.74,说明推理与时序类别仍有差距。在 WorldGenBench-Humanities 上 ToolArtist 取得最佳非专有均值 KCS 22.10,显著高于 Unify-Agent 15.58、GenSearcher 13.66,也高于文中提到的最强开源基线 Qwen-Image 的 21.76;大洲级别上 ToolArtist 在 Africa 24.44、Antarctica 17.13、Asia 26.19 上领先,Qwen-Image 在欧洲/北美/大洋洲领先,Unify-Agent 在南美领先。第二层是消融(Table 2):去掉 image_search 的来源感知摘要,WISE Overall 从 0.79 跌到 0.61(−0.18),其中 Biology 跌幅最大(0.75→0.25,−0.50),证明把参考图绑定到网页来源摘要对需要精确事实身份的场景至关重要。第三层是 RL 动力学(Figure 4):奖励从约 0.37-0.40 稳步升到约 0.41,actor 熵从 12.03 缓降到 11.87-11.91 且无熵崩塌,说明策略稳定收敛到更高奖励的行为。五个 WorldGenBench 案例(Table 3-7)显示 ToolArtist 在传统工具、服饰、储物容器、牲畜、海岸线等清单项上系统优于两个对手,例如索科特拉案例 KCS 0.625 vs Unify-Agent 0.000 vs GenSearcher 0.250。

Main results on WISE and WorldGenBench-Humanities.
Table 1: Main results on WISE and WorldGenBench-Humanities.
Ablation of source-aware summaries in image_search.
Table 2: Ablation of source-aware summaries in image_search.
Checklist evaluation for the Socotra case.
Table 3: Checklist evaluation for the Socotra case.
Checklist evaluation for the Whitechapel case (Appendix).
Table 4: Checklist evaluation for the Whitechapel case (Appendix).
RAD-GRPO training dynamics.
Figure 4: RAD-GRPO training dynamics.
A case on WorldGenBench-Humanities (Socotra resin-collection scene).
Figure 5: A case on WorldGenBench-Humanities (Socotra resin-collection scene).
查看结构化数据
任务指标本文基线提升
WISE(25 子域,1000 prompt,LLM-as-judge WiScore) WiScore Overall(0-1) 0.79(Cul.0.87 / Time0.62 / Space0.75 / Bio.0.75 / Phys.0.81 / Chem.0.79) Unify-Agent 0.77、GenSearcher-Qwen-Image 0.77、BAGEL+CoT 0.70、Emu3.5 0.49、FLUX.1-dev 0.50、Nano Banana-Pro 0.87 超过全部非专有 agentic 与 UMM 基线;Physics 0.81、Chem.0.79 接近闭源 Nano Banana-Pro(0.86/0.85),仅 Time/Space 落后
WorldGenBench-Humanities(244 国家/地区,732 prompt,知识清单满足度 KCS) KCS 均值(百分制) 22.10(AF24.44/AN17.13/AS26.19/EU18.69/NA19.52/OC20.97/SA19.44) Unify-Agent 15.58、GenSearcher-Qwen-Image 13.66、Qwen-Image(最强开源) 21.76、BLIP3o-8B 13.63、Emu3.5 13.17 比 Unify-Agent +6.52、比 GenSearcher +8.44、比最强开源 Qwen-Image +0.34;AF/AN/AS 三洲第一
image_search 来源感知摘要消融(WISE) WiScore Overall 0.79(完整工具链) 去掉摘要后 0.61(Biology 跌至 0.25) 来源摘要带来 +0.18 Overall,Biology +0.50,验证把参考图绑定到网页来源的关键作用
RL 训练动力学(RAD-GRPO) Overall Reward / Actor Entropy 奖励 0.37→0.41,熵 12.03→11.87-11.91 无崩塌 SFT 初始化起点 在线搜索-画图轨迹质量稳步提升,策略稳定收敛无熵崩塌

局限与改进

作者承认的局限:(1) 在 WISE 的 Time(0.62)和 Space(0.75)类别上仍落后于闭源 Nano Banana 系列(0.80/0.89),时序与空间推理是短板;(2) WorldGenBench-Humanities 大洲级别并非全面领先——欧洲、北美、大洋洲由 Qwen-Image 领先、南美由 Unify-Agent 领先;(3) 即便 ToolArtist 拿下最高均值,单个案例(索科特拉、莫雷阿岛)也只能满足约一半清单项,说明对极度细粒度的地域文化知识仍力不从心。我的额外观察:(4) 全部评测依赖外部在线搜索(Google + Jina Reader),结果质量受搜索召回与时效性制约,论文未报告搜索失败/网络不可用时性能下降幅度;(5) RL 的奖励信号来自 LLM-as-judge(含意图奖励与四维质量奖励),存在判官偏差与同源偏置风险,但论文未做判官稳健性分析;(6) 教师轨迹用了 gemini-3-pro-image-preview,可能引入其风格偏置;SFT 数据 7132 条规模相对小,泛化边界未充分验证;(7) 计算成本(在线 RL 每步都要走多轮工具调用+图像生成)未报告,实际延迟可能较高。

独立分析的弱点

独立审视有五个弱点。第一,搜索依赖外部黑箱(Google+Jina),结果稳定性与可重复性受限;改进方向是把搜索结果缓存与去重、并引入一个轻量的『知识置信度』估计,让 policy 在证据不足时主动追问用户而非硬画。第二,奖励完全靠 LLM-as-judge,存在判官偏置;改进方向是引入基于真实图像检索(如以图搜图取 ground truth)或人类标注抽检作为校准,或用多判官集成降低单点偏差。第三,SFT 仅 7132 条、且覆盖 11 个主题分布不均(Sports 仅 0.8%、Business 1.7%),长尾主题(体育、商业)样本稀少;改进方向是针对薄弱主题做定向数据采集或主动学习。第四,未在 WISE 的 Time/Space 类别取得领先,说明模型对『何时发生、物体相对位置』的推理弱;改进方向是在 RL 奖励中加入显式的时空一致性奖励(如要求画里出现时钟/季节/方位线索并由判官核验),或在 SFT 中混入更多时序-空间任务。第五,未报告推理延迟与成本,且每次 RL roll-out 都要走多轮搜索+画图,训练与推理都很贵;改进方向是引入『搜索预算自适应』——让 policy 学会用更少的工具调用达到同等质量,并对工具调用次数设软约束。

未来方向

作者隐含的未来方向包括:扩展到更长的 agentic 轨迹、更多工具(除文本/图像搜索外的计算、地图、知识图谱工具)、以及更强的自我修订。基于此我可延伸四条:(1) 多模态工具扩展——加入视频搜索、3D 资产检索、文字渲染工具等,让 agent 能画含复杂可读文本或 3D 一致的图(当前 Text Accuracy 在无文字任务退回 0.5 暴露了文字渲染短板)。(2) 在线/持续学习——把 ToolArtist 接入实时知识源(新闻、维基更新),让模型对时效性 prompt(如『最近的某事件』)保持新鲜,并设计遗忘与漂移控制。(3) 更细粒度的奖励分解——把当前四维质量奖励扩展为按 checklist 项的稀疏奖励,让 policy 知道『缺了哪一项』并定向补搜补画,对应 WorldGenBench 的 KCS 协议。(4) 安全与可控性——设计机制让 agent 拒绝生成侵权 IP、隐私人物或误导性内容,并在 RL 中引入安全奖励,这是 agentic 图像生成走向部署的必经之路。

复现评估

复现评估较高。开源情况:作者明确发布 SFT 训练数据(HuggingFace: bubble65/EMU-Agentic-PostTrain-Data)与完整 SFT+RL 基础设施(GitHub: bubble65/EMU-Agentic-PostTrain),还附带 Appendix A.1 的完整 prompt(教师 agent、ToolArtist 推理、LLM Reader)与 A.4 的原始 rollout 示例,工程细节透明。数据可获得性:WISE 与 WorldGenBench-Humanities 均公开;Emu3.5 基座开源;教师用的 gemini-3-pro-image-preview 与 Google/Jina 搜索需 API 配额,有商业化门槛但可替换。算力需求:论文未给确切数字,但 RL 阶段每个 prompt 要采样 $B$ 条多轮在线轨迹、每条都含若干次搜索与原生图像生成,叠加 Emu3.5 这一较大 UMM 的前向反向,预计需要多卡多日,且在线交互带来不可忽略的延迟。复现难度:SFT 相对直接(有数据与脚本),RAD-GRPO 是本文创新核心,需要正确实现 token 级 policy-support mask、轨迹级 group advantage、意图+质量双奖励判官,以及搜索/画图工具的环境封装,门槛高于普通 SFT;判官 LLM 与基线(Unify-Agent、GenSearcher)的复现也需要额外对齐。综合看,有经验的 agentic RL 团队可在中等算力下复现主表趋势,但要精确复刻所有数字仍需对判官与搜索栈做细致对齐。