← 返回 2026-08-18

GenRouter:面向智能体图像生成的统一工作流路由 GenRouter: Unified Workflow Routing for Agentic Image Generation

Harold Haodong Chen, Zhiyu Hou, Wen-Jie Shu, Weilin Ruan, Yingjie Xu, Litao Guo, Ying-Cong Chen 📅 2026-08-17 👍 24 2026-08-23 18:30
文生图 智能体工作流 模型路由 高效推理

首个智能体文生图工作流路由框架,按提示需求动态分配最优管线,成本降95%延迟降65%

前置知识

Agentic 图像生成

在冻结的文生图模型(如 Qwen-Image)外层包裹 LLM 编排系统,按需调用搜索、推理、布局代码生成、验证、精修等工具,形成多步工作流,以解决外部知识、精确文字渲染、空间逻辑推理等复杂生成需求。代表作有 GEMS、Mind-Brush、GenClaw、SCOPE。

本文的 GenCanvas 就是对这些孤立管线的统一抽象,GenRouter 路由的对象正是这些工作流模板与生成器的组合。

模型路由与工作流路由

根据查询特征把请求动态分配给不同计算后端以平衡性能与成本。现有两派:学习式路由离线训练预测策略,任务分布漂移时易失效;经验式路由利用实时执行反馈持续精化。传统路由只做模型级选择,本文首次扩展到工作流拓扑级。

理解 GenRouter 属于经验式路由范式,是与 LLM-as-router、RouteT2I 等已有方案对比的坐标系。

Pareto 支配与非支配集

多目标优化概念:方案 a 支配方案 b,当且仅当 a 在所有目标维度上不差于 b 且至少一维严格更好。所有未被支配的方案构成 Pareto 前沿,代表各目标之间无法同时改善的最优权衡集合。

GenRouter 在质量、成本、延迟三个维度上做 Pareto 过滤,先剪掉被支配计划再做标量化选择,是该机制的直接应用。

任务签名 / 需求画像

用轻量模型把查询映射为结构化需求向量作为决策先验。本文将提示编码为七维签名 $z(x) \in \{0,...,5\}^7$,分别量化语义表达、事实接地、视觉参考、逻辑推理、组合启发、评估批判、空间布局七类需求的强度。

签名是候选剪枝(门控公式 5)与冷启动先验的核心依据,不理解它就无法理解路由决策如何产生。

Test-time scaling 与计算失配

推理时投入更多计算(提示改写、思维链、迭代验证)以换取更高质量的策略。计算失配指不分难度地把重型流程套用于所有请求:简单美学提示被迫经历昂贵推理与多轮精修,浪费成本且推高延迟。

这是本文动机的直接靶点——GenRouter 的全部意义在于按需分配测试时计算以消除失配。

研究动机

文生图模型的原始像素合成已基本成熟,社区焦点转向日益复杂的用户请求:外部世界知识、精确文字渲染、多步空间与逻辑推理。为此涌现了一批 agentic 图像生成框架:Mind-Brush 主攻外部多模态检索,GenClaw 用可执行视觉代码控制空间布局,GEMS 通过结构化技能承诺与迭代修复编排生成全流程,SCOPE 采用混合技能。但论文指出两个瓶颈:一是碎片化,各框架在孤岛上构建专用管线,固定拓扑难以融合不同能力;二是计算失配,“一刀切”范式把重型流程强加给每个请求,最简单的美学描述也要经过昂贵推理与迭代精修。量化后果触目惊心:在五个基准的平均任务上,GEMS 花费 59.70 美元、延迟 13.62 小时;而一个简单提示(十八世纪英国法官假发)经轻量 RewriteGen 只需 0.08 美元、6.85 秒即可完成——大量计算被浪费在与提示需求毫不匹配的环节上。

本文的目标是论文的核心研究问题是:如何有效地将异构提示路由到最优工作流,在视觉性能与计算成本之间取得平衡?具体目标分三层。其一,构建 GenCanvas——首个统一的 agentic 图像生成工作流空间,把碎片化的生成过程标准化为 8 个原子原语与 9 个分层模板,从轻量的 DirectGen 到最重的 HybridGen,让孤立管线(GEMS、GenClaw、SCOPE 等)都能映射到同一空间中。其二,在该空间上构建 GenRouter——经验引导的自演化路由器,为每个提示动态选择最优的(工作流模板,生成器)组合 $p=(w,g)$,通过需求画像、经验匹配与 Pareto 过滤三阶段决策缓解计算失配。其三,实证验证:在保持或超越静态管线视觉对齐的同时,执行成本削减 95% 以上、延迟降低 65%,并通过经验积累实现零样本泛化与持续自演化。

与已有工作不同的是,现有模型路由研究分两派:学习式路由离线训练预测策略但难以应对任务分布漂移;经验式路由利用实时执行反馈持续精化。但它们都只做模型级选择且几乎只面向 LLM。唯一的视觉域尝试 RouteT2I 仅在边缘与云生成器之间分发请求,仍在静态管线内扩展原始模型能力。本文的独特切入是双重的:空间上,首次把路由决策从“选哪个模型”扩展到“选哪条工作流拓扑 × 哪个多模态生成器”的联合空间 $\mathcal{P} = \mathcal{W} \times \mathcal{G}$;抽象上,不另造一条孤岛管线,而是把 Mind-Brush、GEMS、SCOPE 等既有框架的核心范式蒸馏、封装并扩展为统一原语库,使路由建立在整个结构化空间之上。由此,任何静态 agentic 框架都可被视为 $|\mathcal{P}|=1$ 的退化路由器,而 GenRouter 让重型原语仅在提示的内在认知复杂度确实需要时才被调用。

核心方法

直觉上,与其对所有提示套用同一条重型管线,不如依次回答三个问题:这个提示“需要什么能力”?历史经验表明“哪种计划划算”?在质量、成本、延迟三维权衡中“哪些候选值得考虑”?技术路线分三阶段。第一阶段需求画像:用轻量 LLM(Qwen3.5-4B)把提示映射为七维意图签名 $z(x)$,显式量化语义表达、事实接地、视觉参考、逻辑推理、组合启发、评估批判与空间布局七类需求的强度。第二阶段记忆引导匹配:候选计划经能力兼容与签名门控剪枝后,由双记忆系统估计每个计划的期望质量、成本与延迟——轨迹记忆检索 top-k 相似历史提示聚合实例级结果,路由记忆按签名分桶蒸馏桶级统计先验,二者置信加权融合。第三阶段 Pareto 过滤:剔除在三维中被其他计划支配的候选,最终在非支配集上最大化效用 $\hat{U}(p|x) = \hat{S} - \lambda_c \hat{C} - \lambda_l \hat{L}$,其中 $\lambda_c=5.0$、$\lambda_l=0.0006$。执行后真实结果回写记忆并周期性蒸馏,形成“路由—执行—蒸馏”的自演化闭环,全程无需任何梯度再训练。

核心创新有二。第一是 GenCanvas 的标准化:把 agentic 图像生成解构为 8 个原语 $\Pi = \{\pi_{rewrite}, \pi_{decompose}, \pi_{search}, \pi_{reason}, \pi_{skill}, \pi_{verify}, \pi_{refine}, \pi_{sketch}\}$,组合成四层 9 个模板——语义对齐层的 DirectGen/RewriteGen、外部接地层的 SearchGen/RefGen、结构推理层的 ReasonGen/SkillGen/SketchGen、迭代精修层的 VerifyGen/HybridGen,GEMS、GenClaw、SCOPE 等孤立管线的执行路径都被映射为其中的实例。第二是路由机制的三个本质区别:与 LLM-as-router 不同,GenRouter 不依赖语义相似度——文生图对意图漂移极度敏感,提示加上 "with the exact text 'ICLR 2027'" 后嵌入距离几乎不变,但生成需求剧变;它用显式七维签名做门控先验保证可解释与可校准,用双记忆经验替代参数化策略避免分布漂移失效,用 Pareto 过滤防止线性加权效用选出被支配计划,故决策可追溯、可自演化、无需再训练。

方法步骤详情

流程五步,输入为提示 $x$,输出为图像 $y$。步骤一画像:Qwen3.5-4B 将 $x$ 映射为签名 $z(x) \in \{0,...,5\}^7$,七个维度分别量化语义表达、事实接地、视觉参考、逻辑推理、组合启发、评估批判与空间布局,$\geq 3$ 视为高需求。步骤二候选剪枝:能力兼容检查(如 RefGen 需视觉条件化生成器)加签名门控——重型 HybridGen 仅当六个重需求轴中至少两个 $\geq 3$ 才激活,得到 $\mathcal{P}_{valid}(x)$。步骤三记忆匹配:轨迹记忆检索 top-k 相似历史提示并聚合同计划实例得 $\hat{S}_{traj}$;路由记忆按签名分桶蒸馏桶级统计 $\hat{S}_{route}$;融合 $\hat{S}_p = \alpha_p \hat{S}_{traj}(p) + (1-\alpha_p)\hat{S}_{route}(p)$,$\alpha_p$ 随记录数增大,冷启动回退到签名先验;同法估计成本与延迟。步骤四 Pareto 过滤:剪去在质量、成本、延迟三维中被支配的计划。步骤五执行与蒸馏:$\hat{p} = \arg\max_{p \in \mathcal{P}_{pareto}} \hat{U}_p$ 交由引擎执行(如 HybridGen 展开为 $\{\pi_{search}, \pi_{sketch}\} \to Loop(g \to \pi_{verify} \to \pi_{refine})$),真实结果回写轨迹记忆并周期性蒸馏进路由记忆。

技术新颖性

技术新颖性体现在四点。(1) 空间级首创:首个 agentic 图像生成工作流路由框架,决策空间从模型级扩展到模板拓扑 × 生成器的联合空间,数学上把既有框架统一为 $|\mathcal{P}|=1$ 的静态退化情形。(2) 双记忆架构:实例级轨迹记忆负责精准匹配,桶级路由记忆以统计聚合缓解数据稀疏,置信加权融合配合冷启动回退机制,使系统从签名先验平滑过渡到经验路由——这种“记忆而非训练”的自演化方式区别于学习式路由的离线策略训练。(3) 可解释门控:七维签名既是候选剪枝的硬约束(公式 5)又是效用估计的先验,决策可追溯到具体需求维度,规避了 LLM 路由器的校准失准与幻觉问题。(4) Pareto 过滤:在标量化效用之前先做多目标支配剪枝,消除线性加权伪影导致的病态选择——严格劣势计划可能因权重设置偶然得分更高。整个路由—执行—蒸馏循环无需梯度更新即可持续改进,零样本迁移实验证明其学到的是任务无关的路由先验。

Overview of our proposed (Left) GenCanvas and (Right) GenRouter.
Figure 3: Overview of our proposed (Left) GenCanvas and (Right) GenRouter.

实验结果

五个基准(WISE、DPG-Bench、OneIG-EN/CN、GenEval2)上的核心发现。发现一(RQ1):Qwen-Image 后端下 GenCanvas+GenRouter 五基准平均 71.3% 为全场最高(GEMS 68.7%),成本 2.97 vs 59.70 美元(降 95% 以上),延迟 4.68h vs 13.62h(降 65%);Z-Image 后端平均 68.1%,成本 3.06 vs 37.42 美元。分基准:WISE 上 0.88 vs 0.80(成本 1.57 vs 38.17);DPG-Bench 上 87.39 vs 85.59(成本 1.41 vs 60.31);GenEval2 上 71.6 vs 70.4。发现二(RQ2):路由分布随基准需求变化——美学主导的 DPG-Bench 有 68.83% 走 RewriteGen、21.03% 走 SkillGen;空间复杂的 OneIG-CN 有 28.48% 走 ReasonGen、10.61% 走 HybridGen。混合集上单用 HybridGen 得 73.53 分但需 6.27 美元/8.78h,GenRouter 以 73.52 同级性能只花 1.37 美元/1.76h,位于 Pareto 前沿。发现三(RQ3):累积三个基准经验后混合集性能 73.5 升至 75.2,成本/延迟再降 8.7%/7.9%;WISE 经验零样本迁移到 DPG-Bench 得 87.1 分(LLM-as-Router 86.4),成本减半,开放在线更新后升至 87.7 分/1.34 美元。

Core workflow templates and topological paths in GenCanvas. We abstract diverse generative demands into 9 structured templates over Π.
Table 1: Core workflow templates and topological paths in GenCanvas. We abstract diverse generative demands into 9 structured templates over Π.
Performance comparison on WISE, DPG-Bench and GenEval2 benchmarks. The best and second best results are highlighted.
Table 2: Performance comparison on WISE, DPG-Bench and GenEval2 benchmarks. The best and second best results are highlighted.
Performance comparison on OneIG-Bench benchmarks. “Average” includes five benchmarks’ results in both Tables 2 and 3.
Table 3: Performance comparison on OneIG-Bench benchmarks. “Average” includes five benchmarks’ results in both Tables 2 and 3.
Generated images using our proposed GenRouter within GenCanvas.
Figure 1: Generated images using our proposed GenRouter within GenCanvas.
Qualitative comparison. Left side shows cost (scaled by 0.01); right side shows latency.
Figure 4: Qualitative comparison. Left side shows cost (scaled by 0.01); right side shows latency.
(Left) Routing distribution of GenRouter; (Middle) Utility comparison between isolated GenCanvas workflows; (Right) Zero-shot generalization on DPG-Bench with WISE experience.
Figure 5: (Left) Routing distribution of GenRouter; (Middle) Utility comparison between isolated GenCanvas workflows; (Right) Zero-shot generalization on DPG-Bench with WISE experience.
Self-evolution analysis.
Figure 6: Self-evolution analysis.
查看结构化数据
任务指标本文基线提升
WISE(常识与知识型生成) Perf(成功率) 0.88(Qwen-Image 后端),成本 $1.57 GEMS 0.80,成本 $38.17 +0.08,成本降低约 96%
DPG-Bench(细粒度提示跟随) Perf (%) 87.39,成本 $1.41,延迟 2.52h GEMS 85.59,成本 $60.31,延迟 15.23h +1.8 分,成本降 97.7%,延迟降 83%
GenEval2(组合多对象生成) Perf (%) 71.6(Qwen-Image),成本 $2.03 GEMS 70.4,成本 $40.43 +1.2 分,成本降低约 95%
五基准平均(含 OneIG-EN/CN) Perf (%) / 成本 / 延迟 71.3% / $2.97 / 4.68h(Qwen-Image) GEMS 68.7% / $59.70 / 13.62h +2.6 分,成本降超 95%,延迟降 65%
OneIG-EN(Z-Image 后端) Perf 0.570,成本 $6.67 GEMS 0.569,成本 $43.13 +0.001,成本降低约 85%

局限与改进

作者承认的局限:为保证跨工作流公平比较,生成器自身的推理延迟被显式隔离,报告的是工作流编排开销,端到端用户体验的改善幅度会小于表观延迟降幅;辅助原语后端(Serper 搜索、Kimi K2.5 推理与验证)在给定路由配置下保持固定,跨后端组合的泛化性未验证。我的补充观察:(1) 效用信号来自 GenEval/DPG 等自动基准分数,路由记忆学到的“质量”是基准指标意义上的质量,可能与人类审美偏好错位;(2) 模板空间限定为 9 个预定义拓扑,无法组合出模板之外的新工作流结构,表达上限受人工设计约束;(3) 案例研究中 SketchGen 的延迟优势几乎为零(28.95s vs GEMS 29.12s),轻量模板的收益集中在成本而非时延;(4) 画像器 Qwen3.5-4B 的签名错误会经由门控传播到下游候选剪枝,纠正依赖执行反馈的滞后回流;(5) 零样本迁移实验只在 WISE 到 DPG 一对域上验证,跨更远域(如 ArtiMuse 艺术审美类)的泛化尚未测试。

独立分析的弱点

独立分析的弱点与改进方向。(1) 七维签名为 0–5 整数分级,粒度粗糙:两个同标 $z_{lay}=4$ 的提示实际难度可能天差地别。改进:让画像器输出连续需求强度并附置信度。(2) 轨迹记忆以 top-k 相似提示聚合,长尾提示可能检索到不相关经验并污染效用估计。改进:把现有记录数比例 $\alpha_p$ 升级为分层贝叶斯收缩等不确定性加权。(3) Pareto 过滤后仍需固定 $\lambda_c=5.0$、$\lambda_l=0.0006$ 做标量化选择,无法适配不同用户的成本/质量偏好。改进:暴露偏好向量接口或在线学习 $\lambda$。(4) 失败执行的代价已实际付出,事后记录只惠及未来请求。改进:执行前叠加成本上限预测器做预算守护。(5) 新原语/模板仍需人工定义拓扑与门控规则。改进:从执行轨迹中自动挖掘频繁子图,半自动合成新模板。(6) 评测均为静态基准,真实生产中提示更长尾更口语化,签名阈值 $\geq 3$ 的鲁棒性存疑。

未来方向

作者提出的方向:持续经验蒸馏以实现长期自优化,扩展 GenCanvas 的模板库与原语种类,强化零样本泛化能力。基于本文成果可延伸的研究:(1) 从离散模板路由走向工作流自动合成——以原语库为词表、执行轨迹为监督信号,让系统自己发明新的拓扑结构;(2) 引入用户可调的多目标偏好模式(质量优先/成本优先/极速模式),替代固定 $\lambda$ 系数,实现个性化的效用函数;(3) 将 GenCanvas 抽象外推到视频生成、3D 资产、音频等多模态任务,检验八原语分解的跨域通用性;(4) 用真实用户反馈或奖励模型替代基准分数作为效用信号,弥合 benchmark-human gap;(5) 研究经验记忆的治理机制:历史经验的隐私删除、过期蒸馏与灾难性遗忘防护;(6) 路由与生成器微调的联合优化——把路由选择概率纳入生成模型的奖励塑形,实现 reward-aware 协同适应;(7) 多机部署下的全局经验共享与联邦式路由记忆,让多个 GenRouter 实例互相蒸馏加速冷启动。

复现评估

复现条件较好。代码与 GenCanvas 框架已开源(github.com/EnVision-Research/GenRouter),提供 9 个模板完整实现、即插即用的原语/生成器替换接口,开箱支持 GenEval、DPG-Bench、WISE、LongText-Bench、SpatialGenEval、ArtiMuse 评测,原生记录延迟与 token 消耗。所需资源:本地部署 Qwen3.5-4B 做画像(消费级 GPU 可行);Kimi K2.5 API 承担推理/验证原语(主要开销——GEMS 式重型管线五个基准烧掉 59.70 美元,完整复现多基准对比需数百美元 API 预算);Serper 搜索 API;Z-Image-Turbo 与 Qwen-Image-2512 权重。难度评估:核心路由逻辑(画像、双记忆、Pareto 过滤)为纯 Python 实现,代码级复刻不难;门槛在评测成本与时间——单方法单基准延迟 2–14 小时,完整表格需数天机时。建议先在较小的 WISE 上复刻 GenRouter 与 GEMS 对比以验证管线正确性。