← 返回 2026-09-09

智能体视觉生成:从生成模型到智能体控制 Agentic Visual Generation: From Generative Models to Agentic Control

Yinming Huang, Shuyuan Tu, Xi Yan, Jiahao Zhan, Zihan Yang, Zhen Xing, Hui Zhang, Tiehua Zhang, Yu-Gang Jiang, Zuxuan Wu 📅 2026-09-06 👍 29 2026-09-12 18:30
LLM控制器 图像与视频生成 强化学习 智能体视觉生成 综述 评估方法

按控制器决策的最大因果触达,把智能体视觉生成统一划分为 L0–L4 五层的综述与评估框架

前置知识

视觉生成模型(扩散模型等执行器)

指从条件 $c$ 映射到视觉输出的模型,如 Latent Diffusion、SDXL、Video Diffusion Models、DreamFusion,以及 ControlNet、InstructPix2Pix 等可控生成/编辑器。它们执行 $y = G(c)$ 这条固定推理路径:给定条件就产出图像、视频或 3D 内容,但自身不决定"该执行哪个操作"。

本文全部层级划分都围绕"谁来控制这些执行器"展开,理解执行器的固定推理路径是理解 L0 边界的前提。

智能体与控制器(LLM/VLM Controller)

智能体是根据观测选择动作、维护状态并使后续决策随之改变的目标导向系统。在视觉生成中,控制器通常是一个 LLM、VLM 或多模态大模型,负责提示改写、布局规划、模型路由、结果验证、停止判断等中间决策;它可以是多模型协作,也可以是单一统一模型。

论文的核心论点是"智能体性由控制器的决策范围决定,而非模型数量或架构",必须先理解控制器这一角色分离。

最大因果触达(Maximum Causal Reach)

论文提出的单一分类判据:沿生成轨迹看,观测到的证据最晚能在哪个时点改变一个未来的生成决策。条件构造先于执行(L1)、操作选择决定执行(L2)、任务内观测可以改向后续动作(L3)、完成任务的经验可以改变之后独立任务(L4)。形式化为能力向量 $c(S)$ 与主层级 $L(S)=\max\{i: c_i=1\}$。

这是全文的分类学基石,L0–L4 每一层的定义、边界案例判定和评估设计都由它推出。

工具调用与工作流编排

指控制器把生成器、编辑器、检索器、渲染器等当作可调用工具,按数据流与兼容性约束组合成操作序列或可执行图(如 Visual ChatGPT 的工具路由、ComfyUI-Copilot 的节点图)。关键在于:选了什么操作、按什么顺序执行,而结果未必反馈回来。

L2 执行控制的全部子系统都以此为实现载体,也是论文区分"有工具"和"有反馈"的对象。

强化学习与奖励微调(RLHF/GRPO/DPOK)

用奖励信号优化策略参数的方法族,如 DPOK 用图像奖励微调扩散参数、ReasonGen-R1 先 SFT 再 GRPO。论文强调 RL 只是优化手段:被优化的可以是固定生成器、路由器、修复策略或记忆策略,系统层级取决于学到的策略在推理时的动作空间与因果触达。

第 IX 章专门用"训练不决定层级"澄清常见误解,成本感知奖励 $r_t = \alpha r^{goal}_t + \beta r^{process}_t - \lambda c(a_t)$ 也依赖这一背景。

反事实评估与选择偏差

通过受控对比把收益归因到具体决策:匹配生成器、工具、预算与评估器后,仅增删一类控制器能力(如去掉闭环反馈的开环变体)。选择偏差指多候选择优报告会伪装成自适应修复——最好的样本可能来自选择器而非诊断与修复能力。

第 X 章层级条件化评估协议的全部说服力都建立在这套因果对比思想上,也是读懂 L3/L4 评估要求的前提。

研究动机

视觉生成的单次采样质量已大幅提升——DALL-E 3、SDXL、视频扩散模型等把文本到图像/视频的对齐与美感推到很高水平,但 T2I-CompBench、GenEval、VBench、EvalCrafter 等基准持续暴露组合性错误、对象绑定失败、时序与感知缺陷:评估器能诊断问题却不能修复问题。于是社区转而给生成系统外挂 LLM/VLM 控制器,涌现出大量自称 agentic 的工作,并把规划深度、工具调用、多角色协作、强化学习当作智能体性的证据。论文指出这些标准都不可靠:一个多规划器流水线可以仍是开环的固定路径(角色数不改变因果链),一个带丰富工具箱的控制器若生成结果不改变下一个动作也只是选路器,一个用 RL 训过的固定生成器在推理时可能没有任何控制器决策。文献因此高度碎片化:跨图像、视频、编辑、3D、世界、幻灯片、UI 七类任务,用什么标准判定"一个系统何时成为智能体"缺乏一致答案,导致不同系统之间的能力比较基本失效。

本文的目标是本文要建立一套可复现的组织框架和评估方法:第一,用"控制器能直接改变的最晚未来生成决策"(最大因果触达)定义智能体性,把系统划分为 L0 固定支持到 L4 经验自适应五个层级,并明确 L0 是纳入边界——独立的生成器、检索器、评估器或固定流水线本身不算智能体视觉生成系统;第二,在每个层级内用"受控对象+技术实现"第二轴细分子类,覆盖条件构造、操作选择、反馈来源和经验载体;第三,构建跨七个任务集合、去重后 313 个系统的结构化语料库,标注层级、日期、模态、机制、反馈边界等字段并开源;第四,提出层级条件化评估协议,在匹配生成器、工具、预算与评估器的条件下,隔离每一级新增决策的边际价值。

与已有工作不同的是,本文的独特切入是用"因果触达"这个单一标准取代常见的多维模糊标准。已有综述习惯把 planning、tool use、multi-agent、RL 当作并列能力维度,但论文证明它们只是实现机制:决策最晚时点才是可比较、可跨模态移植的量——分镜规划器和空间布局规划器都是 L1(决策止于规格),图像路由器和 3D 资产选择器都是 L2(选择并调用操作),无论表示形式如何变化,因果测试不变。由此推导出一系列反直觉判定(Table II):提示重写加固定生成器只是 L1;批评加修复才是 L3;只保留当前任务状态不超过 L3;可复用技能才是 L4;RL 训练的固定生成器是 L0/L1,因为层级看推理时动作空间而非优化器。此外,本文不把"生成器即控制器"当作第六层,而是用同一测试去框定这个未来范式,保持了框架的前后一致性。

核心方法

先直觉:一个生成系统是否"智能",不看它用了多少模型、多大参数、什么训练方法,而看观测到的证据最晚能在因果链的哪个位置改变一个未来的生成决策。技术路线上,论文先形式化:设用户目标为 $g$,当前多模态状态为 $s_t$,动作 $a_t \sim \pi(a_t \mid g, s_t)$,环境转移 $s_{t+1} = F(s_t, a_t, o_{t+1})$ 可包含新生成的图像、视频片段、场景、批评或检索参考,目标是平衡指令满足、一致性、可控性、延迟、成本与人工。随后定义能力向量 $c(S) = (c_1, c_2, c_3, c_4)$,四个分量分别表示规格构造、操作选择、任务内结果适应、跨任务经验复用的演示证据,主层级取 $L(S) = \max\{i : c_i = 1\}$。五个层级依次为:L0 固定支持(生成器/编辑器/检索器/评估器/奖励模型/基准/固定流水线,纳入边界);L1 条件控制(为预定执行器构造提示、布局、检索证据、时间/相机或结构化规格,接口为 $c = \pi(g)$ 后接 $y = G(c)$);L2 执行控制(选择并调用生成器、编辑器、程序或工作流);L3 结果自适应(观测中间结果并据此改变当前任务内的后续操作);L4 经验自适应(保留完成任务的经验 $m_{n+1} = U(m_n, E_n)$ 并改变后续独立任务的决策)。判定时从最高级向下测试,证据不足则保守归低级。

核心创新是把"智能体性"从架构描述问题转化为因果链上的时间定位问题:最大因果触达。它与已有工作的本质区别有三点。其一,单一判据取代多维标注——规划、工具、多角色、RL 都只是机制轴上的实现方式,不决定层级,于是"multi-agent"“self-reflective”“self-evolving”等标题词汇不再能作为证据;Table II 给出八类边界案例的判定:生成器/编辑器选择是 L2,批评加修复是 L3,仅当前任务状态不超过 L3,可复用技能是 L4,RL 训练的固定生成器是 L0/L1,多规划器分镜加固定执行器是 L1,无后续动作的候选打分是 L0。其二,层级是丰富设计空间向最大因果触达的投影,输出质量和实现复杂度被显式分离为独立评估维度,使"决策范围多宽"这一个比较变得可读。其三,判据模态无关且决定了匹配评估设计:每一级对比只增加一类控制器决策,其余(生成器、工具、预算、评估器)全部固定,这直接催生了第 X 章的层级条件化评估协议。

方法步骤详情

第一步,角色分离与形式化:区分控制器(LLM/VLM、学习策略或角色团队)与视觉生成器/编辑器,给出 $a_t \sim \pi(a_t \mid g, s_t)$、$s_{t+1} = F(s_t, a_t, o_{t+1})$ 的决策过程描述,并规定单独的支持模块或固定流水线不入主范围。第二步,层级判定:按 L4→L1 顺序应用测试——跨任务持久性确立 L4,结果到动作的因果链确立 L3,选择并调用视觉操作确立 L2,为预定执行器构造规格确立 L1,全部不成立则为 L0;模糊案例归低级。第三步,层级内细分:L0 按支持功能(生成/检索、数据与训练、评估与基准)分三类;L1 按生成器面向的规格分五类(文本提示、空间/几何、检索证据、时间/相机、结构化内容);L2 按可执行对象分五类(模型与工具、图像与结构化图形、视频与视听、文档与界面、3D/CAD/世界);L3 按决定性反馈源分四类(感知结果、结构化/执行状态、物理与约束、任务内人类评审);L4 按持久经验载体分五类(能力与工具档案、情景与用户记忆、可复用过程与技能、可执行工作流、策略与模型更新)。第四步,构建语料库:从七个任务集合去重收集 313 个系统,标注首次发布时间、主层级、能力路径、模态、机制、控制器类型、视觉执行器、反馈边界、评估类型、跨任务持久性和公开资源,以 CSV/JSON 连同生成脚本开源。第五步,统计分析时间演化与模态、控制器组织截面。第六步,建立训练四阶段框架(轨迹数据、SFT、奖励模型与反馈、策略优化),成本感知奖励为 $r_t = \alpha r^{goal}_t + \beta r^{process}_t - \lambda c(a_t)$,策略目标为 $J(\theta) = \mathbb{E}_{\tau \sim \pi_\theta}[\sum_{t=0}^{T} \gamma^t r_t]$。第七步,给出层级条件化评估协议(Table VIII)与模态特定评估器映射(Table IX)。

技术新颖性

技术新颖性体现在四处。第一,定义层面的新颖:以"决策的最大时间与因果触达"定义 agenticity,是可复现、模态无关的测试,解决了该领域分类标准混乱的问题——同一个测试既适用于模块化系统、多角色工作流,也适用于统一生成策略。第二,证据结构的新颖:发布了 313 个系统、含层级/机制/反馈/记忆/资源/溯源字段的结构化语料库,并从半年度堆叠柱状图而非总量曲线得出"增长由任务内反馈主导、跨任务经验稀缺"的量化结论(L3 202 个 vs L4 25 个),这是此前任何综述都没有的实证观察。第三,评估框架的新颖:层级条件化协议把每级的边际价值隔离出来——L1 与固定规格规则对比,L2 与固定/随机/频率/oracle 路由对比,L3 要求开环/闭环配对执行并审计选择偏差(八候选择优不得与单样本基线比较、控制器批评与保留评估器必须分离),L4 要求时间序 held-out、经验移除/打乱/替换陈旧/注入无关前例等反事实,并报告前向迁移、负迁移、陈旧经验敏感性与回滚。第四,前瞻框架的新颖:把 generator-as-controller 纳入同一判据之下讨论而非另立层级,指出统一视觉策略与外部控制器的混合设计(视觉策略管细粒度修订、外部控制器管意图/权限/回滚)是可检验的中间形态。

Visual overview of controller decision-making scope
Fig. 1: Visual overview of controller decision-making scope
Illustrative comparisons across adjacent controller levels
Fig. 3: Illustrative comparisons across adjacent controller levels
Four-tier taxonomy and roadmap of controller decision-making scope (Part I: L0–L2; Part II: L3–L4)
Fig. 4: Four-tier taxonomy and roadmap of controller decision-making scope (Part I: L0–L2; Part II: L3–L4)
From L0 Fixed Support to L2 Execution Control
Fig. 7: From L0 Fixed Support to L2 Execution Control
The distinction between L3 Outcome-Adaptive Control and L4 Experience-Adaptive Control
Fig. 8: The distinction between L3 Outcome-Adaptive Control and L4 Experience-Adaptive Control

实验结果

作为综述,其"结果"是分类框架、语料库统计与评估协议三件套。语料库共 313 个去重系统(2022 下半年至 2026 年 8 月 24 日),层级分布极不均衡:L0 仅 4 个(语料库围绕控制器系统收集)、L1 49 个、L2 33 个、L3 多达 202 个(64.5%)、L4 只有 25 个(8.0%)——即任务内结果反馈修正已是主流形态,而跨任务经验复用仍然稀缺,L3→L4 是开放挑战而非常规延伸。时间演化上,半年新增系统数从 2022-H2 的 5 个、2023-H1 的 3 个、2023-H2 的 10 个、2024-H1 的 11 个、2024-H2 的 1 个,跃升到 2025-H1 的 37 个、2025-H2 的 45 个、2026-H1 的 149 个(峰值)、2026-H2 截至 8 月 24 日 52 个,且 2025 年后的陡增由 L3 主导。控制器组织上,单 LLM/VLM 控制器 257 个(82.1%)在每个层级都占绝对主导,多角色控制器 40 个(主要出现在 L1–L3,L4 为 0),统一多模态策略 16 个——证明模型数量不决定智能体性。模态截面上 L3 在所有模态普遍存在但含义不同:编辑与 UI 任务暴露可直接检视的渲染状态,视频、3D 与世界任务则需要跨时间或视角的状态一致性。由此论文给出两个面向评估的推论:结果条件化修正是最常见的智能体行为,必须区分真实修复与重复采样加择优(选择偏差);跨任务持久性的稀缺使 L4 评估必须做时间序 held-out 与经验消融。

Half-year capability evolution in the structured corpus, grouped by first public release
Fig. 5: Half-year capability evolution in the structured corpus, grouped by first public release
Corpus cross-sections: (a) Modality × primary level; (b) Controller organization × primary level
Fig. 6: Corpus cross-sections: (a) Modality × primary level; (b) Controller organization × primary level
Causal evaluation of agentic visual generation
Fig. 9: Causal evaluation of agentic visual generation
查看结构化数据
任务指标本文基线提升
语料库层级分布(313 个去重系统) 各主层级系统数(占比) L0=4,L1=49,L2=33,L3=202(64.5%),L4=25(8.0%) 此前无统一判据的碎片化文献(层级无法统计) 首次量化"任务内反馈主导、跨任务经验稀缺"的领域结构
半年度能力演化(按首次公开发布) 半年新增系统数 2026-H1 达 149 个峰值,2026-H2 至 8 月 24 日 52 个,增长由 L3 驱动 2022-H2 仅 5 个(以 L1 条件控制为主) 约 30 倍增长,且堆叠柱状图揭示增长来自哪类控制器决策
控制器组织 × 层级截面 各组织方式的系统数 单 LLM/VLM 控制器 257(82.1%),多角色 40(L4 为 0),统一多模态策略 16 常见"多智能体=更智能"的直觉 实证证明模型数量与角色拓扑不决定因果触达层级
层级条件化评估协议(Table VIII) 匹配因子、反事实设计与增值证据类型 每级只增加一类控制器决策;L2 对照固定/随机/频率/oracle 路由,L3 对照开环执行,L4 对照移除/打乱/陈旧/无关经验,全程预算匹配 不同命名系统间工具、骨干、预算均不可比的直接对比 把收益因果地归因到新增决策,暴露各转移特有的错误模式(如反馈环节的批评放大、经验环节的陈旧约束)

局限与改进

作者承认的局限:Fig. 2 与 Fig. 4 的路线图是定性概览而非定量排名;语料库围绕控制器系统组装,L0 只保留 4 个案例,低估了支持组件的规模;层级判定依赖论文自述的推理时决策证据,证据缺失时按保守规则归低级,说明归类可能随论文补充实验而改变。我的补充观察:第一,语料库截止 2026 年 8 月,视频生成与世界模型方向演进极快,统计很快会过时;第二,L4 仅 25 个样本,论文对五类经验载体在可逆性、回滚成本上的比较只能是定性的,经验上单薄的层级恰恰是作者认为最重要的前沿;第三,因果触达的判定需要论文报告干预行为,而多数论文并不报告,归类仍可能有争议空间;第四,层级条件化评估协议是 protocol 而非已发布的 benchmark——没有配套的参考实现、自动化反事实生成器或排行榜,落地成本转嫁给了后续研究者;第五,对安全、版权、溯源的讨论偏概念性清单(如权限感知路由、机器可读溯源),缺少对失败代价的量化分析。

独立分析的弱点

第一,分类判据依赖论文文本证据:判断一个系统是 L2 还是 L3 需要论文明确展示"观测改变后续动作"的因果链,但很多论文只给最终指标,归类不可避免地带主观性。改进方向:社区共建干预测试套件,用标准化探针(注入已知失败、检查是否触发相应修复动作)代替文本判读。第二,向最大触达的投影丢失路径信息:一个 L1+L2+L3 的系统与只有 L3 证据的系统同标签,尽管前者能力路径更完整;论文虽保留 capability path,但主标签仍是 max。改进方向:报告与检索时同时给出完整向量,评估协议中也应对比"同层级不同路径"的系统。第三,评估协议无参考实现:Table VIII 描述了开环/闭环配对、选择偏差审计、预算匹配等要求,但没有配套 harness,研究者各自实现的协议细节可能不可比。改进方向:开源一个覆盖至少图像与视频两种模态的自动化 matched-loop 评估工具。第四,L4 分析样本太少:25 个系统被分成五类载体后每类约 5 个,关于可逆性(档案可删、工作流可版本化、参数更新需 checkpoint)的论断缺乏实证支撑。改进方向:建立跨任务迁移基准,专门测量负迁移率与回滚成功率。第五,成本与安全维度停留在原则层面:预算化干预要求路由器估计质量增益、延迟、费用与隐私风险,但论文没有给出任何多目标权衡的实测案例。改进方向:在 L2 路由实验中强制报告质量-成本 Pareto 前沿(论文在协议中已建议,但缺实例)。

未来方向

作者按"阻断每一级转移的开放问题"组织未来方向:L1→L2 需要可执行控制的安全与溯源基础设施——对检索引用、模型路由、3D 资产复用与代码执行附加机器可读的来源、许可、参数与编辑记录,并做执行前的权限感知路由;以及预算化干预,路由器应估计期望质量增益、延迟、金钱成本与风险,而非最大化工具使用。L2→L3 需要多源反馈(局部化多模态诊断、专用检测器、可执行校验、模拟器状态、不确定性与人工升级的融合)、从诊断到修复的信用分配(诊断必须映射到可操作的区域/对象/帧区间/代码组件),以及不擦除已接受工作的人类共创界面。L3→L4 需要时间序鲁棒性——工具端点、价格、偏好与安全策略都会变化,记忆策略需要时间戳、溯源、冲突检测、选择性遗忘与回滚——以及长时程一致性测试来厘清"大量当前任务状态仍不是 L4"。Beyond L4 是 generator-as-controller 范式:生成与控制共享状态表示(缺陷直接关联到视觉 token、潜变量区域、帧区间或生成步骤)、更短的反馈回路(免去视觉状态反复序列化为语言)、持久世界状态(动作、视觉后果与世界更新保持链接);可行中间态是混合设计——视觉策略管细粒度生成与修订,外部控制器管用户意图、权限、溯源与回滚。基于这些成果可延伸的方向包括:把层级条件化协议落地为公开 benchmark 与排行榜;面向 L4 的 RL 训练(经验写入参数)的可审计性标准;以及在同容量、同工具、同预算下统一视觉策略与 LLM/VLM 控制器的受控对照实验。

复现评估

作为综述,本文的可复现性主要指语料库与协议。开源情况良好:结构化语料库(CSV 与 JSON 记录)、生成脚本、README 统计都发布在项目仓库(github.com/YinmingHuang/Awesome-agentic-visual-generation-model),Fig. 5、Fig. 6 的数字均由同一批 README 记录生成而非手工转抄,因此层级统计本身可以一键复现。数据方面无需训练算力,普通机器即可处理。难度分层看:复用语料库统计(容易);按 Table VIII 落地一次 L3 开环/闭环配对实验(中等)——需要自己搭建 matched-loop harness、实现选择偏差审计(分离控制器批评、停止批评与保留评估器)并保留预算匹配,工程量集中在评测基础设施而非模型;复现 L4 时间序 held-out 评估(较难)——需要构造时间上不重叠的任务流、带溯源与时间戳的经验存储及回滚机制,目前没有任何现成基准。被综述的 313 个系统本身的复现成本差异巨大,从调用闭源 API 到训练扩散模型不等,但这不属于本文方法的复现负担。总体评估:语料库复现容易、协议落地中等、端到端评估体系构建较难,主要缺口是协议缺少参考实现。