智能体化工件创作:系统、评估、原则与机遇 Agentic Artifact Creation: Systems, Evaluation, Principles, and Opportunities
以交付工件为分析单元,用状态化构建框架统揽259项智能体创作研究与评估
前置知识
LLM 智能体
以大语言模型为核心控制器、围绕其组织规划、记忆、工具调用、观察与停止机制的 AI 系统。典型范式如 ReAct 将'行动—观察'交错进行,Reflexion 则把反馈跨多次尝试保留。智能体的关键不在于调用多少次模型,而在于用什么状态决定下一步动作。
本文讨论的'状态化构建'正是把智能体的控制机制对准一个可检查、可修改的工件,理解智能体基本控制回路才能读懂其三角色功能架构。
多智能体系统
由多个分工智能体协作完成任务的组织形式,分为中心化(由管理者、编排器或共享计划分派工作)与去中心化(通过消息、协商、共享状态或环境信号协调)。MetaGPT、ChatDev 用角色分工模拟软件公司流水线,是工件创作系统的常见实现方式。
论文把智能体拓扑作为构建策略的独立维度,并指出分解虽降低局部复杂度却带来协调成本与依赖交接,这是其全局一致性挑战的理论基础。
生成式基础模型
能从自然语言提示生成文本、代码、图像、音频、视频、3D 等内容的大规模预训练模型,为工件创作提供可复用的内容操作(生成、编辑、转换),但本身不维护构建状态、不选择下一步动作、不决定工件何时完成。
论文明确区分'内容操作'与'构建控制':基础模型只负责前者,如何用观察重定向后续工作才是智能体化工件创作研究的对象。
LM 裁判
用大语言或多模态模型在评估时解释评分标准并给出判断的评估器类型,与规则检查、专用模型、人类评审并列。已知存在偏好偏差与自我偏好,当它与生成器使用相同或相关模型时,可能共享知识与偏好上的盲点。
论文反复论证'学习型裁判与生成器共享偏好或盲点时提供的独立证据有限',这是评估章节和'自诊断极限'挑战的核心论据。
混合主动共创
人类创作者在迭代过程中深度介入系统媒介化工件工作的协作模式:人可以重定向中间选择、保留既有承诺、决定哪些需求继续打磨,而不是只提供初始提示或只打最终分数。游戏与视觉设计领域已有较长研究传统。
论文把混合主动系统纳入定义边界,并在个性化与人类权威等挑战中讨论审批、偏好与撤销如何进入构建回路。
研究动机
直接生成适合输出易于检查、重生成成本低的有界任务,但现实交付物往往由多条相互作用的验收标准共同约束。以 Paper2Poster 为例,一张科研海报必须同时保持源内容忠实、适配单页版面约束、清晰传达论文内容,这些要求需要不同类型的证据,一张看似合理的图片或单一标量分数无法证明海报可以交付。软件领域同样如此:SWE-bench 与 SWE-agent 表明,智能体必须修改仓库状态并解读测试与执行反馈,而非输出孤立的代码片段。此类交付物难以构建的原因有二:决策相互依赖,改动内容可能牵动版面、行为或下游约束;有效性只能部分观察,各项检查覆盖不同标准、可能迟到,且在修订后失效。一旦到最终检查才暴露失败,就会遭遇失败传播、失败定位弱化与被迫大面积重生成三种后果,局部修复因此变得不可能。
本文的目标是本文要为'智能体化工件创作'建立可跨工件族比较的分析框架。具体目标包括:(1) 给出可操作的边界定义——AI 系统实质性构建或修订交付物、跨决策携带工件或过程状态、且至少使用一次中间观察重定向后续工作;(2) 以交付工件为组织单元,系统梳理截至 2026 年 8 月 20 日的 259 项工作(230 个系统、29 个基准),比较文本、2D 视觉、音频、视频、空间、行为六大工件族的构建机制;(3) 把应用情境与评估实践作为独立维度分析,区分关于交付物、构建轨迹与系统本身的证据;(4) 综合出可检查构建控制的四条设计原则,并以未解决问题组织研究议程,依次回答定义与组织(RQ1)、需求与情境如何塑造构建(RQ2)、评估如何进行(RQ3)、原则为何(RQ4)四个综述问题。
与已有工作不同的是,相邻综述的组织轴心各不相同:通用智能体综述强调架构、规划与协作,多模态生成综述按模型家族和媒介组织,另有综述分别聚焦创意工作流、软件修复、工具轨迹、人类反馈或智能体评估。Table 1 显示,没有任何既有综述把'交付工件'作为首要分析单元:工件状态与反馈控制仅在个别综述中部分覆盖,而能同时覆盖六大家族、贯通工件/轨迹/系统多级评估的只有本文。这一空缺使验收标准、可编辑状态、观察与修复范围无法跨族比较——例如无法统一回答'叙事视频的事件记忆与 CAD 的参数约束在构建控制上是否面对同一类问题'。本文以工件为中心的视角让这些原本分散在各模态文献中的机制第一次进入同一套功能词汇与原则体系。
核心方法
论文的核心直觉是:把生成看作构建循环中的一种操作,而不是流水线的终点。智能体化工件创作被定义为一个循环构建过程,由三个功能角色组成。在步骤 $t$,运行时验证将观察转化为反馈 $f_{t+1}=V(T,R_{t+1},o_{t+1})$;构建策略根据任务规范 $T$、当前表示 $R_t$ 与反馈选择动作 $a_t=\pi(T,R_t,f_t)$;动作经编辑接口作用于中间形态,得到状态更新 $R_{t+1}=U(R_t,a_t)$;第 $\tau$ 步通过验收后由交付操作释放工件 $A=D(R_{\tau})$。围绕这一循环,论文组织了三层分析:以六族16档的工件分类刻画状态组织与失败观察点;以六个应用情境刻画工件束与权威分配;以目标—证据—协议三层刻画外部评估,最终提炼出四条设计原则与六个挑战方向。
最核心的创新是分析单元的转移:不按模型家族、媒介、智能体能力或流程阶段组织领域,而以'交付工件及其验收标准'为轴。在此视角下,决定构建难度的不是模态本身,而是三个定性条件——决策相互依赖程度、失败何时以何种可归因性变得可见、以及诊断能否映射到保持既有成果的有界修复动作。由此推出一个可检验的论断:只有当观察在可用动作可修复的范围内识别失败时,构建循环才有价值;功能组件再强,若中间形态暴露的目标、编辑接口可施加的操作、观察揭示的后果与反馈支持的响应四者不对齐,整个系统仍会失效。这与 Self-Refine 式的迭代改进有本质区别:后者的反馈不一定落到可寻址的工件单元上,而本文要求证据、诊断与修复范围严格对应同一构建单元,否则精确诊断也无法支持局部修复。
方法步骤详情
第一步,划定边界与检索:用状态化构建定义作为筛选规则,在 arXiv、Google Scholar、Semantic Scholar、ACM DL、IEEE Xplore 检索 2023 年 1 月至 2026 年 8 月 20 日的文献,经去重与筛选保留 230 个系统与 29 个基准,排除直接生成器、观察无关工作流和只消费或评估工件的系统。第二步,编码:按语料角色、主工件族、子类、横切面与来源标注,歧义案例迭代协商。第三步,功能解构:中间形态分工件实例、结构化模型、可执行程序三类;编辑接口分单元编辑、关系编辑、整体编辑三类;决策控制分工作流与自主两类;智能体拓扑分单智能体、中心化 MAS、去中心化 MAS 三类;观察源分工件状态、运行时行为、评估信号、外部响应四类;反馈函数分标准状态、失败诊断、修订指引三类。第四步,逐族分析16个分析档的依赖机制与观察模式,再分析六个应用情境的工件束与验收权威,最后在目标/证据/协议三层评估基准成熟度,综合出外化承诺、定义控制边界、使反馈可行动、重验证受影响状态四条原则。
技术新颖性
新颖性体现在四个层面。其一,给出了该范式的最小操作定义,使迭代式、混合主动等异质系统能在同一筛选规则下被纳入或排除,避免'智能体'一词的泛化滥用。其二,建立了跨模态可比的功能词汇:STORM 的大纲、PosterAgent 的布局树、SceneWeaver 的场景图、SWE-agent 的仓库在同一张 Table 3 中按统一的'中间形态—编辑接口—决策控制—拓扑—观察源—反馈函数'编码,这类横向可比在以往单模态综述中不存在。其三,提出可组合性、可追溯性、可修订性三个系统能供性,并论证它们来自表示、决策、接口、记录与证据的对齐而非任何单一组件。其四,把外部评估解构为目标×证据通道×评估器×协议的正交框架,明确证据渠道与评估器类型不构成强弱排序,必须针对具体要求与阶段成对陈述——这纠正了'人类评审天然优于 LM 裁判'的常见误读。
实验结果
语料层面:共收录 259 项工作(230 系统 + 29 基准),其中 251 条获得工件族归属,13 条视频记录为跨档、语音音频无严格记录,120 条已发表或录用,覆盖 2023 至 2026 年 8 月的爆发式增长。族层面:构建挑战不只来自模态,更取决于决策耦合程度与失败是否在可修复窗口内可见——文本与 2D 视觉以静态检查为主,音频视频依赖时间回放,空间与行为的后果要到执行与交互才显现;观察越靠后覆盖越广但定位越难,除非能回链到持久可编辑状态;分解降低局部复杂度却抬高协调与重组成本。评估层面:Table 4 的 18 个代表协议中仅 3 个(Mr. Dre、AgenticVBench、AuthorBench)评估了超越任务能力的系统性质且各只覆盖一种;证据最强的是交付物与有界执行,轨迹与使用结果覆盖不足,校准、预算、停止与成本的报告口径不一致。Design Arena 快照显示任务依赖性:Kimi K3 在 Models Arena 五任务全居首,但在 Agents Arena 原生 Android 跌至 54.3 百分位(Claude Fable 5 登顶),GPT-5.6 Sol 从幻灯片 87.5 到移动应用 34.2 百分位;Mr. Dre 测得多轮修订使已覆盖内容或引用质量回归 16–27%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 跨模态文献语料库构建 | 收录工作数与构成 | 259 项(230 系统 + 29 基准),覆盖六族 16 档,120 条已发表或录用 | 相邻综述各自限于单模态或通用智能体任务,工件状态与反馈控制至多部分覆盖(Table 1) | 首次以交付工件为单元实现跨族可比的系统性覆盖 |
| 代表基准协议的系统级评估 | 覆盖'超越任务能力'系统性质的协议数 | 18 个代表协议中仅 3 个(Mr. Dre、AgenticVBench、AuthorBench),每个仅 1 种性质 | 其余 15 个协议仅提供任务能力证据 | 揭示轨迹、使用结果与系统性质评估的结构性缺口 |
| Design Arena 排行榜任务分层分析 | Elo 百分位(≥100 战) | Kimi K3 在 Agents Arena 原生 Android 仅 54.3 百分位,GPT-5.6 Sol 跨度 87.5→34.2 | Kimi K3 在 Models Arena 五任务与 Agents Arena 网页/全栈/幻灯片等任务居首 | 证明单一聚合排名掩盖任务依赖的相对水平 |
| 多轮修订的状态保持测量 | 已接受内容/引用质量回归率 | Mr. Dre 报告 16–27% 回归 | 多数系统未报告回归率或保留率指标 | 为轨迹评估中的'状态保持'维度提供可复用的直接度量 |
局限与改进
作者承认的局限包括:四原则与难度三因素是定性关系而非因果因素或族排序;语料的检索导出、逐源产出与预协商标签未保留,编码结果附带已知局限发布;Table 4 的均衡展示支持比较而非频次估计,音频、视频、空间族更多依赖系统论文自带协议;第四条原则(重验证受影响状态)的跨族证据仍稀疏;六个方向被明确定位为假设而非结论,比较性主张需匹配模型、工具、人类与资源预算。我自己的观察:功能模型缺乏可操作的度量,'对齐'与'可修复范围'没有量化指标,工程中难以直接检验;语料筛选依赖作者主观判断,Table 3 大量单元格标注 NR(未报告)暴露了原始文献实现细节披露不足,也使功能分类的可靠性难以外部复核;截止 2026 年 8 月的快照式覆盖在快速演化的领域很快过时;每族仅选三个代表基准,可能低估边缘工作的真实评估实践。
独立分析的弱点
独立分析的弱点:其一,难度三因素(决策相互依赖、失败可观察性、可修复性)停留在定性层面,未给出依赖密度、失败检出时延、修复局部性比例等可计算度量,改进方向是为每个因素定义跨族可测的代理指标,并在受控实验中验证其对构建成败的预测力。其二,四原则缺少参考实现,团队难以判断自己的系统是否'外化承诺'充分,改进方向是发布承诺图 schema 与静态检查工具,对工件的依赖边、验收标准与证据链接做 lint。其三,评估章节诊断了 LM 裁判共享盲点,但未给出盲点相关性的量化估计方法,改进方向是系统性测量裁判与生成器错误的相关系数并发布校准协议。其四,语音音频无严格记录、部分族基准稀少,反映社区资源分配失衡,改进方向是补建语音构建基准与开放的音视频轨迹数据集。其五,编码语料缺少编码者间一致性统计,改进方向是公开双编码子集与一致性系数,让后续研究者可以评估编码稳定性。
未来方向
作者提出的方向包括:用'选择性显式'的类型化承诺图把需求链接到工件单元、决策、所有者与证据,只在变更触及或高风险时物化链接,并配合自动表示搜索与留出变更测试;诊断多样化——为每条要求配不共享生成器盲点的证据(可执行检查、独立批评者、专家评审),分歧或原因不明时触发升级而非自信重生成,并做依赖感知的故障定位;版本化自我进化——把每次保留的更改当作带出处、范围与回滚路径的补丁,在影子系统的留出集上验证后再晋级,用独立授权保护验收标准不被暗中放宽;范围化偏好记忆区分稳定口味、项目承诺、临时修改与不确定推断,冲突时澄清而非静默覆盖;权威感知委托把许可表达在决策与动作层面而非单一 human-in-the-loop 开关,附动作级出处供事后审计;多元性保持评估用版本化验收规范记录固定约束、演化偏好与评估者角色,并要求预算匹配的比较协议。在其成果上可延伸:把四原则转化为可自动检测的反模式库,以及建立跨族统一的轨迹遥测格式以便横向对比。
复现评估
作为综述无需算力即可复用:论文维护项目网站 agentic-creation.github.io 与 GitHub 论文列表,并发布编码后的语料文件(按语料角色、工件族、子类、横切面与来源编码),Table 3 的功能分类可直接用作系统设计检查表或元分析编码本。复现其筛选过程难度中等:检索式、来源与时间窗已公开,但数据库专属查询导出、逐源产出与预协商标签未保留,严格逐条复现需重新执行检索并自行裁决边界案例,建议使用者把该语料当作起点并按公开定义自行增量更新。若想在其框架上做实证研究(如验证难度三因素的预测力),需要自建跨族实验,无现成代码可跑,难度较高,但编码数据与分类体系已经为后续实证研究提供了基础。
论文图表
展示综述的章节结构:从背景与智能体范式(第 2–3 节)经工件族、应用与评估(第 4–6 节),再到设计原则(第 7 节)与六个挑战—机遇方向(第 8 节),每个模块标注了核心议题。
一张图给出全文地图,读者可按需跳转到自己关心的模块,帮助建立对综述整体逻辑的预期。