JarvisHub:面向画布原生多模态创意智能体的开放框架 JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
把可编辑画布作为智能体共享项目状态,支撑长程多模态创意创作的开放框架
前置知识
画布原生创意智能体(Canvas-Native Creative Agent)
画布原生智能体把可编辑的“画布”作为核心工作记忆和动作空间。不同于聊天式智能体把上下文存在线性对话历史中,它将提示词、参考图、草稿、候选方案、版本分支、编辑、反馈等都表示为画布上带类型、可寻址的节点和连接。智能体每一步先观察画布当前状态,理解已有素材及其关系,再决定下一步动作,并把结果写回同一画布。这种设计让创作过程可检查、可回溯、可局部修改,而不是隐藏在提示和工具调用背后。
这是本文的核心概念,理解它才能理解为什么“画布”而不是“对话历史”成为项目记忆。
长程多模态创作(Long-Horizon Multimodal Creation)
长程多模态创作指跨越多个步骤、涉及多种模态(图像、视频、音频、UI、幻灯片等)的创意工作。与单步“提示→输出”不同,真实创作需要收集参考、规划布局、生成多个候选、局部修改、比较方案、整合反馈,形成一个不断演化的项目状态。这类任务的核心挑战是上下文的持久化与跨步骤的一致性维护,而这正是孤立工具和线性对话难以提供的。
本文要解决的核心问题正是长程创作中的项目状态管理,理解这一任务特性才能评估框架设计的必要性。
协议桥(Protocol Bridge)
协议桥是位于智能体和画布之间的中间层,负责检查智能体对画布的所有读写操作。它提供“能力清单”(capability manifest)列出当前可用的节点类型、变更操作、工具和素材句柄;再派生出“执行授权”(execution grant)限制智能体本轮能做的事。所有动作必须能编码为受检工具调用、画布变更、评估请求或澄清请求才能执行,从而使画布交互变得显式、有效、可审计、可恢复。
协议桥是保证画布更新受约束、可追溯的关键机制,是三层架构中区别于普通画板工具的核心组件。
Model Context Protocol(MCP)
MCP 是一种让大语言模型连接外部工具和服务的开放协议。本文在画布框架中把 MCP 提供的能力纳入同一“能力清单+执行授权”的契约下,使智能体可以像调用原生工具一样调用浏览器、文件、代码、搜索、文档、演示等外部执行能力,并把这些外部能力返回的可检查素材写回画布。
MCP 是本文五个工具家族之一,理解它有助于理解系统如何以统一契约扩展外部服务。
轨迹记录(Trajectory Recording)
轨迹记录指完整记录每一轮的状态转移元组,包括用户请求、画布状态、能力清单、执行授权、动作、观察、反馈信号、修复决策和更新后的画布。这些轨迹既可用于检查、回溯和恢复,也可经质量过滤、匿名化和版权审查后作为训练未来创意智能体的数据。
轨迹是本文做“过程级”分析和未来“数据飞轮”的基础,也是区别于只看最终成品的评估方式。
研究动机
现有的创意 AI 系统在长程创作任务上存在根本性短板。第一类是“提示→输出”工具,它们擅长产出单个素材,但会丢弃中间决策、失败尝试、候选方案和修改历史。第二类是聊天式智能体,它们能多步调用工具,但主要上下文仍是一条线性对话,难以表达空间布局、素材依赖、版本分支和局部编辑目标。第三类是节点式工作流工具,它们让执行步骤可见,但围绕手动固定的流水线,而非可被智能体检查、修改、扩展的持续项目状态。此外,近期商业产品(Claude Design、Google Stitch、TapNow、LibTV、MiniMax Hub)虽然显示创意 AI 正从孤立素材生成走向多阶段项目协作,但它们的架构基本封闭,研究者无法查看项目状态如何表示、动作如何校验、工具如何调度、反馈如何使用、失败如何修复,因此很难研究智能体如何在长工作流中维持上下文。
本文的目标是本文的目标是构建一个开放、画布原生的创意智能体框架(harness),用于长程多模态创作。具体而言,它把可编辑画布既作为用户工作区,也作为智能体的外部记忆、动作空间和共享项目状态。提示词、参考、图像、视频、音频、UI 组件、分镜、候选结果、版本关系、编辑和用户反馈都被表示为带类型、可寻址的画布节点和连接。智能体在每一轮观察当前画布、解释可用素材及其关系、调用合适工具、创建或修改节点、把结果写回同一画布,从而让创作过程可见、可追溯。作者希望这个开放框架能进一步支撑项目级基准、过程级评估协议,以及训练未来创意智能体的数据飞轮。
与已有工作不同的是,本文的独特切入角度在于:它不试图做“又一个更强大的创意生成产品”,而是提供一个开放的研究框架来研究智能体如何在不断演化的多模态项目上运作。与已有的提示式、聊天式、节点式系统不同,JarvisHub 把“画布图”作为统一的项目状态:既有持久的项目记忆,又有受协议约束的可控执行,还有完整的轨迹记录。与封闭的商业产品不同,它公开了状态如何表示、动作如何校验、工具如何调度、反馈如何驱动修复。这种“画布即状态 + 协议约束 + 轨迹可分析”的组合,填补了长程创意智能体研究的空白,并使过程级失败(如忽略参考、丢失已选方案、全局重生成而非局部修复)变得可见。
核心方法
JarvisHub 的整体思路是把“画布”而非“聊天历史”作为主项目记忆。画布存储素材、依赖、修订、反馈和中间结果,用户和智能体都能在之后回到它们。每一轮遵循一个简单循环:运行时观察画布、解释用户输入、通过协议桥选定一个被授权的动作、调用所需能力、把返回的观察写回画布。整个系统由三层组成:画布状态层存储节点、属性、布局、版本和依赖连接;协议桥校验智能体如何读写画布,包括权限、操作格式、校验和日志;智能体运行时选定被授权的动作、调用工具、同步状态并记录轨迹。运行时还暴露 5 个工具家族(画布工具、生成工具、原生工具、恢复工具、MCP 工具),并用技能、记忆、子智能体组织更长的工作流。作者用 5 个核心能力概括这套设计:持久项目状态、可控画布动作、工具与媒体执行、反馈引导修订、可追溯与恢复。
核心创新点在于把“画布图”正式化为创意智能体的项目状态,并通过协议桥让画布交互变得显式、受检、可恢复。与已有方法的本质区别有三点。第一,它把画布既当用户界面又当智能体的外部记忆和动作空间,使素材可寻址(智能体能指向某张候选图或某个网页渲染而非含糊的对话表述)、可复用(参考、草稿、被拒候选都可作为后续步骤输入)、依赖可检查(用户和智能体能追溯哪些素材影响了某个结果)。第二,它用执行授权 $\Omega_t$ 和能力清单 $\Gamma_t$ 约束每一轮动作空间 $A_t = A(\Omega_t, \Gamma_t, C_t, q_t)$,确保每个被接受的动作都扎根于观察到的画布、由能力清单暴露、由授权允许、并通过协议桥提交,从而不让运行时维护隐藏状态。第三,它把每一轮的完整状态转移记录为轨迹 $\tau$,使过程级分析成为可能。
方法步骤详情
方法分六步。第一步定义画布状态:第 $t$ 轮项目表示为 $C_t = (G_t, X_t, M_t, U_t, L_t)$,$G_t = (V_t, E_t)$ 是带类型素材图,$E_t \subseteq V_t \times R \times V_t$ 为有向带类型关系,其余项分别存内容、溯源状态、用户反馈与空间位置。第二步定义节点 $v_i = (id_i, k_i, p_i, x_i, y_i, m_i, s_i)$,含类型 $k_i$、可编辑输入 $x_i$、生成输出 $y_i$ 与运行时状态 $s_i$。第三步协议约束交互:协议桥提供能力清单 $\Gamma_t$ 与执行授权 $\Omega_t$,智能体据此提出动作 $a_t$,仅当可编码为受检工具调用才执行。第四步状态转移 $C_{t+1} = F(C_t, a_t, o_t, f_t, r_t)$,含观察、反馈与修复决策。第五步把每轮状态转移记录为轨迹 $\tau$,便于检查、回溯与恢复。第六步运行时用画布、生成、原生、恢复、MCP 五个工具家族叠加技能、记忆、子智能体编排长工作流。
技术新颖性
技术新颖性体现在多个层面。在状态表示上,首次把长程多模态创作形式化为“在可编辑项目图上的智能体过程”,将素材、依赖、版本、反馈统一为带类型、可寻址的画布节点和连接,而非散落在对话或固定流水线里。在交互约束上,协议桥 + 能力清单 + 执行授权的三件套让画布更新显式、可审计,把原本隐藏在语言生成里的动作变成可追溯的变更记录。在可扩展性上,把 MCP 纳入同一“清单+授权”契约,使浏览器、文件、代码、搜索等外部服务与原生工具一致地被调度和提交。在分析层面,强调“轨迹是分析对象”:最终素材不能完全刻画智能体行为,过程级失败(忽略参考、丢失已选、全局重生成而非局部修复)只有在轨迹里才可见。这套“画布即状态 + 协议约束 + 轨迹可分析”的统一视角为项目级基准、过程级评估协议和训练数据飞轮提供了基础,是已有开源系统所没有的。
实验结果
核心发现是:一个画布原生的框架确实能够支撑跨模态、需要持久项目上下文、迭代素材生成和反馈驱动修订的高价值长程任务。作者在 3 个代表性任务上做了定性验证:叙事媒体生成、交互式网页开发、演示文稿生成(见表 3)。配置上,主智能体后端用 GPT-5.5,图像生成用 GPT Image 2,视频生成用 Seedance 2.0,多模态评估用 Gemini 3.1 Pro。叙事媒体案例把一个“牛仔机器人僵尸拾荒者”短剧提示转成连贯的视觉序列:画布让故事规划、视觉参考、镜头候选、依赖连接和生成进度都可见,最终关键帧保持了跨镜头的角色一致、场景线索和动作连续。网页开发案例把一个“轻量、Awwwards 风格、丰富动画”的个人摄影网站需求转成渲染成品,画布保留了视觉方向和界面一致性。演示文稿案例把“机器学习决策树、斯坦福讲座风格”的题目转成结构化多页幻灯片,画布保留了主题结构和视觉风格。每个案例都提供两个互补视图:画布生产过程的工作区轨迹和最终成品。需要强调的是,作者明确承认这些是定性演示,而非已完成的基准或排行榜,没有报告量化成功指标,也没有与基线做对比。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 叙事媒体生成(短剧:牛仔机器人僵尸拾荒者) | 定性评估(工作区轨迹 + 最终关键帧) | 画布管理故事规划/参考/镜头候选/依赖,最终关键帧跨镜头保持角色、场景、动作连续 | 无(论文未设置定量基线) | 无可量化提升;定性展示画布对长程一致性的支撑 |
| 交互式网页开发(Awwwards 风格摄影网站) | 定性评估(布局/交互/预览/修订状态可视化) | 画布保留设计参考、实现进度、预览与修订状态,输出排版与页面结构一致的网站屏幕 | 无(论文未设置定量基线) | 无可量化提升;定性展示画布在迭代构建中的一致性 |
| 演示文稿生成(决策树、斯坦福讲座风格) | 定性评估(内容规划/视觉组装/预览) | 画布记录讲座内容、生成图表、幻灯片草稿与修订状态,输出布局与图示风格一致的 10 页幻灯片 | 无(论文未设置定量基线) | 无可量化提升;定性展示画布对跨页一致性的支撑 |
局限与改进
作者自己承认的局限有四点。第一,实验是定性演示,而非已完成的基准或排行榜,没有量化指标和基线对比,因此难以客观衡量框架本身的优劣。第二,JarvisHub 关注编排和项目状态管理,最终素材质量仍取决于运行时调用的外部模型和工具(GPT-5.5、GPT Image 2、Seedance 2.0 等),框架本身不提升底层模型能力。第三,协议桥让画布动作显式且可恢复,但不能保证智能体的创意决策在语义上是正确的(例如可能选错参考、误判风格)。第四,轨迹记录对分析和训练有价值,但原始轨迹在用作研究数据前需要质量过滤、同意、匿名化和版权审查。补充观察:论文没有给出运行成本、延迟、成功率或用户研究的量化数据;三个案例都是作者自选的“展示友好”任务,缺少对抗性或失败案例的系统分析;且没有与任何现有开源系统(哪怕是聊天式智能体)的对照实验,使得“画布原生是否真的比对话式更好”这一核心主张缺乏直接证据。
独立分析的弱点
第一个弱点是缺乏量化评估与对照实验。论文只做了三个定性演示,没有成功率、修改轮数、上下文保留率、依赖正确性、反馈遵循度等过程级指标,也没有与聊天式或节点式系统的对照,改进方向是建立项目级基准:每个任务给定初始画布、参考素材、可用工具、约束、反馈事件和检查点,并用 Gemini 3.1 Pro 这类多模态评估器给出过程级分数。第二个弱点是对底层模型的强依赖。框架不改变 GPT-5.5、GPT Image 2、Seedance 2.0 的能力上限,若模型本身在身份保持、跨镜头一致性上失败,画布也无法挽救,改进方向是把模型不确定性显式编码进运行时状态(如标注未验证结果),并由恢复工具做局部修复而非整体重生成。第三个弱点是协议桥不保证语义正确性,它只校验操作格式和权限,不校验“这个修改是否合理”,改进方向是在协议桥中加入基于评估器的语义校验门。第四个弱点是可扩展性未经验证:三个案例都是单用户、中等规模,在节点数极大、多人协作或长历史回溯时,画布的存储与检索效率、协议桥的校验开销都未被讨论。
未来方向
作者提出的方向包括:把演示扩展成完整的“项目级基准”,每个任务含初始画布、参考、工具、约束、反馈事件和检查点;建立结合最终素材质量与过程级度量(上下文保留、工具使用恰当性、依赖正确性、反馈遵循、修复成功率)的评估协议;在同意、匿名化、版权过滤和质量控制下,用轨迹构建训练数据飞轮来训练未来创意智能体的规划、工具选择、多模态状态跟踪、局部修复和反馈引导修订。基于成果可延伸的方向包括:把画布原生范式扩展到更多创意领域(如 3D 建模、游戏关卡、长视频叙事);研究如何让协议桥支持更强的语义校验与自动修复;探索多人协同画布与多智能体委派;研究如何用轨迹数据做模仿学习或强化学习来改进运行时策略;并把执行授权与能力清单的契约推广到更通用的安全智能体沙箱。
复现评估
复现性中等偏上但非完全。作者开放了项目页面(https://www.jarvishub.site/)和 GitHub 仓库(https://github.com/LYL1015/JarvisHub),并公布了模型后端配置(GPT-5.5 主智能体、GPT Image 2 图像、Seedance 2.0 视频、Gemini 3.1 Pro 评估),这为复现框架骨架和三个演示案例提供了基础。但论文没有给出量化的成功标准,三个案例的“成功”依赖主观视觉判断,因此难以客观判定复现是否达标。此外,复现需要访问多个商业闭源模型(GPT-5.5、GPT Image 2、Seedance 2.0、Gemini 3.1 Pro),这些需要付费 API 且能力会随版本变化,给精确复现带来不确定性。论文也未报告运行成本、延迟和所需算力。总体而言,框架与演示流程可复现,但由于缺乏量化指标和依赖闭源模型,完全可验证的科学复现难度较大。
论文图表
图把三类现有创意系统与 JarvisHub 做对比。第一类“提示→输出”工具只产出最终素材,中间上下文常被隐藏;第二类聊天式智能体把素材留在聊天日志里,难以表达空间和带版本的素材状态;第三类节点式工作流工具步骤可见但流水线是固定的、手动指定的,而非可编辑的项目状态。三者都难以胜任长程创意任务。JarvisHub 则把画布作为共享工作区,智能体可以检查和更新它,使多模态素材、依赖、编辑、反馈和修订痕迹在整个创作过程中都可访问。
这张图是理解论文动机的核心:它直观说明了为什么需要一种新的“画布原生”范式,以及 JarvisHub 与现有三类系统的本质差异。
图展示了叙事媒体生成的最终成品:通过画布管理工作流产出的关键帧,呈现了跨镜头反复出现的角色、场景线索和动作连续性。该案例灵感来自 Mx-Shell 的原作 Zombie Sweeper。
这张图展示了画布管理工作流能产出跨镜头一致、连贯的视觉序列,是叙事任务最终质量的定性证据。