图工程:LLM智能体时代的系统智能构建范式 Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence
提出图工程范式,用任务、智能体、运行时三类显式图结构把单体智能体组织成系统智能。
前置知识
LLM智能体(Agent)
以大语言模型为认知核心、能感知环境并自主决策执行的实体,可形式化为 Agent = Loop(LLM + Harness):LLM 负责理解、推理与规划,Harness 提供工具、记忆、技能等持久能力,Loop 反复执行感知-行动-观察-验证-适应的闭环。与单次问答不同,智能体能在长时程中持续追求目标并根据反馈修正行为。
本文的整个论证建立在单体智能体之上:只有先理解个体智能的能力与天花板,才能理解为什么必须走向系统级的图工程。
Harness工程与Loop工程
Harness 工程组织模型外围的运行时层,接入外部知识、工具、记忆、技能与执行环境,决定智能体能访问什么能力;Loop 工程把这些能力组织成有界、有状态、反馈驱动的执行过程,决定智能体如何持续与环境的观察、验证结果交互并决定继续或终止。论文将其分别对应工具集成、记忆管理、技能组合、运行时编排与循环架构、交互范式、环境反馈六个维度。
这是论文智能演化阶梯的中间两级(个体智能),第3.5节正是从 Harness/Loop 的局限推导出图工程的必要性。
有向无环图(DAG)与依赖调度
由节点和有向边组成且不含环的图结构,边编码先后依赖,可通过拓扑排序确定执行顺序,入度为零的节点可并行派发。在 LLMCompiler 等系统中,函数调用计划被编译成数据流 DAG,一旦上游依赖满足,就绪节点立即并行执行,从而把串行的模型调用变成可调度的并行计算。
DAG 是任务组织视图的核心数据结构,理解依赖边如何约束调度与并行,是读懂任务分解与工作流优化两节的门槛。
多智能体系统(MAS)
由多个具备不同角色、能力与资源的智能体组成的系统,通过任务分配、消息传递、结果聚合与冲突消解协同完成单一智能体无法胜任的复杂任务。其关键不是智能体数量,而是组织方式:责任边界、委派路径、监督与验证关系决定了系统整体表现。
图工程的治理对象就是 MAS 的组织结构;论文反复强调系统智能不等于增加智能体数量,而是组织能力的提升。
状态机与事件溯源
状态机把系统行为建模为离散状态及合法的状态转移;事件溯源则把每次状态变更以不可变事件形式追加到日志中,从而支持状态重建、重放、分支与回滚。两者结合可让分布式执行历史成为可审计、可恢复的权威记录,而非散落在各智能体上下文中的碎片。
运行时状态管理一节的机制基础:AgentGit 的重放/回滚/分支、恢复边界的界定、MemTX 的暂态写入与事务性提交都源于这些经典工程思想。
本体(Ontology)
对某领域中实体、关系、约束与推理规则的共享的、机器可解释的概念化模型,例如用 OWL 定义类与属性、用 SHACL 定义合法性约束。本体让不同系统与组件对同一概念有一致解释,并支持一致性检验、映射与复用,是知识工程与语义网的核心工具。
第5节主张本体工程是下一代系统智能的语义基础:图结构显式化了关系,但只有本体才能保证任务、角色、状态、证据在组件间被一致地解释。
研究动机
随着真实任务变得异构、互依赖且长时程,围绕单智能体执行循环组织的个体智能暴露出三大结构性瓶颈。其一,并行与相互依赖的子任务被压缩成串行轨迹:例如软件故障诊断中,日志分析、故障复现、代码检查本可作为独立分支并行推进,而修复与测试依赖其结果,但单智能体只能在单一执行循环中串行化这些分支,既浪费并行效率,又让错误的中间结果传播到后续步骤,出错阶段难以定位。其二,异构专长与独立验证难以整合:当同一个智能体既写代码又评审代码时,即使提示词赋予不同角色,它仍容易把自身的主观判断当作代码正确的证据,产生角色混淆与确认偏误,无法形成真正独立的验证。其三,上下文不是有组织的持久状态:长时程网页或编码任务中,早期的小错误可能潜伏到任务尾声才爆发,届时已难以追溯首次偏差的位置,也无法只修复受影响部分或按可检验的方式恢复进度。信息在共同上下文中竞争有限的容量,依赖操作被串行控制流中介,不同任务的状态被塞进单一共享上下文,无法隔离并发工作、同步共享结果或独立恢复部分进度。简单增强单模型能力或扩大上下文窗口无法解决这种架构性错配。
本文的目标是本文的目标是提出并系统化一种新的工程范式——图工程(Graph Engineering):用显式、动态、可演化的图结构表示任务、智能体与系统状态,把智能从单体分布到系统层面,实现系统智能(System Intelligence),即智能体系统组织复杂目标、向异构组件分配职责、协调相互依赖的执行并在任务生命周期中维护系统级状态的能力。具体包含五项工作:一是给出模型智能到个体智能再到系统智能的演化框架与形式化定义,单体智能体抽象为 $A_i^t = \mathrm{Loop}(F_i, H_i; s_i^t)$,智能体系统抽象为 $S^t = \langle A^t, R^t, E^t, \Pi^t, x^t \rangle$;二是把领域组织为任务组织、智能体协调、运行时状态管理三个耦合视图,外加系统演化维度;三是梳理500余篇文献形成技术分类学;四是汇总三个智能层级的基准、开源库与应用系统;五是指出迈向本体工程的未来路线。
与已有工作不同的是,以往工程范式各自优化不同层级:Prompt 工程与 Context 工程塑造单次模型调用的控制信号与信息环境,Harness 工程与 Loop 工程扩展单个智能体的能力边界与执行循环;现有多智能体综述多聚焦通信协议、协作框架或具体领域应用,很少把图结构本身当作一等工程对象。本文的独特切入在于:把任务依赖、智能体分工、运行时状态转移这些组织关系显式外化为可调度、可优化、可演化的图结构,主张图从静态表示转变为治理系统执行的操作机制。尤为关键的是,论文明确提出系统智能不等于增加智能体数量——一个多智能体系统可能包含多个有能力的智能体,却缺乏有效的工作组织、清晰的责任边界、协调机制与一致的状态管理。作者还提出区分 graph-structured(系统用图结构执行)与 graph-engineered(把图作为工程对象持续优化与演化),这一诊断指出了当代系统普遍停留在前者的事实。
核心方法
先看直觉:复杂系统如同公司,必须回答三个问题——做什么(任务分解与流程)、谁来做(角色分工)、现在到哪了(状态与恢复),图工程主张把三者显式建模为任务图、团队与通信图、状态图。技术路线沿智能演化阶梯展开:第一层模型智能由预训练(GPT-3、LLaMA、DeepSeek-V3)与后训练(DPO、GRPO 等可验证奖励强化学习)在参数中编码能力,再由 Prompt/Context 工程在推理时激发;第二层个体智能中,Harness 工程接入工具、记忆、技能与运行时编排,Loop 工程组织循环架构与环境反馈,形成持久执行体 $A_i^t = \mathrm{Loop}(F_i, H_i; s_i^t)$;第三层系统智能对应五元组 $S^t = \langle A^t, R^t, E^t, \Pi^t, x^t \rangle$:智能体团队、共享资源、环境、协调机制与系统级状态。图工程据此展开为三大视图:任务组织把目标分解为可调度的子目标图并优化为可执行工作流;智能体协调建模能力图、团队拓扑与通信图;运行时状态管理负责状态记录、故障定位与恢复;系统演化再利用执行证据跨任务迭代改进这三种图。
核心创新是把图从静态表示升级为操作机制。已有工作要么把图当外部知识源——如 GraphRAG 用知识图谱辅助检索但不改变执行行为;要么把图当开发期模板——如 LangGraph 的 StateGraph 由开发者预先定义、动态路由只在预设结构内进行。本文主张图是系统执行的组织性基底:任务图中边约束调度,LLMCompiler 把函数调用计划编译成数据流 DAG 后就绪节点并行派发,TDAG 与 Flow 允许按中间结果动态细化任务图;通信图中的边是可剪枝、可重构的信息通道,AgentPrune 从时空消息图删除冗余连接,AgentDropout 逐轮移除低贡献智能体及其边,DyTopo 每轮按信息供需重构稀疏通信边;状态图记录事件、依赖与状态转移,把散落在上下文与日志中的运营信息转化为可审计、可恢复的系统状态,PatchBoard 在提交前按 schema、角色权限与不变量校验补丁,MemTX 区分暂态写入与带溯源的事务性信念提交。另一本质区别在概念层面:论文把系统智能定义为组织能力而非数量堆叠,中心挑战从如何复制或特化智能体,转变为异构组件如何被组织协调为连贯系统。
方法步骤详情
第一步,任务组织(做什么)。目标分解:把目标表示为子目标图,节点为子任务、边为依赖——HuggingGPT 按依赖把请求路由给专用模型,ReWOO 用变量引用解耦推理与工具执行,LLMCompiler 编译为 DAG 后并行派发就绪节点,TDAG 按中间结果动态细化任务图。工作流优化:GPTSwarm 把系统表示为可优化计算图并同步优化节点与边,AFlow 用 LLM 引导搜索可执行工作流代码,DyFlow 按实时反馈生成算子子图,EvoFlow 在推理期进化多个候选工作流。第二步,智能体协调(谁来做)。能力建模:DyLAN 估计候选智能体贡献,MasRouter 按难度与成本路由,SkillGraph 显式表示技能。团队组织四种形态:链式(MetaGPT 的 SOP 流水线)、路由式(Magentic-One 编排器规划委派)、扇出/扇入(Mixture-of-Agents 分层聚合、MacNet 经 DAG 汇聚)与动态结构(AgentNet 去中心化自组织)。通信建模:MAgICoRe 结合步级奖励定位并修正推理错误,G-Designer 权衡性能与成本生成通信图,Collaborative Gym 把人类纳入反馈回路。第三步,运行时状态管理。状态记录:Magentic-One 用任务与进度台账外化执行进度,事件溯源保留只增历史支持重建重放;故障定位:Who&When 做智能体与步骤级归因,MAST 区分设计、协调、验证三类失败,TDAD 经代码-测试依赖定位影响面;故障恢复:MAGE、CausalFlow 选择性修复受影响区域,AgentGit 支持重放、回滚与分支,SagaLLM 用补偿处理不可回滚的外部效应。第四步,系统演化:ReCreate 蒸馏可复用模式,Swarm Skills 提炼协调技能,MemTX 验证并回滚持久状态以防错误经验传播。
技术新颖性
技术新颖性在于范式级的统一与命名:此前工作流搜索(AFlow、ADAS)、通信拓扑优化(G-Designer、AgentPrune)、状态与恢复管理(AgentGit、MemTX)分散在三个几乎没有对话的社区,论文首次把它们纳入同一工程学科,并给出清晰的概念阶梯(模型智能→个体智能→系统智能)与五层范式谱系(Prompt/Context/Harness/Loop/Graph Engineering)。与既有图方法的两点区分(附录11.2):其一,GraphRAG 类方法把图当外部检索知识源,不改变任务组织与执行行为,不属于图工程;其二,GPTSwarm、AFlow 等把拓扑当作优化变量,是图工程的早期形态,但本文强调的是任务图、能力图、通信图、状态图的耦合治理与跨执行持久演化。论文还首次系统提出评测必须分离系统组织贡献与更强底座模型的贡献,倡导干预研究与结构消融;并把本体工程定位为图工程的语义基础而非替代,形成本体定义共享语义、图实例化任务结构、运行时强制执行其操作语义的三层路线。
实验结果
作为综述,其结果是对领域现状的系统诊断而非实验数据。(1) 概念贡献:构建覆盖约517篇文献的三层分类学(图1、图2),把 Prompt/Context/Harness/Loop/Graph 五种工程范式放进统一坐标系。(2) 评测现状(表1):按 B/D/E 三型收录约60个评测资源,分模型级(MMLU-Pro、GPQA、LiveBench 等)、个体级(WebArena、OSWorld、SWE-bench/Pro 等)与系统级(TaskBench、Who&When、MAST、MASEval、BenchAgent 等),并指出三大缺口:系统级改进与更强模型、更多计算的贡献无法分离;评测资源在工作组织、协调、状态、演化间碎片化;结构级信用分配与动态系统评测薄弱。(3) 工程生态(表2):梳理约30个开源栈,发现当前动态性几乎都在预定义结构内——条件边、路由、扇出只改变单次执行路径而不改变治理未来执行的持久组织,仅 GPTSwarm 等少数系统暴露拓扑优化,跨运行持久演化罕见。(4) 应用证据(表3):六大领域约30个系统显示,工作与团队组织已普遍,显式状态管理正在兴起,持久系统演化几乎缺失;量化例证包括 AgentSociety 支持最多30000个智能体的社会模拟、WorkTeam 在3695个真实企业样本上验证工作流生成、Agent-Ops 在7个SOP类别、1000余名客户经理的生产环境部署。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 大规模社会与经济模拟 | 并发智能体规模与涌现行为 | AgentSociety(表3收录)支持最多30000个智能体在真实共享环境中并行交互并开展干预式社会实验 | 传统小规模多智能体模拟与基于规则的建模(通常数百量级智能体) | 规模提升约2个数量级,验证团队结构与运行时状态设计在大种群下的可行性 |
| 企业工作流自动化 | 真实企业样本上的工作流生成与执行 | WorkTeam 由监督、编排、填充三类智能体协作,在3695个真实世界企业样本上完成自然语言到可执行工作流的转换验证 | 早期人工预定义流水线式多智能体系统(如 MetaGPT/ChatDev 的固定阶段结构) | 首次在大规模真实企业数据上验证系统级角色分工的工程价值 |
| 生产级SOP自动化 | 部署规模与可审计性 | Agent-Ops 将SOP梳理、网页执行、文档校验分配给协作组件,在7个SOP类别、1000余名客户经理的生产环境中落地 | 单智能体自动化脚本与人工流程 | 形成可审计的多组件运营链路,是运行时状态管理进入真实生产的代表性证据 |
| 系统智能评测资源盘点 | 收录基准/数据集/环境数量 | 表1按B/D/E三型收录约60个评测资源,其中系统智能级27个,覆盖工作组织、团队协调、状态恢复、演化四类焦点 | 以往单篇多智能体综述通常不系统整理系统级评测资源 | 首次按智能层级统一组织评测版图,并明确指出持久系统演化评测近乎空白 |
| 开源工程生态梳理 | 代表性开源系统数量 | 表2收录约30个跨三层开源栈(Transformers、vLLM、LangChain、Claude Agent SDK、LangGraph、AutoGen、CrewAI、GPTSwarm等),标注抽象、范式与许可证 | 各框架文档分散且抽象互不兼容,缺乏统一坐标系 | 揭示了生态碎片化:框架间任务依赖、权限、通信与状态的表示互不兼容,MCP只解决能力互操作而不提供系统组织表示 |
局限与改进
作者承认的局限有三:其一,显式图结构本身不保证组件对图的一致解释——各智能体对什么算任务完成、充分证据、有效状态或授权动作仍可能分歧,需本体工程建立共享语义;其二,仅凭端到端成功无法判断系统智能是否真实提升,性能可能来自更强底座模型、更长上下文或更大算力而非更有效的组织;其三,持久系统演化在现有系统中极其罕见,评测资源碎片化且结构信用分配方法缺失。我的补充观察:第一,全文缺乏形式化定义与可度量指标——三个图视图没有统一的图语义(如 $G=(V,E)$ 的类型系统)和结构保真度、操作正确性的量化定义,且不少系统横跨多类(StateFlow 同现于循环架构与状态管理,TDAG 同属任务组织与系统演化),边界模糊削弱分类的操作性。第二,显式图的运行时代价——状态记录、溯源、校验的延迟与存储开销——几乎没有定量讨论,而这类开销可能抵消并行化收益。第三,隐私与伦理仅一节带过,但多组件复制敏感信息、跨任务泄漏与执行痕迹推断的风险同图的可见性设计高度耦合。第四,对 Codex、Claude Code 等闭源系统的结构分析依赖公开文档,内部组织不可验证。
独立分析的弱点
弱点一:概念框架缺乏形式化与度量,结构保真度、操作正确性等维度只被点名而无可计算定义。改进方向:为任务/团队/状态图定义带类型的图模式(类似 SHACL 约束),把依赖覆盖率、恢复边界正确性、状态一致性做成可检验指标。弱点二:论文主张图工程带来系统智能,但全文没有受控实验支持这一因果论断。改进方向:在 BenchAgent、MASEval 类平台做结构消融——同一批任务在固定拓扑与演化拓扑、有与无状态图下以匹配计算预算对比,量化组织贡献。弱点三:三视图耦合的复杂度未被分析,通信剪枝、逐轮重构边、事件溯源在长任务中的时间与存储开销可能很大。改进方向:报告延迟/成本曲线,研究状态与拓扑的近似维护。弱点四:自演化系统存在被操纵风险——FlowSteer 已证明注入的规划信号可将重规划劫持到不良执行路径,但论文对对抗性结构注入的防御着墨很少。改进方向:把结构变更纳入权限、事务与回滚机制,对演化信号做可信度评估。弱点五:人类参与仅被建模为通信图中的特殊节点,审批瓶颈与责任分配对系统吞吐的影响缺乏讨论。改进方向:把审批与升级路径作为一等图对象建模并量化其代价。
未来方向
作者提出的方向有五:一是基于LLM的自主本体构建——LLM智能体提议并解释本体变更,OWL推理、SHACL校验、溯源跟踪、回归测试、版本控制与人类治理决定是否接受,LLMs4OL、OntoExtend、OntoCodex 已是雏形;二是图原生能力基底——把模型、工具、技能、记忆、数据源、验证器统一为带依赖、兼容、组合、替代、授权、成本、可靠性类型边的能力图,并与任务图、智能体图、状态图耦合,A-MEM、Zep、Graph of Skills、SkillDAG 是起点;三是自演化图系统——建立从执行观察、结构信用分配、图修改、验证到提交/回滚的闭环,研究跨图一致性演化与版本治理,目标是可控地积累组织经验而非无限制自我修改;四是图原生智能体操作系统——让任务、智能体、能力、状态成为类型化、版本化的一等系统对象,运行时提供图调度、结构事务、检查点、重放、回滚与图级可观测性,AIOS 是重要先例;五是隐私与伦理——隐私保护状态管理、范围权限与溯源日志。基于本文成果还可延伸:系统智能的度量科学(用干预式评测区分组织贡献与模型贡献)、成功结构的跨任务迁移与复用、多智能体团队间的协商与市场化组织。
复现评估
作为综述,复现的含义是按图索骥地搭建与验证,开放度极高。资源层面:配套GitHub仓库(DEEP-JLU/Awesome-Graph-Engineering)持续收集论文、数据与项目,表1至表3本身就是三份资源地图;绝大多数被引系统开源(LangGraph、AutoGen/AG2、CrewAI、CAMEL、GPTSwarm、MetaGPT、AFlow、OpenHands 等均有公开代码,多为 MIT/Apache-2.0 许可)。若要验证核心论点——结构组织的贡献大于单纯堆叠智能体——需自行设计受控消融实验:底座模型调用API即可起步,但要做到论文强调的匹配计算预算比较(排除更多重试、更多样本带来的虚增收益)需要严谨的实验设计,中等工作量。论文本身无需训练与算力。门槛主要在概念层面:吃透三个图视图的区分(很多系统的类别归属本就模糊),并选定框架动手;对工程团队而言,把现有 LangGraph/CrewAI 系统改造为带版本化图工件、结构事务与重放回滚能力的形态,就是最近的可复现路径。总体难度:入门读解容易,实证复现中等。
论文图表
时间轴式总览:模型智能(预训练与后训练,加上 Prompt/Context 工程激发与条件化)演进到个体智能(Harness 工程接入工具、Loop 工程形成闭环,代表工作如 ReAct、SWE-agent、OpenHands、LATS),再到系统智能(图工程的任务组织、智能体协调、运行时状态管理,代表工作如 HuggingGPT、GPTSwarm、LangGraph、TDAG、EvoFlow、DyTopo 等)。
一图读懂全文的概念阶梯:五种工程范式分别优化哪一层智能、各层有哪些里程碑工作,是理解论文定位与贡献的最佳入口。
展示基础模型的参数化能力经过三层转化成为个体智能:Prompt/Context 工程做任务条件化与接地,Harness 工程接入知识、记忆、技能、工具与环境执行提供持久能力,Loop 工程形成感知-规划-行动-观察-验证-恢复的闭环;右侧同时标出个体智能的局限(能力有界、协调有限、经验局部积累),引出系统智能。
清楚解释了为什么单体智能不够用:它是论文论证链条中承上启下的一环,把第3节的演化叙事压缩成一张机制图。
用考试类比刻画智能层级的递进:从模型、Prompt 与 Context 工程(答题),到工具化的 Harness 工程(查资料),再到反馈驱动的 Loop 工程(检查修订)、团队化的 Graph 工程(分工协作),最终到基于本体的协作(共享语义),下方面板汇总各层代表技术。
全篇最直观的类比图,帮助非多智能体背景的读者迅速建立五层范式分工的心智模型。