← 返回 2026-08-18

智能体事务:迈向满足ACID语义的智能体系统 Agentic Transaction: Towards ACID-Compliant Agent Systems

Zhaoyan Sun, Xiaoxiao Wang, Guoliang Li 📅 2026-08-14 👍 27 2026-08-23 18:30
LLM智能体 多智能体 数据库事务 数据智能体 系统可靠性

把数据库ACID事务语义引入LLM智能体,KramaBench得分提升10.6%

前置知识

ACID 事务

数据库事务的四条经典性质(Härder & Reuter, 1983):原子性指事务内操作要么全部生效要么全部回滚;一致性指事务把系统从一个合法状态带到另一个合法状态;隔离性指并发事务互不产生无效干扰,效果可等价于某个隔离级别下的串行执行;持久性指一旦提交,效果永久保存且可独立于瞬时上下文恢复。

本文的全部贡献就是把这套语义逐条'翻译'到智能体执行上,不熟悉 ACID 就无法理解四个语义保证各自的系统挑战与对应机制。

LLM 智能体与 ReAct 执行循环

LLM 智能体通过'推理→调用工具→观察反馈→再推理'的多轮循环完成长程任务,每个步骤可形式化为三元组 $(c_i, a_i, f_i)$:上下文、动作与环境反馈。Claude Code 是典型的 ReAct 风格 harness,具备长程规划、环境交互与上下文管理能力,是本文的主要对比基线。

论文定义的智能体事务 $\tau=\langle r_1,\dots,r_n\rangle$ 就建立在这个执行模型之上,理解执行循环才能明白事务单元的边界划在哪里。

Token 级对数概率与置信度

语言模型对每个输出 token 都给出概率分布,对目标输出取 token 级对数概率的平均再取指数,得到序列置信度 $\mathrm{Conf}(y)=\exp(\frac{1}{|y|}\sum_t \log p(y_t \mid y_{<t}, x))$。两个输出置信度的差称为'置信度分歧',反映模型在不同上下文下对结论把握的差异。

本文的语义一致性验证完全建立在置信度分歧上:决策分歧低于 0.25、代码片段分歧低于 0.50 就触发重试,这是全文最核心的量化机制。

追加写工作区与预写日志

追加写(append-only)指只允许新增记录、不允许就地修改的存储方式;数据库用预写日志(Write-Ahead Log)先持久化操作记录再执行,崩溃后可重放恢复。二者共同保证已提交状态可追溯、未提交状态可整体丢弃,是实现原子性与持久性的经典手段。

ACID-Agent 用追加写工作区实现原子性与持久性:只有验证通过的步骤才被追加,失败尝试的工作区更新被直接排除,Figure 1 标注的 7.7k→0.7k token 压缩正来源于丢弃失败痕迹。

多智能体并发控制与隔离级别

并发控制是数据库协调多个事务同时读写共享数据的技术,包括锁、快照隔离、多版本并发控制(MVCC)等,隔离级别(读已提交、可串行化等)定义了并发事务可见性的强弱。多智能体系统面临类似问题:并行子智能体共享工作区、记忆与工具预算,且冲突常发生在语义层面而非单纯数据访问。

理解语义隔离需要并发控制直觉:论文据此划分出独立/协作/竞争三类子智能体编排策略,以及版本化工作区、快照执行等操作级隔离手段。

研究动机

LLM 智能体正从对话助手演化为执行长程任务的自主系统:它们要在仓库级工作区上自主完成推理、工具调用、代码生成与文件修改,一次任务包含数十次模型调用与外部副作用。但这类工作流长时运行、动态生成、且常涉及非事务性外部资源,中途失败会留下半更新的工作区、重复执行的外部操作或缺乏证据支撑的结论——这与数据库当年要解决的问题高度类似。论文用波士顿海滩水质任务给出具体例子:要求对 90% 以上环境正义(EJ)人口社区的海滩,计算过去 3 天降雨量与肠球菌水平在逐日匹配下的皮尔逊相关系数,常规编码智能体 Claude Code 直接把 4 个海滩数据聚合成一个逐日值再算相关,得到错误答案 0.206,而保留每个海滩-日期对的正确答案是 0.261。此外,作者在 AgenticDataBench 的 10 个任务上每任务重复三次(Figure 3),Smolagents、DA-Agent、Claude Code、CodeX 配三套骨干模型都表现出显著逐任务方差,说明执行不一致是普遍痛点而非个例。

本文的目标是本文的目标是把数据库系统四十多年积累的事务理论系统性引入智能体领域,为不可靠的模型执行提供可靠性保证。具体而言,作者提出'智能体事务(agentic transaction)'概念:把一段依赖感知的模型调用、工具调用、文档修改与外部动作序列视为一个语义执行单元,只有当所有必需操作与后置校验都成功时其效果才对外可见,否则回滚或补偿可恢复的效果。在此概念之上,论文逐条重新诠释经典 ACID 四性质——语义原子性、语义一致性、语义隔离、语义持久性(Table 1 给出每个性质的智能体语义、系统挑战与技术手段),并落地为一个 ACID 兼容的数据智能体 ACID-Agent,通过探索-执行-验证循环、事务化技能库、置信度分歧验证、依赖感知隔离与事务感知状态管理实现四项保证,最终目标是在公开基准上超越 Claude Code 等 SOTA 智能体(实验达成 10.6% 提升)。

与已有工作不同的是,已有可靠性工作大多是'点状'的:SagaLLM 只在多智能体规划中做上下文管理与验证,DeltaBox 提供毫秒级沙箱检查点/回滚,Atomix 只关注工具调用的及时事务性,它们都缺少一套统一的语义框架。本文的独特切入点是以数据库团队的视角做系统性类比迁移:不是给智能体外挂一个校验器,而是把整条执行轨迹重新组织为事务序列,让 ACID 四性质分别约束'提交什么效果、结果满足什么条件、并发如何互不干扰、状态如何持久化',失败被视为常态而非异常,用 commit-or-retry 语义替代 best-of-N 重采样。这一差异被消融实验直接证实:3 次多数投票的 Claude Code 在环境领域只得 75.2 分且消耗 1121K token,而 ACID-Agent 用 444K token 拿到 90 分,说明收益来自架构设计而非推理预算堆叠,这与简单增加采样次数有本质区别。

核心方法

ACID-Agent 的整体思路是:把智能体执行轨迹建模为一系列'探索-执行-验证'循环,每个循环是一个语义事务单元,遵循 commit-or-retry 语义——验证通过才把效果提交到追加写工作区与上下文记忆,失败则丢弃中间状态并带着反馈重试(每单元最多重试 2 次,最多 20 个语义单元、保留 15 个历史单元)。四项保证各有对应机制:(A) 语义原子性由离线技能库(把 GitHub 仓库封装为标准化 CLI 技能、用 LLM 生成测试套件验证行为)与在线分阶段执行框架保障;(C) 语义一致性靠置信度分歧验证,用本地 Qwen3-0.6B 计算 token 级置信度 $\mathrm{Conf}(y)=\exp(\frac{1}{|y|}\sum_t \log p(y_t \mid y_{<t}, x))$,比较决策与代码在有无证据两种上下文下的分歧;(I) 语义隔离通过智能体级(独立/协作/竞争编排)与操作级(版本化工作区、快照执行、效果注解)实现;(D) 语义持久性由知识图谱式演化记忆与全量执行追踪(溯源、版本化工件)保障。

核心创新是'语义层面的 ACID':数据库事务的原子性约束的是数据页与记录,而智能体事务约束的是语义效果——一个循环的结论、代码与工作区变更只有同时满足执行无错、置信度分歧超过阈值、LLM 反思认可时才能进入下游。与已有方法的本质区别有三点。其一,失败步骤不进入记忆:验证失败时其上下文与工作区更新被隔离,消融显示去掉该机制分数直接下跌 11.7%,从机制上阻止错误传播,而 ReAct 式智能体会把全部历史塞进上下文。其二,用置信度'分歧'而非绝对置信度做验证:衡量的是'实际执行的决策是否比探索到的备选决策获得更强证据支持''代码决策相关片段在有无探索证据时置信度差多少',相对量比绝对概率更抗校准误差。其三,用 0.6B 的本地小模型(Qwen3-0.6B)计算置信度来监督 397B 级骨干模型的执行——因为 API 大模型不暴露 token 概率,本地小模型反而成了可靠性组件,这是一个反直觉但有效的工程取舍。

方法步骤详情

一次完整执行分四步。第一步,置信度引导的探索:探索子智能体基于任务描述与近期探索摘要生成只读探索代码并执行,观察被摘要进探索记忆;每次探索后用 LLM 比较有/无先前观察两种上下文下的置信度 $\mathrm{P}_{\mathrm{LLM}}(\mathrm{Explored} \mid \mathrm{Evidences})$,分歧大说明当前探索高度依赖旧观察、信息增量小,冗余超阈值即终止(预算 1–4 轮,每两个单元递减一轮,分歧超 0.45 提前终止),摘要还会被合并以维护一致的证据库。第二步,决策与代码验证:从探索摘要与生成代码中分别抽取结构化决策,计算决策置信度分歧,低于 0.25 触发带反馈重试;再对代码做静态分析定位决策相关片段,计算有无探索证据时的片段置信度分歧,低于 0.50 触发重试。第三步,隔离执行:代码在隔离环境中执行,结果以追加方式写入版本化工作区,失败单元的中间上下文与工作区更新被丢弃。第四步,状态维护:专门的 LLM 对事务级记忆执行插入/合并/拆分/删除等知识图谱演化操作,同时持久化溯源信息与 LLM 交互记录,支持审计与版本感知恢复。

技术新颖性

技术新颖性体现在四个层面。概念层:首次把 Härder 与 Reuter 1983 年的经典 ACID 定义逐条映射到智能体语义(Table 1 为每个性质给出'智能体事务语义—系统挑战—技术手段'三元组),把智能体事务形式化为有界的语义单元 $\tau=\langle r_1,\dots,r_n\rangle$,每个步骤 $r_i=(c_i,a_i,f_i)$ 包含上下文、动作与环境反馈。机制层:置信度分歧验证是新的验证信号组合,同时利用执行错误、决策分歧、代码片段分歧与 LLM 反思反馈,阈值化触发证据引导的重试,而非盲目重采样。系统层:技能被提升为一等事务对象,带幂等键、预写动作日志、检查点与自动补偿等事务性保障,并配工作负载感知的技能路由周期性分析历史日志、动态调整技能检索特征。实验层:证明轻量本地模型(Qwen3-0.6B)的置信度信号可以有效监督 397B 骨干模型——ACID-Agent 配 Qwen3.5-397B-A17B 得 74.6%,甚至超过 Claude Code 配更大 GLM-5.2 的 74.2%,为'小模型监督大模型'提供了可复用范式。

Overview of ACID-Compliant Data Agent System.
Figure 2: Overview of ACID-Compliant Data Agent System.

实验结果

主实验在 KramaBench 上进行(104 个任务、1700 个数据文件、6 个领域)。整体性能(Table 2):ACID-Agent 配 Qwen3.5-397B-A17B 得 74.6%,比同骨干 Claude Code(64.0%)高 10.6 个百分点,其中环境领域 90.0 对 70.2、野火 83.7 对 71.7、法律 83.3 对 73.3;换 GLM-5.2 骨干后 77.4% 对 74.2%,且 Qwen 骨干的 ACID-Agent(74.6)甚至超过 GLM 骨干的 Claude Code(74.2),说明收益来自 harness 设计而非模型规模,代价是代码步骤 22.8 对 9.4、成本 $0.10 对 $0.08(GLM 骨干下 $0.61 对 $0.12)。一致性(Table 3,环境领域三次运行):ACID-Agent 得分 88.9±18.6,显著优于 Claude Code 的 63.9±30.9,逐任务方差大幅收窄。消融(Table 4):完整版 90.0(25.5 步、444K token),去掉失败步骤隔离降到 78.3(-11.7),3 次多数投票的 Claude Code 75.2 且耗 1121K token(ACID-Agent 仅 444K),DA-Agent(去掉全部 ACID 设计)65.2,证明改进不来自推理预算堆叠。

ACID properties for agentic transactions. Unlike conventional database transactions, agent transactions combine non-deterministic reasoning with heterogeneous, potentially non-transactional effects.
Table 1: ACID properties for agentic transactions. Unlike conventional database transactions, agent transactions combine non-deterministic reasoning with heterogeneous, potentially non-transactional effects.
Scores (%) and Trajectory-level Metrics on KramaBench. ➀=Qwen3.5-397B-A17B, ➁=GLM-5.2.
Table 2: Scores (%) and Trajectory-level Metrics on KramaBench. ➀=Qwen3.5-397B-A17B, ➁=GLM-5.2.
Consistency of Agent Performance Across Three Runs on the Environment Domain of KramaBench (mean ± sqrt(avg(Var))). All agents are based on Qwen3.5-397B-A17B.
Table 3: Consistency of Agent Performance Across Three Runs on the Environment Domain of KramaBench (mean ± sqrt(avg(Var))). All agents are based on Qwen3.5-397B-A17B.
Ablation Study on the Environment Domain of KramaBench. All agents are based on Qwen3.5-397B-A17B.
Table 4: Ablation Study on the Environment Domain of KramaBench. All agents are based on Qwen3.5-397B-A17B.
查看结构化数据
任务指标本文基线提升
KramaBench 整体(数据智能体,104 任务/6 领域) 任务得分 (%),骨干 Qwen3.5-397B-A17B ACID-Agent:74.6 Claude Code:64.0 +10.6 个百分点
KramaBench 整体(数据智能体) 任务得分 (%),骨干 GLM-5.2 ACID-Agent:77.4 Claude Code:74.2 +3.2 个百分点
KramaBench 环境领域,三次运行一致性 得分 mean ± sqrt(avg(Var)) ACID-Agent:88.9 ± 18.6 Claude Code:63.9 ± 30.9 +25.0 分,方差降低约 40%
KramaBench 环境领域,消融实验 任务得分 (%),Qwen3.5-397B-A17B ACID-Agent 完整版:90.0;去掉失败步骤隔离:78.3 Claude Code 3-多数投票:75.2;DA-Agent:65.2 隔离机制贡献 11.7 分;比 3-多数投票省 60% token(444K vs 1121K)

局限与改进

作者明确承认这是'初步实验结果':智能体事务是比数据智能体更大的概念,但验证只在 KramaBench 的数据科学任务上进行,未覆盖代码、网页操作等通用智能体场景。此外还可观察到:(1) 三个置信度阈值(探索终止 0.45、决策分歧 0.25、代码分歧 0.50)与重试上限(2 次)均为手工设定,论文未做敏感性分析;(2) GLM 骨干下成本从 $0.12 涨到 $0.61(约 5 倍),可靠性的性价比依赖骨干模型定价,代码步骤数翻倍多(22.5 对 8.8);(3) 置信度依赖本地 Qwen3-0.6B 的 token 概率,0.6B 小模型自身的校准误差可能传导为误判重试或漏判;(4) 原子性承诺中的'补偿外部副作用'(如撤销已发出的 API 调用、幂等键、补偿事务)只有设计构想,没有任何实验支撑;(5) 一致性只用 3 次运行的方差度量,样本量小且未报告显著性检验;(6) Table 2 显示考古领域两者同为 41.7,说明对证据稀缺的难任务收益有限。

独立分析的弱点

独立分析后我认为有几个值得改进的弱点。第一,验证阈值是全局静态超参数,但不同领域任务的最优分歧阈值大概率不同——环境领域证据密集而考古任务证据稀缺,可借鉴论文自己提到的 LLM 数据库调参思路,用历史执行日志微调一个阈值预测器。第二,论文没有量化验证器本身的质量:重试到底拦住了多少真错误、误杀了多少本可提交的好结果(精确率/召回率)完全没有报告,建议引入校准手段(温度缩放、conformal prediction)或多个小模型的集成分歧,并给出验证器消融。第三,外部副作用的补偿机制(幂等键、补偿事务、预写动作日志)只在技能库设计中提及,缺少在真实含副作用的 API 工具上的评估,而这恰是事务语义落地最难的部分——数据库社区几十年的经验表明补偿远比回滚困难。第四,事务级记忆的知识图谱演化依赖 LLM 做合并/拆分/删除,摘要压缩(7.7k→0.7k token)本身也可能丢掉关键约束,在长程代码任务上是否会'压缩掉正确性'需要专门的压力测试。

未来方向

作者在第四节给出四个开放问题:原子性上,如何构建带可执行语义、质量保障与安全保证的可扩展技能生态,支持技能的可靠组合与演化;一致性上,如何通过新架构、专用基准、模型对齐、可机器检查的契约与类型化工具接口,保证跨运行的可靠推理与稳定执行;隔离上,多智能体系统如何安全协调对共享上下文、工具、工件与语义状态的访问,这需要事务抽象与数据库-LLM 一体化的服务机制来管理上下文所有权与冲突;持久性上,如何把智能体记忆变成支持事务状态管理、故障恢复与终身演化的系统级基础设施。基于本文成果还可延伸:把置信度分歧验证与形式化验证结合,对关键决策生成机器可检查的规约;用强化学习端到端训练'何时提交/何时重试'策略替代手工阈值;把 ACID-Agent 的验证信号反过来作为奖励微调骨干模型,形成 harness 与模型共同进化;以及把该框架迁移到代码智能体与网页智能体上检验普适性。

复现评估

复现条件较为友好。代码已开源(https://github.com/TsinghuaDatabaseGroup/ACID-Agent),基准 KramaBench 公开(104 个任务、1700 个数据文件、24 个数据源)。论文给出了完整超参数:最多 20 个语义单元、保留 15 个历史单元、每单元 2 次重试、探索预算 1–4 轮且每两个单元递减一轮、探索分歧阈值 0.45、决策分歧阈值 0.25、代码分歧阈值 0.50。骨干模型 Qwen3.5-397B-A17B 与 GLM-5.2 通过阿里 Bailian 平台 API 获取,置信度估计用本地 Qwen3-0.6B;硬件要求不高(256GB 内存、Xeon Silver 4110、单张 RTX 2080 Ti 即可运行置信度模型),单任务 API 成本约 $0.08–$0.61,全量复现花费可控。主要难点:论文未发布逐次运行轨迹,一致性结果难以精确对齐;API 模型版本迭代可能造成数字漂移;作者自称'初步实验',开源仓库成熟度需自行评估。总体属于中等复现难度,适合数据库与智能体方向的实验室跟进。