DataSpace:面向异构工作空间可验证分析的数据智能体基准 DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces
要求完整表格输出并用确定性评测衡量数据智能体在跨语言异构工作空间表现的基准。
前置知识
Text-to-SQL(自然语言到 SQL)
把用户的自然语言问题翻译成可在关系数据库上执行的 SQL 查询的任务。典型基准如 Spider、BIRD 会给出数据库和问题,模型需输出正确 SQL。本文的 DataSpace-Builder 正是以两个可执行的 Text-to-SQL 基准(EHRSQL、BULL)为源,借助其可执行 SQL 作为分析逻辑与验证基础来构造任务。
本文所有任务的参考答案都靠执行 SQL「算」出来,理解 Text-to-SQL 才能理解为什么答案可被确定性验证。
数据智能体(Data Agent)
能自主规划、调用工具、多步推理,在组织数据上完成自然语言分析的 LLM 智能体。它像一个「工作空间求解器」:检查可用数据、选择数据源和工具、跨表示对齐信息、执行多步计算、返回用户可消费的结果,而不是只回答一个事实片段。
本文评测的对象就是数据智能体,理解其「自主发现+组合+输出完整表」的能力边界是读懂全文的前提。
ReAct 范式
Reasoning 与 Acting 交替的智能体工作模式:模型先输出一段思考,再决定调用哪个工具,工具返回观察后再进入下一轮思考。本文自研的 DataSpace-Agent 就是 ReAct 风格,暴露 bash、view_image、submit_answer 三个动作。
实验的骨干对比就是固定这个 ReAct 智能体只换模型,理解 ReAct 才能看懂效率与动作数等指标。
多模态大模型(Multimodal LLM)
能同时理解文本、图像、视频等多种输入的大语言模型。本文评测的六个骨干(Grok 4.5、GPT-5.6 Sol、Kimi K3、MiMo-V2.5、Claude Sonnet 5、MiniMax M3)都是多模态前沿模型,因为任务工作空间含 PDF 长文档和视频。
基准刻意纳入视频和长文档,目的是考察多模态证据整合能力,这是论文核心发现之一。
关系数据库外键与连接(Foreign Key / Join)
外键声明表与表之间的关联列,连接(join)则利用这种关联把分散在不同表中的行拼合起来。本文的约束感知采样必须保护这些连接路径不被破坏,否则任务可执行性会崩塌。
实验显示 join 任务在所有骨干上都掉 9.7–19.8 分,是最稳定的退化源之一,不懂连接就看不懂这个结论。
研究动机
数据智能体正在成为访问组织数据的自然语言接口。然而在真实的分析场景中,回答用户问题所需的信息很少集中在一个干净的单表或预先选定的数据库里——它可能跨越语言和表示形式,散落在关系数据库、结构化与半结构化文件、商业长文档以及多媒体素材中,工作空间里还混杂着看似有效却无关的文件。现有基准各只覆盖这个场景的一个侧面:结构化数据基准(Spider、BIRD、Spider 2.0)通常提前指明要查哪张表或哪个库;非结构化基准(HotpotQA、CRAG、MMLongBench-Doc)聚焦于事实片段的检索、定位与综合;最接近的数据智能体基准(DABStep、KramaBench、LongDA、DataCross、FDABench)则把目标分散在事实型答案、可执行流水线、选择题或开放报告中,并配合执行式、评分表式或基于模型的评测。三件对真实数据分析至关重要的事始终没被统一起来。
本文的目标是本文要构建一个把任务契约固定不变的基准 DataSpace:每个任务都要求智能体返回完整的表格结果,并由同一套确定性协议评分。智能体只能拿到一个自然语言问题和一个任务局部的工作空间,必须自主发现并组合工作空间里的数据,最终输出用户可直接消费的完整表格。DataSpace 含 410 个跨语言任务和 7,439 个总计约 15.01 GB 的工件,覆盖 CSV、JSON、SQLite、Markdown、PDF 和视频六种模态,问题与工件都可能混用中英文,每个任务都配有完整表格参考答案。它还被选为 KDD Cup 2026「复杂数据分析数据智能体」竞赛的官方评测基准。
与已有工作不同的是,作者抓住的关键缺口是三个尚未被统一的性质:(L1) 工作空间范围——任务局部空间需横跨结构化文件、数据库、长文档和多媒体,并在问题和数据上同时变化语言;(L2) 输出契约——始终要求完整分析结果表,而非事实片段、流水线或开放报告;(L3) 评测语义——确定性评测,能接受等价表示同时拒绝不完整或错误答案。不同于以往孤立地翻译问题或翻译数据库的做法,作者把跨语言变换视为对问题、数据库状态和可执行工作负载的联合迁移,并通过执行式构建框架确保答案可被精确验证,再用 11 位领域专家盲评修复,从而让「异构、跨语言、可验证」第一次在同一基准上同时成立。
核心方法
直觉上,DataSpace 像是为数据智能体设计的一场「开卷但答案唯一」的考试:考场里散落着数据库、电子表格、长文档和视频,题目是中英文混合的,考生必须自己翻找证据、对齐实体、做关联计算,最后交出一张完整且行列精确匹配的表格。技术路线上,作者没有手工逐题构造,而是提出执行式构建框架 DataSpace-Builder,以两个可执行的英文 Text-to-SQL 基准 EHRSQL(临床)和 BULL(金融)为源——它们既提供自然语言问题 $q_0$、关系数据库 $D_0$,又提供可执行 SQL $\sigma_0$,后者提供了可解析的分析逻辑和执行式验证基础。源实例经四个阶段被改造成跨语言、异构的工作空间任务,410 个任务共 7,439 个工件、约 15 GB,答案规模从单格到 12,962 行,最终由确定性评测器评分,全程规模可控、答案可复现。
最本质的创新是把「构建可验证的异构任务」本身做成一个执行式、可校验的工程流程,而非依赖手工标注或纯 LLM 生成。核心在于:每个任务的参考答案都通过对任务局部采样数据库执行可执行 SQL 得到($Y_s = \text{Exec}(D_s, \sigma_c)$),所以答案是「算出来」的而非「标出来」的,天然可被确定性评测。为此作者设计了四项关键机制——(1) 跨语言联合变换:问题、数据库、SQL 一起迁移,并用替换映射 $M = \{M_{tab}, M_{col}, M_{val}\}$ 保证同一实体在主键、外键、去范式列里翻译一致;(2) 约束感知关系采样:先锚定 SQL 谓词和查询路径所需行,再做关系闭包,保证采样不破坏连接;(3) 模态路由与工件渲染:把同一份采样数据「投影」成 CSV/JSON/SQLite/长文档/视频等不同载体,视频还按查询条件构造;(4) 专家盲评修复。这种「以执行保真、以专家消歧」的组合是此前数据智能体基准没有做到的。
方法步骤详情
DataSpace-Builder 分四步。第一步「跨语言变换」:选定数据库语言 $\ell_D$ 和问题语言 $\ell_q$,用外键、同名、值重叠系数 $\rho(C_x,C_y)=|V(C_x)\cap V(C_y)|/\min(|V(C_x)|,|V(C_y)|)$ 抽取应一致翻译的列簇,生成表/列/值三层替换映射 $M=\{M_{tab},M_{col},M_{val}\}$,按值→列→表顺序改写数据库并用「保护-替换-还原」改写 SQL,须过结构、执行对齐、问题保真等校验门。第二步「约束感知关系采样」:从 SQL AST 抽取谓词绑定、查询关系、边界值、目标实体四类安全约束,先放锚点行再做关系闭包,在任务局部 SQLite 上执行 $\sigma_c$ 得候选参考 $Y_s$,退化则重采。第三步「模态路由与工件渲染」:用与查询无关的种子策略把每张表分配给 CSV/JSON/SQLite/Markdown/PDF 之一并做往返校验;视频作为任务级、查询条件的增强,分谓词抽象和答案证据两种策略把条件或答案嵌入分镜。第四步「专家评审与任务修复」:11 位专家双盲独立求解、对金、各自写评测配置,不一致则做最小改动修复直至共识否则剔除。
技术新颖性
新颖性体现在三处。其一,与单纯翻译问题或数据库不同,跨语言变换是对 $(D_0, q_0, \sigma_0)$ 的联合迁移,并用物化映射 $M$ 驱动物理改写,使模型调用可重跑、可手工修复而不改变确定性迁移逻辑。其二,约束感知采样不依赖源答案是否相等——它构造全新任务局部实例,允许实体、聚合、排名、基数随采样变化,只要求可执行且关系完整,这比「复制源库再挑行」更接近真实工作空间。其三,评测器把「表头措辞与列序无关」、等值格式归一化、行顺序是否重要三者统一进确定性协议 $\hat{Y}_i \equiv_{c_i} Y_i \iff \exists \pi \in \Pi_{d_i}: V_i(\hat{Y}_i[:,\pi]) = V_i(Y_i)$,彻底摆脱对 LLM 评判的依赖。这套「执行式构建 + 无模型确定性评测」的组合在已有数据智能体基准中是首创。
实验结果
固定自研 ReAct 智能体对比六个 2026 年 4–7 月前沿多模态骨干:Grok 4.5 以 66.34%(272/410)居首,GPT-5.6 Sol 64.63%(仅差 7 题),Kimi K3 53.41%,MiMo-V2.5、Claude Sonnet 5、MiniMax M3 均低于 40%,最强与最弱相差 37.80 个百分点。六模型并集仅解出 334 题(81.46%),76 题无人解出、56 题全员解出。固定 MiMo-V2.5 换骨架时,Grok Build 46.34%、Claude Code 44.63%、DataSpace-Agent 39.27%、Codex 34.88%、Smolagents 30.98%,15.36 个百分点跨度证明骨架影响巨大。GPT-5.6 Sol 仅落后 Grok 1.71 分却少用 74.2% token、50.3% 动作、39.2% 时延形成 Pareto 前沿;MiMo-V2.5 以每题 $0.011 拿下成本前沿。多模态任务在所有骨干上下降 1.8–14.0 分、join 任务下降 9.7–19.8 分,是最稳定退化源。136 个 Grok 4.5 失败根因审计显示答案物化占 52.2%(60 例多/少列)、意图误解 22.8% 合计 56.6%,而选错证据源仅 3 例——瓶颈不在「找证据」而在「把结果物化成精确的表」。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 骨干对比(固定 DataSpace-Agent) | Task Accuracy | Grok 4.5 达 66.34%(272/410) | 最弱 MiniMax M3 28.54%(117/410) | 最强与最弱相差 37.80 个百分点 |
| 骨干对比(第二梯队) | Task Accuracy | GPT-5.6 Sol 64.63% | Grok 4.5 66.34% | 仅低 1.71 分但少用 74.2% token |
| 骨架对比(固定 MiMo-V2.5) | Task Accuracy | Grok Build 46.34% | Smolagents 30.98% | 骨架选择造成 15.36 个百分点跨度 |
| 多模态整合退化 | Task Accuracy 差 | 多模态任务对比单模态 | 六个骨干均下降 | 一致下降 1.8–14.0 个百分点 |
| 连接任务退化 | Task Accuracy 差 | 需 join 的任务对比无需 join | 六个骨干均下降 | 一致下降 9.7–19.8 个百分点 |
| 成本效率前沿 | API 成本/题 | MiMo-V2.5 $0.011(39.27%) | GPT-5.6 Sol $0.200(64.63%) | MiMo 以最低成本提供可用工作点 |
| 六模型并集上限 | 可解任务比例 | 334/410 = 81.46% | 最佳单模型 66.34% | 76 题无人解出,基准未饱和 |
局限与改进
作者坦承的局限包括:最佳仅 66.34%、基准未饱和;DeepAnalyze、AgenticData 等专用系统因接口不覆盖视频输入或表格输出契约、或无官方实现,无法被忠实评测。我观察到的局限还有:410 题规模相对有限,其中 363 题(88.5%)源自金融 BULL、仅 47 题(11.5%)来自临床 EHRSQL,医疗域偏薄;跨语言仅限中英两种语言,未覆盖日韩等多语场景;为支持官方评测,410 个参考答案里只公开了 60 个,研究者难以在完整基准上本地复现榜上成绩;视频虽是亮点但仅 189 个工作空间含视频、97 个真正需要视频;此外确定性行匹配对「近似正确」(如个别数值差一位小数)一律判错,可能低估真实可用性。
独立分析的弱点
第一,源域集中且偏金融:88.5% 任务来自 BULL,医疗、制造、科研等域缺位,改进方向是引入更多垂直域的 Text-to-SQL 源或支持半监督接入真实脱敏工作空间。第二,跨语言只覆盖中英,而值重叠系数 $\rho$、保护词表等机制本身是语言无关的,完全可扩展到日韩等多语,作者可在下一版补齐以验证泛化性。第三,视频生成依赖 React/Remotion 渲染管线,成本约每题 $0.58,且仅 189 个任务含视频,规模偏小,建议降低渲染成本并扩大覆盖以更稳健地量化多模态瓶颈。第四,评测对「近似正确」零容忍(缺一行或一列即全错),虽保证严格性但可能放大模型间差距,可补充部分得分指标。第五,确定性评测无法评判开放式洞察类问题,覆盖不到「数据故事」这类无唯一答案的真实需求,未来可增设柔性的洞察评测轨道。
未来方向
作者明确把多模态证据整合与连接列为改进数据智能体可靠性的关键瓶颈。可延伸的方向包括:针对「物化失败」这一最大错误源(52.2%),研发更强的输出契约约束与结果投影自检机制,让智能体在提交前校验列数与行粒度;针对跨模态对齐,构建显式的实体/单位/语言对齐工具与中间表示;扩展到更多垂直域与更多语言;把视频从静态分镜扩展到交互式查询;以及将执行式构建框架 DataSpace-Builder 反哺给上游 Text-to-SQL 的数据增广。基于该基准已服务于 KDD Cup 2026,后续可围绕竞赛提交做误差归因与排行榜分析,形成持续的社区基准。
复现评估
复现性整体较好。代码(github.com/HKUSTDial/DataSpace)与数据集(HuggingFace HKUSTDial/DataSpace)均以 MIT 协议开源,含官方评测器、基线实现、实验配置与文档。但完整 410 个参考答案仅公开 60 个(剩余 350 保留用于官方榜评),本地只能端到端评测这 60 个代表题。骨干对比有明确运行上限:每题 60 轮模型调用、50 次工具动作、1800 秒、4 核 16 GiB、无网络;模型经 Vercel AI Gateway 调用,输出上限 32768 token,关键模型多为 2026 年 7 月的专有或开放前沿模型,复现需相应 API 预算。构建成本方面,跨语言变换约 $0.00019/题、文档渲染约 $0.92/题、视频约 $0.58/题,外加 11 位专家人工评审,整体属于中等偏高的工程量。
论文图表
对最强骨干 Grok 4.5 的 136 个失败做根因审计:答案物化占 71 例(52.2%,其中 60 例是多/少列),任务意图误解 31 例(22.8%);矩阵进一步把评测症状(列数不符、行数不符、未提交等)分解到意图/发现/抽取/对齐/计算/物化/终止各阶段。
这张图给出了最具行动力的诊断——「找到证据不等于答对」,物化与意图误解合计 56.6%,直接指明改进方向。