从问题到证据:面向受治理数据分析的小型分析代数 MasterControl Seventeen Every Time
模型只解释问题,确定性策略执行预写分析程序,答案与证据可复现
前置知识
关系代数
一种以集合运算操作关系的查询语言,核心算子包括选择 $\sigma$、投影 $\pi$、重命名 $\rho$、笛卡尔积 $\times$、并 $\cup$ 与差 $\setminus$。它是最经典的受限查询语言:Codd 证明了它对一阶逻辑可表达的查询类是“完备”的,即该类中每个查询都能写成有限的关系代数表达式,完备从不意味着通用计算。
本文的核心论证正是类比关系代数完备性:用 RESTRICT/SHAPE/RELATE 三个算子族构造性地翻译任意有限域一阶公式(定理 1),不懂数据库理论就无法理解“受限不等于丧失表达力”这一关键命题。
一阶逻辑与有限域求值
一阶公式 $\varphi$ 在有限数据库 $D$ 上的答案定义为 $q_\varphi(D) = \{\bar{a} \in A_{s_1} \times \cdots \times A_{s_k} : D \models \varphi(\bar{a})\}$,即所有满足公式的元组集合。当变量域有限时,全称量词可以通过“减去存在反例的赋值”来计算,否定可以用差运算实现。
论文用一阶公式独立定义“问题是什么”,再翻译成可执行程序,把语义规范与实现分开;定理 1、2 的证明都是对该定义做结构归纳,读懂证明必须先熟悉这一定义。
运行时工具规划 Agent
让大模型在推理时自主决定调用哪些工具、如何拼接过滤与连接、何时停止的智能体范式,Text-to-SQL 是其典型实例:模型阅读数据模式后现场生成 SQL 并迭代修订。分析方法在请求时刻被“发明”出来,因此正确性完全依赖模型的规划、搜索与自我验证能力。
本文全部实验就是与三个 8B 运行时规划 Agent(Qwen3-8B、Ministral-3-8B、Granite-4.1-8B)对照,只有理解这一范式的失败面,才能读懂 0/330 对 110/110 的核心结果及其边界。
确定性可复现与执行证书
若固定输入、策略、程序、数据快照与数值约定后,重复执行必然得到相同输出,系统就在分析层可复现。执行证书额外记录数据快照、策略版本、程序版本、内核版本与序列化规则,使每次结果可审计、可追责;近似内核则要求分数离阈值至少 $\eta$、top-k 相邻位差超过 $2\eta$ 才能保证成员不变。
定理 4(证据保持重放)与近似 SIMILAR/RANK 内核的边界条件都建立在这个概念上,也是论文把“可重复”与“正确”区分开、把答案定义为可审计契约的基础。
研究动机
论文从一个看似平淡的问题切入:“上周批准发生了多少起温度偏移偏差?”假设答案是 17。生产一次 17 很容易,难的是保住 17 的含义:“上周”可以是日历周也可以是滚动七天;“温度偏移”可以是受控类别也可以是自由文本的语义相似匹配;一个 JOIN 可能数的是偏差记录还是观测行;作废记录算不算都要事先定义。两个系统可以打印同一个数字,却在测量不同的人群。当前的 LLM Agent(Text-to-SQL、运行时工具规划)在请求时刻自主选择工具、连接、过滤、执行顺序和停止规则,本质上是在现场设计一个分析方法:论文的 330 次运行时规划实验表明,这种自由度直接表现为无法满足“答案+证据”的完整契约——即使是温度 0 下的可复现输出,也可能稳定地错误。
本文的目标是作者要为一类有界的只读企业分析建立清晰的架构边界:语言模型可以解释用户措辞、生成受治理的语义请求,但分析方法由确定性策略从预先编写、审查、测试并版本化的程序目录中选择;程序由少量带类型约定、错误行为和证据语义的算子构成,在返回结果的同时返回带角色标注的支持证据和执行证书。理论上要回答“这种限制是否牺牲分析能力”:证明在声明的分析类内每个规范都有精确的有限程序(scoped completeness),且固定受治理状态后结果与证据可重放;实证上用 440 集实验量化“让模型现场规划方法”相比“策略执行”到底损失多少正确性和效率。
与已有工作不同的是,主流工作把 Text-to-SQL 当作生成问题来改进——更强的模型、更好的提示、自我修订、执行反馈验证。本文的独特切入是把边界整个挪走:模型根本不生成 SQL、算子名、算子顺序或程序标识符。作者借用数据库理论的经典结论做类比——关系代数同样受限,却对一阶可表达的查询类完备——据此论证“受限不必然丧失表达力”。创新点集中在三处:把答案定义为契约 $R = (m, v, E)$(受治理含义、分析值、角色标注证据)而非标量;用同模型对照(Qwen3-8B 同时出现在架构两侧)把“方法归属”这一变量从“模型能力”中剥离;当策略没有覆盖某问题时,系统显式暴露覆盖缺口而不是发明新方法。
核心方法
直觉是:事实型分析器不应该每次回答都发明新的度量方法。系统管线为:自然语言问题先经过概率边界(LLM 语义解释)变成规范化请求 $c$,随后进入受治理的分析核心,确定性策略计算 $\Pi(c) = (j, \theta)$ 或返回澄清/拒绝,其中 $j$ 是预写程序的编号,$\theta$ 只允许绑定站点、产品、时间区间、阈值这类业务参数。选中的程序由八类算子族构成:RESTRICT(哪些记录合格)、SHAPE(返回哪些字段与派生)、RELATE(关系如何连接)、AGGREGATE(聚合粒度)、COMPARE(基线与分母)、WINDOW(时间/有序窗口)、RANK(全序与并列规则)、SIMILAR(版本化语义邻域)。例如那道计数题可写成 RESTRICT[批准人群] $\to$ WINDOW[上个日历周] $\to$ RESTRICT[温度偏移定义] $\to$ AGGREGATE[count distinct deviation_id] $\to$ SHAPE[结果+证据]。最终输出契约 $R = (m, v, E)$,外加记录快照、策略版本、程序版本、内核版本和序列化规则的执行证书。
核心创新是这条架构公理:“模型可以解释问题,但不选择分析方法”,以及支撑它的 scoped completeness 理论。作者不声称语言万能,而是类比关系代数:受限的小语言对声明的查询类完备。定理 1 给出构造性翻译:对变量集 $X$ 构造有限赋值关系 $U_X$,原子变成选择,否定变成 $U_X \setminus T_X(\varphi)$,析取变成并,存在量词变成投影,全称量词通过“减去有反例的赋值”实现——任意有限域一阶规范都可精确编译为 RESTRICT/SHAPE/RELATE 程序,反向等价也成立。定理 2 加入显式分析内核后覆盖整个声明分析类。与已有方法的本质区别在于:正确性不寄托在模型的搜索与验证能力上,而是寄托在设计时已审查测试的版本化程序目录上;“这个分析能否表达”(代数)与“这个分析是否在此获批支持”(策略)被明确分离为两个问题。
方法步骤详情
第一步,规范分析类:在带类型的有限数据库上用一阶公式 $q_\varphi(D)$ 独立定义问题,只声明“答案是什么”而不涉及执行。第二步,构造性编译(定理 1):把公式递归翻译成 RESTRICT/SHAPE/RELATE 程序——原子变选择、否定变差、析取变并、存在量词变投影、全称量词通过减去反例赋值实现,结构归纳证明逐元组等价。第三步,加入分析内核(定理 2):标量派生用 SHAPE、分组折叠用 AGGREGATE、时间/有序框架用 WINDOW、对齐比较用 COMPARE、全序排名用 RANK、固定邻近函数用 SIMILAR,按依赖序处理并用归纳完成证明。第四步,设计时为每个受支持模板 $W = \{q_1(\theta), \ldots, q_m(\theta)\}$ 编写、审查、测试并版本化程序;请求时确定性策略只绑定业务参数(定理 3)。第五步,重放保证(定理 4):固定 $\Omega = (D, A, M, \Pi, C, K, N, O)$ 后重复执行返回相同契约;近似内核要求分数离阈值至少 $\eta$、top-k 相邻位差超过 $2\eta$。第六步,实证:在合成质量/制造数据集的 11 项任务上做 4 种设置 × 2 个面板 × 55 集 = 440 集实验,冻结程序在 4 个保留变体上离线评分,主指标是跨 5 个快照的精确契约准确率。
技术新颖性
技术新颖性体现在四个层面。其一,把数据库理论的完备性论证引入智能体设计:不是实证地比较提示词,而是定理化地证明“限制算子集合不会限制声明的分析类”,为架构约束提供数学依据,这在 LLM Agent 文献中很少见。其二,把“证据”提升为一等公民:主指标是精确契约准确率——数值、受治理含义、合格记录、证据角色在 5 个快照上全部匹配才算对;论文特意展示了数字对但证据错的 5 个 Ministral 例子来说明为什么。其三,实验设计上用同一模型(Qwen3-8B)同时担任运行时规划者与纯语义解释者,把“谁拥有分析方法”从模型能力中干净地隔离出来;固定请求面板进一步排除了语义误解这一替代解释。其四,诚实的范围声明:结论限定为“在该特定配置下”,近似内核给出 $\eta$/$2\eta$ 边界条件,并把“可重复但错误”(温度 0 下可复现的错误 SQL)与正确性明确区分。
实验结果
共 440 集:330 集运行时规划 + 110 集策略执行。主结果:在该特定配置下三个运行时规划 Agent 无一达到主指标——0/330 产出跨 5 个快照全匹配的精确契约;其中 220 集以拒绝告终、55 集耗尽 8 次工具预算、55 集返回最终程序但无一精确。策略执行分析器 110/110 全部精确。自然语言面板(各 55 集):Qwen3-8B 运行时 Agent 最终 0/55、精确 0/55,平均 6,850 令牌、6.372 秒;Ministral-3-8B 最终 10/55、精确 0/55,11,219 令牌、20.029 秒;Granite-4.1-8B 最终 0/55、17,307 令牌、12.815 秒;策略分析器 55/55,仅 1,433 令牌、0.219 秒——比 Qwen 运行时 Agent 令牌少约 4.8 倍、时间少约 29 倍。固定请求面板:三 Agent 合计 165 集 0 精确(Qwen 最终 15/55、8,019 令牌、10.771 秒;Ministral 最终 5/55、15,252 令牌、23.670 秒;Granite 最终 25/55、17,912 令牌、34.003 秒),策略执行零模型调用、0 令牌、平均 0.0028 秒完成 55/55。细节:5 个 Ministral 集在开发快照上数出了正确的 17,但证据角色标注错误、分组聚合在空人群时返回空行——数字对但分析错;温度 0 下若干错误程序跨次可复现,说明可重复不等于正确。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 11 项受治理分析任务(计数、含零计数分组、缺席查询、带并列排名、比率、周期变化、贡献算术、连接多重性、精确均值、分数阈值、区域分组)× 5 个快照 | 精确契约准确率(值+含义+合格记录+证据角色全对) | 策略执行分析器 110/110 | 三个运行时规划 Agent 合计 0/330 | 从 0% 到 100% |
| 自然语言端到端面板(Qwen3-8B 同模型对照) | 精确契约数 / 平均令牌 / 在线耗时 | 55/55,1,433 令牌,0.219s | Qwen3-8B 运行时 Agent 0/55,6,850 令牌,6.372s | 令牌减少约 4.8 倍,耗时减少约 29 倍,精确率 0% → 100% |
| 固定规范请求面板(语义解释已提供,纯分析方法构造) | 精确契约数 / 令牌 / 耗时 | 55/55,0 令牌,0.0028s | 三 Agent 合计 0/165,单模型 8,019–17,912 令牌,10.771–34.003s | 零模型推理即达 100%,排除语义误解解释 |
局限与改进
作者明确承认:结果是经验性且依赖具体配置的,不构成“Agent 在其他搜索、验证、模型或工具设计下不能成功”的证明;更大的模型、原生函数调用、不同提示、更多预算、带形式验证的程序合成、健全的搜索-接受过程都可能改变结论;基准是单一合成质量/制造数据集上的 11 项任务,且任务全部已在策略目录中——这天然偏向预写程序一侧;策略方法自身成本(程序需编写、审查、测试、版本化、维护)未被量化,真实生产中“多大比例的问题能映射到已审程序”仍是开放问题;确定性不修复错误的语义解释或错误的策略——模型把用户的话映射到错误含义时,系统仍会可复现地给出错误答案;纯关系运算无法生成计数标量,必须依赖显式分析内核。我的补充:只测了 8B 开源模型且工具预算仅 8 次,精确契约指标极严格且缺少部分得分诊断,策略管线自身的语义解释错误率未被测量,而这恰是系统的概率软肋。
独立分析的弱点
第一,基准构造偏向结论:11 项任务全部是“已被策略支持”的任务,运行时 Agent 被要求做的(现场发明方法)正是系统设定中明确禁止的失败模式,缺少目录外任务对照来测量澄清/拒绝率与部分覆盖的价值,改进方向是加入目录外任务并报告覆盖率曲线。第二,模型与预算过弱:仅 8B 模型、8 次工具预算、无原生函数调用、温度 0 的单一采样,GPT-4 级模型或更大预算可能显著改善,应做模型规模与预算消融。第三,全有全无指标丢失诊断信息:0/330 掩盖了失败阶段分布(语义理解 vs SQL 生成 vs 证据装配),建议引入分级指标定位失败环节。第四,策略管线的语义解释错误率未被测量:若 LLM 把“滚动七天”解释成“上个日历周”,系统会自信地返回错误但可复现的答案,应报告解释准确率并设计主动澄清交互。第五,维护成本未量化:每个新问题需人工编写程序,作者自己也承认覆盖“审慎而非隐式”地增长,需要生产负载下的成本-收益研究。第六,实验限于质量/制造合规单一领域,向开放域分析外推有限。
未来方向
作者提出的方向:用有代表性的生产工作负载回答“真实用户问题映射到已审程序的比例多大、扩展覆盖的成本多少”,这是产品化前最关键的实证问题;把运行时规划保留在它真正合适的地方——开放式研究、方法发现、代码生成、运营规划——形成策略优先、规划兜底的混合架构;对生成程序引入形式验证与健全的搜索-接受规则,而不是仅靠工具可用性。基于本文成果可延伸:把近似内核的 $\eta$/$2\eta$ 边界条件做成运行时检查并在证据中标注近似风险;把 4 个保留数据变体的多快照回归测试工程化为程序目录的持续集成;把执行证书扩展为端到端数据血缘以对接审计与合规;研究语义解释层的置信度估计与主动澄清,封住“可复现地错”的软肋;以及把八算子代数编译到 SQL 引擎之上形成可部署内核。
复现评估
复现条件相对友好:三个被测模型都是开源 8B 权重(Qwen3-8B、Ministral-3-8B、Granite-4.1-8B),硬件仅需单张 NVIDIA RTX PRO 6000 Blackwell(BF16 推理),温度 0、单请求串行、工具预算 8,Agent 每集在线耗时约 6.3–34 秒,策略执行路径每集仅 0.0028 秒且无需模型调用。论文声明“精确模型修订与完整 harness 保留在配套 artifact 中”,合成数据集与 11 项任务的参考规范也在其中。理论部分自足:附录 A 给出定理 1 的完整构造性证明与类型化闭包、重放证明,可独立核验。不确定性在于论文未明示 artifact 是否公开下载,合成数据生成细节、提示词与拒绝判据都依赖该 artifact;若缺失需自行实现 harness,工作量为中等。总体评估:算力门槛低、理论可验证,artifact 可得时复现难度中等偏低。
论文图表