← 返回 2026-09-09

LLM交易智能体在生产环境中实际做什么:来自两支舰队的六个月种群规模记录 What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets

T. J. Barton, Chris Constantakis, Patti Hauseman, Annie Mous, Alaska Hoffman, Brian Bergeron, Hunter Goodreau 📅 2026-09-04 👍 21 2026-09-12 18:30
LLM智能体 因果推断 实证测量 评估方法论 量化交易

生产级遥测揭示:LLM交易agent的行为由滑块、渲染与订单路径决定,而非模型推理。

前置知识

LLM Agent 工具调用循环(one-action-per-turn)

智能体每个回合接收编译好的上下文(市场状态、持仓、配置、策略文本),必须输出带类型和理由的工具调用(买入/卖出/观察等),一回合恰好执行一个动作后进入下一回合。DXAP 用 10 工具清单加强制 finalize 回合,DX Terminal Pro 每回合仅限一次 buy/sell/observe。

本文全部遥测(231,638 个回合、14,596 次成交、7.5M 次调用)都以回合为原子单位,理解回合结构才能理解数据的粒度与历史归因连接方式。

回归断点设计(RDD)

利用处理变量在某个阈值处的不连续识别因果效应:阈值两侧样本的混杂因素统计相同,结果变量的跳跃只能归因于处理本身。本文利用 movers 排行榜只渲染前 3 名的工程事实,在第 3|4 名边界比较入场频次,测得选择比 1.75 倍。

这是全文唯一干净的因果识别。渲染边界 1.75× 的 RDD 估计是『操作层决定行为』这一核心论点的基石证据,读懂它才能理解论文的因果推断层次。

最大有利偏移(MFE)与捕获率

MFE 指持仓期间价格朝有利方向达到的最大幅度(本文统计 24 小时内是否达到 +300 bps);捕获率 = 已实现收益 / MFE。本文 43.2% 的仓位触及 +300 bps MFE,但中位捕获率仅 2.0%,49.3% 的触达仓位最终亏损平仓。

捕获缺口是发现三的核心:市场状态可预测仓位会到哪(ROC 0.751),却完全预测不了 agent 能留住多少(捕获预测 ROC 0.541,近似随机)。

日聚类标准误

同一天开立的仓位共享同一段行情,把仓位当独立样本会把置信区间缩窄约 2.5 倍。日聚类以交易日为推断单元重算不确定性,本文所有 FIRM 级结论的区间均按日聚类给出,并叠加置换 null 与消融检验。

这是论文方法论准则第 1 条,也是它推翻自己三个早期结论的工具;不理解它就无法理解为什么本文敢把『无方向性优势』作为 FIRM 结论。

杠杆、维持保证金与清算

杠杆是名义敞口/权益之比;账户权益跌破维持保证金要求时交易所强制平仓即清算。本舰队选定杠杆中位 5.0×,纸面引擎用 0.4% 维持保证金占位,比真实 Hyperliquid 保证金机制晚约 2 倍触发清算。

205 次清算承载了舰队 74% 的毛损失,风险行为、清算集中度(OR 22.37)与支架收益(约六成来自防爆炸)全部围绕清算机制展开。

PR-AUC

精确率-召回率曲线下面积,适合稀有事件评估(本文清算基率仅 3.2%,随机基线约等于正类基率 0.1145 附近)。论文用冻结的 25 个具体特征做基线(PR-AUC 0.1145),神经编码器在其上多出 +0.0150。

H2 预注册探针用它量化『神经表征是否比具体特征多携带清算信息』,锚点梯度的分析完全建立在这个指标之上。

研究动机

到 2026 年中期,自主 LLM 智能体已经在公开市场持有并调动真实资金,但领域对它们的评估几乎完全依赖排行榜式锦标赛:nof1 的 Alpha Arena 用六个模型各 $10K 真实资金在 Hyperliquid 上比拼 P&L,KTD-Fin 与 Agent Market Arena 也以结果指标为主。这类评估只公布战绩、不公布操作层遥测,既无法回答『数千个拿到配置面、策略文本和资金的 agent 实际做了什么』,也无法定位亏损的机制来源。更糟的是,数小时到数天的锦标赛窗口叠加按仓位计算的统计区间极易把噪声当优势——本文作者自己的三个早期结论(HIP-3 滞后优势、两个『仅某版本净盈利』主张)后来都被证伪撤回,一个滚动 p 值曾从 0.0067 走到 0.19 再到 0.0277 才被人叫停。

本文的目标是本文的目标是把『评估』升级为『记录』:对两套共享同一设计谱系的生产系统做持续、种群规模的行为测量。DX Terminal Pro 于 2026 年 2 月 26 日至 3 月 18 日运行 21 天,3,505 个用户出资 vault(每个是 Qwen3-235B 智能体)在 Base 链 12 个 memecoin 市场交易真实 ETH,产生 7.5M 次推理调用、约 30 万链上操作、约 700 亿推理 token;DXAP live alpha 从 6 月 8 日到 8 月 15 日在 Hyperliquid 永续上运行 500–599 个用户创建的 agent(91–117 个同时活跃),完成 231,638 个最终化回合、14,596 次成交。在这条记录上回答三个问题:行为由什么决定、风险如何分布、是否存在方向性优势,并为每个头条结论标注 FIRM/PROVISIONAL 证据等级。

与已有工作不同的是,独特切入角度有三层。第一,作者把操作层——五滑块配置、Go 模板提示、渲染出的市场候选面(movers 排行榜只显示前 3 名涨/跌/量)、订单路径机制——当作实验变量本身,而不是把模型当唯一研究对象,这与以模型为中心的已有评估根本不同。第二,设立明确的证据分级制度:FIRM 要求注册分析、日聚类置信区间且通过至少一项消融或置换检验;三个被撤回的自身结论只在文中以『撤回』形式出现,由此换来的 17 条方法论准则在领域内罕见。第三,它选择在指标层面(而非行级)汇总两套系统,并把跨费率时代(4.5→14.5→5.5 bps/边)的 P&L 统一按 5.5 bps 重述,保证结论不因费率漂移而翻转——重述后舰队累计 −$217K,证明亏损并非费率假象。

核心方法

这是一篇测量论文而非新方法论文,核心直觉是:要弄清 LLM 交易智能体的真实行为,必须同时具备种群规模、月级时间跨度和完整遥测。技术路线是差分测量:两套系统共享『五滑块配置(交易活跃度/风险容忍/仓位大小/持仓风格/分散度,各 1–5)+ 每回合恰好一次工具调用 + Go 模板编译提示』的设计谱系,因此滑块-行为映射、交易频率、持仓时长、胜率、费率负担等指标可以跨系统对比。数据管道把 Athena(DX Terminal Pro)与 ClickHouse(DXAP)遥测按 turn id + attempt id + 该回合当时解析的模板与配置修订版本做历史归因连接,绝不使用当前名册模板;真金成交(5,035 笔)全程打标、不与纸面成交静默合并。按研究设计,DXAP 分析把舰队视为单一总体,纸面引擎机制(实时标记价、零滑点、零资金费、0.4% 维持保证金占位)在正文明示。

核心创新是把『操作层是行为的主要决定因素』变成可因果检验的命题。已有工作问『哪个模型赚钱』,本文问『系统的哪个部件决定 agent 做什么』。三个标志性设计:其一,把滑块当作处理变量,用 $p = 3.8 \times 10^{-279}$ 的映射(riskTolerance 每级 $+0.425\times$ 杠杆)加 agent 固定效应吸收 60% 方差,证明杠杆本质是配置常数;其二,利用 movers 排行榜只渲染前 3 名的工程事实,在 3|4 渲染边界做回归断点,边界两侧符号的市场状态统计相同、唯一差别是是否被渲染,得到 $1.75\times$ [1.49, 2.06] 的选择比——这是全记录中最干净的因果识别,其原因是纯粹的渲染选择;其三,把入场时附挂 2%/4% 止损/止盈支架与全部 16 种离散退出策略做配对日聚类对比,量化订单路径机制相对提示工程的杠杆。

方法步骤详情

流程五步。一,归一化:DX Terminal Pro 遥测在 Athena 按 vault/NFT/请求 id 与链上状态对账;DXAP 遥测在 ClickHouse,按回合当时的模板与配置版本做历史归因。二,风险分析:以入场前 24 小时收益率标准差度量波动率,6,400 个已平仓仓位分六分位,计算 Spearman(波动率,杠杆)$=-0.001$ 与清算率梯度,并做剔除 205 次清算的稳健性检验。三,因果识别:对 2,339 个入场在排行榜 3|4 名渲染边界做 RDD。四,退出评估:配对日聚类比较 2%/4% 支架与实际退出(+39.0 bps/仓位 [21.3, 56.5]),分解左尾截断机制。五,重放与探针:416 捕获场景 × 3 前沿模型、温度 0.6、温莎化 regret 配块 bootstrap;H2 预注册检验编码器读回合卡是否比 25 特征基线多携带清算信息(PR-AUC 0.1145→0.1295)。

技术新颖性

技术新颖性体现在测量制度而非算法。其一,7.5M 次调用、23.2 万回合的种群规模生产遥测在公开文献中独一无二——Alpha Arena 等锦标赛没有操作层遥测,TradingAgents 等架构工作在模拟环境,本文首次拿到用户-智能体-执行的完整生产轨迹。其二,证据分级制度(FIRM 需注册分析+日聚类+消融;PROVISIONAL 明示限定;撤回结论只以撤回形式引用)是对滚动态 p 值滥用的制度性回应。其三,显示性偏好优先于结果指标的测量次序:超选比一天内可读且不含市场方差项,结果指标需要数周。其四,用『重放只能刻画冻结上下文下的行为、不能支持盈利主张』的证据规则明确界定重放联赛的效力边界;17 条准则每条都由一次撤回或失败换来(如准则 10 源于只读五消息回合最后一条的 argMax bug),构成可执行的研究规范。

Selection by gainers-leaderboard rank at entry (Jun 16 to Jul 24; 2,339 entry observations across gainers ranks 1–15, plotted through rank 12).
Figure 3: Selection by gainers-leaderboard rank at entry (Jun 16 to Jul 24; 2,339 entry observations across gainers ranks 1–15, plotted through rank 12).

实验结果

四大发现。一,操作层决定行为:riskTolerance 滑块每级 $+0.425\times$ 杠杆($p=3.8\times10^{-279}$),agent 固定效应吸收 60% 方差;46.5% 入场在被渲染符号,渲染边界 RDD 选择比 $1.75\times$ [1.49, 2.06]。二,规模波动盲:波动率跨度 $5.7\times$ 上杠杆恒 $5.0\times$,收益 −10.6→−98.2 bps,清算率 0.7%→4.3%;momentum×频率5 单元格独占 128/205 清算(62%),OR $=22.37$。三,捕获缺口:43.2% 仓位 24h 内达 ≥+300 bps MFE,49.3% 仍亏损平仓,中位捕获仅 2.0%;2%/4% 支架配对净赚 +39.0 bps/仓位。四,无方向性优势:费率统一后舰队累计 −$217K,胜率 41% vs 零售 50%,15% 周净正 vs 零售 53%;重放联赛三模型 regret 263.3–264.4 bps 全重叠($p\geq0.46$),但稳定性迥异(claude-fable-5 翻转 35% vs qwen3.7 系 90–95%),成本差 25 倍。Null:77K 信号账本按机会排序,强制陈述清算距离反使清算率升至 5.8%。

The two production systems. DX Terminal Pro figures are the canonical run facts of [1] and its lab record; DXAP figures are from the live ClickHouse analytics store as of Aug 15, 2026.
Table 1: The two production systems. DX Terminal Pro figures are the canonical run facts of [1] and its lab record; DXAP figures are from the live ClickHouse analytics store as of Aug 15, 2026.
Fleet vs. retail benchmark, trailing windows ending Aug 15, 2026. Retail sample: 1,961 leaderboard traders in the $1K–$100K equity band.
Table 2: Fleet vs. retail benchmark, trailing windows ending Aug 15, 2026. Retail sample: 1,961 leaderboard traders in the $1K–$100K equity band.
Closed positions by entry-time volatility sextile (Jun 8 to Jul 24). Realized return is median net bps; bracketed-entry quality is flat throughout, so the degradation is sizing, not selection.
Table 3: Closed positions by entry-time volatility sextile (Jun 8 to Jul 24). Realized return is median net bps; bracketed-entry quality is flat throughout, so the degradation is sizing, not selection.
DXAP agents vs. a matched Hyperliquid retail sample, trailing window ending Aug 15, 2026.
Figure 2: DXAP agents vs. a matched Hyperliquid retail sample, trailing window ending Aug 15, 2026.
Volatility-blind sizing across 6,400 closed DXAP positions. Left: market volatility per sextile vs. median chosen leverage (flat at 5.0×). Right: median realized return per sextile (bars) and liquidation rate (dashed).
Figure 4: Volatility-blind sizing across 6,400 closed DXAP positions. Left: market volatility per sextile vs. median chosen leverage (flat at 5.0×). Right: median realized return per sextile (bars) and liquidation rate (dashed).
Liquidations by strategy posture × tradeFrequency slider (6,400 closed positions, 205 liquidations). The boxed cell (momentum × frequency 5) holds 128 of 205 (62%).
Figure 5: Liquidations by strategy posture × tradeFrequency slider (6,400 closed positions, 205 liquidations). The boxed cell (momentum × frequency 5) holds 128 of 205 (62%).
H2 anchor ladder: ΔPR-AUC over the frozen concrete baseline when pooling at successive points in the turn card. Error bars are 90% day-clustered intervals.
Figure 6: H2 anchor ladder: ΔPR-AUC over the frozen concrete baseline when pooling at successive points in the turn card. Error bars are 90% day-clustered intervals.
The capture gap: maximum favourable excursion within 24h vs. realized return for 6,400 closed positions (hexbin, log counts; clipped at the 0.5/99.5 percentiles for display). The dashed line marks +300 bps MFE.
Figure 7: The capture gap: maximum favourable excursion within 24h vs. realized return for 6,400 closed positions (hexbin, log counts; clipped at the 0.5/99.5 percentiles for display). The dashed line marks +300 bps MFE.
The June 2026 model decision league. Left: winsorized replay regret against the achievable envelope (bps, lower is better) for three frontier models over 416 captured production scenarios; Right: choice stability in the forced-action arm.
Figure 8: The June 2026 model decision league. Left: winsorized replay regret against the achievable envelope (bps, lower is better) for three frontier models over 416 captured production scenarios; Right: choice stability in the forced-action arm.
查看结构化数据
任务指标本文基线提升
渲染边界选择(入场归因) RDD 选择比(rank-3 / rank-4) 1.75× [1.49, 2.06](原始计数比 290/160 = 1.81×) 边界下未渲染符号;随机可得性基线 8.9% 渲染符号超选 5.2×(46.5% vs 8.9%)
止损/止盈支架 vs 离散退出 配对日聚类已实现收益(bps/仓位) +39.0 [21.3, 56.5],剔除清算后 +16.6 [2.1, 30.8] 16 种离散退出策略(最佳 −9.5 [−25.1, +8.2],无一盈利) 全记录中效应最大的行为杠杆
DXAP 舰队 vs 零售基准 4 日回合胜率 41%(n=353) Hyperliquid 零售 50%(n=16,009) 落后 9 个百分点;周净正账户 15% vs 53%
前沿模型决策质量(重放联赛) 温莎化 regret(bps,越低越好) qwen3.7-max 263.3 / qwen3.7-plus 263.6 claude-fable-5 264.4 统计不可区分(Holm 校正最小 p=0.46)
清算风险表征(H2 探针) PR-AUC 0.1295(基线 0.1145 + 0.0150,90% CI [0.0013, 0.0312]) 25 个具体特征冻结基线 0.1145;TF-IDF 臂 −0.0056(随机) 10% 标记预算下捕获 71/205 vs 57/205 清算(+25%)
环境监督微调(DX-SFT-0.3) DXTradeBench 决策评估(内部,越低越好) 96(41,203 个 harness 回合微调) 119(基线模型) −23;内部早期信号,未外部验证

局限与改进

作者坦承的局限:大多数成交来自纸面引擎——按实时标记价成交、零滑点、全部 14,596 次成交零资金费、0.4% 维持保证金占位使清算比真实 Hyperliquid 保证金机制晚约 2 倍,清算相关结论在真实环境中会更早更大;尾部结果仅由 205 次清算支撑,单元格计数小;每个时代单一场所(Base memecoin / Hyperliquid 永续),跨场所普适性只在少数跨系统发现(追涨 null、文本-控制对比)上成立;模型高度集中(7 月 22 日 86/91 活跃 agent 用 qwen3.7-plus);H2 探针读的是代理编码器 Qwen3.5-4B 而非生产模型激活;DXAP 全历史计数在不同版本间漂移(336–599)。我的补充观察:重放联赛的 regret 定义在冻结上下文上,对上下文扰动的鲁棒性未知;观测性设计无法排除未测混淆;支架收益约六成来自清算预防,外部效度直接受纸面保证金假设制约;5,035 笔真金成交『打标不分离』可能让小资金簿行为混入总体统计。

独立分析的弱点

独立弱点分析:第一,纸面引擎与真实市场的机制差距(零滑点、零资金费、清算晚约 2 倍)直接威胁清算集中与支架收益结论的外部效度,改进方向是用 Hyperliquid 实际保证金曲线重算清算价格并在真金环境小规模复制。第二,杠杆平坦可能是天花板效应——五级滑块映射出的中位杠杆本来就是 5.0×,波动率再高也无从更高,改进方向是报告滑块×杠杆的完整条件分布并检验边界压缩。第三,支架实验只在 DXAP 单系统测量,而论文自己的准则要求跨系统验证,改进方向是在 DX Terminal Pro 的 2.3% 费率环境中重放同一配对检验。第四,H2 的『回声』解释(增量只在编码器读入订单行后出现,side/symbol 解码 0.998–0.999)意味着当前形态只适合事后筛查而非事前预警,改进方向是扩大盘前锚点样本并用生产模型激活重做。第五,撤回制度虽透明但仍是单一实验室自审,改进方向是把 17 条准则实现为公开的自动化统计 CI 检查,接受第三方对逐条声明的复算。

未来方向

作者提出的开发程序按证据强度排序为五支柱:(1) 订单路径工程——原子化『开仓即带保护』路径(当前一个不可重试的触发配额错误曾使 48 小时内 35 次成功开仓中 24 次失去保护)、工具层按已实现波动率缩放杠杆、渲染 A/B;(2) 有实证效用的工具面——不能在注册窗口内相对 null 臂改变行为的表面一律移除,市场研究子代理因 n=120 的 null 已降级为行为面;(3) 风险对齐——后验表征筛查(10% 预算下 71/205 vs 57/205)加记录渲染状态、模板与配置版本的决策溯源账本;(4) 环境训练——231,638 个回合是公开基准没有的回合级训练分布,下一步是 live-branch GRPO,DX-SFT-0.3 已在内部从 119 改善到 96;(5) 基准即基础设施——模型联赛随每次模型发布重跑。可延伸方向:把 17 条准则编译成 CI 统计管道;在 CEX/预测市场检验渲染超选与波动盲的普适性;对 FEET 式羊群(峰值 441 次买入/分钟)与 3,878 次抛售级联建机制模型;比较机械支架与 RL 学习退出策略;设计防记忆污染的清洁记忆协议。

复现评估

复现情况中等偏好。公开资产:dxrg.ai/research 提供版本化公开数据集、仪表盘与逐条声明的证据工件;DX Terminal Pro 有公开 Dune 仪表盘;重放联赛的 416 个捕获场景作为版本化数据集发布,是复算决策质量结论的直接材料。不可复现部分:原始 DXAP 生产遥测含用户标识符不公开,仅提供聚合提取;7.5M 次调用、约 700 亿 token 的原始生产规模无法低成本重跑,但所有头条数字都是聚合统计,可在公开数据上复算。算力需求:聚合分析普通机器即可;H2 探针用 4B 编码器,单卡可复现;重放联赛需三次前沿模型 API 调用,按论文披露的 $8.25–$203.61 每模型量级成本可控。主要难点是两套系统私有,行为分布依赖其提示模板族谱(v2.x→Base/OPAL/JADE/Keystone)与订单路径实现细节;好在论文给出数据字典级别的描述与表 1 的完整口径,配合逐条声明的证据分级,足以定位每个数字的来源。