← 返回 2026-08-05

MerchantBench:评估 LLM 智能体电商运营长期连贯性的基准 MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

Qiming Shi, Yulong Tao, Linbo Jin, Zhaolu Kang, Yibo Dou, Jiawen Zhu, Tianjun Pan, Shaokang Fu, Chengyu Wang, Siyue Li, Yaping Cheng, Di Weng, Chengfu Huo 📅 2026-07-31 👍 96 2026-08-10 18:30
LLM智能体 电商运营 评测基准 部分可观测决策 长期连贯性

365天电商模拟基准,揭示LLM智能体长期连贯性的巨大短板

前置知识

POMDP(部分可观测马尔可夫决策过程)

在状态无法完全观测时进行序贯决策的数学框架,形式化为 $\mathcal{M}=\langle \mathcal{S},\mathcal{A},\mathcal{P},\mathcal{O},\mathcal{Z},R,\mu_0,H_c\rangle$。$\mathcal{S}$ 是隐藏的真实状态,$\mathcal{A}$ 是动作,$\mathcal{P}$ 是状态转移核,$\mathcal{Z}$ 是从真实状态生成观测的发射概率,$H_c$ 是时间范围。智能体只能依据观测与工具结果的历史来决策,而看不到完整真实状态。

MerchantBench 把电商运营明确建模成 POMDP,理解它才能看懂为何延迟反馈与隐藏字段会制造真正的决策难题。

Long-Term Coherence(长期连贯性)

指智能体在长周期内保持目标导向行为、并根据累积证据自适应调整决策的能力。它强调的不是单步动作正确,而是跨数百乃至数千步能否持续推进同一个目标,并在新证据到来时合理地维持或修订当前策略。本文进一步把它拆成操作连贯性(Operational Coherence)和战略连贯性(Strategic Coherence)两个子维度。

这是本文定义并要测量的核心能力,所有指标和失败模式分析都围绕它展开,是理解全篇的钥匙。

ReAct / Hermes 智能体框架

ReAct 是最小化的“推理+行动”控制器,把 26 个 MerchantBench 工具交给模型自己规划调用,以测其核心的规划、推理与工具使用能力;Hermes 是更丰富的运行时,在同样 26 个工具之外内置代码执行、记忆、规划、技能管理等能力。两者共享同一套工具和环境,便于对比纯推理框架与富能力框架的差距。

论文比较的就是这两种框架,结论是“框架红利强烈依赖底层模型”,这是理解实验结果的关键自变量。

一件代发(Drop Shipping)

商家不预先囤货、收到订单后才按当前供应商价采购并由供应商直接发货的电商模式。这使采购动作会立即占用现金,而发货与售后结果(缺货、延迟、退货、差评)延后暴露,天然制造了即时现金承诺与延迟结果之间的时间差。

MerchantBench 的订单生命周期和现金流约束都建立在一件代发之上,不懂它会误判资金压力和延迟反馈从何而来。

研究动机

现有智能体评测大多聚焦于有明确完成标准的“有界任务”——比如调一次工具、完成一次网页交互、关掉一个工单。但真实部署往往是长周期的:环境状态会持久化,早先的动作会约束后续选项,而相关后果可能要经过很多中间决策之后才浮现。近期多个长周期基准都表明,即便是当前最强的智能体,也常常无法在长视野内维持连贯表现。以卖家侧电商为例:一条上架或定价决策会立刻产生订单并占用现金,但履约失败、退货、差评等异常结果往往延迟很久才被观测到;同时季节性需求在不断变化,热门品类此起彼伏。这些因素叠加,要求智能体把后到的证据与早先决策关联起来,判断是维持还是修订当前经营策略——而现有基准几乎没有同时呈现“订单级延迟反馈”和“非平稳真实需求”这两个关键挑战。

本文的目标是本文要构建首个针对 Long-Term Coherence 的卖家侧电商评测基准。具体目标包括:把店铺运营形式化为一个 365 天(8,760 步)的部分可观测决策问题;用 98,843 条真实电商商品记录、来自 36,576 个供应商的真实数据打底,使需求与风险分布可信;围绕选品(Product Sourcing)、上架定价(Listing and Pricing Control)、现金流管理(Cash-Flow Management)、混合延迟反馈适应(Mixed-Latency Feedback Adaptation)四个相互依赖的决策组件组织任务;通过 26 个商家可见工具暴露环境,让不同智能体框架在同一动力学和可观测状态下公平比较;并对 8 个主流大模型 × 2 种框架做 48 次、每次 365 天的完整运营,量化它们与人类运营者的差距,并定位长期连贯性失败的具体形态。

与已有工作不同的是,已有长周期商业基准各有侧重但都漏掉了本文抓住的点。Vending-Bench 只评估自动售货机运营,商品面极窄;RetailBench 模拟超市管理但固定在 96 个杂货品类的静态目录上。它们的共同问题是:如果可售商品和需求长期不变,再长的回合也无法真正考验连贯性——智能体只要反复执行同一套动作即可。MerchantBench 的独特切入在于把“订单级延迟反馈”和“基于真实全年需求轨迹的非平稳机会集”同时放进同一环境,于是连贯性同时体现在两个维度:既要处理延迟才暴露的异常结果,又要随季节不断发现新品类、淘汰失势商品。这种组合此前没有被同时呈现。

核心方法

直觉上,MerchantBench 就像让你扮演独立店主、用整整一年经营一家网店:每天看行情、挑货上架、定价、盯现金流、处理供应商变故和售后异常,目标是在第 365 天结束时让净资产最大化。技术路线上,它把店铺运营建为有限视野的部分可观测马尔可夫决策过程 $\mathcal{M}=\langle\mathcal{S},\mathcal{A},\mathcal{P},\mathcal{O},\mathcal{Z},R,\mu_0,H_c\rangle$:模拟器以小时为单位推进 $H_c=8{,}760$ 步,需求、供应商状态与订单生命周期每步演化,智能体每 12 步(12 小时)获得一个决策窗口。真实状态 $s_t$ 含时钟、需求画像、供应商条件、店铺上架与财务、活动订单和待处理事件,但只对智能体暴露“商家可见”部分。目标是期望终止净资产 $J(\pi)=\mathbb{E}_\pi[R(s_T)]$,其中 $R(s_T)=B_T+D_T+I_T+Q_T$ 为终止现金、保证金、在途资金与应收款之和。

核心创新是把“订单生命周期”作为评测的基本单元,让即时可见的上游供应商事件与延迟显现的下游订单结果在同一笔订单上耦合。上游的 Price Change、Product Delisting、Shipment Delay 等事件会较快被观测;而一笔订单从 Placed → Procured → Shipped → Delivered → Settled 的漫长旅途中,Cancellation、Stockout、Late Shipment、Return/Refund、Bad Review 等异常结果要到对应生命周期节点才暴露。这就迫使智能体必须跟踪每一笔订单的生命周期,把后到的坏结果回溯归因到当初的上架/定价决策,再决定是维持还是修订经营策略——这正是“长期连贯性”的可测量体现。配合基于真实全年需求的非平稳商品目录,环境还不断制造新机会与失效的旧选择,连贯性因此同时经受“延迟证据”与“动态机会集”的双重考验。这与以往只在聚合层面统计销售/利润、或用静态目录测长周期的做法有本质区别。

方法步骤详情

一次运行流程如下。(1) 数据打底:从 1688 采集 365 天真实商品/供应商属性、需求史与履约信号,过滤无效记录,得 98,843 条商品、36,576 个供应商的目录。(2) 初始化:商家持 RMB 2,000 现金、RMB 1,000 保证金、最多 50 个上架位;按 $\lambda_{m,i,t}=D_{i,d(t)}w_{c(i),h(t)}r_{m,t}\ell_{m,i,t}(p_{m,i,t}/p_{ref,i})^{-\epsilon_i}$ 算每小时到达强度,泊松采样生成订单。(3) 每步演化:每小时推进需求与补货,三类上游异常(改价/下架/延迟)按商品级概率触发并采样恢复时间,订单沿生命周期推进。(4) 决策窗口:每 12 步给智能体观测摘要,其在窗口内反复调用 26 个工具直至结束或超时。(5) 结算反馈:正常订单结算入账,异常结果罚款并更新评分 $R_{m,d}$,评分再经星级乘子 $r_{m,t}$ 反作用需求。(6) 终止:到 $H_c$ 后停新需求与新决策,活动订单结算到 $T\geq H_c$,按 $R(s_T)$ 计净资产。

技术新颖性

新颖性体现在三层。其一,订单级而非聚合级:大多数商业基准只在聚合层面产出销售额/利润,MerchantBench 生成每一笔独立订单并追踪其完整生命周期,使延迟异常结果可被精确归因到具体的上架与定价决策。其二,真实非平稳需求:98,843 条全年真实需求曲线让机会集随季节流动(如红包、电风扇、暖水袋各有独立需求周期,11.11 出现双峰、春节出现低谷),长回合因此真能考验连贯性而非机械重复。其三,混合延迟反馈 + 现金约束的一件代发模型:采购即时扣现、异常结果延迟暴露且部分会扣保证金,一旦保证金耗尽经营即终止,这让“早先决策约束后续选项”成为可量化的累积效应。与 Vending-Bench/RetailBench 的静态目录、Market-Bench/Magentic Marketplace 的单回合交易相比,这是首次把上述要素组合进同一个持续运营环境。

Overview of MerchantBench
Figure 2: Overview of MerchantBench
Real-world demand patterns and calibrated risk profiles across 98,843 products
Figure 3: Real-world demand patterns and calibrated risk profiles across 98,843 products

实验结果

核心发现是当前最强 LLM 智能体与人类差距巨大,且这种差距来自长期连贯性的系统性失效。Table 1 显示:Hermes 下 Qwen3.7-Max 以净资产 RMB 59.46K 夺冠,ReAct 下 GPT-5.6 Sol 以 40.89K 领先;而人类平均净资产达 217.61K,规则基线仅 24.48K——最佳配置只达人类的 27.3%。框架层面,Hermes 平均比 ReAct 高 53.3% 净资产、71.5% GMV、71.2% 订单量,但增益因模型而异(最高 187.8%,唯独 Kimi K2.6 反低 4.1%)。稳定性上,榜首 Qwen3.7-Max/Hermes 变异系数高达 55.1%,远高于 GPT-5.6 Sol/ReAct 的 3.3%。连贯性上,人类维持 100% 的 SWR,LLM 在 ReAct 下仅 10.6%–99.4%、Hermes 下 17.8%–66.1%。典型失效:Kimi K2.6 第 104 天判店铺无法挽回后于剩余 523 窗口中 355 个完全不作为;Qwen3.7-Max 把 Day 285 误记为终点、提前 83 天停补。

Business performance, store reliability, and long-horizon activity after 365 simulated days
Table 1: Business performance, store reliability, and long-horizon activity after 365 simulated days
Final net asset distributions across three repeated runs for each configuration
Figure 4: Final net asset distributions across three repeated runs for each configuration
Monthly Product Sourcing across four representative models
Figure 6: Monthly Product Sourcing across four representative models
Final net assets against environment tool calls and new products tried
Figure 8: Final net assets against environment tool calls and new products tried
查看结构化数据
任务指标本文基线提升
365天电商运营(终止净资产) Final Net Assets (千 RMB,越高越好) Qwen3.7-Max + Hermes = 59.46 Human 平均 = 217.61;Rule-based = 24.48 最佳 LLM 仅达人类的 27.3%,但已超过规则基线约 2.4 倍
365天电商运营(交易额) GMV (千 RMB,越高越好) Qwen3.7-Max + Hermes = 116.76 Human 平均 = 608.06 约为人类的 19.2%,规模差距比净资产差距更大
智能体框架对比(净资产均值) 跨 8 模型平均 Final Net Assets Hermes 平均 ReAct 平均 Hermes 净资产高 53.3%、GMV 高 71.5%、订单量多 71.2%
长期活跃一致性 Sustained Window Rate (%,越高越好) LLM 最佳约 99.4 (ReAct/GPT-5.6 Sol),Hermes 最高 66.1 Human = 100 多数 LLM 远低于人类,暴露活动衰退与过早放弃问题

局限与改进

作者层面:人类基线仅来自 3 名无电商经验的参与者、样本偏小;规则基线与人类都各跑 3 次,统计置信度有限;最佳配置变异系数高达 55.1%,说明“榜一”并不稳健、结论对随机种子敏感。作者也指出 Hermes 采用默认配置、未做针对性调优,框架对比未必反映其上限。我的观察:(1) 数据完全来自 1688 这一个国内批发平台、单一年份(2025-06 至 2026-05),品类仅 10 个一级类目,外推到其他市场或品类的泛化性存疑;(2) 一件代发单件下单模型简化了真实店铺的多件采购、库存与组合营销,可能高估或低估某些策略;(3) 中间奖励恒为零、只看终止净资产,这种极端稀疏奖励天然偏向能长期规划的智能体,但也会让短期合理却终止时点不利的策略被低估;(4) 人类用 5 个日历天完成 365 天运营,与智能体的交互节奏并不相同,人机对比并非完全同条件。

独立分析的弱点

第一,环境真实但策略空间有限:26 个工具里写操作只有 list/delist/adjust_price,缺少营销、优惠券、组合套装、广告投放等真实运营手段,想测“全栈运营能力”的读者会发现天花板偏低——改进方向是扩充可操作维度并引入竞争性多商家环境。第二,评分与结算的稀疏性放大方差:终止净资产作为唯一奖励、变异系数高达 55.1%,意味着同一配置不同种子可能差出数倍,难以做可靠的模型横评——改进方向是引入过程性指标(如月度净资产曲线、夏普式稳定性度量)作为辅助评判。第三,记忆与时间理解是隐性瓶颈:Qwen3.7-Max 把 Day 285 误记为终点导致提前 83 天停手,说明框架级“时间锚定”和“长程记忆校验”很脆弱——可引入外部日历/校对工具或显式终止条件审计。第四,单平台、单年数据限制了结论的普适性,建议接入多平台、多年份的真实数据并做跨分布泛化测试。第五,人类基线太小(3 人、5 个日历天),应扩到更多、更有经验的运营者并匹配相同决策节奏,才能得到可信的人机差距。

未来方向

作者隐含的方向是把 LLM 智能体评测从“孤立任务完成”扩展到“持续目标追求与决策一致性”,并系统诊断操作连贯性衰退、过早目标放弃、与证据不匹配的策略漂移等失败模式。可延伸的研究方向包括:(1) 用该基准做在线学习/记忆机制的消解研究,比如对比不同上下文压缩与持久化记忆策略对 SWR 和变异系数的影响;(2) 把 Hermes 的“技能沉淀”作为研究自进化智能体的试验台,分析技能质量从“证据驱动修订”到“无结构堆砌”的分化成因;(3) 引入多智能体市场竞争(多个商家共享需求池),测连贯性在博弈压力下的表现;(4) 与强化学习或运筹优化基线(如动态定价、库存补货算法)联用,检验 LLM+OR 互补能否逼近人类水平;(5) 把环境推广到跨平台、跨年份以测分布外鲁棒性。

复现评估

代码已在 https://github.com/KhanCold/merchantbench 开源,便于复现。环境核心是基于真实公开数据(1688 商品/供应商属性、365 天需求史)的确定性可配模拟器,所有分布参数都在附录给出(如曝光因子 $\ell_0=0.2$、$T_r=14$ 天、$\kappa=0.0092$、$\ell_{min}=0.10$;供应商库存 20–399、补货 1–19/小时;罚款 RMB 3–8;评分 $R_0=4.0$、$\alpha=20$、$\gamma=2^{-1/30}$),数据过滤规则也透明。主要成本在于长视野推理:每次 365 天运行需要数千次模型调用,48 次运行对前沿模型(GPT-5.6 Sol、Claude Opus 4.8 等)的 API 费用不菲,且需要上下文压缩(ReAct 在 16 万 token 时截断到 3 万、提示先做摘要)。复现门槛中等偏高:懂 POMDP/智能体框架即可跑通,但要稳定复现具体数值(尤其变异系数高的 Qwen3.7-Max)需要多次取均值,建议至少重复 3 次并报告方差。