← 返回 2026-07-31

面向 LLM 智能体的文件系统记忆:组织、演化与可持续性 Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability

Sizhe Zhou, Sheldon Yu, Hui Wei, Junda Wu, Siru Ouyang, Yizhu Jiao, Shijia Pan, Julian McAuley, Yu Zhang, Tong Yu, Jiawei Han 📅 2026-07-29 👍 12 2026-08-05 19:06
LLM智能体记忆 实证研究 工具组合 技能学习 文件系统记忆 记忆可持续性 长程对话

系统刻画智能体文件系统记忆的组织价值、成本与可持续性

前置知识

LLM 智能体记忆 (Agent Memory)

指 LLM 智能体跨越单次上下文窗口之外保存的持久化信息。本文采用经典的包含式定义,同时涵盖声明式记忆(事实、事件、偏好、规则)与程序性记忆(从经验中蒸馏出的可复用技能),并用同一个存储同时服务两者。当对话或任务轨迹不断累积、产生重复、矛盾与过时事实时,记忆必须被'演化'——更新、调和、重组——才能保持可搜索与可信。

理解本文必须先明白:作者研究的不是某种新记忆表示,而是业界部署默认形态(markdown 文件目录树)本身的组织、演化与健康问题。

检索增强生成 (RAG) 与 BM25

RAG 把外部文档切块、建索引,按查询检索相关片段后送入 LLM 生成答案。BM25 是一种基于词频的经典关键词排序算法,本文的 Chunk retrieval 基线(每查返回 top-3 块全文)和 Center+BM25 工具变体都用它。理解'检索成本'与'检索质量'的区分是读懂本文成本分析的关键。

Chunk retrieval 是本文的对照基线,BM25 既是基线检索器也是工具组合实验轴,理解它才能看懂'组织换检索经济'这一核心结论。

工具组合 (Tool Harness)

智能体不直接操作存储,所有访问都通过一组有限工具(如 view/create/str_replace/grep 等文件操作,或 bash shell)。不同工具组合在粒度与能力上不同:沙箱 shell、对照业界记忆工具的六操作函数集、带排序关键词检索的增强变体。本文把工具组合提升为一等实验轴,证明仅换工具集就能像换模型一样重塑存储形态。

RQ5 把'工具组合不是中性包装而是组织旋钮'作为核心发现,看不懂工具组合就无法理解同一存储在不同工具下为何会长成截然不同的树。

长对话基准 (LoCoMo / PersonaMem / REALTALK)

LoCoMo 提供多会话长对话及四类问题(多跳、时序、开放域、单跳);PersonaMem 在 persona 丰富的流上设 32k 与 128k 词元两档多选题检查点,按精确匹配评分;REALTALK 贡献 21 天真实人类间消息,检验结论能否在自然对话中存活。三者共同构成本文对话设定的评估底座。

本文所有质量结论都建立在这三个基准的特定规模上(32-158 题),理解其覆盖范围才能正确判断结论的可推广性与局限。

ALFWorld 具身任务与技能

ALFWorld 是 140 个文本化家庭任务(跨放置/双物/查看/清洁/加热/制冷六个目标族)。本文用它做程序性记忆(技能)设定:按无泄漏协议顺序执行,每个任务只从先前任务构建的存储中检索技能。执行智能体固定(gpt-4.1 或 gpt-4.1-mini),由环境本身报告成败。

技能设定是本文回答'组织价值取决于消费者'与'能力阈值'两大结论的关键场景,与对话设定互为镜像。

分类法契约与树形指标 (Taxonomy Contract & B1-B4)

作者把'良好组织的存储'形式化为五条原则 P1-P5:兄弟可仅凭标签区分、兄弟相关、父子覆盖、树距镜像相关度、结构服务搜索。并用 B1(兄弟标签可区分度)、B2(兄弟内容凝聚度)、B3(范围泄漏比例)、B4(树距与内容距离的 Spearman 相关)等指标量化。文件夹名+文件名+文件内标题共同构成单一分类法树。

这是本文量化'组织质量'的核心工具,可持续性章节关于'分类法依从侵蚀'的结论完全依赖 B 指标,读懂它们才能评判该结论的可靠度。

研究动机

部署中的 LLM 智能体(如 Anthropic memory tool、Claude Code 的 CLAUDE.md/memory 文件夹、OpenAI Codex 的 AGENTS.md)越来越把长期记忆存成文件系统——一个由 markdown 文件构成的目录树,智能体通过通用文件工具自己读、写、重组。然而学术界对此媒介研究甚少:先前工作大多设计专门记忆表示(MemGPT 的 OS 式分页上下文、Mem0 的事实存储、Zep 的时序知识图谱、A-MEM 的自链接笔记网络、SeCom 的话语单元存储、Rezazadeh 等的嵌入组织树)并研究其上的检索,把'文件系统默认'的两个工作假设悬置未测:其一,随记忆累积、冲突、过时,智能体能否把不断增长的存储保持井然有序?其二,这种有序是否值得付出成本?做错代价高昂——Zhang et al. 2026 证实持续用 LLM 重写记忆库可能让它退化到无记忆基线之下。现有机制无法弥合该缺口:学术记忆操作(Mem0 的 add/update/delete)按条目作用,从不作用于存储形态;工业界的'梦境'整合(OpenAI dreaming、Anthropic Dreams)在智能体之外后台运行,恰恰是因为工作智能体自己的写入'局部而增量'、存储在两次重建之间退化。外部清理只治标,'智能体自身能否维持增长存储的有序、有序是否回本'仍是假设而非被测量的结论。

本文的目标是本文目标是首次系统探索面向 LLM 智能体的文件系统记忆,把'文件系统默认'从一个未经检验的假设变成可设计的记忆设计空间。具体目标包括四点:其一,把部署实践抽象为围绕单一存储的三角色最小契约——管理智能体整合并维护存储、搜索智能体带引用地回答查询、技能设定中固定执行智能体的任务尝试既提供经验片段又消费检索到的技能;其二,在对话记忆与程序性记忆(技能)两个设定下用同一存储类与契约统一声明式记忆与技能,证明二者只是携带不同内容的同一种文件系统记忆;其三,沿四个轴系统变化并测量:存储构建方式(智能体自组织、逐字转储、分块检索等六种变体)、流规模、工具组合(沙箱 shell / 六操作函数集 / 带排序检索的增强变体)、管理与搜索模型强度(gpt-5.4-nano/mini/5.4 三档阶梯);其四,同时追踪答案质量、构建与搜索成本(轮次、词元、读取内容)以及随记忆增长的存储健康度(早期记忆能否在后续演化中存活、更新是否落地正确、分类法依从是否侵蚀),输出完整的增长曲线而非终点快照,从而把每个研究问题在两个设定中同时回答。

与已有工作不同的是,本文的独特切入角度是把'记忆形态本身'而非'检索方法'作为研究对象。先前文件系统记忆工作(如 A-Mem)研究'如何在文件上检索',但记忆形态如何被构建、塑造、保持健康几乎没有系统研究。关键差异在于四点:第一,同时研究'写得好'与'读得好'两种能力,用三角色解耦——部署中一个模型可同时扮演三角色,但契约最小化使能力可单独研究;第二,把声明式记忆与技能统一在同一个存储类与同一组契约下,是首个证明二者'只是携带不同内容的同一种文件系统记忆'的工作;第三,引入'可持续性协议'——按任务或块快照存储轨迹(560 个状态零失配),追踪存储健康、成本、质量随记忆增长的变化,而非只看终点答案质量,这是先前文件系统记忆工作从未做的纵向测量;第四,把工具组合提升为一等实验轴,发现仅替换工具集就能像换模型一样重塑存储形态,从而把'组织'从被动观察对象变成可控的设计旋钮。

核心方法

直觉上,作者把'部署中的文件系统记忆'简化为三个角色围绕一个共享存储:执行智能体做活并产生经验片段(对话切片或任务轨迹);管理智能体把每个片段整合进记忆文件系统并保持其有序;搜索智能体在需要回忆时遍历存储、返回带引用的答案或检索到的技能。技术路线如下:先定义一个文件存储类——每个文件是 markdown 三元组 $f = (p_f, d_f, c_f)$(路径、一行描述、正文),文件夹是路径前缀、自身无内容,文件夹名+文件名+文件内标题共同构成单一分类法树,导航自顶向下,名称与一行描述是唯一路标。管理智能体按方程 $M_t = m_{H,\pi}(\iota, x_t, M_{t-1}),\ M_0 = \emptyset$ 把流 $x_1,\ldots,x_T$ 诱导出存储轨迹 $M_1,\ldots,M_T$;搜索智能体按 $(a, \Gamma) = s_{H_r,\pi'}(\iota, q, M)$ 返回带引用集 $\Gamma$(文件路径、可选节/行)的答案 $a$。两个设定共用同一存储类与契约,只是'片段'(对话切片 vs 渲染轨迹)与'查询'(问题 vs 任务)的语义不同,因此一个系统同时服务声明式与程序性记忆。

核心创新点在于把'记忆形态'从检索方法的附属变量提升为系统化、可控的研究对象,并通过一组最小化且对部署友好的契约把整个设计空间参数化。与已有方法的本质区别体现在四方面:其一,不设计专门记忆表示,而是把部署默认(markdown 目录树 + 通用文件工具)当作研究主体本身;其二,用'分类法契约'五原则 P1-P5(兄弟可仅凭标签区分、兄弟相关、父子覆盖、树距镜像相关度、结构服务搜索)给出'良好组织'的、与部署提示词一致的可操作定义,并用 B1-B4 等树形指标(如 B4 为树距 $d_T(u,u')$ 与内容距离 $1-\cos(v_u,v_{u'})$ 的 Spearman 相关)量化;其三,把'存储健康随时间演化'作为一等指标——早期记忆是否存活、更新是否落地、分类法依从是否侵蚀,而先前工作只看终点答案质量;其四,把工具组合(Center / Center+BM25 / Shell)作为可控旋钮,证明仅换工具就能像换模型一样直接重塑存储(对话中 Shell 把内容分片成 147 个小文件,技能中 Shell 反而聚合成 36 个文件)。这套参数化使'组织何时重要'从一个含糊直觉变成可被五个研究问题逐一回答的实证问题。

方法步骤详情

方法步骤完整描述如下。第一步(形式化,第 2 节):定义文件存储 $M$、工具组合 $H$(沙箱 shell、对照业界记忆工具的六操作函数集 view/create/str_replace/insert/delete/rename、及检索增强变体)、三个智能体角色及其组合方式;管理智能体授权整合与维护(可创建、重写、合并、拆分、移动、删除任何内容),组织是其职责而非副作用。第二步(两个实例化,第 2.3 节):对话记忆把流设为多会话对话切片,每轮带内联源定位符,评估在终态或检查点提问并按金标评分;程序性记忆/技能按方程 $\Gamma_i = s(\iota_r,\tau_i,M_{i-1})$、$(\xi_i,z_i)=e(\tau_i,\Gamma_i)$、$M_i=m(\iota_c,\text{render}(\xi_i),M_{i-1})$ 无泄漏地顺序执行 140 个 ALFWorld 任务。第三步(实验轴,第 2.4 节):固定管理与搜索为研究对象、执行智能体固定,沿四轴变化——构建方式(Closed-book / Chunk retrieval / Verbatim dump / Foldered sessions / Reorg preserve 与 condense / Agent-curated store 共六种)、流规模、工具组合、模型强度。第四步(测量,第 3 节):用单一冻结判官(gpt-5.4-mini 低推理、温度 0)评分,统计每查/每块/每任务的词元、轮次、工具调用,并按任务快照存储轨迹。第五步(分析):用符号检验比较成对差异,并用完美缓存下界/无缓存上界(方程 $\text{perfect}=p_R+o_R$、$\text{no-cache}=\sum_r p_r+\sum_r o_r$)剥离定价,输出与提供商无关的内在计算量度,最终把五个研究问题的结论在两个设定中同时给出。

技术新颖性

技术新颖性体现在五点。其一,首次把文件系统记忆作为系统研究对象:此前工作(MemGPT、Mem0、Zep、A-MEM、SeCom、Rezazadeh 等)都预设某种记忆表示并研究其上的检索,从未把'部署默认形态'本身作为被系统变化的轴。其二,三角色最小契约 + 五原则分类法,使'组织质量'首次有了与部署提示词一致的、可量化的形式定义——B1 兄弟标签可区分度、B2 兄弟内容凝聚度(同父内容对余弦均值除以随机跨父对均值)、B3 范围泄漏($\max_{g\neq g(u)}\cos(v_u,\mu_g) > \cos(v_u,\mu_{g(u)})$ 的单元比例)、B4 树距-内容距离 Spearman 相关。其三,'可持续性协议'——按任务快照存储(560 状态零失配),追踪早期记忆命运、创建 vs 编辑比例、分类法依从随链长侵蚀,这是先前文件系统记忆工作从未做的纵向测量。其四,把工具组合证明为'控制存储组织的旋钮'而非中性包装,揭示 Shell 在对话中分片、在技能中聚合,方向与回报都由设定决定。其五,用 perfect-cache 下界与 no-cache 上界剥离定价(效率份额 $\text{Eff}=(\text{no-cache}-\text{measured})/(\text{no-cache}-\text{perfect})$),给出与提供商无关的内在计算量度,避免用原始 prompt 词元和跨变体比较的常见谬误。

Overview of filesystem-based agent memory.
Figure 1: Overview of filesystem-based agent memory.
Two files of one memory filesystem.
Figure 2: Two files of one memory filesystem.

实验结果

五个研究问题逐一回答。RQ1(组织):管理智能体都长出按主题的树,但形态是'模型的签名'而非'规模的响应'——同一 mini 在 PersonaMem 从 32k(3 文件夹 12 文件)到 128k(1 文件夹 2 文件),层级从文件夹/文件迁入文件内标题(sections 53→210),存储随规模'聚合'而非'分片';仅换管理模型,同一 128k 会话在 nano 下是 122 文件、mini 下是 2 文件、gpt-5.4 下是 105 文件,相差一个数量级。最清晰的退化行为是重组时静默压缩细节(REALTALK 正确率在压缩版从 77.6% 跌到 41.2%,几乎腰斩),加一条'保留每条事实'规则才止住。RQ2(形态价值):没有任何形态在各基准都赢正确率,最便宜的结构化存储 Foldered sessions 在 LoCoMo/REALTALK/128k 领先或并列(86.1/77.6/76.2%);Agent-curated 在 PersonaMem 32k 上竟以 37.5% 垫底(逐字转储 78.1%),其失败是'表示层'而非覆盖或可靠性;组织唯一无条件的回报是检索成本——在最大的 PersonaMem 上把每查价格从 4.0 美分砍到 1.4 美分(几乎减半);技能设定里胜负随执行智能体翻转——强执行智能体(gpt-4.1)下 Episode log 87.1% 领先,弱执行智能体(gpt-4.1-mini)下 GS 反超 10 个点(76.4 vs 66.4%,p≈0.02)。RQ3(骨干能力):对话设定中管理智能体强度只买'组织风格'不买'答案质量'(三档模型正确率 73.8/66.7/71.4%,非单调的七点带),而搜索智能体强度单调直接换分(62→71→79%);技能设定中能力像阈值——越过后存储内容比执行模型更重要,gpt-5.4 管理智能体在 mini 执行器上的链(89.3%)超过所有 gpt-4.1 执行器单元(含 Episode log 88.6%)。RQ4(可持续):存储越增长越有用(mini Episode log 从前 35 任务 51.4% 升到后 35 任务 91.4%),早期记忆在强管理下存活(删除与重写是细薄片),但分类法依从在除最强管理外所有存储都侵蚀;curation 每集保持 6-12 轮、永不摊销;Episode log 的'全量服务'检索成本随存储线性增长(链尾 $7.88 vs GS 的 $2.97 每 140 任务)。RQ5(工具组合):加工具改行为不改结果(Center+BM25 与 Center 统计打平 p≈0.85),换工具集重塑存储——对话中 Shell 分片(147 文件)打平质量,技能中 Shell 聚合(36 文件)并以 82.9% 取胜(净 +11 任务,p≈0.04)。

Main comparison of memory variants: answer quality per benchmark.
Table 1: Main comparison of memory variants: answer quality per benchmark.
Search cost and effort per query, by token category.
Table 2: Search cost and effort per query, by token category.
Build cost and effort per conversation, by token category, with store profile.
Table 3: Build cost and effort per conversation, by token category, with store profile.
Hierarchy shape panel over the stores of record.
Table 4: Hierarchy shape panel over the stores of record.
Skill setting, three-chain protocol: task success and deployment cost.
Table 5: Skill setting, three-chain protocol: task success and deployment cost.
The search agent grid: three search agent backbones read the same three fixed stores.
Table 7: The search agent grid: three search agent backbones read the same three fixed stores.
Skill setting, full-chain protocol.
Table 8: Skill setting, full-chain protocol.
Where the hierarchy lives, in the stores themselves.
Figure 3: Where the hierarchy lives, in the stores themselves.
Store size along the full chain (files).
Figure 4: Store size along the full chain (files).
Conversational build curves from the per-chunk trajectories of the builds of record.
Figure 5: Conversational build curves from the per-chunk trajectories of the builds of record.
Memory's edge as the store grows.
Figure 6: Memory's edge as the store grows.
Retrieval cost per task along the full chain.
Figure 7: Retrieval cost per task along the full chain.
Store lifecycle at the path level, from the per-task snapshots.
Figure 8: Store lifecycle at the path level, from the per-task snapshots.
查看结构化数据
任务指标本文基线提升
LoCoMo 长对话问答(158 题) 答案正确率(判官评分 %) Foldered sessions / Agent-curated store 并列 86.1% Closed-book 18.4% +67.7 个百分点;任何存储均显著超越无记忆基线
PersonaMem 128k 多选题(42 题) 精确匹配正确率 % Foldered sessions 76.2% Closed-book 47.6% +28.6 个百分点;组织把大材料检索成本从 3.9 美分砍到 1.6 美分
ALFWorld 140 任务(gpt-4.1-mini 执行智能体) 任务成功率 % Curated skills+mem (GS) 76.4% No store 52.9% +23.5 个百分点;弱执行智能体下蒸馏指导最有效
ALFWorld 检索成本(gpt-4.1-mini 执行智能体) 每任务部署成本(美分) Curated skills+mem (GS) 4.3 美分(每解任务 5.7 美分) No store 3.2 美分(每解任务 6.1 美分) 按'每解任务'计 GS 比无记忆还便宜 0.4 美分,记忆在部署上回本
技能设定模型强度(gpt-4.1-mini 执行智能体,全链) 140 任务成功率 % gpt-5.4 管理智能体构建的 GS 存储 89.3% gpt-5.4-nano 管理智能体 75.0% +14.3 个百分点(净 +18 任务,p≈0.001),集中在需真迁移的 cool/heat 族

局限与改进

作者承认的局限有六点。其一,基准规模小且列间问题数仅 32-158,重判一个固定单元会移动约 2 题(±1.3 点),小列上几个点的差距是'暗示'而非'定论',作者反复强调应谨慎解读。其二,质量基准'对形态基本盲目'——LoCoMo 三种工具集正确率 86.1-86.7% 几乎并列,无法区分组织优劣,意味着'组织何时重要'在该尺度上无解。其三,视野仅限'一次对话长度'(最长 128k 词元 / 140 任务),尚未触及数月级的真正长程累积,作者明确把这列为'下一个该被这套增长设计去探测的视野'。其四,每个存储是单次构建抽样,推理模型构建存在真实运行间形态方差(同一配置仅修正一处工具描述就从 2 文件变 29 文件),故单次存储形态被当作'特征行为'而非'固定常数'。其五,PersonaMem 32k 上 Agent-curated 异常失败(37.5%)只完成了构建侧假设检验(升 gpt-5.4 管理后固定搜索智能体从 12/32 恢复到 18/32,单侧 p=0.073),搜索侧检验尚未完成,且 56.3% 仍远低于逐字转储 78.1%,剩余缺口归属未定。其六,一个 instruction-corrected 的 Curated skills+mem 变体已构建验证但'刻意未运行',是否改变该条件地位是已知开放局限。我自己的观察:B4(树距镜像相关度)作为组织质量指标会随粒度虚高(作者已诚实声明),且 B3 只抓内容层错位不抓标签层错嵌,分类法依从'侵蚀'结论部分依赖尚不完善的指标;判官为单一模型单提示,未做多判官一致性或人评校准;模型栈用的是 gpt-5.4 系列,外部难以复现其确切行为,可能影响数值层面的可重复性。

独立分析的弱点

独立分析的弱点与改进方向分六点。第一,形态-质量脱钩可能只在更大尺度才显现:本文证据(86.1 vs 86.7)只覆盖单次对话长度,应把 PersonaMem 128k 推到数倍规模、跨会话跨用户累积,或引入需要跨片段推理的多跳/时序任务作为'形态敏感探针',去检验组织对正确率的回报是否在更长视野中浮现。第二,分类法契约的量化指标 B1-B4 尚不完备:B4 随粒度虚高、缺父子标签一致性检查,可补充标签层嵌套合理性度量,并用基于检索轨迹的'结构服务搜索'功能度量(作者已部分用检索努力替代静态公式)来校准侵蚀结论。第三,单判官单提示打分可能掩盖质量差异,建议引入多判官集成或人评子集校准,并报告跨判官一致性,否则几个点的差距难以令人信服。第四,强管理智能体只在一个 128k 会话上验证'风格换不来质量',应扩展到更多会话与对话类型,分离'会话特异性'与'普遍规律'。第五,工具组合作为'旋钮'的机制研究不足——Shell 为何在对话分片、在技能聚合尚是经验观察,可设计消融分离'工具表达力''操作粒度''反馈格式'三个子因素,回答机制而非仅描述现象。第六,未触及跨用户的隐私、一致性、并发写入等部署现实问题:文件系统记忆在生产中会面对多用户共享与冲突,这是后续工程化的重要缺口,建议引入多写入者场景研究锁定/版本/合并语义。每个弱点的改进方向都是把'模糊观察'升级为'可控实验'。

未来方向

作者明确提出的未来工作有三条主线:其一,检验基准'对形态盲目'是否在长于一次对话的视野中存活——即设计跨越多次会话、跨用户、跨数月的长程累积实验,看组织的回报是否在该尺度上才浮现;其二,探索能否在'组织确实划算处'主动诱导有用层级,而非盲目期待智能体自我组织——把工具组合等旋钮用于诱导目标结构而非仅观察自然结果;其三,研究当记忆真正增长(数月级)时存储健康如何演化,特别是分类法依从侵蚀是否会最终破坏可用性。基于本文成果可进一步延伸的方向有四:把工具组合作为'反向设计'输入——给定期望存储形态,自动搜索能诱导它的工具组合;把 B1-B4 树形指标做成构建时在线反馈,给管理智能体实时'组织体检'并触发自我修正;把'模型签名'现象发展为'存储指纹'——用存储形态反推或验证构建所用模型;把搜索智能体与存储形态的'共适应'机制(如 BM25 在多文件中被频繁调用、在单大文件中被绕过)形式化为自适应检索策略,使检索方法随存储形态自动调整。整体上,本文最大的研究遗产是把文件系统记忆变成了'有设计空间'的对象,未来工作应继续填实这个空间而非再加一种新表示。

复现评估

复现评估分四方面。开源情况:论文未明示提供代码或数据仓库链接,但附录逐字给出了所有管理/搜索/重组/判官/技能提示词(Prompt 1-14,与运行时字节一致,仅剥离推理模型不需要的 think-tag 段)、所有工具的完整 JSON schema 与'按发送原样'描述(Table 12)、流分块规则(每块≤8 轮、3000 字符上限)、配置(Table 11:seed=42、搜索并发 8、检索 top-3、输出上限 8192/32768/100000、96k 触发上下文压缩为摘要+最近 3 轮)、成本核算三档公式(方程 4 的 perfect/measured/no-cache 与效率份额)以及基线筛选目录(如 LoCoMo 4 条缺陷金标、各基准 sample id)。数据全部来自公开基准(LoCoMo conv-50、PersonaMem 指定 sample id 如 pm 128k 18 43642c89 e784、REALTALK Chat 10、ALFWorld valid seen pool),获取无障碍。算力需求可观:构建 Agent-curated PersonaMem 128k 花费约 $13.44、约 1986 次工具调用;技能全链 GS mini 单元约 $17.5;完整复现主表需数十次此类构建加上数千次判官评分,估算数百至上千美元。复现难度中等偏高:提示词与工具已公开可复用,主要障碍是访问 gpt-5.4 系列模型(论文未说明获取途径,且为虚构未来模型)与重现 provider 缓存行为;鉴于推理模型存在真实运行间形态方差(同配置 2→29 文件),精确数值复现预期有偏差,但核心定性结论(组织换检索经济、形态买不来对话答案质量、工具集重塑存储、弱执行智能体下蒸馏指导反超)应稳健可复现。