← 返回 2026-08-11

智能体记忆蒸馏:以分层教师记忆赋能小型 LLM 智能体 Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory

Taeil Kim, Kangsan Kim, Sung Ju Hwang 📅 2026-08-07 👍 49 2026-08-16 18:30
免训练迁移 分层记忆 小语言模型 工具调用 智能体记忆 知识蒸馏

把大教师智能体的成功经验分层蒸馏为工作流/子任务/函数三级记忆,免训练注入 4B-8B 小智能体

前置知识

LLM 智能体记忆(Agent Memory)

指智能体把过往交互轨迹沉淀为可复用知识的机制。典型做法是任务结束后由 LLM 对轨迹做语言化总结(如 Reflexion 的自我反思、ExpeL 的跨任务经验),存入记忆库;新任务到来时按相似度检索相关条目注入上下文,让智能体重用成功模式、避免重复失败。

AMD 的出发点就是记忆系统,本文全部贡献(三类记忆的生成、组织与注入方式)都建立在"记忆如何产生、如何结构化、如何检索"这套框架之上,不熟悉记忆机制就无法理解各设计的动机。

知识蒸馏与能力鸿沟(Capability Gap)

经典知识蒸馏用大模型(教师)的软标签或行为监督小模型(学生)训练。研究表明当师生能力差距过大时,学生难以模仿教师输出,蒸馏效果反而下降(Mirzadeh 等人据此提出 teacher assistant 蒸馏)。本文把这一概念迁移到记忆层面:教师记忆写得再好,学生读不懂、用不上也是无效迁移。

"朴素教师记忆迁移增益有限"是本文的核心实证发现(Figure 1B),理解能力鸿沟才能理解为什么必须把教师知识拆解成分层、小模型可消化的形态。

工具调用基准(Tool-use Benchmarks)

评测智能体调用外部 API 完成任务能力的标准化环境。AppWorld 提供模拟的日常应用套件(邮件、Venmo、Spotify 等),智能体写 Python 代码操作有状态解释器,以数据库状态单元测试判分;BFCL V3 考察结构化函数调用的每个参数是否与期望 API 状态完全一致;ToolSandbox 是有状态、多轮对话式评测,用里程碑(milestone)和雷区(minefield)打分。

论文全部实验基于这三个基准,各自的任务形态(代码块 vs JSON 调用 vs 对话)和判分方式决定了 AMD 三类记忆在不同基准上的适配难度与增益差异。

稠密向量检索(Dense Retrieval)

把文本用预训练嵌入模型编码成向量,用余弦相似度衡量语义相关性,从库中取 top-k 最相似条目。本文用 OpenAI text-embedding-3-small 编码所有记忆条目,检索时设最低相似度阈值 δ 过滤不相关条目,Workflow/Subtask 按查询向量检索,Function 记忆按函数名索引、同名多条时再用向量相似度排序。

检索质量直接决定注入内容的相关性;论文还发现检索条数 k 越多效果越差(Figure 5),这一反直觉结论的机制就要用嵌入检索的噪声特性来解释。

主动注入与被动注入(Proactive / Reactive Injection)

主动注入指任务开始前把知识一次性放进系统提示词,为执行提供事前规划;被动注入指只在工具调用报错时才把相关知识以提示块形式附加到错误信息旁,提供事后纠错。后者避免在执行顺利时膨胀上下文,只在不确切断点上供给知识。

AMD 对三类记忆采用不同注入时机(Workflow/Subtask 主动、Function 被动),这是方法设计的关键一环,消融实验和 LLaMA3.1-8B 的异常结果都与此相关。

研究动机

记忆系统已在大模型智能体上证明有效,但小模型面临双重困境。第一重是成功经验稀缺:小模型任务成功率低(例如 Qwen3-4B 在 AppWorld 上 zero-shot 仅 14.88%,Llama3.1-8B 更是只有 8.93%),靠自我积累建起的记忆库被失败轨迹主导,可用于提取成功模式的素材极少;即使叠加反思机制,成功轨迹的根本性缺失也限制了记忆利用的上限。第二重是"送上门的经验也消化不了":直接把 GPT-5-mini 这类强教师的高质量记忆注入小模型,增益却与学生自产记忆相当(Figure 1B)——教师记忆常是"先登录再播放歌单"这类高层策略,而学生可能连登录流程本身都执行不了;同时小模型的上下文学习与指令跟随能力弱(Wei et al., 2022),面对长而复杂的记忆文本理解力不足。现有记忆方法(ReasoningBank 的扁平任务级洞察、MemP 的程序化记忆、SASM 的子任务级检索)都默认同一模型自产自用、以 GPT-4/Gemini 级大模型为评测对象,从未针对跨模型迁移时的粒度与格式匹配问题做设计,导致直接套用到小模型上反而不稳定甚至倒退(ReasoningBank 把 Qwen3-4B 的 AppWorld 成绩从 14.88% 拉低到 10.71%)。

本文的目标是本文的目标是构建一个 training-free 的知识迁移框架,让 4B-8B 参数量的小型语言模型智能体在不更新任何参数的前提下,充分利用 GPT-5-mini 这类强大教师智能体的经验记忆。形式化地,即在固定学生 $\pi_S$ 的条件下寻找最优记忆库 $\mathcal{M}$,最大化期望任务成功率 $\max_{\mathcal{M}} \mathbb{E}_{s \sim S} R(\pi_S(s; \mathcal{M}))$。目标可拆解为三点:(1) 把教师的成功轨迹重构为小模型真正能理解的形态——按任务、子任务、函数三级粒度拆分,并给每级配上合适的表征(自然语言或可执行代码);(2) 设计检索与注入机制,在恰当的时机(任务开始前规划、报错时纠错)以恰当的粒度供给知识;(3) 在三个工具使用基准、四个学生模型上一致超越 zero-shot 和现有记忆基线,并逼近甚至超越教师本身的水平。

与已有工作不同的是,已有两条研究路线各管一头。记忆侧:ReasoningBank 用扁平任务级推理洞察,MemP 研究程序化记忆的分层抽象但明确面向同模型自进化,SASM 做子任务级检索对齐但只有单一记忆类型,它们都没考虑跨模型迁移;蒸馏侧:SAD、Agent Distillation、SCoRe 把教师行为蒸进学生参数,需要昂贵的训练流程,AgentDistill 虽免训练但只是让学生复用教师生成的 MCP 工具盒而非直接利用其记忆。师生能力鸿沟在传统知识蒸馏中早有认知(teacher assistant 蒸馏、spherical KD),但此前没有人把它当作记忆迁移的核心约束来系统处理。AMD 的独特切入正在于此:它是第一个系统研究"教师→学生记忆蒸馏"的工作,把模糊的"能力鸿沟"具体化为三个可操作的设计维度——知识粒度(任务/子任务/函数三级)、表征形式(自然语言 vs 代码)、注入时机(主动 vs 被动),并对每个维度做独立消融,用数据回答"教师知识应该以什么形态、在什么时机、以多少量喂给多大的学生"。

核心方法

先讲直觉:学生看不懂教师的高端攻略,往往不是攻略错了,而是攻略跳过了学生不会的基本功——教师写"先登录 Spotify 再播放",学生却不会登录。因此要把教师经验"降维"成三级:做什么(任务级策略)、怎么做(子任务级示范)、每个 API 具体怎么调(函数级用法),并且各级使用最适合小模型理解的载体——计划用简短自然语言,示范与调用用可执行代码。技术路线分离线与在线两阶段。离线阶段:教师 GPT-5-mini 在全部任务上执行,收集成功轨迹子集 $D_T^+ \subseteq D_T$,由教师 LLM 从中抽取三类记忆——工作流记忆 $\mathcal{M}^{wf}$(任务完成策略洞察)、子任务记忆 $\mathcal{M}^{st}$(子任务级带观测的执行示例)、函数记忆 $\mathcal{M}^{fn}$(按函数名索引的 API 调用范例),构成 $\mathcal{M} = \mathcal{M}^{wf} \cup \mathcal{M}^{st} \cup \mathcal{M}^{fn}$。在线阶段:学生接到任务后先做主动注入——以任务指令为查询检索 top-1 工作流洞察,同时把任务分解为至多六个子任务标签、各自检索 top-1 子任务示范并跨子任务去重,一并拼入系统提示词;随后进入执行循环,一旦工具调用报错就按失败函数名查函数记忆,把教师的成功用例以提示块附在错误信息后做被动纠错。全程不触碰模型参数,任何能被 prompt 的黑盒小模型都能直接受益。

核心创新是"分层记忆蒸馏":不把教师记忆当作单一扁平文本整体搬运,而是按任务、子任务、函数三个粒度重构,并让每种粒度采用与学生理解力对齐的表征和注入时机。与 ReasoningBank 式扁平记忆的本质区别在于知识的功能分工:工作流洞察回答"为什么这么做"(涉及哪些 app、前置条件、决策规则、验证线索、常见失败模式),子任务示范回答"具体怎么做"(带真实观测的可执行代码段),函数记忆回答"这个 API 长什么样、参数怎么传"(函数名 + 教师用例 + 可选 schema),三者分别修补不同层的失败模式——Figure 6 的级联案例展示了一个 Venmo 任务必须依次依靠三类记忆才能走完:WF 修正月份过滤、ST 解除日期解析死循环、FN 修复响应字典键解析。另一个关键洞察是"表征-粒度对齐":消融显示任务级规划用自然语言最好(49.40% vs 代码 44.05%),而子任务级和函数级用代码最好(49.40% vs 纯文本 23.21%),说明小模型读得懂简短的散文计划,但落实动作时需要无歧义、可直接照抄的代码范本——这正是能力鸿沟在表征层面的具体表现。

方法步骤详情

完整流程六步。第一步,教师轨迹收集:教师在任务集 $S$ 上逐任务执行(每任务上限 40 步),留下成功轨迹集合 $D_T^+$(AppWorld 上 GPT-5-mini 成功率 50%,168 个测试任务对应充足的成功样本供抽取)。第二步,生成工作流记忆:教师 LLM 对每条成功轨迹写一段 120 词以内的策略洞察,必须以 app.function_name 形式点名关键 API(如 venmo.login、supervisor.show_account_passwords),涵盖前置条件、决策规则、验证线索与失败模式,并把所有具体值(用户 ID、凭证、文件路径)替换为 、、 等类型化占位符以保证可复用性;得到条目 $m^{wf}_i = (q_i, ins_i)$(查询 + 洞察),用 text-embedding-3-small 编码入库。第三步,生成子任务记忆:教师 LLM 把轨迹切分为语义连贯的段(建议不超过六段,可辅以 API 调用边界等规则提示),每段记录标签 $\ell_{i,k}$(≤5 词动词短语,如 "authenticate to Venmo")、一句描述 $d_{i,k}$ 和带返回观测的执行示例 $e_{i,k}$,即 $m^{st}_{i,k} = (\ell_{i,k}, d_{i,k}, e_{i,k})$。第四步,生成函数记忆:从成功轨迹抽取每次函数调用,按函数名 $f_{i,j}$ 索引,存教师用例 $E_{i,j}$(含调用上下文与返回观测),文档丰富的基准(AppWorld)额外附加参数与响应 schema,得 $m^{fn}_{i,j} = (f_{i,j}, E_{i,j}, doc(f_{i,j}))$。第五步,主动注入:任务开始时以指令为查询检索 top-1 工作流条目;学生分解器 $\pi_S^{decomp}$ 把任务拆成至多六个子任务标签,每个标签独立检索 top-1 子任务段并按标签跨子任务去重,两类内容一起写入系统提示词。第六步,被动注入与执行循环:每步工具调用返回错误时,从错误信息提取失败函数名,在 $\mathcal{M}^{fn}$ 中按名查找(同名多条时用当前任务指令与各记录推理文本的余弦相似度排序),top-1 以提示块附加到错误信息后;循环至任务完成或达到 40 步上限。所有检索设最低相似度阈值 $\delta$,主实验统一 $k=1$,学生用 vLLM 部署、Qwen3 关闭 thinking 模式以保证公平。

技术新颖性

技术新颖性有五点。其一,问题设定新:这是首个系统化的教师→学生记忆蒸馏研究,明确把师生能力鸿沟当作一等约束,此前所有记忆方法(ReasoningBank、MemP、SASM)均假设同模型自产自用。其二,免训练:与 SAD、Agent Distillation、SCoRe 等需要梯度更新的蒸馏路线相比,AMD 只操作上下文,即插即用于任何黑盒小模型,部署成本几乎为零。其三,分层设计有消融支撑而非先验假设:Subtask 记忆贡献最大增量(Qwen3-4B 在 AppWorld 上 WF 单独 22.02% → WF+ST 47.02%,跳升 25 个百分点),三类记忆缺一不可。其四,表征与注入的双通道设计并均有对照实验:规划用散文、执行用代码(Table 4),规划事前给、纠错事后给(Figure 2、Algorithm 1),每个设计选择都拿出了数据。其五,负结果同样有信息量:朴素迁移无效(Figure 1B)、学生自产记忆接近 zero-shot(Table 2 的 Student Memory 行仅 16.07%)、检索条目越多越糟(Figure 5 中 Subtask 记忆 k=1→5 从 49.40% 跌至 33.34%),共同刻画了小模型记忆利用的能力边界,为后续工作标定了问题的真实难度。

Hierarchical Memory Generation and Injection in AMD.
Figure 2: Hierarchical Memory Generation and Injection in AMD.

实验结果

主实验(Table 1,教师 GPT-5-mini,每实验重复两次取平均):Qwen3-4B 在 AppWorld 从 zero-shot 的 14.88% 升至 49.40%(+34.52p),BFCL V3 从 15.50% 升至 38.50%(+23.00p),ToolSandbox 从 16.28% 升至 20.16%(+3.88p);Gemma4-E4B 为 24.40%→54.17%、37.25%→46.00%、18.22%→21.71%;Qwen3-8B 为 25.60%→51.79%、38.00%→45.50%、20.16%→25.58%;Llama3.1-8B 为 8.93%→27.38%、9.00%→14.50%、5.43%→6.20%。四个学生平均增益 27.2/11.2/3.4 个百分点。对比基线:ReasoningBank、MemP、SASM 在教师记忆下表现不稳,ReasoningBank 甚至把 Qwen3-4B 的 AppWorld 从 14.88% 拉低到 10.71%,印证扁平记忆对小学生是噪声。超越教师:AppWorld 上 Gemma4-E4B(54.17%)和 Qwen3-8B(51.79%)双双超过教师 GPT-5-mini 的 50.00%;平均精度上 Gemma4(40.63%)与 Qwen3-8B(40.96%)也超过教师的 38.39%,说明 AMD 蒸馏的是可迁移的决策模式而非轨迹模仿。交互效率(Figure 3):Qwen3-4B 在 AppWorld 上 zero-shot 平均 23.8 步 vs 教师 10.1 步,AMD 压到 14.9 步,Gemma4-E4B 降到 7.2 步;BFCL 上本就步数接近,AMD 保持不变。消融(Table 2):WF 单独有效(Qwen3-4B AppWorld 22.02%),加 ST 跳升 25 个点到 47.02%,再加 FN 达 49.40%;Student Memory 仅 16.07%,证明教师轨迹质量是关键。教师效应(Table 3):强学生 Qwen3-8B 上教师准确率排序即蒸馏效果排序(GPT-5.5 91.08%→学生 58.93%,DeepSeek V4 Pro 81.55%→57.14%,GPT-5-mini 50.00%→51.79%,Qwen3-32B 34.42%→39.29%);但弱学生 Qwen3-4B 上顺序打破,GPT-5-mini(49.40%)反超 GPT-5.5(47.02%),兼容性开始起作用。学生规模(Figure 4):Qwen3 家族 1.7B/4B/8B/14B 准确率为 21.43%/49.40%/51.79%/52.68%,增益在 4B 达峰 +34.52p。检索数(Figure 5):k=1 已最优,Subtask 记忆 k=1→5 从 49.40% 单调跌至 33.34%。表征(Table 4):WF 用文本 49.40% vs 代码 44.05%;ST 用代码 49.40% vs 纯文本 23.21%;FN 用代码 49.40% vs 文本 47.62%;三者全换文本暴跌至 26.19%。鲁棒性:7:3 跨划分与自排除检索两种协议下 WF+ST+FN 在 AppWorld 仍达 41.07% 与 46.43%(Table 6),排除"背题"解释;五次重复实验标准差均小于 1 个百分点(Table 5,AMD AppWorld 49.60±0.91)。

Main results across three benchmarks. Δ shows absolute accuracy gains of AMD over zero-shot.
Table 1: Main results across three benchmarks. Δ shows absolute accuracy gains of AMD over zero-shot.
Ablation study across models and benchmarks. WF, ST, and FN denote workflow, subtask, and function memory.
Table 2: Ablation study across models and benchmarks. WF, ST, and FN denote workflow, subtask, and function memory.
Effect of teacher agents on AppWorld. GPT-5-mini shows the strongest transfer effectiveness for Qwen3-4B student.
Table 3: Effect of teacher agents on AppWorld. GPT-5-mini shows the strongest transfer effectiveness for Qwen3-4B student.
Effect of memory representation on AppWorld. Our design choice achieves the best accuracy.
Table 4: Effect of memory representation on AppWorld. Our design choice achieves the best accuracy.
Mean ± standard deviation of success rate (%) across five runs for each benchmark with Qwen3-4B as the student model.
Table 5: Mean ± standard deviation of success rate (%) across five runs for each benchmark with Qwen3-4B as the student model.
Success rates under the two disjoint-evaluation protocols with Qwen3-4B as the student model.
Table 6: Success rates under the two disjoint-evaluation protocols with Qwen3-4B as the student model.
Interaction steps on two benchmarks. AMD brings the student's turn count closer to the teacher's, particularly where the zero-shot gap is large.
Figure 3: Interaction steps on two benchmarks. AMD brings the student's turn count closer to the teacher's, particularly where the zero-shot gap is large.
Effect of student model size on AMD performance. Accuracy increases with model size, while accuracy gain peaks at 4B.
Figure 4: Effect of student model size on AMD performance. Accuracy increases with model size, while accuracy gain peaks at 4B.
Effect of retrieval count k on AMD performance. Accuracy at k=1 is near-optimal for all memory types, and increasing k generally degrades performance.
Figure 5: Effect of retrieval count k on AMD performance. Accuracy at k=1 is near-optimal for all memory types, and increasing k generally degrades performance.
Cascading Effect of Each Memory Type
Figure 6: Cascading Effect of Each Memory Type
Case Study for Workflow Memory
Figure 7: Case Study for Workflow Memory
Case Study for Subtask Memory
Figure 8: Case Study for Subtask Memory
Case Study for Function Memory
Figure 9: Case Study for Function Memory
查看结构化数据
任务指标本文基线提升
AppWorld(多应用工具调用,test_normal 子集 168 任务,Qwen3-4B 学生) 任务成功率 (%) 49.40 Zero-shot 14.88;最佳记忆基线 MemP 16.67 +34.52p(对比最佳记忆基线 +32.73p);学生几乎追平教师 GPT-5-mini 的 50.00%
BFCL V3(多轮函数调用,base 子集 200 任务,Qwen3-4B 学生) 准确率 (%) 38.50 Zero-shot 15.50;最佳记忆基线 MemP 28.25;教师 36.50 +23.00p(对比最佳记忆基线 +10.25p);超过教师 2.00p
ToolSandbox(有状态对话式工具使用,base 子集 129 场景,Qwen3-4B 学生) 准确率 (%) 20.16 Zero-shot 16.28;最佳记忆基线 SASM 18.22;教师 28.68 +3.88p(对比最佳记忆基线 +1.94p);仍低于教师 8.52p,是对话式场景迁移难度的体现
AppWorld(Gemma4-E4B / Qwen3-8B 学生 vs 教师自身) 任务成功率 (%) 54.17 / 51.79 教师 GPT-5-mini 自身 50.00 学生分别超过教师 +4.17p / +1.79p,证明蒸馏到的是可泛化决策模式而非轨迹模仿

局限与改进

作者明说的三点局限:其一,只在文本类工具使用基准上验证(Python API 或结构化函数调用),多模态环境(需视觉观察)和开放式代码生成任务(动作空间不固定)未测试,泛化性存疑;其二,记忆在离线阶段从固定的教师轨迹集构建后即冻结,推理时无法吸收学生自身的成败经验,也无法适应教师示范与学生实际任务之间的分布漂移;其三,方法依赖教师轨迹的质量与适配度,Table 3 显示更强的教师不一定带来更大的学生增益,如何自适应地选择教师仍是开放问题。我补充四点观察:第一,附录的子任务分解 prompt 针对 AppWorld 硬编码了"第一个子任务必须是从 Supervisor 取密码并登录",等于注入了人工先验知识,跨基准可移植性和公平性都值得追问;第二,跨划分协议下增益明显缩水(AppWorld 自排除检索 46.43% → 跨划分 41.07%),说明记忆效用仍部分依赖任务分布重叠,对真正陌生的任务族泛化有限;第三,ToolSandbox 增益仅 3.4p 且未追平教师,有状态、对话驱动、依赖世界状态演化的场景中,静态三层记忆与单次子任务分解都更难适配;第四,"k=1 最优"这一结论的另一面是方法对上下文长度与噪声高度敏感,随着学生模型上下文能力增强,最优检索配置可能改变,结论的时效性有待检验。

独立分析的弱点

弱点一:记忆静态冻结。学生测试时的成功经验全部丢弃,长期使用无法自我改进。改进方向是引入在线更新机制:让学生自己的成功轨迹(经质量过滤或与教师记忆去重后)回写记忆库,或按时间/效用衰减淘汰过时条目,形成师生混合、可进化的记忆系统。弱点二:教师-学生兼容性只能靠网格搜索式实验发现(Qwen3-4B 配 GPT-5-mini 优于配 GPT-5.5),缺少可计算的选择标准。改进方向是把兼容性形式化为可度量指标,例如用学生 zero-shot 能力画像(指令跟随长度、代码执行成功率)与记忆抽象层级、条目长度的匹配度来预测最优教师,先跑少量探针任务再定教师,避免全量试错。弱点三:子任务分解由学生单次前向生成、无验证环节,分解错误会连锁导致检索错误进而执行错误。改进方向是给分解加自检(用检索到的工作流记忆校验分解的完整性与顺序合理性)或多次采样后按一致性筛选。弱点四:基准特定工程量大——Workflow 生成、子任务切分、学生分解三套 prompt 都要按基准手调,且 AppWorld 分解 prompt 还硬编码了登录先验。改进方向是设计基准无关的统一 prompt 模板,或让教师从环境 API 文档自动归纳切分规则。弱点五:个别模型出现加函数记忆反而降分的异常(LLaMA3.1-8B 在 AppWorld 上 WF+ST 30.36% → WF+ST+FN 27.38%),说明错误恢复时的额外上下文对弱指令跟随模型是负担。改进方向是训练轻量门控网络判断是否注入,或把函数记忆压缩为单行调用签名加一句要点。

未来方向

作者提出的方向:自适应教师选择(为给定学生自动确定最合适的教师);把框架推广到多模态智能体环境与开放式代码生成任务;在线记忆适应(吸收学生测试时经验、应对分布漂移)。基于本文成果可延伸的方向:多教师集成蒸馏——从多个教师收集互补轨迹,按子任务或 API 域去重合并,甚至动态决定每个子任务查询哪个教师;课程化蒸馏——训练初期以低抽象级记忆(函数级)为主,随学生熟练度提升逐步引入高层策略,与 teacher assistant 蒸馏的思想呼应,可能进一步压低 1.7B 级学生的使用门槛;与参数高效微调结合——先用 AMD 免训练冷启动,再用学生自产的成功轨迹做 LoRA/SFT,形成"记忆预热 + 参数固化"两段式流程,验证两种迁移范式的可加性;跨域迁移规律——系统检验同一教师记忆库在任务族之间迁移的衰减曲线,与其团队此前的 Memory Transfer Learning 工作衔接;理论层面,把能力鸿沟与最优记忆粒度、表征形式的关系形式化,从学生上下文利用效率出发预测给定容量的最优层级组合,让 Table 3/Figure 4 的经验现象获得解释框架。

复现评估

复现条件总体较好。学生模型全部开源可得(Qwen3-4B/8B、Gemma4-E4B、Llama3.1-8B,均在 HuggingFace),用 vLLM 部署即可,单卡到双卡级算力足够推理;三个基准公开:AppWorld test_normal 168 任务、BFCL V3 multi-turn base 200 任务、ToolSandbox base 129 场景。需要付费 API 的部分有两块:教师 GPT-5-mini 跑全部任务收集轨迹(每任务上限 40 步)加上记忆抽取的 LLM 调用,以及 OpenAI text-embedding-3-small 的嵌入编码,成本中等但可估算。实现细节论文给得相当完整:附录 Algorithm 1 提供推理伪代码,Figure 13-15 给出三个核心 prompt 全文(Workflow 生成、子任务切分、学生分解),并明确了 k=1、相似度阈值 δ、跨子任务去重、Qwen3 关闭 thinking、每实验重复两次取平均等关键配置。项目主页 agent-memory-distillation.github.io 已存在,但正文未明确承诺开源代码仓库,若代码未放出则需按论文重写整个 pipeline。整体复现难度评估为中等:无训练环节,主要工程量在轨迹收集、三类记忆抽取与检索注入逻辑的搭建;需要特别小心的是 prompt 与表征格式——Table 4 显示表征选择可造成 20 个百分点以上的差异(子任务记忆纯文本 23.21% vs 代码 49.40%),建议严格照搬附录模板并在自己环境下先跑通 Qwen3-4B + AppWorld 这一增益最大的组合做 sanity check。