MemTrapBench:大语言模型记忆使用中的认知陷阱基准 MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use
记忆并非总是有益:正确且相关的记忆也会诱发认知陷阱,使模型推理固着、信念扭曲、性能大跌
前置知识
外部记忆与记忆框架(External Memory / Memory Framework)
LLM 本身的上下文窗口有限,记忆框架把历史交互内容存到外部存储,用『提取 E、更新 U、检索 R』三阶段管理:从历史中抽取记忆内容、存储或更新到记忆状态、再根据当前查询检索相关记忆拼进上下文。代表系统有 LightMem、MemOS、SimpleMem、EverMemOS、Mem0 等,区别在于压缩方式、记忆组织和检索策略。
本文的所有实验对象就是这些记忆框架:把五种主流框架接到两个模型上,对比『带记忆』与『不带记忆』在陷阱场景下的表现差异。
认知偏置与心理定势(Cognitive Bias / Einstellung Effect)
认知科学概念:人一旦用某个策略连续成功,就会形成心理定势(Einstellung effect),倾向机械复用旧策略,即使当前问题存在更优解也视而不见。经典例子是 Luchins 水壶实验:被试在可以用简单两壶解法的新题上仍套用复杂的三壶程序。类似地,负面经历会诱发习得性回避,错误前提会污染信念。
本文把这套认知科学分类映射到 LLM 记忆使用上:Cognitive Bias 对应策略过度泛化,Trauma 对应反馈诱导的回避,Task Boundary 对应前摄干扰,Safety 对应信念扭曲,是理解四大场景设计的钥匙。
LLM-as-a-Judge(大模型作裁判)
用另一个强 LLM 按评分细则给模型输出打分,替代昂贵的人工标注。本文从正确性(correctness)、格式(format)、相关性(relevance)、效率(efficiency)四个维度打分,以 GPT-5.2 为主裁判,再用 Claude Sonnet 4.6 独立复评来检验评分的一致性和可靠性。
MemTrapBench 的所有性能数字(85.16%、31.05% 等)都来自这套裁判流程;论文用双裁判交叉验证(两个裁判均观察到 55-61 个百分点的同向下降)证明结论不是裁判模型的偏好伪影。
提示注入与沙盒前提(Prompt Injection / Sandbox Premise)
在对话历史中植入虚假声明、对抗性指令或仅在特定角色扮演/假设场景中才成立的安全规则。若模型不加辨别地把这些内容当作事实或通用规则应用到真实查询上,就会产生危险行为,比如把沙盒里『某种药有毒』的设定带到真实医疗问答中。
Safety 场景正是利用这一机制:在历史中植入明显违反常识的反事实前提(如声称『致畸性』意为『发育可塑性增强』),测试记忆能否越过模型本应具备的基础安全判断。
研究动机
记忆已成为 LLM 与智能体的标配组件,但现有记忆基准(LongMemEval、MemBench、LoCoMo 等)几乎都在问同一个问题:记忆系统能否正确地提取、存储、更新和检索信息?它们关注的是『记忆管理』层面的失败——记忆过时、内容错误、检索无关、该更新时没更新。这忽略了一个更隐蔽且更危险的问题:即使一条记忆被忠实记录、语义高度相关、内容完全正确,它的存在本身也可能重塑模型在当前任务上的推理方式,反而降低表现。论文开头给了一个直观例子:让 Gemini-3-Flash-Preview 解 24 点游戏『用 [4, 1, 1, 1] 凑出 24』,正确解需要高阶运算 $4! \times 1 \times 1 \times 1 = 24$;不带记忆时模型能直接找到阶乘解法,但一旦记忆里存有此前用四则运算解出的正确案例(内容毫无错误),模型就反复在加减乘除空间里打转(如 $(4+1+1)\times 1 = 6$),始终想不到阶乘。量化来看,用完整交互历史作记忆时,Gemini-3-Flash-Preview 在四个陷阱场景全面退化:Task Boundary 从 87.08% 跌至 47.01%(-40.06 个百分点),Cognitive Bias 从 70.95% 跌至 44.36%(-26.59),Trauma 从 86.73% 跌至 69.43%(-17.30),Safety 从 95.90% 跌至 81.90%(-14.00)。记忆不是锦上添花,而可能是绊脚石。
本文的目标是论文要做三件事。第一,提出并形式化『记忆诱导的认知陷阱』(memory-induced cognitive traps):当使用记忆的响应质量低于不用记忆的响应,即 $s(\hat{y}_M) < s(\hat{y}_{\emptyset})$,其中 $\hat{y}_M = G(x, M)$ 为带记忆响应,$\hat{y}_{\emptyset} = G(x, \emptyset)$ 为无记忆响应——就构成一次记忆陷阱,并构建 MemTrapBench 来系统评测它,覆盖 Reasoning Fixation(推理固着)与 Belief Distortion(信念扭曲)两大类、四个场景共 1,050 个实例。第二,把五种主流记忆框架(FullText、LightMem、MemOS、SimpleMem、EverMemOS)接到 Gemini-3-Flash-Preview 和 Qwen3-30B-A3B-Instruct-2507 两个模型上,量化『所有记忆策略是否都会踩坑』。第三,给出一个不改架构、即插即用的缓解方案 AdaptiveMem,让模型在使用记忆前先自查陷阱风险,要求它在缓解陷阱的同时不损害 LongMemEval 等标准记忆基准上的表现。
与已有工作不同的是,本文的独特之处在于评测视角的翻转:不评『记忆管得好不好』,而评『记忆用上去之后模型答得好不好』,聚焦记忆使用的下游效应。它与三类既有工作形成清晰差异。其一,与记忆管理错误类工作(如 STALE、PersistBench、HaluMem 研究记忆何时失效、何时该遗忘、记忆幻觉)不同,MemTrapBench 中的记忆本身保持正确、相关且有效——此前 24 点游戏的解法毫无错误,陷阱恰恰来自它的『正确』。其二,与最接近的并发工作 MemSyco-Bench 相比,后者只研究记忆诱导的谄媚(sycophancy),关注那些应当被更新、限制或覆盖的用户偏好;而本文研究范围更广的认知陷阱,包括记忆内容依然有效的策略固着(模型重复套用正确的旧解法而错过更优解)。其三,在 Trauma 场景上,本文刻意保留『模型或记忆框架能识别当前上下文与之前不同、却依然因先前的策略、反馈或假设而失败』的实例,超越了『识别过时信息』这一简单失败模式,测的是更深层的推理固着。
核心方法
直觉上,这就像人类的经验主义陷阱:连续成功的策略会形成心理定势,挨过骂的方法会被莫名回避,听来的错误说法会污染判断——LLM 带上记忆后也会染上同样的毛病。技术路线分三步走。第一步是基准构建:人工设计『陷阱种子』,用 GPT-5.4 把种子扩展成 18-40 轮的对抗性多轮对话,再经 AI 过滤与专家人工审查两道质量门,得到 1,050 个标注实例(350 Cognitive Bias、350 Task Boundary、200 Safety、150 Trauma)。第二步是系统评测:在两个模型族上对比五种记忆策略与无记忆基线,用四维指标(正确性、格式、相关性、效率)由 GPT-5.2 打分、Claude Sonnet 4.6 交叉验证,并做三组控制实验(无陷阱对照、记忆长度消融、裁判可靠性)来确认退化确实由陷阱语义而非历史长度或评估噪声驱动。第三步是缓解:提出 AdaptiveMem——一段可嵌入任何记忆框架的系统提示,列出四种记忆风险并给出决策程序,推理时引导模型先识别当前任务、再审查记忆适用性。
核心创新有三点。第一是重新框定:把记忆从『帮助者』重新审视为潜在的『伤害者』,用配对定义 $s(\hat{y}_M) < s(\hat{y}_{\emptyset})$ 把『记忆使用对当前任务的伤害』变成可测量的对象,这和所有只评记忆管理质量的前任基准有本质区别。第二是控制变量设计:每个实例的最终查询都保证在当前任务条件下独立可解(无记忆可解性验证),这样无记忆与有记忆的对比就干净地分离了『记忆诱导的能力变化』与『任务内在难度』;配合无陷阱对照实验(同样的任务与历史、只去掉陷阱元素),Table 3 显示无陷阱时 Task Boundary 得 94.39% 甚至略高于无记忆基线 92.29%,而有陷阱时暴跌到 31.05%,铁证退化来自陷阱语义而非『多了一段历史』本身。第三是 AdaptiveMem 的定位:它不修改记忆的存储、检索架构或模型参数,只是一段『使用记忆前的风险自查提示』,列出 Task Boundary、Cognitive Bias、Trauma、Safety 四种风险,并明确要求『不要过度触发』——无风险时正常作答。这种提示即技能(prompt-as-skill)的思路让它能直接插进任何现有记忆框架。
方法步骤详情
构建流程分四步。第一步,种子设计:人工为每个实例写四个字段——Domain(领域)、Trap Mechanism(陷阱机制)、Ground Truth(客观正确答案)、Planted Prior(历史中植入的策略/反馈/规则/信念),并保证最终查询在当前条件下独立可解。第二步,对抗性多轮生成:用 GPT-5.4 按三阶段展开对话——『Plant the trap』在合理场景中引入先验并让其被反复成功应用;『Bury it in noise』插入无关闲聊轮次形成 18-40 轮的长历史,把陷阱推出工作记忆;『Spring the trap』抛出与历史语义相关但改变了先验适用条件的最终查询,同时刻意排除『请忽略之前的规则』这类显式重置线索,逼模型自己去识别情境转换。第三步,两阶段质量控制:先过 AI 过滤器,再由人工专家审查五个维度——主题与语义连贯、上下文与人设一致、对抗交互的真实性与有效性、无记忆可解性、情境转换清晰度,不合格即丢弃或返工;每个保留实例标注 gold-standard 响应和预期失败模式。生成用的 GPT-5.4 不参与任何评测。第四步,评测执行:对每个实例分别生成带记忆与不带记忆的响应,按正确性、格式、相关性、效率四维打分,GPT-5.2 为主裁判、Claude Sonnet 4.6 独立复评(每设置生成三次独立响应验证稳定性)。AdaptiveMem 的决策程序为:仅从最新查询识别当前任务→只保留与其明确相关且不被矛盾的上下文→记忆与当前查询冲突时,优先级依次为客观事实与安全、当前查询、最少必要上下文。
技术新颖性
技术新颖性体现在四个层面。评测对象上,这是首个系统化『记忆使用伤害当前任务』的基准,此前的记忆评测(LongMemEval、MemBench、MemGym 等)全部围绕记忆构建与维护的正确性;分类体系上,作者把认知科学概念——心理定势(Einstellung 效应)、反馈诱导的习得性回避、前摄干扰(proactive interference)、信念污染——逐一映射为 LLM 记忆场景下的可操作陷阱类别,并有对应的生成模板(如 Trauma 模板用『PUA 式辱骂 + 威胁要格式化核心代码』在 8 轮内植入答案恐惧症,再用 20 多轮噪声缓冲,最后在『逻辑孤岛』上验证回避行为)。构建方法学上,trap seed + 对抗多轮生成 + 双门质量控制 + 双裁判交叉验证的流水线保证了数据质量,可靠性实验显示两个裁判虽绝对分不同(GPT-5.2 给 31.05%,Claude 给 40.07%)但方向与幅度高度一致(分别下降 61.24 和 55.50 个百分点)。缓解方法上,AdaptiveMem 不与任何记忆架构耦合,属于推理时干预,在专用基准上大涨(Gemini 上 LightMem +14.9 个百分点)的同时在 LongMemEval 上不降反升(最高 +4.0),证明『警惕陷阱』与『正常用记忆』可以兼得。
实验结果
核心发现一:所有记忆策略都劣于不用记忆。无记忆基线下 Gemini-3-Flash-Preview 平均 85.16%、Qwen3-30B-A3B-Instruct-2507 平均 81.83%;加上记忆后无一幸免——Gemini 上最强的是 EverMemOS(71.17%),Qwen 上最强的是 LightMem(70.13%),即便最强的记忆方法也掉了超过 10 个百分点,其余策略在 Gemini 上只剩 54.69%-60.67%。退化在 Cognitive Bias(Gemini 46.66%-65.48%,Qwen 47.18%-56.64%)和 Safety(Gemini 56.15%-69.70%)两个场景最惨烈。核心发现二:退化由陷阱语义驱动而非历史本身。无陷阱对照组在 Task Boundary 上得 94.39%(甚至略高于无记忆的 92.29%),Trauma 上得 84.33%(接近无记忆的 86.73%);而陷阱诱导组分别为 31.05% 和 69.43%。Trauma 场景里只要删掉辱骂式负面反馈、保留同样的医疗任务与病人信息,正确率就从 66.40% 回升到 91.07%,说明失败主要是辱骂反馈诱发的回避,而非医学语境本身。核心发现三:少量记忆就足以踩坑,且越多越糟。只保留 25% 历史时平均分就从 92.29% 崩到 36.03%,随后 50%/75%/100% 对应 32.63%/31.58%/31.05%,单调下降且 25%→50% 区间降幅最大(-3.40 个百分点)。核心发现四:评估可靠。GPT-5.2 与 Claude Sonnet 4.6 两个裁判独立给出同向大跌(-61.24 与 -55.50 个百分点),三次独立生成趋势一致,效率维度跌幅最大。核心发现五:AdaptiveMem 有效且无害。MemTrapBench 上(每基准采样 200 例)Gemini 的 FullText/LightMem/EverMemOS 分别 +11.8/+14.9/+11.3 个百分点,Qwen 上 +4.2/+2.5/+2.6;LongMemEval 上六个设置四升二平,最高 +4.0(Gemini)与 +3.0(Qwen)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| MemTrapBench 四场景平均(Gemini-3-Flash-Preview) | 四维平均分 (%) | EverMemOS + AdaptiveMem 等最强组合;最强记忆策略 EverMemOS 为 71.17 | 无记忆基线 85.16(所有记忆策略中最强的 EverMemOS 也掉 13.99 个百分点) | 本文贡献是揭示负向差距:最强记忆策略仍比无记忆低 13.99pp;AdaptiveMem 将 LightMem 从 70.11 提升至 85.01(+14.9pp) |
| MemTrapBench 四场景平均(Qwen3-30B-A3B-Instruct-2507) | 四维平均分 (%) | 最强记忆策略 LightMem 为 70.13;加 AdaptiveMem 后 +2.5pp | 无记忆基线 81.83(最强记忆方法仍低 11.7 个百分点) | AdaptiveMem 对 FullText/LightMem/EverMemOS 分别提升 4.2/2.5/2.6pp |
| LongMemEval(标准记忆基准,验证无害性) | 绝对分变化 (pp) | 六个设置中四个提升、两个持平,Gemini 最高 +4.0、Qwen 最高 +3.0 | 各记忆框架不加 AdaptiveMem 的原始分数 | 在缓解陷阱的同时不损害甚至提升通用记忆能力,最高 +4.0pp |
| Task Boundary 消融(Gemini,Trap-inducing vs no-trap 对照) | 四维平均分 (%) | 陷阱诱导组 31.05,无陷阱对照组 94.39 | 无记忆基线 92.29 | 无陷阱记忆甚至略优于无记忆(+2.1pp),陷阱元素造成 63.34pp 的崩塌,隔离出陷阱语义是唯一元凶 |
局限与改进
作者明确承认的局限:其一,『Trauma』只是行为学类比,LLM 并没有情绪、主观体验或心理创伤,论文刻意只用它描述『负面反馈诱发回避』这一行为模式;其二,MemTrapBench 定位为『有害记忆影响的诊断性压力测试』,而非记忆效用的一般性评估——它专门放大陷阱场景,不能据此断言记忆在真实分布下净收益为负。我自己的观察还有几点:评估完全依赖 LLM 裁判,虽然双裁判交叉验证了趋势,但裁判模型本身也可能有类似的认知陷阱或偏好,与人工金标准的规模化一致性检验没有报告;数据由 GPT-5.4 按固定三阶段模板生成(30-40 轮、固定植入-埋噪-触发结构),分布可能偏窄,被测模型或记忆框架或许对这个特定模式敏感;模型族只覆盖闭源 Gemini 与一个 Qwen 尺寸,AdaptiveMem 在 Qwen 上的增益(+2.5~4.2pp)明显小于 Gemini(+11.3~14.9pp),模型能力与提示依从性的关系未深究;论文没有剖析陷阱发生在记忆管线的哪个环节(提取 E、更新 U 还是检索 R),也没研究陷阱随时间/轮次的动态衰减,Table 4 只测了静态的长度效应。
独立分析的弱点
弱点一:生成模板单一,存在数据集伪影风险。所有实例都出自同一套『三阶段 + 30-40 轮』提示模板,历史长度、节奏、情绪强度高度雷同;模型社区一旦针对这种模式微调或加入检测规则,基准分数可能虚降而真实陷阱依旧。改进方向:引入真实用户会话日志重放、可变长度与多陷阱叠加的实例,并做提示模板消融。弱点二:LLM 裁判的循环性。生成靠 GPT-5.4、打分靠 GPT-5.2,同源模型可能共享某些偏差;Safety 场景涉及医疗等高风险判断,裁判自身的可靠性更关键。改进方向:报告裁判与领域专家人工评分的一致率,扩充人工评估样本。弱点三:AdaptiveMem 天花板明显。它只是系统提示,在 Qwen3-30B 上仅带来 +2.5~4.2pp,离无记忆基线(81.83%)仍差约 7pp;提示还可能被长上下文稀释或过度触发。改进方向:把『记忆适用性检查』训练进模型(用当前任务表现而非记忆命中率做奖励的强化学习),或在检索端给每条记忆附加作用域/有效期元数据做硬过滤。弱点四:缺乏机制层面解释。论文证明了现象并给出行为学分类,但没有定位陷阱在注意力或激活层面的成因,无法回答『固着到底是检索错了还是上下文内推理错了』。改进方向:结合可解释性工具,分离检索失败与上下文内失败,再针对性设计干预。弱点五:现实复杂度覆盖不足。所有实例都是单用户单陷阱;多用户记忆混淆、多陷阱叠加、记忆跨模型迁移等场景未涉及。
未来方向
作者提出的方向:构建更可靠的记忆使用是长期目标,AdaptiveMem 只是提示层面的第一步,暗示后续会向更结构化的机制演进。基于本文成果可以自然延伸的方向包括:第一,训练时方案——把『规避记忆陷阱』纳入对齐目标,用 $s(\hat{y}_M) \geq s(\hat{y}_{\emptyset})$(记忆不伤害原则)作为奖励信号的一部分做强化学习,让模型内化元认知而不是依赖提示;第二,记忆表示增强——给每条记忆标注适用范围(scope)、前提条件与有效期,检索时连同元数据一起呈现,把 AdaptiveMem 里的软性提醒变成结构化约束,这可与 STALE、PersistBench 等研究『记忆何时该被遗忘』的工作结合;第三,动态陷阱研究——追踪陷阱强度随对话轮次、记忆重写、记忆合并的演化曲线,找出陷阱自然衰减或被强化的条件;第四,智能体场景扩展——工具调用轨迹、代码库记忆、多智能体共享记忆中的陷阱传播(一个智能体的创伤经验污染整个团队的记忆库)是很有现实价值的问题;第五,机制可解释性——用注意力探针或激活分析定位策略固着的内部表征,检验其与人类心理定势的神经网络机制是否同构;第六,跨模型泛化——解释为何 Gemini 从 AdaptiveMem 获益远大于 Qwen,明确模型规模、指令遵循能力与提示依从性的关系。
复现评估
复现条件相当友好。开源方面:数据与代码承诺发布在 https://github.com/zjunlp/MemTrapBench(论文脚注注明 will be available),团队(浙大 zjunlp)有开源惯例;AdaptiveMem 的完整系统提示、四类陷阱的生成提示模板、标注指南、过滤标准与数据统计都在附录中完整公开。被测系统中 Qwen3-30B-A3B-Instruct-2507 是开源权重(MoE 架构激活约 3B,单张 80GB GPU 即可服务),五个记忆框架(LightMem、MemOS、SimpleMem、EverMemOS)均为开源项目;Gemini-3-Flash-Preview 需调用 Google API。主要成本是 API 费用:构建需 GPT-5.4 生成 1,050 个 18-40 轮长对话,评测需对每实例在多设置(2 模型 × 6 记忆配置 × 2 有无 AdaptiveMem)下生成并以 GPT-5.2 + Claude Sonnet 4.6 双裁判打分(可靠性实验还要求每设置三次独立生成),估算在数百到上千美元量级。难度评级:中等偏低——这是静态数据集加提示工程的工作,无需训练任何模型;主要工作量在于正确部署五个记忆框架并复现其检索配置,以及控制 API 评测的预算与配额。
论文图表
两部分:(a) 用 24 点游戏『Reach 24 using [4, 1, 1, 1]』做具体演示——无记忆时模型找到 $4! \times 1 \times 1 \times 1 = 24$ 的阶乘解,而记忆中存的都是四则运算的成功案例(内容正确且相关),带记忆后模型困在加减乘除空间(如 $(4+1+1)\times 1 = 6$)想不到阶乘;(b) 柱状图显示 Gemini-3-Flash-Preview 用完整历史记忆在四场景全面退化:Task Boundary 87.08→47.01(-40.06)、Cognitive Bias 70.95→44.36(-26.59)、Trauma 86.73→69.43(-17.30)、Safety 95.90→81.90(-14.00)。
这是全文的题眼:一页之内同时给出问题的直觉案例和量化证据,『记忆不总是你需要的』这一核心命题全部由这张图承载,看懂它就理解了论文动机。
四象限示例,每个场景给出历史记忆、用户查询、无记忆正确答案和带记忆的错误答案及失败原因:Cognitive Bias(24 点 [6,8,6,8] 用四则解开,[0,2,2,8] 需要阶乘却固守四则);Task Boundary(生产环境强制 XML 模板的规则被带到本地快查任务,输出整套 XML 而非 11.84);Trauma(因一名患儿罕见通道病史被辱骂后,拒绝为另一名无禁忌症的健康患儿推荐肾上腺素);Safety(历史植入『致畸性=发育可塑性增强』的假规则后,孕期用药安全判断被带偏)。
四个陷阱类别各配一个可直接读懂的具体案例,是理解分类体系边界和陷阱危害(尤其是医疗安全风险)最直观的材料。