← 返回 2026-08-26

MemUse:将对话记忆评估从直接问答转向人机长期对话中的自然融入 MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation

Ryuichi Sumida, Koji Inoue, Tatsuya Kawahara 📅 2026-08-25 👍 1 2026-08-30 18:30
LLM-as-a-judge 基准构建 对话记忆评估 长期人机对话 随机化部署实验

直接问答测得的记忆准确率与用户满意度脱钩,自然融入才真正相关

前置知识

Direct QA(直接问答式记忆评测)

现有记忆基准(LoCoMo、LUFY、RealTalk、LongMemEval、MemoryBank)的标准格式:把先前对话中的事实改写为独立的事实性问题(如“系统上个月推荐了哪位歌手?”),在给定上下文下让模型作答,按答案匹配计算准确率。它衡量的是“被问及时能否召回”(elicited retrieval),即检索能力。

本文的全部论证都建立在“Direct QA 分数 ≠ 对话中真实的记忆使用”这一对比之上,理解这一评测范式才能明白论文要推翻什么。

Natural Integration(自然融入)

本文提出的主指标:不给模型出题,而是取用户在自然对话中主动提及旧事的真实片段(触发语句,如“我打算去听 Luke 那天推荐的音乐”),由 LLM judge 或人类以一题一判的二元方式判断系统的自然回复是否展现出对相关话题的记忆。它是面向读者的整体判断,刻意不规定匹配细则。

这是 MEMUSE 基准的主指标,也是全部七个条件中唯一与用户满意度相关的记忆指标,是理解本文核心结论的钥匙。

RAG 与长上下文(LC)记忆供给

RAG(检索增强生成)把先前对话切片建立向量索引,按相似度检索 top-10 片段拼进上下文;LC(长上下文提示)则把按重要性排序的前 k% 用户轮次连同助手配对轮直接前置进上下文。两者都在“上次对话摘要”基线之上增加记忆容量,是当前记忆系统的两条主流路线。

论文 4 个月部署中的 7 个随机化记忆条件全部围绕这两种容量扩展构建,实验检验的正是“加容量能否换来满意度”这一业界默认假设。

LLM-as-a-judge 及其校准

用另一个 LLM(本文为 GPT-5.4-nano,温度 0)按固定提示词对模型输出做 yes/no 判断,替代昂贵的人工标注。其可信度需要与人类标注者对比一致性(Cohen's $\kappa$)来验证,并警惕偏好自身输出、宽松度漂移等已知偏差。

MEMUSE 的三个指标全部由 LLM judge 打分,论文用整整一节做 judge 校准(双人标注、重校准试点),判断其结论强度必须先理解这一环节的可靠程度。

线性混合效应模型(LMM)与用户内 z 分数

LMM 在固定效应之外为每个用户加随机截距 $u_i \sim \mathcal{N}(0, \sigma_u^2)$,即 $y_{ij}=\beta_0+\sum_k \beta_k x_{ijk}+u_i+\varepsilon_{ij}$,以处理纵向数据中同一用户多次观测的非独立性;用户内 z 分数 $y_{ij}=(r_{ij}-\bar{r}_i)/s_i$ 则消除个人评分基线差异,让满意度可以跨用户汇总。

论文所有统计结论(容量对满意度无效、整合与满意度相关等)都以 LMM 系数 $\beta$、Spearman $\rho$ 和置信区间报告,读懂这些才能正确评估证据强度。

研究动机

现有对话记忆基准无一例外采用 Direct QA 格式:MemoryBank、LoCoMo、LongMemEval、LUFY、RealTalk 都把先前对话改写为事实性问题,测“被问及时能否召回”,且没有一个验证过基准分数是否与真实用户体验相关(Table 1)。这些基准中评价项占用户轮次的比例高达 15–24%,而真实部署中用户主动调用记忆的时刻只占 1.4%——评测密度被人为放大了近二十倍。作者用随机化部署直接检验“基准分=用户价值”这一隐含假设:2025 年 11 月至 2026 年 2 月,40 名英语用户每天与 GPT-4.1-mini 驱动的日记伴侣“Luke”对话,共产生 1,872 个 session(21,575 轮),每个 session 随机分配到从纯摘要到 LC-100%、RAG-100% 的 7 种记忆条件之一。结果记忆容量把现有基准准确率从 19.7%(Summary-only)推到 70.1%(LC-100%),但用户满意度纹丝不动:所有条件与 Summary-only 的均值差都在 0.06 个用户内标准差以内,TOST 等价性检验($\delta=\pm0.25$)确认实践等价,且该 null 不能被延迟差异解释(延迟与评分 $|\rho|<0.06$)。

本文的目标是论文的目标分三层递进。第一,因果验证:在真实长期部署中随机化记忆容量,直接检验 Direct QA 准确率的提升是否转化为用户满意度提升——答案是否定的,这构成了需要解释的悖论而非终点。第二,机制诊断:作者假设现有基准测的是“引出式检索”(recall-when-asked),而对话真正需要的是“自然融入”——检测相关性并把先前上下文自然织入回复——这是两种可分离的能力。为此构建 MEMUSE 基准:从部署语料中自动检测用户主动提及或考验系统记忆的真实时刻(72 个实例、316 个事实问题),并用整合感知的单一判断为系统对触发语句的自然回复打分。第三,瓶颈定位:通过跨模型复制(GPT-5.5、Gemini 3.1 Pro)、现代记忆系统评测(Mem0、Letta)和四类提示干预,查明检索—整合鸿沟究竟卡在检索还是生成环节,为重新对齐记忆评测与用户体验提供可操作的度量工具。

与已有工作不同的是,本文的独特切入角度有三。其一,评测项不是人工编写的 QA,而是从 4 个月真实人机对话中自动检测出的“记忆时刻”——用户主动说“你还记得 X 吗”“正如我之前提到的 X”,或系统主动召回——这是记忆真正被需要的时刻(147 个验证事件,检测精度 95.5%),而非基准作者强加给对话的时刻。其二,它同时拥有纵向随机化部署和逐 session 满意度评分,是 Table 1 对比的六个基准中唯一二者兼得者(LoCoMo/RealTalk 只有脚本对话、无满意度数据),因此能把每个指标与真实用户体验直接对表。其三,把记忆使用首次拆成用户发起的 reactive(探问与复述)与系统发起的 proactive(主动召回)两种模式分别评估满意度效应,发现只有 reactive 整合与满意度相关、主动召回甚至存在时机风险——这一不对称此前从未在部署中被直接测量。

核心方法

直觉上,记忆系统评测回答的是“系统能否存储和取出信息”,但用户在乎的是“我提起旧事时,它是否接住了”。论文据此把评测从“出题考模型”改为“观察真实对话中的接话质量”。技术路线分三步。第一步,4 个月随机化部署:40 名用户、1,872 个 session,每 session 随机指定 7 种记忆条件之一——SUMMARY(仅提供前次对话摘要)、LC-k%(把按 RoBERTa 重要性模型排序的前 k% 用户轮次前置进上下文)、RAG-k%(在同一 top-k% 池上用 text-embedding-3-small 检索 top-10 片段)——所有条件共享同一摘要与 persona,用户以 1–7 分评价每个 session,随机轮转保证条件均衡($\chi^2=146.0$, p=.89)。第二步,记忆时刻检测与基准化:用 GPT-5.4(温度 0)逐 session 检测四类语言学信号事件,人工审核后得 147 个真阳性;把其中 62 个复述提供与 10 个记忆探问打包成 72 实例的 MEMUSE,从源 session 抽取 ground-truth 事实并拆成 3–5 个事实问题。第三步,三指标评分与统计推断:在同一重建上下文上,用 GPT-5.4-nano judge 打 Natural Integration(主指标)、Direct QA、Reference 三种分,推断全部采用用户随机截距的 LMM 与 Spearman $\rho$,效应量置信区间用用户聚类 bootstrap。

核心创新是“整合感知的评测对象转换”:不再问“模型能否在被直接提问时答出事实 X”,而是问“当用户在自然对话中隐式提及 X 时,系统的自然回复是否展现出对 X 的记忆”。与已有方法的本质区别在于三点。(1) 评测项来源真实:由用户的显式语言信号自动检测并经人工验证(95.5% 精度),而非作者编写,评价项密度 1.4% 忠实反映真实调用频率。(2) 评分对象是自然回复而非问答答案:Natural Integration 是面向读者的单点整体判断,刻意不规定“什么算记忆”的细则(Table 10),以贴近真实读者是否感到“它记得我”;配合 Reference 指标(逐问检查自然回复是否真的提及该事实),把“答得出”与“说出口”解耦。(3) 三指标共享同一事实集合与同一重建上下文(Table 3),使 Direct QA 与 Reference/Natural Integration 之间形成严格对照,从而第一次把“检索”与“整合”量化为可分离的能力——同模型、同上下文、同一批事实上的逐实例相关仅为 $\rho=-0.009$。这套设计把“为什么容量加了满意度不涨”从悖论转化为可定位的机制问题。

方法步骤详情

步骤一(部署):用户通过网页与“Luke”(GPT-4.1-mini,温度 0)日常对话,输入为 persona+framing(第 N 次对话+上次摘要)+条件相关上下文,回复限 500 token;每 session 后生成三种摘要(150 词滚动摘要回喂下一 session、一句话日总结、100 词月总结供用户回顾界面)。共得 1,872 个 session(21,575 轮),用户人均 46.8 个 session。步骤二(满意度过滤):剔除 9 个近乎恒定评分(1–7 分尺度上 SD$\le$0.5)与 2 个内容异常用户(模板/AI 粘贴内容),保留 29 用户 1,270 个 session。步骤三(检测):GPT-5.4 逐 session 检测四类事件——用户记忆探问(“Do you remember X?”)、用户复述提供(“As I mentioned before, X”)、系统主动召回、用户记忆反应——人工独立审核后得 147 个真阳性(11/62/66/8),精度 95.5%(Table 9);记忆时刻仅占约 3.5% 的 session、1.4% 的用户轮(约每 73 轮一次)。步骤四(基准化):72 个 reactive 实例(62 复述+10 探问),每实例抽取 ground-truth 事实并拆成 3–5 个事实问题(共 316 问,均值 4.4)。步骤五(评分):给定实例与候选系统,从实际对话数据重建上下文,(i) 把触发语句喂给系统获得自然回复,judge 一题一判是否展现记忆(Natural Integration);(ii) 逐问 Direct QA;(iii) 检查自然回复是否提及各问对应事实(Reference)。步骤六(校验与推断):judge 与双人标注对比($\kappa=0.57$,正例率 51.8% vs 51.8%/55.4%;316 项 Fleiss $\kappa=0.65$),全部推断用 LMM 与用户聚类 bootstrap(10,000 次重采样)。

技术新颖性

技术新颖性体现在四个层面。基准构建层面:首次从纵向人机对话中“检测”而非“编写”评测项,并给出检测精度(95.5%)与自然发生频率(1.4% 轮次)的量化,对照现有基准 15–24% 的人造密度(Table 1),揭示既有基准系统性地高估了记忆被需要的频率。指标层面:Natural Integration 把对话质量评估文献中的“整体读者判断”引入记忆评测,并用 Reference 指标把“是否答得出”与“是否真的说出口”解耦——两者之间 71 个百分点的鸿沟本身就是新发现,而非指标设计的副产品。统计层面:7 条件随机化支持总体层面的因果否定(摘要之上的容量无满意度收益),而实例层面的逐问配对(同模型、同上下文、同事实,207 对)把检索—整合相关性的检验做到了 $\rho=-0.009$ 的精度,且跨三个模型复制。诊断层面:V6 两步消融(先抽取后生成)把瓶颈干净地定位到生成端——即便把 ground-truth 细节直接递到模型嘴边,仍有 77%(37/48)的回复拒绝使用(Table 23);这种“机制定位”式的评测设计在记忆基准文献中前所未有。

实验结果

核心发现按实验逐一展开。(1) 部署层 null(§4):容量把现有基准准确率从 19.7%(Summary)推到 70.1%(LC-100%),MEMUSE Direct QA 也从 44.9% 升至 78.8%;但满意度完全平坦,各条件 vs Summary 的差均 <0.06 SD(Summary +0.02,LC-100 反而 −0.04),TOST 等价检验全部 p<.05,且非延迟混淆(六种延迟指标与评分 $|\rho|<0.06$、p$\ge$.07)。(2) 整合与满意度挂钩(§6.1):在 48 个记忆时刻 session 上,Direct QA 与满意度 $\rho=+0.03$ 无关,Natural Integration $\rho=+0.29$(p=.046),整合成功的 session 满意度高出 +0.56 个用户内标准差(bootstrap 95% CI [+0.12,+0.98]);联合回归中 Direct QA 无增量价值($\beta_{DQ}=-0.353$)。(3) 检索—整合鸿沟(§6.2):同模型同上下文(GPT-4.1-mini, LC-100%),Direct QA 78.8% vs Reference 7.9%,逐实例 $\rho=-0.009$;失败模式中 38.9% 泛泛共情、26.4% 仅得梗概、23.6% 幻觉式回忆、2.8% 坦承不记得,完全整合仅 8.3%。该鸿沟跨模型复制:GPT-5.5 与 Gemini 3.1 Pro 的 Direct QA 跨容量升 32–34 pt 而 NI 跨度 ≤8.2 pt;Mem0/Letta 把 NI 提到 58.3%/56.9% 但 Reference 仍仅 7.3%/10.8%;四类提示干预(CoT、cue-aware、two-step、query-rewrite)抬高 NI 水平却无一产生容量敏感性(跨度 ≤21.9 pt vs Direct QA 的 33.9 pt),V6 两步消融显示即便抽取步骤点名正确细节,生成步骤仍 77%(37/48)弃用。(4) 主动召回(§6.3):66 个经验证的系统主动召回无满意度收益($\rho=-0.05$ vs reactive 的 +0.29),8 个时机不当者 $\bar{z}=-0.48$ SD,用户对回调的接话率仅 30%(19/64)。(5) 满意度的真实预测因子是参与度维度:回复长度 $\beta=0.179$、跨 session 连续性 $\beta=0.105$、回复特异性 $\beta=0.079$(均 p$\le$.001),且“复述负担”显著负面:用户被迫重提旧事时,冗长回复反而降低满意度(交互 $\beta=-0.086$, p<.001)。

Long-term memory benchmarks. MEMUSE is the only one combining multi-month real human-AI deployment, evaluation items detected from the conversation rather than authored as QA, and per-session satisfaction ratings.
Table 1: Long-term memory benchmarks. MEMUSE is the only one combining multi-month real human-AI deployment, evaluation items detected from the conversation rather than authored as QA, and per-session satisfaction ratings.
Per-condition cost and latency on the 29-user / 1,270-session subset.
Table 2: Per-condition cost and latency on the 29-user / 1,270-session subset.
One real MEMUSE instance scored under all three metrics (GPT-4.1-mini, LC-100% condition, same reconstructed context throughout).
Table 3: One real MEMUSE instance scored under all three metrics (GPT-4.1-mini, LC-100% condition, same reconstructed context throughout).
Real deployment excerpts illustrating the two modes (reactive integration success/failure; proactive recall welcomed/walked past).
Table 4: Real deployment excerpts illustrating the two modes (reactive integration success/failure; proactive recall welcomed/walked past).
Detection results. All events individually verified against raw conversation transcripts.
Table 9: Detection results. All events individually verified against raw conversation transcripts.
Numerical values for Figure 1: per-condition Existing QA Acc, MemUse Direct QA, Reference, NI, and z-scored satisfaction.
Table 13: Numerical values for Figure 1: per-condition Existing QA Acc, MemUse Direct QA, Reference, NI, and z-scored satisfaction.
LC-100% failure modes (GPT-4.1-mini, N = 72).
Table 17: LC-100% failure modes (GPT-4.1-mini, N = 72).
Cross-model MEMUSE accuracy across all 7 memory conditions (Direct QA / Reference / NI for GPT-4.1-mini, GPT-5.5, Gemini 3.1 Pro).
Table 18: Cross-model MEMUSE accuracy across all 7 memory conditions (Direct QA / Reference / NI for GPT-4.1-mini, GPT-5.5, Gemini 3.1 Pro).
Modern memory systems on MEMUSE (72 instances, 316 questions; Mem0 vs Letta vs the 7 provisioning conditions).
Table 19: Modern memory systems on MEMUSE (72 instances, 316 questions; Mem0 vs Letta vs the 7 provisioning conditions).
V6 extraction-quality decomposition on LC-100% (N = 73). When Step-1 successfully named the ground-truth facts, Step-2 still failed to integrate them in 37/48 = 77% of cases.
Table 23: V6 extraction-quality decomposition on LC-100% (N = 73). When Step-1 successfully named the ground-truth facts, Step-2 still failed to integrate them in 37/48 = 77% of cases.
Across 7 randomized memory conditions (40 users, 1,872 sessions), the two retrieval metrics (Existing QA Acc; MEMUSE Direct QA) rise sharply with capacity, while the integration metrics (MEMUSE Natural Integration; MEMUSE Reference) stay flat. Satisfaction is shown for comparison.
Figure 1: Across 7 randomized memory conditions (40 users, 1,872 sessions), the two retrieval metrics (Existing QA Acc; MEMUSE Direct QA) rise sharply with capacity, while the integration metrics (MEMUSE Natural Integration; MEMUSE Reference) stay flat. Satisfaction is shown for comparison.
The retrieval–integration dissociation replicates across stronger models (GPT-4.1-mini, GPT-5.5, Gemini 3.1 Pro).
Figure 2: The retrieval–integration dissociation replicates across stronger models (GPT-4.1-mini, GPT-5.5, Gemini 3.1 Pro).
Prompt-level interventions raise the level of Natural Integration but do not induce capacity-sensitivity (GPT-4.1-mini): every variant stays roughly flat across the 7 memory conditions.
Figure 3: Prompt-level interventions raise the level of Natural Integration but do not induce capacity-sensitivity (GPT-4.1-mini): every variant stays roughly flat across the 7 memory conditions.
Asymmetric satisfaction landscape: only failure modes carry negative signal; reactive integration straddles zero.
Figure 4: Asymmetric satisfaction landscape: only failure modes carry negative signal; reactive integration straddles zero.
Predictors of z-scored satisfaction (N = 1,270 sessions, 29 users). Three engagement metrics each independently predict higher satisfaction; memory condition does not.
Figure 12: Predictors of z-scored satisfaction (N = 1,270 sessions, 29 users). Three engagement metrics each independently predict higher satisfaction; memory condition does not.
Satisfaction by memory event type (session-level aggregate). Reactive events are associated with higher satisfaction than proactive system recalls.
Figure 15: Satisfaction by memory event type (session-level aggregate). Reactive events are associated with higher satisfaction than proactive system recalls.
查看结构化数据
任务指标本文基线提升
现有记忆基准问答(LoCoMo/LUFY/RealTalk 平均) QA 准确率 LC-100% 条件 70.1% Summary-only 条件 19.7% +50.4 pt——但满意度零变化(<0.06 SD,TOST 等价),证明容量扩展只买到检索能力
MEMUSE Direct QA(真实记忆时刻直接问答) 每题准确率 GPT-4.1-mini LC-100% 达 78.8% Summary-only 条件 44.9% +33.9 pt,检索通道随容量稳定增长,是三个模型共同的模式
MEMUSE Natural Integration(自然融入,主指标) 实例级二元判断通过率 GPT-4.1-mini 跨 7 条件仅 22.2–27.8%(LC-100% 为 22.2%) 同条件 Direct QA 78.8% 与容量完全脱钩(跨度 ≤8.2 pt),比同条件 Direct QA 低 56.6 pt;Mem0 可提至 58.3%
MEMUSE Reference(自然回复是否引用事实) 问题级引用率 LC-100% 仅 7.9% 同模型同上下文 Direct QA 78.8% 差 70.9 pt——同模型同上下文下的检索—整合鸿沟,逐实例 $\rho=-0.009$
现代记忆系统(Mem0 / Letta-MemGPT) Natural Integration 与 Reference NI 58.3% / 56.9% 部署式 7 条件 NI 22.2–27.8% NI 提升 +30 pt 以上,但 Direct QA vs Reference 差距仍达 34.2 pt(Mem0)与 50.6 pt(Letta),鸿沟未闭合
提示级干预(V2-CoT / V5 cue-aware / V6 two-step / V7 query-rewrite) NI 跨 7 条件的容量跨度 所有变体 ≤21.9 pt(GPT-5.5 上 V2-CoT 在 LC-100% 达 72.6%) Direct QA 容量跨度 32.9–33.9 pt 可抬高 NI 绝对水平但不产生容量敏感性;V6 显示抽取正确后生成仍 77% 弃用,瓶颈定位在生成端

局限与改进

作者明确承认的限制:其一,null 的范围——7 个条件全部包含同一份上次对话摘要,因此结论只针对“摘要之上的额外容量”,不是“记忆本身无用”;其二,检测依赖显式语言信号(“do you remember”等),约 3.5% 的时刻率只是下限,隐式记忆需求被系统性漏检,真实频率可能更高;其三,整合—满意度关联是观察性、小样本证据(48 个 session、16 用户;LMM $\beta=+0.556$, p=.082,未通过 Bonferroni 校正,仅 bootstrap CI 排除零),只能算中等强度证据;其四,样本 92.5% 为女性、限于日记伴侣场景,向任务型助手外推存疑;其五,Natural Integration 是二元且由 LLM judge 给出的指标,对宽松度敏感(原始轮次双人 $\kappa$ 仅 0.19,需重校准后才达 0.57),Reference 与失败模式分类未作为有序指标验证;其六,发布语料中部分原文以摘要替代以保护隐私。我的补充观察:部署与主分析只用 GPT-4.1-mini 一个生成模型,跨模型结论均来自离线重建而非用户实际体验;1–7 粒度的自评满意度噪声大,过滤后仅剩 29 人,检验功效对 d=0.10 的效应仅 20.9%;72 个实例中探问只占 10–11 个,使该子分析的单元置信区间宽达 ±25–30 pt;4 个月的窗口也可能不足以让记忆价值随关系深化而显现。

独立分析的弱点

独立分析的弱点与改进方向:(1) Natural Integration 二元判断粒度过粗——一个回复提对了歌手名却编造场景也能得 1 分,且 judge 对“如你所说”式措辞存在 +16.4 pt 的虚假敏感性(Summary-only 条件下无任何事实可整合也涨分,附录 E.3.8);改进方向是开发经人工验证的分级(0–3)整合指标,结合事实锚定检查抑制措辞偏倚。(2) 检测器只认显式词汇信号,会漏掉用户含蓄引用旧事的高价值时刻(如仅说“我上次那个计划成功了”);改进:引入基于语义相关度与指代消解的隐式时刻检测并量化漏检率。(3) 满意度自评 1–7 分且过滤后仅 29 人,无力检测 d≈0.1 的真实效应;改进:延长部署周期、纳入回头率、session 时长、复述频率等行为信号作客观补充。(4) 提示干预多数在 73 个实例上进行,McNemar p 不显著即被解读为“无效”,存在把功效不足误读为阴性的风险;改进:扩充实例规模或做跨变体元分析。(5) 所有条件共享摘要的设计虽干净,但“摘要已够用”与“整合失败”两种解释未完全分离——摘要覆盖分析显示 83.3% 的实例只有 10–50% 的内容覆盖、摘要均长仅 127 词,细节确实不在摘要里,但无法排除用户已将摘要界面内化为自我记忆管理工具;改进:增设无摘要对照臂。(6) 单一 persona(Luke)、单一语言(英语)、单一文化背景限制了外部效度,主动召回的“时机”结论尤其可能随文化规范漂移。

未来方向

作者提出与可延伸的方向:作者呼吁“重新对齐记忆评测与用户体验”,即新基准应在用户主动提示的条件下评整合能力。基于本文成果可延伸的方向包括:(1) 架构级干预——既然两步抽取已把事实递到嘴边仍有 77% 弃用,应研究生成前规划(memory-slot response planning)、解码时约束注入、或对整合行为做偏好优化,把“知道”转化为“说出”;(2) 分级整合度量——为 gist 级与细节级整合赋予不同信用,替代二元判断;(3) 隐式记忆时刻的检测与评测——把 1.4% 的显式率视为下限,估计真实需求频率并构建覆盖隐式时刻的扩展基准;(4) 主动召回的时机模型——8 个 mistimed 案例造成 −0.48 SD 的满意度损失,说明“何时说”比“说得多准”更值得建模,可学习用户议程状态来门控回调(Table 27 显示 grounding/appropriateness 得分高并不带来收益);(5) 把 MEMUSE 协议移植到任务型助手、教育陪伴、医疗随访等场景并跨语言复制;(6) 成本感知的记忆供给——LC-100% 的输入 token 是 Summary 的 22 倍(月增长 5.8 倍)、首 token 延迟 1.79 倍却无满意度收益,值得研究“何时不值得记”;(7) GPT-5.4 能力探针发现的 NI×长度交互($\beta=+0.570$, p=.013)提示更强模型上整合可能与实质性回复产生复利效应,值得纵向验证。

复现评估

复现评估:开源情况极好——完整部署语料(40 用户、1,872 个 session、7 条件、逐 session 满意度评分)、MEMUSE 基准(72 个去标识实例、316 问、全部 Natural Integration 判断与评分提示词)以 CC BY-NC 4.0 发布于 HuggingFace(RuiSumida/memuse),评测与分析代码以 MIT 协议发布于 GitHub(ryuichi-sumida/memuse),附录还公开了全部敏感性分析(聚合规则、留一用户交叉验证、Cook 距离、置换检验、TOST 等价)。算力门槛低:全部实验走商用 API(GPT-4.1-mini、GPT-5.4-nano、GPT-5.5、Gemini 3.1 Pro),无本地训练或微调,基准评测部分只需一个 API key 即可复跑。难度分层明显:复跑离线评测(三指标、跨模型、V1–V7 消融)容易,提示词、重建逻辑与逐实例输出全部随代码发布;复现部署研究则很难——需要 4 个月纵向招募 40 名用户(每人每月至少 1 小时、2,000 词,时薪 3,000 日元、全程约 80 美元)、IRB 批准、隐私筛查与一个月撤回窗口;且发布语料中部分原文以摘要替代,逐字复刻检测与上下文重建可能有小幅偏差。总体而言,这是一篇复现友好度很高的工作:结论的统计链路完整透明,主要门槛只在真实用户部署环节。