个性化幻象:大模型对用户画像的过度推断与自我监控失效 The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads
首个量化个性化LLM过度推断的基准,揭示自我监控信号跨模型时反向失效。
前置知识
个性化记忆系统 (Personalized Memory Systems)
让 LLM 跨会话持久保存用户信息的产品形态。典型代表是 ChatGPT Memory、Mem0、MemGPT 等。系统在对话中抽取用户属性写入结构化或半结构化记忆库,下次交互时检索并注入提示词,使回复显得“懂你”。其底层假设是模型能可靠区分“用户说过的”与“模型猜的”。
本文正是要证伪这个底层假设——证明模型会把“猜的”当成“知道的”写进记忆,从而污染整个个性化系统。
过度推断 (Over-Inference, OI)
LLM 生成超出证据支持的、关于用户个人的论断。它与经典幻觉(关于世界知识的错误事实)和社会偏见(群体层面的刻板印象)不同,介于二者之间:模型编造的是“看似个性化、实则无据”的个体属性。本文用四类标签衡量:Grounded(有据)/Reasonable(合理一步推断)/Stereotype(群体刻板)/Fabricated(纯虚构),后两类合计为过度推断。
这是论文的核心被测对象,理解它的边界(与幻觉、偏见的区别)才能理解 MirageBench 测的是什么。
LLM-as-Judge(LLM 作为评判)
用一个独立的大模型对被测模型输出进行自动打分。本文用 Claude-Opus-4-7(不在被测榜单内)对每条 claim 做四类标注,温度设为 0.0 保证可复现。为防止“裁判偏向”,论文用盲标人工在 400 条分层抽样上验证:四类一致率 89.8%(Cohen's κ=0.863),二分类 95.0%(κ=0.900),属“几乎完美”一致区间。
全文 143,616 条 claim 的结论全靠 Judge 的可靠性支撑;读懂验证协议才能判断结论的可信边界。
自我审计与元认知 (Self-Audit & Metacognition)
让模型对自己的输出做反思式检查:先完成任务,再在另一轮对话中逐条抽取 claim 并按四类标签自评。元认知指模型“知道自己知道什么”的能力。论文发现跨模型时,自我报告的 OI 与外部判定的 OI 呈负相关(Spearman ρ=-0.60),即“自我感觉最安全”的模型反而编得最多——这就是 Self-Monitoring Inversion。
这是全文最具实践价值的发现,直接决定“能不能用模型自评做安全筛选”这一系统设计决策。
可证伪性梯度 (Groundability Gradient)
论文按任务“多大程度上需要推断未观测属性”把 6 个个性化任务排成梯度:礼物推荐(可锚定到爱好的具体物品)→ 约会简介 → 周末行程 → 压力来源 → 推荐信 → 公寓描述(必须凭空想象物理空间)。这个梯度把 OI 率的变异从“模型怪癖”归因到“任务需求”。
理解这条梯度,才能解读为何公寓任务 OI 高达 57.8%、礼物任务仅 27.0%。
研究动机
当前主流个性化 LLM(ChatGPT Memory、Mem0、MemGPT 等)都共享一个未被检验的底层假设:模型能可靠地分辨“关于用户哪些是已知的、哪些是在猜”。论文用一个具体场景戳穿了这个假设——当用户只透露 3 个事实(“我是西雅图创业公司的软件工程师”“上周末去攀岩了”“我家猫 Pixel 今天打翻了咖啡”),个性化模型就会自信地生成“你住极简风公寓、喜欢自然旅行胜过城市游、可能单身、爱听独立摇滚”等毫无证据的内容。这种过度推断既不属于关于世界知识的传统幻觉,也不属于群体层面的社会偏见,而是危险的中间地带:编造的是个体级、看似个性化实则无据的属性,会被静默写进长期记忆并跨轮累积。在早期交互阶段(用户只说过 $k=3$ 条事实)这一现象既最易发生又最具后果,因为模型“刚好有足够信息被诱惑去个性化,却没有足够信息做对”。
本文的目标是本文要建立一个可大规模、可比较、可复现的测量体系来量化这种现象。具体目标有四:(1) 测出 OI 在 12 个模型、7 个家族上是否普遍存在及其严重程度;(2) 验证“让模型自查自己的输出”能否作为跨模型的安全筛选信号;(3) 沿一条“可证伪性梯度”刻画 OI 的任务依赖性;(4) 在多轮交互中追踪无据推断是否会累积且不可纠正。为支撑结论,作者还要把自动判官(Claude-Opus-4-7)与盲标人工标注对齐到 Cohen's κ=0.863(四类)/0.900(二分类)的“几乎完美”区间,最终把外部验证而非模型自报定位为可信个性化的基础。
与已有工作不同的是,已有个性化基准(LongMemEval、PersonaMem-v2、PerMa、CRAG 等)测的都是“记忆-检索-应用”这一侧——用户信息是否被正确记住、追踪、应用到任务里。MirageBench 测的是与之正交的问题:被存储/生成的信息是否忠实于用户实际透露的内容,即“生成与存储侧”的证据有效性。更独特的是,论文把 OI 从传统幻觉(世界知识)和社会偏见(群体统计)中清晰切分出来,定义了四类标签(Grounded/Reasonable/Stereotype/Fabricated),并专门设计了 Probe 与 Task 两套对照工具来证明“同一份知识在显式询问时几乎不犯错(错误率 0.7%–4.6%),在隐式生成时却大规模越界(OI 41.6%)”——这种显隐分离是已有工作从未系统测过的。
核心方法
打个比方:MirageBench 像是给个性化模型做一次“测谎”——先让它听用户讲 3 句话,再看它转述给第三方时会不会添油加醋。技术上,论文把容易被混淆的四件事拆开来分别测量:模型认为自己能推断什么(Probe)、它在真实任务中实际生成了什么(Task)、外部裁判怎么说(Judge)、记忆如何随对话轮次演化(Accum)。150 个人设 × 6 个任务 × 四类忠实度标签 × 三阶段+纵向扩展,最终对 12 个模型产出 143,616 条被判 claim。直觉是“证据越稀疏、任务越需要想象,模型越会编”,整条 pipeline 就是为了把这个直觉变成可比较的数字。
核心创新是“四仪表解耦”——用 Probe/Task/Judge/Accum 四件套把过去混为一谈的“模型表现”拆成四个正交信号。这种解耦直接暴露了全文最重要的 Self-Monitoring Inversion:在 Probe 阶段(显式问“你能推断什么”)模型错误率仅 0.7%–4.6%,但在 Task 阶段(让它真正去做个性化任务)同一个模型却被外部判官判出 42% 的 OI,二者相差 38.6 个百分点。也就是说模型“知道”自己不该这么推断,却照样做了——这是一致知识在两种情境下的非对称应用。第二个关键点是固定 $k=3$ 模拟早期交互,故意留 12 个属性不透露,任何想个性化的模型都被迫越界,使 OI 可观测;同时用 stereotypical/counter-stereotypical/neutral 三组人设分离“复制群体统计的 OI”与“毫无统计支撑的纯编造”。
方法步骤详情
七步走。(1) 构造 150 个人设(三来源混合生成),每个为 $(P, E)$:$P$ 是 15 属性真值画像、$E$ 恰好 3 条透露事实,均衡分到 stereotypical/counter/neutral 各 50,留 12 属性不透露以迫使越界。(2) Probe 直接问“能推断什么”并标 directly_stated/inferred,建显式基线。(3) Task 阶段模型仅凭 $E$ 完成 6 任务,随后同模型另一轮自审逐条标四类。(4) Judge 由独立 Claude-Opus-4-7(不在榜单)对每条 claim 标注,温度 0.0,可见 $E$、任务上下文$P$(仅标矛盾)。(5) Accum 跑 8 轮多轮对话,每轮更新结构化记忆并追踪增长与修正。(6) 400 条分层抽样盲标验证 Judge。(7) 算 $OI=(Stereotype+Fabricated)/Total$、自监 $Gap(M)=OI_{Judge}(M)-OI_{self}(M)$、跨模型 Spearman ρ、单模型 AUROC、累积率 $Acc(M)=(|M_8|-|M_1|)/7$。
技术新颖性
和 LongMemEval/PerMa/PersonaMem 这些“检索应用侧”基准相比,MirageBench 测的是“生成存储侧”的证据有效性,是正交问题。和 Hallulens/HalluDial 等幻觉基准相比,它把焦点从世界知识转向个体级编造;和社会偏见基准相比,它把焦点从群体统计转向个体特征。四类标签中 Reasonable↔Stereotype 这条最细的边界,正是 LLM 在证据不足时把个体属性和群体先验混淆的典型滑点,论文专门设计 counter-stereotypical 人设做压力测试。Probe/Task 对照用来证明“同知识非对称应用”,Accum 用 8 轮 + 结构化记忆字段捕捉“静默污染”,Self-Monitoring Inversion 则是把元认知校准不对称(strict vs lenient 自标者)首次量化为跨模型负相关——这些都是已有评估范式没有触及的角度。
实验结果
四个核心发现。(1) OI 普遍且严重:12 模型无一幸免,OI 35%–49%、跨模型均值 41.6%;Qwen3-8B 最高 48.7%、Gemini-3.1-pro 最低 35.1%,仅 24%–31% 内容有据,fabrication 均值 31.1% 远超 stereotyping 均值 10.5%——模型在“编”而非“贴标签”。(2) Self-Monitoring Inversion:跨 12 模型 Spearman ρ=-0.60;Qwen3-8B 自报 13.0% 却被判 48.7%,Kimi-K2.5 自报 58.2% 却只判 43.1%;单模型内 AUROC 0.58–0.83,适合模型内排序、不适合跨模型比安全。(3) 任务依赖:公寓 57.8% > 推荐信 48.2% > 礼物 27.0%,公寓 stereotyping 19.8%、推荐信 fabrication 40.4%;stereotypical 人设 44.8% vs counter 37.0% 全 12 模型一致。(4) 累积:GPT-5.5 18.5→125 属性(+15.2/轮)、9/12 模型 $R^2>0.90$ 线性;最快累积者 removal 仅 0.4%–5%,几乎不修正;而 Probe 阶段同批模型错误率仅 0.7%–4.6%,与 Task 落差 38.6pp。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 跨模型整体 OI 率 | Judge OI% (mean over 12 models) | 41.6%(claim 加权 41.8%) | 无(首个基准);最安全模型 Gemini-3.1-pro 35.1% | 无安全模型,全部 35%–49% |
| 自我监控与外部判定一致性 | 跨模型 Spearman ρ (Self vs Judge OI) | ρ = -0.60 (p=0.044, n=12) | 理想:ρ 趋近 +1(自评越严实际越安全) | 方向反转,自报最安全的 Qwen3-8B 实际 OI 最高 48.7% |
| 单模型内自审排序能力 | AUROC (self-audit OI% 排 above-median-Judge-OI 记录) | 0.58–0.83,9/12 模型 >0.75 | 随机 0.5 | 模型内可用、跨模型不可比 |
| 任务依赖的 OI 区间 | OI% 沿可证伪性梯度 | 礼物 27.0% — 公寓 57.8% | — | 把变异归因到任务需求而非模型怪癖 |
| Judge 与人工一致率 | Cohen's κ (400 条盲标) | 四类 0.863 / 二分类 0.900 | Landis-Koch ‘几乎完美’ 区间 ≥0.81 | 裁判可靠性达标 |
局限与改进
作者在 Appendix A 主动列出五点:(1) 单判官(Claude-Opus-4-7)+ 单人工标注者,只估了人-判一致而未报 κ 的置信区间、也未做标注者间一致;(2) 证据唯一打分原则下,任务预设性 claim(如行程任务里的“计划周末旅行”)被一律算 OI,这是相对“任务感知锚定”的上界;(3) Self-Monitoring Inversion 属探索性结论——仅 n=12 且家族相关,自助 CI [-0.90,+0.06] 包含 0;(4) Accum 只是试点,2 个人设 + “倾向保留”的记忆提示词系统性偏向累积,绝对计数仅供参考;(5) 只刻画现象与设计含义,没评测具体修复措施或对推荐质量、用户满意度的下游影响。我额外观察到:12 个模型里开源只有 Qwen3-8B 一个,且全部人设为英文/西方语境;72/150 人设由 LLM 自己生成存在循环风险;判官在 FABRICATED 上 recall 仅 0.842,比人类略宽松,可能系统性低估 fabrication;温度 0.7 生成但未做多 seed 稳定性分析。
独立分析的弱点
独立分析有六个弱点及改进方向。(1) n=12 对做跨模型相关太单薄,自助 CI 含 0——应扩到 30+ 模型并用 family-clustered 自助。(2) Accum 仅 2 个人设就下“线性累积”结论过于脆弱,且提示词强制“不删旧条目”自带偏向——应扩到 50+ 人设、用允许自由裁剪的中性提示词做对照。(3) 所有数字都押在单一判官 Claude-Opus-4-7 上——应做多判官集成(如再加 GPT、Gemini 各一)与多标注者。(4) OI Rate 把“温和的群体刻板”和“有害编造”等权求和,掩盖严重度差异——应引入 severity-weighted 指标(如对涉及健康/财务/身份敏感属性的 fabrication 加权)。(5) 没评测下游影响:高 OI 是否真的降低推荐质量或引发用户不适——应补一个真实用户使用研究。(6) 生成温度 0.7 但单次采样,没量化随机性——应在多 seed 上报均值与方差。每条都指向把这篇“现象刻画”升级为“机制+干预”的下一步。
未来方向
作者明确提出:跨判官稳健性检验、增加标注者、为 Accum 设计允许自由裁剪的中性提示词、评测具体缓解措施(provenance 追踪、写入时过滤、temporal-validity 检查)以及对推荐质量与用户满意的下游影响。基于成果可延伸的方向:把人设扩展到非英语文化与不同社会语境(刻板基线随文化变化),研究 OI 与检索质量在完整 RAG-记忆栈中的耦合,为每个模型开发校准过的自审阈值而非跨模型比较,探究通过指令微调或显式 CoT 推理能否压低 Task 阶段的 OI,并把 Self-Monitoring Inversion 与机制可解释性结合——寻找那条“编造电路”,看它为何在 Task 激活在 Probe 沉默。
复现评估
作者承诺完整开源 MirageBench。复现材料齐备:150 个人设来源清楚(8 手工 + 70 PersonaMem-v2 + 72 LLM 生成,生成提示词见 Appendix G.8);6 个任务、Probe、Task、Judge、Accum、自我审计的全部提示词逐字附在 Appendix G;模型 API 快照在 Table 9 冻结到日期;算力门槛低——闭源走 HTTPS API(CPU 工作站即可),唯一自托管 Qwen3-8B 用 2×NVIDIA H20 96GB 经 vLLM 提供。主要成本是 143,616 条 claim 的 API 调用,估算几百美元量级。复现难度中低,主要门槛是要同时拿到 12 个模型(含 GPT-5.5、Claude-Opus-4-6、Gemini-3.1-pro 等前沿 API)并复刻 400 条盲标人工验证;判官本身可复现(快照固定)。整体属于“提示词给全、snapshots 锁定”的高可复现工作。
论文图表
左侧展示喂给模型的 3 条透露事实(软件工程师、上周末攀岩、猫 Pixel 打翻咖啡),右侧是模型在约会简介任务中生成的输出,其中多条 claim(loves rock climbing、has a cat named Pixel、looking for an adventure partner 等)毫无证据支撑,用颜色标出 Grounded/Reasonable/Stereotype/Fabricated。
用一张图直观定义了“过度推断”现象本身——读者扫一眼就能理解论文在测什么、为什么这是问题,是全文最有效的动机图。