大模型智能体经历生活事件后的人格演化分析与 BFI-Adapt 基准测试 Do AI Personas Grow? Analyzing and Benchmarking Personality Evolution in LLM Agents After Life Events
用大五人格量表测量大模型智能体经历生活事件后的人格变化,构建 BFI-Adapt 基准。
前置知识
大五人格模型(Big Five)
人格心理学最广泛使用的人格结构,将人格分为五个维度:外向性(E)、宜人性(A)、尽责性(C)、神经质(N,对应情绪稳定性的反面)、开放性(O)。每个维度是连续量表,常用 1–5 的 Likert 分数表示。本文用 E/A/C/N/O 作为衡量智能体人格的统一坐标。
整篇论文的测量、对照和分析都建立在大五人格之上,不理解五维度的含义就无法理解作者如何定义「方向正确」和「幅度合理」。
BFI-44 人格量表
由 44 个条目组成的大五人格自陈量表(John et al., 2008),每个条目用 1–5 打分,部分条目反向计分。五个维度的条目数分别为 E 8 题、A 9 题、C 9 题、N 8 题、O 10 题,因此维度级的步长(最小变化单位)分别约为 0.125、0.111、0.111、0.125、0.1。本文用它在事件前后各施测一次,得到人格分数向量 $b$ 和 $p$,再计算变化 $\Delta_t = p_t - b_t$。
BFI-44 是把智能体的「文本行为」转化为可比数值的核心锚点,论文的所有统计量($\kappa$、DCR、匹配率、BFI-Adapt)都建立在它的条目级评分之上。
人格条件化 LLM 智能体(PC-Agent)
通过系统提示词给大模型注入性别、文化区域和隐式人格描述,使其「扮演角色」回答后续问题的一类智能体。广泛用于情感陪伴、心理健康支持、社会模拟、角色扮演与交互式叙事。本文要求它在长时间交互中保持人格连贯,并像人类那样随生活事件发生合理的人格变化。
这是论文的评估对象;理解它的设计(特别是用隐式人格描述而非直接标注五维度)才能看懂为何要控制 persona 来测量「变化」。
纵向研究与效应量 $d$
人类人格心理学用纵向面板研究追踪同一批人在多年间、经历重大事件后的人格变化,并用标准化均差(Cohen's $d$)报告效应大小。本文把这些研究(如 Specht 2017、Bühler 2024、Roberts 2006)整理成「事件–特质」方向先验表,并用代表性效应量区间 $|d| \in [0.05, 0.20]$、人格标准差 $\sigma \approx 0.7$ 推出原始分参考区间 $\Delta \in [0.035, 0.14]$ Likert 单位。
论文判定智能体变化「方向是否正确、幅度是否合理」的外部参照完全来自人类纵向证据,这是把 LLM 行为与心理学对接的关键。
加权 Cohen's $\kappa$ 与 DCR
线性加权 $\kappa$ 衡量前后两次评分在条目级的一致程度,取值 $[-1,1]$,$\kappa=1$ 完全一致、$\kappa=0$ 等于随机。DCR(方向一致性比率)统计事件后变化条目中单向移动的比例,$\mathrm{DCR}=\max(n_\uparrow,n_\downarrow)/(n_\uparrow+n_\downarrow)\in[0.5,1]$,越接近 1 说明变化越系统。两者在事件–特质对层面配对计算,避免相反方向互相抵消。
$\kappa$ 回答「测量是否稳定可靠」,DCR 回答「变化是否系统一致」,二者共同构成 BFI-Adapt 复合指标的核心组件,是理解基准排名的基础。
重测信度与匹配率(match rate)
重测信度指同一对象在无干预条件下两次施测的差异,代表测量噪声底;本文用无事件重测为每个模型设定 $|\Delta|$ 的噪声地板。匹配率定义为在非中性变化中、移动方向与人类期望方向一致的条件概率 $P_\text{match}(e,t)=|\{p:d=d_\text{human}\}|/|\{p:d\neq 0\}|$,用单尾二项符号检验对照 0.5 的随机基线,并做 Benjamini–Hochberg FDR 校正。
匹配率是判断智能体「是否朝人类方向走」的直接指标,重测信度则是判断「变化是否真超出噪声」的前提,二者支撑了 RQ1 与 RQ2 的核心结论。
研究动机
人格条件化 LLM 智能体(PC-Agent)已被广泛用于情感陪伴与心理健康对话、社会行为模拟、长程角色扮演与交互式叙事等场景,例如 AnnaAgent 在心理咨询中把演化的情绪与认知状态和持久记忆耦合在一起。这类应用要求智能体在跨多次会话、长时间跨度和开放式用户驱动剧情中保持人格连贯。然而在人类心理学中,人格虽然是持久特质,却会因生活事件而改变:入职与升职伴随尽责性(C)上升,慢性病与失业伴随神经质(N)上升,退休则伴随 C 显著下降。一个忽视这种动态的 PC-Agent 会「局部一致、整体失真」,长期看就像「套着人名的静态脚本」。已有的并发工作(Bodroža 等 2024、Yu 等的 PTCBench)虽然证明 LLM 人格会随时间或情境扰动而漂移,但对于这些漂移如何在不同特质、不同事件、不同 persona、不同模型之间分化,几乎一无所知。
本文的目标是本文要建立一个系统、可复现、且与人类心理学证据对接的诊断框架,回答四个层层递进的研究问题:RQ1 存在性——经历生活事件后 persona 是否会离开 BFI 子量表噪声地板;RQ2 方向与幅度——当它移动时是否与人类记录的方向一致、幅度是否落在人类效应量区间内;RQ3 人口学形态——变化是否随性别与文化区域呈现人类研究中的调节结构;RQ4 个体形态——同一事件–特质对内不同 persona 是否像人类那样有足够的个体差异。基于这套诊断,作者还希望产出一个可复用的基准 BFI-Adapt,对市面主流模型在「事件诱导人格变化是否忠实于人类方向」这一维度上排序。
与已有工作不同的是,本文的切入角度与已有工作有三点本质不同。第一,已有工作多把人格当作固定剖面或只在聚合均值上测变化,但系统化与个体化移动会在均值中互相抵消,因此作者把分析下沉到事件–特质对层面,并引入条目级信度与方向一致性。第二,方向与幅度必须对照外部心理学参照才有意义,因此作者为每个事件–特质对锚定一个来自元分析与原始研究的期望方向(如退休后 C 下降),并用效应量区间 $|d|\in[0.05,0.20]$ 校准幅度。第三,persona 异质性本身就是被测现象,因此作者用 100 个受人口学控制的 persona(2 性别×5 文化区域×10 人格原型)来同时检验人口学调节与个体离散度。
核心方法
整体思路是「用人类纵向心理学做标尺,给 LLM 智能体做人格变化的前后测量」。技术路线分三步:先构造受控 persona 群体,再让每个 persona 经历一次结构化的生活事件反思流程,最后用 BFI-44 在事件前后各施测一次得到轨迹 $\Delta_t=p_t-b_t$。作者在 $2\times5\times10=100$ 个 persona、11 个生活事件、11 个主流大模型上跑完整个网格(约 12,100 条事件条件轨迹,每模型产出 48,400 对条目评分)。测量信号再用四类互补的稳健性检验(无事件重测、独立释义、情境决策、延迟重测)背书,最终把结果凝练成 BFI-Adapt 复合指标并扩展到 14 个模型排序。
核心创新是把 PC-Agent 人格演化重新定义为「针对人类先验的四轴诊断」,而不是简单地报告聚合均值变化。具体体现在三点:其一,在 persona 层面做方向分类($\Delta>\varepsilon$ 为 +、$\Delta<-\varepsilon$ 为 −、$|\Delta|\le\varepsilon$ 为 0,$\varepsilon=0.1$),并定义条件匹配率 $P_\text{match}$,因为正负相反的个体移动在均值里会互相抵消;其二,在事件–特质对层面计算 $\kappa$ 与 DCR,刻意避免把期望方向相反的对放在一起聚合产生伪信号(论文专门用 pooled 形式做对照来揭示这种聚合伪迹);其三,把可靠测量($\kappa$)、系统移动($S_{e,t}=2\,\mathrm{DCR}_{e,t}-1$)与方向契合(指示函数 $\mathbb{1}^\text{dir}_{e,t}$)三者相乘,得到 BFI-Adapt 复合分。
方法步骤详情
完整流程分四阶段。阶段一 Baseline:系统提示词给出性别、文化区域与隐式人格描述(不出现大五标签),模型以角色身份作答 BFI-44 得基线分向量 $b$。阶段二 Event Presentation:插入第一人称生活事件叙事,引导 persona 反思。阶段三 Post-Event:再次施测 BFI-44 得 $p$。阶段四 Change:计算 $\Delta_t=p_t-b_t$,并用 $\varepsilon=0.1$ 做方向分类(+/−/0)。匹配率在非中性 persona 上对照人类方向,用单尾二项符号检验、Wilson 95% CI 与 Benjamini–Hochberg FDR($\alpha=q=0.05$)做统计检验;人口学比较用 Fisher 精确检验。条目级用线性加权 $\kappa$ 与 DCR 在事件–特质对层面配对计算。最后用四类验证背书:无事件重测设噪声地板、独立释义测结构稳定性、情境决策测跨格式收敛、三次无关对话后延迟重测测短期保留。完整网格在 11 个 API 模型上运行,BFI-Adapt 排行榜扩展到 14 个模型。
技术新颖性
技术新颖性主要体现在三处。第一,方向先验矩阵把分散在多篇人类纵向研究中的「事件–特质」方向浓缩成统一参照表,使 LLM 人格变化首次能在事件维度上做心理学对齐评估,而不是泛泛地说「人格变了」。第二,对层面的 $\kappa$–DCR 二元诊断直接揭示「测量可靠但方向系统化不足」「测量可靠且方向系统化」等不同失效模式,并用 pooled 对照证明跨对聚合会重排 11 个模型中的 9 个——这是方法学上的重要警示。第三,BFI-Adapt 复合分把「测得稳、移得系统、方向对」三者乘在一起,避免单看某一维度会高估或低估模型,成为可复用、可扩展(支持新增模型)的基准。
实验结果
作者沿四个研究问题逐项诊断。RQ1 存在性:605 个组合中人格移动普遍但不区分方向——有/无定方向先验的两组对移动率中位跨模型为 0.44–0.84 与 0.42–0.82,模型内差异不足 0.05,条目级 $\kappa$ 跨模型 0.58–0.86,仅 MiMo-V2.5-Pro(0.58)离群。RQ2 方向与幅度:方向契合 DC% 仅 48.1%–70.4%,幅度更差——只有 11.0%–16.4% 落入人类效应量区间,其余多为反转(20.8%–40.2%)、欠移或过冲;27 个定方向对 14 匹配、13 反转,退休被所有模型反转(中位仅 11.5% 正确),宜人性倾向事件后「默认变好」。RQ3 人口学:跨性别与区域的 SD 中位仅 0.044,93.2% 组合低于 0.10,Fisher 检验无一通过校正,人口学调节缺失。RQ4 个体:persona 离散度 $\sigma$ 中心仅 0.19,99.8% 低于人类 0.5 下界,相对人类 0.5–0.8 区间被压缩 3–4 倍,不同 persona 被塌缩到同一条平均轨迹。结论:当前模型只模拟了人类人格动力学的均值而非形态。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 事件诱导人格变化的复合评估(BFI-Adapt) | BFI-Adapt 复合分 | Gemini-3-flash 0.348(榜首) | MiMo-V2.5-Pro 0.071(榜末 API 模型) | 11 个 API 模型整体跨度 4.9 倍;开源扩展中 InternLM3-8B 仅 0.044,全场跨度 7.9 倍 |
| 幅度校准(投影到人类期望方向后的 $e\Delta$ 分箱) | 落入人类参考区间 $[0.035,0.14]$ 的比例 | 11.0%–16.4% 落入区间,最佳为 Gemini-3-flash 16.4% | 理想模型应使该比例接近 1.0 | 其余为反转(20.8%–40.2%)、欠移(15.1%–54.0%)、过冲(9.9%–31.6%),整体幅度严重失配 |
| 测量噪声地板与事件信号分离 | 事件+反思条件 $|\Delta|$ 相对无事件重测 $|\Delta|$ 的倍数 | 1.6×–9.0×(8 个验证模型,bootstrap 95% CI 全部大于 0) | 无事件重测基线 0.025–0.080 | InternLM3-8B(0.028→0.237,约 8.5×)与 Qwen2.5-14B(0.025→0.228,约 9.1×)分离最强 |
| 提示词释义下的结构稳定性 | 原始与独立释义事件在 55 个事件–特质格上的符号一致率 | 80.0%–92.7%,Spearman 0.825–0.956 | 随机基线约 50% | Qwen3.5-9B 达 92.7%、DeepSeek-V4-Pro 与 Qwen2.5-14B 达 91%,事件–特质结构在改写后高度稳定 |
| 情境决策与 BFI 变化的跨格式收敛 | persona–事件–特质 Spearman $\rho$ | $\rho=0.003$–0.105,方向一致率 48.4%–62.7% | 随机基线 0 | 仅 DeepSeek-V4-Pro(0.105)、Mistral-Large-3(0.097)、Qwen2.5-14B(0.060)bootstrap CI 显著大于 0,跨格式收敛弱且高度模型相关 |
局限与改进
作者承认的主要局限有三:其一,前后测设计只能捕捉「即时人格响应」,无法刻画人类纵向研究中「急性期到适应」的完整轨迹(Luhmann 等 2012),三次无关对话的延迟测量仍远远够不上人类面板的多年尺度,因此智能体能否复现重大事件后生活满意度的回升仍是开放问题。其二,期望方向表几乎逐字沿用 Specht (2017),并将其不确定或情境依赖的对(如 Job Change)排除在打分之外;人类 $\sigma$ 与效应量区间本身只是粗粒度的元分析范围(Bühler 2024、Bleidorn 2018)。其三,所有模型均使用非推理模式,未探究推理模式是否改善幅度校准。我自己的观察还包括:仅 11.0%–16.4% 落入人类区间这一数字相当低,说明即便方向正确,幅度也系统性偏移;所有模型对退休普遍反转,提示预训练语料可能缺乏退休→尽责性下降的强先验;只使用 BFI-44 单一量表,未与 NEO-FFI 等交叉验证;人类先验与 11 个事件主要源自西方纵向研究,跨文化代表性有限。
独立分析的弱点
第一,persona 异质性塌缩是最大弱点:$\sigma_\text{LLM}$ 中位 0.19,相对人类 $0.5$–$0.8$ 被压缩 3–4 倍,意味着模型把不同 persona 拉回同一条平均轨迹。改进方向是为每个 persona 维护个性化的事件记忆与情感状态,并在解码端引入 persona 条件化的轨迹噪声或受控随机性,人为恢复个体差异。第二,退休等事件被全员反转,说明模型没有编码事件特有的纵向先验,可通过对齐人类纵向摘要或检索增强把「退休→C↓」「失业→N↑」等先验注入。第三,宜人性存在「默认变好」偏置(30%–58%),应通过反事实训练或负样本事件抑制这种利他漂移。第四,人口学完全无效(性别/区域 Fisher 检验无一通过 BH 校正),可显式地把人口学作为条件变量纳入事件反思提示或微调目标。第五,幅度系统性失配(仅约 11%–16% 落入区间),可把效应量 $|d|$ 作为回归目标做轻量校准。
未来方向
作者明确提出的方向包括:发展多步引发协议来刻画「急性期→适应」乃至生活满意度回升的完整轨迹;用更密的逐对效应–方向矩阵替代逐字沿用 Specht (2017) 的先验表,以收紧 DC% 但不改变「全员反转退休趋势」的核心结论。基于本文成果可延伸的方向有:第一,把情境决策的跨格式收敛($\rho$ 仅 0.003–0.105)单独列为一个评估维度,研究 BFI 自陈与情境化行为之间的鸿沟;第二,从单事件转向多事件叠加、长程叙事下的累积人格漂移与回弹建模;第三,在推理模式、角色扮演微调模型、多模态智能体上扩展 BFI-Adapt,检验更复杂推理是否能改善幅度与个体差异;第四,结合持久记忆系统(如 AnnaAgent 的 counselling 场景)做「事件–记忆–人格」的闭环纵向评估。
复现评估
复现性总体较好。作者在 https://github.com/sci-m-wang/BFI-Adapt 公开了 persona 集合、事件情景、打分代码与每个模型的日志,附录 B、C 给出了完整的系统提示词与人格描述样例,并报告了响应完整性检查(附录 F)。实验设计完全确定:100 个 persona × 11 个事件 × 44 个条目,每模型 48,400 对评分,统计流程($\varepsilon=0.1$、Wilson CI、BH-FDR、Fisher 检验、bootstrap)在正文与附录 E、G 中写明。主要成本在于 14 个模型的 API 调用与可选的延迟/释义/情境决策验证网格,对中等规模实验室而言 API 费用可观但可行,开源模型部分(Qwen3.5-9B、Qwen2.5-14B、InternLM3-8B)可在单机或小集群上跑通。需要注意的复现风险是所有模型都锁定非推理模式,且模型版本随时间漂移,严格复现需固定具体 API 快照与温度等采样参数。
论文图表
该总览图把整篇论文的方法链路画成五列:人类纵向心理学定义的事件–特质方向先验、100 个受控 persona 与 11 个模型、四阶段事件条件化测量流水线、四轴诊断(存在性/方向与幅度/人口学形态/个体形态),以及最终的发现与 BFI-Adapt 基准。图中还标注了关键数字:11 个生活事件、100 个 persona、约 12,100 条事件条件轨迹、中位 $\sigma_\text{LLM}=0.19$、人类 $\sigma\in[0.5,0.8]$、$|d|\in[0.05,0.20]$、Pearson $r(\kappa,\mathrm{DCR})=+0.226$ 等。
这是理解全篇的导航图,把分散在多节里的设计、测量、诊断与基准一次串起来,看完它能迅速把握「为什么测、怎么测、测完怎么评判」的整体逻辑。
附录中的小提琴图展示每个模型在全部事件–特质对上 persona 级变化标准差 $\sigma_\text{LLM}$ 的分布,并叠加人类 $0.5$–$0.8$ 的离散区间作为参照。分布中心约 0.19,几乎所有点都远低于 0.5 下界;模型间从 Claude-Sonnet-4.6 的 0.138 到 MiMo-V2.5-Pro 的 0.361 不等。
这张图最直观地展现了 RQ4 的核心结论——persona 异质性塌缩,是判断「智能体只模拟均值不模拟形态」的视觉化关键证据,也是改进方向(恢复个体差异)的直接动机。