MatrAIx:用83亿人格智能体模拟世界的评测基础设施 MatrAIx: Simulating the World with 8.3 Billion Persona Agents
构建83亿人格库与四大模拟环境,用模拟用户端到端评测AI产品
前置知识
人格智能体(Persona Agent)
把一条结构化人格档案(在 1,290 个类别维度上的一组取值,如年龄、地区、风险偏好)与一个大语言模型绑定,让模型以该档案为条件来回答和行动,从而扮演一名具有特定背景的模拟用户。同一份档案换不同的驱动模型,就得到不同的人格智能体实例。
全文的'被试'就是人格智能体,理解档案如何条件化模型行为,是读懂人格采样、行为遵循率与抽取质量验证这些实验的前提。
有向无环图(DAG)采样
把每个属性视为节点、属性间的条件依赖视为有向边,联合分布分解为各节点在父节点条件下的乘积 $p_\theta(x)=\prod_i p_\theta(x_i \mid x_{\mathrm{Pa}(i)})$,再按拓扑序逐维采样,即可生成保留属性相关性的个体,避免独立采样产生逻辑矛盾的组合。
Persona 8B 的合成人格生成正是 DAG 前向采样,论文的核心公式、边恢复流程与'年级-教育、地区-语言'等依赖示例都建立在这个概念上。
Cramér's V
衡量两个分类变量之间关联强度的统计量,取值范围 0 到 1:0 表示相互独立,越接近 1 关联越强。它是对卡方统计量做归一化后的结果,不会随样本量增大而虚高,可以理解为分类数据版本的相关系数。
论文用 Cramér's V 量化人格属性(如信任水平)与试验结果的关联强度,OpenBB 任务中 $V=0.228$ 到 $0.363$ 是应用级一致性的核心证据。
Benjamini–Hochberg 校正
多重假设检验中控制错误发现率(FDR)的方法:把所有 p 值从小到大排序,与递增阈值 $i q / m$ 逐一比较,保证被判显著的结果中假阳性比例的期望不超过设定水平 $q$。相比 Bonferroni 校正它更有统计功效。
论文对 8 项主要结果统一做 BH 校正后报告 q 值;膳食规划案例中最好的 $q=0.51$,意味着子群差异校正后不显著,只能作描述性结论。
计算机使用代理(CUA)
能像人一样用鼠标点击、键盘输入、触屏滑动来操作图形界面的智能体:可以驱动浏览器完成网页浏览与表单提交,也可以在 Docker 化 Linux 桌面、远程 macOS 或 iOS 模拟器中操作原生应用,通常借助截图与界面元素树来感知屏幕。
MatrAIx 的 Web 与 App 两类评估环境靠 CUA 扮演真实用户去操作产品,是四种环境中交互最复杂、成本最高(App 任务每模型只用 20-24 人格)的两类。
研究动机
对 AI 系统和数字产品做人工评估昂贵且缓慢,招募、排期和数据收集动辄数周,难以支撑开发过程中频繁的评估需求。离线基准虽然可扩展、可复现,但通常只测任务结果,完全抽象掉了用户的多样性与交互行为。例如编码智能体基准只看轨迹能否通过单元测试,却无法体现新手用户想要解释、小步修改和频繁确认,而专家用户偏好简短回复、大范围重构和更高自主权;有些用户给出详细规格并检查每次改动,有些用户目标模糊却期待智能体主动提问澄清。这些差异决定了交互轨迹、对结果的信任以及失败后是否继续使用。聚合分数还会掩盖特定用户群体遇到的问题——同一系统对不同人群的体验可能天差地别。这不仅限于 AI 系统,任何结果取决于用户如何交互的数字产品都有同样的盲区。
本文的目标是本文的目标是构建一个人口级规模的模拟用户评估基础设施 MatrAIx,用异构的模拟用户测试 AI 系统与数字产品,把'从采样目标人群、运行交互任务到分析结果'做成一条可重复的端到端流水线。具体由三个组件支撑:其一,Persona 8B 人格数据集,在 1,290 个类别维度的共享模式下表示 83 亿条人格记录,并发布约 100 万条的质量过滤核心集(599,847 条人类来源加 400,000 条合成记录,合计 999,847 条);其二,MatrAIx Playground,提供 Survey、AI Chatbot、Web、App 四种环境让多样的模拟用户评估并与产品交互;其三,MatrAIx Applications 任务库,含覆盖 25 余个领域的 1,010 个可复用任务。论文同时回答三个问题:人格总体是否保留合理的分布与依赖、智能体是否在言行上遵循所分配的人格、模拟用户研究能否揭示跨系统/模型/用户群的一致差异。
与已有工作不同的是,已有工作要么专注构造人格数据集(众包撰写或大规模生成),要么把人格当作自由文本的对话条件,要么把智能体当作被测系统跑智能体基准;没有人覆盖'人群查询、人格智能体执行、任务级校验、人口级报告'的完整评估流程。MatrAIx 的独特切入在于三点结合:借用合成人口建模思想(保留边际分布、交叉属性依赖与结构约束),用依赖图采样生成合成记录,避免独立采样产生'年龄段-教育''地区-语言'自相矛盾的档案;用 LLM 受约束抽取把维基百科传记、亚马逊评论历史等六类人类来源映射进同一模式,未支持的维度保持 null;再把固定的人格群体当作'被试'去评测固定的目标系统——与生成式智能体一脉相承,但被测对象可以是网站、应用、问卷等任意数字产品,且在声明的抽样设计下只变动模拟用户群体。
核心方法
MatrAIx 由三大组件串成端到端流水线。直觉是:与其雇真实用户做昂贵的人工研究,不如先建一个结构化、可查询的‘虚拟人口’,按目标受众采样出评估队列,让每个人格由 LLM 驱动,在受控环境中完成问卷、与聊天机器人对话、浏览网站或操作原生应用,再由程序化校验器和人工/LLM 裁判把行为转成结构化结论并聚合报告。技术上,Persona 8B 用 $d=1290$ 个类别维度构成模式 $\mathcal{D}=\{X_1,\dots,X_d\}$,合成人格通过依赖图 $G=(\mathcal{D},E)$ 按拓扑序逐维采样,联合分布分解为 $p_\theta(x)=\prod_{i=1}^{d} p_\theta(x_i \mid x_{\mathrm{Pa}(i)})$。每次试验表示为 $\tau=\langle \pi,\theta,\alpha,\mu,\sigma\rangle$:人格 $\pi$ 通过接口 $\alpha$、用模型 $\mu$ 和种子 $\sigma$ 执行任务 $\theta$,产出工件束 $A=\alpha(\pi,\theta;\mu)$,任务自有校验器将其映射为类型化结论 $V_\theta(A)$。试验间无共享状态,天然可并行。
核心创新是把'依赖感知的概率采样'与'硬性兼容约束'显式分离,并让人类来源记录与合成记录共用同一坐标系。对非根维度 $X_i$,候选值 $v$ 按下式打分:$p_\theta(X_i=v \mid x_{\mathrm{Pa}(i)}) \propto \pi_i(v)\, r_i(v; x_{\mathrm{Pa}(i)})\, m_i(v; x_{\mathrm{Pa}(i)})$,其中 $\pi_i(v)$ 是该值的人口级先验,$r_i$ 是来源知情的似然比调整(如主语言为英语、地区为北美时提高 Native 档概率),$m_i \in \{0,1\}$ 是兼容性掩码:主语言为英语的人英语水平不能为 None,该候选被直接置零剔除;而 Basic 这类少见但可能的取值仍然保留。这明确区分了'统计上少见'与'逻辑上矛盾',既执行硬约束又不抹掉稀有但有效的档案,是它与独立采样和自由文本人格卡 conditioning 的本质区别。人类来源记录只保留有证据支持的维度、其余为 null,并去除姓名等直接标识符以保护隐私,与合成记录在同一模式上互补。
方法步骤详情
第一步,模式设计:把背景(238 维)、心理(210 维)、能力(331 维)、行为与交互(124 维)、生活方式(387 维)共 1,290 维组织成三层分类,先验来自联合国人口展望、世界银行、ILOSTAT、Stack Overflow 开发者调查等。第二步,构建依赖 DAG:仅当来源直接报告条件关系才加边,如教育水平以年龄段为条件、英语水平以主语言和地区为条件。第三步,合成采样:按拓扑序 $\tau=(\tau_1,\dots,\tau_d)$ 逐维前向采样,根维度取先验 $\pi_i(v)$,下游维度取归一化局部 CPD。第四步,人类来源抽取:Wikipedia(323,438 条)、Amazon Reviews(97,915 条)、PRISM(1,487 条)用 LLM 受约束抽取,Stack Overflow(113,120 条)与 GSS(63,532 条)用确定性映射,加 355 份志愿者问卷,去标识化后共 599,847 条。第五步,质量控制:矛盾检查、精确哈希与 MinHash 去重,合成记录按 14 个高信息属性去重。第六步,校准发布:使核心集在年龄段、地区、性别、城乡四个边际上逼近公开人口统计,得 999,847 条。第七步,运行评估:Playground 记录运行清单,并行执行试验,校验器产出类型化结论并按任务/队列/子群聚合,支持固定任务版本改队列重跑。
技术新颖性
技术新颖性体现在四个层面。其一,规模与表示:83 亿记录加 1,290 维类型化模式在公开资源中前所未有,类型化模式让缺失值、矛盾、人群查询和抽样决策都可检查,优于自由文本人格。其二,采样方法:来源知情的调整 $r_i$ 与二值兼容掩码 $m_i$ 相乘的评分设计,在保持稀有但有效档案的同时执行硬约束,把依赖建模从'拟合边际'推进到'拟合条件结构'。其三,基础设施设计:Survey、AI Chatbot、Web、App 四种环境统一在同一基础设施下,试验无共享状态因而可本地或经 HTTP 远程 worker 水平扩展,运行清单记录人格池、抽样过程、任务版本、智能体与模型,保证可重复。其四,评估学设计:把人格保真度、产品结果与执行失败分成不同类型化结论,把驱动人格智能体的模型作为评估配置强制报告(引用了 Santurkar 等 2023、Yoon 等 2024 等关于模型间意见差异的证据),并明确'任务成功'不等于'人类效度',避免了以往模拟用户工作把流畅回答当作人类行为证据的陷阱。
实验结果
论文在 8 个代表性任务(每种环境 2 个)上完成 18,189 次试验,人格智能体由 Claude Opus 4.8、GPT 5.5、Claude Haiku 4.5 驱动,Survey/Chatbot/Web 每模型约 1,000 人格,两个 App 任务因原生交互昂贵只用 24 和 20 人格,分析以真实完成数为分母并对 8 项主要结果做 BH 校正。受控行为遵循:10 个行为属性 × 4 环境 × 每臂 5 人格共 400 次试验,366 次(91.5%)正确表达或抑制声明行为;按环境分 Survey 96%、Web 95%、Chat 92%、OS-App 83%;40 个属性×环境单元格中 33 个双臂达至少 4/5,cog-politeness 在 App 仅 5/10 是明显短板。应用级一致性:OpenBB 任务中信任水平在三个模型下都稳定划分子群(Cramér's $V=0.228$–$0.363$,全部 $q<10^{-8}$),且三模型对四个信任组排序完全一致。抽取质量:双 LLM 裁判评 1,000 条抽取人格,89.1% 配对分数相差不到 1 分;6 名人类评 100 条来源匹配子集,均值 4.135/5,GPT 5.5 与 Opus 4.8 分别在 79.2% 和 93.8% 的比较中与人类均值差小于 1 分。膳食规划案例:平均 7.1 轮对话(SD=1.8),空巢者遵循意愿 66% 高于转行者 46%,但校正后 $q=0.51$ 不显著,属描述性发现。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 受控行为遵循(10 属性 × 4 环境 × 每臂 5 人格) | 正确表达/正确抑制声明行为的试验比例 | 366/400(91.5%);Survey 96%、Web 95%、Chat 92%、OS-App 83% | 无直接基线,为该基础设施的首个受控验证;40 个单元格中 33 个双臂达 4/5 以上 | 证明人格条件在跨模型、跨环境下稳定生效,仅 App 环境明显偏弱(6/10 属性达 strong) |
| OpenBB 金融应用子群一致性 | 信任水平与结果的 Cramér's V 及 BH 校正后 q 值 | 三个模型均为 $V=0.228$–$0.363$,全部 $q<10^{-8}$,四个信任组排序完全一致 | 八项主要结果经 Benjamini–Hochberg 校正控制错误发现率 | 首次展示该基础设施能在三个不同驱动模型下恢复一致的子群模式 |
| 人类来源人格抽取质量(100 条来源匹配子集人工评分) | 5 分制平均质量分及 LLM 裁判与人类的一致率 | 人类均值 4.135/5;GPT 5.5 裁判 79.2%、Claude Opus 4.8 裁判 93.8% 的比较与人类差小于 1 分 | 双 LLM 裁判评 1,000 条抽取人格,89.1% 配对分数相差不到 1 分 | LLM 裁判接近人类评分水平,支持大规模抽取质量的自动化评估 |
| 膳食规划 Chatbot 案例(固定 GPT-4o mini 助手) | 平均对话轮数与子群遵循率差异 | 平均 7.1 轮(SD=1.8);空巢者 66% vs 转行者 46%(选模态遵循回答的比例) | BH 校正后最佳 $q=0.51$,无显著人格效应 | 示范从任务规范到可执行研究的完整链路,并示范'描述性而非确认性'结论的报告方式 |
局限与改进
作者承认的局限包括:人格效应高度依赖驱动智能体的模型,同一任务不同模型可能给出不同结论,因此重要发现应跨模型复核;膳食规划研究中多数人格维度与结果的关联在 BH 校正后不显著(最佳 $q=0.51$),子群差异只能作描述性解读;App 环境遵循率最低(83%,10 个属性中仅 6 个达 strong),且 App/Web 任务极少(分别 6 和 12 个),四种环境覆盖严重不均;1M 核心集只对年龄段、地区、性别、城乡四个边际做尽力校准,并非 1,290 维上的代表性联合覆盖,人类来源本身也不具人口代表性;合成记录仍反映模型先验与设计选择。我的补充观察:论文验证的是'人格是否被表达'而非'模拟用户与真实用户行为的一致性',sim-to-real 效度并未建立,结论段也承认在用于真实人群前仍需人类研究;来源语料(维基百科、亚马逊评论)偏向显著人物和活跃消费者,英语中心明显;LLM 裁判虽有 89.1% 的一致率,但未做与人类评分的全量校准,系统性偏差风险仍在。
独立分析的弱点
第一,验证广度与统计效力之间有落差:18,189 次试验只覆盖 8 个任务,App 任务仅 6 个且每模型只用 20–24 人格,对小组差异的检验功效不足,膳食规划案例中几乎没有效应存活校正就是例证;改进方向是扩充 App/Web 任务库并为标准任务预设最小样本量与功效分析。第二,人格无记忆、无社会性:每个试验相互独立,无法模拟口碑传播、群体决策或跨会话的用户生命周期,而这恰是真实产品体验的重要维度;可引入持久用户状态与纵向设计。第三,真实世界校验缺位:论文没有与真实 A/B 测试或用户研究结论的对照,91.5% 的遵循率只说明人格被表达,不说明模拟试验能预测真实用户行为;应开展与线上实验的平行校准研究并报告排序可靠性。第四,偏差与公平风险:从维基百科和评论抽取会放大名人、重度用户的形象,模型先验可能强化刻板印象(论文自身引用了'模型放大刻板印象'的文献),需要偏差审计与去偏采样策略。第五,全流程绑定前沿闭源模型(Opus 4.8、GPT 5.5、Haiku 4.5),成本高且结果难在其他栈复现;建议补充开源模型的敏感性分析以评估结论对驱动模型的稳健性。
未来方向
作者在结论中提出 MatrAIx 适用于部署前筛查、子群分析、压力测试和产品版本比较,并强调重要发现应跨人格智能体模型复核、追溯到底层交互轨迹,在推广到真实人群或重大决策前仍需人类研究。基于这些成果可延伸的方向包括:其一,sim-to-real 校准,把模拟试验结果与真实产品 A/B 测试对齐,量化模拟器对系统排序的可靠性;其二,扩展多语言、多地区人群以缓解英文中心偏差,并补齐 1,290 维上的联合代表性;其三,为 Web/App 环境扩充任务,并引入多智能体社会模拟(口碑扩散、群体意见形成);其四,利用已有 DAG 结构做因果设计,区分'人格与结果相关'与'人格导致结果';其五,对去标识化人格记录做重识别风险评估,建立隐私纵深防线;其六,发展人格保真度与模拟器排序可靠性的标准化基准,让不同模拟用户平台可以横向比较。
复现评估
复现基础较好但有边界。公开资产:1M 核心集(999,847 条 = 599,847 条人类来源 + 400,000 条合成)发布在 HuggingFace(MatrAIx2026/MatrAIx_Persona_1M)并附数据卡,代码在 GitHub(MatrAIx-ai/MatrAIx-Persona-8B),项目网站 matraix.ai;附录 G–J 给出完整的运行核算、统计程序、判定证据与抽取准则,利于核查。限制:完整 83 亿数据集未发布;论文明确任务数不等于已执行研究数,8 个任务的轨迹与运行清单是否公开未在正文说明。算力与成本:18,189 次试验全部调用 Claude Opus 4.8、GPT 5.5、Claude Haiku 4.5 的 API,按平均 7.1 轮对话估计成本可观;App 环境还需 Docker Linux 桌面沙箱或远程 macOS/iOS 模拟器,部署门槛较高。总体而言,用发布的 1M 核心集加开源模型复现人格抽样与队列构建是可行的(难度中等),但复现论文级评估试验需要可观的 API 预算和基础设施工程。
论文图表