← 返回 2026-08-03

心智世界建模:融合物理与心理状态的耦合世界模型框架 Mental World Modeling

Hao Fei, Yiran Zhao 📅 2026-07-29 👍 103 2026-08-08 18:30
世界模型 心智理论 智能体决策 社会推理 部分可观测决策过程

将信念、意图、情绪等心智变量纳入世界模型以预测人类决策。

前置知识

世界模型 (World Model)

一种计算模型,表示环境的当前状态并预测状态如何演化,为智能体提供反事实模拟、规划和决策的预测基底。当代AI中可分为三大流派:表征型世界模型(学习紧凑隐状态与转移动力学,如Dreamer、JEPA)、视频生成型世界模型(合成时间连贯的未来帧,如Sora、Genie)和3D交互型世界模型(可导航可编辑的持久空间环境,如Marble)。

本文正是对世界模型的扩展。作者论证现有所有流派都默认只建模物理基底(物体、位置、几何、运动、遮挡、可供性),而把场景中的智能体仅仅当作另一种移动的物体,遗漏了驱动人类行为的心智变量。

部分可观测马尔可夫决策过程 (POMDP)

经典的形式化框架,处理底层状态只能部分观测的决策问题。智能体维护对隐藏状态的信念$b_t$,根据观测历史选择动作,并接收由隐状态生成的观测$o_t$。MWM直接采用POMDP的脚手架但改变了隐藏状态的内容:隐藏状态不仅是被遮挡的物体或未观测的物理变量,还可能是错误信念、私人意图、情绪、角色关系或社会规范。

MWM的整套数学形式化被作者定义为'增强的部分可观测动态过程'。理解POMDP中状态、观测、动作、转移算子的分工,才能读懂论文第3节的状态因子化$s_t=(s^{phy}_t,s^{ment}_t)$、目标特异观测生成$\Omega^\epsilon$、联合转移核$T_\theta$等核心公式。

心智理论 (Theory of Mind, ToM)

归因信念、欲望、意图、知识等心理状态给自己和他人的能力(Premack & Woodruff 1978)。认知科学和发展心理学的核心概念,相关AI基准如ToMi、SocialIQA、FANToM、ToMBench、SOTOPIA测试语言模型能否回答关于动机、信念、错误信念、社会常识的问题。

作者论证心理状态是因果状态变量——两个在同一物理房间的智能体若信念不同会采取不同动作,同一句话后两个目标不同的智能体会更新不同的心理状态。但现有ToM工作把问题简化为静态问答,而MWM要求心智变量是会演化的状态变量,这是论文区别于以往工作的关键。

BDI智能体模型 (Belief-Desire-Intention)

Bratman (1987)和Rao & Georgeff (1995)提出的实用推理形式化传统,通过智能体所相信的(belief)、想要的(desire/goal)和承诺去做的(intention)来表示实践推理过程。MWM心智状态$s^{ment}$中的字段(信念$b$、目标$g$、意图$\iota$)直接对应BDI三元组。

BDI为MWM的心智状态分类法(Figure 4的身份/认知/动机/情感/倾向/规范/约束字段)提供了理论根基。理解BDI有助于读懂为什么作者把心智变量当作'会随物理事件、言语行为、社会后果演化'的状态而非静态标签。

研究动机

现有世界模型——无论是表征型(Dreamer、V-JEPA 2)、视频生成型(Sora 2、Genie 3、Cosmos、GAIA-2)还是3D交互型(Marble、HunyuanWorld)——都共享一个默认的建模对象:世界的物理基底,即物体、位置、几何、运动、接触、遮挡、可供性和感知连续性。它们回答的是'某物是什么/在哪里、它将如何演化'这类物理问题,却把场景中的智能体当作另一种移动的物体。但对于人本智能这远远不够:服务机器人要判断用户是否困惑或不耐烦,医疗助手要考虑患者的信念、风险感知、恐惧与信任,协作智能体要识别何时规范/角色会让一个物理上可行的动作变得在社会上不恰当。Figure 2用一个杯子被偷偷挪走的例子说明了问题:当她的杯子在她移开视线时被放进橱柜,纯物理世界模型会预测她去原来的位置够杯子——对'看起来正确的场景'做出'错误的动作预测',因为它没有跟踪她的错误信念。当前AI要么构建不含心智状态的物理世界模型,要么把心智推理评估为孤立的心智理论问答,两者都无法描述'下一个状态是物理与心理共同演化'的世界。

本文的目标是提出心智世界建模(Mental World Modeling, MWM)——一个通用的理论框架,让心智变量成为世界模型的核心组件而非事后合理化解释。具体目标包括:(1) 维护一个耦合的物理-心理世界状态$s_t=(s^{phy}_t, s^{ment}_t)$;(2) 从该全局状态渲染出目标特异的第一人称局部观测$o^\epsilon_t$;(3) 把候选动作分解为物理载体$a^{phy}$与心智语义$a^{ment}$两个维度;(4) 模拟候选动作如何同时更新物理与心理两个分量。作者希望构建一个统一的数学框架,在单一世界建模视角下统一物理与心理动力学,使AI不仅能推理环境如何变化,还能推理智能体如何感知、解释并作出心理响应。为实现可测试性,作者还设计了一个免训练、完全可检视的基线实现MENTIS,并通过系统实证研究验证两个核心主张:显式心智建模对预测人类决策是必要的;定位当前MWM系统的瓶颈以指导未来改进。

与已有工作不同的是,本文的独特切入角度有三点。其一,MWM不是意识理论,也非性格化的'心智模拟',而是一个客观的外部模拟器,只维护预测社会行动及其后果所需的变量。其二,区别于把心智推理降为静态答案的ToM基准(ToMi、SocialIQA、FANToM、ToMBench、SOTOPIA),MWM要求世界模型同时包含物理和心理状态、渲染目标观测、接受候选动作、模拟下一联合状态——心智变量是被转移算子更新、随物理事件演化的状态变量,而非待推断的标签。其三,区别于最近的社交世界模型(SWM)主要提出面向叙事的结构化社交表示,MWM范围更广:把目标观测视为第三人称联合状态的第一人称渲染,并显式地在分支层面模拟物理-心理转移。其核心建模主张是:社会决策的最小模拟对象既不是单独的物理轨迹,也不是单独的心智理论答案,而是耦合状态上的动作条件转移——物理变量约束'能发生什么',心智变量决定'同一事件对相关智能体意味着什么'。

核心方法

直觉层面:人类行动由'智能体相信什么、想要什么、打算什么、感受到什么'驱动,而非仅由物理布局驱动,因此面向社会智能的世界模型应追踪'目标智能体所理解的世界',而不只是物理场景。技术路线上,作者把问题刻画为'增强的部分可观测动态过程':世界模型(第三人称、全知)维护联合状态$s_t=(s^{phy}_t,s^{ment}_t)$,目标只接收从$s_t$渲染的第一人称局部观测$o^\epsilon_t$,据此产出耦合动作$a^\epsilon_t=(a^{phy},a^{ment})$,世界模型再用转移核$T_\theta$模拟下一联合状态,整体流程为$s_t \xrightarrow{\Omega^\epsilon} o^\epsilon_t \xrightarrow{\Pi^\epsilon} a^\epsilon_t \xrightarrow{T_\theta} s_{t+1}$。MENTIS将其操作化为六阶段流水线:解析场景→状态、渲染观测、分解候选动作为物理-心智对、并行模拟K分支、逐分支评分、确定性决策。

核心创新在于把心智变量当作一等的、会因果地塑造动作分布并随转移演化的隐状态变量,而非事后解释。性质3.1形式化证明其必要性:只要存在心智分量使$p^\star(a^\epsilon|s^{phy},s^{ment})\neq p^\star(a^\epsilon|s^{phy},\tilde{s}^{ment})$,仅保留物理分量的表示就必然不足(对称地纯心智表示也不足)。三个结构性承诺把MWM与已有方法本质区分:(1) 物理-心理联合状态因子化$s_t\in\mathcal{S}^{phy}\times\mathcal{S}^{ment}$;(2) 第一人称目标观测与全局状态分离——这正是MWM能表示错误信念、无知、惊讶、社会性偏倚动作的形式原因;(3) 动作刻画为耦合对$(a^{phy},a^{ment})$,并经阶段性因子化转移让物理与心理因果通道可独立检视:物理转移只条件于载体$a^{phy}$,心理转移则同时条件于载体和含义。

方法步骤详情

MENTIS共六阶段,每阶段实例化一个形式算子并写出可检视产物。①状态解析:STATEPARSER按Figure 3/4分类法把场景(文本直接解析;图像结合视觉证据与字幕;视频解码为关键帧加转录音轨)映射为联合状态$\hat{s}_t$。②观测生成:从$\hat{s}_t$渲染第一人称$\hat{o}^\epsilon_t$,过滤目标无法访问的信息——目标可能持有错误或不完整信念。③动作分解:把每个选项$c_k$解析为带物理载体与心理语义的结构化动作$\hat{a}^{\epsilon}_{t,k}$。④分支模拟:对每个候选,物理通道从$(\hat{s}^{phy},\hat{s}^{ment},\hat{a}^{phy})$预测后继,心理通道再附加$\hat{a}^{ment}$,合并为$\hat{s}^k_{t+1}$;K分支并行。⑤价值评估:按心智一致性、物理合理性、社会适当性三维评分并产出安全否决。⑥决策:确定性模块在固定平局规则下选最高价值分支并映射回选项标签。

技术新颖性

技术新颖性体现在五个方面。第一,首次在POMDP脚手架上提出统一物理与心理动力学的形式框架,并给出显式的状态分类法:物理状态(Figure 3,含实体内在/语境属性、空间与接触关系、环境视觉/声学/空气/空间条件)与心智状态(Figure 4,含个体身份/认知/动机/情感/倾向/规范/约束字段,群体心智复用同样结构,加上态度、角色关系和场景氛围)。第二,阶段性转移因子化让物理与心理因果通道可独立分析与消融(这正是后续A1/A2/A3实验能逐通道拆解的原因)。第三,分支级价值评估器采用三个对应理论的维度加安全否决,且决策规则被刻意放在语言模型之外以保证可复现、可审计。第四,MENTIS免训练且完全可检视——每阶段产物可日志化、与标注比对或用金值替换,从而支持组件级评估和oracle干预。第五,配套的过程完备基准Menti-Bench提供状态/观测/动作/后继状态的完整金标注,而非仅结局标签,使'过程必要性'可被严格检验。

Mental World Modeling (MWM) 表示场景为耦合的物理-心理世界状态,渲染目标特异观测,预测候选目标动作,并模拟下一物理和心理状态。
Figure 1: Mental World Modeling (MWM) 表示场景为耦合的物理-心理世界状态,渲染目标特异观测,预测候选目标动作,并模拟下一物理和心理状态。
物理世界状态$s^{phy}_t$的分类法。实体(物体和角色)带有内在与语境属性;关系记录空间和接触结构;环境记录时间、地点、区域以及环境视觉、声学、空气和空间条件。
Figure 3: 物理世界状态$s^{phy}_t$的分类法。实体(物体和角色)带有内在与语境属性;关系记录空间和接触结构;环境记录时间、地点、区域以及环境视觉、声学、空气和空间条件。
心智世界状态$s^{ment}_t$的分类法。个体心智实体带身份、认知、动机、情感、倾向、规范和约束字段;群体实体在集体层面复用同样结构;心智关系记录态度和角色关系;场景级氛围总结集体情绪。
Figure 4: 心智世界状态$s^{ment}_t$的分类法。个体心智实体带身份、认知、动机、情感、倾向、规范和约束字段;群体实体在集体层面复用同样结构;心智关系记录态度和角色关系;场景级氛围总结集体情绪。
MENTIS流水线。系统把输入场景转换为结构化当前状态$\hat{s}_t$,渲染目标伪智能体的观测$\hat{o}^\epsilon_t$,把每个选项解析为动作分支,并行模拟物理和心理后继状态,并评估所得未来以选出最终动作。编号区域对应第5.2节的六个阶段。
Figure 5: MENTIS流水线。系统把输入场景转换为结构化当前状态$\hat{s}_t$,渲染目标伪智能体的观测$\hat{o}^\epsilon_t$,把每个选项解析为动作分支,并行模拟物理和心理后继状态,并评估所得未来以选出最终动作。编号区域对应第5.2节的六个阶段。

实验结果

核心主张得到一致验证。必要性阶梯(8模型平均)F1单调上升:S0=31.3→S1=63.3→S2=74.6→S3=77.9→S4=80.3→S5=82.6→S6=87.9,该排序对每个模型都成立,完整MWM对所有8模型都是最佳配置。直接回答即便加算力也不够:六采样自洽S3仍比S6低10.0;S6用最弱gpt-4.1(84.9)甚至超过S3用最强gpt-5.6-sol(83.6)。通道消融:去心智损失12.1、去物理损失16.5、解耦转移损失6.4,排序S6>A3>A1>A2在全部模型上成立。瓶颈定位(gpt-5.6-sol,S6=90.7,距人类98.5差7.8):金转移+3.5(恢复45%差距)、金状态+2.8、金观测+1.7、金动作+0.7;四者全用达97.0(残差仅1.5)。场景研究中人际场景增益最大(+26.4),物体/资源最小(+14.0)。模态分析中文本/图像/视频S6−S1增益为+19.7/+24.2/+26.1,模态差距在S5已被结构化状态消除。

MWM形式化中使用的符号。
Table 1: MWM形式化中使用的符号。
MWM框架的基本元素。两种计算角色通过三个耦合变量交互:世界状态、目标观测和目标动作。
Table 2: MWM框架的基本元素。两种计算角色通过三个耦合变量交互:世界状态、目标观测和目标动作。
系统阶梯与干预。每一级增加一个承诺;消融和oracle干预在完整系统(S6)上进行。
Table 3: 系统阶梯与干预。每一级增加一个承诺;消融和oracle干预在完整系统(S6)上进行。
必要性阶梯与通道消融:448条记录上各世界模型的最终动作F1(%)。Avg为8模型平均;同协议下人类参考为98.5。每列最佳系统加粗。
Table 4: 必要性阶梯与通道消融:448条记录上各世界模型的最终动作F1(%)。Avg为8模型平均;同协议下人类参考为98.5。每列最佳系统加粗。
S6上的oracle干预(gpt-5.6-sol):单阶段及组合。$\Delta$为相对全预测S6(90.7)的增益;人类参考为98.5。
Table 5: S6上的oracle干预(gpt-5.6-sol):单阶段及组合。$\Delta$为相对全预测S6(90.7)的增益;人类参考为98.5。
按场景类别和领域的最终动作F1(%)(gpt-5.6-sol,448条记录)。列份额给出各切片数据占比;末行为S6−S1增益。
Table 6: 按场景类别和领域的最终动作F1(%)(gpt-5.6-sol,448条记录)。列份额给出各切片数据占比;末行为S6−S1增益。
按故事模态的最终动作F1(%)(gpt-5.6-sol)。
Table 7: 按故事模态的最终动作F1(%)(gpt-5.6-sol)。
通道干预(gpt-5.6-sol):图像记录替换为中性字幕;视频记录去音频、再打乱帧序、或仅保留音频。
Table 8: 通道干预(gpt-5.6-sol):图像记录替换为中性字幕;视频记录去音频、再打乱帧序、或仅保留音频。
必要性阶梯(最终动作F1,448条记录)。 子图各阶梯rung在8个世界模型上的F1(细线)及其平均(粗线)。 S6的消融,平均8模型;白点标各模型值。
Figure 6: 必要性阶梯(最终动作F1,448条记录)。 子图各阶梯rung在8个世界模型上的F1(细线)及其平均(粗线)。 S6的消融,平均8模型;白点标各模型值。
oracle干预(gpt-5.6-sol)。柱形显示当金信息替换一个或多个阶段的预测产物时的最终动作F1;柱标给出相对全预测S6的增益。
Figure 7: oracle干预(gpt-5.6-sol)。柱形显示当金信息替换一个或多个阶段的预测产物时的最终动作F1;柱标给出相对全预测S6的增益。
场景研究(gpt-5.6-sol)。 四个系统在各场景类别上的F1。 按场景类别和领域的S6−S1增益。
Figure 8: 场景研究(gpt-5.6-sol)。 四个系统在各场景类别上的F1。 按场景类别和领域的S6−S1增益。
模态分析(gpt-5.6-sol)。 各阶梯系统按故事模态的F1。 图像替换为字幕的效果。 视频通道干预。
Figure 9: 模态分析(gpt-5.6-sol)。 各阶梯系统按故事模态的F1。 图像替换为字幕的效果。 视频通道干预。
查看结构化数据
任务指标本文基线提升
情境化目标动作预测(448条多模态情境决策,6选项选1) 最终动作F1 (%) S6完整MWM在8模型上平均87.9,最强gpt-5.6-sol达90.7 S1直接回答平均63.3;S3自洽@6平均77.9 S6−S1平均+24.6;S6−S3平均+10.0(且S6+弱模型>S3+强模型)
心智通道必要性消融 最终动作F1 (%),平均8模型 完整S6=87.9 A1去心智=75.8;A2去物理=71.4;A3解耦转移=81.5 保留心智通道+12.1,保留物理通道+16.5,物理-心理耦合转移+6.4
瓶颈定位(gpt-5.6-sol) F1 (%) 相对S6(90.7)的增益 四阶段全用oracle达97.0(+6.3) S6全预测=90.7(距人类98.5差7.8) 金转移+3.5(恢复45%差距),金状态+2.8,金观测+1.7
场景类别切片(gpt-5.6-sol) S6−S1 F1增益(百分点) 人际+26.4(S6=92.9,S1=66.5) 物体/资源+14.0(S6=88.0) 人际场景增益最大,验证'隐藏心智变量主导决策处增益最大'

局限与改进

作者明确承认的限制包括:Menti-Bench规模较小(448条记录,其中仅28条发声视频——50条制作中只保留28条),小规模子集上的绝对差值仅作方向性参考;数据集为人工构造,规模受质量控制约束;MENTIS免训练,反映的是建模结构而非拟合参数,可能低估学习型MWM的潜力。oracle增益是次可加的(单阶段之和+8.7 vs 组合+6.3),表明阶段错误相互重叠传播。最强系统仍比人类参考98.5低7.8。我的额外观察:(1) 目标伪智能体只能从给定选项中选择,未实现自由提议模式,因此并未测试动作生成质量,仅测分支转移质量;(2) 心智状态中情绪/规范等字段难以客观校验,依赖校准的LLM裁判做语义评分,可能引入自身偏倚;(3) 只测试了OpenAI与Anthropic两族共8个模型,模型多样性有限;(4) Menti-Bench以英文日常场景为主,跨文化规范泛化未受检验;(5) 虽定位了转移瓶颈但本文未提出修复方案;(6) 多智能体同时行动的转移(公式18的边际化)形式上给出但未被深入评估。

独立分析的弱点

第一,转移模拟被证明是首要瓶颈(金转移+3.5、占人类差距的45%),改进方向是构建学习型、微调过的心智转移模型替代免训练的LLM提示,并引入对比或反事实转移训练。第二,数据规模(448条、视频仅28条)限制统计功效与模态覆盖,可在保留快捷控制前提下扩展更大规模自动采集数据。第三,多智能体场景仅78%含≥2个角色,真正多智能体同时行动的转移(公式18)虽被形式化但未被深入评估,对其他智能体动作的边际化$p(a^{-\epsilon}_t|s_t)$实现复杂度高。第四,自由提议模式仅在概念上描述、未实现,无法将动作生成质量与转移质量解耦评估。第五,心智状态以JSON/文本表示,缺乏对信念不确定性的概率化表示——而照护/咨询领域恰恰需要标定好的不确定性来决定何时让步、询问或转交人类。第六,缺乏真实具身部署,所有评估都是离线多选题,未在真实机器交互中验证。

未来方向

作者明确指出的方向:优先改进转移模拟——这是清晰的优先级排序,未来工作应首先针对转移模型。把框架扩展到交互智能体和开放世界规划的自由提议模式。作者期望MWM成为'世界建模的下一阶段,从模拟物理场景到模拟在其中行动的心智'。基于本成果可延伸的方向包括:(1) 在过程标注数据上训练学习型心智转移核,取代免训练提示;(2) 引入概率化/贝叶斯心智状态跟踪以实现标定好的不确定性,这对照护/咨询中'决定何时不自主行动'至关重要;(3) 扩展Menti-Bench到更多文化/规范/语言,检验跨文化泛化;(4) 在真实具身协作中评估;(5) 与视频生成型和3D世界模型整合,把MWM作为物理模拟器之上的心智层;(6) 针对机构/组织等集体行动者研究分层与群体心智动力学;(7) 把自由提议模式与分支评估结合,单独度量动作生成与转移两个维度。

复现评估

复现性总体较好。框架与MENTIS设计完全公开:状态分类法见Figure 3/4、符号表见Table 1、六阶段流水线见Figure 5及第5节详述。由于MENTIS免训练,无需训练权重,任何LLM端点都能复现;项目主页给出(mental-world.github.io)。Menti-Bench构造协议在附录F中给出并附数据表,448条记录含完整金过程标注。运行操作点固定且描述清楚(中等推理强度、批量比较式评分、在冻结的30条校准切片上确定)。测试覆盖OpenAI与Anthropic两族8个模型,经统一端点访问。需要注意:正文未明确确认完整数据/提示词的开源状态;裁判提示词与精确指标定义放在附录(本文档未含附录正文);需要前沿模型(gpt-5.6-sol等)的API访问权限,存在访问与成本门槛;人工数据集构造劳动密集、难以快速扩展;自由提议模式未实现,复现交互式设定需要额外工程。