← 返回 2026-08-12

伴身智能体(ComBodied Agents):以人为中心的智能体AI新范式 ComBodied Agents: a New Paradigm of Human-Centric Agentic AI

Qianggang Ding, Xingyao Wang, Rui Feng, Zhibin Wang, Feixiang Wang, Kelong Mao, Hao Sun, Zhiyao Luo, Jiankai Tang, Lei Li, Jiadong Guo, Minheng Ni, Weicong Lin, Chenxi Yang, Hongxiang Gao, Zhenghua Chen, Yang Bai, Min Wu, Jun Cheng, Huazhu Fu, Dacheng Tao, Bang Liu 📅 2026-08-11 👍 189 2026-08-17 18:30
AI治理 个人世界模型 人本AI 智能体范式 立场论文 能动性保留 评估基准 边缘智能

提出以人的状态轨迹为核心对象的智能体新范式,主张在保护人类能动性前提下提供纵向支持。

前置知识

Agentic AI 与智能体循环

指能迭代解释观测、维持任务相关内部状态、选择并执行动作、再利用反馈调整后续行为的 AI 系统。论文将其概念化为循环 $o_t \to b_t \to (g_t, p_t) \to a_t \to x_{t+1} \to o_{t+1}$:观测 $o_t$ 更新信念 $b_t$,结合目标 $g_t$ 与计划 $p_t$ 选出动作 $a_t$,改变外部目标域状态 $x_{t+1}$,再产生新观测。它不要求参数持续学习,只要求闭环的信息流。

ComBodied Agents 的整个定义和闭环框架都建立在这个循环上,但把循环所服务的目标域从软件或物理状态换成了不断演化的人的状态,理解该循环是理解全文形式化的基础。

Digital Agents 与 Embodied Agents

数字智能体围绕软件状态的变换组织,如浏览器/GUI 自动化、编码助手、工具与 API 调用、工作流代理,以正确性、完成率、效率评价;具身智能体围绕物理或仿真物理状态的变换组织,如导航、抓取、自动驾驶,以任务成功、控制可靠性、安全性评价。论文提出二者是三个相互重叠的重心中的两个。

本文的核心论证是通过“作用基底(action substrate)”区分范式:既有的两类都以外部状态为重心,而 ComBodied Agents 以人和人的能动性为重心,必须先知道这两类是什么才能理解第三类的定位。

Human Digital Twin(HDT,人体数字孪生)

通过持续的数据同步与反馈,维护某个人(或其某个用例特定的方面)的动态更新数字表示,可整合多模态、多尺度数据以支持监测、仿真、预测与优化。论文指出完整、高保真的整体人孪生仍是愿景:生理、认知、行为、关系在多个时间尺度上演化,而感知不完整,验证、同步、计算、隐私与治理都是硬约束。

ComBodied Agents 与 HDT 共享以个体为中心的纵向视角,但刻意划清边界——只维护目的限定、可纠正的部分表示而非高保真复刻,理解这一区别才能把握本文的雄心边界。

World Model(世界模型)与个人世界模型 PWM

世界模型是关于相关环境或状态如何在动作下演化的内部预测表示,通过想象未来轨迹支持预测、规划与控制,免去在真实环境中试错每个动作。PWM(Personal World Model)是其在具体个人上的特化:给定受治理的事件历史、当前上下文与候选情景,预测该人未来状态-事件-结果的校准分布。

PWM 是本文技术框架的核心组件,其定义性功能是“干预条件下的个人动力学建模”,与个性化、记忆、生成模拟的本质区别全靠世界模型的功能契约来刻画。

Edge-native(边缘原生)部署

指把推理、记忆与个性化主要放在用户侧可信设备(手机、戒指、眼镜、家庭中枢)上本地优先运行,以获得隐私、低延迟、离线韧性和可检查可重置的模型状态;云端仅按需提供知识与算力,敏感数据经隐私网关过滤后再出设备。

论文用整整一节论述从云中心到边原生的三阶段演进,认为纵向个人模型和干预权威最终应驻留用户侧,这是其治理与隐私主张的架构落点。

Agency Preservation(能动性保留)

指系统在反复交互中保护并增强用户理解、选择、行动、拒绝、纠错和成长的能力。它不等价于任务成功、满意度、个性化质量或参与度——一个系统可能完成了任务却因隐藏取舍、施压选择、让后果难以逆转或替代用户推理而破坏能动性。

这是本文的价值内核与评估纲领:论文把它细化为 8 个可测维度并要求作为非补偿性评估目标,是区分 ComBodied Agents 与普通个性化助手的关键判据。

研究动机

论文以一个具体场景开场:一位老人漏服了一次药,软件智能体可以再发一次提醒,具身智能体可以把药送过去,但两者都无法解释这个人究竟是忘了、困惑、正在经历药物副作用、还是故意拒绝服药,也无法判断什么样的支持才恰当。作者认为这暴露了 Agentic AI 的结构性缺口:数字智能体围绕软件状态变换组织,具身智能体围绕物理状态变换组织,没有任何范式把“不断演化的人的状态与能动性”作为建模、干预和评估的首要对象。Table 1 系统综合了对话、工具使用、计算机使用、工作流、具身、记忆助手、个性化、伴侣、健康、学习、辅助照护、边缘 AI 等十余类现有系统,归纳出三个反复出现的局限:其一,现有系统优化外部任务或领域结果而非人的纵向轨迹;其二,对“人”的模型碎片化、浅层或仅限单次情景——记忆助手存事实却不建模轨迹,个性化智能体缺乏用户变化的因果模型;其三,安全与评估标准很少测量能动性损失、能力增长、关系效应或长期福祉。作者还引用认知外包研究发现:AI 可以改进文档却让作者理解更少、加速决策却削弱用户判断依据,且用户无法判断何时该接受、验证或拒绝模型输出时会出现认知努力下降与过度依赖;情感伴侣系统则可能催生依赖、操纵、社会替代,对未成年人与脆弱用户风险尤大。

本文的目标是本文的目标是提出并系统化一个新范式:ComBodied Agents(ComBodied 由 Companion 与 Body 合成)——以人为中心的智能体,通过持续多模态感知与纵向交互来感知、建模、预测并支持个体人状态随时间的轨迹;软件工具、传感器、可穿戴设备、机器人和人类服务都只是“动作通道”而非最终目标,成功由这个人随时间能理解什么、决定什么、做到什么、维持什么来判定。具体贡献有四:(1) 正式定义该范式,确立人本状态建模、纵向性、干预性、共同能动性(co-agency)、能动性保留五个联合属性,并区别于数字与具身智能体;(2) 建立闭环技术框架,连接多模态人状态感知、纵向记忆、个人世界模型(PWM)、能动性保留的干预策略、反馈适应与安全约束;(3) 综合设计空间,给出部署架构(云到边三阶段)、以人为本评估、以及“关系模式 × 智能体角色 × 人状态目标 × 应用”的整合分类法;(4) 检视风险、治理要求、开放挑战与相邻研究领域,形成负责任的研究议程。明确反对把参与度、依赖度或最大自动化当作成功度量。

与已有工作不同的是,本文的独特切入角度有三。第一,提出“作用基底(action substrate)”这一分类维度:不按界面、模型架构、自主性或感知模态划分智能体,而按“建模、决策、干预与评估最终围绕哪类目标状态组织”来划分——数字状态、物理状态、人的状态与能动性,作者强调一个系统可以用浏览器安排照护、用传感器检测疲劳,但网页和传感运动状态都不是它的最终目标。第二,刻意与 Human Digital Twin 划界:作者论证完整高保真的人的孪生仍是愿景而非可达系统(感知不完整、验证/同步/隐私/治理困难),因此 ComBodied Agent 只维护 purpose-bounded(目的限定)、uncertainty-aware(不确定感知)、user-correctable(用户可纠正)的部分表示,首要目标不是最大表征保真度而是安全的纵向有益参与;领域级 HDT 可以为其提供证据或预测,但不定义其记忆、权限、交互策略与人际关系。第三,把“AI for humans”从伦理口号操作化为技术研究纲领:优化目标从孤立任务成功扩展为“即时收益 + 纵向人类增益”,人机分工本身成为技术设计问题——智能体应学会何时独立行动、何时请求监督、何时把知识与能力归还给人,同时保留人选择、拒绝、纠正和恢复的能力。

核心方法

先讲直觉:这不是又一个更聪明的聊天助手,而是一个围绕“这个人现在怎么样、接下来会怎样、我该怎么帮才恰当”组织起来的长期陪伴系统,其成功标准是人的长期受益与能动性保留。技术路线是一个闭环(Figure 2):事件式多模态感知从碎片化、含噪、不均匀采样的个人数据中重建“有意义的个人事件”证据;纵向且可纠正的记忆(Table 2 的 7 类组件)提供时间上下文;个人世界模型(PWM)把纵向事件证据与当前上下文转化为备选决策/干预下未来个人状态、可观测事件与结果的校准分布;干预策略在同意、不确定性、安全、可逆性与用户控制约束内选择相称的支持或人类升级;人和环境的反馈再更新感知、记忆、预测与干预。形式化上,设 $H_t$ 为不可观测的人状态、$D_{\le t}$ 为事件证据记录,智能体维护带不确定性的后验 $Z_t \sim q_\phi(\cdot \mid D_{\le t}, M_t, C_t)$ 并检索决策相关证据 $R_t = \mathrm{Read}(M_t; Z_t, C_t, G_t)$;关键的是人状态转移 $H_{t+1} \sim T_H(\cdot \mid H_t, a^{\mathrm{agent},*}_t, a^{\mathrm{user}}_t, \Xi_t)$ 显式包含用户自身动作与外生影响 $\Xi_t$——干预不决定人的下一状态;观测 $O_{t+1} \sim \Omega(\cdot \mid H_{t+1}, C_{t+1})$ 与反馈 $F_{t+1}$ 经 $M_{t+1} = \mathrm{Update}(M_t, O_{t+1}, a^{\mathrm{agent},*}_t, Y_{t+1}, F_{t+1})$ 更新记忆,闭合纵向回路。

核心创新是把“人”而非任务设为智能体的第一性对象,并把 PWM 的定义性功能契约定为“干预条件下,这个具体的人的状态-事件轨迹在备选情景下将如何展开”。与已有方法的本质区别体现在三处。其一,与数字/具身智能体的区别不在实现而在作用基底:三者共享感知、表征、推理、规划、行动、学习的通用机制(Figure 1b),差异在于动作最终为了什么目标状态——这解释了为什么一个聊天界面或机器人平台不自动成为 ComBodied Agent。其二,与 HDT 的区别是不追求整体高保真复刻:只维护目的限定、用户可纠正的部分表示,把资源集中在已商定支持场景所需的方面。其三,与个性化智能体/生成式智能体的区别是功能契约(Table 5):检索个人上下文、适配输出、或生成貌似合理的行为都不满足 PWM 契约——必须是动作与上下文条件化的校准轨迹预测,并以个人轨迹有效性、干预响应准确性、校准度与场景区分度来验证。另一个关键设计是干预策略允许“不干预”:策略只在合法集 $\mathcal{A}^{adm}_t$ 内选择,该集合包含不干预、澄清、确认和转介人类专家,安全与同意不能用更高参与度或平均预测效用来交换。

方法步骤详情

方法按论文结构可拆为五步。第一步,事件式多模态感知(第 3 节):覆盖语言/文本、语音/音频、视觉、生理生化、运动行为、社会关系、环境上下文、临床与机构记录 8 类模态(Table 4 详列各模态的传感器、获取方式与采样模式),并区分用户自报、设备介导、体上接触、环境无接触、机构获取 5 种获取配置,因为获取方式改变证据强度与隐私负担;观测先经质量控制与候选事件分段,再形成事件-证据记录(观测了什么、何时如何采集、支持什么解释、剩余什么不确定性、相关性如何)。感知融合遵循严格的证据链:观测 → 事件 → 推断状态 → 预测轨迹 → 授权干预——例如心率升高是观测;“运动后恢复慢”是重构事件;“可能疲劳”是推断状态;“若继续运动则延迟恢复”是预测轨迹;“建议停止运动”才是干预决策。第二步,纵向记忆:Table 2 定义情景记忆、语义个人记忆、轨迹记忆、目标与承诺记忆、关系记忆、干预-响应记忆、用户控制记忆 7 类组件,每条记忆含内容、时间戳、来源、模态、置信度、敏感度与保留策略,必须可检查、可纠正、可删除。第三步,PWM 预测:给定受治理历史 $D_{\le t}$、上下文 $C_t$、目标 $G_t$ 与候选情景 $s_{t:t+\Delta} = (a^{user}, a^{agent}, \Xi)_{t:t+\Delta}$,预测 $p_\theta(Z_{t+1:t+\Delta}, E_{t+1:t+\Delta}, Y_{t+1:t+\Delta} \mid D_{\le t}, Z_t, C_t, G_t, s_{t:t+\Delta})$,其中 $Y$ 为依从性、目标进展、福祉、能力、安全、关系质量等情景相关结果;策略只在合法集内做非支配选择 $a^{\mathrm{agent},*}_t \in \mathrm{ParetoArgmax}_{a \in \mathcal{A}^{adm}_t} \mathbb{E}_{p_\theta}[U(Y_{t+1:t+\Delta}, G_t)]$;更强的因果版本支持 $p_\theta(Y \mid do(a^{\mathrm{agent}}_t = a), Z_t, R_t, C_t)$,但作者强调 $do(\cdot)$ 本身不消除动机、隐藏情境、选择性参与等混杂,识别需要因果图与一致性/正性假设,最好辅以微随机化试验或 N-of-1 研究。第四步,干预动作空间(Table 3):Inform、Remind、Recommend、Coach、Nudge、Reflect、Coordinate、Protect、Escalate、Execute 10 类动作,按目标、强度、可逆性与所需权威分层。第五步,部署与本地演化(第 5 节):云中心(Stage I)→ 边云混合(Stage II,边缘做隐私网关、记忆过滤、安全检查与任务路由)→ 边原生(Stage III,纵向记忆、PWM、偏好、干预策略与安全边界驻留用户侧设备);本地演化覆盖记忆演化、感知校准、动力学适应、策略适应四方面,所有更新必须可检查、可回滚、受安全约束。

技术新颖性

技术新颖性可以从五个层面分析。第一,分类学贡献:作用基底维度使“用什么的成功来评价系统”成为范式划分标准,且以三个相互重叠的重心(而非互斥类别)表述,承认自主实验室、记忆支持、辅助康复、机器人辅助用药支持等跨基底任务配置的合法性,这比常见的按架构或模态分类更能刻画研究纲领的演化。第二,PWM 作为组织性抽象:论文坦承 PWM 不是单一新估计器,其贡献在于“把个人特有的预测动力学与可纠正的、能动性受限的干预环路连接起来”,并给出可判别的功能契约与验证标准(个人轨迹有效性、干预响应准确性、校准、场景区分度),这为后续实证研究划定了靶子。第三,证据链认识论:把“观测/事件/推断状态/预测轨迹/授权干预”的五级区分作为架构硬约束,防止感知越权直接变成干预,这是对当前 LLM 代理“一感知就行动”惯例的系统性纠偏。第四,评估学贡献:把能动性保留从伦理口号细化为自主性、可争辩与纠错、知情决策、能力保持与增长、过度依赖风险、可逆性与问责、边界与同意尊重、关系与社会世界保护 8 个可测维度,并要求严重失败非补偿、设置有无智能体的对照。第五,部署贡献:把隐私从合规问题转化为架构演化问题,为三阶段各给出可验证的判别性评估问题。整体而言,这是范式定义加研究议程,而非单点技术突破。

Functional organization of a Combodied Agent.
Figure 2: Functional organization of a Combodied Agent.
Reference technical scheme of a PWM.
Figure 3: Reference technical scheme of a PWM.
Three-stage development of Combodied Agent deployment.
Figure 4: Three-stage development of Combodied Agent deployment.
Reference architecture of an edge-native Combodied Agent.
Figure 5: Reference architecture of an edge-native Combodied Agent.
Three-axis taxonomy of Combodied Agents.
Figure 6: Three-axis taxonomy of Combodied Agents.

实验结果

必须先说明:这是一篇立场/框架论文,不报告任何实验数值,其“结果”是一组概念产出、形式化与研究议程。核心产出包括:(1) Table 1 系统综合了对话、工具使用、计算机使用、工作流、具身、记忆助手、个性化、伴侣、健康、学习、辅助照护、边缘 AI 等十余类现有智能体的能力、局限与缺失,归纳出三大共性缺陷——优化外部任务而非人的轨迹、对人的模型碎片化浅层、安全评估不测量能动性与长期福祉。(2) 给出闭环形式化(公式 1-6)与 PWM 预测/选择形式化(公式 7-9),并明确“预测不等于授权”:高预测收益既非事实保证也非行动许可。(3) 提出部署三阶段论(Figure 4)并给出每阶段的迁移判据与评估问题,例如 Stage II 应验证任务路由是否达成可度量的隐私-效用-延迟权衡、云端输出是否被边缘恰当拒绝/修订/升级、断网时系统是否安全降级。(4) 评估矩阵(Table 7):感知与记忆、PWM 与决策支持、干预、人类结果与能动性 4 层 × 交互/片段/纵向与关键失败 3 个时间尺度,且隐私泄露、未授权高影响动作、操纵、有害依赖、未经同意的不可逆动作等作为非补偿性关键失败。(5) 能动性保留 8 维指标体系,要求与无智能体条件或不同干预策略(直接执行/确认后执行/反思式辅导/不干预)做对照,核心问题是“帮助是否改变了用户未来理解、决策、恢复、关系与行动的能力”。(6) 梳理四类现有公开资源及其缺口:个性化与长期记忆(LaMP、LongLaMP、LongMemEval、iOSWorld)、健康可穿戴推理(PHIA、PH-LLM、Health-LLM)、伴侣关系安全(Replika 身份中断研究、青少年伴侣使用报告、监管系统与角色扮演多轮评估)、临床与心理健康红队——均只测孤立能力而非“人建模-目标协商-干预-反馈-记忆修订”的完整回路。(7) 提出 CombodiedBench 模块化基准套件,含 Human State Perception、Memory Continuity、Goal Negotiation、Intervention Appropriateness、Agency Preservation、Relationship Boundaries、Escalation、Longitudinal Outcomes 8 个模块。(8) 风险议程:操纵(含时机敏感的脆弱性利用)、依赖、谄媚式过度迎合、商业模式错位、敏感记忆与同意控制、脆弱用户与医疗/心理健康高风险、纵向与因果学习、能动性对齐的干预校准、可信个人基础设施、多智能体协调与跨文化全生命周期适应。

Consolidated related-agent landscape: representative capabilities, limitations, and the human-centered longitudinal support added by Combodied Agents.
Table 1: Consolidated related-agent landscape: representative capabilities, limitations, and the human-centered longitudinal support added by Combodied Agents.
Main components of Longitudinal Memory in Combodied Agents.
Table 2: Main components of Longitudinal Memory in Combodied Agents.
Representative acquisition configurations for personal data modalities.
Table 4: Representative acquisition configurations for personal data modalities.
Positioning PWMs relative to adjacent personal representations and agent-modeling constructs.
Table 5: Positioning PWMs relative to adjacent personal representations and agent-modeling constructs.
Illustrative task routing between edge and cloud.
Table 6: Illustrative task routing between edge and cloud.
Evaluation matrix for Combodied Agents across layers and time horizons.
Table 7: Evaluation matrix for Combodied Agents across layers and time horizons.
Scenario-centered evaluation of Combodied Agents.
Table 8: Scenario-centered evaluation of Combodied Agents.
Relational contexts for Combodied Agents.
Table 10: Relational contexts for Combodied Agents.
查看结构化数据
任务指标本文基线提升
纵向个人状态建模(PWM 评估) 轨迹预测校准(如 CRPS、校准度)、备选场景区分度、干预响应预测准确性、漂移检测 提案性质:提出四层三尺度评估矩阵(Table 7)与 PWM 验证标准(个人轨迹有效性、干预响应准确性、校准、场景区分),未给出任何实验数值 现有资源只测孤立能力:LongMemEval 测长程交互记忆、LaMP/LongLaMP 测个性化生成、PHIA/Health-LLM 测可穿戴健康数据推理 把评估从“回忆与解释”扩展到“干预响应与延迟结果”,填补完整闭环评估空白(属研究议程而非实测提升)
能动性保留评估 8 维指标:自主性保留、可争辩与纠错、知情决策、能力保持与增长、过度依赖风险、可逆性与问责、边界与同意尊重、关系与社会世界保护 首次系统化为多维评估目标,要求非补偿性关键失败报告,并设置有无智能体或不同干预策略的对照条件 任务成功率、用户满意度、个性化质量、参与度等传统单维指标 评估对象从任务输出转向人的长期能力、控制权与关系安全,明确“慢一点但保住用户判断力”可以是更好的结果
CombodiedBench 基准套件 8 个模块:状态感知、记忆连续性、目标协商、干预适当性、能动性保留、关系边界、升级(escalation)、纵向结果 作为标准化协议提案:基本单元是含先验轨迹、当前上下文、可用证据、允许动作空间与延迟结果窗口的纵向情景片段,需指定权限、预期解释、评估范围、评分规则与不可接受失败模式 无(领域空白,尚无面向完整纵向闭环的基准) 填补纵向事件重建、干预响应与延迟结果数据、能动性与关系边界测试、隐私保护个人轨迹四项基准缺口

局限与改进

作者明确承认的局限包括:PWM 只是组织性抽象,其经验有效性必须按目标状态、时间尺度、人群与权限级别逐一确立,不能从框架本身推出;边缘本地模型受计算、存储、能耗、模型新鲜度与专业知识获取限制;本地持续适应可能过拟合短期状态、强化错误记忆或发生灾难性遗忘,因此每个更新必须可检查、可回滚、受安全约束;设备丢失、共享使用与多设备同步不一致会威胁权威个人状态;本地存储本身不自动带来隐私、有效同意或能动性保留;医疗、法律、危机等高风险任务即使边原生仍需合格人类或受治理的外部服务。我的补充观察有五:其一,全文没有任何原型系统、实验或用户研究,闭环四个组件均无可运行实例,框架的可检验性完全依赖后续工作,这在立场论文中常见但意味着核心主张(PWM 能学到有用的个人动力学、能动性指标可测)都未经验证;其二,能动性保留 8 维指标大量依赖用户主观报告与长期对照实验,测量成本高、易受需求特征与社会期许偏差污染,作者未给出心理测量学层面的操作化;其三,可纠正记忆、同意传播、审计日志等治理要求与现有 LLM 产品形态差距巨大,论文未给出渐进式落地路径;其四,多个专用伴侣(工作、健康、财务、情感)之间的协调只停留在问题陈述;其五,术语 ComBodied 与 Embodied 仅一字母之差,尽管作者专门澄清其含义是 Companion+Body 而非第三方陪伴,传播中仍极易混淆。

独立分析的弱点

第一,零实证支撑是最大弱点:PWM 的预测校准、干预响应学习、能动性指标的可测性全部悬空,任何读者都无法据此判断该范式在真实场景中是否优于一个带记忆的普通助手。改进方向是选一个窄场景(如服药依从性支持)做最小闭环原型,用微随机化试验(micro-randomized trial)估计干预响应,先验证“干预-响应记忆能改善后续干预时机”这一个环节。第二,评估提案重但不可操作:8 维能动性指标多为质性描述,缺少具体量表、探针任务与自动化测量协议,改进方向是将其转化为可测量的行为指标(如独立尝试率、纠正传播率、智能体不可用时的 distress 变化)并发布测量工具包。第三,框架高度依赖用户积极配合纠错与设置边界,但最需要保护的脆弱用户(认知衰退老人、青少年、危机中的人)恰恰最无力行使这些控制,需要异常检测、监护人协商与默认保护机制,作者提到但未设计。第四,PWM 的数据稀疏问题只是原则性带过:个人数据量级远小于预训练语料,“人群先验 + 个人适配层 + 不确定性后验”具体如何实现(adapter、校准层、贝叶斯更新还是记忆检索)没有技术方案。第五,商业激励与范式直接冲突:参与度优化是当前产品的默认逻辑,与 agency 优先背道而驰,论文呼吁治理与审计,但缺乏激励相容的商业模式设计建议,这可能是范式落地的真正瓶颈而非技术。

未来方向

作者提出的研究方向包括:与个人数字孪生的接口——健康向 ComBodied Agent 作为数字孪生的交互与干预层,把孪生模型的预测转译为解释、目标协商与日常指导,同时管理其不确定性并避免过度医疗化日常生活;多智能体生态的用户中心协调——工作伴侣求效率、健康伴侣劝休息、财务监护人限消费时的优先级设定、冲突消解与跨智能体一致性机制;跨文化与全生命周期适应——隐私、家庭参与、情感表达、医疗决策规范因文化而异,儿童、青少年、成人、老人需要不同的交互风格与保护假设,需要跨文化评估与参与式设计;纵向与因果学习——结合干预-响应历史、反事实推理与延迟结果,用微随机化试验、N-of-1 研究或谨慎验证的观察估计器识别干预效应,并以有界仿真、专家审查、分阶段部署保证安全验证;能动性对齐的干预校准——不确定性感知策略、用户可调的 initiative、关系敏感的权限、可逆动作与不把过度干预常态化的反馈机制;可信个人基础设施——加密存储、访问控制、可信执行环境、可审计同步、模型状态跨设备跨提供商可携带可删除。基于本文成果可自然延伸的方向:把 CombodiedBench 的 8 个模块做成可下载的真实基准与排行榜;在公开可穿戴数据集上实证 PWM 的校准与场景区分能力;为能动性保留开发心理测量学工具并与教育、临床的既有“能力保持”文献对接。

复现评估

传统意义的复现不适用:这是立场论文,无代码、无数据集、无模型权重、无实验表格可对照。论文为 arXiv v2(2026 年 8 月),作者团队 22 人,横跨蒙特利尔大学/Mila、新加坡 A*STAR、南京医科大学、南京大学、人民大学、剑桥、牛津、清华、NUS、港科大、南洋理工等机构,属于学界共识性议程文档,本身无需复现。如果把“复现”理解为“实现该范式”,则门槛很高:需要边缘硬件生态(可穿戴、手机、家庭中枢上的本地模型)、隐私基础设施(本地记忆库、隐私网关、可信执行)、纵向个人数据与严格的伦理审批,且核心组件(PWM 的干预响应学习、能动性指标测量)尚无可借鉴的开源实现,短期内只有大机构或资源充足团队可尝试完整闭环。近期可低门槛“复现”的部分是:按 Table 7 评估矩阵与 8 维能动性指标在现有个性化智能体基准(如 LongMemEval、iOSWorld)上先行测量,以及按三阶段架构做 Stage II 的隐私-效用-延迟权衡对照实验。综合评价:作为研究议程可操作性中等偏高(方向、评估与架构边界都写得很清楚),作为系统复刻难度很高。