VibeLifeBench:动态世界中生活智能体的主动性与持久性基准 VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?
200个多周生活任务基准,七个前沿模型最高仅32.5分
前置知识
LLM 智能体(LLM Agent)
以大语言模型为决策核心的系统,通过工具调用(API、文件读写、消息发送)与环境交互,在多轮过程中自主规划行动。本文中智能体通过288个工具接口操作22个模拟服务,其输出不是单个答案,而是留存在世界中的可观察痕迹:预订记录、日历事件、已发邮件和工作区文件。
本文的评测对象就是这类智能体,理解工具调用与多轮决策机制,才能理解评分为何只看行为痕迹而绝不读模型自述。
长程任务(Long-horizon Task)
跨越数周乃至数月、覆盖准备-执行-收尾完整生命周期的任务。本文任务中位模拟跨度29天,最长约111天,中位24个阶段(stage)。阶段不是自然日,而是需要智能体行动或评分器检查世界状态的检查点,安静的两周可压缩为一个阶段。
长程性是本文三大核心属性之一,阶段化的时间结构直接决定了评分方式,也解释了模型通过率随时间线衰减的现象。
静默突变(Silent Mutation)
不触发智能体回合、无任何通知的世界状态变更:如航班被悄悄标记延误、钓鱼邮件被放入收件箱、封路记录被插入地图。全套共1,483个突变,占全部7,453个事件的19.9%,且后续阶段刻意依赖这些变化,只有主动重查世界的智能体才能及时发现。
静默突变是把主动性变成可测量指标的核心机制,也是七个模型集体失分(传播与恢复轴仅18.5-32.0)的主要原因。
avg@3 评测协议
为消除输出随机性,每个任务独立运行3次,先取任务内三次得分的均值、最大、最小,再对所有200个任务取平均,得到 avg@3、max@3、min@3,并报告任务内标准差 $\sigma$ 衡量稳定性。单次得分是通过的检查权重占总权重之比,映射到0-100分。
读懂实验表格(最强模型 avg@3 仅32.5、$\sigma$ 高达9.8)必须先理解这一多次运行取均值的协议。
加权检查(Weighted Checks)
评分的基本单元:每个检查 $c_i$ 是对世界终态或行为痕迹的确定性谓词,配正权重 $w_i>0$。检查分三层:阶段内检查占数量的80.8%,跨阶段与最终层合计仅19.1%数量却占26.8%权重,安全与红线类检查权重最高。
分层加权设计解释了为何泄露隐私或突破预算这类单次失误无法被大量常规子任务的完成所掩盖。
研究动机
现有智能体评测几乎全部集中于编程与办公场景:SWE-Milestone、Terminal-Bench 等让智能体修代码、跑测试,APEX-Agents、JobBench 等办公基准要求产出报表与分析。它们共享同一设定——任务给出明确指令和交付物,智能体是被动执行者,世界只在智能体行动时才发生变化。这与真实生活辅助形成鲜明反差:一次二十多天的赴日家庭旅行中,¥60,000 预算是硬上限,母亲护照有效期不足六个月、患糖尿病的父亲携带胰岛素需医生证明,这些约束从未被明说;行程中台风登陆、飞机被静默换型导致已订座位作废、伪装成签证加急费的钓鱼邮件悄然而至。生活任务动辄运行数周,世界在无人提示时持续演进,只回答眼前请求的智能体必然失败。然而目前没有任何基准能同时测量主动性、活世界适应与长程一致性这三个生活辅助的定义性属性。
本文的目标是本文的目标是构建专门评测生活域智能体的基准 VibeLifeBench,把真实生活辅助中被忽视的三个属性转化为具体可测的机制:(1)主动性——智能体须自行决定何时行动、何时告知用户、何时保持沉默,该出手时出手、无需行动时不打扰;(2)动态活世界——环境有状态并按自身虚拟时钟推进,天气、价格、库存、航班延误、可穿戴设备读数等信号自主变化,其中相当一部分变化完全静默,只有主动重查世界的智能体才能及时发现并并入计划;(3)长程一致性——任务覆盖准备、执行、收尾的完整生命周期,中位模拟29天、最长约111天,智能体须持续维护一个自洽且始终满足初始硬约束的演进计划。具体而言,作者构建了200个任务、十个生活域各20个,共享22个 mock 服务后端(288个工具接口),由7,453个脚本化事件驱动,并承诺开源全部任务、环境与评测框架。
与已有工作不同的是,本文的独特切入是把任务定义为「带时钟的世界」而非「一条提示词」。对照 Table 1 的逐项比较可以看清空档:编程与办公类基准(SWE-Milestone、Terminal-Bench、APEX-Agents、JobBench、Workspace-Bench)在主动性、活世界、长程三项上大多不满足;ClawBench、ClawMark、ClawArena 等少数触及通用工具使用的也至多部分满足;最接近的 UltraHorizon、CostBench 在活世界上仅部分满足。本文的差异化机制有三:其一,突变类事件(占19.9%)不产生任何回合与推送,静默改变世界,「是否及时察觉」因此成为主动性的直接测量;其二,隐性约束与安全红线被埋进人设和工作区材料——护照有效期、胰岛素海关申报、钓鱼邮件——使可信度也成为可检查项;其三,评分只读智能体留下的客观痕迹(服务终态、文件、邮件、各阶段回复),绝不读其内部推理,杜绝自报功劳。三个机制叠加,使这三个属性第一次被纳入同一度量。
核心方法
VibeLifeBench 的核心设计承诺是:任务不是一条提示词,而是一个带时钟的世界。形式上每个任务是五元组 $\tau = (\mathcal{W}_0, \mathcal{E}, \mathcal{K}, \mathcal{P}, \mathcal{R})$:$\mathcal{W}_0$ 为种子数据决定的初始世界状态;$\mathcal{E}$ 为按阶段分组、阶段内按时间戳排序的事件时间线;$\mathcal{K}$ 为启用的服务能力集合;$\mathcal{P}$ 为人设与工作区;$\mathcal{R}=\{(c_i, w_i)\}_{i=1}^{m}$ 为 $m$ 个加权检查。一次运行驱动策略 $\pi$ 走完整条时间线,世界状态按 $\mathcal{W}_j = \mathrm{apply}(\mathcal{W}_{j-1},\, e_j,\, a_j)$ 演化,动作 $a_j \sim \pi(\cdot \mid \mathrm{obs}_j, \mathcal{H}_{j-1})$;对突变事件 $a_j=\varnothing$,世界仅因事件本身改变。世界由22个 mock 服务构成:email、calendar、notion、通知枢纽四个通用服务几乎每题必用,其余域服务按场景启用,任务中位数用7个。全部7,453个事件中用户消息仅占30.1%,约69.9%由环境驱动——世界不等智能体开口就自己往前走。
核心创新是静默突变机制。事件分四类:用户消息、世界观察、通知推送这三类会开启一个智能体回合并记录其回复,而第四类突变直接写入服务状态——不产生回合、不推送任何消息:航班被悄悄标记延误、钓鱼邮件被静默放进收件箱、封路记录被插入地图。全套共嵌入1,483个静默突变(占19.9%),且后续阶段刻意依赖这些变化,于是「是否及时察觉并响应」成为主动性的直接测量:只有既持久(记得几天前订的机票)又主动(无人提醒也去复查状态)的智能体才能发现世界与自身计划的不一致;同样,在无事可做时保持沉默也被计为正确行为。配套的评分同样反传统:每个检查是只读客观痕迹(服务终态、工作区与笔记文件、已发邮件、各阶段回复文本)的确定性谓词,绝不读模型隐藏推理;检查分阶段内、跨阶段、最终三层且权重刻意不均——泄露个人信息或突破硬预算等关键失败的代价远高于装饰性疏漏,智能体无法靠完成大量常规子任务来掩盖一次不安全行为。
方法步骤详情
构建流水线分四步。(1)场景与人设:从真实生活场景出发(带父母出国、租房纠纷、装修协调),固定服务对象的人设与工作区,预埋隐性约束、安全红线与授权边界——哪些可自行动手、哪些须先询问、哪些绝对禁止,并故意设置诱人但不安全的捷径(如替用户向陌生地址发送护照扫描件)。(2)时间线编写:把场景展开为按阶段组织的事件时间线(中位24个阶段),四类事件交错;突变占比被刻意抬高且后续阶段依赖它们,使主动性成为得分前提。(3)环境实例化:为每个启用服务准备初始数据,冷启动即可查询;撒布充分干扰项防止浅层猜答案,所有关键实体都能经工具调用发现而非硬编码进评分,避免「本可做对却被误判」的假阴性。(4)评分标准编写:为每任务编写阶段感知的加权检查(中位58个,最少约31、最多135个),覆盖工具调用、后端终态、持久化产物、回复一致性、跨阶段一致性五个证据维度,要求每个检查做判别性判断(计算具体数值、验证真实状态变化)而非关键词匹配。评测在 TERRARIUM 基础设施上经 openclaw harness 以最强推理档运行,每任务独立跑3次。
技术新颖性
相对已有工作的新颖性体现在四个轴。域轴:首个系统覆盖十个生活域(旅行、金融、诉讼、装修、职业、健身、备考、租房、购物、团队建设各20题)的基准,而此前工作集中于编程与办公。能力轴:把「无人提示时自行决定行动与否」变成可打分项——该出手时出手、该沉默时沉默都计分,这是对被动执行范式的根本反转。环境轴:世界按自身虚拟时钟独立推进,69.9%的事件由环境驱动,其中1,483个完全静默;现有基准的世界要么静态,要么只在智能体行动时变化,要么只是任务间的受控扰动。任务轴:每个任务是嵌入完整生命周期的连续多周时间线(中位29天,17个任务超60天),后段依赖前段遗留状态,而非孤立单步或可随时重置的场景。与长程基准的两条既有路线——把单任务拉成超长工具调用轨迹,或模拟跨任务偏好漂移——相比,本文的活世界在单个任务进行中就持续独立演化,且评分凭客观痕迹而非模型自述。这一组合首次把主动性、活世界与长程一致性纳入统一测量。
实验结果
七个前沿模型全部低分:Claude Opus 5 以 avg@3 32.5 居首(max@3 41.2、min@3 23.8、任务内$\sigma$ 9.8),其后为 GPT-5.5 30.1、Gemini 3.5 Flash 与 Claude Opus 4.8 并列27.5、GLM-5.2 25.4、Kimi-K2.6 22.6、DeepSeek-V4-Pro 21.1,全部挤在21-33窄带。分层看,所有模型跨阶段层通过率最低(18.2%-31.0%)、最终层次之(23.7%-32.8%),而这两层承载26.8%总权重;按能力轴,主动性(16.0-33.6)、传播与恢复(18.5-32.0)、持久与记账(18.9-28.0)垫底,持久与记账占全部失败检查的22.2%。时间衰减普遍:各模型时间线末三分之一的通过率比前三分之一低10-15分,如 Claude Opus 5 从52.0降到37.7。域差异巨大:GPT-5.5 购物域60.2、租房域仅13.5,购物、旅行、装修易,团队建设、租房、备考难,排序跨模型一致。成本上 Claude Opus 5 每次运行读30.2M上下文、生成325k输出、316次工具调用,但 Gemini 读得最多(41.2M)却居中游,GPT-5.5 输出最少(79k)却排第二——努力花在何处比花多少更重要。分数与规模仅弱相关(Spearman:事件数 +0.28、天数 +0.02、阶段数 −0.26),难点在维持阶段性约束而非任务变长。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| VibeLifeBench 全集(200个生活域多周任务) | avg@3(0-100分) | Claude Opus 5:32.5(全场最高) | GPT-5.5:30.1;DeepSeek-V4-Pro:21.1(最低) | 无「提升」可言——核心发现是七模型全部低分,挤在21-33窄带,最强者离及格线也相距甚远 |
| 购物域 vs 租房域(最易/最难对照) | avg@3 | GPT-5.5 购物60.2(全表最高单项) | 同模型租房域仅13.5;Kimi-K2.6 租房仅9.8 | 域间差距近50分,难易排序跨模型一致:购物/旅行/装修易,团队建设/租房/备考难 |
| 高权重检查层(跨阶段+最终) | 检查通过率 | Claude Opus 5:31.0% / 31.3% | DeepSeek-V4-Pro:18.2% / 23.7% | 高权重两层普遍低于阶段内层(34.3%-44.9%)约10-15个百分点,是拉低总分的主因 |
| 时间线末段 vs 首段(长程衰减) | 阶段内检查通过率 | Claude Opus 5:52.0% → 37.7% | Kimi-K2.6:42.2% → 27.1%(衰减最大) | 七个模型无一例外衰减10-15个百分点,长程一致性是普遍短板 |
局限与改进
作者承认的局限:能力轴是按检查名称的关键词匹配归类的,只是指示性而非精确划分,且 pooled 失败中41.8%落在命名类别之外,失败归因尚不完整;分数与任务规模的弱相关(与阶段数甚至为 −0.26)也说明当前统计还未能定位难度的真实来源。我自己的观察:其一,22个离线 mock 服务语义稳定、可复现,但也因此缺少真实世界 API 的脏数据、限流与接口漂移,结论对生产环境的外推有限;其二,12,261个检查由人工编写,虽要求判别性判断,但如此规模的谓词集难免存在噪声与潜在漏洞,论文未报告检查本身的信度检验(如多标注者一致性);其三,七个模型都跑在同一个 openclaw 原生工具调用脚手架下,未比较外挂记忆系统、日程提醒器等脚手架能否弥补低分,「模型弱」与「脚手架弱」未被解耦;其四,缺少人类对照基线,无法判断32.5分距离一个合格的人类生活助理究竟有多远。
独立分析的弱点
独立分析的弱点:第一,主动性测量依赖「突变后必有后续阶段依赖」这一构造,但采用「每回合无脑重查所有服务」暴力策略的智能体也可能得分,基准未惩罚过度查询的开销,未来可引入查询预算或把 token 成本计入评分以区分「真主动」与「穷举式轮询」。第二,回复一致性检查号称确定性谓词,但「回复文本与工具结果一致」这类判断很难完全脱离语义,若内部以关键词规则实现则可能被表面措辞欺骗或误伤,论文未给出此类检查的实现示例。第三,域间检查粒度不均——金融域中位94个检查而职业域仅43个——权重设计是否使各域难度等价值得商榷,域间排名可能部分混入了检查密度差异。第四,任务内 $\sigma$ 高达9.8-10.0,说明单次评分噪声不小,avg@3 之外增加运行次数或报告置信区间会更稳健。第五,基准提出了问题但未提供任何消融实验(如加检索、加记忆、加提醒守护进程)来验证哪种缓解手段有效,对后续研究的指引停留在定性建议层面。
未来方向
作者提出四个改进方向:(i)持久化——智能体应把状态显式写入笔记、日历和工作区文件,维护跨阶段可审计的产物而非停留在聊天回复;(ii)主动感知与传播——在无人提示时重查世界、与记忆对账并把静默突变并入计划;(iii)加固与安全——针对钓鱼拒绝、隐私保护、授权边界和预算红线做专项工作,因为高权重的跨阶段与最终检查通过率最低;(iv)长程稳定性——抑制通过率随时间线的衰减,让智能体在任务后段仍守得住早期承诺与约束。基于本文成果可自然延伸的方向包括:把这类活世界环境用作强化学习训练场,以检查器加权得分作为 reward 训练持久性策略;为智能体外挂日历提醒守护进程与差异检测记忆模块并量化收益;扩展到多智能体协作(家庭成员各有智能体)或与真实 API 混合部署;研究「何时该问用户」的校准问题,把通知打扰率作为与得分并列的指标;开源后社区还可做脚手架消融与新模型的持续榜单。
复现评估
复现友好度高。作者承诺开源全部任务、环境和评测框架;基础设施基于公开的 TERRARIUM 多回合评测系统,模型经 openclaw harness 调用。环境完全离线且确定:22个 mock 服务冷启动自种子数据,任务只配置自身初始数据,每次运行都在隔离沙箱中进行,不依赖真实 API,结果可精确重放;harness 记录每次运行的最终得分、每个检查的通过状态和完整轨迹,便于归因调试。成本是需要考虑的因素:单次运行上下文读取13.7M-41.2M token、输出79k-325k token、101-227个回合;完整复现七个模型×200任务×3次运行约4,200次运行,仅 Claude Opus 5 一个模型的上下文消耗就约 30.2M×600 ≈ 181亿 token,需要可观的 API 预算或自托管算力。构建侧成本也高:12,261个检查、7,453个事件的编写与校对依赖大量人工,但复现者无需重新构建,直接使用发布套件即可,主要门槛在评测算力而非数据获取。
论文图表