VitaBench 2.0:在长期用户交互中评估个性化和主动智能体 VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions
首个评估个性化和主动行为的长期用户交互智能体基准测试
前置知识
部分可观测马尔可夫决策过程(POMDP)
POMDP是一种用于建模决策过程的数学框架,其中智能体无法直接观测到环境的完整状态,只能通过观测获得部分信息。在POMDP中,状态空间S、动作空间A和观测空间O,状态转移函数T: S × A → S和奖励函数r共同定义了决策过程。智能体需要根据观测历史和内部信念来推断环境状态并选择最优策略。这在用户交互场景中尤为重要,因为用户偏好往往是隐含的,需要从碎片化交互中推断。
本文将每个智能体任务建模为POMDP,理解这一概念有助于理解为什么个性化决策如此困难——智能体必须在信息不完整的情况下做出符合用户偏好的决策。
记忆增强智能体(Memory-Augmented Agents)
记忆增强智能体是LLM智能体的一种架构设计,通过外部记忆模块来存储、检索和更新用户相关信息,从而实现长期交互中的个性化服务。典型的记忆架构包括Agentic Memory(智能体主动控制记忆内容)和RAG Memory(基于向量检索的固定流程)。Agentic Memory要求智能体决定保留、更新或丢弃哪些信息,执行选择性抽象和冲突解决;RAG Memory则通过向量嵌入存储交互记录,执行基于相似度的检索。记忆接口通常通过UPDATE和RETRIEVE两个操作实现。
本文的核心贡献之一是设计了可扩展的记忆接口来系统研究不同记忆机制对个性化的影响,理解记忆增强智能体的概念对于理解实验设计和方法论至关重要。
条件偏好(Conditional Preferences)
条件偏好是指用户偏好在不同上下文条件下会发生变化的特性。例如,用户可能偏好早上喝高咖啡因咖啡,下午喝低咖啡因咖啡;或者和配偶一起旅行时偏好豪华酒店,独自出差时偏好经济型酒店。条件偏好要求智能体在当前信息不足时能够识别缺失的上下文,并主动向用户询问或进行环境探索。形式化地,条件偏好可以表示为p(a|c),其中a是决策,c是上下文条件。
本文的主动行为评估就是基于条件偏好设计的,理解这一概念有助于理解为什么当前智能体在主动交互方面表现不佳,以及这是如何成为个性化决策的一个关键瓶颈的。
偏好漂移(Preference Drift)
偏好漂移是指用户的偏好会随着时间推移而发生系统性变化的现实现象。偏好漂移可以分为三种类型:偏好添加(新偏好的出现)、偏好修改(现有偏好的转移)和偏好删除(原有偏好的失效)。例如,用户可能因为健康状况改变而开始偏好健康食品,或者因为经济状况变化而调整消费习惯。在长期交互场景中,智能体必须能够检测和适应这些偏好变化,而不是基于静态的用户模型进行决策。
本文通过在任务序列中引入时间锚定的偏好漂移事件来模拟现实世界的用户动态,这是评估智能体长期个性化能力的关键设计。理解偏好漂移有助于理解为什么基于记忆的个性化如此具有挑战性。
研究动机
现有的大语言模型智能体基准测试主要评估推理能力和工具使用能力,任务通常定义明确,完成所需的所有上下文信息都显式地提供在当前上下文中。这使得这些基准测试主要评估智能体遵循显式指令和执行正确动作序列的能力。然而,现实世界中的智能体系统越来越多地在用户意图不明确的场景下运行,这些意图必须从先前的交互中推断。例如,用户可能说给我订个酒店,但没有说明是商务酒店还是度假酒店,是预算型还是豪华型。现有基准测试无法评估这种从碎片化历史交互中推断和应用用户偏好的能力,导致在真实场景中表现不佳。
本文的目标是本文的目标是构建一个评估个性化和主动行为的智能体基准测试VitaBench 2.0,能够在长期用户交互场景中系统评估智能体推断、维护和利用用户偏好的能力。具体来说,该基准测试从三个维度评估个性化:偏好提取,从碎片化交互中推断隐式偏好;偏好利用,利用这些偏好进行用户特定的决策;偏好更新,捕获偏好漂移并在用户行为演变时更新理解。此外,基准测试还评估主动行为,即当用户偏好是条件性的时,智能体在做出决策前主动获取缺失信息的能力。
与已有工作不同的是,本文的独特切入角度是将个性化和主动行为引入智能体评估,填补了现有基准测试在现实用户交互场景方面的空白。与专注于多步推理和工具编排的现有工作不同,本文关注从显式指令推理转向基于隐含和演变用户偏好的决策。这引入了根本不同的复杂性来源:任务不是关于如何完成,而是关于为谁完成和在什么上下文下完成。通过构建56个用户、2000多个细粒度偏好、66个工具的基准测试,本文首次在交互式智能体场景中系统评估了长期个性化决策能力。
核心方法
VitaBench 2.0的整体思路是模拟长期用户与智能体协作的真实场景,通过时间有序的任务序列评估个性化和主动行为。每个用户关联一个用户画像Pu、演变的偏好集合Nu = (n1, n2, ..., nL)和一个时间任务序列Tu = (t1, t2, ..., tN)。在任务ti-1和ti之间,智能体被暴露到新引入的交互历史Hi,这些历史反映新出现的偏好或偏好漂移,并允许智能体维护记忆模块M来存储用户信息以支持未来决策。每个任务被建模为部分可观测马尔可夫决策过程Pi = (Si, Ai, Oi, Ti, ri),智能体需要在每一步根据当前观测和记忆状态选择动作。技术路线包括用户画像和偏好构建、交互历史合成、环境生成、记忆接口设计和评估指标定义。
本文的核心创新点是将个性化和主动行为评估集成到交互式智能体基准测试中,通过三个独特设计实现:将任务组织为以用户为中心的时间序列,嵌入演变的偏好到碎片化交互历史中;设计可扩展的记忆接口,通过UPDATE和RETRIEVE操作实现不同记忆机制的即插即用;构建主动任务,评估智能体识别缺失信息并主动获取的能力。与现有工作的本质区别在于:现有基准测试假设所有任务相关信息都显式可用,而VitaBench 2.0要求智能体从隐式信号中推断用户意图,并在信息不完整时主动寻求澄清。这使得评估从智能体能否完成任务转向智能体能否以用户喜欢的方式完成任务。
方法步骤详情
VitaBench 2.0的方法步骤包括:用户画像构建:手动创建56个用户的详细画像,包括人口统计属性、地理位置、职业、社会背景等维度,分布与真实场景统计对齐。偏好设计:为每个用户设计超过2000个细粒度偏好,涵盖餐饮、休闲娱乐、购物、旅行、爱好和生活习惯等方面,偏好以自然语言陈述形式表达,基于用户画像生成。偏好漂移模拟:在任务序列中引入时间锚定的偏好漂移事件,包括偏好添加、修改和删除,有些变化显式反映在交互中,有些则建模为隐式状态转换。交互历史合成:生成两种类型的交互记录——对话(多轮用户-智能体对话)和行为(用户行为日志如浏览、订购、评论、搜索历史)。历史包含信号交互(反映偏好)和噪声交互(无关、模糊或上下文误导)。环境生成:为每个任务合成包含商家和产品的可执行环境,包括两类干扰项:查询相关但违反规则的干扰项和满足规则但违反偏好的干扰项。记忆接口:提供UPDATE和RETRIEVE操作,实现Agentic Memory(智能体主动控制)和RAG Memory(固定流程检索)两种代表性记忆机制。评估执行:智能体与用户模拟器和环境交互,轨迹级和结果级评估通过评估器LLM应用评价标准集。
技术新颖性
VitaBench 2.0的技术新颖性体现在多个方面:首先,这是首个在交互式智能体场景中评估个性化和主动行为的基准测试,填补了现有工作的空白。其次,通过精心设计的记忆接口,首次实现了不同记忆机制的统一比较框架,为记忆研究提供了系统评估平台。第三,环境合成管道采用多智能体设计,自动生成包含精确控制的干扰项的可执行环境,平衡了规模和可控性。第四,主动任务的设计基于条件偏好,评估智能体识别信息不足和主动澄清的能力,这是之前工作未涉及的维度。最后,通过56个用户、2000多个偏好、66个工具的规模,首次在智能体评估中实现了真实世界偏好多样性和行为异质性的模拟。
实验结果
本文的实验结果揭示了几个关键发现。首先,现实世界的个性化任务对当前智能体仍然极具挑战性。即使在Full Context设置下(可以访问完整交互历史),最先进的模型也只能达到约0.5的Avg@4和约0.3的Pass^4。例如,DeepSeek-V4-Pro在Full Context下Avg@4为0.456,Pass^4为0.267;Claude-Opus-4.6在Full Context下Avg@4为0.503,Pass^4为0.337。这表明当前智能体难以可靠地推断和利用用户偏好,尽管任务设置已经相对简化。其次,记忆机制在个性化中起关键作用但探索不足。在现实场景中,交互往往是长期的和跨会话的,使得记忆机制对于维护用户表示至关重要。然而,大多数模型在依赖记忆时性能会下降,相比于Full Context设置。例如,DeepSeek-V4-Pro在Agentic Memory下Avg@4为0.427(相比Full Context的0.456),Claude-Opus-4.6在Agentic Memory下Avg@4为0.454(相比Full Context的0.503)。第三,推理能力的提升并不直接转化为个性化收益。与主要依赖多步推理的任务不同,启用thinking模式并不一致地带来更好的性能。例如,DeepSeek-V4-Pro (w/ thinking)在Full Context下Avg@4为0.472,仅比w/o thinking的0.456略高;GLM-5.1 (w/ thinking)在Full Context下Avg@4为0.394,反而比w/o thinking的0.420更低。这表明个性化需要超越一般推理的能力,包括健壮的偏好提取、长期一致性和处理噪声和不完整观测的能力。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Full Context个性化任务 | Avg@4 | 0.503 (Claude-Opus-4.6) | N/A (首个个性化基准) | 新基准建立 |
| Agentic Memory个性化任务 | Avg@4 | 0.454 (Claude-Opus-4.6) | N/A | 新基准建立 |
| RAG Memory个性化任务 | Avg@4 | 0.430 (Claude-Opus-4.6) | N/A | 新基准建立 |
| 主动任务 | 平均分数 | 27.4 (Claude系列平均) | 46.0 (Claude个性化分数) | 主动能力显著低于个性化 |
| 给定真实偏好 | 平均分数 | 51.2 (Claude) | 46.0 (标准设置) | 提供真实偏好后提升有限 |
局限与改进
作者承认了几个局限性。首先,用户偏好和交互历史是通过程序构建的,以允许对偏好动态和任务难度进行精确控制。虽然这便于可重现评估,但可能无法完全捕捉真实世界用户行为的全部多样性。其次,记忆接口将记忆抽象为更新和检索操作,实现不同设计的可控比较,但这种抽象专注于隔离记忆的作用,不旨在覆盖所有可能的端到端架构。第三,评估基于轨迹的标准驱动评估,提供结构化和可解释的信号,但更开放式的用户满意度措施超出了本文范围。作者将这些设计选择视为优先考虑可控性和可比较性,并将VitaBench 2.0视为个性化和主动智能体研究的补充测试平台。
独立分析的弱点
独立分析显示本文存在以下弱点:用户画像和偏好的程序化构建可能无法完全反映真实用户行为的复杂性和细微差别,真实用户行为往往更难建模,包含更多边缘情况和上下文敏感性。当前评估主要关注工具使用和偏好利用的准确性,但可能忽视了用户体验的其他重要维度,如响应时间、多轮对话的自然性、错误恢复能力等。记忆接口的抽象虽然便于比较,但可能过于简化,现实世界中的记忆系统可能需要更复杂的操作如冲突解决、优先级管理、过期策略等。主动任务的设计基于条件偏好,但真实场景中的主动行为可能更复杂,涉及基于用户疲劳度、时间压力、历史成功率的更精细决策。基准测试的三个领域(外卖、到店消费、在线旅游)虽然具有代表性,但可能无法覆盖所有现实应用场景,如金融决策、医疗咨询、教育指导等。改进方向包括:引入真实用户数据进行偏好验证、扩展到更多应用领域、增加更多用户体验维度的评估、设计更复杂的记忆机制、引入更多样化的主动任务类型。
未来方向
作者提出的未来研究方向包括:探索更先进的记忆架构,能够更好地处理长期上下文、冲突信息和优先级管理;研究主动行为的更精细建模,包括基于上下文的主动时机选择;扩展基准测试到更多领域和更复杂的场景;开发更好的训练方法,使模型能够从数据中学习个性化能力;研究用户偏好的自动发现和表示学习方法。基于本文成果可以延伸的方向包括:将VitaBench 2.0作为训练数据源,通过监督学习或强化学习改进模型的个性化能力;研究多智能体协作场景下的个性化,其中多个智能体需要协同服务同一个用户;探索个性化与隐私保护的平衡,在利用用户信息的同时保护用户隐私;研究个性化智能体的可解释性,使智能体的决策过程更加透明;开发个性化智能体的自适应能力,能够根据用户反馈持续改进服务。
复现评估
本文在复现性方面做得较好。作者提供了开源代码(https://github.com/meituan-longcat/vitabench-2.0),包括基准测试框架、任务数据集、工具接口和评估脚本。基准测试构建采用系统化的流程:用户画像和偏好的手动注释、交互历史的受控合成、环境的程序生成和验证、评估的自动化执行。作者使用gpt-4.1-2025-04-14作为用户模拟器和评估器,确保了一致性。每个任务运行4次,温度为0.0以确保确定性评估。作者提供了详细的实现和配置设置(见附录C.2.4),包括提示模板、工具签名、记忆机制实现等。然而,复现本文实验需要强大的计算资源,因为作者评估了20多个模型,每个模型在三种设置下运行(Full Context、Agentic Memory、RAG Memory)。此外,依赖商业API(如GPT系列模型)可能会带来成本和访问限制。总体而言,本文在复现性方面做得较好,开源代码和详细文档使得研究人员可以复现实验并扩展基准测试,但大规模评估需要相当的计算预算。
论文图表