← 返回 2026-08-24

迈向忠实的用户购物行为模拟 Towards Faithful Simulation of Human Shopping Behavior

Jiakai Tang, Yan Mi, Jing Yu, Yang Zhang, See-Kiong Ng, Qi Cao, Fei Sun, Xu Chen, Wen Chen, Jian Wu, Han Zhu, Bo Zheng 📅 2026-08-21 👍 6 2026-08-29 18:30
GUI智能体 大语言模型智能体 强化学习 推荐系统 用户行为模拟 记忆系统

RecVerse用认知分层记忆与轨迹级强化学习,在真实GUI环境中忠实模拟人类购物行为

前置知识

用户行为模拟

让模型生成与真实用户一致的浏览轨迹——用户在电商信息流中如何滚动、点击、比价、加购乃至下单。它是推荐系统离线评估、反事实策略评估和强化学习训练环境的基础,核心难点在于模拟器既要在统计分布上像真实用户(如点击率、加购率),又要在具体决策上符合用户购物意图。

本文全部设计(记忆结构、奖励函数、评测协议)都围绕『如何让模拟轨迹在分布和意图两个层面逼近真实用户』展开,先理解这个任务的特殊性才能理解各项设计动机。

GRPO(组相对策略优化)

DeepSeek 提出的强化学习算法:对同一提示采样一组 $G$ 个回复,用奖励的组内均值和标准差归一化得到优势 $A_i = (R(y_i) - \mathrm{mean}) / \mathrm{std}$,再配合裁剪代理目标与 KL 正则项更新策略,无需训练价值函数。适合以会话级反馈优化多轮智能体。

RecVerse 的轨迹级 RL 直接建立在 GRPO 之上:每个训练会话采样 8 个完整 rollout,以会话级奖励计算组相对优势,理解 GRPO 才能读懂其训练流程。

分层记忆系统(认知科学)

认知科学(Atkinson-Shiffrin、Tulving)认为人类记忆分多个层次:瞬时的感觉/工作记忆保持数秒内的视觉印象,情景记忆记录一段时间内的事件序列,语义记忆沉淀稳定的知识与偏好。不同层次在不同时间粒度上互补协作,而非把经历存成一条平铺序列。

RecVerse 的 Working/Episodic/Preference 三级记忆正是这一理论的工程化,是其在长会话中保持有界上下文又不丢失跨页依赖的核心机制。

模仿学习与行为克隆

从专家演示中学习策略,在用户模拟里即最大化 $\mathcal{L}_{IL} = -\sum_{t} \log \pi_\theta(a_t \mid o_t, h_{<t})$,逐步预测真实用户的下一个动作。它提供稳定的策略初始化,但对会话整体行为模式没有约束,也无法区分『合理决策』与『行为噪声』。

本文以 IL 热启动、再用轨迹级 RL 纠偏;理解 IL 的两大局限(拟合噪声、无视整体分布)是理解论文动机部分『优化挑战』的前提。

GUI 智能体

直接以屏幕截图为观测、以点击坐标/滚动/输入为动作的多模态智能体(如 CogAgent、SeeClick、UI-TARS),通过视觉定位在图形界面上操作。与传统操作文本描述的智能体相比,它感知的信息模态与真实用户看到的页面完全一致。

本文把 GUI 感知引入用户模拟,让智能体与用户看到同样的像素级推荐页面;这是它与文本类模拟器(RecAgent、OPeRA 等)的本质区别,也是性能提升的重要来源。

研究动机

真实电商购物会话横跨几十页屏幕,一次点击或购买往往与许多页之前浏览、比较过的商品相关,而现有方法都没法处理这种长程依赖。第一条路是丢弃或启发式剪枝历史:最强 GUI 基线 STA 只用当前截图加启发式裁剪的历史 HTML,跨页依赖被切断。第二条路是把历史原样拼进上下文:论文 Figure 1 的实验显示,随着视觉记忆片段从 0 增到 8,准确率先提升约 11%,超过适度长度后反而下降约 5%,而 token 成本从约 2.1k 单调涨到 3.0k,呈明显收益递减。更深层的是优化问题:所有现有方法都用逐步模仿(预测下一个动作)做监督,但真实浏览充满行为噪声(比如误滚动后立刻回滚),拟合噪声会干扰模型对用户意图的推理;逐步监督对整体行为又没有约束,导致模拟会话出现失真模式——RecAgent 的加购率高达 80.09%、转化率 64.34%,而真实用户只有 15.93% 和 13.54%,属于典型的『过度探索』。此外现有基准也不合格:Amazon、MovieLens 只有单一交互类型且无视觉信息,OPeRA 虽有 GUI 轨迹但只能静态回放日志,无法支持多轮交互式强化学习。

本文的目标是本文的目标是构建一个『忠实』的购物行为模拟器:让智能体在 GUI 层面与真实用户看到同样的像素级页面(而非文本化的商品描述);在长会话中保持上下文有界的同时不丢失跨页依赖(比如几页前比较过的商品仍能影响当前决策);并通过会话级(轨迹级)优化让模拟轨迹在两个粒度上对齐真实用户——宏观上行为统计分布匹配(滚动/点击/加购/购买频率等漏斗指标),微观上交互决策符合真实购物意图(商品类目一致)。同时,作者发布 USB 基准:5,274 条真实用户轨迹、69,842 个动作、90,095 个商品、5,222 个用户,涵盖 8 类动作和三级类目体系(41/517/2,256 个 L1/L2/L3 类目),并首次提供支持多轮 agentic RL 的交互式视觉环境。

与已有工作不同的是,本文的独特切入角度有三个。其一,认知科学视角:把人类互补记忆系统(视觉速写板式的短期印象、会话级行为追踪、稳定个人偏好)引入模拟器,并且把『何时记、记什么』本身作为动作交给 RL 学习(memory-as-action),而不是像 Reflexion、MemoryBank 那样依赖手工记忆管理启发式——因为哪些印象以后会重要是隐式的、无标注的,规则无法穷举。其二,评测视角:把目标从『预测下一步正确动作』转向『复现轨迹的多模态分布』;任务导向 GUI 智能体要抑制的失败模式(反复比较、犹豫、浏览)恰恰是忠实模拟器要复现的信号。其三,环境视角:作者从线上日志重建每个会话的完整曝光状态(每步全部候选商品及其页面布局),使智能体能执行任意可行动作并获得真实页面反馈,从而首次在真实界面上实现多轮 agentic RL——而 STA 一旦偏离日志动作环境就无法给出真实后续状态,只能退化为静态逐步预测。

核心方法

直觉上,像真人一样购物需要三种能力:看清眼前页面(短期视觉印象)、记住本会话发生过什么(行为上下文)、知道自己喜欢什么(稳定偏好)。RecVerse 由此构建三级分层记忆:Working Memory $W_t$ 用容量有限的 FIFO 队列保存最近 $K$ 步的(视觉印象 $v_i$、用户心态 $z_i$、动作 $a_i$)三元组,模拟容量受限的人类视觉持久性;Episodic Memory $E_t$ 以文本记录会话内值得记住的交互事件;Preference Memory $P_t$ 蒸馏高级意图(偏好属性、比较标准、讨厌的属性、购买意图)。每个时间步,智能体读取当前截图 $o_t$ 和记忆状态 $\mathcal{M}_{t-1}$,联合输出内部推理 $z_t$、环境动作 $a_t$ 和记忆更新 $m_t$:$$z_t, a_t, m_t = \pi_\theta(o_t, \mathcal{M}_{t-1})$$。训练上先用模仿学习在真实轨迹上热启动,再用基于 GRPO 的轨迹级强化学习精调,奖励由宏观分布对齐、微观意图一致和格式合法三部分组成,整体形成『感知—读取记忆—行动+记忆更新』的闭环。

核心创新是 memory-as-action:记忆写入 $E_t = E_{t-1} \cup \{e_t\}$($e_t = f_\theta(o_t, W_{t-1}, E_{t-1})$)和偏好更新 $P_t = g_\theta(o_t, E_{t-1}, P_{t-1})$ 都由策略模型自身诱导,是否生成记忆、生成什么内容完全由 RL 奖励信号端到端学习,而不是手工规则或固定工作流——这直接解决了『何时该记是隐式的、无标注』这一认知难题。第二个核心创新是轨迹级对齐奖励:$R_{\mathrm{macro}}(\tau) = -\sum_{a \in \mathcal{A}} \frac{|N_a(\tau) - N_a(\tau^*)|}{N_a(\tau^*) + \epsilon}$($\epsilon = 0.1$,排除滚动/返回等纯导航动作)在会话层面惩罚与真实用户行为分布的偏差,抑制过度探索或过度被动;$R_{\mathrm{micro}}(\tau) = \sum_{a \in \tau_{\mathrm{item}}} w(a) \cdot r(a)$ 以意图强度加权(点击权重 1、进详情页 5、加购 5、购买 10),并用三级类目层级匹配给相似商品部分得分,取代严格的商品精确匹配——既容纳电商中多样的合理选择,又为 GRPO 提供更稠密的奖励信号、缓解优势坍缩问题。总奖励为 $R_i = R_{\mathrm{macro}} + \lambda \cdot R_{\mathrm{micro}} + R_{\mathrm{format}}$。

方法步骤详情

完整流程分四步。第一步,数据与交互环境:USB 从某东亚主流电商 App 首页推荐流收集 5,274 条真实会话,从线上日志重建每步的完整曝光状态与页面布局;动作空间 8 类(上/下滚动、点击坐标、进详情页、返回、加购、购买、终止),训练和推理轨迹都截断到 20 步,截图输入像素预算上限 200,704(即 448×448)。第二步,模仿学习热启动:用 Qwen3.5-397B-A17B(温度 0.7)对真实轨迹做反事实重建——给定用户画像 $u$、记忆状态 $\mathcal{M}_{t-1}$、截图 $o_t$ 和真实下一动作 $a_t^*$,教师模型生成符合 RecVerse 输出格式(mindset、两级记忆更新、动作的严格 JSON)的推理与记忆内容;然后全参微调 Qwen3.5-2B(视觉编码器冻结),学习率 $2 \times 10^{-7}$、余弦调度、10 个 epoch;针对真实动作分布的长尾性做幂律平滑重采样 $q_i = n_i^\alpha / \sum_j n_j^\alpha$($\alpha = 0.3$)。第三步,轨迹级 RL:GRPO 每组采 8 个 rollout、总 rollout batch 16、KL 系数 $1 \times 10^{-3}$、训练 100 个优化步,奖励 $\lambda$ 设为 1000。第四步,多轮推理执行:智能体逐步滚动、点击、更新记忆,直到触发终止动作,输出完整浏览轨迹。

技术新颖性

与已有工作逐线对比可以看清其新颖性。相对规则模拟器(RecSim、RecSim NG、Virtual Taobao):摆脱了预定义动作空间和向量化商品特征,直接感知像素级真实界面。相对文本 LLM 模拟器(RecAgent、Agent4Rec、OPeRA、AlignUSER、Shop-R1、Customer-R1):补齐了驱动真实浏览决策的视觉版面信息,消融显示同一方法从文本换到 GUI 后 HCO 在 RL 下从 24.38 提升到 32.64。相对 GUI 模拟器 STA:用学习式分层记忆替代启发式历史剪枝,用轨迹级分布奖励替代逐步动作匹配。相对记忆增强智能体(Reflexion、MemoryBank、Voyager):记忆操作不是手工流程而是策略动作空间的一部分,由 RL 端到端学习。评测协议同样有新意:行为保真指标(ATL、CTR、IPVR、ACR、CVR)要求向真实值收敛而非最大化/最小化,作者特意不用 KL/JS 散度,因为它们对绝对交互量不敏感,会让『比例正确但过度活跃』的智能体蒙混过关;微观奖励采用层级类目匹配 $r(a) = \max_{y \in \mathcal{I}^*} \frac{1}{L} \sum_{l=1}^{L} \mathbb{I}(c_l[x_a] = c_l[y])$。这套『memory-as-action + 双粒度轨迹奖励 + 可重建曝光状态的交互环境』组合在用户模拟领域均为首次。

Overview of RecVerse. At each step, the agent perceives a page screenshot, reads from its multi-level memory, and outputs both an environment action and memory updates.
Figure 2: Overview of RecVerse. At each step, the agent perceives a page screenshot, reads from its multi-level memory, and outputs both an environment action and memory updates.

实验结果

主实验(Table 3、Figure 4):RecVerse-GUI(RL)的行为统计紧贴真实用户参考值(真实 ATL/CTR/ACR/CVR/IPVR = 13.47/9.08/15.93/13.54/29.60,RecVerse 为 16.25/7.78/19.99/4.87/32.86),同时意图一致性大幅领先最强 GUI 基线 STA:item 级 F1 从 4.27 升到 7.19、HR 从 5.92 升到 10.45,类目级 HCO 从 23.11 升到 32.64。模态消融显示 GUI 感知的价值:同一方法从文本换到 GUI,HCO 在 IL 下从 19.03 提到 30.00、RL 下从 24.38 提到 32.64。RecAgent/Agent4Rec 的意图分数看似不差,但处于过活跃区(ACR 80.09/55.09、IPVR 80.09/80.70),其命中指标是靠过度交互灌出来的,不能算忠实模拟。记忆消融(Figure 5a):完整层级 > 去掉 Preference Memory > 只留 Working Memory,证明短期视觉上下文不足以维持连贯的购物意图,EM 与 PM 在不同抽象层级上互补。奖励消融(Figure 5b):去掉 micro 奖励在所有意图指标上退化最大,去掉 macro 对意图分数影响较小但削弱了防止不真实交互模式的轨迹级约束。人类评估(Figure 6,Fleiss' κ=0.834):真人轨迹在 74% 的对比中被偏好于 RecVerse、98% 被偏好于 STA;RecVerse 与 STA 直接对比时 92% 被偏好。敏感性分析(Table 4):$\lambda$ 从 1 增到 1000,F1 从 3.65 升至 7.19、HCO 从 27.97 升至 32.64,但 ΔATL 从 0.26 增至 2.78。粒度消融(Table 6):类目匹配比精确商品匹配 F1 4.90→7.19、HR 6.51→10.45、HCO 27.41→32.64。规模分析(Figure 7):2B→4B 后 CVR 从严重欠活跃大幅改善、HR 相对增益最大、类目指标从低 30% 区升到 40% 以上,但 IPVR 变得低于真实值,说明并非所有维度均匀收敛。

Overview statistics of USB, organized by trajectory, item, and user dimensions, respectively.
Table 1: Overview statistics of USB, organized by trajectory, item, and user dimensions, respectively.
Feature comparison of user simulation benchmarks.
Table 2: Feature comparison of user simulation benchmarks.
Overall evaluation performance. TF, IL, and RL denote training-free prompting, imitation learning, and reinforcement learning, respectively. All metrics except ATL are reported as percentages.
Table 3: Overall evaluation performance. TF, IL, and RL denote training-free prompting, imitation learning, and reinforcement learning, respectively. All metrics except ATL are reported as percentages.
Sensitivity analysis of the reward coefficient 𝜆. ΔATL is computed against the real-user average trajectory length.
Table 4: Sensitivity analysis of the reward coefficient 𝜆. ΔATL is computed against the real-user average trajectory length.
Condensed prompt template for rollout generation. Placeholders are filled with the user profile, historical records, current memory state, GUI observation, and executable action set at each step.
Table 5: Condensed prompt template for rollout generation. Placeholders are filled with the user profile, historical records, current memory state, GUI observation, and executable action set at each step.
Ablation analysis of matching granularity in the micro-level reward. Behavioral fidelity is reported as absolute deviation from real-user statistics; intent metrics are reported as percentages.
Table 6: Ablation analysis of matching granularity in the micro-level reward. Behavioral fidelity is reported as absolute deviation from real-user statistics; intent metrics are reported as percentages.
Category distribution analysis of USB. (a), (b), (c) show the top-10 categories at the L1, L2, and L3 levels of the product taxonomy, respectively. (d) displays a word cloud of sampled categories, with font size proportional to frequency.
Figure 3: Category distribution analysis of USB. (a), (b), (c) show the top-10 categories at the L1, L2, and L3 levels of the product taxonomy, respectively. (d) displays a word cloud of sampled categories, with font size proportional to frequency.
Behavioral fidelity comparison normalized by real-user statistics. Each point reports the ratio between a method's behavioral statistic and the corresponding real-user value. The shaded regions distinguish over-active, high-fidelity, and under-active behavioral regimes.
Figure 4: Behavioral fidelity comparison normalized by real-user statistics. Each point reports the ratio between a method's behavioral statistic and the corresponding real-user value. The shaded regions distinguish over-active, high-fidelity, and under-active behavioral regimes.
Ablation analysis of RecVerse. (a) Memory ablation compares the full memory hierarchy with variants that remove Preference Memory (PM) or retain only Working Memory (WM). (b) RL-reward ablation evaluates the contributions of macro-level and micro-level rewards.
Figure 5: Ablation analysis of RecVerse. (a) Memory ablation compares the full memory hierarchy with variants that remove Preference Memory (PM) or retain only Working Memory (WM). (b) RL-reward ablation evaluates the contributions of macro-level and micro-level rewards.
Human evaluation via pairwise preference judgments. Annotators compare trajectories generated by RecVerse, STA, and real users, where larger segments indicate higher preference rates for the method shown on each side.
Figure 6: Human evaluation via pairwise preference judgments. Annotators compare trajectories generated by RecVerse, STA, and real users, where larger segments indicate higher preference rates for the method shown on each side.
Scaling analysis from Qwen3.5-2B to Qwen3.5-4B on behavioral fidelity and intent consistency metrics.
Figure 7: Scaling analysis from Qwen3.5-2B to Qwen3.5-4B on behavioral fidelity and intent consistency metrics.
Annotation interface for human evaluation. Annotators compare two anonymized trajectories conditioned on the same user profile, inspect their action timelines and GUI observations, and identify the trajectory judged to be machine-generated.
Figure 8: Annotation interface for human evaluation. Annotators compare two anonymized trajectories conditioned on the same user profile, inspect their action timelines and GUI observations, and identify the trajectory judged to be machine-generated.
Case study of RecVerse on a real browsing session. The example illustrates aligned action trajectories between RecVerse and the real user, along with generated mindset and preference memory that support the purchase decision.
Figure 9: Case study of RecVerse on a real browsing session. The example illustrates aligned action trajectories between RecVerse and the real user, along with generated mindset and preference memory that support the purchase decision.
查看结构化数据
任务指标本文基线提升
GUI 用户模拟·类目级意图一致性 HCO(层级类目重叠,%) 32.64 STA(最强 GUI 基线)23.11 +9.53 个百分点(CP 34.51 vs 24.46,CR 30.95 vs 21.89)
GUI 用户模拟·商品级意图一致性 F1(%) 7.19 STA 4.27 +2.92 个百分点,HR 同步从 5.92 提升到 10.45
GUI 用户模拟·行为保真 ATL/CTR/ACR/CVR/IPVR(与真实值偏差) 16.25/7.78/19.99/4.87/32.86(真实:13.47/9.08/15.93/13.54/29.60) STA 17.28/5.70/15.58/4.64/14.99 各漏斗统计量收敛至真实值附近的高保真区间,STA 的 IPVR 仅为真实的约一半
观测模态消融(同为 RL 训练) HCO(%) RecVerse-GUI 32.64 RecVerse-Text 24.38 +8.26 个百分点,证明像素级页面观测提供文本之外的关键证据
人类偏好评估(成对盲测) 偏好率(%) RecVerse 92%(对比 STA) STA 8% 真人轨迹仍以 74% 优于 RecVerse,但差距远小于 STA 的 98%,标注一致性 Fleiss' κ=0.834

局限与改进

作者承认的局限:人类评估中真实轨迹仍在 74% 的对比中胜过 RecVerse,说明模拟与真人差距仍明显,作者将其归因于个性化与个体偏好建模不足;Figure 7 显示扩大模型并未让所有行为维度对齐,IPVR 反而降到真实值以下。我补充观察到的数字层面局限:购买率 4.87 仍只有真实值 13.54 的约三分之一,ACR 19.99 高于真实 15.93,说明『加购→购买』的漏斗中段决策未被完全校准;$\lambda$ 的调节揭示两个目标存在张力——意图对齐越强,轨迹长度偏差越大(ΔATL 0.26→2.78),需要人工权衡。方法论层面:macro 奖励需要参考轨迹 $\tau^*$ 的动作计数、micro 奖励需要参考商品集 $\mathcal{I}^*$,训练时每条样本都要有真实轨迹做参照,框架本质是在『复现已见分布』,对无参考的全新用户或改版界面的泛化能力未验证;USB 来自单一东亚电商且服饰类占 51.0%,跨平台跨文化外推存疑;训练与推理都截断到 20 步(平均轨迹长 13.24 步),论文反复强调的『数十页长会话』的极端长程能力其实没有被直接检验;Working Memory 容量 $K$、动作权重等关键超参均为经验设定,缺少敏感性分析。

独立分析的弱点

独立分析的弱点及改进方向:(1) 对参考轨迹的依赖——macro 奖励以 $N_a(\tau^*)$ 为锚、micro 奖励以 $\mathcal{I}^*$ 为目标集,这意味着系统无法为『没有历史轨迹的新用户』或『界面改版后』的训练信号定义奖励,改进方向是从群体统计学习行为先验做无参考正则,或引入可自适应的世界模型预测合理分布。(2) 漏斗建模粗糙——奖励只对齐边缘分布(各动作类型的计数)和类目一致性,没有刻画『加购后多久购买、浏览几次后点击』这类时序与条件结构,这可能是 CVR 仅 4.87(真实 13.54)的原因,改进方向是在奖励中加入漏斗各阶段的条件概率对齐项。(3) 记忆机制缺解释性证据——论文没有报告 RL 学到的记忆写入策略长什么样(Episodic/Preference 记忆的平均条目数、写入频率与人工规则的对比),无法判断模型是否真的学到了『何时该记』,改进方向是发布记忆操作策略的定量分析并与固定频率写入对照。(4) 视觉信息损失——截图像素预算 448×448 对信息密集的推荐页面可能丢失关键细节,且每步携带多图推理成本高,改进方向是研究记忆压缩后的文本状态条件化或视觉 token 蒸馏。(5) 数据外部效度——单一平台、服饰主导(51.0%)、20 步截断,三个因素叠加使结论向其他领域(如内容社区、B2B 采购)推广的置信度有限。

未来方向

作者明确提出的方向:把 RecVerse 接入生产流水线,作为 (i) RL 推荐器的训练环境(优化长期用户参与和商业价值)、(ii) 低成本在线 A/B 测试的离线代理、(iii) 模型训练的数据增广生成器、(iv) 透明可检的用户行为分析测试床;论文附录还指出这种『从日志重建曝光状态』的环境构建方式可以推广到其他平台。基于其成果可延伸的研究:个性化建模——作者在人类评估后明确指出需要更深的个体偏好建模,可结合画像条件化生成或每个用户的轻量在线适应模块;跨会话长程记忆——当前记忆只覆盖单会话,跨日、跨设备的偏好演化需要持久化记忆层;记忆与参数化记忆(如 per-user LoRA 适配)的结合;用模拟器做反事实政策评估的统计校准与置信区间理论;更大骨干网络下的规模定律(Figure 7 只测到 4B,且发现行为对齐与意图对齐的扩展规律不同);以及把记忆写入策略显式蒸馏成可解释规则,服务合规审计。

复现评估

复现评估:论文承诺发布 USB 数据集(5,274 条轨迹、页面截图、用户画像、商品元数据和交互式环境),并给出了完整的实现细节:Qwen3.5-2B 全参微调(视觉编码器冻结)、Megatron-LM 分布式训练、vLLM 加速 rollout 推理、IL 10 epochs/学习率 $2 \times 10^{-7}$/余弦调度、GRPO 8 rollouts/组、rollout batch 16、KL 系数 $1 \times 10^{-3}$、100 优化步、$\lambda = 1000$、重采样 $\alpha = 0.3$、像素预算 448×448,提示词模板(Table 5)和全部指标定义(附录 A)也都写明了,实现路径清晰。风险与门槛:(1) 正文未见明确的代码/数据开源链接,USB 依托某东亚主流电商的真实日志与页面重建,第三方几乎不可能自行重建这个交互式环境,能否实际拿到数据和模拟器是复现成败的关键;(2) IL 数据由 397B 参数的教师模型(Qwen3.5-397B-A17B)合成,重新合成成本很高,若作者不同时发布合成数据,这一步难以复刻;(3) 2B 模型全参 RL 训练(每组 8 个 rollout)需要多卡 GPU,中等规模实验室可以承担;(4) 人类评估依赖外包标注团队(Fleiss' κ=0.834),复现该部分成本较高。总体属于『中上等可复现』:协议透明度好,核心不确定性在数据与环境的实际可得性。