迈向忠实的用户购物行为模拟 Towards Faithful Simulation of Human Shopping Behavior
RecVerse用认知分层记忆与轨迹级强化学习,在真实GUI环境中忠实模拟人类购物行为
前置知识
用户行为模拟
让模型生成与真实用户一致的浏览轨迹——用户在电商信息流中如何滚动、点击、比价、加购乃至下单。它是推荐系统离线评估、反事实策略评估和强化学习训练环境的基础,核心难点在于模拟器既要在统计分布上像真实用户(如点击率、加购率),又要在具体决策上符合用户购物意图。
本文全部设计(记忆结构、奖励函数、评测协议)都围绕『如何让模拟轨迹在分布和意图两个层面逼近真实用户』展开,先理解这个任务的特殊性才能理解各项设计动机。
GRPO(组相对策略优化)
DeepSeek 提出的强化学习算法:对同一提示采样一组 $G$ 个回复,用奖励的组内均值和标准差归一化得到优势 $A_i = (R(y_i) - \mathrm{mean}) / \mathrm{std}$,再配合裁剪代理目标与 KL 正则项更新策略,无需训练价值函数。适合以会话级反馈优化多轮智能体。
RecVerse 的轨迹级 RL 直接建立在 GRPO 之上:每个训练会话采样 8 个完整 rollout,以会话级奖励计算组相对优势,理解 GRPO 才能读懂其训练流程。
分层记忆系统(认知科学)
认知科学(Atkinson-Shiffrin、Tulving)认为人类记忆分多个层次:瞬时的感觉/工作记忆保持数秒内的视觉印象,情景记忆记录一段时间内的事件序列,语义记忆沉淀稳定的知识与偏好。不同层次在不同时间粒度上互补协作,而非把经历存成一条平铺序列。
RecVerse 的 Working/Episodic/Preference 三级记忆正是这一理论的工程化,是其在长会话中保持有界上下文又不丢失跨页依赖的核心机制。
模仿学习与行为克隆
从专家演示中学习策略,在用户模拟里即最大化 $\mathcal{L}_{IL} = -\sum_{t} \log \pi_\theta(a_t \mid o_t, h_{<t})$,逐步预测真实用户的下一个动作。它提供稳定的策略初始化,但对会话整体行为模式没有约束,也无法区分『合理决策』与『行为噪声』。
本文以 IL 热启动、再用轨迹级 RL 纠偏;理解 IL 的两大局限(拟合噪声、无视整体分布)是理解论文动机部分『优化挑战』的前提。
GUI 智能体
直接以屏幕截图为观测、以点击坐标/滚动/输入为动作的多模态智能体(如 CogAgent、SeeClick、UI-TARS),通过视觉定位在图形界面上操作。与传统操作文本描述的智能体相比,它感知的信息模态与真实用户看到的页面完全一致。
本文把 GUI 感知引入用户模拟,让智能体与用户看到同样的像素级推荐页面;这是它与文本类模拟器(RecAgent、OPeRA 等)的本质区别,也是性能提升的重要来源。
研究动机
真实电商购物会话横跨几十页屏幕,一次点击或购买往往与许多页之前浏览、比较过的商品相关,而现有方法都没法处理这种长程依赖。第一条路是丢弃或启发式剪枝历史:最强 GUI 基线 STA 只用当前截图加启发式裁剪的历史 HTML,跨页依赖被切断。第二条路是把历史原样拼进上下文:论文 Figure 1 的实验显示,随着视觉记忆片段从 0 增到 8,准确率先提升约 11%,超过适度长度后反而下降约 5%,而 token 成本从约 2.1k 单调涨到 3.0k,呈明显收益递减。更深层的是优化问题:所有现有方法都用逐步模仿(预测下一个动作)做监督,但真实浏览充满行为噪声(比如误滚动后立刻回滚),拟合噪声会干扰模型对用户意图的推理;逐步监督对整体行为又没有约束,导致模拟会话出现失真模式——RecAgent 的加购率高达 80.09%、转化率 64.34%,而真实用户只有 15.93% 和 13.54%,属于典型的『过度探索』。此外现有基准也不合格:Amazon、MovieLens 只有单一交互类型且无视觉信息,OPeRA 虽有 GUI 轨迹但只能静态回放日志,无法支持多轮交互式强化学习。
本文的目标是本文的目标是构建一个『忠实』的购物行为模拟器:让智能体在 GUI 层面与真实用户看到同样的像素级页面(而非文本化的商品描述);在长会话中保持上下文有界的同时不丢失跨页依赖(比如几页前比较过的商品仍能影响当前决策);并通过会话级(轨迹级)优化让模拟轨迹在两个粒度上对齐真实用户——宏观上行为统计分布匹配(滚动/点击/加购/购买频率等漏斗指标),微观上交互决策符合真实购物意图(商品类目一致)。同时,作者发布 USB 基准:5,274 条真实用户轨迹、69,842 个动作、90,095 个商品、5,222 个用户,涵盖 8 类动作和三级类目体系(41/517/2,256 个 L1/L2/L3 类目),并首次提供支持多轮 agentic RL 的交互式视觉环境。
与已有工作不同的是,本文的独特切入角度有三个。其一,认知科学视角:把人类互补记忆系统(视觉速写板式的短期印象、会话级行为追踪、稳定个人偏好)引入模拟器,并且把『何时记、记什么』本身作为动作交给 RL 学习(memory-as-action),而不是像 Reflexion、MemoryBank 那样依赖手工记忆管理启发式——因为哪些印象以后会重要是隐式的、无标注的,规则无法穷举。其二,评测视角:把目标从『预测下一步正确动作』转向『复现轨迹的多模态分布』;任务导向 GUI 智能体要抑制的失败模式(反复比较、犹豫、浏览)恰恰是忠实模拟器要复现的信号。其三,环境视角:作者从线上日志重建每个会话的完整曝光状态(每步全部候选商品及其页面布局),使智能体能执行任意可行动作并获得真实页面反馈,从而首次在真实界面上实现多轮 agentic RL——而 STA 一旦偏离日志动作环境就无法给出真实后续状态,只能退化为静态逐步预测。
核心方法
直觉上,像真人一样购物需要三种能力:看清眼前页面(短期视觉印象)、记住本会话发生过什么(行为上下文)、知道自己喜欢什么(稳定偏好)。RecVerse 由此构建三级分层记忆:Working Memory $W_t$ 用容量有限的 FIFO 队列保存最近 $K$ 步的(视觉印象 $v_i$、用户心态 $z_i$、动作 $a_i$)三元组,模拟容量受限的人类视觉持久性;Episodic Memory $E_t$ 以文本记录会话内值得记住的交互事件;Preference Memory $P_t$ 蒸馏高级意图(偏好属性、比较标准、讨厌的属性、购买意图)。每个时间步,智能体读取当前截图 $o_t$ 和记忆状态 $\mathcal{M}_{t-1}$,联合输出内部推理 $z_t$、环境动作 $a_t$ 和记忆更新 $m_t$:$$z_t, a_t, m_t = \pi_\theta(o_t, \mathcal{M}_{t-1})$$。训练上先用模仿学习在真实轨迹上热启动,再用基于 GRPO 的轨迹级强化学习精调,奖励由宏观分布对齐、微观意图一致和格式合法三部分组成,整体形成『感知—读取记忆—行动+记忆更新』的闭环。
核心创新是 memory-as-action:记忆写入 $E_t = E_{t-1} \cup \{e_t\}$($e_t = f_\theta(o_t, W_{t-1}, E_{t-1})$)和偏好更新 $P_t = g_\theta(o_t, E_{t-1}, P_{t-1})$ 都由策略模型自身诱导,是否生成记忆、生成什么内容完全由 RL 奖励信号端到端学习,而不是手工规则或固定工作流——这直接解决了『何时该记是隐式的、无标注』这一认知难题。第二个核心创新是轨迹级对齐奖励:$R_{\mathrm{macro}}(\tau) = -\sum_{a \in \mathcal{A}} \frac{|N_a(\tau) - N_a(\tau^*)|}{N_a(\tau^*) + \epsilon}$($\epsilon = 0.1$,排除滚动/返回等纯导航动作)在会话层面惩罚与真实用户行为分布的偏差,抑制过度探索或过度被动;$R_{\mathrm{micro}}(\tau) = \sum_{a \in \tau_{\mathrm{item}}} w(a) \cdot r(a)$ 以意图强度加权(点击权重 1、进详情页 5、加购 5、购买 10),并用三级类目层级匹配给相似商品部分得分,取代严格的商品精确匹配——既容纳电商中多样的合理选择,又为 GRPO 提供更稠密的奖励信号、缓解优势坍缩问题。总奖励为 $R_i = R_{\mathrm{macro}} + \lambda \cdot R_{\mathrm{micro}} + R_{\mathrm{format}}$。
方法步骤详情
完整流程分四步。第一步,数据与交互环境:USB 从某东亚主流电商 App 首页推荐流收集 5,274 条真实会话,从线上日志重建每步的完整曝光状态与页面布局;动作空间 8 类(上/下滚动、点击坐标、进详情页、返回、加购、购买、终止),训练和推理轨迹都截断到 20 步,截图输入像素预算上限 200,704(即 448×448)。第二步,模仿学习热启动:用 Qwen3.5-397B-A17B(温度 0.7)对真实轨迹做反事实重建——给定用户画像 $u$、记忆状态 $\mathcal{M}_{t-1}$、截图 $o_t$ 和真实下一动作 $a_t^*$,教师模型生成符合 RecVerse 输出格式(mindset、两级记忆更新、动作的严格 JSON)的推理与记忆内容;然后全参微调 Qwen3.5-2B(视觉编码器冻结),学习率 $2 \times 10^{-7}$、余弦调度、10 个 epoch;针对真实动作分布的长尾性做幂律平滑重采样 $q_i = n_i^\alpha / \sum_j n_j^\alpha$($\alpha = 0.3$)。第三步,轨迹级 RL:GRPO 每组采 8 个 rollout、总 rollout batch 16、KL 系数 $1 \times 10^{-3}$、训练 100 个优化步,奖励 $\lambda$ 设为 1000。第四步,多轮推理执行:智能体逐步滚动、点击、更新记忆,直到触发终止动作,输出完整浏览轨迹。
技术新颖性
与已有工作逐线对比可以看清其新颖性。相对规则模拟器(RecSim、RecSim NG、Virtual Taobao):摆脱了预定义动作空间和向量化商品特征,直接感知像素级真实界面。相对文本 LLM 模拟器(RecAgent、Agent4Rec、OPeRA、AlignUSER、Shop-R1、Customer-R1):补齐了驱动真实浏览决策的视觉版面信息,消融显示同一方法从文本换到 GUI 后 HCO 在 RL 下从 24.38 提升到 32.64。相对 GUI 模拟器 STA:用学习式分层记忆替代启发式历史剪枝,用轨迹级分布奖励替代逐步动作匹配。相对记忆增强智能体(Reflexion、MemoryBank、Voyager):记忆操作不是手工流程而是策略动作空间的一部分,由 RL 端到端学习。评测协议同样有新意:行为保真指标(ATL、CTR、IPVR、ACR、CVR)要求向真实值收敛而非最大化/最小化,作者特意不用 KL/JS 散度,因为它们对绝对交互量不敏感,会让『比例正确但过度活跃』的智能体蒙混过关;微观奖励采用层级类目匹配 $r(a) = \max_{y \in \mathcal{I}^*} \frac{1}{L} \sum_{l=1}^{L} \mathbb{I}(c_l[x_a] = c_l[y])$。这套『memory-as-action + 双粒度轨迹奖励 + 可重建曝光状态的交互环境』组合在用户模拟领域均为首次。
实验结果
主实验(Table 3、Figure 4):RecVerse-GUI(RL)的行为统计紧贴真实用户参考值(真实 ATL/CTR/ACR/CVR/IPVR = 13.47/9.08/15.93/13.54/29.60,RecVerse 为 16.25/7.78/19.99/4.87/32.86),同时意图一致性大幅领先最强 GUI 基线 STA:item 级 F1 从 4.27 升到 7.19、HR 从 5.92 升到 10.45,类目级 HCO 从 23.11 升到 32.64。模态消融显示 GUI 感知的价值:同一方法从文本换到 GUI,HCO 在 IL 下从 19.03 提到 30.00、RL 下从 24.38 提到 32.64。RecAgent/Agent4Rec 的意图分数看似不差,但处于过活跃区(ACR 80.09/55.09、IPVR 80.09/80.70),其命中指标是靠过度交互灌出来的,不能算忠实模拟。记忆消融(Figure 5a):完整层级 > 去掉 Preference Memory > 只留 Working Memory,证明短期视觉上下文不足以维持连贯的购物意图,EM 与 PM 在不同抽象层级上互补。奖励消融(Figure 5b):去掉 micro 奖励在所有意图指标上退化最大,去掉 macro 对意图分数影响较小但削弱了防止不真实交互模式的轨迹级约束。人类评估(Figure 6,Fleiss' κ=0.834):真人轨迹在 74% 的对比中被偏好于 RecVerse、98% 被偏好于 STA;RecVerse 与 STA 直接对比时 92% 被偏好。敏感性分析(Table 4):$\lambda$ 从 1 增到 1000,F1 从 3.65 升至 7.19、HCO 从 27.97 升至 32.64,但 ΔATL 从 0.26 增至 2.78。粒度消融(Table 6):类目匹配比精确商品匹配 F1 4.90→7.19、HR 6.51→10.45、HCO 27.41→32.64。规模分析(Figure 7):2B→4B 后 CVR 从严重欠活跃大幅改善、HR 相对增益最大、类目指标从低 30% 区升到 40% 以上,但 IPVR 变得低于真实值,说明并非所有维度均匀收敛。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| GUI 用户模拟·类目级意图一致性 | HCO(层级类目重叠,%) | 32.64 | STA(最强 GUI 基线)23.11 | +9.53 个百分点(CP 34.51 vs 24.46,CR 30.95 vs 21.89) |
| GUI 用户模拟·商品级意图一致性 | F1(%) | 7.19 | STA 4.27 | +2.92 个百分点,HR 同步从 5.92 提升到 10.45 |
| GUI 用户模拟·行为保真 | ATL/CTR/ACR/CVR/IPVR(与真实值偏差) | 16.25/7.78/19.99/4.87/32.86(真实:13.47/9.08/15.93/13.54/29.60) | STA 17.28/5.70/15.58/4.64/14.99 | 各漏斗统计量收敛至真实值附近的高保真区间,STA 的 IPVR 仅为真实的约一半 |
| 观测模态消融(同为 RL 训练) | HCO(%) | RecVerse-GUI 32.64 | RecVerse-Text 24.38 | +8.26 个百分点,证明像素级页面观测提供文本之外的关键证据 |
| 人类偏好评估(成对盲测) | 偏好率(%) | RecVerse 92%(对比 STA) | STA 8% | 真人轨迹仍以 74% 优于 RecVerse,但差距远小于 STA 的 98%,标注一致性 Fleiss' κ=0.834 |
局限与改进
作者承认的局限:人类评估中真实轨迹仍在 74% 的对比中胜过 RecVerse,说明模拟与真人差距仍明显,作者将其归因于个性化与个体偏好建模不足;Figure 7 显示扩大模型并未让所有行为维度对齐,IPVR 反而降到真实值以下。我补充观察到的数字层面局限:购买率 4.87 仍只有真实值 13.54 的约三分之一,ACR 19.99 高于真实 15.93,说明『加购→购买』的漏斗中段决策未被完全校准;$\lambda$ 的调节揭示两个目标存在张力——意图对齐越强,轨迹长度偏差越大(ΔATL 0.26→2.78),需要人工权衡。方法论层面:macro 奖励需要参考轨迹 $\tau^*$ 的动作计数、micro 奖励需要参考商品集 $\mathcal{I}^*$,训练时每条样本都要有真实轨迹做参照,框架本质是在『复现已见分布』,对无参考的全新用户或改版界面的泛化能力未验证;USB 来自单一东亚电商且服饰类占 51.0%,跨平台跨文化外推存疑;训练与推理都截断到 20 步(平均轨迹长 13.24 步),论文反复强调的『数十页长会话』的极端长程能力其实没有被直接检验;Working Memory 容量 $K$、动作权重等关键超参均为经验设定,缺少敏感性分析。
独立分析的弱点
独立分析的弱点及改进方向:(1) 对参考轨迹的依赖——macro 奖励以 $N_a(\tau^*)$ 为锚、micro 奖励以 $\mathcal{I}^*$ 为目标集,这意味着系统无法为『没有历史轨迹的新用户』或『界面改版后』的训练信号定义奖励,改进方向是从群体统计学习行为先验做无参考正则,或引入可自适应的世界模型预测合理分布。(2) 漏斗建模粗糙——奖励只对齐边缘分布(各动作类型的计数)和类目一致性,没有刻画『加购后多久购买、浏览几次后点击』这类时序与条件结构,这可能是 CVR 仅 4.87(真实 13.54)的原因,改进方向是在奖励中加入漏斗各阶段的条件概率对齐项。(3) 记忆机制缺解释性证据——论文没有报告 RL 学到的记忆写入策略长什么样(Episodic/Preference 记忆的平均条目数、写入频率与人工规则的对比),无法判断模型是否真的学到了『何时该记』,改进方向是发布记忆操作策略的定量分析并与固定频率写入对照。(4) 视觉信息损失——截图像素预算 448×448 对信息密集的推荐页面可能丢失关键细节,且每步携带多图推理成本高,改进方向是研究记忆压缩后的文本状态条件化或视觉 token 蒸馏。(5) 数据外部效度——单一平台、服饰主导(51.0%)、20 步截断,三个因素叠加使结论向其他领域(如内容社区、B2B 采购)推广的置信度有限。
未来方向
作者明确提出的方向:把 RecVerse 接入生产流水线,作为 (i) RL 推荐器的训练环境(优化长期用户参与和商业价值)、(ii) 低成本在线 A/B 测试的离线代理、(iii) 模型训练的数据增广生成器、(iv) 透明可检的用户行为分析测试床;论文附录还指出这种『从日志重建曝光状态』的环境构建方式可以推广到其他平台。基于其成果可延伸的研究:个性化建模——作者在人类评估后明确指出需要更深的个体偏好建模,可结合画像条件化生成或每个用户的轻量在线适应模块;跨会话长程记忆——当前记忆只覆盖单会话,跨日、跨设备的偏好演化需要持久化记忆层;记忆与参数化记忆(如 per-user LoRA 适配)的结合;用模拟器做反事实政策评估的统计校准与置信区间理论;更大骨干网络下的规模定律(Figure 7 只测到 4B,且发现行为对齐与意图对齐的扩展规律不同);以及把记忆写入策略显式蒸馏成可解释规则,服务合规审计。
复现评估
复现评估:论文承诺发布 USB 数据集(5,274 条轨迹、页面截图、用户画像、商品元数据和交互式环境),并给出了完整的实现细节:Qwen3.5-2B 全参微调(视觉编码器冻结)、Megatron-LM 分布式训练、vLLM 加速 rollout 推理、IL 10 epochs/学习率 $2 \times 10^{-7}$/余弦调度、GRPO 8 rollouts/组、rollout batch 16、KL 系数 $1 \times 10^{-3}$、100 优化步、$\lambda = 1000$、重采样 $\alpha = 0.3$、像素预算 448×448,提示词模板(Table 5)和全部指标定义(附录 A)也都写明了,实现路径清晰。风险与门槛:(1) 正文未见明确的代码/数据开源链接,USB 依托某东亚主流电商的真实日志与页面重建,第三方几乎不可能自行重建这个交互式环境,能否实际拿到数据和模拟器是复现成败的关键;(2) IL 数据由 397B 参数的教师模型(Qwen3.5-397B-A17B)合成,重新合成成本很高,若作者不同时发布合成数据,这一步难以复刻;(3) 2B 模型全参 RL 训练(每组 8 个 rollout)需要多卡 GPU,中等规模实验室可以承担;(4) 人类评估依赖外包标注团队(Fleiss' κ=0.834),复现该部分成本较高。总体属于『中上等可复现』:协议透明度好,核心不确定性在数据与环境的实际可得性。
论文图表
在多模态上下文中逐步增加视觉记忆片段数量(0 到 8 个)的效果曲线:准确率先提升约 11%,达到峰值后出现收益递减并下降约 5%,而 token 成本从约 2.1k 单调增长到 3.0k,从未停止上涨。
这是『朴素拼接历史不可行』的直接实验证据:多给上下文既不持续提升质量又持续增加成本,是动机部分最关键的一张图,论证了必须用结构化记忆压缩替代堆上下文。