← 返回 2026-08-04

RecHarness:基于多臂老虎机路由的推荐系统自演化智能体框架 RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems

Haoran Ling, Yuecheng Li, Zeyu Song, Jing Yao, Shuwen Kang, Chi Lu, Wenjin Wu, Peng Jiang 📅 2026-07-31 👍 11 2026-08-09 18:30
LLM智能体 Thompson采样 多臂老虎机 推荐系统优化 自动化机器学习

用多臂老虎机路由与LLM推理解耦,在有限trial预算下稳定优化推荐模型

前置知识

LLM驱动的MLE Agent(Machine Learning Engineering Agent)

一类基于大语言模型的智能体,给定数据集、评估指标和初始代码库后,能阅读任务描述、编写或修改训练代码、执行实验,并基于验证结果和执行日志迭代改进候选方案。代表工作AIDE把解组织成树、用贪心策略起草/调试/改进最优节点,AIRA把agent形式化为在算子集上操作的搜索策略。它们大多是无梯度的,把执行反馈压缩成标量验证分数,仅用于排序和剪枝分支。

本文要解决的核心痛点正是这类agent直接用于推荐优化时发散且预算低效的问题,理解它们的搜索范式(多分支/树/图搜索)才能看清RecHarness用bandit路由替代开放搜索的本质区别。

多臂老虎机与Thompson采样(Multi-armed Bandit & Thompson Sampling)

多臂老虎机是序贯决策问题:每轮从K个arm(选项)中选择,被选arm返回一个随机奖励,目标是在有限轮次内最大化累计奖励。Thompson采样为每个arm维护后验分布(常用Beta分布 Beta(α,β)),每轮从每个arm后验采样一个值,选采样值最大的arm,再用观测奖励更新后验 α←α+r, β←β+1−r。它天然平衡探索与利用:既倾向历史高回报arm,又给证据不足的不确定arm留概率。

RecHarness把推荐优化建模为incumbent-conditioned的bandit问题,arm=编辑维度,用Thompson采样做trial分配是方法的脊柱,不理解bandit就无法理解Level 2路由层的设计。

序列推荐系统(Sequential Recommendation)

给定用户历史交互序列,预测下一个交互物品的任务。常见模型族覆盖不同序列建模范式:GRU4Rec用RNN、BERT4Rec用双向Transformer、NextItNet用卷积、SASRec用自注意力、HSTU用万亿参数序列transducer。评估常用留最后一项(leave-last-out)的HR@N和NDCG@N,每个评估集含1个正样本和99个负采样样本。

这是论文的主实验场景之一(Amazon Reviews),5个模型族的实验结果和HR@10/NDCG@10指标贯穿全文,是衡量RecHarness有效性的核心证据。

Bandit探索-利用权衡(Exploration-Exploitation Trade-off)

在有限预算下做序贯决策时的根本矛盾:exploitation倾向于选择已知高回报的方向(利用已有证据),exploration倾向于尝试不确定的方向(发现潜在更优解)。纯LLM选arm探索不可靠,而把LLM推理与显式bandit结构结合可得到更受控的探索-利用机制(Krishnamurthy et al. 2024; Sun et al. 2026)。

本文的核心动机和消融对比都围绕'为什么不能让LLM自由探索'展开,理解这个权衡才能理解Thompson后验路由相对于'LLM直接选arm'和'随机选arm'的优势来源。

研究动机

现代推荐模型(序列推荐、CTR排序、观看时长预测)的优化严重依赖工程师手动迭代架构、目标函数和训练策略。虽然基于LLM的MLE Agent能自动化这种试错流程——读代码、改训练逻辑、跑实验、看反馈——但把通用MLE agent直接用到推荐优化上存在严峻的系统挑战:每个候选修改都要经过代码生成、执行、训练和验证,单次trial就消耗不可忽视的算力预算。更关键的是,推荐优化不是一组独立的一次性实验,而是连续的模型迭代过程,每次trial还提供超越最终验证分数的优化证据(收敛行为、训练稳定性、暴露的失败模式)。若让LLM自由决定探索方向,则过于发散:候选在开放空间被提出,缺乏原则性的trial分配,而每次编辑都带来昂贵且有噪声的训练-验证trial,导致成功率低、优化效率低(Krishnamurthy et al. 2024; Sun et al. 2026; Bouneffouf and Feraud 2026)。与此同时,现有搜索方法把执行反馈仅压缩成标量分数会丢弃错误日志、训练动态等宝贵信号。

本文的目标是构建一个验证引导的优化harness(RecHarness),把推荐模型优化组织为一系列隔离的训练-验证trial,在有限的trial-runtime预算下高效分配试验、稳定地提升推荐性能,并能适应不同的推荐场景(序列推荐、观看时长/排序)、模型族(GRU4Rec/BERT4Rec/NextItNet/SASRec/HSTU/D2Q/TPM/GR)和评估目标。其核心目标是把验证反馈同时用作两条信道:给bandit router的标量后验状态,用于决定下一轮往哪个编辑维度搜索;以及给LLM的文本反馈,用于帮助它在选定方向内形成具体改进假设。关键设计目标是让LLM推理与经典bandit机制各司其职、互补增益,而不是像纯agent那样在开放空间盲目搜索,也不是像AutoML那样只能调标量超参。

与已有工作不同的是,RecHarness的独特切入点来自in-context bandit实验的发现:通用LLM在缺乏外部摘要或算法支持时难以可靠探索,而LLM增强的多臂bandit方法比直接让LLM选arm更有效。因此它把'编辑方向的选择'与'具体代码变异的生成'显式解耦。与AutoML/HPO/NAS不同——后者只能在预定义配置空间内调标量超参或在固定架构模板内搜索,难以处理重设计loss函数、切换架构block、改pooling策略这类超出可枚举网格的代码级改动;也与AIDE/AIRA等纯LLM agent的开放空间搜索不同——后者缺乏原则性trial分配且丢弃非标量信号。RecHarness用validation-driven的Thompson routing在结构化编辑维度上积累跨trial证据,用LLM reasoning在选定方向内解释反馈并提出可执行编辑,两条反馈信道明确分离以防止文本摘要静默覆盖标量证据。

核心方法

RecHarness把推荐模型迭代组织为三层控制过程(见Figure 1)。Level 1由人类专家定义优化上下文:优化目标、验证指标 $M$ 和候选编辑arm集 $A=\{a_1,\ldots,a_K\}$。Level 2用bandit router(Thompson采样)根据标量验证反馈在有限预算 $B$ 下分配试验,决定下一轮搜索哪些编辑维度:$G_t=\mathrm{TopG}_{a\in A_t}\tilde{\theta}_a$。Level 3用Experiment Skill(紧凑文本指南,记录当前incumbent、近期成功编辑、无效或被拒方向、失败原因和验证趋势)配合LLM reasoning形成下一个改进假设。核心直觉是把每个候选修改看成一次昂贵的bandit arm pull:用后验概率指导方向选择,用LLM在该方向内生成具体代码变异。预算约束 $C_t=\sum_{a\in G_t} c(f_{t,a})$,$\sum_t C_t\le B$,每模型设43,200秒GPU总预算,每轮并行4个trial。

核心创新是把推荐优化建模为incumbent-conditioned的bandit问题,并把标量与文本两条反馈信道明确分离、各司其职。每个编辑arm $a$ 代表可解释的编辑维度(调学习率schedule、改dropout/weight decay、改embedding维度、改层数/注意力头数、改序列pooling、加特征、改loss函数),而非精确patch或标量超参。arm维护Beta后验 $\theta_a\sim\mathrm{Beta}(\alpha_a,\beta_a)$,每轮采样 $\tilde{\theta}_a$ 选最大若干个。与直接让LLM选arm的本质区别在于posterior提供有原则的探索-利用机制——既倾向历史高回报方向,又给证据不足的不确定arm留概率。arm集按粒度分为局部精炼arm $A_{local}$ 和结构跳跃arm $A_{jump}$,$A=A_{local}\cup A_{jump}$,前者在当前basin增量精炼,后者做可能跨越basin的结构改动。

方法步骤详情

**步骤1(定义上下文)**:人类输入初始实现 $f_0$、划分 $D=(D_{train},D_{val})$、指标 $M$、预算,定义候选arm集。**步骤2(Thompson路由)**:每轮从每个arm的 $\mathrm{Beta}(\alpha_a,\beta_a)$ 采样 $\tilde{\theta}_a$,选top-G组并行trial。**步骤3(LLM变异)**:$f_{t,a}=\mu_\phi(f_t^\star,a,m_t,\ell_t)$ 基于incumbent、Experiment Skill $m_t$、日志 $\ell_t$ 生成候选变异。**步骤4(执行验证)**:$\omega_f=\mathrm{Train}(f,D_{train})$,$M(f)=M(\omega_f;D_{val})$。**步骤5(提升incumbent)**:仅当 $\max_{f\in V_t}M(f)>s_t^\star$ 时提升。**步骤6(后验更新)**:$\Delta_t(a)=M(f_{t,a})-s_t^\star$,组内标准化 $A_t(a)$,二元成功 $r_t(a)=\mathbb{1}[f\,valid\land A_t(a)>0\land M(f_{t,a})\ge s_t^\star]$,更新 $\alpha_a\leftarrow\alpha_a+r_t(a)$、$\beta_a\leftarrow\beta_a+1-r_t(a)$。**步骤7(Skill更新)**:$m_{t+1}=\mathrm{Summarize}(m_t,\{a,f_{t,a},M(f_{t,a}),e_{t,a}\})$,成功蒸馏为lesson、失败提取avoid规则。**步骤8(basin jump)**:改进率 $b_v=(s_t^\star-s_{t-W}^\star)/W$,当 $b_v\le\tau$ 激活jump arm,需retuning后满足 $\max_{0\le r\le R}M(f_{t,r}^{(a)})-s_t^\star>\delta_{jump}$ 才接受。

技术新颖性

技术新颖性四点。第一,**解耦设计**:把编辑方向选择(bandit后验)与具体代码变异(LLM reasoning)分离,关键约束是Experiment Skill只作用于变异算子 $\mu_\phi$ 而不介入后验更新,防止文本摘要静默覆盖router的标量证据。第二,**结构化arm空间**:arm是可解释编辑维度而非精确patch或标量超参,并分local/jump两类,区别于AutoML只能调标量、纯agent开放空间搜索,使方法可跨场景迁移。第三,**basin-aware jump+retuning窗口**:incumbent-based搜索样本高效但易饱和,当 $b_v\le\tau$ 激活jump arm,且不按即时分数判而需retuning后满足margin $\delta_{jump}$ 才接受(延迟判据),避免结构改动因短期不适应被误杀。第四,**grouped并行trial+组内标准化**:同组并行用组统计标准化改进 $A_t(a)$ 使跨候选比较公平,并采纳'LLM直接选arm不可靠、需结合显式bandit结构'的近期证据。

Overview of RecHarness
Figure 1: Overview of RecHarness

实验结果

核心发现四块。**Amazon Reviews(Table 3,三次平均)**:5个模型一致提升。最弱基线GRU4Rec的avg HR@10升85.85%(0.2685→0.4990,超Kim et al. 2025的0.4188);最强基线HSTU仍升12.58%(0.4723→0.5317)。典型如CDs上SASRec HR@10从0.5833升到0.6593、Movies上GRU4Rec从0.2317升到0.5179。**KuaiRec(Table 4)**:弱基线TPM上WT-MAE降26.37%(4.5372→3.3406)、WR-MAE降26.41%;D2Q上WT-XAUC升12.00%(0.5310→0.5947);强基线GR四指标仍一致小幅提升。**消融(Table 5、Figure 2,SASRec)**:RecHarness在47.92%的非基线trial(23/48)刷新轮最优,远超TR w/ Random的22.45%、TR w/ LLM的21.74%、w/o Bandit的41.67%;平均增益5.06%、最大增益24.00%(vs w/o Bandit的10.16%)。验证轨迹从0.5050出发,Round 2达0.6125、Round 4达0.6342,每个checkpoint最优。**在线A/B(Table 6)**:短视频广告系统7天10%流量上ADVV +2.084%、Revenue +0.534%、Exposure +0.559%,离线AUC +0.09%。

Statistics of the Amazon Reviews datasets
Table 1: Statistics of the Amazon Reviews datasets
Statistics of the KuaiRec dataset
Table 2: Statistics of the KuaiRec dataset
Performance on Amazon Reviews
Table 3: Performance on Amazon Reviews
Performance on KuaiRec
Table 4: Performance on KuaiRec
Trial-level gains relative to the round-start best validation score
Table 5: Trial-level gains relative to the round-start best validation score
Online A/B test in short-video advertising scenario
Table 6: Online A/B test in short-video advertising scenario
Best-so-far validation HR@10 during the SASRec-based ablation study
Figure 2: Best-so-far validation HR@10 during the SASRec-based ablation study
查看结构化数据
任务指标本文基线提升
Amazon Reviews序列推荐(GRU4Rec平均HR@10) Avg HR@10 0.4990 0.2685(冷启动基线) +85.85%
Amazon Reviews序列推荐(HSTU平均HR@10) Avg HR@10 0.5317 0.4723(冷启动基线) +12.58%
Amazon Reviews序列推荐(SASRec CDs数据集HR@10) HR@10 0.6593 0.5833 +13.03%
KuaiRec观看时长(D2Q WT-XAUC) WT-XAUC 0.5947 0.5310 +12.00%
KuaiRec观看时长(TPM WT-MAE) WT-MAE 3.3406 4.5372 −26.37%(越低越好)
消融:非基线trial刷新轮最优的比例 Improving/All Ratio 47.92%(RecHarness) 22.45%(TR w/ Random) 约2.1倍
短视频广告在线A/B测试(ADVV) ADVV相对变化 +2.084% 生产ranker +2.084%

局限与改进

作者承认与可观察的局限包括:第一,RecHarness并非完全自主——arm集合 $A=\{a_1,\ldots,a_K\}$ 及local/jump划分、阈值 $\tau$、$\delta_{jump}$、窗口 $W$、retuning轮数 $R$ 都依赖人类专家针对每个任务预先定义,搜索空间质量受限于专家先验,跨新场景迁移需重新设计arm。第二,reward设计为二元信号 $r_t(a)\in\{0,1\}$ 且incumbent-conditioned,没有建模改进幅度大小,可能丢失'小幅但稳定改进'与'一次性大幅改进'的区分。第三,计算成本高昂:每个模型43,200秒(12小时)GPU预算、每轮4并行trial,且方法本身需要完整训练-验证循环,难以轻量试错。第四,论文未报告LLM调用成本与token开销、不同LLM后端的鲁棒性,也未给出在arm定义错误或先验偏差时的失败恢复机制。第五,Amazon评估用99负采样(非全排序),KuaiRec虽密集但仍为单一数据切片,泛化到更复杂多目标或冷启动场景未验证。

独立分析的弱点

独立分析的主要弱点与改进方向:第一,**arm空间的人工定义是天花板**——RecHarness只能搜索人类划定的编辑维度,无法发现'专家未想到'的结构创新。改进方向是让LLM或元学习器自动提议新arm并加入 $A_{jump}$,配合更激进的exploration bonus。第二,**二元reward信息损失**——可改为连续或分层奖励(如改进幅度分箱、训练稳定性加权),让后验更精细。第三,**单一incumbent轨迹**——当前是贪心incumbent提升,缺少对次优但有潜力的分支保留;可引入Pareto前沿或多incumbent记忆,借鉴AIDE的树结构做分支回溯。第四,**LLM成本未披露且后端单一**——应报告token/调用成本,并测试在不同LLM能力等级下的退化曲线,验证'随LLM推理能力增长Thompson相对收益是否下降'。第五,**评估局限于推荐**——bandit-routed agentic harness的思想可推广到更广的MLE任务(如CV分类器、NLP微调),但论文未做跨域验证,泛化性存疑。

未来方向

作者方向包括把RecHarness扩展到更多推荐场景与模型族、深化Experiment Skill的记忆机制(呼应EvoRec的co-evolve methodology、AgentX的semantic-gradient self-update)。基于成果可延伸:第一,自动arm发现——结合LLM提议与历史成功模式挖掘动态扩容 $A_{jump}$,降低对专家先验依赖。第二,把二元后验升级为连续/上下文bandit(如LinUCB、contextual Thompson),把数据集、模型族、任务类型作为context,实现跨场景后验迁移。第三,引入多目标Pareto路由——推荐业务常需同时优化ADVV、Revenue、Exposure、观看时长,单一标量 $M$ 不足,可做多维Thompson采样。第四,把retuning窗口与curriculum learning结合,让结构jump自动调整训练schedule。第五,研究LLM推理能力增长时bandit路由的边际价值变化,指导何时减少bandit约束、放开LLM搜索。

复现评估

复现评估总体较好。**开源**:作者公开代码(github.com/6lyc/RecHarness),重大加分。**数据**:Amazon Reviews与KuaiRec均为公开数据集,Table 1、Table 2给出预处理统计(如KuaiRec训练集12,530,806交互/7,176用户/10,728物品),可独立获取。**算力**:每模型43,200秒GPU预算、5个Amazon+3个KuaiRec+消融,完整复现总开销显著,普通实验室难承全量。**超参**:论文给出核心超参(4并行trial/轮、留最后一项、99负采样、HR/NDCG的N=10和20),但bandit阈值 $\tau$、$\delta_{jump}$、窗口 $W$、retuning轮数 $R$、Beta先验初值、LLM后端与prompt设计需查代码。**统计**:结果为三次平均并标bold,但未报标准差。综合判断:方法学清晰、数据公开、代码开源,复现主结论可行,但精确数字复现需较多算力与代码细节挖掘。