训练智能体与其脚手架共同进化:TaoLive 数字人主播智能体技术报告 Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
提出HAT训练法,让紧凑模型学会理解不断演化的Harness配置,兼顾低延迟与业务敏捷迭代。
前置知识
Harness(智能体脚手架)
包裹在策略模型外围、可在不改动模型权重的前提下独立更新的一整套执行环境配置。本文将其形式化为四元组 $h=(S,T,P,K)$:$S$ 是活跃 Skills(回复规则与策略模块)、$T$ 是工具注册表(schema 与描述)、$P$ 是动态流水线装配的系统提示、$K$ 是 Hooks(输入校验、参数检查、格式强制与重试逻辑)。各模块按版本独立发布,使业务行为能在几小时内改版。
全文的核心问题是『模型如何适应持续变化的 harness』。不理解 $h$ 的构成,就无法理解 HSA 到底在增强什么、四个奖励维度在约束什么。
表面形式过拟合(surface-form overfitting)
在单一固定 harness 配置上训练后,模型记住的是具体技能名、工具名和提示模板的字面形式,而非其功能语义。一旦上线后技能改名、工具描述重写或提示结构变化,模型就失灵。论文证据:Fixed-Harness SFT 使 IFEval 下降 7.7 分(IFE-P 81.5→73.8),且在 harness 变体集 T2 上 Accuracy 反而从 88.7 降到 86.9。
这是 HSA 要治疗的核心病症。理解了『靠字符串匹配抄近路』的失败模式,才能理解为什么增强必须做在 harness 上且保持任务语义。
在线策略蒸馏(On-Policy Distillation, OPD)
学生模型先自己对输入采样生成序列(on-policy),再用教师模型对这些序列逐 token 打分,以 KL 散度 $\mathcal{L}_{OPD}=\mathbb{E}_{x\sim D_{gen}} D_{KL}(p_\theta(\cdot|x)\,\|\,p_{base}(\cdot|x))$ 为损失,把学生的整个输出分布拉向教师,而不是只模仿离线答案。优势是能纠正学生自己的采样分布偏移。
论文的 General OPD 阶段以底座模型为教师、在 Tulu3 通用数据上蒸馏,专门修补领域 SFT 造成的通用指令跟随能力损失,是三阶段流水线的关键一环。
GRPO 与 GDPO
GRPO(组相对策略优化)对每个 prompt 采样 $G$ 条完整轨迹,用组内归一化奖励充当优势,省去价值网络。GDPO 进一步按奖励维度分别做组内归一化 $\hat{A}^{(d)}_i=(r^{(d)}_i-\mu^{(d)}_g)/\sigma^{(d)}_g$ 再求和,避免单一维度(如 Accuracy)淹没其他信号,并把轨迹切成工具段与回复段分别成组。
HSA-RL 的目标函数建立在二者之上,还叠加了 CoT 长度惩罚($L\le100$ 免罚、$L\ge200$ 饱和)与 GSPO 序列级重要性采样,读懂这套奖励-优势设计才能理解 RL 消融结果。
MTP 与投机解码
MTP(Multi-Token Prediction)是挂在主模型上的 NextN 草稿头,一次预测多个未来 token;推理时经 EAGLE 风格的『草稿-验证』路径执行三个投机步、每步四个草稿 token,被主模型接受的 token 直接输出从而加速解码。文中 MTP 开启后解码吞吐提升 1.69 倍(并发 1)。论文还给出把预训练草稿头『嫁接』到训练后策略上再适配的损失公式 $\mathcal{L}_{MTP}$。
P50 3.407 秒的低延迟指标高度依赖 MTP;理解草稿头与策略参数必须一起更新(否则接受率降为零),才能看懂部署实验部分。
IFEval 与 Agent-as-a-Judge
IFEval 是公开的指令跟随基准,报告 prompt 级(IFE-P)与指令级(IFE-I)准确率,衡量模型是否遵守显式的格式与内容约束。Agent-as-a-Judge 则用另一个可编辑的 harness 智能体当裁判,对回复按 Accuracy(0/1,罚事实错误、虚假承诺)与 Effectiveness(0/0.5/1,看是否解决用户意图)打分,并在 482 条人工标注样本(Cjudge)上做过校准。
论文四个评测集的打分都靠这两套体系,『领域提分』与『通用能力不回退』的结论也分别由它们支撑,是解读所有实验数字的前提。
研究动机
淘宝直播的数字人主播要实时回答商品问题、与观众互动并执行营销策略,且回复全程公开广播,因此必须同时满足三条硬约束:超低延迟以维持观众留存、对频繁变化的招商规则/合规口径/商家偏好的高适应性、以及准确无幻觉的回答。为避免每次策略调整都重训模型,系统引入可演化的 evolvable Harness——Skills、Hooks、提示、工具四类模块按版本独立发布,几小时内即可完成改版。但这带来一个两难:大模型(如 DeepSeek-V4-flash)能零样本理解新 harness,可实测端到端中位延迟超过 11 秒,无法实时互动;满足延迟的紧凑模型必须做领域训练,而在单一固定配置上训练会导致表面形式过拟合——模型背下技能名和模板而非理解指令,实验显示 Fixed-Harness SFT 让 IFEval 掉 7.7 分,harness 一改版就失灵。测试时适应会违反延迟预算,持续学习则每次改版都要重付训练成本,在周级更新频率下都不可行。
本文的目标是训练一个紧凑策略模型(Qwen3.6-35B-A3B 级别),让它像大模型一样能读懂『当前给到的』任意 harness 配置而不是死记某个版本,从而与 harness 共同进化。具体目标有三:一是在明确声明的变更包络内,对部署时抽到的新 harness 状态 $h'\sim E_{deploy}$(比任何单一训练快照都更宽)保持业务回复效果;二是保住通用指令跟随能力(IFEval),避免领域微调常见的灾难性遗忘;三是部署在单张 NVIDIA H20 上仍满足实时约束——15 秒硬上限、目标 P50 约 3-4 秒——并在淘宝直播生产环境通过 A/B 实验验证真实业务收益。
与已有工作不同的是,已有工作把 harness 当作部署期的静态常量:训练只针对当时碰巧在线的那一套生产配置。本文的独特切入是把 harness 状态本身纳入训练分布——数据不再来自单一配置,而来自一个任务保持的『变更包络』。为此提出 Harness-State Augmentation(HSA),对技能标识与内容、工具 schema、提示结构、Hook 行为五个维度做系统扰动,并贯穿 SFT、蒸馏、强化学习三个训练阶段。与测试时适应(违反延迟)、持续学习(每次编辑重训)两条备选路线相比,HAT 只训练一次就换来对配置变化的鲁棒性;同时用 General OPD 这一独立阶段专门修补 SFT 造成的通用能力损失,形成了『领域适应—能力恢复—环境内强化』互补的三段式设计。
核心方法
直觉上,要让小模型像大模型那样『见招拆招』,训练时就得让它见过足够多的『招式』变体。HAT 先把一次智能体交互建模为 $\pi_\theta(a|x,h)$,其中 harness 状态 $h=(S,T,P,K)$ 涵盖活跃技能、工具注册表、系统提示与 Hook,且在生产中持续演化(每周加技能、工具接口随上游变、提示随 bad case 修订)。训练分三阶段:第一阶段 HSA-SFT,用强教师模型在原始及 HSA 增强后的多种 harness 环境里生成候选轨迹,经 Accuracy/Effectiveness 拒绝采样过滤后,用 10K 条真实直播间样本做监督微调,直接提升推理与工具调用能力;第二阶段 General OPD,以底座模型为教师、在 Tulu3 通用指令数据上按 KL 散度做在线策略蒸馏,恢复被 SFT 损伤的通用能力;第三阶段 HSA-RL,在一个带技能路由、Hook 重试、工具故障注入的生产参照型直播间模拟器中,对原始与增强 harness 混合采样的 rollout 做 GRPO 强化学习,最终得到能随 harness 演化的策略。
核心创新是 Harness-State Augmentation(HSA):对 harness 的五个维度做任务保持式变换——(1) 技能标识:合成似真技能与噪声技能、随机遮蔽、改名、用强模型重写描述;(2) 技能内容:逐条改写规则、随机遮蔽子集、打乱顺序;(3) 工具定义:改名并重写描述;(4) 系统提示:重排顶层指令块与块内条目、在运营有效范围内扰动数值约束(如回复长度上限 80→60 字符);(5) Hook:设计重试行为、消息结构的变化变体。其假设是:一旦表层形式不断变化,靠字符串匹配技能名或背诵工具 schema 的捷径就失效,功能性语义变成路由与调用的唯一可靠信号,模型因此被迫学会『理解当前 harness』而非『记住某个版本』。这与领域泛化中的数据增强同源,但增强对象是智能体的执行环境而非输入样本——这是与 Fixed-Harness SFT 的本质区别。
方法步骤详情
第一步 HSA-SFT:对 10K 条真实直播间样本施加 HSA 生成多个 harness 变体;教师模型在各变体环境下生成候选轨迹,由裁判按 Accuracy/Effectiveness 拒绝采样过滤;多数含 Hook 重试的轨迹删去中间失败片段只留正确终态,少量完整保留以教会模型听懂 Hook 提醒。第二步 General OPD:以底座模型为教师,在 Tulu3 上让学生在线采样并最小化 $\mathcal{L}_{OPD}=\mathbb{E}_x D_{KL}(p_\theta\|p_{base})$,恢复通用指令跟随能力。第三步 HSA-RL:每次 rollout 前决定用原始或增强 harness;GRPO 每提示采 $G$ 条轨迹并按工具段/回复段分组,Accuracy、Effectiveness、Tool Rationality、Skill Selection 四维奖励经 GDPO 逐维组内归一化,叠加 CoT 长度惩罚 $r_{CoT}(L)$(100 token 内免罚、200 饱和),重要性采样用 GSPO 序列级比率并裁剪,零优势样本直接丢弃。
技术新颖性
新颖性有四点。其一,把『执行环境配置』本身当作可增强的数据维度:传统领域泛化增强的是输入文本,标准智能体 SFT/RL 把环境固定,HSA 则显式地把 harness 变化写进训练分布,这直接对症『模型随配置过时』的部署痛点。其二,三段信号的分工与可叠加性被消融严格证实:HSA-SFT 主要抬回复质量(T1/T2 +9.7/+14.8)且天生不伤泛化,General OPD 在 Fixed 路径上恢复 IFE-P 8.5 分,HSA-RL 把代理行为维度(Skill Selection、Tool Rationality)推到最优——三者互补而非冗余。其三,奖励设计针对多步智能体的信用分配:轨迹按工具段/回复段分组、四维奖励逐维归一化(GDPO)、CoT 长度分段正则,配合 GSPO 序列级重要性采样以稳住 MoE 稀疏路由下的训练。其四,工程层面首次(在此类报告中)给出任务训练后策略模型的 NextN 草稿头嫁接与再适配方案,把质量训练与推理加速解耦,并实测同检查点 MTP 开关质量不变(T1 AVG 94.8→95.2)。
实验结果
四评测集(超 4500 例)核心结果:T1 直播间问答达 94.8(底座 80.3,最强通用模型 93.0),T2 harness 变体问答达 94.6(底座 75.4),与 T1 分差仅 0.2(底座 4.9)。IFE-P/IFE-I 83.5/88.7,比底座高 2.0/1.0,避开 Fixed SFT 的 7.7/5.3 分暴跌;T3 工具/提示鲁棒性 84.0/77.6,同样全面领先 Fixed SFT。消融显示 HSA-SFT 使 T1/T2/工具鲁棒性升 9.7/14.8/15.7 分,Fixed 路径 RL 后提示鲁棒性却跌至 66.7(低于底座),HSA-RL 保持 77.6。部署回放单张 H20 上 HAT+MTP 并发 1 下 P50 3.407 秒、P95 8.114 秒、15 秒达标率 100%。真实 harness 编辑测试中 HAT 错误数降 51.7%,Fixed SFT 仅降 18.1%。盲测非平局案例 Harness 赢 35/36(97.2%);线上 A/B(197.7 万 UV)GMV +4.334%、IPV +0.9107%,均显著正向。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| T1 Live-Stream QA(真实直播间回复质量) | AVG(Accuracy 与 Effectiveness 的逐样本均值) | 94.8(Acc 95.8 / Eff 93.8) | 底座 Qwen3.6-35B-A3B 80.3;最强通用模型 GLM-5.2 93.0 | 较底座 +14.5,超最强通用模型 +1.8 |
| T2 Harness-Variant QA(harness 变体鲁棒性) | AVG | 94.6(Acc 94.5 / Eff 94.7) | 底座 75.4;Fixed-Harness SFT 88.2 | 较底座 +19.2,较 Fixed SFT +6.4;与 T1 的分差仅 0.2(底座 4.9) |
| T4 IFEval(通用指令跟随) | IFE-P / IFE-I | 83.5 / 88.7 | 底座 81.5 / 87.7;Fixed-Harness SFT 73.8 / 82.4 | 较底座 +2.0 / +1.0(Fixed SFT 则暴跌 -7.7 / -5.3) |
| T3 Tool Robustness(合成场景工具鲁棒性) | ACQ/RC/TC 之 AVG | 84.0(TC 94.7,RC 70.1) | 底座 69.5;Fixed-Harness SFT 82.0 | +14.5 / +2.0 |
| T3 Prompt Robustness(合成场景提示鲁棒性) | ACQ/FI/TCO 之 AVG | 77.6(ACQ 99.4,TCO 65.3) | 底座 72.8;Fixed-Harness SFT 68.2 | +4.8 / +9.4 |
| 部署回放 Dperf(并发 1,单张 H20) | Wall P50 / P95(秒)、≤15s 达标率 | 3.407 / 8.114 秒,100%(MTP On) | 底座+MTP:3.648 / 9.805 秒,99%;DeepSeek-V4-flash API:11.210 / 21.191 秒,71% | P50 快 0.24 秒、P95 快 1.7 秒,API 路线无法满足 15 秒约束 |
| 线上 A/B(淘宝直播生产环境,197.7 万 UV) | UV 归一化确认收货 GMV / IPV 相对提升 | +4.334% / +0.9107% | 线上 ReAct 对照组(158.1 万 UV) | 平台判定两项均显著正向 |
| 人类盲测(100 对真实请求) | 非平局偏好胜率 | 35/36(97.2%),p<0.001 | ReAct 风格模块化基线仅 1 例被偏好 | 与自动裁判结论一致 |
局限与改进
作者坦承多处证据边界:训练动态(Fig.5/6)与 MTP 损失曲线(Fig.7)均为单次运行的过程诊断,不代表跨种子稳定性或训练效率;Decode 吞吐对生成长度敏感,跨模型速度对比不构成内核级速度结论;厂商 API 基线的硬件、批处理与负载不可观测,只作运维参考;A/B 只复现了平台『显著正向』的判定快照,未给出 p 值与置信区间;评测裁判本身也是 harness 智能体,仅在 482 条人工标注上校准。我的补充观察:所有业务评测集都来自淘宝直播自有流量、由自建裁判打分,存在裁判自偏好与场景单一性风险;T2/T3 的『变体』正是由同一 HSA 机制生成的,有自己出题自己答之嫌(held-out 编辑实验部分缓解,但仅限提示与技能类编辑);高并发下性能明显衰减(C=8 达标率 75%),方案的有效运行域其实是低并发;所用底座与教师均为特定版本,方法对其他模型族的迁移性未验证。
独立分析的弱点
第一,对强教师模型的依赖重:HSA-SFT 的监督信号全部来自教师在增强环境中的轨迹,教师在新 harness 上的系统性偏差会被学生继承,改进方向是引入师生分歧挖掘或让学生在过滤环节参与自我修正。第二,变更包络靠人工设计:HSA 五类扰动(改名、改写、重排、数值扰动、Hook 行为变体)未必覆盖线上更剧烈的编辑,如工具语义变化或技能间冲突,可改为 failure-driven 自动增广——把线上 bad case 反向合成新的 harness 变体持续扩充包络。第三,裁判可信度:Agent-as-a-Judge 由同一团队实现并在仅 482 例上校准,存在自评循环风险,应引入独立第三方裁判或更大规模人工标注交叉验证。第四,泛化边界未充分检验:缺少与测试时适应、持续学习两条被否决路线的定量对比实验,『只训练一次』的优势目前是论述而非测量。第五,训练基建门槛高:RL 需要带故障注入的完整直播间模拟器,普通团队难以复用,开源模拟器与 HSA 工具链会显著放大方法的行业价值。
未来方向
作者方向上,Harness Evolution 目前是人在环的『诊断-确认-编辑-评估-回归』循环(Evo.2 即因长尾规则回退而早停),未来可让 AI 承担端到端编辑并在自动回归门禁下自主晋升;变更包络本身也可从线上 harness 版本历史中自动学习分布,而非手工设定五类扰动。基于本文成果可延伸:其一,把 HSA 推广到客服、教育、企业知识助手等其他需要环境敏捷性的领域,验证跨域通用性;其二,把 RL 环境的故障注入与恢复行为扩展到长程任务——主动营销、多轮逼单、跨链接选品规划;其三,把『何时改配置、何时重训模型』形式化为联合调度决策问题,打通权重更新与 harness 更新两条迭代通道;其四,以多种子训练与更严格的统计报告(置信区间、p 值)巩固结论;其五,探索 MTP 草稿头与策略的协同训练或并发感知调度,缓解高并发下加速饱和(C=8 仅 1.19×)的问题。
复现评估
完全复现难度很高。这是一份工业技术报告,未提及开源代码、模型权重或数据;训练数据(10K SFT + 4K RL 任务)与评测集(T1/T2 各 978 例、T3 2023 例、Cjudge 482 例、Dperf 110 例)全部来自淘宝直播私有流量,外部无法获取。方法描述相对完整:三阶段流程、HSA 五类扰动、GDPO/GSPO 目标、CoT 惩罚阈值($L_{low}=100$、$L_{high}=200$)均已写明,但缺少关键超参——GRPO 组大小 $G$、裁剪范围 $\varepsilon$、学习率、训练轮数与算力清单。推理侧复现门槛较低:单张 NVIDIA H20、BF16、TP=PP=1,EAGLE 风格投机解码三步四草稿,若拿到同款底座模型与 vLLM 类引擎可近似复现延迟数量级。总体而言,学界可做到『方法层面重实现 + 公开基准(IFEval)对齐』,业务指标与 A/B 结论只能当作参考证据而非可验证事实。
论文图表
固定模型不改权重,仅靠多轮 harness 编辑迭代:Evo.1 把 Accuracy 从 82.40 提到 92.13 但 Effectiveness 降到 84.16;Evo.2 达 92.55/92.75,被选为发布检查点;Evo.3-4 加入长尾规则后一个或两个维度回退(如 91.51/91.51、90.89/89.96)。
用真实数据证明『不训练模型也能靠 harness 编辑显著改进智能体』,同时暴露编辑的回归风险——正是这一现象重塑了训练问题,是全文动机的实证支点。