← 返回 2026-08-11

意图比响应更响亮:超越响应模仿的可控用户模拟 Intent Speaks Louder: Controllable User Simulation Beyond Response Imitation

Bo Wang, Ruixing Zhang, Yunqi Liu, Yang Zhang, Liangzhe Han, Tongyu Zhu, Leilei Sun 📅 2026-08-10 👍 8 2026-08-16 18:30
GRPO LLM评测 可控生成 对话系统 强化学习 用户模拟

把每轮交互意图变成显式控制变量,意图校准GRPO训练出意图准确率86.6%的用户模拟器

前置知识

LLM 用户模拟器(User Simulator)

用大语言模型扮演人类用户、与 AI 助手多轮对话的程序。因为真人交互数据昂贵、覆盖面窄且不可复现,社区用模拟器批量生成训练环境和评测环境:给定用户画像和对话历史,模型生成下一条用户消息,供助手应答,从而做合成数据、动态多轮评测或助手 post-training。代表工作有 USP(隐式画像条件化)和 UserLM(翻转对话训练的用户语言模型)。

本文的对象就是这类模拟器:先理解它以'下一轮响应模仿'为默认训练目标,才能理解作者为什么要给它加一层意图控制。

一对多生成与边缘/条件分布分解

同一个对话状态下存在多种都合理的下一轮用户行为:可以补充信息、接受回答、修正约束或指出助手错误。标准模仿学习拟合的是边缘分布 $\pi(u_t|c_t,p)$,把所有可能行为混在一起采样,无法指定要哪一种。论文用 $\pi(u_t|c_t,p)=\sum_{z} P(z|c_t,p)\,\pi(u_t|c_t,p,z)$ 把意图变量 $z$ 从语言实现中分解出来。

这是全文的问题起点和方法骨架:UserIDA 本质上就是把求和号里的 $z$ 暴露成显式控制变量,训练条件实现器 $\pi_\theta(u_t|c_t,p,z_t)$。

六类交互意图(规范指令分类法)

论文定义的逐轮控制接口:Initiate(开启新目标)、Amend(推进/修改进行中任务)、Supply(提供被索要的信息或材料)、Repair(纠正/质疑助手错误)、SetRegister(设定助手角色、协议或语气)、GroundAccept(问候、感谢、接受或继续)。标签只规定局部状态转移,不规定内容、措辞和风格,另有 Ambiguous 作为标注兜底并被过滤。

这个分类法是标注、SFT 条件、RL 约束和评测共用的核心接口,理解每类的边界规则(如 Repair 必须显式归因助手错误)才能看懂标注协议和实验。

GRPO(群组相对策略优化)

DeepSeekMath 提出的 RL 算法:对每个 prompt 用旧策略采样一组 K 个候选,把组内奖励标准化为优势 $\hat{A}_i=(r_i-\bar{r})/\sqrt{s_r^2+\varepsilon}$,免去训练价值网络,再用 PPO 式 clip 目标加 KL 惩罚更新策略。组内标准化是严格递增的仿射变换,不改变候选间排序。

UserIDA 的第三阶段就建在 GRPO 上,而且正是利用'标准化不改排序'这一性质,证明意图校准后的合规-违规排序在优势层面得以保持。

LoRA 低秩适配

冻结原模型权重,只训练注入到注意力/FFN 权重矩阵旁的低秩分解 $\Delta W=BA$(秩 $r$ 远小于维度),大幅降低显存和算力需求。本文 SFT 用 $r=64,\alpha=32$,RL 用 $r=16$,目标模块覆盖 q,k,v,gate,up,down_proj(SFT 还含 lm_head)。

论文全部训练都基于 LoRA,且在 4 张 RTX 4090 消费级显卡上完成,这直接决定了复现门槛的评估。

回顾式验证器与 Cohen's κ

回顾式验证器 $g_{ret}(c_t,p,v)$ 读入画像、对话状态和一条已实现的用户轮 $v$,输出其六类意图标签;与之对照的前瞻式预测器 $h_\phi(c_t,p)$ 只看状态预测下一轮意图。Cohen's κ 度量模型与人类专家在名义标签上超出随机一致的程度,$\kappa>0.8$ 通常视为高度一致。

这个冻结的 Qwen3.5-9B 验证器同时承担语料标注、RL 合规判定和自动评测三职,其与专家的一致性(κ=0.8223)决定了整套方法的可靠性上限。

研究动机

现有 LLM 用户模拟器几乎都以'下一轮响应模仿'为目标:给定对话历史 $c_t$(可选加上用户画像 $p$),直接预测下一条用户消息 $u_t$。这个生成任务天然是一对多的——同一个对话状态可以合理地引出截然不同的用户行为。论文在引言中举例:当助手向用户索要缺失的偏好信息时,真实用户可能提供偏好(Supply),也可能简单接受(GroundAccept);当助手推荐的马尔代夫方案违反了用户先前声明的预算时,真实用户应当纠错(Repair),但模仿式模拟器可能生成一句流畅却表示'接受'的回复。作者指出,这类错误不只是表面瑕疵:它们会实际改变对话状态走向,掩盖助手在澄清、纠错和任务细化上的缺陷,使基于模拟器的评测和训练环境失真。根本原因在于,画像和会话级目标只约束'用户是谁、最终想要什么',对'下一轮该做什么'完全欠约束——模拟器收不到任何显式信号来在一组同等合理的续写中选择。实验也印证了这一点:即便给最强的专用模拟器 USP 在推理时直接注入六类意图指令提示,其意图准确率也只有 62.28%,说明仅在推理期暴露接口远远不够。

本文的目标是本文的目标是把'下一轮用户消息应该完成什么交互动作'从'这句话怎么说'中分离出来,作为显式的、逐轮可控的变量。具体拆成三个子目标:其一,定义一个紧凑且表面欠规范的意图接口——六类规范指令(Initiate、Amend、Supply、Repair、SetRegister、GroundAccept),只规定局部交互状态转移,不指定目标载荷、措辞和风格,从而既比画像/全局目标更局部,又比参考轮复述更抽象;其二,训练一个指令条件化的模拟器:同一对话状态在不同指令下生成交互上不同但都合理的用户轮,同时保持语义保真(SimCSE)、风格保真(StyleCSE)和画像一致性;其三,建立三套互补的评测协议——真实对话上的轮级生成、同一对话多检查点的受控多轮轨迹评测、以及固定语境下换指令的干预套件——来分别度量意图遵循、跨轮组合一致性和因果可控性。量化目标是大幅超过最强基线 USP 的 62.28% 意图准确率,且不牺牲任何响应质量指标。

与已有工作不同的是,本文的独特切入是把指令微调中'每条回复都有显式用户指令'的思想迁移到用户模拟一侧,补上被忽视的中间层规范。此前的两条路线都没有占据这个位置:其一,画像或目标条件化(如 USP 的隐式画像、UserLM 的翻转对话训练)刻画长期身份与目标,对下一轮局部动作欠约束;其二,以目标轮复述为条件又过度约束,等于把参考答案的内容泄露给模型。作者提出'意图指令'恰好落在两者之间。在训练目标层面,已有的 RL 工作(目标达成、策略性行为、图灵奖励、UserLM-R1 等)都没有把'请求意图 vs 实现意图'当作显式约束变量;作者进一步发现并形式化了一个质量-意图错配问题:语义上吸引人但意图错误的候选可能在组间相对优化中获得有利优势,而任何固定加奖励 $\tilde{r}_i=q_i+\lambda b_i$ 都会在质量分差超过 $\lambda$ 时失效。解法是计算群组内最小分离平移 $\Delta_t$ 来校准奖励,给出可证明的排序保证——这是与 RLMR 等混合奖励方法的本质区别。

核心方法

直觉上,作者把模拟器从'预测下一句话'升级为'在指定动作类别下实现下一句话':在策略分解 $\pi(u_t|c_t,p)=\sum_{z} P(z|c_t,p)\,\pi(u_t|c_t,p,z)$ 中,把意图变量 $z$ 暴露成控制输入,模型只负责条件实现。技术路线三阶段。其一,规范意图标注:用冻结的 Qwen3.5-9B 回顾式验证器 $g_{ret}(c_t,p,v)$,按 SET_REGISTER→REPAIR→GROUND_ACCEPT→SUPPLY→AMEND→INITIATE→AMBIGUOUS 的优先级规则给 LMSYS 每个用户轮打唯一六类标签,Ambiguous 被过滤,得到 444,635/27,778/9,233 条训练/验证/测试轮次。其二,Intent-SFT:把画像、上下文、目标指令渲染进模板 $\Phi(c,p,z)$,只对目标用户轮 token 计负对数似然 $\mathcal{L}_{SFT}=-\sum_{\ell}\log\pi_\theta(u_\ell|u_{<\ell},\Phi(c,p,z))$,LoRA($r=64$)训 3 个 epoch,让同一对话状态学会映射到六类不同但都合理的行为。其三,意图校准策略优化:GRPO 框架下每组采 $K=4$ 个候选,冻结打分器合成质量分 $q_i=\alpha_{sem}r_{semi}+\alpha_{sty}r_{style}-\alpha_{AI}r_{aii}$(权重 0.50/0.02/0.05),再按验证器判定的意图合规性做群组内最小平移校准,标准化为优势后做 PPO-clip + KL 更新;全程 BF16、4 块 RTX 4090。

核心创新有两点。第一是'意图指令'接口设计:六类标签满足四个原则——逐轮局部(描述这一轮对交互状态做什么,而非人格或长期目标)、表面欠规范(不得复述目标轮或泄露载荷)、操作可判定(人和冻结验证器都能按显式边界规则执行)、开放域(刻画交互动态而非特定任务域)。它把一对多问题中'选哪个行为'的自由度显式交给外部控制器,使同一对话状态能被干预成六种交互上完全不同的合理续写,同时把'怎么说'留给模型。第二是意图校准的相对奖励:与固定奖励混合 $\tilde{r}_i=q_i+\lambda b_i$ 不同(当 $q_v-q_c>\lambda$ 时违规候选仍会胜出,且对质量打分的尺度漂移敏感),作者对每个混合组(既有合规也有违规候选)计算最小校准量 $\Delta_t=\max\big(0,\max_{i:b_i=0}q_i-\min_{j:b_j=1}q_j+m\big)$,把违规者奖励降为 $q_i-\Delta_t$,从而严格保证 $\max_{违规}r+m\le\min_{合规}r$;由于 GRPO 组内标准化是严格递增的仿射变换,这一顺序在优势层面保持不变(附录 B.2 给出证明)。全合规或全违规组退化为纯质量分,不注入无意义偏置。这样既消灭'高分错意'候选,又保留合规候选之间的语义/风格区分度,避免奖励坍缩。

方法步骤详情

第一步,标注与数据构建:冻结验证器读入画像 $p$、前缀 $c_t$、目标轮 $u_t$,按优先级输出唯一主标签;483,237 个用户轮标注覆盖率 99.995%,分布为 Amend 42.04%、Initiate 39.32%、SetRegister 6.23%、Repair 5.12%、GroundAccept 5.05%、Supply 1.92%,Ambiguous(0.32%)被过滤,按会话切分。第二步,Intent-SFT:输入是 $\Phi$ 渲染的模板(系统提示 + 画像块 + 历史 + 轮级意图指令块,并注明控制文本不得被复制进用户消息),输出目标 $u_t$;在 444,635 轮上训 3 epochs,LoRA $r{=}64,\alpha{=}32$,含 q,k,v,gate,up,down_proj,lm_head,学习率 $5\times10^{-5}$,有效 batch 648,最大长度 4096。第三步,意图校准策略优化:对每个指令条件化 prompt $x_t$ 采 $K{=}4$ 个候选;验证器判实现意图 $\hat{z}_i$,合规位 $b_i=\mathbf{1}[\hat{z}_i=z_t]$;三个冻结打分器合成质量分 $q_i$;混合组计算 $\Delta_t$(margin $m{=}0.10$)并校准;组内标准化为优势 $\hat{A}_i=(r_i-\bar{r})/\sqrt{s_r^2+\varepsilon}$;以长度归一化的 PPO-clip($\epsilon{=}0.2$)加每 token KL($\beta{=}0.05$)更新 LoRA($r{=}16$),学习率 $5\times10^{-7}$,在 49,844 轮上做 1 个名义 epoch,有效 batch 12 个 completion。

技术新颖性

与已有工作的本质区别体现在四个层面。相对画像条件化模拟器(USP、HumanLM 等):它们控制'用户是谁、怎么说',UserIDA 控制'这一轮做什么',两者互补——USP 的 StyleCSE 0.407 说明画像保真良好,但意图准确率仅 62.28%,恰恰暴露局部执行维度缺失。相对目标/推理导向的 RL 模拟器(UserLM、Turing Rewards、UserLM-R1):它们优化长期目标达成或人类相似度,没有逐轮意图变量,更没有'违规候选必须排在合规候选之下'的可证明排序保证。相对经典对话行为(dialogue act)传统(agendas、POMDP 对话行为):六类标签不是面向任务域的语义行为,而是开放域人机对话的局部状态转移抽象;论文还用上下文依赖探针(图 6)证明六类意图对画像、上轮助手回复、早期历史有系统性不同的依赖模式(如 Amend 对早期历史的 $\Delta$NLL 达 0.786),说明它们是可区分的状态抽象而非表面关键词类别。相对 RLMR 式固定混合奖励:本文的'最小分离平移'校准是适配群组相对优化的创新,附带排序保持证明,并显式处理全合规/全违规组的退化情形。工程闭环上,同一个冻结验证器同时承担标注、RL 合规判定与自动评测,保证三处意图语义一致,再辅以 1,315 轮、3 位专家的人工审计证明系统并非在过拟合验证器的特异偏好。

Overview of our proposed User Intent-Directive Alignment (UserIDA) framework.
Figure 2: Overview of our proposed User Intent-Directive Alignment (UserIDA) framework.

实验结果

轮级(表 2):UserIDA 意图准确率 86.62%、宏 F1 0.864,超最强通用基线 GPT-4o w/ Dir(77.34%)9.28 点、超最强专用模拟器 USP w/ Dir(62.28%)24.34 点,同时拿到 SimCSE 0.591、StyleCSE 0.476、Ctx Valid 86.73、User Auth 89.89 四项最佳,说明控制不以保真为代价。仅靠推理期注入指令即可让提示基线提升 6.01–26.16 点(LLaMA Base 40.30%→56.20%),但远不及训练条件化——Intent-SFT 即达 81.98%。分意图(表 14):六类全部最高(Initiate 92.6、Amend 80.8、Supply 73.4、Repair 83.3、SetRegister 91.7、GroundAccept 95.5);占 1.9% 的稀有类 Supply 从 USP 的 32.8% 升至 73.4%,增益不靠多数类(Initiate+Amend 占 81.4%)。消融(图 4):Base 56.2% → Intent-SFT 82.0% → 质量-only GRPO 反降至 80.7%(SimCSE 却升至 0.61,直接证明质量-意图错配)→ 完整 UserIDA 86.6%/0.59,回收 5.9 点意图精度。受控多轮(表 3):步级意图准确率 88.38%(USP 60.17%,+28.21 点),All-Turn 成功 58% vs 13%(+45 点),轨迹总分 78.93 vs 63.63;UserLM 角色分高(75.40)却仅 2% 轨迹全对,说明角色合理性与局部控制是两个维度。同语境干预(表 4):75.35%(最强外部基线 41.32%,+34.03 点),4-of-6 成功 91.67% vs 22.92%,覆盖 4.71/6;较 w/o RL 的 +9.03 点经配对 bootstrap 显著(95% CI [4.17,14.24])。人工审计(表 11):均衡人工意图准确率 90.83% > w/o RL 84.17% > USP 49.17%,排除'只过拟合验证器偏好'的担忧。闭环试点(表 16):指令准确率 51.20% vs USP 19.35%(+31.85,CI [14.17,40.14]),目标成功 54.17% vs 25.00%。

Canonical interaction-intent directives.
Table 1: Canonical interaction-intent directives.
Turn-level next-user simulation.
Table 2: Turn-level next-user simulation.
Conversation-level performance comparison of different user simulators.
Table 3: Conversation-level performance comparison of different user simulators.
Within-context directive intervention.
Table 4: Within-context directive intervention.
Agreement with expert intent labels.
Table 5: Agreement with expert intent labels.
Full canonical interaction-intent directive taxonomy.
Table 6: Full canonical interaction-intent directive taxonomy.
Corpus size and taxonomy coverage.
Table 7: Corpus size and taxonomy coverage.
Intent distribution: count and percentage of labeled user turns.
Table 8: Intent distribution: count and percentage of labeled user turns.
Per-intent agreement with expert labels.
Table 9: Per-intent agreement with expert labels.
Intent accuracy on model-generated user turns under human and automatic labels.
Table 11: Intent accuracy on model-generated user turns under human and automatic labels.
Exact directive accuracy (%) by target intent.
Table 14: Exact directive accuracy (%) by target intent.
Within-context intervention comparison.
Table 15: Within-context intervention comparison.
Diagnostic recursive closed-loop evaluation.
Table 16: Diagnostic recursive closed-loop evaluation.
Per-intent turn-level results.
Figure 3: Per-intent turn-level results.
Effect of supervised directive conditioning and intent calibration.
Figure 4: Effect of supervised directive conditioning and intent calibration.
Directive-specific context dependence.
Figure 6: Directive-specific context dependence.
Cross-judge groupwise evaluation.
Figure 7: Cross-judge groupwise evaluation.
查看结构化数据
任务指标本文基线提升
轮级下一轮用户模拟(LMSYS-USP 测试集) Intent Accuracy 86.62% USP w/ Directive 62.28%(最强专用);GPT-4o w/ Directive 77.34%(最强通用) +24.34 pp / +9.28 pp
轮级下一轮用户模拟 Macro-F1 0.864 USP w/ Directive 0.509 +0.355
受控多轮轨迹评测 All-Turn Success 58.00% USP w/ Directive 13.00% +45 pp
受控多轮轨迹评测 Step Intent Accuracy 88.38% USP w/ Directive 60.17% +28.21 pp
同语境指令干预(48 状态 × 6 指令) Intent Accuracy 75.35% LLaMA-3-8B Base w/ Directive 41.32%(最强外部基线) +34.03 pp
同语境指令干预 4-of-6 Success 91.67% LLaMA-3-8B Base w/ Directive 22.92% +68.75 pp
生成轮人工意图审计(3 专家,意图均衡) Human IAbal 90.83% USP w/ Directive 49.17% +41.66 pp
递归闭环试点(24 场景,72 会话) Directive Accuracy 51.20% USP w/ Directive 19.35% +31.85 pp(95% CI [14.17, 40.14])
跨裁判组内偏好评测(Qwen judge) Mean overall score (0–5) 2.87 USP w/ Directive 2.25;UserLM 1.25;LLaMA-3-8B 0.86 排序与人工/LLaMA 裁判完全一致:LLaMA < UserLM < USP < w/o RL < UserIDA

局限与改进

作者承认的局限:其一,回顾式验证器与专家的一致性虽高(κ=0.8223、准确率 87.88%),但残余错误集中在相邻类边界——Initiate→Amend 7.81%、Amend→Initiate 10.32%、Repair→Amend 9.09%,意味着标注与 RL 信号本身携带边界噪声,模型在 Initiate/Amend 上的表现(92.6/80.8)可能部分受益于类间语义重叠;其二,前瞻式意图预测仅 71.39%(κ=0.5950),说明'该做什么'本身部分不可判定,当前框架仍依赖外部供给指令,尚无自主意图策略;其三,论文把全违规组率作为'指令探索不足'的诊断量记录,暗示部分组无法提供意图梯度信号。我自己的观察:第一,标注、RL 合规判定、自动评测共用同一个 Qwen3.5-9B 验证器,存在循环优化的结构性风险——表 11 的人工审计(90.83%)部分缓解了担忧,但审计集仅 1,315 轮且仍在同一套六类分类法内;第二,六类单标签无法表达一轮内多个动作(如'先纠错再补充'只能按优先级取主动作),也缺少用户长期策略层;第三,类别极不均衡(Supply 仅 1.92%),Supply 73.4% 仍是六类最低;第四,受控前缀协议避免了误差传播,但也回避了真实闭环中的复合漂移,而闭环试点规模很小(24 场景、72 会话、365 轮)且只接了 Qwen3.5-9B 一个助手;第五,基于参考的 SimCSE/StyleCSE 对一对多生成天然保守,合法的不同续写会被扣分,论文自己的质量-only GRPO 消融恰恰显示这两类指标的张力;第六,全部结论限于 LMSYS 英文开放域对话和 8B+LoRA 规模,任务导向对话、agent 工具调用场景与多语言未验证。

独立分析的弱点

第一,单验证器闭环:标注、RL 奖励和评测共用 $g_{ret}$,若它有系统性偏差(例如把委婉纠错判成 Amend),SFT 与 RL 会协同放大该偏差。改进方向是验证器集成投票、按验证器置信度/不确定性加权奖励,或对边界样本做人工仲裁的主动学习。第二,Initiate/Amend 边界模糊且占 81.4%:可引入分层标签(先判'开新任务还是推进旧任务',再细分)或主+次双标签,并把'是否显式归因助手错误'做成显式二值特征辅助 Repair 判定。第三,稀有类 Supply 在 RL 中天然被稀释:可按意图做组容量或采样频率的 curriculum 调度,对 Supply 提高每组候选数,或在混合组判定中给稀有类更大的 margin。第四,评测体系依赖 LLM judge 与参考相似度:质量-only GRPO 的消融(SimCSE 升至 0.61 而意图降至 80.7%)说明参考型指标与意图正确性存在张力,应开发意图条件化、一对多感知的评测(如'该意图下行为等价类匹配'),并对 judge 做位置偏差与冗长偏好的校准。第五,意图空间是固定人工先验:可学习连续意图嵌入或从数据中归纳可扩展的开放标签集,使指令空间随场景生长。第六,泛化边界未探明:8B+LoRA 够用是好信号,但任务导向对话(需要槽位/目标状态)、agent 工具调用(需要模拟工具输出与支付等副作用)、非英语场景均未测试;接入更强助手后的闭环行为漂移也需系统评估。

未来方向

作者提出的方向:其一,把前瞻式预测器 $h_\phi(c_t,p)$(已达 71.39% 专家一致、0.718 宏 F1)发展成自主意图策略,让模拟器在无外部指令时按学到的分布采样意图,形成'可编程先验 + 自主运行'的两用模拟器;其二,把 UserIDA 当作助手 post-training 的可控环境——外部控制器按私有场景状态选择指令序列(需要信息时 Supply、助手出错后 Repair、标准满足后 GroundAccept),生成可复现的反事实多轮轨迹用于 RL 训练与回归评测,这与 UserRL、APIGen-MT 的方向直接衔接;其三,扩展更细粒度的意图组合与序列级规划控制。基于本文成果可延伸的方向:第一,把'意图校准的群组相对奖励'抽象为通用'约束优先'模块,套用于工具调用正确性、安全约束、格式合规等其他可验证属性,凡属'质量分可能与硬约束冲突'的 RL 场景都可复用 $\Delta_t$ 式最小平移校准;第二,跨验证器鲁棒性研究——换用 GPT/Claude 系验证器重测意图准确率,量化方法对验证器选择的敏感性;第三,在 Sim2Real、MirrorBench、ChatBench 等人类相似度与评测可靠性基准上,检验意图控制是否改善模拟器作为评测代理的保真度;第四,把意图与个体差异结合(同一意图在不同人格下的表达倾向分布),连接用户建模与心理语言学;第五,用指令干预做助手的定向压力测试:系统性构造 Repair/SUPPLY 交替序列,探测并量化助手在澄清、纠错、约束保持上的能力边界。

复现评估

复现条件在同类工作中属于较好水平。代码已开源(github.com/ptwang773/UserIDA);数据基于公开的 LMSYS-Chat-1M,按 USP 公开协议做非英语/毒性/低质过滤并按会话切分,隐式画像直接沿用 USP;标注使用公开的 Qwen3.5-9B,附录 A 给出完整的分类 prompt(含七步决策顺序与 JSON 输出格式),附录 C 报告了标注覆盖率 99.995% 与人工审计细节。训练成本友好:两阶段全部 LoRA(SFT $r=64$、RL $r=16$)、BF16、4 块 RTX 4090 消费级显卡即可完成;附录 D 的表 12/13 列出全部超参(学习率 $5\times10^{-5}$/$5\times10^{-7}$、有效 batch 648/12、$K=4$、margin 0.10、KL 0.05、clip 0.2、解码温度 0.8/贪心)。评测协议完整:式 (13)–(26) 给出所有指标定义,附录 F 提供轮级 rubric、会话级 rubric、组内比较三套 judge prompt。主要成本在算力与推理:SFT 需在 444,635 轮上训 3 个 epoch,RL 在 49,844 轮上做 $K=4$ 组采样,标注与评测需对数十万轮做验证器推理(建议 vLLM 加速);人工审计(3 位专家、1,315 轮)普通团队可省略,用自动验证器替代即可得到可比数字。总体难度中等:流水线无未公开组件,难点在于忠实复刻三套评测协议并稳定运行 LLM judge。