NeoHorse-1:经路由护栏智能体后训练迈向递归自我改进 NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness
把部署路由护栏的交互轨迹与能力信号转化为课程化后训练,闭合评估—选择—更新循环。
前置知识
递归自我改进(RSI)
指让 AI 系统在自己的改进过程中扮演越来越大的角色:从优化单条回复、改造执行护栏,到从自己生成的经验中学习,甚至自动化部分 AI 研究流程。其结构吸引力在于:一旦模型改进本身被部分自动化,每一代模型都能为下一代贡献改进,形成复利式迭代,不再完全受人工数据和人类监督的约束。
本文的最终目标就是 RSI,全篇围绕“系统如何观察自身能力并把证据转化为下一轮学习”这一机制展开,理解这个概念才能把握论文的定位与贡献边界。
智能体护栏(Agent Harness)
护栏是管理智能体执行的技术层,负责组织上下文、提供工具接口、注入系统指令,并处理与终端、文件系统、网页、API 等环境的交互。同一模型配不同护栏表现可能差异巨大(SWE-agent 等研究表明接口设计直接影响性能与稳健性)。带路由的护栏还会根据请求和交互状态决定由池中哪个模型来服务。
本文的训练数据、难度信号与反馈闭环全部产生于部署护栏之内,“护栏介导的 RSI”是全文关键词,不懂护栏就无法理解数据从哪来、闭环如何闭合。
LLM 路由与服务分层
路由器在用户回合级预估请求的“能力需求”,把请求分配给异构模型池中合适的模型,以在响应质量与推理成本间权衡(如 FrugalGPT、RouteLLM、Agentic Routing)。本文系统把每回合分到 C0–C3 四个服务层级:C0 处理有界低风险请求,C1 是通用默认档,C2 支持多步推理与执行,C3 提供最高能力或可靠性。
路由记录(预测层级、实际服务层级与后续交互结果)正是本文用来构造课程难度信号和闭环反馈的原始材料,是方法部分的地基。
在线策略蒸馏(OPD)与反向 KL
传统蒸馏让学生模仿教师的固定轨迹,存在训练与部署的分布偏移。OPD 改为学生自己生成回复,教师在学生访问到的每个前缀上提供下一个 token 的分布作监督。损失用反向 KL $D_{\mathrm{KL}}(\tilde{P}_\theta \| \tilde{Q})$,其中 $\tilde{P}_\theta$ 是学生分布、$\tilde{Q}$ 是教师分布,会把学生的概率质量拉向教师的高概率模式,提供比轨迹 SFT 更密集的过程监督。
本文把路由课程推广到 OPD 的起始上下文调度(R-OPD),是其两大训练方法之一;不熟悉 OPD 与反向 KL 就读不懂第 4.3 节和式 (3)(4)。
课程学习(Curriculum Learning)
一种训练策略:按估计的难度组织样本呈现顺序,先易后难,以获得更稳定的优化过程和更好的最终性能。在 LLM 后训练中已证明有效,但现有方法通常依赖显式难度标注或数据集特定启发式,标注成本高、难以随部署规模自动增长。
本文的核心贡献正是用路由打分免费替代人工难度标注:难度信号来自部署时的真实预估,理解课程学习才能看出这一替代的价值。
交错思考与轨迹 SFT
现代智能体模型的一条回复序列通常交织着推理文本、工具调用与工具结果,称为交错思考(interleaved thinking)。轨迹 SFT 把完整交互序列化后做监督微调:只对助手生成段(推理、工具调用参数、可见回复、结束符)计损失,用户消息、工具结果、系统指令与工具规格只作上下文、不计损失。
论文的数据构造、损失掩码设计(式 1)以及“省略早期回合推理”的上下文策略都建立在这一范式之上,式 (1) 的掩码求和归一化直接对应这套约定。
研究动机
在本文之前,智能体后训练主要依赖两类数据:人工或合成的高质量教师轨迹(如 FireAct、AgentTuning 以及公开的 Toucan 工具智能体数据集),以及把交互记录当作静态监督的轨迹 SFT。这带来三个具体问题。其一,分布偏移:SFT 让模型模仿录制好的教师回复,而部署时模型条件于自己生成的前缀,一旦走偏就缺乏纠偏监督。其二,课程学习需要难度信号,但显式难度标注昂贵且无法随规模增长,公开合成轨迹又与真实用户任务分布脱节——例如 Qwen3.5-4B 在 QwenClawBench 项目排期任务中虽然能找到工作目录里的文件,却不去查看经理邮件中更新过的依赖约束,用过期信息生成无效排期还把产物写到错误路径,这类“局部合理但整体断裂”的执行失败恰恰只有真实交互数据才能教模型修正。其三,递归自我改进长期停留在概念层面,缺少一个具体机制让系统观察自身能力、并把观察到的证据转化为下一轮学习。
本文的目标是本文要为“护栏介导的递归自我改进”给出一个可运行的原型。目标分三层。系统层:构建由异构模型池和多个护栏(含 OpenSquilla)支撑的路由护栏,让每次交互都留下执行轨迹、路由记录与任务结果三类可复用信号。数据层:把部署轨迹转化为保留交错推理、工具调用与护栏上下文的用户回合训练样本,经结构校验、六维语义评估与子场景级标注后入库,并用能力评估反馈决定下一轮训练混合比例。模型层:训练 NeoHorse-1-4B 与 NeoHorse-1-9B 两个智能体原生模型,量化目标是把十项基准的宏观平均分从 4B 基座的 58.94 提升到 64.87、9B 基座的 65.60 提升到 69.04,并显著缩小后训练 4B 模型与 9B 基座之间的总差距,为跨代迭代的 RSI 打下可操作的基础。
与已有工作不同的是,本文的独特切入在于:作者注意到部署中的路由护栏本身就是一个现成的“能力传感器”。每次交互它都记录预测的能力需求、实际选择的服务层级和随后的交互结果,构成“预测—行动—结果”三元记录。与 FrugalGPT、RouteLLM 只把路由当作服务时降本提质的手段不同,本文把路由记录升级为训练组织信号;与需要显式难度标注的课程学习不同,路由打分是服务过程的免费副产品;与把“实际服务了哪个模型”当作难度标签的朴素做法不同,作者明确拒绝这一代理——因为实际路由还混入用户覆盖、服务可用性与部署策略的影响——转而在首个受监督回复之前,用请求加交互历史重新估计能力需求,剥离策略噪声。由此,多模型池的真实经验被压缩进单一模型,部署即数据生产,评估反馈直接重分配下一轮训练混合,三个环节首次串成完整的评估—选择—更新闭环。
核心方法
直觉上,可以把路由护栏理解为系统的“感官加记账本”:它每天观察大量真实交互,知道每个请求“需要多强的能力”(路由打分)、“实际用了谁”(服务层级)以及“最后做成了没有”(结果)。NeoHorse-1 的方法就是把这些账本变成教材。技术上分四步走。第一步,异构模型池在多样真实任务上通过路由护栏(含 OpenSquilla)产出 $10^5$–$10^6$ 量级轨迹,经结构校验、六维语义评估和 Scene/Goal/Outcome 三轴子场景标注后,用 Qwen3.5 聊天模板序列化为用户回合样本,只对当前回合的助手段施加掩码损失。第二步,用路由分数把样本排成三阶段课程,逐步引入高分样本并保留部分低分样本到后期。第三步,把同一课程逻辑推广到在线策略蒸馏:学生从录制上下文自己生成回复,固定教师在每个生成前缀上以反向 KL 监督。第四步,评估反馈形成“模型短板画像”,把下一轮训练混合向薄弱区域倾斜;更新后的模型回到护栏继续服务并产生新数据,闭合评估—选择—更新循环。
核心创新是“路由分数即课程”。已有课程学习依赖人工难度标注或数据集启发式,而已有轨迹 SFT 把所有交互一视同仁地混合训练;本文首次把服务时的路由预估转用作训练组织信号:每个样本得到层级索引 $k_i$(硬排序)或得分加权平均层级 $\sum_{k=0}^{3} k\,\pi_{i,k}$(软排序,$\pi_{i,k}$ 为归一化层级分数,可区分同层级样本),据此构造三阶段递进课程,而不改变样本的监督目标本身。第二个创新是把该课程从 SFT 推广到 OPD 的起始上下文调度:路由决定学生“在哪些任务状态上练习”,在线策略监督保证练习贴合学生当前行为,二者正交互补——“路由管材料,在线监督管行为”。第三个要点是对信号来源的谨慎处理:语料同时保留路由器原始预测、策略调整后的决策与实际服务层级三个字段,只取预测用于课程排序,避免把部署策略当成真实难度,这是与把被服务模型身份当标签的做法的本质区别。
方法步骤详情
完整流水线如下。数据采集:异构模型池在多样任务上经路由护栏执行,路由器综合当前请求、近期对话、历史路由决策与执行状态,把每个用户回合分到 C0–C3 四个服务层级,完整轨迹保留用户请求、推理、工具调用、环境观察、恢复尝试与终态。质量控制:先做精确与近重复去重,并对照评测套件去污染,保证训练与评测不相交;规则化结构校验把轨迹判为内部完整、部分可恢复或隔离三类,检查载荷可读、因果事件顺序、工具调用/结果按标识符配对闭合等问题;再对可用轨迹做六维语义评估(目标达成、指令遵循、工具使用、证据一致、错误恢复、终止),每维给 PASS/WARN/FAIL/NOT_EVALUATED,缺证据或裁判调用中断绝不转为正面判定。样本构造:以用户回合为单元,保留当前回合交错推理与工具调用、省略更早回合的推理,序列化后按式 (1) 的掩码损失 $\mathcal{L}_{\mathrm{SFT}}(\theta;\mathcal{B}) = -\frac{\sum_{i\in\mathcal{B}}\sum_{t=2}^{T_i} m_{i,t}\log p_\theta(x_{i,t}\mid x_{i,<t})}{\sum_{i\in\mathcal{B}}\sum_{t=2}^{T_i} m_{i,t}}$ 训练,仅对当前回合助手目标段按 token 数归一化计损。课程调度:按式 (2) 计算路由分 $s_i$(硬排序取 $k_i$,软排序取 $\sum_k k\pi_{i,k}$),三阶段各约三分之一样本,高分逐步加入且保留部分低分样本到后期,阶段间不重置优化器、不重启学习率。路由引导 OPD:按同一方案调度录制上下文分布 $\rho_j$,学生检查点 $\bar{\theta}$ 对每个上下文生成一条回复,固定教师在每个位置给出分布,双方使用相同的 top-$K$ 候选 token 加一个“剩余概率桶”得到粗化分布 $\tilde{P}_{\theta,r,t}$ 与 $\tilde{Q}_{r,t}$,按式 (3) 最小化按回复长度归一的反向 KL $\frac{1}{\sum_r w_r}\sum_{r}\frac{w_r}{L_r}\sum_{t=1}^{L_r} D_{\mathrm{KL}}(\tilde{P}_{\theta,r,t}\|\tilde{Q}_{r,t})$,rollout 检查点随训练刷新。能力引导分配:在与训练集隔离的分层评测套件上评估当前检查点,聚合出短板画像,把下一轮混合向低分区域倾斜同时保持广覆盖。
技术新颖性
技术新颖性可从四个对照看清。其一,对照 RouteLLM/FrugalGPT 一系:路由通常止步于服务时决策,本文证明路由记录还是训练期的高价值信号,把“服务系统”升级为“数据飞轮”。其二,对照 FireAct/AgentTuning 式轨迹 SFT:传统做法模仿固定教师策略的静态轨迹,本文的数据来自真实部署的异构模型池,且序列化时保留执行条件(系统指令、护栏注入消息、工具规格),使助手目标与产生它的语境配对,学习任务推进与失败恢复而非只学最终答案。其三,对照已有 OPD:常见 OPD 用随机或人工挑选的上下文,本文首次用能力需求分数调度上下文难度,让蒸馏分阶段由易到难推进。其四,对照需要难度标注的课程学习:路由打分免费、随部署规模自动增长,并通过“预测—行动—结果”分离规避策略污染。控制实验显示,同一课程配置下路由护栏数据比公开 Toucan 数据平均高 6.26 分,说明增益同时来自数据源与组织方式,这一组合是先前工作未验证过的。
实验结果
核心结果有三组。第一,后训练在两个规模都带来广泛提升:4B 模型十项基准宏观平均从基座 Qwen3.5-4B 的 58.94 升至 64.87,且在所有可比基准上全面超越基座,例如 $\tau^2$-Bench 88.46(基座 84.29)、WorkBuddy 34.41(24.62)、VitaBench 32.00(21.50)、PinchBench 77.33(71.19)、HumanEval 96.95(87.20)、LiveCodeBench v6 59.43(53.71);平均分也高于 Spark-X2.5-4B(62.22)、Nanbeige-4.2-3B(62.31)、Agents-A1-4B(61.46)与 Gemma-4-E4B-it(42.95)等同级模型。9B 模型从 65.60 升至 69.04,超过所有对比模型,包括 30B 的 Muse-Glimmer-30B(67.86),增益集中在智能体执行与代码(PinchBench 74.55→82.25、QwenClaw 44.04→48.73、BFCL 64.88→67.43),指令遵循基本持平(IFEval 89.09 略低于基座 89.46,IFBench 66.33 持平)。第二,轨迹分析显示行为级差异:PinchBench 数据分析案例中,发现 pandas 不可用后 9B 模型果断切换到 Python 标准库 csv 与 math 完成分析与报告,相比反复安装依赖失败的 4B 模型,模型请求数、执行时间与 token 用量分别减少约 70.8%、76.7%、83.6%;Gomoku 案例同一段 26 次点击回放中,NeoHorse-1-9B 无运行时异常、保留 26 颗棋子与回合状态,Qwen3.5-9B 则全程索引错误、页面空白。第三,闭环论证初步成立:相同课程配置下,路由护栏数据比公开 Toucan 数据五基准平均高 6.26 分(70.57 对 64.32,其中 $\tau^2$-Bench +11.31、HumanEval +8.54);监督规模从基线 69.31 稳步升至 71.45(约 2M–10M 唯一监督 token,对数轴),支持把数据量当作能力相关的分配决策。后训练 4B 在多项基准上追平或超过 Qwen3.5-9B,表明训练能部分补偿规模差距。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 十项基准宏观平均(4B 轨道) | 宏平均分 | NeoHorse-1-4B 64.87 | Qwen3.5-4B 58.94 | +5.93 |
| 十项基准宏观平均(9B 轨道) | 宏平均分 | NeoHorse-1-9B 69.04 | Qwen3.5-9B 65.60 | +3.44 |
| τ²-Bench 多轮用户-智能体-工具交互(4B) | 任务得分 | 88.46 | Qwen3.5-4B 84.29 | +4.17 |
| WorkBuddy 多领域工作场景(4B) | 任务得分 | 34.41 | Qwen3.5-4B 24.62 | +9.79 |
| HumanEval 代码功能正确性(4B) | pass@1 | 96.95 | Qwen3.5-4B 87.20 | +9.75 |
| PinchBench 标准化工作流(9B) | 任务得分 | 82.25 | Qwen3.5-9B 74.55 | +7.70 |
| 9B 轨道平均对比 30B 模型 | 宏平均分 | NeoHorse-1-9B 69.04 | Muse-Glimmer-30B 67.86 | +1.18(以小胜大) |
| 路由护栏数据 vs 公开合成数据(同配置对照) | 五基准非加权平均 | 70.57 | Toucan 公开数据 64.32 | +6.26 |
| 路由护栏监督规模扩展(唯一监督 token 约十兆级) | 五基准平均 | 71.45(最大数据档) | Qwen3.5-4B 基座 69.31 | +2.14 |
局限与改进
作者明确承认两点:当前验证只覆盖智能体、代码、工具使用与指令遵循等能力域,护栏实际服务的更广任务范围尚未评估;整个“评估—选择—更新”循环只跑了一遍,跨代迭代中增益能否持续累积仍是开放问题。我再补充几点观察:其一,9B 模型在 IFEval 上出现轻微回退(89.46→89.09)、IFBench 持平(66.33),说明路由课程对相对静态的指令遵循边际收益有限,甚至可能被智能体数据轻微挤压;其二,PinchBench 与 VitaBench 只跑单次,VitaBench 还因原推荐模型下线而改用 DeepSeek-V4-Flash 兼任用户模拟器与裁判,存在评测方差与裁判偏差风险;其三,论文没有提供“去掉课程、均匀混合训练”的消融,课程呈现顺序本身的净贡献与数据源贡献(+6.26)未能完全解耦;其四,路由层级语义随部署栈演化需要版本化维护,跨部署迁移时打分校准可能漂移,而课程又完全依赖这一信号;其五,OPD 的教师上限决定学生天花板,且语料规模只给出 $10^5$–$10^6$ 量级的定性描述,未披露精确 token 数、教师身份与算力开销。
独立分析的弱点
第一,课程机制缺乏隔离消融:论文没有报告同数据同预算下去掉三阶段调度(均匀混合)的对照,无法区分“高分样本本身更有效”与“呈现顺序本身有效”,也无法比较硬排序 $k_i$ 与软排序 $\sum k\pi_{i,k}$ 的优劣,改进方向是补做课程消融与打分来源消融。第二,RSI 闭环只演示单次迭代:多代迭代可能出现反馈塌缩——模型回归自身输出导致分布收窄、错误被自我强化,建议引入外部验证器、保留固定比例非自身来源数据,并监控生成多样性指标。第三,路由信号粒度粗:只有四个层级加一个打分向量,且预测产生于部署策略约束之下,作者自己也承认需要把它校准成真正的难度与缺陷估计;改进方向是用结果数据反向训练路由器并做不确定性量化。第四,反向 KL 的模式寻找特性可能让学生回避教师的低概率但必要的探索行为,在需要多样试错的智能体任务上或造成保守化,可考虑与前向 KL 或可执行奖励信号混合。第五,评测集中于文本任务与少数护栏(OpenSquilla 等),对多模态、超长程真实生产任务的泛化未知,应扩充评测域并报告方差。
未来方向
作者规划了三个方向:其一,跨代迭代反馈回路——每代改进的检查点回到护栏服务真实流量,检验“使用收益”能否随能力演化持续累积;其二,把经验采集、能力引导分配与课程设计扩展到护栏服务的更多任务、执行环境与模型;其三,锐化路由信号本身——把“预测—行动—结果”记录转化为校准良好的难度与缺陷估计,包括用监督数据训练路由器,让护栏不仅决定用什么数据、在哪里分配,还能决定模型下一步该尝试什么。基于本文成果还可延伸:把能力引导分配与可执行验证奖励结合,走向智能体强化学习;对监督规模做更系统的扩展律拟合(当前只到约十兆唯一监督 token、总增益 +2.14,曲线尚未饱和);探索路由课程信号在多教师、模型合并或专家混合架构中的使用;以及研究反向问题——用训练后的模型反过来改进路由器,形成路由与模型互惠的双闭环。
复现评估
开源情况:论文给出 HF 模型集合与 GitHub 仓库链接(TokenRhythm/NeoHorse),基座 Qwen3.5-4B/9B 公开可取,评测覆盖的十个基准全部公开,推理与评测细节相当完整:SGLang v0.5.17 部署,temperature=1.0、top-$p$=0.95、top-$k$=20、min-$p$=0.0、presence penalty=1.5、repetition penalty=1.0,思考模式开关与各基准最大输出长度(32768/51200 token)均已给出,QwenClawBench、WorkBuddy、$\tau^2$-Bench 跑三次取均值。核心障碍在数据:$10^5$–$10^6$ 条真实部署轨迹、路由记录与子场景标注是生产系统私有资产,论文未宣布开放;OPD 教师模型身份未披露;算力消耗与训练时长完全未报告。对研究者而言,可行的复现路径是用公开智能体数据(如 Toucan)加离线路由打分近似课程流程——论文的对照实验本身演示了这条路(70.57 对 64.32);但要复现完整结果需自建路由护栏与异构模型池,工程量与推理成本显著,综合评估属于中高难度复现。
论文图表