← 返回 2026-09-09

NeoHorse-1:经路由护栏智能体后训练迈向递归自我改进 NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness

NeoHorse Team, Guoliang Cao, Guohao Dai, Tianyu Guo, Kai Han, Hailin Hu, Zihan Jiang, Xiang Kuang, Boxun Li, Yulong Li, Zehua Pei, Yuchuan Tian, Jiamin Wang, Yu Wang, Yunhe Wang, Yihong Wu, Haiyang Xu, Shuo Zhang, Hang Zhou, Siyang Cheng, Jiayu Fan, Wei He, Qingrui Jiao, Hongguang Li, Zhiyuan Li, Runke Liu, Xi Liu, Xinchen Liu, Sinno Jialin Pan, Yi Ren, Liuyang Song, Chenyu Wang, Bei Yu, Quanlu Zhang, Xiangyu Zhang, Mengyu Zheng, Yingjie Zong 📅 2026-09-08 👍 402 2026-09-12 18:30
LLM路由 在线策略蒸馏 技术报告 智能体后训练 课程学习 递归自我改进

把部署路由护栏的交互轨迹与能力信号转化为课程化后训练,闭合评估—选择—更新循环。

前置知识

递归自我改进(RSI)

指让 AI 系统在自己的改进过程中扮演越来越大的角色:从优化单条回复、改造执行护栏,到从自己生成的经验中学习,甚至自动化部分 AI 研究流程。其结构吸引力在于:一旦模型改进本身被部分自动化,每一代模型都能为下一代贡献改进,形成复利式迭代,不再完全受人工数据和人类监督的约束。

本文的最终目标就是 RSI,全篇围绕“系统如何观察自身能力并把证据转化为下一轮学习”这一机制展开,理解这个概念才能把握论文的定位与贡献边界。

智能体护栏(Agent Harness)

护栏是管理智能体执行的技术层,负责组织上下文、提供工具接口、注入系统指令,并处理与终端、文件系统、网页、API 等环境的交互。同一模型配不同护栏表现可能差异巨大(SWE-agent 等研究表明接口设计直接影响性能与稳健性)。带路由的护栏还会根据请求和交互状态决定由池中哪个模型来服务。

本文的训练数据、难度信号与反馈闭环全部产生于部署护栏之内,“护栏介导的 RSI”是全文关键词,不懂护栏就无法理解数据从哪来、闭环如何闭合。

LLM 路由与服务分层

路由器在用户回合级预估请求的“能力需求”,把请求分配给异构模型池中合适的模型,以在响应质量与推理成本间权衡(如 FrugalGPT、RouteLLM、Agentic Routing)。本文系统把每回合分到 C0–C3 四个服务层级:C0 处理有界低风险请求,C1 是通用默认档,C2 支持多步推理与执行,C3 提供最高能力或可靠性。

路由记录(预测层级、实际服务层级与后续交互结果)正是本文用来构造课程难度信号和闭环反馈的原始材料,是方法部分的地基。

在线策略蒸馏(OPD)与反向 KL

传统蒸馏让学生模仿教师的固定轨迹,存在训练与部署的分布偏移。OPD 改为学生自己生成回复,教师在学生访问到的每个前缀上提供下一个 token 的分布作监督。损失用反向 KL $D_{\mathrm{KL}}(\tilde{P}_\theta \| \tilde{Q})$,其中 $\tilde{P}_\theta$ 是学生分布、$\tilde{Q}$ 是教师分布,会把学生的概率质量拉向教师的高概率模式,提供比轨迹 SFT 更密集的过程监督。

本文把路由课程推广到 OPD 的起始上下文调度(R-OPD),是其两大训练方法之一;不熟悉 OPD 与反向 KL 就读不懂第 4.3 节和式 (3)(4)。

课程学习(Curriculum Learning)

一种训练策略:按估计的难度组织样本呈现顺序,先易后难,以获得更稳定的优化过程和更好的最终性能。在 LLM 后训练中已证明有效,但现有方法通常依赖显式难度标注或数据集特定启发式,标注成本高、难以随部署规模自动增长。

本文的核心贡献正是用路由打分免费替代人工难度标注:难度信号来自部署时的真实预估,理解课程学习才能看出这一替代的价值。

交错思考与轨迹 SFT

现代智能体模型的一条回复序列通常交织着推理文本、工具调用与工具结果,称为交错思考(interleaved thinking)。轨迹 SFT 把完整交互序列化后做监督微调:只对助手生成段(推理、工具调用参数、可见回复、结束符)计损失,用户消息、工具结果、系统指令与工具规格只作上下文、不计损失。

论文的数据构造、损失掩码设计(式 1)以及“省略早期回合推理”的上下文策略都建立在这一范式之上,式 (1) 的掩码求和归一化直接对应这套约定。

研究动机

在本文之前,智能体后训练主要依赖两类数据:人工或合成的高质量教师轨迹(如 FireAct、AgentTuning 以及公开的 Toucan 工具智能体数据集),以及把交互记录当作静态监督的轨迹 SFT。这带来三个具体问题。其一,分布偏移:SFT 让模型模仿录制好的教师回复,而部署时模型条件于自己生成的前缀,一旦走偏就缺乏纠偏监督。其二,课程学习需要难度信号,但显式难度标注昂贵且无法随规模增长,公开合成轨迹又与真实用户任务分布脱节——例如 Qwen3.5-4B 在 QwenClawBench 项目排期任务中虽然能找到工作目录里的文件,却不去查看经理邮件中更新过的依赖约束,用过期信息生成无效排期还把产物写到错误路径,这类“局部合理但整体断裂”的执行失败恰恰只有真实交互数据才能教模型修正。其三,递归自我改进长期停留在概念层面,缺少一个具体机制让系统观察自身能力、并把观察到的证据转化为下一轮学习。

本文的目标是本文要为“护栏介导的递归自我改进”给出一个可运行的原型。目标分三层。系统层:构建由异构模型池和多个护栏(含 OpenSquilla)支撑的路由护栏,让每次交互都留下执行轨迹、路由记录与任务结果三类可复用信号。数据层:把部署轨迹转化为保留交错推理、工具调用与护栏上下文的用户回合训练样本,经结构校验、六维语义评估与子场景级标注后入库,并用能力评估反馈决定下一轮训练混合比例。模型层:训练 NeoHorse-1-4B 与 NeoHorse-1-9B 两个智能体原生模型,量化目标是把十项基准的宏观平均分从 4B 基座的 58.94 提升到 64.87、9B 基座的 65.60 提升到 69.04,并显著缩小后训练 4B 模型与 9B 基座之间的总差距,为跨代迭代的 RSI 打下可操作的基础。

与已有工作不同的是,本文的独特切入在于:作者注意到部署中的路由护栏本身就是一个现成的“能力传感器”。每次交互它都记录预测的能力需求、实际选择的服务层级和随后的交互结果,构成“预测—行动—结果”三元记录。与 FrugalGPT、RouteLLM 只把路由当作服务时降本提质的手段不同,本文把路由记录升级为训练组织信号;与需要显式难度标注的课程学习不同,路由打分是服务过程的免费副产品;与把“实际服务了哪个模型”当作难度标签的朴素做法不同,作者明确拒绝这一代理——因为实际路由还混入用户覆盖、服务可用性与部署策略的影响——转而在首个受监督回复之前,用请求加交互历史重新估计能力需求,剥离策略噪声。由此,多模型池的真实经验被压缩进单一模型,部署即数据生产,评估反馈直接重分配下一轮训练混合,三个环节首次串成完整的评估—选择—更新闭环。

核心方法

直觉上,可以把路由护栏理解为系统的“感官加记账本”:它每天观察大量真实交互,知道每个请求“需要多强的能力”(路由打分)、“实际用了谁”(服务层级)以及“最后做成了没有”(结果)。NeoHorse-1 的方法就是把这些账本变成教材。技术上分四步走。第一步,异构模型池在多样真实任务上通过路由护栏(含 OpenSquilla)产出 $10^5$–$10^6$ 量级轨迹,经结构校验、六维语义评估和 Scene/Goal/Outcome 三轴子场景标注后,用 Qwen3.5 聊天模板序列化为用户回合样本,只对当前回合的助手段施加掩码损失。第二步,用路由分数把样本排成三阶段课程,逐步引入高分样本并保留部分低分样本到后期。第三步,把同一课程逻辑推广到在线策略蒸馏:学生从录制上下文自己生成回复,固定教师在每个生成前缀上以反向 KL 监督。第四步,评估反馈形成“模型短板画像”,把下一轮训练混合向薄弱区域倾斜;更新后的模型回到护栏继续服务并产生新数据,闭合评估—选择—更新循环。

核心创新是“路由分数即课程”。已有课程学习依赖人工难度标注或数据集启发式,而已有轨迹 SFT 把所有交互一视同仁地混合训练;本文首次把服务时的路由预估转用作训练组织信号:每个样本得到层级索引 $k_i$(硬排序)或得分加权平均层级 $\sum_{k=0}^{3} k\,\pi_{i,k}$(软排序,$\pi_{i,k}$ 为归一化层级分数,可区分同层级样本),据此构造三阶段递进课程,而不改变样本的监督目标本身。第二个创新是把该课程从 SFT 推广到 OPD 的起始上下文调度:路由决定学生“在哪些任务状态上练习”,在线策略监督保证练习贴合学生当前行为,二者正交互补——“路由管材料,在线监督管行为”。第三个要点是对信号来源的谨慎处理:语料同时保留路由器原始预测、策略调整后的决策与实际服务层级三个字段,只取预测用于课程排序,避免把部署策略当成真实难度,这是与把被服务模型身份当标签的做法的本质区别。

方法步骤详情

完整流水线如下。数据采集:异构模型池在多样任务上经路由护栏执行,路由器综合当前请求、近期对话、历史路由决策与执行状态,把每个用户回合分到 C0–C3 四个服务层级,完整轨迹保留用户请求、推理、工具调用、环境观察、恢复尝试与终态。质量控制:先做精确与近重复去重,并对照评测套件去污染,保证训练与评测不相交;规则化结构校验把轨迹判为内部完整、部分可恢复或隔离三类,检查载荷可读、因果事件顺序、工具调用/结果按标识符配对闭合等问题;再对可用轨迹做六维语义评估(目标达成、指令遵循、工具使用、证据一致、错误恢复、终止),每维给 PASS/WARN/FAIL/NOT_EVALUATED,缺证据或裁判调用中断绝不转为正面判定。样本构造:以用户回合为单元,保留当前回合交错推理与工具调用、省略更早回合的推理,序列化后按式 (1) 的掩码损失 $\mathcal{L}_{\mathrm{SFT}}(\theta;\mathcal{B}) = -\frac{\sum_{i\in\mathcal{B}}\sum_{t=2}^{T_i} m_{i,t}\log p_\theta(x_{i,t}\mid x_{i,<t})}{\sum_{i\in\mathcal{B}}\sum_{t=2}^{T_i} m_{i,t}}$ 训练,仅对当前回合助手目标段按 token 数归一化计损。课程调度:按式 (2) 计算路由分 $s_i$(硬排序取 $k_i$,软排序取 $\sum_k k\pi_{i,k}$),三阶段各约三分之一样本,高分逐步加入且保留部分低分样本到后期,阶段间不重置优化器、不重启学习率。路由引导 OPD:按同一方案调度录制上下文分布 $\rho_j$,学生检查点 $\bar{\theta}$ 对每个上下文生成一条回复,固定教师在每个位置给出分布,双方使用相同的 top-$K$ 候选 token 加一个“剩余概率桶”得到粗化分布 $\tilde{P}_{\theta,r,t}$ 与 $\tilde{Q}_{r,t}$,按式 (3) 最小化按回复长度归一的反向 KL $\frac{1}{\sum_r w_r}\sum_{r}\frac{w_r}{L_r}\sum_{t=1}^{L_r} D_{\mathrm{KL}}(\tilde{P}_{\theta,r,t}\|\tilde{Q}_{r,t})$,rollout 检查点随训练刷新。能力引导分配:在与训练集隔离的分层评测套件上评估当前检查点,聚合出短板画像,把下一轮混合向低分区域倾斜同时保持广覆盖。

技术新颖性

技术新颖性可从四个对照看清。其一,对照 RouteLLM/FrugalGPT 一系:路由通常止步于服务时决策,本文证明路由记录还是训练期的高价值信号,把“服务系统”升级为“数据飞轮”。其二,对照 FireAct/AgentTuning 式轨迹 SFT:传统做法模仿固定教师策略的静态轨迹,本文的数据来自真实部署的异构模型池,且序列化时保留执行条件(系统指令、护栏注入消息、工具规格),使助手目标与产生它的语境配对,学习任务推进与失败恢复而非只学最终答案。其三,对照已有 OPD:常见 OPD 用随机或人工挑选的上下文,本文首次用能力需求分数调度上下文难度,让蒸馏分阶段由易到难推进。其四,对照需要难度标注的课程学习:路由打分免费、随部署规模自动增长,并通过“预测—行动—结果”分离规避策略污染。控制实验显示,同一课程配置下路由护栏数据比公开 Toucan 数据平均高 6.26 分,说明增益同时来自数据源与组织方式,这一组合是先前工作未验证过的。

Towards RSI through routing-guided agentic training
Figure 2: Towards RSI through routing-guided agentic training
Subscene-level scenario characterization
Figure 3: Subscene-level scenario characterization
Agentic supervision within a user turn
Figure 4: Agentic supervision within a user turn
Routing-guided curriculum
Figure 5: Routing-guided curriculum
Routing-guided on-policy distillation
Figure 6: Routing-guided on-policy distillation

实验结果

核心结果有三组。第一,后训练在两个规模都带来广泛提升:4B 模型十项基准宏观平均从基座 Qwen3.5-4B 的 58.94 升至 64.87,且在所有可比基准上全面超越基座,例如 $\tau^2$-Bench 88.46(基座 84.29)、WorkBuddy 34.41(24.62)、VitaBench 32.00(21.50)、PinchBench 77.33(71.19)、HumanEval 96.95(87.20)、LiveCodeBench v6 59.43(53.71);平均分也高于 Spark-X2.5-4B(62.22)、Nanbeige-4.2-3B(62.31)、Agents-A1-4B(61.46)与 Gemma-4-E4B-it(42.95)等同级模型。9B 模型从 65.60 升至 69.04,超过所有对比模型,包括 30B 的 Muse-Glimmer-30B(67.86),增益集中在智能体执行与代码(PinchBench 74.55→82.25、QwenClaw 44.04→48.73、BFCL 64.88→67.43),指令遵循基本持平(IFEval 89.09 略低于基座 89.46,IFBench 66.33 持平)。第二,轨迹分析显示行为级差异:PinchBench 数据分析案例中,发现 pandas 不可用后 9B 模型果断切换到 Python 标准库 csv 与 math 完成分析与报告,相比反复安装依赖失败的 4B 模型,模型请求数、执行时间与 token 用量分别减少约 70.8%、76.7%、83.6%;Gomoku 案例同一段 26 次点击回放中,NeoHorse-1-9B 无运行时异常、保留 26 颗棋子与回合状态,Qwen3.5-9B 则全程索引错误、页面空白。第三,闭环论证初步成立:相同课程配置下,路由护栏数据比公开 Toucan 数据五基准平均高 6.26 分(70.57 对 64.32,其中 $\tau^2$-Bench +11.31、HumanEval +8.54);监督规模从基线 69.31 稳步升至 71.45(约 2M–10M 唯一监督 token,对数轴),支持把数据量当作能力相关的分配决策。后训练 4B 在多项基准上追平或超过 Qwen3.5-9B,表明训练能部分补偿规模差距。

Comparison of NeoHorse-1-4B with representative 4B-scale open-weight models across agentic, coding, and instruction-following benchmarks
Table 1: Comparison of NeoHorse-1-4B with representative 4B-scale open-weight models across agentic, coding, and instruction-following benchmarks
Comparison of NeoHorse-1-9B with representative larger-scale models across agentic, coding, and instruction-following benchmarks
Table 2: Comparison of NeoHorse-1-9B with representative larger-scale models across agentic, coding, and instruction-following benchmarks
Comparison of routing-harness trajectories with public tool-agent data under the same routing-guided training configuration
Table 3: Comparison of routing-harness trajectories with public tool-agent data under the same routing-guided training configuration
Execution and artifact evidence for Case A (Daily Ticket Reporting under Temporal and Audit Constraints)
Table 4: Execution and artifact evidence for Case A (Daily Ticket Reporting under Temporal and Audit Constraints)
Repository requirements, implementation, and execution artifacts for Case B (Implementing a Time-Leakage Auditor from Repository Requirements)
Table 5: Repository requirements, implementation, and execution artifacts for Case B (Implementing a Time-Leakage Auditor from Repository Requirements)
Execution and artifact evidence for the Gomoku case (Supporting Sustained Two-Player Gomoku Interaction)
Table 6: Execution and artifact evidence for the Gomoku case (Supporting Sustained Two-Player Gomoku Interaction)
Comparison on six agentic benchmarks in the 4B and 9B tracks
Figure 1: Comparison on six agentic benchmarks in the 4B and 9B tracks
Scaling routing-harness supervision
Figure 7: Scaling routing-harness supervision
Original pages after the same 26-click replay
Figure 8: Original pages after the same 26-click replay
查看结构化数据
任务指标本文基线提升
十项基准宏观平均(4B 轨道) 宏平均分 NeoHorse-1-4B 64.87 Qwen3.5-4B 58.94 +5.93
十项基准宏观平均(9B 轨道) 宏平均分 NeoHorse-1-9B 69.04 Qwen3.5-9B 65.60 +3.44
τ²-Bench 多轮用户-智能体-工具交互(4B) 任务得分 88.46 Qwen3.5-4B 84.29 +4.17
WorkBuddy 多领域工作场景(4B) 任务得分 34.41 Qwen3.5-4B 24.62 +9.79
HumanEval 代码功能正确性(4B) pass@1 96.95 Qwen3.5-4B 87.20 +9.75
PinchBench 标准化工作流(9B) 任务得分 82.25 Qwen3.5-9B 74.55 +7.70
9B 轨道平均对比 30B 模型 宏平均分 NeoHorse-1-9B 69.04 Muse-Glimmer-30B 67.86 +1.18(以小胜大)
路由护栏数据 vs 公开合成数据(同配置对照) 五基准非加权平均 70.57 Toucan 公开数据 64.32 +6.26
路由护栏监督规模扩展(唯一监督 token 约十兆级) 五基准平均 71.45(最大数据档) Qwen3.5-4B 基座 69.31 +2.14

局限与改进

作者明确承认两点:当前验证只覆盖智能体、代码、工具使用与指令遵循等能力域,护栏实际服务的更广任务范围尚未评估;整个“评估—选择—更新”循环只跑了一遍,跨代迭代中增益能否持续累积仍是开放问题。我再补充几点观察:其一,9B 模型在 IFEval 上出现轻微回退(89.46→89.09)、IFBench 持平(66.33),说明路由课程对相对静态的指令遵循边际收益有限,甚至可能被智能体数据轻微挤压;其二,PinchBench 与 VitaBench 只跑单次,VitaBench 还因原推荐模型下线而改用 DeepSeek-V4-Flash 兼任用户模拟器与裁判,存在评测方差与裁判偏差风险;其三,论文没有提供“去掉课程、均匀混合训练”的消融,课程呈现顺序本身的净贡献与数据源贡献(+6.26)未能完全解耦;其四,路由层级语义随部署栈演化需要版本化维护,跨部署迁移时打分校准可能漂移,而课程又完全依赖这一信号;其五,OPD 的教师上限决定学生天花板,且语料规模只给出 $10^5$–$10^6$ 量级的定性描述,未披露精确 token 数、教师身份与算力开销。

独立分析的弱点

第一,课程机制缺乏隔离消融:论文没有报告同数据同预算下去掉三阶段调度(均匀混合)的对照,无法区分“高分样本本身更有效”与“呈现顺序本身有效”,也无法比较硬排序 $k_i$ 与软排序 $\sum k\pi_{i,k}$ 的优劣,改进方向是补做课程消融与打分来源消融。第二,RSI 闭环只演示单次迭代:多代迭代可能出现反馈塌缩——模型回归自身输出导致分布收窄、错误被自我强化,建议引入外部验证器、保留固定比例非自身来源数据,并监控生成多样性指标。第三,路由信号粒度粗:只有四个层级加一个打分向量,且预测产生于部署策略约束之下,作者自己也承认需要把它校准成真正的难度与缺陷估计;改进方向是用结果数据反向训练路由器并做不确定性量化。第四,反向 KL 的模式寻找特性可能让学生回避教师的低概率但必要的探索行为,在需要多样试错的智能体任务上或造成保守化,可考虑与前向 KL 或可执行奖励信号混合。第五,评测集中于文本任务与少数护栏(OpenSquilla 等),对多模态、超长程真实生产任务的泛化未知,应扩充评测域并报告方差。

未来方向

作者规划了三个方向:其一,跨代迭代反馈回路——每代改进的检查点回到护栏服务真实流量,检验“使用收益”能否随能力演化持续累积;其二,把经验采集、能力引导分配与课程设计扩展到护栏服务的更多任务、执行环境与模型;其三,锐化路由信号本身——把“预测—行动—结果”记录转化为校准良好的难度与缺陷估计,包括用监督数据训练路由器,让护栏不仅决定用什么数据、在哪里分配,还能决定模型下一步该尝试什么。基于本文成果还可延伸:把能力引导分配与可执行验证奖励结合,走向智能体强化学习;对监督规模做更系统的扩展律拟合(当前只到约十兆唯一监督 token、总增益 +2.14,曲线尚未饱和);探索路由课程信号在多教师、模型合并或专家混合架构中的使用;以及研究反向问题——用训练后的模型反过来改进路由器,形成路由与模型互惠的双闭环。

复现评估

开源情况:论文给出 HF 模型集合与 GitHub 仓库链接(TokenRhythm/NeoHorse),基座 Qwen3.5-4B/9B 公开可取,评测覆盖的十个基准全部公开,推理与评测细节相当完整:SGLang v0.5.17 部署,temperature=1.0、top-$p$=0.95、top-$k$=20、min-$p$=0.0、presence penalty=1.5、repetition penalty=1.0,思考模式开关与各基准最大输出长度(32768/51200 token)均已给出,QwenClawBench、WorkBuddy、$\tau^2$-Bench 跑三次取均值。核心障碍在数据:$10^5$–$10^6$ 条真实部署轨迹、路由记录与子场景标注是生产系统私有资产,论文未宣布开放;OPD 教师模型身份未披露;算力消耗与训练时长完全未报告。对研究者而言,可行的复现路径是用公开智能体数据(如 Toucan)加离线路由打分近似课程流程——论文的对照实验本身演示了这条路(70.57 对 64.32);但要复现完整结果需自建路由护栏与异构模型池,工程量与推理成本显著,综合评估属于中高难度复现。