← 返回 2026-08-11

Macaron-V1:迈向开放持续学习的自我改进与 LoRA 混合架构 Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

Mind Lab, Vin Bo, Asher Cai, Jingwei Cao, Song Cao, Vic Cao, Amelia Chen, Andrew Chen, Kaijie Chen, Cleon Cheng, Steven Chiang, Kaixuan Fan, Hera Feng, Huan Feng, Arthur Fu, Jun Gao, Pyke Han, Nolan Ho, Ori Hong, Hailee Hou, Piers Hua, Charles Huang, Miles Jiang, Nora Jiang, Yuyi Jiang, Qiuyu Jin, Fancy Kong, Kuss Koo, Jaron Lee, Andrew Lei, Alexy Li, Dawn Li, Lucian Li, Ray Li, Ricardo Li, Smith Li, Theo Li, Allen Lin, Elliot Lin, Fan Lin, Chen Ling, Kairus Liu, Kieran Liu, Logan Liu, Neo Liu, Xiang Liu, Yuxin Lu, Maeve Luo, Pony Ma, Verity Niu, Cole Qiao, Guian Qiu, Vince Qu, Sentry, Niko Song, Vincent Wang, Bo Wu, Rio Yang, Evelyn Ye, Fiona Ye, Ina Ye, Regis Ye, Josh Ying, Atlas Zeng, Danney Zeng, Salmon Zhan, Anya Zhang, Di Zhang, Mia Zhang, Sueky Zhang, Wei Zhao, Ada Zhou, Adrian Zhou, Yuhua Zhou, Juno Zhu, Murphy Zhuang 📅 2026-08-10 👍 332 2026-08-16 18:30
Mixture-of-LoRA 持续学习 智能体后训练 模型系统 生成式UI 递归自我改进

冻结底座叠加LoRA专家、递归自我改进闭环,让智能体部署后持续学习

前置知识

LoRA(低秩适配)

冻结原模型权重 $W$,只训练低秩增量 $\Delta W = BA$(秩 $r \ll d$)来改变模型行为,可训练参数量极小。本文把 LoRA 从省钱微调手段升格为可热插拔的能力模块。

MoL 是全文架构基石:只有理解 LoRA 的可插拔性,才能理解'冻结底座+专家适配器'如何同时支撑持续学习与跨团队组合。

MoE(混合专家)

在 Transformer 中设置多个前馈'专家'和门控网络,每个 token 只激活少数专家,参数量增长时计算量近似不变,是'以稀疏换规模'的主流路线。

论文把 MoE、skills、MoL 并列为三种扩展方式(Figure 2);且底座 GLM-5.2 本身是稀疏 MoE,带来 rollout 与训练不匹配等独特工程问题。

GRPO 与智能体 RL

GRPO 是一种 RL 后训练算法:对同一 prompt 采样一组响应,用组内相对优势替代价值网络来估计优势函数并更新策略,广泛用于推理与智能体训练。

MindForge 用 GRPO 从筛选后的轨迹更新 LoRA 专家;策略写作 $\pi_\phi(a_t \mid o_{\le t}; \theta, c)$,长上下文基础设施 LongStraw 就是为这类 RL 服务的。

Agent Harness(执行框架)

包裹模型的运行时层,决定工具如何暴露、动作如何执行、结果如何回传,如 function calling、REPL、shell。相同模型在不同 harness 下成功率和 token 成本可相差数倍。

本文核心主张'模型-harness 协同设计',把 harness 当作一阶训练目标;UI4A、REPL、HCP 三个组件都属于这一层。

KV Cache 与前缀缓存

自回归推理缓存每层注意力的 Key/Value 避免重复计算;前缀缓存进一步复用相同前缀的 KV,命中时只需 prefill 新增尾部。

MoL 的 own-view 设计使路由和专家切换近乎'免费'复用 KV;Table 1 的路由开销与 Section 2.5 的两级 KV 复用都建立在这个机制上。

持续学习与灾难性遗忘

模型在部署后随新数据继续学习而不丢旧能力的范式,核心风险是新任务梯度覆盖旧权重导致旧能力骤降(灾难性遗忘)。

论文的'经验智能'目标就是持续学习;MoL 冻结底座+可注册适配器正是为了避免遗忘而做的架构选择,需要理解这一背景才能评估其设计取舍。

生成式 UI(Generative UI)

模型在对话中直接生成可交互界面(卡片/面板)而非纯文本。两条传统路线:HTML 原生(表现力强但难控)与 Schema 原生(可验证但受组件目录上限约束)。

UI4A 是本文提出的第三条'组件原生'路线,是 L3 专家的基底和 UI4A-Bench 的评测环境,也是 Venti 领先幅度最大的能力项(+11.9 分)。

递归自我改进(RSI)

系统用自身产生的经验(任务、轨迹、评估)构造下一代版本的循环过程;关键约束是需要外部契约与谱系记录防止自我强化漂移。

这是论文'适应'维度的核心机制:Discovery→Expansion→Update 三阶段循环,Figure 7 的 122/122 覆盖实验度量的是其中 Expansion 阶段的覆盖能力。

研究动机

现有智能体模型的主流做法是集中式后训练:在一个有界任务与环境集合上优化模型、对齐当时的 harness,然后打包成检查点发布,能力自此冻结。论文指出三层具体问题。其一是跨任务干扰:聊天、智能体工具使用、编码、生成式 UI 这些思维形态差异极大的任务在共享参数上联合训练时会互相竞争(引 Wang et al. 2026),且本发布也缺少预算对齐的单 LoRA 对照来量化这种干扰有多大。其二是环境绑定:模型学习的数据、可用的工具、服务的用户与必须支持的交互共同塑造部署行为,而这些条件在发布后持续演化——新知识出现、新领域涌现、交互状态跨 episode 累积,系统却没有机制把执行经验转化为系统性改进。其三是概念层面:作者把这种做法明确定义为'逼近一个静态最优'而非真智能,真正的智能应是经验智能(experiential intelligence)——从真实环境积累的经验中学习并在部署后继续学习(引 Silver & Sutton 2025)。产品层面要求的 Personal Intelligence(跨会话记住约束、判断何时澄清何时行动、对用户诚实)进一步带有时间性要求,静态检查点天然无法满足。

本文的目标是构建一个面向经验智能的开放智能体模型家族 Macaron-V1,把'部署后继续学习'工程化为可版本化、可审计的修订循环,而不是停留在单一检查点。目标拆成两个互补维度:适应(adaptation)——对显式版本化的'模型-harness 对'做递归改进,一个配置产生的经验在外部契约下评估后用于构造后继版本,并跨代度量保持、迁移与累积改进;协作(collaboration)——用组合表达异质能力:冻结大底座、叠加专家 LoRA、每个用户轮选择一个专家,使新能力能以'注册适配器'而非重训底座的方式加入,并原则上支持不同团队或用户训练的专家在同一运行时上组合。同步交付配套基础设施(MinT 后训练平台、LongStraw 长上下文 RL 执行、稀疏 MoE/DSA 稳定性控制)和三组评测(Personal Intelligence、GenUI、通用能力基准套件)来验证当前系统,同时坦诚标记哪些长期目标(跨代复合提升、集体智能)仍是开放问题。

与已有工作不同的是,独特切入在于两个'占位'。第一,把持续学习的落点从'改权重'挪到'模型-harness 对的版本化修订':已有工作分别守在三条路径——参数化持续学习直接跨任务更新权重;记忆/状态方法携带轨迹、检索经验或在线状态而不动参数;上下文/harness 方法只改指令、工具、技能、编排或执行结构。Macaron-V1 把 harness 适应与模块化参数适应接起来:先从种子构造更难任务、在生产 harness 中审计轨迹、搜索塑造行为的上下文配置(语言空间搜索),再把入选轨迹转训进专家 LoRA(参数空间更新),由 MindForge 的谱系(问题库+HCP+适配器修订)链接成完整实验记录。第二,协作粒度定在'每用户轮一个 LoRA'这个此前未被占据的操作点:现有 mixture-of-adapter 系统在任务/序列/token 级混合专家,多智能体系统协调完整模型实例;MoL 则每轮由入口适配器 L0 自己推理出路由标签,路由成为聊天专家理解力的一部分而非外挂分类器或独立路由模型。

核心方法

直觉上,与其训练一个什么都会的单体模型,不如让四个层各自独立版本化、联合评估:底座承载通用能力、LoRA 专家承载差异化行为、harness 承载工具与上下文约定、RSI 循环承载修订过程。技术路线分三块。架构上,MoL(Mixture-of-LoRA)在冻结的 744B GLM-5.2 底座上叠四个 rank-16 LoRA 专家——L0 Chat(对话骨干兼路由入口)、L1 Agent(长程重工具任务,吸收了 Preview 的 OpenClaw 适配器)、L2 Coding、L3 GenUI;每个适配器含 7,688,042,496 个存储值(748B 只是发布标签)。Proxy 按用户轮执行三跳:Route(L0 在 24 token 预算内经受限解码语法输出唯一的 L0–L3 规范标签)→ Answer(中选专家从自己的会话视图作答)→ Summary(专家输出 ≤192 token 摘要,Proxy 存服务端供跨适配器继承,绝不返回客户端)。算法上,模型-harness 协同设计提供 UI4A 组件原生 GenUI harness、REPL 有状态动作基底和 HCP 版本化 TOML 运行时契约;MindForge 在其上跑 Discovery→Expansion→Update 三阶段 RSI,用 GRPO 更新适配器。基础设施上,MinT 管理适配器修订与策略记录的分离,LongStraw 提供响应侧-only 的长上下文 RL 执行,R3 路由重放、DSA 对齐与 IcePop 式掩码控制稀疏基座的 rollout-训练失配。50B 的 Tall(Qwen3.6-35B-A3B 底座 + 4 个 rank-64 LoRA ≈ 50.1B)复用同一设计面向本地部署。

核心创新是三个彼此咬合的机制。其一,'路由即理解':MoL 不训练独立路由器、不用关键词规则库,而是让 L0 在受限解码语法下自己输出规范标签,路由精度随底座与 L0 的进步而进步(实测 99.12%,残差集中在语义最近的 L0/L1 边界);配合确定性 own-view——每个专家只看到自己的原始轨迹与其他专家的 192 token 摘要,由 append-only 时间线确定性重建,重入时前缀字节级一致——引擎原生的 LoRA 感知前缀缓存自动命中,KV 复用成为稳定提示的涌现性质,完全无需修改 vLLM/SGLang。其二,'harness 是一阶训练目标':REPL 基底让依赖值驻留在持久命名空间,案例中把 48 轮的离散调用链压到 6 轮;validated reuse(save_tool 暂存候选、通过 held-out 私有验证才 promote_tool 共享,坏的晋升记录在案并降级)把用户重复工作流零梯度地编译成已验证助手;HCP 把运行时选择、工具、技能、提示、钩子变成可移植可审计的 TOML 工件,使语言空间搜索与参数空间更新耦合成一个可训练对象——模型-harness 对。其三,RSI 把'自我生成数据训练'升级为带外部契约的版本化修订:任务须同时满足质量与学习价值才入库,配置改动须过自动 eval 门,轨迹须筛选后才进训练。

方法步骤详情

一轮完整的 RSI 以版本化三元组(冻结底座 $\theta$、可训 LoRA $\phi$、HCP 配置 $c$)为输入,策略写作 $\pi_\phi(a_t \mid o_{\le t}; \theta, c)$。(1) Discovery:从版本化种子库出发,当前模型通过放宽约束、引入隐藏偏好、链接子目标、嵌入矛盾来提出更难的任务变体,每个提案必须自带可验证答案或评估 rubric;验证器与难度估计器只保留'质量合格且当前模型不能稳定解决'的任务。(2) Expansion:任务在固定模型-HCP 对下由当前模型在生产同款 REPL/UI4A harness 中执行,评估器同时打任务结果分与过程分,产出轨迹集;审计把失败定位到模型、任务或 harness 配置(多余模型往返、本应离散的动作、缺失工具边界、导致过早路由的指令等),候选配置修改通过重跑受影响切片来评估,自动 eval 通过才接受,触及工具暴露或安全边界才人工评审。(3) Update:轨迹选择过滤无效运行、去重、保留既验证又有信息量的样本;训练后端用 GRPO 只更新 LoRA,MinT 把变更导出为服务兼容的适配器修订而非合并底座;接受的 HCP 注册为下一代运行时配置,MindForge 把新适配器与父工件、评估证据链接。输出回到 Discovery,能力变化诱导新任务分布。服务侧每个用户轮执行 Route→Answer→Summary 三跳:工具结果轮锁定同一适配器跳过路由与摘要;Proxy 每轮前检查点会话状态,引擎故障或客户端断连时回滚,未送达的轮不会进入历史。

技术新颖性

与已有方法的本质区别:(1) 相对 MoE,MoL 不改底座前向、不在 token 级混合,而在请求级切换 LoRA,换取底座不可变性与适配器可移植性(作者明言这是设计选择而非受控比较结论);相对多智能体系统,MoL 不协调多个模型实例而共享一个底座,路由+摘要开销仅 0.54s+0.97s(约 32%)而非多次完整模型调用。(2) own-view + 受限解码把'多专家服务'压缩为'一个引擎+多适配器',无需独立路由器模型,路由决策本身是模型能力。(3) UI4A 提出生成式 UI 的第三条'组件原生'路线:模型写普通前端代码(import + 组件 + state + 四字段 Action 契约,含 NoAI 可见性边界),运行时强制边界,兼顾 HTML 原生的表现力与 schema 原生的可验证性,且框架无关——React/Vue/Svelte/SolidJS 由同一输出经各自 renderer 渲染。(4) 系统层面,LongStraw 把 RL 激活图寿命约束到最长响应而非'prompt+全部响应':$M_{\text{live}} \approx M_{\text{weights}} + M_{\text{prefix}}(P) + M_{\text{grad}} + \max_i\left(M_{\text{graph}}(R_i) + M_{\text{score}}(\sum_i R_i)\right)$,在 8×H20 上完成 Qwen3.6-27B 精确 2,097,152 位置的 G=2/8 响应回放与 4,456,448 位置的驻留前缀复用,在 32×H20 上完成 GLM-5.2 的 2M 端到端在线事务。难能可贵的是全文持续标注证据边界,把 companion 报告的机制与本文受控实验严格分开。

Three ways to scale model capability.
Figure 2: Three ways to scale model capability.
Three approaches to generative UI.
Figure 3: Three approaches to generative UI.
A slice of the UI4A-Bench gallery.
Figure 4: A slice of the UI4A-Bench gallery.
Executable composition.
Figure 5: Executable composition.
The three loops that share one harness.
Figure 6: The three loops that share one harness.
Infrastructure inside the Macaron revision loop.
Figure 8: Infrastructure inside the Macaron revision loop.

实验结果

对照 Opus 4.8、GPT-5.5、Gemini 3.1 Pro、GLM-5.2、Qwen 3.7 Max、Minimax M3 六个模型共 12 行基准(Table 8)。(1) Personal Intelligence:ChatBench 58.3 领先 GPT-5.5(55.5)2.8 分;LivingBench 64.0 以 0.2 分险胜 Opus 4.8(63.8),作者明确警告无区间估计不应解读为确立优势,且 judge 是私有 GLM-5.2,可能偏袒 GLM 系响应。(2) Agent:τ³-Bench pass@1 69.3(GLM-5.2 为 69.1)、PinchBench 94.0 为各行最高;但 VitaBench 60.0 低于 Qwen 3.7 Max 的 61.2,VitaBench2 46.0 低于 Gemini 3.1 的 50.2,ClawGym 77.7 低于 GPT-5.5 的 82.5。(3) 编码/终端:TerminalBench 2.1 87.6 全场最高(GPT-5.5 83.4*);SWE-Verified 85.6 低于 Opus 的 88.6*;DeepSWE 58.4 明显低于 GPT-5.5 的 70.0*。(4) GenUI:161 例同协议下 UI4A-Bench Final Score 87.8,比 Opus 4.8 的 75.9 高 11.9 分;层分数上 Constraint Adherence 94.2 对 Opus 82.2(+12.0)、Visual Quality 90.0 对 GPT-5.5 83.4(+6.6)。(5) 系统指标:路由 99.12% 准确(6391/6448)、100% 标签合规、零解析错误,且跨底座稳定(Tall 99.04%);Vita 交付三臂对比无可检测质量损失(direct 0.636±0.026 vs 路由+KV 复用 0.632±0.019);MoL 存储约 774.8B,仅为四副本合并布局(2.976T)的 26%,省 74%。(6) RSI Expansion 实验:冻结 GLM-5.2 在其 0/122 全错的 122 个 TerminalBench 2.1 任务上,最强单配置扫描仅 11/122(9.0%),自适应配置搜索经 69 个 job、450 次尝试(3.69 次/任务)后覆盖 122/122,stop-gate hooks 阶段池化通过率 81.2%。(7) Tall 在 7 行上全部超过其 35B-A3B 底座(UI4A-Bench +25.4:59.3 vs 33.9);但纯文本 LoRA 使 MME perception 降 52.99 分(MME cognition 反升 66.43)。

Per-hop latency of the route–answer–summary loop.
Table 1: Per-hop latency of the route–answer–summary loop.
Routing confusion matrices for Macaron-V1-Venti and Macaron-V1-Tall.
Table 2: Routing confusion matrices for Macaron-V1-Venti and Macaron-V1-Tall.
Three-arm benchmark quality on Vita delivery.
Table 3: Three-arm benchmark quality on Vita delivery.
Phase breakdown of the 69-job expansion run.
Table 4: Phase breakdown of the 69-job expansion run.
Fixed-hardware LongStraw execution receipts.
Table 5: Fixed-hardware LongStraw execution receipts.
Six constitutional axioms for dynamic quality derivation.
Table 6: Six constitutional axioms for dynamic quality derivation.
Seven conversation scenarios and their core tensions.
Table 7: Seven conversation scenarios and their core tensions.
Row-specific benchmark point estimates for Macaron-V1-Venti and six comparison models.
Table 8: Row-specific benchmark point estimates for Macaron-V1-Venti and six comparison models.
Comparison of Macaron-V1-Tall with its Qwen3.6 35B-A3B base.
Table 9: Comparison of Macaron-V1-Tall with its Qwen3.6 35B-A3B base.
Multimodal benchmarks on Macaron-V1-Tall (no-thinking, full datasets).
Table 10: Multimodal benchmarks on Macaron-V1-Tall (no-thinking, full datasets).
Macaron-V1-Venti main results.
Figure 1: Macaron-V1-Venti main results.
Expansion over a base-failure set.
Figure 7: Expansion over a base-failure set.
Macaron LivingBench system architecture.
Figure 9: Macaron LivingBench system architecture.
UI4A-Bench evaluation loop.
Figure 10: UI4A-Bench evaluation loop.
Paired output-token counts on 48 gallery cases.
Figure 11: Paired output-token counts on 48 gallery cases.
Macaron-V1-Venti and GLM-5.2 on the same UI4A-Bench case.
Figure 12: Macaron-V1-Venti and GLM-5.2 on the same UI4A-Bench case.
查看结构化数据
任务指标本文基线提升
生成式 UI(UI4A-Bench,161 例同协议) Final Score(0–100) 87.8 Opus 4.8:75.9(GPT-5.5 72.1) +11.9 分,全场最高;Constraint Adherence 层 +12.0(94.2 vs 82.2)
终端操作(TerminalBench 2.1) 得分(协议见附录 B) 87.6 GPT-5.5:83.4*(GLM-5.2 82.7*) +4.2 分,全场最高(含导入的星标公共值)
对话体验(Macaron ChatBench,46 例×3 次) 体验分(0–100) 58.3 GPT-5.5:55.5 +2.8 分;judge 为私有 GLM-5.2,可能偏向 GLM 系
有状态生活助理模拟(Macaron LivingBench,40 场景) 0.7×需求满足 + 0.3×过程质量 64.0 Opus 4.8:63.8 +0.2 分,无区间估计,作者声明不作优势宣称
个性化任务(PinchBench) 最佳观测运行 94.0 Qwen 3.7 Max:93.4*(公共榜导入) +0.6 分
工具调用(τ³-Bench) pass@1 69.3 GLM-5.2:69.1 +0.2 分
多步工具组合(ClawGym) pass@1 77.7 GPT-5.5:82.5 落后 4.8 分
软件修复(SWE-Verified) pass@1(Claude Code 脚手架) 85.6 Opus 4.8:88.6* 落后 3.0 分
深度软件工程(DeepSWE) 得分 58.4 GPT-5.5:70.0* 落后 11.6 分
MoL 路由(6,448 样本轨迹) 路由准确率 99.12%(Venti)/ 99.04%(Tall) 无外部基线;实现诊断而非 held-out 泛化估计 100% 规范标签合规、零请求/解析错误
RSI Expansion(122 个底座全错任务) 累计唯一覆盖 122/122(450 次尝试,3.69 次/任务) 最强单配置全量扫描 11/122(9.0%) 搜索覆盖约 11 倍差距;末期阶段池化通过率 81.2% vs 6.1%(13× 单次尝试产出)
50B 系统收益(Tall vs Qwen3.6-35B-A3B 底座) UI4A-Bench Final Score 59.3 底座:33.9 +25.4 分;7 行基准全部为正(+1.3 ~ +25.4)

局限与改进

作者相当坦率。内部 Personal Intelligence 基准与 RSI 循环共享来源域和失败分类,是'分布内证据'而非通用能力对比;ChatBench 的 judge 是私有 GLM-5.2,无人类或跨家族 judge 校准研究;LivingBench 的 0.2 分优势无区间估计;路由准确率在训练数据轨迹上测量,非独立 held-out,不估计泛化;Table 3 三臂对比只有 5 个不配对种子,'未检测到退化'不等于等价;122/122 是自适应搜索的覆盖上限而非单一配置的泛化估计,且该实验冻结模型、未执行后续的 $\phi$ 更新、未度量迁移是否泛化;VitaBench 复跑用了重现的 GLM-5.1 judge(原 judge 不可得);星标基线值来自公共榜,协议不一致;多模态测量无重复方差、无适配器/路由消融;Tall 对底座的提升是端到端系统比较而非参数匹配消融。我的补充观察:LongStraw/MinT 的数字全部来自 companion 系统报告而非本文实验,跨组件因果归因(收益来自专家化、路由、harness 还是跨代复合)在本文任何受控实验中都未解决;模拟器质量本身是移动目标,评估-部署差距未被量化;REPL 基底在 observe-before-commit 类 API 上反而劣于 function calling(BFCL v4:49.5% vs 54.0%),且长会话多次偏漂移后角色稳定性只有定性观察。

独立分析的弱点

弱点一:多意图请求只能整轮路由给一个专家(Section 2.8)。用户一条消息里'聊生活+要代码+要 UI'会被切到单一专家,靠后续轮自然分段,体验割裂。改进方向:作者已有探索分支——由 orchestrator 把多意图轮分解为专家子任务序列并组合输出,待更统一的表述定型后上线。弱点二:REPL 基底在 observe-before-commit 有状态 API 上反而更差(BFCL v4 200 任务:49.5% vs function calling 54.0%),因为依赖调用无法在观察前盲提交;生产 harness 已允许离散调用回退,更系统的做法是按 API 状态性动态选择基底,或训练'何时组合何时离散'的元决策。弱点三:KV 复用只覆盖连续前缀,跨适配器切换仍使适配器专属 KV 失效,非连续 GPU KV 拼接未实现;作者设想的'所有专家复用 L0 全量 KV'共享底板可消除每适配器的摘要冗余,但需先解决聊天适配器 KV 与专家计算混合的正确性问题。弱点四:长会话多次偏好漂移后角色稳定性定性退化、未量化,也未进入 RSI 反馈;应把角色一致性做成 LivingBench 可量化维度并闭环进训练。弱点五:自我生成任务趋向当前策略'可发现'的形状,可能自优化进局部模式、偏离真实用户行为分布(作者自己承认);除以真实产品交互(Macaron Artifacts,需同意与选择加入)喂给循环外,可引入外部任务分布锚定或对生成任务做分布偏移检测。弱点六:缺少 MoL 与预算对齐单 LoRA 的对照实验,跨任务干扰只是设计动机而非实证结论,架构的核心收益主张尚未被自己的数据证明。

未来方向

作者提出的路线图:(1) 更多专家——领域研究、非英语长文等新 LoRA 以注册方式加入,决策支持域需先过专门安全评估;(2) UI4A 更多渲染目标——Flutter 与原生移动端,协议不变,只新增 renderer 与组件导入层;(3) 第三方适配器与个性化——公开组合路径,让不同团队/用户训练的专家在同一运行时组合,验证'集体智能'究竟是架构的涌现性质还是仅仅一种可组合性设计,这是作者定义的下一代核心开放问题;(4) 与 Macaron Artifacts 产品闭环——在明确同意与选择加入下让真实交互喂给 RSI,使持续学习真正复合;(5) RSI 规模化——更多任务、更长上下文(LongStraw 的数百万 token 操作点尚未跑过完整学习曲线)、跨代提升的受控度量。基于本文成果可延伸的方向:(6) 把单输入多意图分解编排器产品化并评测;(7) 补做预算对齐的单 LoRA 对照,量化跨任务干扰;(8) 设计跨代受控实验,隔离'权重更新 vs 配置搜索 vs 两者交互'的贡献(论文明确承认未做该归因);(9) 跨适配器非连续 KV 拼接与全 L0 KV 共享底板;(10) 将 LivingBench 的四层噪声系统推广为通用智能体评测的压力测试套件,并量化长会话角色稳定性。

复现评估

开源情况较好但有硬缺口。已开放:MoL serving harness(GitHub:MindLab-Research/Mixture-of-LoRA-Harness)、Venti/Tall 权重(HuggingFace:mindlab-research)及单独合并的 Macaron-V1-Coding-Venti 检查点;适配器公开配置(Venti rank 16/alpha 32,Tall rank 64/alpha 128,含每适配器存储值数)足以核算参数驻留;训练超参(学习率、批大小、epoch、调度、优化器)在附录 B.6 披露,评测协议(judge、案例数、pass@k、重试、聚合)逐基准记录于附录 B。缺口:论文自认未提供完整的 per-specialist 训练规范;MindForge/MinT/LongStraw 的核心数字(如 2M 回执、18.3× handoff 加速、百万条目目录)来自 companion 系统报告而非本文可复现实验;内部基准(ChatBench 46 例、LivingBench 40 场景)未公开,且含未说明同意/去标识流程的产品对话数据,数据治理被作者列为实质性限制;744B 底座的训练与服务需要 H20/B300 级算力(LongStraw 回执用 8–32×H20,MinT 的 Kimi K2 运行用 64×H800),学术团队基本无法复现 Venti 级别,Tall(50B)相对可及。综合判断:复现推理与路由行为可行性中等,复现训练与 RSI 循环对多数团队不现实,复现评测数字受私有基准阻碍。