Macaron-V1:迈向开放持续学习的自我改进与 LoRA 混合架构 Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
冻结底座叠加LoRA专家、递归自我改进闭环,让智能体部署后持续学习
前置知识
LoRA(低秩适配)
冻结原模型权重 $W$,只训练低秩增量 $\Delta W = BA$(秩 $r \ll d$)来改变模型行为,可训练参数量极小。本文把 LoRA 从省钱微调手段升格为可热插拔的能力模块。
MoL 是全文架构基石:只有理解 LoRA 的可插拔性,才能理解'冻结底座+专家适配器'如何同时支撑持续学习与跨团队组合。
MoE(混合专家)
在 Transformer 中设置多个前馈'专家'和门控网络,每个 token 只激活少数专家,参数量增长时计算量近似不变,是'以稀疏换规模'的主流路线。
论文把 MoE、skills、MoL 并列为三种扩展方式(Figure 2);且底座 GLM-5.2 本身是稀疏 MoE,带来 rollout 与训练不匹配等独特工程问题。
GRPO 与智能体 RL
GRPO 是一种 RL 后训练算法:对同一 prompt 采样一组响应,用组内相对优势替代价值网络来估计优势函数并更新策略,广泛用于推理与智能体训练。
MindForge 用 GRPO 从筛选后的轨迹更新 LoRA 专家;策略写作 $\pi_\phi(a_t \mid o_{\le t}; \theta, c)$,长上下文基础设施 LongStraw 就是为这类 RL 服务的。
Agent Harness(执行框架)
包裹模型的运行时层,决定工具如何暴露、动作如何执行、结果如何回传,如 function calling、REPL、shell。相同模型在不同 harness 下成功率和 token 成本可相差数倍。
本文核心主张'模型-harness 协同设计',把 harness 当作一阶训练目标;UI4A、REPL、HCP 三个组件都属于这一层。
KV Cache 与前缀缓存
自回归推理缓存每层注意力的 Key/Value 避免重复计算;前缀缓存进一步复用相同前缀的 KV,命中时只需 prefill 新增尾部。
MoL 的 own-view 设计使路由和专家切换近乎'免费'复用 KV;Table 1 的路由开销与 Section 2.5 的两级 KV 复用都建立在这个机制上。
持续学习与灾难性遗忘
模型在部署后随新数据继续学习而不丢旧能力的范式,核心风险是新任务梯度覆盖旧权重导致旧能力骤降(灾难性遗忘)。
论文的'经验智能'目标就是持续学习;MoL 冻结底座+可注册适配器正是为了避免遗忘而做的架构选择,需要理解这一背景才能评估其设计取舍。
生成式 UI(Generative UI)
模型在对话中直接生成可交互界面(卡片/面板)而非纯文本。两条传统路线:HTML 原生(表现力强但难控)与 Schema 原生(可验证但受组件目录上限约束)。
UI4A 是本文提出的第三条'组件原生'路线,是 L3 专家的基底和 UI4A-Bench 的评测环境,也是 Venti 领先幅度最大的能力项(+11.9 分)。
递归自我改进(RSI)
系统用自身产生的经验(任务、轨迹、评估)构造下一代版本的循环过程;关键约束是需要外部契约与谱系记录防止自我强化漂移。
这是论文'适应'维度的核心机制:Discovery→Expansion→Update 三阶段循环,Figure 7 的 122/122 覆盖实验度量的是其中 Expansion 阶段的覆盖能力。
研究动机
现有智能体模型的主流做法是集中式后训练:在一个有界任务与环境集合上优化模型、对齐当时的 harness,然后打包成检查点发布,能力自此冻结。论文指出三层具体问题。其一是跨任务干扰:聊天、智能体工具使用、编码、生成式 UI 这些思维形态差异极大的任务在共享参数上联合训练时会互相竞争(引 Wang et al. 2026),且本发布也缺少预算对齐的单 LoRA 对照来量化这种干扰有多大。其二是环境绑定:模型学习的数据、可用的工具、服务的用户与必须支持的交互共同塑造部署行为,而这些条件在发布后持续演化——新知识出现、新领域涌现、交互状态跨 episode 累积,系统却没有机制把执行经验转化为系统性改进。其三是概念层面:作者把这种做法明确定义为'逼近一个静态最优'而非真智能,真正的智能应是经验智能(experiential intelligence)——从真实环境积累的经验中学习并在部署后继续学习(引 Silver & Sutton 2025)。产品层面要求的 Personal Intelligence(跨会话记住约束、判断何时澄清何时行动、对用户诚实)进一步带有时间性要求,静态检查点天然无法满足。
本文的目标是构建一个面向经验智能的开放智能体模型家族 Macaron-V1,把'部署后继续学习'工程化为可版本化、可审计的修订循环,而不是停留在单一检查点。目标拆成两个互补维度:适应(adaptation)——对显式版本化的'模型-harness 对'做递归改进,一个配置产生的经验在外部契约下评估后用于构造后继版本,并跨代度量保持、迁移与累积改进;协作(collaboration)——用组合表达异质能力:冻结大底座、叠加专家 LoRA、每个用户轮选择一个专家,使新能力能以'注册适配器'而非重训底座的方式加入,并原则上支持不同团队或用户训练的专家在同一运行时上组合。同步交付配套基础设施(MinT 后训练平台、LongStraw 长上下文 RL 执行、稀疏 MoE/DSA 稳定性控制)和三组评测(Personal Intelligence、GenUI、通用能力基准套件)来验证当前系统,同时坦诚标记哪些长期目标(跨代复合提升、集体智能)仍是开放问题。
与已有工作不同的是,独特切入在于两个'占位'。第一,把持续学习的落点从'改权重'挪到'模型-harness 对的版本化修订':已有工作分别守在三条路径——参数化持续学习直接跨任务更新权重;记忆/状态方法携带轨迹、检索经验或在线状态而不动参数;上下文/harness 方法只改指令、工具、技能、编排或执行结构。Macaron-V1 把 harness 适应与模块化参数适应接起来:先从种子构造更难任务、在生产 harness 中审计轨迹、搜索塑造行为的上下文配置(语言空间搜索),再把入选轨迹转训进专家 LoRA(参数空间更新),由 MindForge 的谱系(问题库+HCP+适配器修订)链接成完整实验记录。第二,协作粒度定在'每用户轮一个 LoRA'这个此前未被占据的操作点:现有 mixture-of-adapter 系统在任务/序列/token 级混合专家,多智能体系统协调完整模型实例;MoL 则每轮由入口适配器 L0 自己推理出路由标签,路由成为聊天专家理解力的一部分而非外挂分类器或独立路由模型。
核心方法
直觉上,与其训练一个什么都会的单体模型,不如让四个层各自独立版本化、联合评估:底座承载通用能力、LoRA 专家承载差异化行为、harness 承载工具与上下文约定、RSI 循环承载修订过程。技术路线分三块。架构上,MoL(Mixture-of-LoRA)在冻结的 744B GLM-5.2 底座上叠四个 rank-16 LoRA 专家——L0 Chat(对话骨干兼路由入口)、L1 Agent(长程重工具任务,吸收了 Preview 的 OpenClaw 适配器)、L2 Coding、L3 GenUI;每个适配器含 7,688,042,496 个存储值(748B 只是发布标签)。Proxy 按用户轮执行三跳:Route(L0 在 24 token 预算内经受限解码语法输出唯一的 L0–L3 规范标签)→ Answer(中选专家从自己的会话视图作答)→ Summary(专家输出 ≤192 token 摘要,Proxy 存服务端供跨适配器继承,绝不返回客户端)。算法上,模型-harness 协同设计提供 UI4A 组件原生 GenUI harness、REPL 有状态动作基底和 HCP 版本化 TOML 运行时契约;MindForge 在其上跑 Discovery→Expansion→Update 三阶段 RSI,用 GRPO 更新适配器。基础设施上,MinT 管理适配器修订与策略记录的分离,LongStraw 提供响应侧-only 的长上下文 RL 执行,R3 路由重放、DSA 对齐与 IcePop 式掩码控制稀疏基座的 rollout-训练失配。50B 的 Tall(Qwen3.6-35B-A3B 底座 + 4 个 rank-64 LoRA ≈ 50.1B)复用同一设计面向本地部署。
核心创新是三个彼此咬合的机制。其一,'路由即理解':MoL 不训练独立路由器、不用关键词规则库,而是让 L0 在受限解码语法下自己输出规范标签,路由精度随底座与 L0 的进步而进步(实测 99.12%,残差集中在语义最近的 L0/L1 边界);配合确定性 own-view——每个专家只看到自己的原始轨迹与其他专家的 192 token 摘要,由 append-only 时间线确定性重建,重入时前缀字节级一致——引擎原生的 LoRA 感知前缀缓存自动命中,KV 复用成为稳定提示的涌现性质,完全无需修改 vLLM/SGLang。其二,'harness 是一阶训练目标':REPL 基底让依赖值驻留在持久命名空间,案例中把 48 轮的离散调用链压到 6 轮;validated reuse(save_tool 暂存候选、通过 held-out 私有验证才 promote_tool 共享,坏的晋升记录在案并降级)把用户重复工作流零梯度地编译成已验证助手;HCP 把运行时选择、工具、技能、提示、钩子变成可移植可审计的 TOML 工件,使语言空间搜索与参数空间更新耦合成一个可训练对象——模型-harness 对。其三,RSI 把'自我生成数据训练'升级为带外部契约的版本化修订:任务须同时满足质量与学习价值才入库,配置改动须过自动 eval 门,轨迹须筛选后才进训练。
方法步骤详情
一轮完整的 RSI 以版本化三元组(冻结底座 $\theta$、可训 LoRA $\phi$、HCP 配置 $c$)为输入,策略写作 $\pi_\phi(a_t \mid o_{\le t}; \theta, c)$。(1) Discovery:从版本化种子库出发,当前模型通过放宽约束、引入隐藏偏好、链接子目标、嵌入矛盾来提出更难的任务变体,每个提案必须自带可验证答案或评估 rubric;验证器与难度估计器只保留'质量合格且当前模型不能稳定解决'的任务。(2) Expansion:任务在固定模型-HCP 对下由当前模型在生产同款 REPL/UI4A harness 中执行,评估器同时打任务结果分与过程分,产出轨迹集;审计把失败定位到模型、任务或 harness 配置(多余模型往返、本应离散的动作、缺失工具边界、导致过早路由的指令等),候选配置修改通过重跑受影响切片来评估,自动 eval 通过才接受,触及工具暴露或安全边界才人工评审。(3) Update:轨迹选择过滤无效运行、去重、保留既验证又有信息量的样本;训练后端用 GRPO 只更新 LoRA,MinT 把变更导出为服务兼容的适配器修订而非合并底座;接受的 HCP 注册为下一代运行时配置,MindForge 把新适配器与父工件、评估证据链接。输出回到 Discovery,能力变化诱导新任务分布。服务侧每个用户轮执行 Route→Answer→Summary 三跳:工具结果轮锁定同一适配器跳过路由与摘要;Proxy 每轮前检查点会话状态,引擎故障或客户端断连时回滚,未送达的轮不会进入历史。
技术新颖性
与已有方法的本质区别:(1) 相对 MoE,MoL 不改底座前向、不在 token 级混合,而在请求级切换 LoRA,换取底座不可变性与适配器可移植性(作者明言这是设计选择而非受控比较结论);相对多智能体系统,MoL 不协调多个模型实例而共享一个底座,路由+摘要开销仅 0.54s+0.97s(约 32%)而非多次完整模型调用。(2) own-view + 受限解码把'多专家服务'压缩为'一个引擎+多适配器',无需独立路由器模型,路由决策本身是模型能力。(3) UI4A 提出生成式 UI 的第三条'组件原生'路线:模型写普通前端代码(import + 组件 + state + 四字段 Action 契约,含 NoAI 可见性边界),运行时强制边界,兼顾 HTML 原生的表现力与 schema 原生的可验证性,且框架无关——React/Vue/Svelte/SolidJS 由同一输出经各自 renderer 渲染。(4) 系统层面,LongStraw 把 RL 激活图寿命约束到最长响应而非'prompt+全部响应':$M_{\text{live}} \approx M_{\text{weights}} + M_{\text{prefix}}(P) + M_{\text{grad}} + \max_i\left(M_{\text{graph}}(R_i) + M_{\text{score}}(\sum_i R_i)\right)$,在 8×H20 上完成 Qwen3.6-27B 精确 2,097,152 位置的 G=2/8 响应回放与 4,456,448 位置的驻留前缀复用,在 32×H20 上完成 GLM-5.2 的 2M 端到端在线事务。难能可贵的是全文持续标注证据边界,把 companion 报告的机制与本文受控实验严格分开。
实验结果
对照 Opus 4.8、GPT-5.5、Gemini 3.1 Pro、GLM-5.2、Qwen 3.7 Max、Minimax M3 六个模型共 12 行基准(Table 8)。(1) Personal Intelligence:ChatBench 58.3 领先 GPT-5.5(55.5)2.8 分;LivingBench 64.0 以 0.2 分险胜 Opus 4.8(63.8),作者明确警告无区间估计不应解读为确立优势,且 judge 是私有 GLM-5.2,可能偏袒 GLM 系响应。(2) Agent:τ³-Bench pass@1 69.3(GLM-5.2 为 69.1)、PinchBench 94.0 为各行最高;但 VitaBench 60.0 低于 Qwen 3.7 Max 的 61.2,VitaBench2 46.0 低于 Gemini 3.1 的 50.2,ClawGym 77.7 低于 GPT-5.5 的 82.5。(3) 编码/终端:TerminalBench 2.1 87.6 全场最高(GPT-5.5 83.4*);SWE-Verified 85.6 低于 Opus 的 88.6*;DeepSWE 58.4 明显低于 GPT-5.5 的 70.0*。(4) GenUI:161 例同协议下 UI4A-Bench Final Score 87.8,比 Opus 4.8 的 75.9 高 11.9 分;层分数上 Constraint Adherence 94.2 对 Opus 82.2(+12.0)、Visual Quality 90.0 对 GPT-5.5 83.4(+6.6)。(5) 系统指标:路由 99.12% 准确(6391/6448)、100% 标签合规、零解析错误,且跨底座稳定(Tall 99.04%);Vita 交付三臂对比无可检测质量损失(direct 0.636±0.026 vs 路由+KV 复用 0.632±0.019);MoL 存储约 774.8B,仅为四副本合并布局(2.976T)的 26%,省 74%。(6) RSI Expansion 实验:冻结 GLM-5.2 在其 0/122 全错的 122 个 TerminalBench 2.1 任务上,最强单配置扫描仅 11/122(9.0%),自适应配置搜索经 69 个 job、450 次尝试(3.69 次/任务)后覆盖 122/122,stop-gate hooks 阶段池化通过率 81.2%。(7) Tall 在 7 行上全部超过其 35B-A3B 底座(UI4A-Bench +25.4:59.3 vs 33.9);但纯文本 LoRA 使 MME perception 降 52.99 分(MME cognition 反升 66.43)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 生成式 UI(UI4A-Bench,161 例同协议) | Final Score(0–100) | 87.8 | Opus 4.8:75.9(GPT-5.5 72.1) | +11.9 分,全场最高;Constraint Adherence 层 +12.0(94.2 vs 82.2) |
| 终端操作(TerminalBench 2.1) | 得分(协议见附录 B) | 87.6 | GPT-5.5:83.4*(GLM-5.2 82.7*) | +4.2 分,全场最高(含导入的星标公共值) |
| 对话体验(Macaron ChatBench,46 例×3 次) | 体验分(0–100) | 58.3 | GPT-5.5:55.5 | +2.8 分;judge 为私有 GLM-5.2,可能偏向 GLM 系 |
| 有状态生活助理模拟(Macaron LivingBench,40 场景) | 0.7×需求满足 + 0.3×过程质量 | 64.0 | Opus 4.8:63.8 | +0.2 分,无区间估计,作者声明不作优势宣称 |
| 个性化任务(PinchBench) | 最佳观测运行 | 94.0 | Qwen 3.7 Max:93.4*(公共榜导入) | +0.6 分 |
| 工具调用(τ³-Bench) | pass@1 | 69.3 | GLM-5.2:69.1 | +0.2 分 |
| 多步工具组合(ClawGym) | pass@1 | 77.7 | GPT-5.5:82.5 | 落后 4.8 分 |
| 软件修复(SWE-Verified) | pass@1(Claude Code 脚手架) | 85.6 | Opus 4.8:88.6* | 落后 3.0 分 |
| 深度软件工程(DeepSWE) | 得分 | 58.4 | GPT-5.5:70.0* | 落后 11.6 分 |
| MoL 路由(6,448 样本轨迹) | 路由准确率 | 99.12%(Venti)/ 99.04%(Tall) | 无外部基线;实现诊断而非 held-out 泛化估计 | 100% 规范标签合规、零请求/解析错误 |
| RSI Expansion(122 个底座全错任务) | 累计唯一覆盖 | 122/122(450 次尝试,3.69 次/任务) | 最强单配置全量扫描 11/122(9.0%) | 搜索覆盖约 11 倍差距;末期阶段池化通过率 81.2% vs 6.1%(13× 单次尝试产出) |
| 50B 系统收益(Tall vs Qwen3.6-35B-A3B 底座) | UI4A-Bench Final Score | 59.3 | 底座:33.9 | +25.4 分;7 行基准全部为正(+1.3 ~ +25.4) |
局限与改进
作者相当坦率。内部 Personal Intelligence 基准与 RSI 循环共享来源域和失败分类,是'分布内证据'而非通用能力对比;ChatBench 的 judge 是私有 GLM-5.2,无人类或跨家族 judge 校准研究;LivingBench 的 0.2 分优势无区间估计;路由准确率在训练数据轨迹上测量,非独立 held-out,不估计泛化;Table 3 三臂对比只有 5 个不配对种子,'未检测到退化'不等于等价;122/122 是自适应搜索的覆盖上限而非单一配置的泛化估计,且该实验冻结模型、未执行后续的 $\phi$ 更新、未度量迁移是否泛化;VitaBench 复跑用了重现的 GLM-5.1 judge(原 judge 不可得);星标基线值来自公共榜,协议不一致;多模态测量无重复方差、无适配器/路由消融;Tall 对底座的提升是端到端系统比较而非参数匹配消融。我的补充观察:LongStraw/MinT 的数字全部来自 companion 系统报告而非本文实验,跨组件因果归因(收益来自专家化、路由、harness 还是跨代复合)在本文任何受控实验中都未解决;模拟器质量本身是移动目标,评估-部署差距未被量化;REPL 基底在 observe-before-commit 类 API 上反而劣于 function calling(BFCL v4:49.5% vs 54.0%),且长会话多次偏漂移后角色稳定性只有定性观察。
独立分析的弱点
弱点一:多意图请求只能整轮路由给一个专家(Section 2.8)。用户一条消息里'聊生活+要代码+要 UI'会被切到单一专家,靠后续轮自然分段,体验割裂。改进方向:作者已有探索分支——由 orchestrator 把多意图轮分解为专家子任务序列并组合输出,待更统一的表述定型后上线。弱点二:REPL 基底在 observe-before-commit 有状态 API 上反而更差(BFCL v4 200 任务:49.5% vs function calling 54.0%),因为依赖调用无法在观察前盲提交;生产 harness 已允许离散调用回退,更系统的做法是按 API 状态性动态选择基底,或训练'何时组合何时离散'的元决策。弱点三:KV 复用只覆盖连续前缀,跨适配器切换仍使适配器专属 KV 失效,非连续 GPU KV 拼接未实现;作者设想的'所有专家复用 L0 全量 KV'共享底板可消除每适配器的摘要冗余,但需先解决聊天适配器 KV 与专家计算混合的正确性问题。弱点四:长会话多次偏好漂移后角色稳定性定性退化、未量化,也未进入 RSI 反馈;应把角色一致性做成 LivingBench 可量化维度并闭环进训练。弱点五:自我生成任务趋向当前策略'可发现'的形状,可能自优化进局部模式、偏离真实用户行为分布(作者自己承认);除以真实产品交互(Macaron Artifacts,需同意与选择加入)喂给循环外,可引入外部任务分布锚定或对生成任务做分布偏移检测。弱点六:缺少 MoL 与预算对齐单 LoRA 的对照实验,跨任务干扰只是设计动机而非实证结论,架构的核心收益主张尚未被自己的数据证明。
未来方向
作者提出的路线图:(1) 更多专家——领域研究、非英语长文等新 LoRA 以注册方式加入,决策支持域需先过专门安全评估;(2) UI4A 更多渲染目标——Flutter 与原生移动端,协议不变,只新增 renderer 与组件导入层;(3) 第三方适配器与个性化——公开组合路径,让不同团队/用户训练的专家在同一运行时组合,验证'集体智能'究竟是架构的涌现性质还是仅仅一种可组合性设计,这是作者定义的下一代核心开放问题;(4) 与 Macaron Artifacts 产品闭环——在明确同意与选择加入下让真实交互喂给 RSI,使持续学习真正复合;(5) RSI 规模化——更多任务、更长上下文(LongStraw 的数百万 token 操作点尚未跑过完整学习曲线)、跨代提升的受控度量。基于本文成果可延伸的方向:(6) 把单输入多意图分解编排器产品化并评测;(7) 补做预算对齐的单 LoRA 对照,量化跨任务干扰;(8) 设计跨代受控实验,隔离'权重更新 vs 配置搜索 vs 两者交互'的贡献(论文明确承认未做该归因);(9) 跨适配器非连续 KV 拼接与全 L0 KV 共享底板;(10) 将 LivingBench 的四层噪声系统推广为通用智能体评测的压力测试套件,并量化长会话角色稳定性。
复现评估
开源情况较好但有硬缺口。已开放:MoL serving harness(GitHub:MindLab-Research/Mixture-of-LoRA-Harness)、Venti/Tall 权重(HuggingFace:mindlab-research)及单独合并的 Macaron-V1-Coding-Venti 检查点;适配器公开配置(Venti rank 16/alpha 32,Tall rank 64/alpha 128,含每适配器存储值数)足以核算参数驻留;训练超参(学习率、批大小、epoch、调度、优化器)在附录 B.6 披露,评测协议(judge、案例数、pass@k、重试、聚合)逐基准记录于附录 B。缺口:论文自认未提供完整的 per-specialist 训练规范;MindForge/MinT/LongStraw 的核心数字(如 2M 回执、18.3× handoff 加速、百万条目目录)来自 companion 系统报告而非本文可复现实验;内部基准(ChatBench 46 例、LivingBench 40 场景)未公开,且含未说明同意/去标识流程的产品对话数据,数据治理被作者列为实质性限制;744B 底座的训练与服务需要 H20/B300 级算力(LongStraw 回执用 8–32×H20,MinT 的 Kimi K2 运行用 64×H800),学术团队基本无法复现 Venti 级别,Tall(50B)相对可及。综合判断:复现推理与路由行为可行性中等,复现训练与 RSI 循环对多数团队不现实,复现评测数字受私有基准阻碍。
论文图表