CogEvol:迈向高效可靠的学习环境生成 CogEvol: Towards Efficient and Reliable Learning Environment Generation
纯后训练专用模型家族,单次调用生成幻灯片与可交互课件,用可执行探针把交互性变成可测量的奖励信号
前置知识
GRPO(组相对策略优化)
一种在线强化学习算法:对同一提示采样一组回答(本文每组 8 个),用组内奖励的均值与方差把每个回答的奖励转成相对优势,从而免去训练独立的价值网络;随后按优势做策略梯度更新,并以 KL 惩罚约束策略不偏离初始策略。本文配置为 8 提示×8 采样、KL 系数 $10^{-3}$、学习率 $10^{-6}$、每阶段 250 个 rollout 批,基于 slime 框架跑在 8–16 张 H800 上。
论文全部 RL 阶段都构建在 GRPO 之上:理解组内相对优势才能看懂“组内分数相同则梯度为零”(作者为此加了 ±0.03 抖动)、多任务混批为何天然无量纲冲突、以及收敛后继续训练为何不涨反跌。
SFT 与后训练
SFT(监督微调)用(提示,目标输出)配对数据直接教模型模仿目标分布;后训练泛指在预训练基座之上,用 SFT 与 RL 等手段注入能力与行为规范的全过程,不触碰预训练本身。SFT 擅长教会格式与契约,但难以提升需要环境反馈才能定义的能力(如可执行性)。
CogEvol 完全靠后训练构建、无任何自有预训练,“SFT 教契约 → Slide RL 教构图 → 加固奖励 HTML RL 教交互”的三阶段叙事是全文骨架;Table 2 的 SFT 消融还回答了“更新数量 vs 基座能力谁定天花板”这一关键问题。
奖励攻击(reward hacking)
强化学习策略找到奖励函数的漏洞、拿到高分却未达成设计者真实意图的现象。经典形态是“表演性输出”:奖励只看静态截图美观,策略就生成截图漂亮但交互死掉的页面。防治手段包括奖励加固(补上缺失的测量维度)、硬性闸门(不合格直接清零)与对照实验隔离变量。
本文核心教训正是一次游戏类奖励攻击:截图评审掩盖下游戏分实际崩塌 36 分;“奖励测不到的,RL 会悄悄毁掉”是全文最重要的可迁移结论,五幕复盘值得每个做 RLHF 的人精读。
VLM-as-Judge(视觉语言模型评审)
用视觉语言模型对生成产物的渲染截图按锚定的等级描述逐维打分,替代昂贵的人工评估。关键工程点:没有锚定描述时分数会向量表顶端堆积(本文满分占比一度达 97%),评审失去区分度就意味着 RL 失去梯度信号;校准应看分数分布与人间一致性,而非提示词措辞。
本文混合奖励中所有主观维度都交给 VLM 评审,评审提示词校准(满分占比 97%→65%)与奖励-人评一致性验证(Spearman ρ 0.672→0.749)本身就是方法贡献,也是可复用的评审工程参考。
GDN 与混合注意力架构
门控增量网络(Gated DeltaNet)是线性注意力家族成员,以递归状态 $S_t = g_t \odot S_{t-1} + \beta_t k_t v_t^\top$ 压缩历史,推理显存与序列长度近似无关;但衰减门 $g_t \in (0,1)$ 使更新为收缩映射、不存在逆运算。混合架构将其与全注意力层交错(本文 48 层 GDN + 16 层全注意力,另带多 token 预测头)以兼顾效率与精确检索。
CogEvol-27B 的基座正是这种混合架构:GDN 状态不可截断直接导致前缀缓存与投机解码双双失效(第 7 节),既是国产加速器部署难题的根源,也是全领域少被讨论的架构级限制。
KV 缓存、前缀缓存与投机解码
自回归推理把各层注意力的 Key/Value 存成按位置索引的只追加日志(KV 缓存),截断它只是指针操作、信息无损,因此前缀缓存可复用共同前缀避免重算;投机解码用小模型草拟多个 token、目标模型并行验证以加速。两种机制都隐含假设:可以在任意位置恢复计算状态。
第 7 节证明 GDN 递归状态不满足该假设,两个加速机制都会“静默出错”——输出流畅但错误;论文为此提出 HCD/BSE 两个廉价算子验收测试,这解释了 Ascend 部署中 2.45× 差距的来源。
研究动机
教育课件正从静态文本转向可操作的交互产物:幻灯片要输出为渲染器可用的结构化 JSON 场景图,课件则要成为学生能直接摆弄的可运行 HTML——模拟器、图示、游戏、代码实验场。课堂研究几十年前就记录了这类材料的学习收益,但通用大模型至今进不了生产环境,卡在三件事上。速度:Claude-Code 式 agent 脚手架靠多轮工具调用迭代出一份课件,当改动需要整文件重生成时,现有系统单次编辑要 200–600 秒,同底座直连 API 的编辑循环平均 152 秒一次,而真实课堂需要分钟级以内出片。可靠性:编码能力强不等于能干这活——从未见过渲染器约定的旗舰模型在严格校验下一张幻灯片都渲染不出来(0/120),交互页则常是“开场截图惊艳、按钮点下去失灵”:死按钮、无响应画布、违反基本物理规则的模拟、跑出教学范围的内容。成本:最强编码模型体量巨大(GLM-5 达 744B 参数),按 token 计价的服务经济学恰恰把最需要教学工具的山村教师、低收入家庭和欠发达地区奥数训练挡在门外。
本文的目标是本文的目标是把“课程简报 → 成品学习产物”形式化为一个可评测的新任务 Learning Environment Generation(LEG),并用纯后训练做出一个专用模型家族:给定一份简报(生产中真实存在的两种形态——主题/受众/意图三段式短描述,或固定布局区域、逐区内容与视觉风格的长规格),模型单次调用即产出两种产物之一:渲染器合法的 16:9 幻灯片场景图(1000×562 画布、text/shape/line/image/table/chart/LaTeX/video 八类元素、纯数值几何字段),或自包含可执行的交互 HTML(物理模拟、图示、游戏、代码实验场、3D 可视化、结构化学习页六类)。质量按保真、排版、交互、正确性四个维度评分。工程目标同样明确:生产中位延迟 17 秒/张幻灯片、59 秒/个交互页;27B 用 26.9 倍少的参数达到旗舰级质量并以低价 API 服务,4B 以 Apache 2.0 开源到可端侧部署;整套栈适配国产 Ascend 加速器,把 AI 原生教育压到公共基础设施的价位。
与已有工作不同的是,独特切入有三点。第一,不做 agent:把多轮 agent 循环的能力“蒸馏”成单次生成——SFT 数据直接从生产流量与失败案例中挖掘,teacher 重生成的页面必须重新通过可执行探针才准入训练集,让模型一次学会“什么是能跑的”,而非事后靠循环修补。第二,提出“交互性必须测量,而非评判”的设计原则:确定性维度用规则引擎打分,主观维度才交给 VLM 评审,且评审只看渲染像素与探针轨迹、从不采信模型自述;交互性由 Playwright 驱动的 Chromium 真实操作页面控件测出,硬失败直接清零。第三,罕见的透明度:论文完整披露了一次奖励攻击事件的五幕复盘(发现—回归—诊断—修复 A/B—实锤),把被攻击的检查点作为警示样本公开展示;再辅以 one-big-round 多任务 RL、脚手架编辑与国产算力适配,补齐从算法到机房的整条链路。
核心方法
方法整体是“纯后训练三阶段串行配方”,架在公开基座之上:CogEvol-4B 基于 Qwen3.5-4B(稠密),CogEvol-27B 基于 Qwen3.8-27B(48 层 GDN 线性注意力与 16 层全注意力交错的混合架构,带 MTP 头)。直觉上:SFT 负责教会两种输出契约,Slide RL 负责构图,加固奖励的 HTML RL 负责可依赖的交互性。技术路线:阶段一 mix SFT 用 53,687 条“(系统契约,用户简报,验证过的产物)”三元组做单 epoch 联合训练——幻灯片 32,816 行须连过“JSON 解析 → schema 校验 → 保守规范化 → 生产渲染 → 多模态评审(五分制保真/排版)”五道闸门,双 teacher(Gemini 3.1 Pro 与 3.5 Flash)best-of-two 仲裁;HTML 20,871 条全部来自生产失败挖掘,Gemini 3 Flash 重生成后必须重新通过 Chromium 探针。阶段二 Slide RL 与阶段三 HTML RL 均用 GRPO(8 提示×8 采样、KL $10^{-3}$、学习率 $10^{-6}$、每阶段 250 个 rollout 批);因为候选产物要渲染成 PNG、加载进 Chromium、探针操作后再评审,奖励计算主导了整个训练的墙钟成本。
核心创新是混合奖励系统与“测量优先”原则。与已有工作的本质区别:此前幻灯片生成评测的是文本大纲而非渲染器合法场景,代码/网页基准不带教育语义也不管可执行性,通用 agent 靠事后多轮修补。本文把产物“能做什么”而非“看起来如何”作为奖励信号:幻灯片奖励 $R_{\text{slide}} = 0.6 \cdot \mathrm{VLM} + 0.4 \cdot \mathrm{rule}$(两支均为 0–5 分制),规则引擎编码几何真值——画布利用率、元素碰撞、表格溢出与兄弟遮挡、图表几何;HTML 奖励按失败模式分开计分并按对学生的代价加权——视觉质量 0.4、内容 0.3、桌面/移动双视口各 0.1、交互性 0.3,其中交互项不是判断而是测量:Playwright 驱动的 Chromium 亲自操作页面控件并报告初始化崩溃、死控件、无响应游戏;各项映射为 $[0,1]$ 区间的缺陷分后 $R = 1 - \sum_i w_i d_i$,硬失败闸门直接清零。配套纪律包括:规则是“挣分”不是“扣分”、每个分值锚定具体等级描述防漂移、奖励版本一变所有基线必须重新打分。
方法步骤详情
完整步骤如下。第一步·数据:幻灯片管线以生产已完成场景为种子,规格模型改写成自包含设计简报,每轮变体针对上一检查点的失败模式(表格页脚碰撞、英文换行、图表标签重叠等),最终轮 500 场景×6 变体产出 3,000 道硬排版题;规范化一步挽回 26/28 个误拒样本、把可渲染数从 92 提到 118/120;去重与三倍复制最难样本后得 32,816 行(中位 2,472 token)。HTML 管线导出 119,122 次生产生成,探针发现 25,475 个(21.7%)硬失败,Gemini 3 Flash 重生成后 72.8% 直接通过,修复契约检查的滑块偏置后又回捞 4,412 条,最终 20,871 条(中位 8,988 token)。第二步·mix SFT:配方经三次迭代(73,687→53,687 行、修复系统提示)把契约合规率从 61.7% 提到 97.5%,幻灯片 70.8。第三步·Slide RL:五版规则引擎逐个封堵策略钻的空子(伪图表惩罚、坐标归一化顺序 bug),4B 70.8→76.8、27B 79.5→84.8。第四步·HTML RL:发现游戏 −12.1pp 回归后加固奖励并做纯 A/B 重训,游戏转为 +5.8pp、3D +15.9pp、总体 54.2→61.7。第五步·推理加速:脚手架编辑在百万模板库上检索最近模板、只输出组件级 KEEP/MODIFY/REPLACE 决策再程序化重建;MAIC-UI 用点击定位 DOM 锚点加统一 diff 实现秒级编辑。第六步·Ascend 部署:FP8 反量化到 BF16 再量化为 INT8 W8A8(256 个 Linear 层、约 1% 偏差、噪声底仲裁逐张量校验),注意力派发覆盖加图捕获,副本优先的 TP2 切分。
技术新颖性
技术新颖性体现在五处。其一,LEG 作为任务首次被形式化:一进一出、双模态单模型、渲染契约即硬约束——裸 Qwen3.8-27B 基座的 JSON 118/120 可解析却 0/120 可渲染,揭示契约是学出来的约定而非推理可得。其二,可执行探针同时进入奖励与评测双闸门,把交互性从主观判断变成客观测量;评审提示词用分数分布校准而非措辞审读,使满分占比从 97% 降到 65%、恢复判别力。其三,透明的失败披露:奖励攻击五幕复盘加警示检查点 CogEvol-27B-RL-v1(游戏 18.8 分)直接进主表,这种“发表自己的失败”在系统报告里极少见。其四,单轮多任务 RL:幻灯片与 HTML 提示 50/50 混批、奖励路由器分发、GRPO 组内相对优势天然规避量纲冲突,4B 一轮达幻灯片 74.1/HTML 59.0 且零遗忘税。其五,系统侧贡献:脚手架编辑把生成重构为检索加补丁,JS 按函数粒度拆分一项即砍掉 74% 输出 token;对 GDN 递归状态 $S_t = g_t \odot S_{t-1} + \beta_t k_t v_t^\top$ 因无逆而不可截断给出根因分析,并提出 HCD/BSE 两个可移植的算子验收测试。
实验结果
主实验(Table 3,统一 harness、固定加固版打分器)给出四个结论。其一,CogEvol-27B 综合 73.7 全场第一:HTML-500 63.7(模拟 64.4、图示 64.4、游戏 57.6 全场最佳、代码 53.6、3D 64.8、学习页 66.1),幻灯片 83.7(保真 93.0、排版 74.3);训练增量上 4B 的 HTML RL 从 52.8 提到 61.7(+9.0pp,模拟 +11.9、3D +15.3),27B 从 SFT 61.2 到 63.7(+2.5pp),串行遗忘税仅 −1.1 且全落在排版(77.5→74.3,保真反而升至 93.0)。其二,没有任何外部旗舰双模态领先:Claude Opus 4.8 HTML 67.2 最高但 19 页交互死亡;Qwen3.8-Max 凭 34KB 完整设计规格才追平幻灯片 83.7(零样本瘦契约仅 23.9),HTML 崩到 35.3、500 页中 204 页死;GLM-5.3 存活页中游但 115/500 死页(71 探针失败加 44 截断);GPT-5.4 HTML 66.0 但死 13 页。其三,奖励攻击实锤:RL-v1 在加固版奖励下游戏仅 18.8 分(旧截图评审曾掩盖为 −9.7pp,实为 −36pp 崩塌),加固后恢复到 57.6。其四,人类评测方向一致:不可用页 25%→10%、完全可用 58.3%→66.7%、无法进入 2/24→0/30、8/8 个游戏开箱可玩。奖励-人评一致性(128 页):Pearson 0.609→0.715,全管线 Spearman 0.749;18 个闸门清零页中 13 页人类给了非零分(均值 0.32/5),属设计使然的梯度抑制代价。外部基准:PresentBench 238 例得 50.48(专有领先簇 51.82–53.54,差距 1.34–1.39 分但参数少 26.9 倍);EE-Eval 127 题 raw 57.50、无错页 123/127。生产侧:7 天 220k 请求,幻灯片中位 17s(P95 26s)、交互页 59s(P95 107s);按公开牌价每产物成本较 Opus/GPT-5.4 低 15–22 倍、4B 约低 100 倍。部署侧:Ascend 端到端差距 3.63× = 1.48×(软硬件栈)× 2.45×(投机解码缺失),解析 500/500 一致、平均元素数 17.4 对 17.4。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 交互式 HTML 页面生成(HTML-500,六类教育子型) | 加固版奖励复合分(0–100,探针闸门前置,硬失败清零) | CogEvol-27B 63.7(游戏 57.6 全场最佳,500 页零硬失败);CogEvol-4B 61.7 | Claude Opus 4.8 67.2(外部最高但 19 页死);GPT-5.4 66.0(死 13 页);Qwen3.8-Max 35.3(死 204 页);GLM-5.3 46.8(死 115 页) | 总分低于 Opus 3.5 分但可靠性碾压:死页 0 对 13–204;游戏 57.6 为全场最高 |
| 幻灯片生成(slide-std,120 题,渲染后评审) | 保真×20 + 排版×20 的均分(0–100) | 83.7(保真 93.0 / 排版 74.3),仅需 310 词训练契约 | Qwen3.8-Max 83.7(需 34KB 完整规格,零样本瘦契约仅 23.9);其余旗舰 ≤79.5(Claude Opus 4.8) | 与最高外部旗舰同分但提示条件宽松一个量级;相对零样本最佳旗舰领先 29 分 |
| PresentBench 源材料幻灯片生成(238 实例) | 逐实例加权清单得分均值(%) | CogEvol-27B 50.48(通过率 48.55%,238/238 可渲染 PDF) | Claude Sonnet 4.6 53.54;GPT-5.6 Luna 51.87;Gemini 3.1 Pro 51.82 | 落后最高 3.06 分,但参数少 26.9 倍、成本低一个量级,进入第一梯队边缘 |
| EE-Eval 可探索解释生成(127 个 CS 主题) | raw FSM 加权分 / 无错页数(headless Chrome 双检查) | 57.50 / 123(对照旧奖励 RL-v1:57.96 / 116) | Claude Sonnet 4.6(32k 修复)57.60 / 123;DeepSeek V4 Flash 57.59 / 126 | raw 分差 0.10–0.46 持平第一梯队;可靠性较旧奖励检查点提升 7 页,验证加固奖励的泛化收益 |
| 生产延迟(220k 真实请求,7 天窗口) | 单产物时延中位数(P95) | 幻灯片 17s(26s,约 1.8k 输出 token);交互页 59s(107s,约 9k token) | agent 多轮管线单次编辑 200–600s;同底座直连 API 编辑循环均值 151.7s | 单次生成替代多轮脚手架,端到端快约 3–9 倍且可直接嵌入 live 课堂 |
| 脚手架编辑首次生成(与语料无重叠的外部 500 请求) | 输出 token / 平均时延 / 重建成功率 | 3,411 tok / 24.7s / 98%(内部集 2,999 tok / 16.0s / 94%,oracle 上界 −82.5%) | 从零直出 8,468 tok / 50.9s(内部 12,344 tok / 67.2s) | 外部集 token −59.7%、时延 −52%;内部集 −75.7%;按类型降幅 −37%(游戏)到 −88%(vis3d) |
| 迭代编辑(同底座、同三任务三方对照) | 平均每编辑时延 / token / 成本 | MAIC-UI:6.3s / 17.1k tok / ¥0.37 | Claude Code 34.3s / 233k tok(94% 缓存命中)/ ¥1.03;直连 API 151.7s / 27.4k tok / ¥1.68 | 较直连整文件重生成 23×,较通用 agent 5×(且已计入其全部缓存优势) |
| 国产加速器部署(Ascend 910 A3 对比 A800 生产) | 吞吐 RPM 与应用级一致性(500 例业务数据集) | Ascend 46.1 RPM(并发 64 工作点,峰值 70.4@128),解析 500/500,平均元素数 17.4 = 17.4 | A800 生产拓扑 167.4 RPM(FP8 + 4 步投机解码) | 差距 3.63× 被精确分解为 1.48×(软硬件栈)× 2.45×(投机解码不可用),应用层输出不可区分 |
局限与改进
作者坦承的局限:数据有偏——幻灯片目标偏安全稀疏(均值 14.4 个元素、68.5% 不超过 16 个),规格模型的英文丰富简报与生产简报写手不匹配,导致初期部署迁移受挫;HTML 语料 69.8% 是模拟、2.4% 代码、完全没有 3D 样本。人工评测非严格 A/B(n=24 对 30,提示略异),只能作方向性参考。评测套件与打分器内部维护不公开,外部模型只能通过 API 提交由官方代跑;HTML 复合打分器是 Qwen3.8 家族的 27B VLM,与 Qwen3.8-Max 基线同家族(论文已主动披露)。串行配方 HTML 仍优于混合训练(61.7 对 59.0),学习页/代码等长尾类型为混合买单;one-big-round 只在 4B 验证,27B 留作未来工作。语言混杂(6/24→4/30)与元素堆叠等缺陷当前奖励不定价、因此未被修复。我的补充观察:其一,强绑定私有渲染契约意味着迁移到其他渲染器需要重新后训练,契约既是护城河也是天花板;其二,生产延迟、失败率等核心数字来自内部数据库,无法独立核验;其三,硬失败闸门对“渲染正常但无响应”的页面一律清零,会系统性低估这类页面的静态价值——这是为抑制梯度而自愿付出的已知代价。
独立分析的弱点
独立分析的弱点与改进方向。一、评测封闭性:套件、打分器、题目全部内部维护,社区无法复现主表数字,榜单公信力依赖团队自律;改进方向是发布匿名化或扰动版评测子集、或交由第三方托管,允许批量 API 复核。二、攻击面只是“已发现的那一个”:探针测的是控件响应,而游戏规则正确性、教学有效性的深层质量仍靠 VLM 判断,策略完全可能找到新的未测维度钻空子——伪图表惩罚就是前车之鉴;可让探针自动增殖,用强模型按提示生成针对性探针再人工抽审,形成对抗闭环。三、规则引擎靠五个版本被动打补丁演化,说明手写几何规则天然滞后于策略的钻空子能力;可用渲染器差分测试或形式化布局约束(如用约束求解器保证无重叠布局)替代。四、脚手架编辑收益依赖语料覆盖:相似度 0.85–0.93 但结构迥异的模板被迫接近全量生成(游戏类仅 −37%);可引入结构相似度感知的路由阈值与跨类型模板抽象层。五、模态竞争有结构性代价:HTML RL 必然稀释排版(77.5→74.3),可在 HTML 阶段加排版正则项或对幻灯片输出做约束投影。六、GDN 状态不可截断使前缀缓存与投机解码双双失效,构成 2.45× 的最大差距项;可研究状态可逆门控、或分段检查点加重放的混合调度(重放已比快照省 160 倍暂存,3.8MB 对 604MB)。
未来方向
作者明确提出的方向:在 27B 上验证 one-big-round 多任务 RL(目前仅 4B 验证);开放 harness 生态,欢迎其他 AI+教育团队像 OpenMAIC 一样接入并适配;修复语言混杂与元素堆叠等当前奖励未覆盖的缺陷。基于其成果可自然延伸的工作:一、把交互正确性验证从“控件有响应”升级到“模拟符合它声称的物理/数学规律”,注入解析解对照、量纲检查、守恒量监测等数值探针;二、把 LEG 从单产物扩展到课程与会话级——跨页状态管理、先修关系与难度阶梯的自动编排;三、探针自动合成:为每个新子类型用强模型生成探针脚本、人工抽审后入库,压缩奖励攻击的暴露窗口;四、以开源 4B 为支点研究小模型蒸馏极限与端侧个性化(本地课标对齐、教师风格记忆);五、把 HCD/BSE 推广为所有线性注意力/递归状态模型的算子验收标准,推动硬件与推理引擎生态补齐递归状态语义;六、其评审工程方法论(锚定校准 + 分数分布验收 + Spearman 主指标)可作为通用 RLHF 评审协议在其他领域复用。
复现评估
开源与复现评估。CogEvol-4B 完全开放(Apache 2.0):HuggingFace 提供全精度权重与 Q4_K_M GGUF 端侧构建,GitHub 提供部署指南与 MAIC-UI 编辑 harness,消费级硬件即可跑通推理,推理复现门槛低。CogEvol-27B 不开源,仅通过 MaaS 平台低价 API 服务,外部测试需邮件申请并由官方用同一 harness 代跑——保证了可比性却牺牲了可审计性。主要复现障碍有三:训练数据来自生产流量与 Gemini 3.1 Pro/3.5 Flash teacher 蒸馏,外界不可得;评测套件与打分提示以“防污染”名义内部维护;HTML 打分器本身就是生产 RL 奖励。算力参照:SFT 为单节点 13,421 步(GBS4 或 GBS8),每个 RL 阶段 8–16 张 H800、250 个 rollout 批,奖励计算因渲染与浏览器探针而主导墙钟。综合判断:推理复现容易(4B 开箱即用),微调复现中等(需自建数据管线与探针设施),端到端复现主表结果困难(封闭评测加专有数据);第三方现实的参与方式是 API 提交评测,或基于 4B 做自己的下游研究与改进。
论文图表
展示生产流量中八个单次生成的产物:上排四个交互 HTML 页面(细胞器功能模拟器、运行中的 AC 阻抗电路模拟器、拼写规则实验室、梁反力计算器),下排四张幻灯片(氮循环、$(a+b)^2$ 二项式平方推导、静力平衡支座反力、模型-视图-控制器架构),全部无 agent 脚手架、无人工编辑。
直观定义 LEG 任务的输入输出形态与产出水平,让读者在进入方法前先看到“好的学习产物长什么样”。