找到 121 条结果

用标准化流在LLM中建模连续思维链,保持自回归接口并支持策略梯度优化

Guancheng Tu, Xiangjun Fu, Suhao Yu, Yao Tang, Haoqiang Kang, Lianhui Qin,... 2026-06-05
代码生成 大语言模型 思维链推理 标准化流 潜在表示

9.8B 激活参数的 MoE 大模型,通过 Agent 数据管线+Forge 强化学习系统+自我进化,在编码与办公 Agent 任务上比肩头部闭源模型

MiniMax, Aili Chen, Aonian Li, Baichuan Zhou, Bangwei Gong, Binyang Jiang,... 2026-05-27
Agent MoE Speculative Decoding 代码生成 强化学习

提出变分策略蒸馏(VPD)框架,通过EM算法让教师与学生协同进化,解决RLVR稀疏奖励问题

Yang Li, Erik Nijkamp, Semih Yavuz, Shafiq Joty 2026-05-21
代码生成 变分推断 大语言模型 强化学习 科学推理

用评估技能+六阶段流水线让 Claude 自动为任意 agent 生成可执行的评估代码

Kang Zhou, Sangmin Woo, Haibo Ding, Kiran Ramnath, Subramanian Chidambaram,... 2026-05-14
LLM 评估 代码生成 基准测试 工具使用 智能体评估