在统一隐空间交错文本推理与音视频潜状态,突破CoT文本瓶颈
Yifan Dai, Zhenhua Wu, Bohan Zeng, Daili Hua, Jialing Liu, Bozhou Li, Yuran...
2026-05-22
全模态
后训练
多模态推理
思维链
隐空间推理
用 9 类任务、9 种奖励的 23K RLVR 数据集和 TMN-Reweight 多任务优化算法,让 30B 模型长上下文能力逼近 R1-0528。
Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen,...
2026-05-20
GRPO
RLVR
后训练
多任务学习
强化学习
把30B-A3B训成IMO/IPhO金牌级推理器:反向困惑度SFT+两级RL+TTS精炼。
Yafu Li, Runzhe Zhan, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Zhilin Wang,...
2026-05-15
MoE
后训练
奥赛推理
强化学习
测试时扩展
OmniClean 去偏评测加 OmniBoost 三阶段后训练,3B 模型可比肩 30B
Che Liu, Lichao Ma, Xiangyu Tony Zhang, Yuxin Zhang, Haoyang Zhang, Xuerui...
2026-05-15
RLVR
全模态语言模型
后训练
自蒸馏
视觉去偏评测
提出「稀疏奖励给大教师、稠密信号传小部署模型」的分配原则,四阶段流程在 MATH 提升 3.4 点
Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard
2026-05-13
GRPO
后训练
奖励密度
强化学习
推理模型
解耦评分标准 RL 中验证器错误与评分标准设计缺陷两类奖励黑客,给出无需外部评审的自内化差距早停信号。
Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang, Anisha Gunjal, Bing Liu,...
2026-05-13
LLM 评审
医疗 AI
后训练
奖励黑客
强化学习
UNO:在统一多模态模型中用理解任务反向监督生成表征
Zeyu Liu, Zanlin Ni, Yang Yue, Cheng Da, Huan Yang, Di Zhang, Kun Gai, Gao Huang
2026-05-11
后训练
图像生成
图像编辑
理解-生成协同
统一多模态模型
三阶段管线,用黑盒对抗式在线策略蒸馏修复 SFT 分布漂移
Sudong Wang, Weiquan Huang, Xiaomin Yu, Zuhao Yang, Hehai Lin, Keming Wu,...
2026-05-06
Mixture-of-Experts
分布对齐
后训练
在线策略蒸馏
多模态推理
并行训练多领域专家并在训练中持续互蒸馏,保持行为一致性以提升能力整合效率。
Naibin Gu, Chenxu Yang, Qingyi Si, Chuanyu Qin, Dingyu Yao, Peng Fu, Zheng...
2026-05-01
后训练
多模态推理
强化学习
策略蒸馏
能力整合
将Fréchet距离直接作为生成器训练损失,只需解耦估计与梯度规模。
Jiawei Yang, Zhengyang Geng, Xuan Ju, Yonglong Tian, Yue Wang
2026-05-01
Fréchet距离
一步生成
后训练
图像生成
扩散模型
四阶段流水线(SFT+GRPO+提示增强+自回归蒸馏)弥合视频扩散模型预训练与部署差距。
Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li,...
2026-04-29
GRPO
RLHF
后训练
扩散模型
自回归蒸馏
通过模态感知自适应混合 SFT+RL 后训练,约束偏好优化于文本通道并锚定语音通道,缓解口语对话模型中 IQ/EQ 难以同步提升的矛盾。
Yifu Chen, Shengpeng Ji, Qian Chen, Tianle Liang, Yangzhuo Li, Ziqing Wang,...
2026-04-23
偏好优化
口语对话模型
后训练
多模态生成
强化学习
让模型自己当老师,把稀疏二元奖励转成稠密 token 级自监督。
Yinghui He, Simran Kaur, Adithya Bhaskar, Yongjin Yang, Jiarui Liu,...
2026-04-16
LLM
后训练
强化学习
推理增强
自蒸馏
在导数空间用对抗目标训练连续流模型,仅10个epoch后训练即大幅降低FID
Shanchuan Lin, Ceyuan Yang, Zhijie Lin, Hao Chen, Haoqi Fan
2026-04-14
后训练
图像生成
对抗训练
扩散模型
概率流ODE
首个 UMM 统一代码库,标准化 15 个模型的评估与后训练,揭示架构统一≠表征统一。
Yinyi Luo, Wenwen Wang, Hayes Bai, Hongyu Zhu, Hao Chen, Pan He, Marios...
2026-04-14
后训练
基准测试
多模态大模型
架构-表征解耦
统一评估
通过筛选高方差轮次和功能等价奖励,将SFT轨迹转化为高效RL训练,实现4倍计算节省同时保持OOD泛化
Junkeun Yi, Damon Mosk-Aoyama, Baihe Huang, Ritu Gala, Charles Wang, Sugam...
2026-03-24
GRPO
后训练
大语言模型
工具调用
强化学习
将经典RL的马尔可夫状态引入LLM后训练,突破能力天花板,实现指数级样本效率提升
Yurun Yuan, Tengyang Xie
2026-03-23
后训练
大语言模型
强化学习
推理能力
马尔可夫决策过程
30B MoE模型通过级联RL+在线蒸馏,在IMO/IOI/ICPC三大竞赛获金牌
Zhuolin Yang, Zihan Liu, Yang Chen, Wenliang Dai, Boxin Wang, Sheng-Chieh...
2026-03-20
MoE
后训练
强化学习
推理
数学证明
系统比较SFT和RL在LLM后训练中的作用、差异与融合方法
Haitao Jiang, Wenbo Zhang, Jiarui Yao, Hengrui Cai, Sheng Wang, Rui Song
2026-03-17
LLM对齐
后训练
强化学习
混合训练
监督微调
通过最小化编辑的数据修正和奖励二分类损失实现高效推理注入且避免灾难性遗忘
Wenye Lin, Kai Han
2026-03-04
后训练
大语言模型
推理优化
灾难性遗忘
知识蒸馏