把模态平衡本身作为在线自蒸馏的特权信息,用正负双教师提升多模态推理
Aniri, Jinhe Bi, Peng Liao, Zengjie Jin, Volker Tresp, Fei Shen, Yunpu Ma,...
2026-08-06
MLLM
后训练
在线自蒸馏
多模态大模型
模态平衡
用信息匹配的锚点修复在线自蒸馏中师生信息不对称导致的特权幻觉。
Jianyu Wu, Yizhou Wang, Encheng Su, Chen Tang, Shixiang Tang
2026-08-04
信息不对称
后训练
大语言模型
推理模型
特权幻觉
揭示 LLM 系统性回避删除代码的偏差,构建 CanItDelete 基准并证明训练可缓解。
Amir M. Ebrahimi, Mohammed Mehedi Hasan, Aaditya Bhatia, Gopi Krishnan...
2026-08-04
LLM 智能体
代码编辑
后训练
基准测试
程序修复
三阶段后训练流水线把企业问答可接受率从52.76%提升到91.51%。
Xiaofeng Shi, Xiaosong Qiu, Wenxin Ma, Qian Kou, Yiming Pan, Longbin Yu,...
2026-08-04
GRPO强化学习
企业知识问答
后训练
残差数据选择
闭卷问答
把 LLM 裁判升级为教练,用可迁移经验知识替代标量奖励训练模型。
Tianzhu Ye, Li Dong, Guanheng Chen, He Zhu, Xun Wu, Shaohan Huang, Furu Wei
2026-07-21
后训练
大语言模型
强化学习
指令遵循
知识蒸馏
将VLA后训练重构为多租户服务,解耦训练/推理/环境并组批调度,GPU时间降28%
Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei...
2026-07-21
GPU调度
VLA模型
后训练
多租户服务
强化学习
把后训练重构为token级正确性二元分类,提升分布外事实忠实度
Zitong Huang, Gustavo Lucas Carvalho, Deqing Fu, Robin Jia
2026-07-21
LoRA
事实性
后训练
机制可解释性
条件转向
用教师与基础模型的概率差作为蒸馏奖励,大幅提升推理蒸馏效果。
Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han
2026-07-20
后训练
在线策略蒸馏
大语言模型推理
奖励设计
强化学习替代
Direct-OPD:用小模型RL的策略位移当隐式奖励,低成本提升更强的学生模型
Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng...
2026-07-14
后训练
弱到强泛化
强化学习RLVR
知识蒸馏
策略蒸馏
PUST用轻量代理模型探索更新信号再迁移到更强主模型,实现弱到强、可复用的后训练。
Daocheng Fu, Rong Wu, Yu Yang, Xuemeng Yang, Jianbiao Mei, Licheng Wen,...
2026-07-14
后训练
弱到强迁移
强化学习对齐
模块化训练
策略蒸馏
通过训练专用ACI实现语言模型的自主端到端后训练
Zhaojian Yu, Penghao Yin, Shuzheng Gao, Shilin He, Kai Cai, Xiao-Ping Zhang
2026-07-02
Agent-Computer Interface
后训练
自主训练
自动化机器学习
语言模型
研究后训练阶段对生物推理模型泛化的不同影响
Lukas Fesser, Hanlin Zhang, Michelle M. Li, Eric Wang, Bryan Perozzi,...
2026-06-26
后训练
多模态学习
强化学习
泛化能力
生物推理
单代理模型梯度联合优化数据混合比例与模型参数,搜索成本降低550倍
Haoru Tan, Sitong Wu, Yanfeng Chen, Jun Xia, Ruobing Xie, Bin Xia, Xingwu...
2026-06-23
双层优化
后训练
数据混合优化
梯度下降
预训练
通过对比性上下文选择任务增强LLM的上下文 grounding 能力
Peiyang Xu, Bangzheng Li, Sijia Liu, Karthik R. Narasimhan, Pramod...
2026-06-19
Agent系统
上下文学习
后训练
多模态推理
强化学习
3B小模型经Spectrum-to-Signal后训练在可验证任务上达到千亿级旗舰性能
Sen Xu, Shixi Liu, Wei Wang, Jixin Min, Yingwei Dai, Zhibin Yin, Yirong...
2026-06-16
MGPO
Spectrum-to-Signal
可验证推理
后训练
小语言模型
首个面向知识与推理密集型视频理解的大规模训练语料库,通过技能导向的QA生成框架和严格质量控制,显著提升模型在知识密集型视频推理任务上的表现
Lin Fu, Zheyuan Yang, Yang Wang, Tingyu Song, Arman Cohan, Yilun Zhao
2026-06-05
后训练
多模态学习
数据集构建
知识密集推理
视频理解
以欠优化区域挖掘与CPT-SFT-RL渐进训练把0.9B文档解析模型推至新SOTA。
Zelun Zhang, Hongen Liu, Suyin Liang, Yubo Zhang, Yiqing Xiang, Jiaxuan Liu,...
2026-06-03
GRPO
OCR
PaddleOCR
后训练
强化学习
通过协同进化策略与解码器解决离散AR T2I模型中的潜在协变量偏移问题
Siyong Jian, Siyuan Li, Luyuan Zhang, Zedong Wang, Xin Jin, Ying Li, Cheng...
2026-05-25
VQ-VAE
后训练
强化学习
文本到图像生成
自回归模型
把视觉感知、文本推理、视觉推理拆成三个独立阶段做后训练,VLM 的视觉推理准确率涨、推理链还变短了。
Juncheng Wu, Hardy Chen, Haoqin Tu, Xianfeng Tang, Freda Shi, Hui Liu,...
2026-05-25
GRPO
后训练
强化学习
视觉感知
视觉语言模型
双重潜在对齐框架,解决统一多模态模型理解与生成不一致问题。
Yinyi Luo, Wenwen Wang, Hayes Bai, Marios Savvides, Jindong Wang
2026-05-25
一致性优化
偏好优化
后训练
潜在空间对齐
统一多模态模型