找到 76 条结果

把模态平衡本身作为在线自蒸馏的特权信息,用正负双教师提升多模态推理

Aniri, Jinhe Bi, Peng Liao, Zengjie Jin, Volker Tresp, Fei Shen, Yunpu Ma,... 2026-08-06
MLLM 后训练 在线自蒸馏 多模态大模型 模态平衡

用教师与基础模型的概率差作为蒸馏奖励,大幅提升推理蒸馏效果。

Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han 2026-07-20
后训练 在线策略蒸馏 大语言模型推理 奖励设计 强化学习替代

Direct-OPD:用小模型RL的策略位移当隐式奖励,低成本提升更强的学生模型

Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng... 2026-07-14
后训练 弱到强泛化 强化学习RLVR 知识蒸馏 策略蒸馏

研究后训练阶段对生物推理模型泛化的不同影响

Lukas Fesser, Hanlin Zhang, Michelle M. Li, Eric Wang, Bryan Perozzi,... 2026-06-26
后训练 多模态学习 强化学习 泛化能力 生物推理

单代理模型梯度联合优化数据混合比例与模型参数,搜索成本降低550倍

Haoru Tan, Sitong Wu, Yanfeng Chen, Jun Xia, Ruobing Xie, Bin Xia, Xingwu... 2026-06-23
双层优化 后训练 数据混合优化 梯度下降 预训练

首个面向知识与推理密集型视频理解的大规模训练语料库,通过技能导向的QA生成框架和严格质量控制,显著提升模型在知识密集型视频推理任务上的表现

Lin Fu, Zheyuan Yang, Yang Wang, Tingyu Song, Arman Cohan, Yilun Zhao 2026-06-05
后训练 多模态学习 数据集构建 知识密集推理 视频理解