提出受人类睡眠启发的范式,让LLM通过知识蒸馏与做梦实现持续学习与自我改进。
Ali Behrouz, Farnoosh Hashemi, Vahab Mirrokni
2026-06-03
大语言模型
持续学习
知识蒸馏
自我改进
记忆巩固
用 chunk 级语义验证替代 teacher logits,实现黑盒模型蒸馏并超越白盒 OPD
Yuhang Zhou, Lizhu Zhang, Yifan Wu, Mingyi Wang, Peng Bo, Jiayi Liu,...
2026-06-03
On-Policy Distillation
推理模型
数学推理
知识蒸馏
蒙特卡洛估计
解耦LLM编排器与短窗DiT,实现实时流式角色音视频生成
Linrui Tian, Qi Wang, Bang Zhang
2026-06-02
LLM编排
扩散变压器
流式音视频生成
知识蒸馏
角色动画
重构分词器+均值映射+离线蒸馏,高效把多语言教师适配到土耳其语
M. Ali Bayram, Banu Diri, Savaş Yıldırım
2026-06-02
分词器适配
句子嵌入
土耳其语NLP
模型压缩
知识蒸馏
将人类专家的痕迹(文档、聊天、决策)自动蒸馏为可检查、可修正的AI技能包
Tianyi Zhou, Dongrui Liu, Leitao Yuan, Jing Shao, Xia Hu
2026-06-01
AI代理
人机协作
可解释AI
技能生成
知识蒸馏
通过KL信任区域引导早期rollout行为,提升策略蒸馏效果
Daniil Plyusov, Alexey Gorbatovski, Alexey Malakhov, Nikita Balagansky,...
2026-06-01
大语言模型
数学推理
知识蒸馏
策略学习
提出token可教性概念,在线策略蒸馏中仅用5%监督token即可超越全量监督
Yuanyi Wang, Su Lu, Yanggan Gu, Pengkai Wang, Yifan Yang, Zhaoyi Yan,...
2026-06-01
在线策略学习
大语言模型
知识蒸馏
选择性蒸馏
通过两阶段知识蒸馏,将字幕条件的帧相关性蒸馏到轻量级视觉模型,实现无需文本的高效视频关键帧选择
Killian Steunou, Anas Filali Razzouki, Khalil Guetari, Mounîm A. El-Yacoubi,...
2026-06-01
帧选择
排序学习
知识蒸馏
视频字幕生成
视频理解
全栈框架将视频基础模型转为实时相机可控世界模型
Min Zhao, Hongzhou Zhu, Bokai Yan, Zihan Zhou, Yimin Chen, Wenqiang Sun,...
2026-05-29
世界模型
实时推理
扩散模型
相机控制
知识蒸馏
限制蒸馏 rollout 到前 N 个 token,解决 OPD 的离策略教师衰减问题
Zhou Ziheng, Jiaqi Li, Huacong Tang, Ying Nian Wu, Demetri Terzopoulos
2026-05-28
在线策略蒸馏
大语言模型
模型压缩
知识蒸馏
用Bradley-Terry判别器+前向流匹配,把黑盒视频教师蒸馏进自回归学生。
Yang Luo, Shengju Qian, Xiaohang Tang, Zirui Zhu, Yong Liu, Xin Wang, Yang You
2026-05-26
对抗学习
流匹配
知识蒸馏
自回归模型
视频生成
将加速 MRI 重建重构为离散潜在空间中的下一加速尺度预测,显著提升极端欠采样下的感知质量
Yilmaz Korkmaz, Vishal M. Patel
2026-05-25
MRI重建
VQ-VAE
医学影像
知识蒸馏
视觉自回归模型
提出工具编排视觉经验蒸馏,让图像生成智能体自我进化。
Sixiang Chen, Zhaohu Xing, Tian Ye, Xinyu Geng, Yunlong Lin, Jianyu Lai,...
2026-05-22
GRPO
图像生成智能体
多模态大模型
工具调用
强化学习
把时空压缩内化到87M视觉编码器中,蒸馏让LLM用8倍帧数仍快35%
Jihwan Kim, Nikhil Parthasarathy, Danfeng Qin, Junhwa Hur, Deqing Sun,...
2026-05-19
InternVL3
Video LLM
时空压缩
知识蒸馏
长视频理解
解耦可迁移动作与具身外观的跨具身视频生成,仅用未配对视频即可适配新机器人。
Yiren Song, Xiyao Deng, Pei Yang, Yihan Wang, Mike Zheng Shou
2026-05-18
DiT
LoRA 适配
扩散模型
机器人数据合成
知识蒸馏
提出「稀疏奖励给大教师、稠密信号传小部署模型」的分配原则,四阶段流程在 MATH 提升 3.4 点
Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard
2026-05-13
GRPO
后训练
奖励密度
强化学习
推理模型
剖析OPD/OPSD成败,提出三类失败机制与对应稳定化修复。
Siqi Zhu, Xuyan Ye, Hongyu Lu, Weiye Shi, Ge Liu
2026-05-13
在策略蒸馏
大语言模型后训练
强化学习
知识蒸馏
自蒸馏
用门控潜变量把循环Transformer的KV缓存压成常量,解耦推理深度与显存
Victor Conchello Vendrell, Arnau Padres Masdemont, Niccolò Grillo, Jordi...
2026-05-12
KV缓存压缩
循环Transformer
模型架构
潜在推理
知识蒸馏
在预训练尺度系统研究 MoE 压缩,提出部分保留专家合并、MTP 蒸馏与渐进剪枝
Shengkun Tang, Zekun Wang, Bo Zheng, Liangyu Wang, Rui Men, Siqi Zhang,...
2026-05-12
MoE 压缩
Qwen3
多 token 预测
模型预训练
知识蒸馏
免训练token级诊断框架量化每个蒸馏信号与理想梯度的对齐程度
Mohammadreza Armandpour, Fatih Ilhan, David Harrison, Ajay Jaiswal, Duc N. M...
2026-05-12
在线策略蒸馏
推理模型
梯度对齐
知识蒸馏
训练自由诊断