限制蒸馏 rollout 到前 N 个 token,解决 OPD 的离策略教师衰减问题
Zhou Ziheng, Jiaqi Li, Huacong Tang, Ying Nian Wu, Demetri Terzopoulos
2026-05-28
在线策略蒸馏
大语言模型
模型压缩
知识蒸馏
首个面向移动端的十亿参数级MoE模型,建立端侧LLM新帕累托前沿
Yanbei Chen, Hanxian Huang, Ernie Chang, Jacob Szwejbka, Digant Desai,...
2026-05-27
Scaling Law
模型压缩
混合专家网络
移动AI
端侧部署
首个跨架构扩散LLM蒸馏框架,统一解决时序/上下文/词表三重鸿沟。
Gongbo Zhang, Wen Wang, Ye Tian, Li Yuan
2026-04-30
块扩散解码
扩散语言模型
模型压缩
知识蒸馏
跨架构学习
用 RL options 框架训练 MoE 控制器,把切换率从 50%+ 压到 5% 以下。
Zeyu Shen, Peter Henderson
2026-04-24
LLM推理优化
Mixture-of-Experts
Options Framework
强化学习
模型压缩
统一文本概率空间的多模态蒸馏框架,含视觉切换与动态双向 logits 差异损失。
Haoyi Sun, Xiaoxiao Wang, Ning Mao, Qian Wang, Lifu Mu, Wen Zheng, Tao Wei, Wei Chen
2026-04-17
多模态学习
模型压缩
知识蒸馏
视觉-语言模型
剪枝在非生成任务有效但生成任务失效,softmax非线性放大是关键
Shwai He, Guoheng Sun, Haichao Zhang, Yun Fu, Ang Li
2026-04-08
模型压缩
生成任务
网络剪枝
表示学习
语言模型
将对话历史音频压缩为固定latent tokens,降低成本同时保留ASR增益
Shashi Kumar, Esaú Villatoro-Tello, Sergio Burdisso, Kadri Hacioglu,...
2026-04-01
上下文感知
多模态大模型
对话系统
模型压缩
语音识别
0.39B参数统一扩散模型,在手机端实现<1秒图文生成与编辑
Kailai Feng, Yuxiang Wei, Bo Chen, Yang Pan, Hu Ye, Songwei Liu, Chenqian...
2026-03-31
图像生成
图像编辑
扩散模型
模型压缩
移动端部署
用强化学习学习可迁移的逐层位宽分配策略,实现比统一4位量化更优的精度-效率权衡
Arpit Singh Gautam, Saurabh Jha
2026-03-19
强化学习
模型压缩
混合精度
端侧部署
量化
用 mLSTM-SWA 混合架构蒸馏 Transformer,通过专家合并实现近乎无损的性能迁移
Lukas Hauzenberger, Niklas Schmidinger, Thomas Schmied, Anamaria-Roberta...
2026-03-17
xLSTM
模型压缩
知识蒸馏
线性注意力
高效推理
通过知识蒸馏将2B VLM压缩到69M文本编码器,实现高效视觉文档检索
Zhuchenyang Liu, Yao Zhang, Yu Xiao
2026-03-16
多模态检索
模型压缩
知识蒸馏
视觉文档检索
跨模态对齐
首个在手机端实现实时渲染的3D高斯泼溅方法,融合无排序渲染、SH蒸馏、神经矢量量化与贡献剪枝。
Xiaobiao Du, Yida Wang, Kun Zhan, Xin Yu
2026-03-13
3D Gaussian Splatting
ICLR 2026
实时渲染
新视角合成
模型压缩
首次系统对比 AR 与扩散 LLM 的层间表征结构,发现扩散目标函数带来可被利用的早层冗余。
Raghavv Goel, Risheek Garrepalli, Sudhanshu Agrawal, Chris Lott, Mingu Lee,...
2026-03-10
Layer Skipping
扩散语言模型
推理加速
模型压缩
表征分析
通过锚点式集群丢弃和球谐系数截断解决稀疏视角3DGS过拟合问题
Shuangkang Fang, I-Chao Shen, Xuanyang Zhang, Zesheng Wang, Yufeng Wang,...
2026-02-26
3D Gaussian Splatting
新视角合成
模型压缩
正则化
稀疏视角重建
首个VLA模型训练后量化框架,通过选择性量化和轻量校准实现70%内存节省且超越全精度性能
Jingxuan Zhang, Yunta Hsieh, Zhongwei Wang, Haokun Lin, Xin Wang, Ziqi Wang,...
2026-02-25
具身智能
后训练量化
扩散变换器
模型压缩
视觉-语言-动作模型
首个可在手机上实时运行的统一多模态理解与生成模型,仅1.6B参数
Abdelrahman Shaker, Ahmed Heakl, Jaseel Muhammad, Ritesh Thawkar, Omkar...
2026-02-24
图像生成
多模态模型
模型压缩
视觉理解
边缘部署
针对扩散语言模型中注意力汇聚不稳定的特点,提出感知汇聚的剪枝方法
Aidar Myrzakhan, Tianyi Li, Bowei Guo, Shengkun Tang, Zhiqiang Shen
2026-02-23
后训练剪枝
扩散语言模型
推理加速
模型压缩
注意力汇聚
利用正交字典学习和闭式Procrustes更新实现训练后Transformer压缩
Denis Makhov, Dmitriy Shopkhoev, Magauiya Zhussip, Ammar Ali, Baher...
2026-02-18
低秩分解
后训练压缩
大语言模型
字典学习
模型压缩
通过比特平面构造可变量化网格,突破固定网格在2-bit极限压缩下的精度瓶颈
Junyu Chen, Jungang Li, Jing Xiong, Wenjie Wang, Qingyao Yang, He Xiao, Zhen...
2026-02-16
LLM推理优化
后训练量化
模型压缩
模型量化
免训练的 LLM 压缩框架,通过单步稀疏字典分解和全局背包优化实现 SOTA 压缩效果
Ammar Ali, Baher Mohammad, Denis Makhov, Dmitriy Shopkhoev, Magauiya...
2026-02-12
LLM
低秩分解
后训练优化
字典学习
模型压缩