提出Draft-OPD,通过错误位置重放机制在验证时错误上训练draft模型,实现5倍以上无损加速
Haodi Lei, Yafy Li, Haoran Zhang, Shunkai Zhang, Qianjia Cheng, Xiaoye Qu,...
2026-06-02
大语言模型
投机解码
推理加速
模型蒸馏
通过视觉编码器内部帧合并和解耦空间选择,将视频LLM推理速度提升2.65倍
Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang
2026-05-29
Token压缩
推理加速
时域压缩
视频大语言模型
视频理解
通过结构感知的块扩散和scaffolding技术,实现SOTA轨迹精度下的12倍推理加速
Kewei Zhang, Jin Wang, Sensen Gao, Chengyue Wu, Yulong Cao, Songyang Han,...
2026-05-28
扩散模型
推理加速
端到端规划
自动驾驶
视觉-语言-动作模型
FP4 注意力中只对 5% 关键块保留 FP16,兼顾速度与质量。
Joe Sharratt
2026-05-26
CUDA 内核
FP4 量化
GPU 优化
推理加速
注意力机制
无需训练,靠KV缓存的视角检索与相似度压缩,让视频世界模型拥有长程一致记忆
Jung Yi, Minjae Kim, Paul Hyunbin Cho, Wooseok Jang, Sangdoo Yun, Seungryong Kim
2026-05-22
KV缓存
世界模型
免训练
推理加速
注意力稀疏性
首个面向自回归视频扩散模型的量化框架,用帧敏感度加权与自适应双尺度量化加速推理。
Siao Tang, Xinyin Ma, Gongfan Fang, Xingyi Yang, Xinchao Wang
2026-05-22
PTQ
异常值检测
推理加速
模型量化
自回归扩散模型
面向om-LLM推理加速的阶段自适应token选择方法SEATS。
Zijie Xin, Jie Yang, Ruixiang Zhao, Tianyi Wang, Fengyun Rao, Jing Lyu, Xirong Li
2026-05-20
Token剪枝
全模态LLM
多模态大模型
推理加速
训练无关
通过零专家注入与两阶段自蒸馏把 post-trained MoE 转成 dynamic MoE
Xingtai Lv, Li Sheng, Kaiyan Zhang, Yichen You, Siyan Gao, Xueheng Luo,...
2026-05-19
LLM 效率
MoE
动态专家激活
推理加速
自蒸馏
通过分头混合压缩 KV 缓存,为自回归视频扩散提速 1.5–2.8 倍
Yicheng Ji, Zhizhou Zhong, Jun Zhang, Qin Yang, XiTai Jin, Ying Qin, Wenhan...
2026-05-15
KV缓存压缩
扩散模型
推理加速
注意力机制
视频生成
BEAM用可学习二值mask在MoE Top-K候选中动态筛除冗余专家
Juntong Wu, Jialiang Cheng, Qishen Yin, Yue Dai, Yuliang Yan, Fuyu Lv, Ou...
2026-05-15
MoE
STE
vLLM
二值掩码
动态路由
DECO通过ReLU路由、可学习专家缩放、NormSiLU激活与非门控MLP专家的组合,在仅激活20%路由专家时匹配密集Transformer性能,并在Jetson AGX Orin上实现2.93倍推理加速。
Chenyang Song, Weilin Zhao, Xu Han, Chaojun Xiao, Yingfa Chen, Zhiyuan Liu
2026-05-12
推理加速
混合专家
激活函数
稀疏激活
端侧部署
通过块扩散与自推测解码,把字节级语言模型的推理内存带宽最高砍掉九成。
Julie Kallini, Artidoro Pagnoni, Tomasz Limisiewicz, Gargi Ghosh, Luke...
2026-05-11
字节级语言模型
扩散语言模型
推测解码
推理加速
无分词器
SPEED 让 prefill 只走前 K 层、decode 全层走,配 BoS 锚点降本。
Jungsuk Oh, Hyeseo Jeon, Hyunjune Ji, Kyongmin Kong, Jay-Yoon Lee
2026-05-11
KV 缓存优化
Transformer 优化
推理加速
长上下文推理
高效推理
MotionCache 以帧差代理运动,token 级缓存将视频生成加速至 7.26×
Jing Xu, Yuexiao Ma, Songwei Liu, Xuzhe Zheng, Shiwei Liu, Chenqian Yan,...
2026-05-05
扩散模型
推理加速
特征缓存
自回归视频生成
运动感知
用图像质量路由实现视频扩散的推测解码,1.59×加速保98%质量
Yuezhou Hu, Jintao Zhang
2026-04-22
奖励路由
推测解码
推理加速
自回归扩散
视频生成
DDTree:从单次块扩散草稿的逐位分布构建最优草稿树,提升投机解码接受长度。
Liran Ringel, Yaniv Romano
2026-04-15
DFlash
LLM推理
扩散模型
投机解码
推理加速
让小模型接管扩散轨迹首尾步骤,中间保留大模型,省 17% 算力几乎不掉质量
Ivan Sedykh, Nikita Sorokin, Valentin Malykh
2026-04-14
扩散语言模型
推理加速
掩码扩散语言模型
模型调度
步骤重要性
用on-policy训练+软嵌入解码让dLLM并行度翻倍且不丢精度。
Zigeng Chen, Gongfan Fang, Xinyin Ma, Ruonan Yu, Xinchao Wang
2026-04-10
On-Policy训练
并行解码
扩散语言模型
推理加速
自修正
用轻量微调让 AR 模型一次生成多 token,无需架构改动即可调节速度与质量。
Ziqi Jin, Lei Wang, Ziwei Luo, Aixin Sun
2026-04-09
KV 缓存
多 token 生成
扩散语言模型
推理加速
模型微调
针对LLM代码修复中的「过度编辑」问题,提出编辑感知奖励与自造数据框架,显著提升修复精度与推理速度。
Changxin Ke, Rui Zhang, Jiaming Guo, Yuanbo Wen, Li Ding, Shuo Wang, Xuyuan...
2026-04-08
代码修复
大语言模型
强化学习
推理加速
程序正确性