找到 68 条结果

通过视觉编码器内部帧合并和解耦空间选择,将视频LLM推理速度提升2.65倍

Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang 2026-05-29
Token压缩 推理加速 时域压缩 视频大语言模型 视频理解

首个面向自回归视频扩散模型的量化框架,用帧敏感度加权与自适应双尺度量化加速推理。

Siao Tang, Xinyin Ma, Gongfan Fang, Xingyi Yang, Xinchao Wang 2026-05-22
PTQ 异常值检测 推理加速 模型量化 自回归扩散模型

通过零专家注入与两阶段自蒸馏把 post-trained MoE 转成 dynamic MoE

Xingtai Lv, Li Sheng, Kaiyan Zhang, Yichen You, Siyan Gao, Xueheng Luo,... 2026-05-19
LLM 效率 MoE 动态专家激活 推理加速 自蒸馏

通过块扩散与自推测解码,把字节级语言模型的推理内存带宽最高砍掉九成。

Julie Kallini, Artidoro Pagnoni, Tomasz Limisiewicz, Gargi Ghosh, Luke... 2026-05-11
字节级语言模型 扩散语言模型 推测解码 推理加速 无分词器

DDTree:从单次块扩散草稿的逐位分布构建最优草稿树,提升投机解码接受长度。

Liran Ringel, Yaniv Romano 2026-04-15
DFlash LLM推理 扩散模型 投机解码 推理加速