仅用3D坐标、免训练地把多视角词元精确剪到目标数量,8%词元保留93.5%性能
Nhat-Tan Bui, Varshini Elangovan, Arun Reddy Anugu, Sreyas Mohan, Wei Ye,...
2026-09-09
免训练方法
多视角3D推理
推理加速
视觉词元剪枝
视觉语言模型
冻结AR权重、外挂LoRA扩散权重并行起草,AR验证实现全批量无损提速
Subham Sekhar Sahoo, Lingjie Chen, Khiem Pham, Jonathan Geuter, Chaitanya...
2026-09-08
LoRA
RL后训练加速
一致性蒸馏
扩散语言模型
投机解码
纯后训练专用模型家族,单次调用生成幻灯片与可交互课件,用可执行探针把交互性变成可测量的奖励信号
Shangqing Tu, Daniel Zhang-Li, Yucheng Wang, Shiyu Gan, Yanpeng Wang,...
2026-09-01
GRPO
后训练
国产算力适配
奖励攻击
奖励设计
响应耦合分区+探针残差重构,22–26%密度下免训练稀疏注意力加速视频生成1.48–2.61倍
Pardis Taghavi, Reza Langari, Gaurav Pandey
2026-08-24
世界模型
免训练方法
推理加速
稀疏注意力
视频生成
用边界感知的LCA掩码让层级字节模型单头并行预测多字节,加速推理且性能基本不掉。
Abraham Toluwase Owodunni, Chibuzor Okocha, Christan Grant, Tomasz...
2026-08-19
多Token预测
字节级语言模型
层级架构
投机解码
推理加速
用LLM在残差式DSL空间中自动搜索视觉token剪枝策略,94.4%剪枝下保留99%以上性能
Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang, Jingwen Fu
2026-08-14
AI4AI
LLM驱动算法设计
多模态大模型
推理加速
视觉Token剪枝
用校准流量驱动的专家合并把推荐MoE压缩为更小的标准MoE,近无损且提速至2.21倍
Lei Xin, Bin Gu, Peize Li, Zitong Wang, Jianbo Zhao, Changjiang Jiang,...
2026-08-12
专家合并
推理加速
推荐系统
模型压缩
混合专家MoE
离线抽取信息金块并切片复用上下文化KV缓存,在100ms尾部延迟预算下兼顾精度与效率
Gyuwan Kim, Cheoneum Park, Tao Yang
2026-08-12
KV缓存复用
RAG
多跳问答
推理加速
缓存增强生成
把 Gemma 4 微调成开源离散扩散模型,单 H100 上约 1500 tokens/s。
DiffusionGemma Team, Adrien Ali Taïga, James Assiene, Daniele Calandriello,...
2026-08-04
开源大模型
强化学习对齐
推理加速
文本扩散
混合专家MoE
免训练的模态解耦Token压缩框架,共享查询但独立估计各模态显著性,实现3.53倍预填充加速
Jinsen Su, Yongdong Luo, Yuexiao Ma, Yibo Hu, Meiguang Jin, Xiaowu Zheng
2026-07-31
Token压缩
全模态大语言模型
推理加速
视频理解
跨模态对齐
将动态路由、稀疏计算与近似校正统一到单次在线softmax中的免训练稀疏注意力
Haopeng Li, Yitong Li, Junsong Chen, Tian Ye, Haozhe Liu, Jincheng Yu,...
2026-07-28
GPU内核优化
扩散Transformer
推理加速
稀疏注意力
视频生成
用层级并行解码范式重构文档解析,吞吐量达4752 TPS。
Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan,...
2026-07-22
vLLM
多token预测
并行解码
推理加速
文档解析
提出端到端可学习的层级稀疏注意力机制,实现超长上下文外推和高效推理
Xiang Hu, Xinyu Wei, Hao Gu, Minshen Zhang, Tian Liang, Huayang Li, Lei Zhu,...
2026-07-08
大语言模型
推理加速
注意力机制优化
稀疏注意力
长上下文建模
通过半自回归生成和硬件感知调度,将LLM推理速度提升60%-85%
Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi...
2026-07-08
大语言模型
并行生成
投机解码
推理加速
系统优化
提出三模式LM,联合AR和扩散训练,实现AR/扩散/自投机三种解码方式,在精度和速度上超越SOTA开源模型
Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich,...
2026-07-08
并行生成
扩散模型
推理加速
自投机解码
语言模型
通过强化学习后训练框架提升VLA模型执行效率,减少物理步数51.4%,加速5.83倍
Xianghui Wang, Feng Chen, Wenbo Zhang, Hua Yan, Zixuan Wang, Changsheng Li,...
2026-06-23
Vision-Language-Action
动作分块
强化学习
推理加速
机器人策略优化
为每个输入预测如何动态跳过/重复预训练层,在更少层数下获得更高准确率
Ziyue Li, Yang Li, Tianyi Zhou
2026-06-15
MCTS
动态深度推理
层路由
推理加速
测试时计算
通过内部模型路由引入轻量级中间验证器,实现分层推测解码,降低拒绝率并提升推理速度
Yuchen Xian, Yang He, Yunqiu Xu, Yi Yang
2026-06-12
KL散度
分层验证
推测解码
推理加速
模型压缩
通过解耦预测投影实现CPU-GPU异步预取,提升稀疏注意力长上下文推理效率
Yaosheng Fu, Guangxuan Xiao, Xin Dong, Song Han, Oreste Villa
2026-06-11
KV缓存卸载
推理加速
注意力优化
长上下文
用神经记忆索引器预测关键 KV 块,将 GPU 内存消耗降至 13.5% 同时保持精度
Yan Wang, Qifan Zhang, Jiachen Yu, Tian Liang, Dongyang Ma, Xiang Hu, Zibo...
2026-06-09
KV cache
内存效率
推理加速
注意力优化
长上下文