FP4 注意力中只对 5% 关键块保留 FP16,兼顾速度与质量。
Joe Sharratt
2026-05-26
CUDA 内核
FP4 量化
GPU 优化
推理加速
注意力机制
提出 SLIM 架构,将通信通路与策略表征解耦,在带宽严格受限下保持高性能的多智能体协作。
Alexi Canesse, Benoît Goupil, Jesse Read, Sonia Vanier
2026-05-26
PPO
去中心化通信
多智能体强化学习
带宽压缩
注意力机制
提出注意力状态记忆,无训练地将长前缀外部化为查找记忆
Yasuyuki Okoshi, Hao Mark Chen, Guanxi Lu, Hongxiang Fan, Masato Motomura,...
2026-05-20
KV缓存
推理优化
注意力分解
注意力机制
长上下文
同一权重暴露两条等价解码路径,让模型在 H100 与 H20 上同时达 roofline 最优。
Fanxu Meng
2026-05-18
KV cache 压缩
Roofline 模型
模型转换
注意力机制
高效推理
通过分头混合压缩 KV 缓存,为自回归视频扩散提速 1.5–2.8 倍
Yicheng Ji, Zhizhou Zhong, Jun Zhang, Qin Yang, XiTai Jin, Ying Qin, Wenhan...
2026-05-15
KV缓存压缩
扩散模型
推理加速
注意力机制
视频生成
用编码器-解码器交叉注意力替代外部检索器,统一检索与生成
Elad Hoffer, Yochai Blau, Edan Kinderman, Ron Banner, Daniel Soudry, Boris Ginsburg
2026-05-14
RAG
多跳问答
检索增强生成
注意力机制
编码器-解码器
块循环压缩记忆统一Transformer与线性RNN架构
Daniel Goldstein, Eugene Cheah
2026-05-12
KV缓存压缩
块循环Transformer
注意力机制
线性循环网络
长上下文建模
DBTrimKV:权重共享保留门+全局预算,动态分配KV缓存
Ngoc Bui, Hieu Trung Nguyen, Arman Cohan, Rex Ying
2026-05-12
KV缓存压缩
模型推理加速
注意力机制
视觉语言模型
长上下文推理
为LVLM设计并行PVM模块,缓解长序列生成中的视觉信号衰减
Siyuan Huang, Xiaoye Qu, Yafu Li, Tong Zhu, Zefeng He, Muxin Fu, Daizong...
2026-05-05
参数高效微调
多模态大模型
多模态推理
幻觉抑制
注意力机制
用 sigmoid 替代 softmax,单细胞基础模型训练更快更稳、表征更优
Vijay Sadashivaiah, Georgios Dasoulas, Judith Mueller, Soumya Ghosh
2026-05-04
GPU 内核优化
单细胞基础模型
注意力机制
生物信息学
训练稳定性
针对反演无关视频编辑中编辑信号的不稳定问题,提出训练免费的 SAR 与 AMM 双锚定机制。
Ze Chen, Lan Chen, Yuanhang Li, Qi Mao
2026-04-27
Rectified Flow
扩散模型
无训练方法
注意力机制
视频编辑
将注意力机制嵌入循环反馈通路,构造多跳路由的Sessa解码器,理论上获得ℓ^-β的多项式记忆衰减与灵活选择性检索能力。
Liubomyr Horbatko
2026-04-27
序列建模
架构设计
注意力机制
状态空间模型
理论分析
首篇系统综述 AS 在 Transformer 各家族中的机制、用法与抑制方法
Zunhai Su, Hengyuan Zhang, Wei Wu, Yifan Zhang, Yaxiu Liu, He Xiao, Qingyao...
2026-04-14
Attention Sink
Transformer 可解释性
注意力机制
激活异常值
量化部署
提出推理时插拔式方法,通过交叉注意力路由实现多事件视频的精确时间控制,无需训练或架构修改
Gordon Chen, Ziqi Huang, Ziwei Liu
2026-04-14
多事件合成
扩散模型
时间控制
注意力机制
视频生成
对 AIME 题目施加 13 种纯结构扰动,证实开权重推理模型平均准确率掉 54%。
Pavel Golikov, Evgenii Opryshko, Gennady Pekhimenko, Mark C. Jeffrey
2026-04-13
对抗鲁棒性
开权重 vs 闭源对比
数学推理评测
注意力机制
结构扰动
NUMINA 是一个无需训练的文本到视频框架,通过挑选可分实例的注意力头构造可数布局,引导再生过程,使视频中的物体数量与提示数字精确对齐。
Zhengyang Sun, Yu Chen, Xin Zhou, Xiaofan Li, Xiwu Chen, Dingkang Liang, Xiang Bai
2026-04-10
免训练方法
扩散模型
文本到视频生成
注意力机制
计数对齐
首项AVLLMs机械可解释性研究,揭示视觉主导的模态偏向机制
Ramaneswaran Selvakumar, Kaousheik Jayakumar, S Sakshi, Sreyan Ghosh, Ruohan...
2026-04-07
因果中介分析
多模态大语言模型
机械可解释性
模态偏见
注意力机制
提出统一推荐系统三大主流架构的缩放框架UniMixer,提升参数和计算效率。
Mingming Ha, Guanchen Wang, Linxun Chen, Xuan Rao, Yuexin Shi, Tianbao Ma,...
2026-04-02
TokenMixer
推荐系统
注意力机制
深度学习架构
缩放定律
通过分层索引加速稀疏注意力的token选择,实现3.75倍内核加速
Yufei Xu, Fanxu Meng, Fan Jiang, Yuxuan Wang, Ruijie Zhou, Jiexi Wu, Zhixin...
2026-03-31
LLM系统优化
推理加速
注意力机制
稀疏注意力
长上下文
系统综述视频生成模型作为世界模拟器时的效率优化技术,涵盖建模范式、架构设计和推理算法三个维度。
Muyang He, Hanzhong Guo, Junxiong Lin, Yizhou Yu
2026-03-31
世界模型
扩散模型
效率优化
注意力机制
自回归模型