找到 114 条结果

保留少数垂直线token和局部窗口为全精度,其余低比特量化,实现近无损长上下文推理加速

Jiatong Ding, Bingxin Xing, Yu Zhang, Dian Ding, Xiaodong Yi, Xianbin... 2026-09-11
KV缓存压缩 LLM推理加速 模型量化 注意力机制 混合精度

利用全局查询的聚类几何结构,用信标查询预判思维回看,保留关键KV缓存并实现5.8倍显存压缩

Janghyeon Kim, Minsoo Kim, Kyuhong Shim, Jungwook Choi 2026-09-09
Farthest Point Sampling KV缓存压缩 大型推理模型 无训练方法 注意力机制

零训练的带槽滑窗注意力在短长上下文任务上追平甚至碾压昂贵的后训练线性注意力

Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais 2026-08-31
KV缓存 LLM推理效率 注意力机制 滑窗注意力 线性注意力

Chat模板token是DiT的隐式语义寄存器:语义走S→I→R间接回路,据此剪枝省20%注意力算力

Maohua Li, Qirui Li, Yanke Zhou, Yiduo Li, Zhaosheng Chi, Chao Xu, Cuifeng... 2026-07-22
可解释性 扩散模型 文本到图像生成 模型加速 注意力机制

让LLM自主选择训练片段提升长上下文推理性能

Xinyu Zhu, Zhe Xu, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Kaushik... 2026-07-13
参数高效微调 注意力机制 测试时训练 自适应推理 长上下文

系统刻画MLLM生成时逐token注意力动态,并用注意力阻断与增强干预验证因果并提升性能

Varun Gupta, Vineet Gandhi, Makarand Tapaswi 2026-07-08
多模态大模型 机制可解释性 注意力干预 注意力机制 自回归生成

系统表征多探针网格算法的N和d扩展性,发现在高维场景下相比图、树、划分方法具有独特优势

Matthew J Liu, Wei Hang Zheng, Vidhan Purohit, Siqi Xie, Chieh-En Li, Jerry... 2026-07-03
扩展律分析 注意力机制 网格索引 近似最近邻搜索 高维数据