找到 114 条结果

为ViT添加可学习高斯核偏置注意力,显著提升分割性能且不损害分类精度

Sina Hajimiri, Farzad Beizaee, Fereshteh Shakeri, Christian Desrosiers,... 2026-03-06
基础模型适配 密集预测 注意力机制 视觉Transformer 语义分割

首个评估多模态生成模型流体智能的基准,揭示当前模型存在严重的执行差距

Ruichuan An, Sihan Yang, Ziyu Guo, Wei Dai, Zijun Shen, Haodong Li, Renrui... 2026-02-12
多模态生成 注意力机制 流体智能 统一多模态模型 评估基准

通过双频带分解和能量校准恢复RoPE下均值池化损失的高频位置信息,实现高效块稀疏注意力

Xinghao Wang, Pengyu Wang, Xiaoran Liu, Fangxu Liu, Jason Chu, Kai Song, Xipeng Qiu 2026-02-11
RoPE 模型加速 注意力机制 稀疏注意力 长上下文

揭示指令令牌作为模态仲裁结构锚点,浅层缓冲深层仲裁的稀疏头机制

Yu Zhang, Mufan Xu, Xuefeng Bai, Kehai chen, Pengfei Zhang, Yang Xiang, Min Zhang 2026-02-04
可解释性 因果分析 多模态大语言模型 模态遵循 注意力机制

缩放图像分隔符令牌隐藏状态,无需训练即可抑制跨图像信息泄漏

Minyoung Lee, Yeji Park, Dongjun Hwang, Yejin Kim, Seong Joon Oh, Junsuk Choe 2026-02-03
多图像理解 多模态大模型 推理优化 注意力机制 训练无关方法

用LLM式编码器实现视觉token的因果重排序,突破文档OCR的语义理解瓶颈

Haoran Wei, Yaofeng Sun, Yukun Li 2026-01-29
OCR 因果推理 文档解析 注意力机制 视觉语言模型