为ViT添加可学习高斯核偏置注意力,显著提升分割性能且不损害分类精度
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用 erank 分析图像复杂度,自适应切换注意力/多样性剪枝策略。
混合线性与softmax注意力,兼顾长序列推荐的效率与精度
提出稀疏拓扑注意力和33K多尺度QA数据集,专攻肝癌WSI诊断
UPipe在注意力头级别分块处理,显著降低激活内存,支持更长上下文训练
可学习路由+QAT优化稀疏线性注意力,97%稀疏下18.6倍加速
提出ViewRope几何感知位置编码,解决视频世界模型在相机循环闭合时的空间不一致问题
GENIUS:生成式流体智能评估套件
👍 55首个评估多模态生成模型流体智能的基准,揭示当前模型存在严重的执行差距
Prism:频谱感知的块稀疏注意力机制
👍 38通过双频带分解和能量校准恢复RoPE下均值池化损失的高频位置信息,实现高效块稀疏注意力
将LLM自发重复问题的现象从缺陷重新定义为认知锚点,通过概率框架和注意力分析证明其提升推理准确性。
将注意力分布视为策略,用RL优化注意力分配以提升多模态LLM视觉推理能力
通过动态token级稀疏化,在128K上下文下实现3.23倍注意力加速,精度损失小于1%
揭示指令令牌作为模态仲裁结构锚点,浅层缓冲深层仲裁的稀疏头机制
通过时序KV压缩和ANN稀疏注意力实现5-10倍加速的自回归视频生成
通过分隔符令牌缩放增强多图像理解
👍 5缩放图像分隔符令牌隐藏状态,无需训练即可抑制跨图像信息泄漏
提出 TAPPA 框架,从时序连续性角度统一解释 LLM 中多样化的注意力模式。
Softmax1替换标准注意力,token减少70%、准确率提升27%
DeepSeek-OCR 2:视觉因果流
👍 73用LLM式编码器实现视觉token的因果重排序,突破文档OCR的语义理解瓶颈
提出基于局部注意力机制的特征上采样方法,在保持语义一致性的同时实现线性时间复杂度
将整个 Transformer 重写为高阶注意力张量,统一编码所有子组件用于模型理解