通过跨层复用索引,移除75%计算,实现1.82倍加速
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出OAKS基准,评估LLM在流式动态知识更新下的在线适应能力
差分子空间分解与双通道软加权注意力,实现精准提示词高亮
通过块级近似和动态阈值实现长上下文预填充加速
用于提示词高亮的谱注意力引导方法
👍 7通过预注意力计算编辑 key 实现高效的提示词高亮
首个将稀疏与线性注意力混合的9B参数模型,支持1M tokens上下文,推理速度提升3.5倍
让模型自主管理上下文,从被动预测器转变为状态感知智能体
Prism:频谱感知的块稀疏注意力机制
👍 38通过双频带分解和能量校准恢复RoPE下均值池化损失的高频位置信息,实现高效块稀疏注意力
提出可控扩展环境状态的基准测试,揭示语言代理在长上下文下的性能退化与失败模式
通过软裁剪RoPE低频组件,CoPE在长上下文场景中显著提升LLM性能
利用相邻步骤置信度相关性预测解码位置,实现无训练的29倍长上下文推理加速
FASA:基于频率感知的稀疏注意力机制
👍 154利用 RoPE 频率块的功能稀疏性,训练无关地动态预测 token 重要性以压缩 KV 缓存
用全注意力层当Oracle指导稀疏层选token并共享KV缓存,降低计算和内存开销
基于横向思维谜题的环境回滚,构建评估长上下文智能体动态推理能力的基准
将推理链渲染为图像,用视觉token替代文本token,实现3.4×压缩和2.7×加速
通过轻量路由器在推理时动态分配注意力头到全注意力或稀疏模式
为Gemini构建生产就绪的探针
👍 9开发鲁棒的激活探针架构,以检测语言模型在长上下文等生产分布偏移下的滥用行为。
递归语言模型
👍 99通过递归调用和环境变量突破LLM上下文限制的新范式
LG AI Research推出的236B参数MoE多语言模型,支持256K上下文与六种语言