通过视觉侧局部聚类+语言侧文本引导逐层剪枝的双阶段框架,实现VLM的极致token压缩
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
TTT 的 KV 绑定机制并非记忆检索,而是可改写为线性注意力算子
高效推理的艺术:数据、奖励与优化
👍 7系统研究高效推理训练机制,通过数据、奖励和优化策略实现更短、更准确的推理链生成
混合Top-k/Top-p掩码+速度蒸馏,实现95%稀疏率且不损质量
196B MoE 模型仅激活 11B 参数,通过架构与 RL 创新达到 GPT-5.2 水平
将上下文压缩重构为显式信息传输,解决LLM压缩器的分配缺失和层间稀释两大瓶颈
首个专为自回归视频扩散设计的稀疏注意力方案,实现2-3倍加速且质量无损
FASA:基于频率感知的稀疏注意力机制
👍 154利用 RoPE 频率块的功能稀疏性,训练无关地动态预测 token 重要性以压缩 KV 缓存
用全注意力层当Oracle指导稀疏层选token并共享KV缓存,降低计算和内存开销
残差上下文扩散语言模型
👍 37通过回收被丢弃的中间计算信号,显著提升扩散语言模型的推理准确率
混合头稀疏注意力,长上下文推理提速2.7倍且质量不降
超越模仿:面向主动潜在规划的强化学习方法
👍 10通过VAE和强化学习,主动优化隐空间中的推理策略,提升准确率并减少token消耗
将推理链渲染为图像,用视觉token替代文本token,实现3.4×压缩和2.7×加速
Softmax1替换标准注意力,token减少70%、准确率提升27%
提出基于局部注意力机制的特征上采样方法,在保持语义一致性的同时实现线性时间复杂度
通过轻量路由器在推理时动态分配注意力头到全注意力或稀疏模式
用轻量门控模块直接从隐藏状态预测KV重要性,免去运行时重建开销
SALAD在视频扩散变换器中引入并行线性注意力分支,实现90%稀疏度和1.52-2.03倍推理加速,同时保持生成质量。
VIBE:基于视觉指令的图像编辑器
👍 64紧凑高效的指令式图像编辑系统,2B VLM+1.6B扩散模型,4秒生成2K图像
让小模型主动调用大模型,用1.07%的token成本恢复60%性能差距