通过显式自适应记忆管理压缩LLM推理过程中的中间思维,大幅降低内存开销并提升推理效率
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过分层索引加速稀疏注意力的token选择,实现3.75倍内核加速
用同一模型的自回归模式作验证器,无需训练即加速扩散LLM解码
将推测解码从token级提升到智能体级,用轻量模型跳过不必要的工具调用链
通过感知约束的动态缓存,将视频世界模型推理速度提升2.3倍同时保持99.4%质量
通过嵌入空间中的掩码token探测,实现无需训练的多token预测,显著提升推理效率。
通过跨层复用索引,移除75%计算,实现1.82倍加速
通过空间稀疏化和动态token激活实现DiT免训练7倍加速
首次系统对比 AR 与扩散 LLM 的层间表征结构,发现扩散目标函数带来可被利用的早层冗余。
通过块级近似和动态阈值实现长上下文预填充加速
基于曲率的异构 token 缓存框架,实现扩散世界模型最高 3.7 倍加速且保持 98% 生成质量
用网络敏感度指导缓存决策,加速视频扩散模型推理
通过频谱演化感知的缓存策略,在保留内容质量的同时加速扩散模型推理
通过查询传播和融合,将视频分割统一到纯ViT编码器中,实现10倍加速且精度相当
扩散语言模型的注意力汇聚感知剪枝
👍 4针对扩散语言模型中注意力汇聚不稳定的特点,提出感知汇聚的剪枝方法
轨迹自蒸馏+DDO目标函数,让扩散语言模型用更少步骤生成高质量文本
首个将稀疏与线性注意力混合的9B参数模型,支持1M tokens上下文,推理速度提升3.5倍
引入T2T编辑机制突破扩散语言模型速度-质量权衡瓶颈
无需训练的段级运行时模型切换框架,显著降低推理延迟
原子级专家+笛卡尔积路由+专家中心调度,10.9倍加速MoE推理