利用全局查询的聚类几何结构,用信标查询预判思维回看,保留关键KV缓存并实现5.8倍显存压缩
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
按隐藏状态轨迹方向角把冗余思维链压成潜在token,精度升2.6%、长度近半。
并行管解码:面向视频的高效生成式时空定位
👍 16把时空管解码深度压到固定1+1轮,延迟降79倍、吞吐升92倍且精度更优。
推理时只保留提示前缀加滑动窗口,让长思维链成本恒定,免训练提速3倍
把3D形状码的逐token自回归解码改为块间因果、块内并行去噪加置信度修正,提速5.15倍
用时序置信度做异步分支控制,并行推理延迟降低21.8–32.2%
针对单用户CPU解码反向设计的卷积-注意力混合小模型,长上下文解码最高提速2.08倍
细粒度MoE+核优化+防遗忘视频微调,稀疏CLIP视觉编码器追平1.7倍大的SOTA稠密模型
首个智能体文生图工作流路由框架,按提示需求动态分配最优管线,成本降95%延迟降65%
训练时预测未来视觉嵌入、推理时直接作答,精度持平或超越Visual CoT且延迟降5倍以上
把世界生成模型构造未来的内部计算蒸馏为仅由当前观测预测的表征,控制时无需执行生成器
无需训练的两阶段全模态Token压缩,极致压缩下仍保持95%性能
混合线性与softmax注意力,单卡生成比全softmax视频DiT快3.2倍
提出Latent Memory,将每条多模态证据压缩为一个高维潜在token,实现高效的问答系统
LoRA 联合训练实现按输入类型自适应跳过层
将RAT+的指数衰减记忆模块应用于Quest、MoBA、SnapKV等稀疏推理方法,大幅提升精度
将视频编码的I/P帧思想引入MLLM,用运动-残差token大幅降低视觉token成本
内省式识别冗余步骤并以掩码偏好学习折叠推理链,token减半
ACTS框架通过控制器代理策略级引导推理器,在保持精度的同时大幅降低推理成本
同一权重暴露两条等价解码路径,让模型在 H100 与 H20 上同时达 roofline 最优。