三段式KV缓存压缩策略,5秒训练生成120秒长视频
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
AVO:用于自主进化搜索的智能体变异算子
👍 11用自主编程智能体替代进化搜索中的变异算子,生成超越专家优化的GPU注意力内核
通过稀疏化视觉-语言交互而非减少token数量来提升LVLM效率的新方法
基于快照的广义离散扩散模型
👍 11统一框架支持任意离散扩散,首次大规模超越自回归
通过关系注意力机制显式绑定人脸-属性,实现精准多主体视频定制
VLM对问题表述方式敏感,不同格式下视觉注意力分配差异显著
通过VL-MoT框架和动作引导的视觉剪枝策略,解决VLA模型深层视觉敏感性衰减问题
立体世界模型:相机引导的立体视频生成
👍 11首个相机条件约束的立体世界模型,联合学习外观与双目几何,实现端到端立体视频生成
揭示Transformer两轴对偶性:用DDL改捷径、ShortSWA做混合
提出AttnRes用softmax注意力替代固定残差累加,解决PreNorm深度信息稀释问题
混合深度注意力机制(MoDA)
👍 83MoDA:通过跨层深度KV注意力解决LLM深度扩展中的信息稀释问题
稀疏性通过调节方差传播有效缓解深度诅咒,提升深层利用率
利用多头注意力查询向量的时序可预测性检测多变量时间序列的结构性异常
证明 softmax 注意力的归一化约束使 sink 成为触发条件任务的必要机制
差分子空间分解与双通道软加权注意力,实现精准提示词高亮
通过识别音频专家注意力头,实现推理时激活干预以缓解音频语言模型的文本主导问题
将MLA单潜在头分解为多分支,实现4路张量并行解码,速度提升2.8倍
揭示冷启动中视觉注意力不足的瓶颈,提出AVAR框架重塑注意力分配,平均提升7%
大规模人体数据集+非对称注意力,实现跨视角身份一致视频生成
通过QK-norm和降低每步token数,使INT8注意力训练匹配全精度效果