SALAD在视频扩散变换器中引入并行线性注意力分支,实现90%稀疏度和1.52-2.03倍推理加速,同时保持生成质量。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
因果注意力掩码使解码器模型在选项位于上下文之后时丧失对上下文的利用能力
系统分析多图像视觉语言模型的失败模式,提出 MIMIC 基准和针对性改进方案
通过知识蒸馏对齐教师模型的视觉注意力轨迹,让小模型获得大模型的视觉推理能力
揭示LLM注意力斜线模式由RoPE中高频分量与近秩一查询/键的相互作用内在产生
通过显式相关性指标调制LLM注意力机制,提升RAG系统对噪声文档的鲁棒性
首个在手机端实现 DiT 高质量图像生成的系统,0.4B 模型 1.8 秒生成 1K 图像
提出多头线性注意力MHLA,通过token维度分块解决全局上下文坍塌问题
基于Megalodon改进的Gecko架构,通过滑动分块注意力和自适应工作记忆实现4M长序列建模
ReHyAt通过混合注意力将视频生成复杂度从二次降为线性。
序列推荐中的并行隐式推理
👍 5提出并行隐式推理框架,通过多流并行探索提升序列推荐性能
提出两阶段可解释仇恨言论检测框架,融合人类理据与LLM解释
利用LLM内部KV重路由在无需训练情况下提取高质量文本嵌入
首个基于SLAT的训练无关3D变形框架,实现跨类别平滑变形