通过模态感知的一致性蒸馏,将世界动作模型的推理延迟从8.1秒降至348毫秒,实现23倍加速
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用一个 Mixture-of-Transformers 统一语言/图像/视频/音频/动作的理解与生成
扩散模型中的分数控制以减少幻觉
👍 2通过控制分数平滑度减少扩散模型幻觉
把扩散过程拆成噪声域协调与残差映射两阶段,实现统一高效的图像翻译
通过检索历史生成内容解决AR长视频生成的错误累积问题
表示强制:无瓶颈统一多模态模型
👍 63通过预测理解表示来指导像素空间生成,消除VAE瓶颈
消费级GPU上实现实时高分辨率流式视频编辑的混合架构系统
通过TTT架构实现Softmax Transformer到线性复杂度的快速转换
提出两阶段粗到细框架,通过全局粗略引导和全局-局部帧交换机制,实现高分辨率长序列视频的时空一致外扩。
DEMON:音乐编排噪声的实时扩散引擎
👍 11将扩散模型去噪过程转化为实时可演奏的乐器,支持每帧25Hz精细控制
将50个视觉效果LoRA蒸馏到单一模块,解决部署成本和特征干扰问题
全栈框架将视频基础模型转为实时相机可控世界模型
用于生成的原生音频-视频对齐
👍 33提出NAVA框架,通过原生音频-视频对齐实现高质量联合音视频生成
彩色噪声扩散采样
👍 25利用扩散模型频谱偏差,通过动态彩色噪声注入显著提升生成质量的无训练采样方法
用自适应状态替换静态锚点,解决流式视频生成中的动态性抑制问题
结合生成式运动与物理模拟,生成物理合理的4D人机交互场景
提出融合交通流与碰撞风险的统一时空风险场
通过结构感知的块扩散和scaffolding技术,实现SOTA轨迹精度下的12倍推理加速
万物皆可缩放:尺度不变扩散与连续超分辨率
👍 15单一框架统一无条件和连续超分辨率,无需条件分支或重新训练
在三维重建模型的特征空间里做扩散去噪,同时恢复图像与几何。