用解耦扩散Transformer将短视频保真度与长时序一致性分离,实现分钟级快速视频生成
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
仅0.5B参数的VLA基线通过标准化训练细节实现SOTA,超越数十亿参数大模型。
用 LoRA 权重基底跨越视觉类比空间
👍 13提出 LoRWeB,通过可学习的 LoRA 基底和动态编码器组合,实现对未见视觉类比任务的泛化编辑。
通过动能正则化将最大熵RL重构为薛定谔桥问题,无需显式密度估计
统一五大导航任务的VLA基础模型,1690万轨迹+7802场景,7项基准SOTA
基于扩散模型的多音轨同步生成框架,推理速度提升25-50%
用动量混合参数化非线性轨迹,2步即可逼近50步教师模型的生成质量
提出TP-GRPO框架,用增量式步骤奖励和转折点检测缓解Flow-GRPO的奖励稀疏问题
42000小时数据训练的零样本歌声合成系统,支持乐谱与旋律双模态控制
首个蛋白质骨架多尺度自回归生成框架PAR,实现从粗到精的结构生成
基于像素均值流的单步无潜变量图像生成
👍 18提出pMF方法实现单步无潜变量图像生成,ImageNet 256×256达2.22 FID
一个务实的视觉-语言-动作基础模型
👍 50基于2万小时真实双臂机器人数据训练的VLA基础模型,实现跨平台泛化与高效训练
利用预训练视频生成器作为自改进器,通过预测-扰动循环提升视频物理真实性和运动连贯性
提出统一动作空间和混合流架构,实现单一模型跨5种机器人平台部署
首个将物理碰撞规则直接编码到高维空间的强化学习视频生成框架。
首个基于流匹配的GUI Agent,通过连续轨迹生成实现拖拽等高自由度操控
构建15万小时10语言词级时间戳数据集,并训练TTS和语音编辑双模型验证其价值