一种可扩展的4D世界建模方法,支持从单目视频进行重建、新轨迹视频生成和多种下游应用
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
多模态学习
具身智能
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
多模态大语言模型
可解释性
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
按去噪阶段重要性分配大/小模型,实现1.65×加速且保持质量
提出3D物体流作为通用中间接口,将视频生成模型的视觉预测转化为机器人可执行动作,实现零样本开放世界操作
提出轻量级历史嵌入,通过两阶段学习在自回归视频生成中保持一致性
通过物理感知数据管道和组式DPO框架提升视频生成的物理一致性
首个统一实现音频-视频理解与生成的多模态大语言模型
首个实现相机运动与时间序列完全解耦的视频扩散模型,支持从单目视频生成自由时空探索的新视角视频。