提出首个统一控制相机、物体和天气的视频世界模型,从单张图像生成精确可控的目标天气场景
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过稀疏3D边界框实现精确的多对象视频生成与编辑控制
提出语言引导的三维物体点轨迹预测方法,构建百万级数据集和基准,显著超越现有运动预测方法
首个原生面向物理AI的世界模型,跨具身课程+混合线性时序记忆
首个单GPU实时运行22B参数的视听自回归生成模型,支持亚秒级交互和千秒级长时生成
通过改进提示词、清理人工制品和重新设计评分方法,提升了物理理解评估的可靠性
提出分层动作感知记忆,统一导航和物体交互的实时交互式世界模型
支持相机导航、场景记忆和可组合事件控制的通用世界模型
以自然语言为统一动作接口,跨场景训练具身视频世界模型。
提出无标签对抗框架BadWorld,攻击自回归世界模型速度场暴露其脆弱性
用配对3D点轨迹条件化视频扩散,实现相机可控的4D一致视频重渲染
通过解耦语义外观与几何结构实现编辑后视频长期一致性
用"相机栅格视频"作为视觉化的相机表征,实现无需跨配对数据的多镜头相机运动克隆。
iMaC把未来动作渲染成运动图与接触图,注入视频扩散模型做策略评估。
用视频参考+稀疏注意力+动作表征实现生产级1080p数字人视频生成
首个在单个ViT中统一图像视频tokenization的UMM框架
从单张窄视场图像实时生成可交互漫游的3D视频世界模型,支持8FPS实时交互
世界模型自蒸馏:训练世界模型解决通用任务
👍 15通过自蒸馏和VLM反馈将视频扩散模型转为指令跟随的任务求解器
提出端到端角色动画范式,统一多种子任务,通过MotionPair-60K数据集和Bias-Aware DPO实现业界领先性能
首个支持实时推理的唇形同步扩散模型,通过分析驱动的蒸馏框架将14B教师压缩为两步自回归学生,实现31 FPS流式生成