用视觉语言联合推理自动生成相机轨迹,实现精准可控视频生成
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
LPM 1.0:基于视频的角色表演模型
👍 8217B视频生成模型实时驱动全双工对话虚拟角色
双分支 flow matching 视频生成模型,联合建模视觉与 V-JEPA2 物理潜变量
实时单视频驱动的 4D 交互世界模型,24FPS 跑出 SOTA 相机控制。
MoRight:做对运动控制
👍 7通过双流架构解耦相机与物体运动,并引入主动-被动因果推理,实现可前向/逆向推理的交互式视频生成。
统一框架直接生成人体试穿动画视频,解决身份漂移和服装失真问题
把7自由度机器人动作编码成像素级动作图像,让视频主干直接当零样本策略
世界模型统一定义与统一推理框架OpenWorldLib
提出解耦运动注入和混合上下文集成,实现高质量组合人-环境视频生成
提出SC-DMD与缓存感知训练,解决视频扩散蒸馏多步组合崩溃与缓存漂移
首个将三维点云作为可更新世界状态、闭环驱动自我中心手物交互视频生成的模拟器。
用合成光流替代合成视频,解耦运动与外观生成高动态视频。
MultiGen 用显式外部记忆+三模块架构,让扩散游戏引擎支持关卡可编辑与多人一致性
首个动作条件化的第一人称视频世界模型,融合人体姿态联合建模。
潜在空间几何引导的4D世界一致性视频生成框架
在T2V模型token空间添加偏移向量实现连续属性控制
系统综述视频生成模型作为世界模拟器时的效率优化技术,涵盖建模范式、架构设计和推理算法三个维度。
将轨迹重建重新定义为地图视觉视频生成任务,用视频模型直接在地图上绘制连续GPS路径
提出混合记忆范式,让视频世界模型追踪离屏动态主体
因果多镜头架构实现16FPS实时交互式长叙事视频生成