用相机位姿统一动作控制与3D一致性,构建交互式游戏世界模型
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
基于真实世界的城市场景世界模拟模型:首尔世界模型
👍 155首尔世界模型:用街景图像检索增强,实现真实城市级别的世界模拟视频生成
统一视频扩散框架,实现场景、多视角主体和运动的解耦控制
通过混合扩散和对抗训练实现少步轨迹可控视频生成,质量与精度双提升
用预训练视频模型激活复原先验,仅需1K样本实现少样本图像复原
通过多智能体问答框架实现视频生成的评估与迭代优化
提出Plan-then-Control框架,用VLM自动规划电影级相机轨迹,实现多镜头视频精准控制
统一框架实现多主体身份保持与全方位运动控制,通过潜在空间强化学习优化身份保真度
提出ELIT机制,通过可变长度潜在接口实现扩散变换器的弹性计算分配和多预算推理
通过内容自适应的token分配,在保持重建质量的同时节省24%以上的视频token开销
用 Doob h-变换把粗引导信号注入扩散采样,无需训练和前向算子。
通过误差感知路由和无参数线性补偿,高效加速视频扩散Transformer注意力计算
多智能体竞争框架自动生成1-2分钟喜剧小品视频
基于对角蒸馏的流式自回归视频生成
👍 5对角蒸馏实现31FPS实时视频生成,加速277倍
层次化去噪替代逐块生成,实现高质量长视频
基于注意力恢复的免训练潜在帧间剪枝方法
👍 14利用时序冗余的潜在空间剪枝加速视频生成
提出解耦世界演化与渲染的框架,让视野外实体持续演化
大规模人体数据集+非对称注意力,实现跨视角身份一致视频生成
物理模拟器在环视频生成
👍 12将物理模拟器嵌入视频生成循环,确保运动符合物理规律
MLLM推理+DiT上下文学习的参考视频特效迁移框架