用生成式世界模型替代真实机器人,实现实时数字遥操作数据生成
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
统一双向与自回归视频生成的灵活分块框架,实现质量与效率的动态权衡
系统研究世界模型作为机器人策略评估器的关键设计要素,提出GigaWorld-1实现14.9%性能提升
在保持约200ms延迟的同时将实时音视频交互模型输出分辨率从192×336提升至640×368
基于表示自编码器的多人交互世界模型
👍 22首个支持四玩家实时交互的动态环境世界模型,在单张GPU上实现20fps生成且能保持数小时稳定
通过4D几何先验和时空自强迫机制实现任意长度的多视角视频生成
通过旋转基共享 Lloyd-Max 码本实现数据无关的 DiT 低比特量化,无需校准数据即可跨模态应用
解耦语义编排与视频生成,实现动态对象持久记忆的可控世界模拟
首个面向流式视频生成的工作负载调度系统,联合优化会话迁移与GPU弹性伸缩
用学习型查询token解决视频世界模型的长期记忆问题
通过适配开源视频先验,在消费级GPU上实现14-15 FPS的实时可控世界模拟
通过分层物理对齐提升机器人视频生成的物理合理性,用于世界模拟和策略学习
首个评估世界生成中消失-重现记忆一致性的基准,测试10个SOTA模型揭示记忆瓶颈
提出DomainShuttle框架实现高保真且灵活的开放领域视频个性化生成,跨域分数提升18.7%
提出双流内存银行+边界感知门控,解决多镜头音视频生成中的身份漂移问题
统一TF-CM和SF-DMD的三阶段蒸馏,1-4步实时流式视频生成达84.63分。
提出PQSG框架,用层次化问题图细粒度评估视频生成物理真实性
基于点跟踪的视频合成与运动控制
👍 3通过参考图像锚定的点跟踪统一实现视频外观和运动控制
用图像编辑替代视频生成作为世界动作模型骨干,降低推理成本并提升机器人控制性能
当前世界模型缺乏持久状态核心
👍 16现有视频世界模型无法在相机离开视野后维持世界状态的连续演化