把7自由度机器人动作编码成像素级动作图像,让视频主干直接当零样本策略
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
世界模型统一定义与统一推理框架OpenWorldLib
面向潜在世界属性的涌现式组合通信
👍 7多智能体在通信压力下自发形成可分解的潜在物理属性离散编码
提出ECoT合成与工业代码世界模型,训练32B思考型代码LLM。
WAM vs VLA 系统鲁棒性对比研究
首个将三维点云作为可更新世界状态、闭环驱动自我中心手物交互视频生成的模拟器。
MultiGen 用显式外部记忆+三模块架构,让扩散游戏引擎支持关卡可编辑与多人一致性
为视频世界模型引入主体状态token与空间RoPE偏置,解决多智能体动作绑定难题
首个动作条件化的第一人称视频世界模型,融合人体姿态联合建模。
提出原生离散扩散VLA模型,统一多模态理解与生成,实现机器人长视距精准控制
基于世界模型规划的结构化折纸生成
👍 18提出神经符号框架Learn2Fold,结合LLM语义规划与图结构世界模型,生成物理有效的折纸折叠序列
系统综述视频生成模型作为世界模拟器时的效率优化技术,涵盖建模范式、架构设计和推理算法三个维度。
提出混合记忆范式,让视频世界模型追踪离屏动态主体
Vega:学习用自然语言指令驾驶
👍 6提出统一视觉-语言-世界-动作模型,实现基于自然语言指令的自动驾驶
运动脉搏:从视觉动力学测量物理帧率
👍 20提出Visual Chronometer预测视频物理帧率,解决时间尺度幻觉
PhyGenesis 通过轨迹矫正与异构训练实现物理一致的驾驶视频生成
从《怪物猎人:荒野》采集的1亿帧游戏数据集,支持动作条件世界建模
VLM引导JEPA隐式世界模型,双时序通路融合语义与动态建模
将触觉感知融入预测式视频世界模型,实现接触丰富操作的鲁棒控制
提出14B参数物理对齐世界模型,生成符合物理定律的机器人操作视频