提出神经隐式场景(NIS)作为固定长度可渲染状态,解耦状态转移与观测合成
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过动作条件预训练世界模型,获得可复用的机器人动力学先验
通过分层物理对齐提升机器人视频生成的物理合理性,用于世界模拟和策略学习
通过动作前缀并行预测替代自回归rollout,在提升视觉规划成功率的同时大幅降低计算开销
从数据覆盖角度研究世界模型幻觉,提出三种检测方法并验证缓解效果
提出物理感知的世界模型EO-WM,实现更可靠的地球观测预测
统一TF-CM和SF-DMD的三阶段蒸馏,1-4步实时流式视频生成达84.63分。
智能体模型的批判性分析与GIC架构
👍 21区分工具型与内禀型系统,提出基于分层目标、演化身份和自调节的GIC架构
用于机器人操作的世界价值模型
👍 7将世界模型作为机器人价值学习的基础,实现SOTA任务进度估计
世界行动模型综述
👍 56系统梳理世界行动模型的设计哲学、核心组件、关键属性与开放挑战
利用动作条件世界模型潜在表示实现长视野机器人任务的实时故障监控
当前世界模型缺乏持久状态核心
👍 16现有视频世界模型无法在相机离开视野后维持世界状态的连续演化
提出首个统一控制相机、物体和天气的视频世界模型,从单张图像生成精确可控的目标天气场景
首个原生面向物理AI的世界模型,跨具身课程+混合线性时序记忆
通过改进提示词、清理人工制品和重新设计评分方法,提升了物理理解评估的可靠性
循环世界模型
👍 478用参数共享的循环迭代构建高效稳定的世界模型
提出分层动作感知记忆,统一导航和物体交互的实时交互式世界模型
支持相机导航、场景记忆和可组合事件控制的通用世界模型
以自然语言为统一动作接口,跨场景训练具身视频世界模型。
iMaC把未来动作渲染成运动图与接触图,注入视频扩散模型做策略评估。