统一VLM框架,融合情景记忆+数据关联+探索策略,跨视角生成一致物体描述
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
整合CARLA与AirSim于单一UE4进程,实现高保真空地联合仿真,支持18种传感器模态同步采集
提出多智能体协作框架解决流式视频理解中的实时推理、长期记忆和主动交互三大挑战
通过强化学习对齐MLLM推理与低层动作,显著提升VLA机器人操控性能
基于模拟环境的诊断基准,系统评估VLM在机器人任务中的空间推理能力
通过运动学控制机器人+4D扩散模型生成环境反应,实现高保真具身仿真
物理闭环双向优化,实现仿真就绪的人-场景交互重建
全景图像中的功能预测研究
👍 10首次探索全景功能预测任务,提出PAP-12K数据集和模拟人眼中央凹视觉的PAP框架
提出家庭安全基准和双脑架构,实时检测具身智能体危险行为
通过将执行反馈转化为结构化行为知识,实现Minecraft智能体的持续自我进化
统一因果时空注意力视觉骨干,支持流式感知、几何重建与具身控制
ROVA框架通过结构化时空扰动与自反思难度调度,提升视频推理在真实世界扰动下的鲁棒性
首个支持在线、实时、开放词汇3D感知的前馈式3DGS框架
世界链:潜在运动中的世界模型思维
👍 8CoWVLA 通过结构-运动解耦的潜在表示统一世界模型与潜在动作,实现高效机器人操控
提出交互式3D物理基准CHAIN,揭示VLM在结构化物理推理中的系统性失败
首个VLA模型训练后量化框架,通过选择性量化和轻量校准实现70%内存节省且超越全精度性能
提出反思式测试时规划框架,让具身LLM在部署时通过三种反思机制从失败中学习
RynnBrain:开源具身智能基础模型
👍 46阿里达摩院开源具身智能基础模型,统一感知/推理/规划,四个核心能力全面超越SOTA
模块化人形机器人开放词汇物体抓取系统,末端跟踪误差降低5.5倍
在真实世界中学习情境感知
👍 8提出SAW-BENCH基准测试,评估多模态模型在第一人称视角下的空间情境感知能力