找到 138 条结果

首篇系统综述大模型时代音视觉感知/生成/交互三大支柱的统一分类法与方法论

You Qin, Kai Liu, Shengqiong Wu, Kai Wang, Shijian Deng, Yapeng Tian, Junbin... 2026-05-08
全模态对话 具身智能 多模态大模型 综述 音视频生成

提出Seeing Through Touch框架,用局部视觉-触觉对齐实现触觉引导的材料分割。

Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak 2026-04-15
具身智能 多模态定位 对比学习 材料分割 视觉-触觉学习

开源 3D 框中心化的空间数据引擎,合成 3M 多任务样本让 VLM 在空间推理基准上平均提升 14.1%。

Jianhui Liu, Haoze Sun, Wenbo Li, Yanbing Zhang, Rui Yang, Zhiliang Zhu,... 2026-04-10
3D 视觉 VQA 合成 具身智能 数据引擎 空间智能