找到 144 条结果

提出MAGNet模型解决连续环境中语义视听导航任务,在目标声音间歇或静默后仍能维持目标追踪

Yichen Zeng, Hebaixu Wang, Meng Liu, Yu Zhou, Chen Gao, Kehan Chen, Gongping Huang 2026-03-24
具身导航 多模态学习 强化学习 音频-视觉融合

通过部分级标注和过程奖励强化学习,实现逐步生成可编辑的矢量素描

Xiaodan Du, Ruize Xu, David Yunis, Yael Vinker, Greg Shakhnarovich 2026-03-23
多模态学习 强化学习 生成模型 矢量图形 计算机视觉

提出反向标注流水线构建多模态文档提取基准,评估20个模型在小规模参数下的结构化输出能力

Udi Barzelay, Ophir Azulai, Inbar Shapira, Idan Friedman, Foad Abo Dahood,... 2026-03-18
基准测试 多模态学习 小模型评估 文档理解 结构化数据提取