找到 979 条结果

让视觉推理轨迹显式指向图像证据,提升计数和空间理解能力

Junkai Zhang, Yihe Deng, Kai-Wei Chang, Wei Wang 2026-06-19
强化学习 接地学习 视觉推理 视觉语言模型

通过强化学习让大语言模型适应不同检索器的查询策略

Ruifeng Yuan, Chaohao Yuan, David Dai, Yu Rong, Hong Cheng, Hou Pong Chan,... 2026-06-19
多模态检索 强化学习 查询重写 检索增强生成

首个原生全模态Agent框架,通过迭代Observation-Thought-Action循环解耦视频时长与推理复杂度,实现测试时正扩展

Zhenghao Xing, Ruiyang Xu, Yuxuan Wang, Jinzheng He, Ziyang Ma, Qize Yang,... 2026-06-18
POMDP 主动感知 多模态Agent 强化学习 长视频理解

提出SR-ReaL框架,通过LOR和DTR双路径推理+强化学习提升空间VLM的几何推理能力

Yatai Ji, An-Chieh Cheng, Yang Fu, Yukang Chen, Han Zhang, Zhaojing Yang,... 2026-06-18
3D感知 双路径推理 强化学习 空间推理 视觉语言模型

基于图灵测试判别奖励训练人类不可区分的用户模拟器

Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu, Zexue He, Pengyuan Li,... 2026-06-18
LLM训练 图灵测试 对话系统 强化学习 用户模拟

通过将中间错误答案转化为修订与验证提示,训练LLM的测试时序列修订能力

Yuanxin Liu, Ruida Zhou, Xinyan Zhao, Amr Sharaf, Hongzhou Lin, Arijit... 2026-06-18
序列修订 强化学习 数据增强 测试时扩展