找到 979 条结果

ESPO通过提前终止失败轨迹节省20%+token并提升LLM推理性能

Zihang Li, Rui Zhou, Yingcheng Shi, Wenhan Yu, Zhewen Tan, Zixiang Liu,... 2026-06-02
大语言模型 强化学习 数学推理 策略优化 训练效率

自监督强化学习训练多模态大模型做在线心智推理,无需心理状态标注

Shunchi Zhang, Jin Lu, Chuanyang Jin, Yichao Zhou, Zhining Zhang, Tianmin Shu 2026-06-02
多模态大模型 强化学习 心智理论 智能助手 自监督学习

通过shell命令让LLM直接检索原始文本,bypass传统检索索引实现高效多跳推理

Alireza Salemi, Chang Zeng, Atharva Nijasure, Jui-Hui Chung, Razieh Rahimi,... 2026-06-01
代理式搜索 多跳推理 强化学习 检索增强生成 直接语料库交互

首个将数据无关的自我对弈扩展到开放式任务的框架,通过文档锚定的标准分解实现自我评估和持续自我改进

Wai-Chung Kwan, Aryo Pradipta Gema, Joshua Ong Jun Leang, Pasquale Minervini 2026-06-01
大语言模型 开放式任务 强化学习 检索增强生成 自我对弈

将真实GUI轨迹转换为可控手机环境,支持评估与训练

Zhengyang Tang, Yuxuan Liu, Xin Lai, Junyi Li, Pengyuan Lyu, Jason, Yiduo... 2026-05-29
多模态代理 强化学习 手机GUI交互 环境构建 监督学习