ESPO通过提前终止失败轨迹节省20%+token并提升LLM推理性能
Zihang Li, Rui Zhou, Yingcheng Shi, Wenhan Yu, Zhewen Tan, Zixiang Liu,...
2026-06-02
大语言模型
强化学习
数学推理
策略优化
训练效率
系统研究多智能体RL训练LLM工作流,揭示IP/SP策略共享的梯度机制与失败模式
Yifan Zeng, Yiran Wu, Yaolun Zhang, Wentian Zhao, Kun Wan, Qingyun Wu, Huazheng Wang
2026-06-02
GRPO
LLM工作流
多智能体系统
强化学习
策略共享
在 on-policy RL 中复用 rollout 的下一观测做辅助世界模型监督,零额外推理开销
Ning Lu, Baijiong Lin, Shengcai Liu, Jiahao Wu, Haoze Lv, Yanbin Wei,...
2026-06-02
LLM智能体
世界模型
强化学习
稀疏奖励
联合训练
自监督强化学习训练多模态大模型做在线心智推理,无需心理状态标注
Shunchi Zhang, Jin Lu, Chuanyang Jin, Yichao Zhou, Zhining Zhang, Tianmin Shu
2026-06-02
多模态大模型
强化学习
心智理论
智能助手
自监督学习
通过shell命令让LLM直接检索原始文本,bypass传统检索索引实现高效多跳推理
Alireza Salemi, Chang Zeng, Atharva Nijasure, Jui-Hui Chung, Razieh Rahimi,...
2026-06-01
代理式搜索
多跳推理
强化学习
检索增强生成
直接语料库交互
通过搜索代理轨迹构建分层干扰文档,用实体级评分奖励提升长上下文推理能力
Nianyi Lin, Jiajie Zhang, Lei Hou, Juanzi Li
2026-06-01
奖励设计
强化学习
搜索代理
数据构建
长上下文推理
通过强化学习使多模态智能体学会根据环境任务动态决定记忆内容
Tao Zou, Yichen He, Tian Qiu, Yuan Lin, Hang Li
2026-06-01
VQA
多模态智能体
强化学习
自适应记忆
长期记忆
首个将数据无关的自我对弈扩展到开放式任务的框架,通过文档锚定的标准分解实现自我评估和持续自我改进
Wai-Chung Kwan, Aryo Pradipta Gema, Joshua Ong Jun Leang, Pasquale Minervini
2026-06-01
大语言模型
开放式任务
强化学习
检索增强生成
自我对弈
通过动态建模搜索边界来减少代理式搜索中的过度搜索,同时保持推理准确性
Yunbo Tang, Chengyi Yang, Shiyu Liu, Zhishang Xiang, Zerui Chen, Qinggang...
2026-06-01
代理式搜索
工具使用
强化学习
检索增强生成
通过双流强化学习将视觉定位能力内化到文本推理中,无需显式输出坐标
Chang-Bin Zhang, Yujie Zhong, Qiang Zhang, Kai Han
2026-06-01
多模态大语言模型
强化学习
视觉定位推理
链式思维
将dLLMs的RL转化为去噪器自蒸馏,避免ELBO似然度替代的TIM偏差
Xiaohang Tang, Keyue Jiang, Che Liu, Qifang Zhao, Xiaoxiao Xu, Sangwoong...
2026-06-01
大语言模型
强化学习
扩散语言模型
自蒸馏
MCTS+神经网络设计公交网络,Bloomington服务率54.6%-82.1%
Bibek Poudel, Sai Swaminathan, Weizi Li
2026-06-01
交通网络设计
图神经网络
强化学习
组合优化
蒙特卡洛树搜索
通过分析隐藏表示的几何异常检测RL训练中的数据污染
Minju Gwak, Minseo Kwak, Dongseok Lee, Guijin Son, Alan Ritter, Jaehyung Kim
2026-05-29
强化学习
成员推断攻击
数据污染检测
模型审计
表示学习
通过差异化处理通用技能内部化与任务特定技能动态利用,提升智能体在OOD场景下的泛化能力。
Jiapeng Zhu, Jianxiang Yu, Yibo Zhao, Chengcheng Han, Qi Gu, Xunliang Cai,...
2026-05-29
LLM智能体
分布外泛化
强化学习
技能学习
智能体强化学习
研究长程交互中LLM的信念管理问题,提出CBM框架和BeliefTrack基准,发现RL可显著改善模型信念追踪能力
Haoming Xu, Weihong Xu, Zongrui Li, Mengru Wang, Yunzhi Yao, Chiyu Wu, Jin...
2026-05-29
上下文学习
信念追踪
多轮对话
强化学习
零依赖合成终端环境,提升LLM命令行能力
Xiaoxuan Peng, Kaiqi Zhang, Xinyu Lu, Boxi Cao, Yaojie Lu, Hongyu Lin,...
2026-05-29
命令行界面
强化学习
数据合成
终端环境
语言智能体
将真实GUI轨迹转换为可控手机环境,支持评估与训练
Zhengyang Tang, Yuxuan Liu, Xin Lai, Junyi Li, Pengyuan Lyu, Jason, Yiduo...
2026-05-29
多模态代理
强化学习
手机GUI交互
环境构建
监督学习
用Wikipedia共现统计替代神经验证器,实现低成本、高性能的事实性问答过程监督
Shicheng Fan, Haochang Hao, Dehai Min, Weihao Liu, Philip S. Yu, Lu Cheng
2026-05-29
事实性验证
共现统计
强化学习
过程监督
问答系统
通过工具调用重采样解决思考-行动差距,提升智能体推理能力
Minki Kang, Shizhe Diao, Ryo Hachiuma, Sung Ju Hwang, Pavlo Molchanov,...
2026-05-28
多模态学习
大语言模型
工具使用
强化学习
智能体推理
通过修正策略梯度估计中的长度偏差和方差问题,实现高效的主动推荐路径规划。
Hongru Hou, Tiehua Mei, Denghui Geng, Jinhui Huang, Ao Xu, Hengrui Chen,...
2026-05-28
主动推荐
强化学习
推荐系统
用户偏好引导
策略梯度