面向全模态任务的多智能体编排框架与决策对齐强化学习方法。
Fan Zhang, Vireo Zhang, Shengju Qian, Haoxuan Li, Hao Wu, Jinyang Wu,...
2026-06-15
GRPO
OmniGAIA
ReAct
任务分解
全模态智能体
用冻结小模型为大模型 GRPO 生成探索性 rollout,渐进切入到自采样的 S2L-PO 框架
Yiming Ren, Yiran Xu, Zicheng Lin, Chufan Shi, Yukang Chen, Dingdong Wang,...
2026-06-15
GRPO
小模型利用
强化学习后训练
探索多样性
推理增强
通过多视图GRPO与自验证锚点,解决GUI定位RL训练奖励退化问题。
Xinyu Qiu, Yunzhu Zhang, Heng Jia, Shuheng Shen, Changhua Meng, Linchao Zhu
2026-06-15
GRPO
GUI Grounding
多视图学习
强化学习
视觉-语言模型
用层次化强化学习让LLM边读边想并自动分配计算
Junlong Tong, Wenqi Xu, Yingqi Fan, Anhao Zhao, Xuan Lu, Yang Tan, Xiaoyu Shen
2026-06-15
GRPO
层次化优势分配
强化学习
流式推理
自适应计算
用双判官注入已知偏差构建可控环境,复现并自动检测rubric-RL奖励黑客
Xuekang Wang, Zhuoyuan Hao, Shuo Hou, Hao Peng, Juanzi Li, Xiaozhi Wang
2026-06-04
GRPO
LLM-as-a-Judge
奖励建模
奖励黑客
强化学习
自监督双代理任务(端到端重建+中间记忆召回)预训练LLM记忆能力。
Ziheng Li, Xingrun Xing, Haoqing Wang, Zhi-Hong Deng, Yehui Tang
2026-06-04
GRPO
上下文记忆智能体
多跳问答
强化学习
自监督预训练
以欠优化区域挖掘与CPT-SFT-RL渐进训练把0.9B文档解析模型推至新SOTA。
Zelun Zhang, Hongen Liu, Suyin Liang, Yubo Zhang, Yiqing Xiang, Jiaxuan Liu,...
2026-06-03
GRPO
OCR
PaddleOCR
后训练
强化学习
用感知扰动构造数据集并经GRPO批排序奖励训练判官,缓解其重文本轻视觉的偏差。
Seojeong Park, Jiho Choi, Junyong Kang, Seonho Lee, Jaeyo Shin, Hyunjung Shim
2026-06-03
GRPO
反事实数据构造
多模态大模型评判
奖励建模
强化学习
用梯度-激活显著性重加权GRPO的token级优势,提升数学推理。
Tej Deep Pala, Vernon Toh, Soujanya Poria
2026-06-03
GRPO
RLHF
信用分配
可验证奖励
强化学习
系统研究多智能体RL训练LLM工作流,揭示IP/SP策略共享的梯度机制与失败模式
Yifan Zeng, Yiran Wu, Yaolun Zhang, Wentian Zhao, Kun Wan, Qingyun Wu, Huazheng Wang
2026-06-02
GRPO
LLM工作流
多智能体系统
强化学习
策略共享
在RLVR中引入时间调度维度,按时序从后向前渐进优化轨迹百分位token
Jinghao Zhang, Ruilin Li, Feng Zhao, Jiaqi Wang
2026-06-02
GRPO
RLVR
token级优化
信用分配
时间调度
浏览器宿主、以结构化 JSON 状态为核心的移动端仿真平台与基准,单机即可承载数百并行实例用于可验证评估与在线 RL 训练。
Dingbang Wu, Rui Hao, Haiyang Wang, Shuzhe Wu, Han Xiao, Zhenghong Li,...
2026-05-27
Benchmark
GRPO
GUI Agent
Mobile Agent
Reinforcement Learning
NoisyAgent:在训练中显式注入用户与工具噪声以提升LLM智能体鲁棒性
Yuxin Chen, Xiaodong Cai, Junfeng Fang, Zhuowen Han, Yu Wang, Yaorui Shi, Yi...
2026-05-27
GRPO
LLM智能体
噪声注入
强化学习
课程学习
通过双路径 rollout 动态探测知识边界,引导 agentic RL 训练减少冗余工具调用。
Dingwei Chen, Zefang Zong, Zhipeng Ma, Leo Luo, Yang Li, Chengming Li, Peng...
2026-05-27
Agentic RL
GRPO
LLM Agent
RAG
Tool-Use
为多奖励GRPO引入方差自适应权重,兼顾训练稳定与目标协同
Guochao Jiang, Jingyi Song, Guofeng Quan, Chuzhan Hao, Guohua Liu, Yuewei Zhang
2026-05-26
GRPO
LLM对齐
多奖励强化学习
工具调用
数学推理
提出基于验证器失败诊断的智能体-环境协同共演化框架 SEAL,用同一诊断信号同时驱动训练接口进化与策略梯度更新。
Yihao Hu, Zhihao Wen, Xiujin Liu, Pan Wang, Xin Zhang, Wei Wu
2026-05-26
GRPO
LLM智能体
失败诊断
工具调用
强化学习
提出 CMRP 新任务和 UniCharacter 框架,用极少样本让统一多模态模型同时学会角色的语言风格与视觉外观。
Chao Tang, Jianzong Wu, Qingyu Shi, Ye Tian, Aixi Zhang, Hao Jiang,...
2026-05-26
GRPO
个性化生成
多模态大模型
强化学习
文生图
把终端输出 token 当作监督信号,叠加到 GRPO 损失上,让失败轨迹也产生梯度。
Vaishnavi Shrivastava, Piero Kauffmann, Ahmed Awadallah, Dimitris Papailiopoulos
2026-05-26
GRPO
LLM Agent
世界模型
强化学习
智能体训练
用专用图像编辑器替代工具调用与统一多模态,让MLLM真正“用图像思考”。
Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin
2026-05-25
GRPO
LoRA微调
图像编辑
多模态大模型
强化学习
首个用强化学习做相机控制视频重拍的框架,用度量3D评估器约束相机轨迹精度。
Zizun Li, Haoyu Guo, Runzhe Teng, Chunhua Shen, Tong He
2026-05-25
GRPO
强化学习
新视角合成
相机控制
视频生成