用词表里的功能 token 统一 agentic 与 latent 视觉推理。
Ziyu Guo, Rain Liu, Xinyan Chen, Pheng-Ann Heng
2026-05-15
GRPO
VLM
功能 token
强化学习
视觉推理
RAVEN 通过重打包自展开轨迹并结合一致性模型策略优化,实现高质量实时自回归视频生成。
Yanzuo Lu, Ronglai Zuo, Jiankang Deng
2026-05-15
一致性模型
实时生成
强化学习
扩散模型蒸馏
自回归生成
用100条偏好样本自演化技能与工具库,冻结VLM即可超越GPT-5的图像编辑奖励。
Yuxuan Zhang, Penghui Du, Bo Li, Cong Wei, Junwen Miao, Huaisong Zhang,...
2026-05-15
上下文学习
图像编辑
奖励建模
强化学习
智能体
把生成视频提升到三维物理仿真器中评估,作为RL微调奖励显著改善人体动作真实度。
Yidong Huang, Zun Wang, Han Lin, Dong-Ki Kim, Shayegan Omidshafiei, Jaehong...
2026-05-15
SMPL/MuJoCo
三维运动
人体视频生成
奖励建模
强化学习
用闭式 value baseline 降低 OPD 梯度方差,无需额外 critic 即可稳定训练
Minjae Oh, Sangjun Song, Gyubin Choi, Yunho Choi, Yohan Jo
2026-05-14
在线策略蒸馏
大模型后训练
强化学习
控制变量
方差缩减
用强化学习联合优化记忆图边表示与路由策略的查询条件遍历框架。
Dongming Jiang, Yi Li, Guanpeng Li, Qiannan Li, Bingzhe Li
2026-05-14
图神经网络
多关系图
强化学习
智能体记忆
检索增强生成
用在线动态奖励权重与每题目标长度,兼顾正确性与简洁性
Songtao Wei, Yi Li, Zhikai Li, Xu Hu, Yuede Ji, Guanpeng Li, Feng Chen, Carl...
2026-05-14
GRPO
大语言模型
强化学习
推理压缩
高效推理
流式记忆+问题分解重读,免检索地解决长上下文证据丢失
Baibei Ji, Xiaoyang Weng, Juntao Li, Zecheng Tang, Yihang Lou, Min Zhang
2026-05-14
GRPO
强化学习
记忆智能体
重读机制
长上下文推理
在单次自回归轨迹内同时生成候选并排序,用分解式GRPO解决端到端信用分配难题。
Rohan Surana, Gagan Mundada, Junda Wu, Xintong Li, Yizhu Jiao, Bowen Jin,...
2026-05-14
GRPO改进
LLM排序
信用分配
强化学习
检索增强生成
EAPO 教会 LLM 智能体在不确定时才探索,4B 模型在 GUI 任务上击败 GPT-4 级对手。
Xingyuan Hua, Sheng Yue, Ju Ren
2026-05-14
GRPO
GUI自动化
LLM智能体
变分推断
强化学习
Rubric统一策略/评估/记忆,8B深度研究agent超越开源基线
Gaotang Li, Bhavana Dalvi Mishra, Zifeng Wang, Jun Yan, Yanfei Chen,...
2026-05-13
Rubric引导评估
元强化学习
强化学习
深度研究Agent
经验复用
THINC框架让代码本身成为推理主体,4B模型击败235B基线
Hyeon Hwang, Jiwoo Lee, Jaewoo Kang
2026-05-13
GRPO
代码生成
工具增强推理
强化学习
思维链
图像库引用协议+ODE把Qwen3-VL平均提升14.1个百分点
Shijue Huang, Hangyu Guo, Chenxin Li, Junting Lu, Xinyu Geng, Zhaochen Su,...
2026-05-13
MLLM
多模态智能体
工具使用
强化学习
数据合成
POISE 用策略模型自身隐藏状态预测奖励基线,替代 PPO 价值网络与 GRPO 多采样
Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo
2026-05-13
LLM推理
RLVR
价值估计
可验证奖励
强化学习
揭示异步RL中旧logits缺失问题,提出精确获取与PPO-EWMA两种修复路径
Zhong Guan, Yongjian Guo, Haoran Sun, Wen Huang, Shuai Di, Xiong Jun Wu,...
2026-05-13
PPO优化
大语言模型
异步训练
强化学习
离策略修正
首个逐轮响应感知防御器 TURNGATE,精确锁定「最早危害闭合点」以平衡安全与实用性。
Xinjie Shen, Rongzhe Wei, Peizhi Niu, Haoyu Wang, Ruihan Wu, Eli Chien, Bo...
2026-05-13
LLM安全
多轮越狱
对话防御
强化学习
意图检测
提出「稀疏奖励给大教师、稠密信号传小部署模型」的分配原则,四阶段流程在 MATH 提升 3.4 点
Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard
2026-05-13
GRPO
后训练
奖励密度
强化学习
推理模型
DR.Q 通过最大化表示互信息和衰减式优先回放,给基于模型的Q学习表示去偏,单套超参横扫73个连续控制任务。
Jiafei Lyu, Zichuan Lin, Scott Fujimoto, Kai Yang, Yangkun Chen, Saiyong...
2026-05-13
互信息最大化
基于模型的表示学习
强化学习
经验回放
连续控制
RL通过概率重分配让LLM事实回忆准确率平均提升27%。
Wanli Yang, Hongyu Zang, Junwei Zhang, Wenjie Shi, Du Su, Jingang Wang,...
2026-05-13
GRPO
LLM-as-a-Judge
LLM事实回忆
参数化知识
强化学习
解耦评分标准 RL 中验证器错误与评分标准设计缺陷两类奖励黑客,给出无需外部评审的自内化差距早停信号。
Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang, Anisha Gunjal, Bing Liu,...
2026-05-13
LLM 评审
医疗 AI
后训练
奖励黑客
强化学习