提出 L1/L2/L3 三级能力 × 物理/数字/社会/科学四规律的二维世界建模分类法
Meng Chu, Xuan Billy Zhang, Kevin Qinghong Lin, Lingdong Kong, Jize Zhang,...
2026-04-27
AI for Science
世界模型
强化学习
智能体
理论框架
用强化学习训练一个轻量 Actor 在长上下文中插入高亮标记,提升冻结 LLM 的证据利用能力。
Shaoang Li, Yanhang Shi, Yufei Li, Mingfu Liang, Xiaohan Wei, Yunchen Pu,...
2026-04-27
可迁移性
强化学习
提示优化
证据选择
长上下文
将前向KL与反向KL按token级信号混合,结合off-policy数据与轻量on-policy采样的统一蒸馏框架
Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu
2026-04-24
代码生成
大语言模型
强化学习
推理
知识蒸馏
用 RL options 框架训练 MoE 控制器,把切换率从 50%+ 压到 5% 以下。
Zeyu Shen, Peter Henderson
2026-04-24
LLM推理优化
Mixture-of-Experts
Options Framework
强化学习
模型压缩
用强化学习让 7B 小模型端到端生成可部署的多页网站,匹敌 671B 模型。
Juyong Jiang, Chenglin Cai, Chansung Park, Jiasi Shen, Sunghun Kim, Jianguo...
2026-04-24
GRPO
Web 开发
代码生成
多模态奖励
强化学习
用同条训练跑上稍后的 checkpoint 当老师,做 Q/V 折中最优的混合策略 RLVR。
Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng...
2026-04-23
RLVR
多模态推理
强化学习
混合策略
策略优化
用视频扩散模型规划 HOI,从合成视频提 3D 人+2D 物目标驱动物理灵巧模仿。
Hyeonwoo Kim, Jeonghwan Kim, Kyungwon Cho, Hanbyul Joo
2026-04-23
SMPL-X
人-物交互
强化学习
灵巧操作
物理仿真
通过模态感知自适应混合 SFT+RL 后训练,约束偏好优化于文本通道并锚定语音通道,缓解口语对话模型中 IQ/EQ 难以同步提升的矛盾。
Yifu Chen, Shengpeng Ji, Qian Chen, Tianle Liang, Yangzhuo Li, Ziqing Wang,...
2026-04-23
偏好优化
口语对话模型
后训练
多模态生成
强化学习
用 GRPO 强化学习联合优化显式弃答与拒答后澄清质量,3B 模型对不可答题表现匹敌 671B DeepSeek-R1。
Skylar Zhai, Jingcheng Liang, Dongyeop Kang
2026-04-23
GRPO
可验证奖励
大语言模型对齐
幻觉抑制
强化学习
用两阶段RL课程让多模态大模型自主掌握视觉工具调用以解决复杂视觉推理
Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang,...
2026-04-23
GRPO
多模态大模型
工具调用
强化学习
视觉推理
统一推理与生成的自动摄影图像编辑框架
Ying Zeng, Miaosen Luo, Guangyuan Li, Yang Yang, Ruiyang Fan, Linxiao Shi,...
2026-04-22
图像增强
图像编辑
多模态大模型
强化学习
扩散模型
首个系统评测 Agent-as-a-Judge 的基准,带工具访问 F1 平均涨 13 点。
Wentao Shi, Yu Wang, Yuyang Zhao, Yuxin Chen, Fuli Feng, Xueyuan Hao, Xi Su,...
2026-04-22
LLM-as-a-Judge
基准评测
工具使用
强化学习
智能体评估
首次将GRPO引入均匀离散扩散,通过将最终干净样本作为动作并用前向过程重构轨迹,解决训练崩溃。
Jiaqi Wang, Haoge Deng, Ting Pan, Yang Liu, Chengyuan Wang, Fan Zhang,...
2026-04-22
GRPO
RLHF
强化学习
扩散模型
文本到图像
1978个MCP环境+19822工具,GRPO自演化闭环训练,23个基准全面领先开源基线。
Guanting Dong, Junting Lu, Junjie Huang, Wanjun Zhong, Longxiang Liu, Shijue...
2026-04-21
GRPO
MCP
可验证奖励
工具调用
强化学习
首个专为视频RL设计的端到端训练评测框架,带离线缓存与异步推理
Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng...
2026-04-21
RLVR
多模态大模型
强化学习
视频理解
训练框架
将SFT重写为带稀疏奖励的on-policy RL,提出GAL+DCR统一后训练框架
Wangjie Gan, Miao Pan, Linbo Xi, Wenqi Zhang, Jintao Chen, Jianwei Yin, Xuhong Zhang
2026-04-21
LLM后训练
强化学习
数学推理
监督微调
策略梯度
在游戏自博弈中引入轨迹优势调制,用抽象度系数与演化奖励解决推理迁移难题
Xiachong Feng, Deyi Yin, Xiaocheng Feng, Yi Jiang, Libo Qin, Yangfan Ye, Lei...
2026-04-21
LLM训练
博弈论
强化学习
推理迁移
自博弈
首次系统证明在情感支持对话中,一个支持者回复可以同时包含多种支持策略,并提出两种生成方法结合认知推理与强化学习。
Jie Zhu, Huaixia Dou, Junhui Li, Lifan Guo, Feng Chen, Jinsong Su, Chi...
2026-04-21
GRPO
LLM微调
强化学习
情感支持对话
策略建模
用PPL空间解耦破解RLVR训练中探索-利用的两难困境
Xiaofan Li, Ming Yang, Zhiyuan Ma, Shichao Ma, Jintao Du, Yu Cheng, Weiqiang...
2026-04-20
GRPO
LLM后训练
RLVR
困惑度
强化学习
用三 Agent 架构与四阶段训练流水线,让 30B 模型在深度搜索与研究任务上比肩百亿参数大模型。
MindDR Team, Li Auto Inc
2026-04-20
LLM Agent
多 Agent 系统
工具使用
强化学习
检索增强生成