用散度方向导数重定义信任域方向判据,改进LLM强化学习稳定性。
Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang, Haonan Wang,...
2026-07-24
PPO
信任域
大语言模型
强化学习
策略优化
仅用单目RGB即达具身导航SOTA的8B视觉语言模型
Arjun Majumdar, Avinash Sooriyarachchi, Benjamin Tibi, Chris Bamford, Elliot...
2026-07-24
具身导航
强化学习
机器人
视觉语言模型
高效训练
用轻量代理与容器编排解耦训练与推理,让任意 harness 和环境直接接标准 RL 训练
Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu, Hao Cheng, Wenlin Yao,...
2026-07-24
GRPO
GUI 智能体
容器编排
工具调用智能体
强化学习
从黎曼几何修正PPO裁剪,等距更新RIPO显著缓解探索坍缩。
Zhicheng Cai, Xinyuan Guo, Hanlin Wu, Mingxuan Wang, Wei-Ying Ma, Ya-Qin...
2026-07-23
LLM推理
PPO裁剪
强化学习
探索利用权衡
策略优化
分类法驱动的可验证视觉推理环境,RLVR训练后24个外部基准平均提升约4个百分点
Md Tanvirul Alam
2026-07-23
可验证奖励
强化学习
程序化数据生成
视觉推理
视觉语言模型
用代理似然把结果奖励RL引入潜在推理,实现潜在测试时扩展
Runyang You, Zhiyuan Liu, Yongqi Li, Wenjie Li
2026-07-23
强化学习
思维链
测试时扩展
潜在推理
策略优化
复用基模型权重奇异谱、仅优化奇异框架的 RLVR 原生优化栈
Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David...
2026-07-22
RLVR
优化器
奇异值分解
强化学习
推理能力
按轨迹正确性分流的混合自蒸馏框架,统一RLSD稳定优化与OPSD方向纠正。
Qiye Cai, Yichuan Ma, Linyang Li, Peiji Li, Yongkang Chen, Qipeng Guo,...
2026-07-22
信用分配
可验证奖励RLVR
大语言模型推理
强化学习
自蒸馏
构建可验证的离线维基百科环境,让搜索智能体自蒸馏迭代进化。
Xinyu Geng, Xuanhua He, Sixiang Chen, Yanjing Xiao, Fan Zhang, Shijue Huang,...
2026-07-21
工具使用
强化学习
智能体
深度搜索
自蒸馏
用群组熵引导的非对称优势塑形,缓解GRPO多任务训练的探索-利用失衡
Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen
2026-07-21
GRPO
多任务强化学习
大语言模型对齐
强化学习
策略熵控制
把 LLM 裁判升级为教练,用可迁移经验知识替代标量奖励训练模型。
Tianzhu Ye, Li Dong, Guanheng Chen, He Zhu, Xun Wu, Shaohan Huang, Furu Wei
2026-07-21
后训练
大语言模型
强化学习
指令遵循
知识蒸馏
将教师监督直接融入强化学习目标,通过反向重要性采样实现选择性知识迁移
Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan, Yue Wang
2026-07-21
GRPO
大语言模型后训练
强化学习
知识蒸馏
策略优化
将VLA后训练重构为多租户服务,解耦训练/推理/环境并组批调度,GPU时间降28%
Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei...
2026-07-21
GPU调度
VLA模型
后训练
多租户服务
强化学习
记忆中枢+语义ID+隐式推理,让LLM低成本驱动淘宝推荐
Bowen Zheng, Chao Yi, Dian Chen, Gaoyang Guo, Han Zhu, Jiakai Tang, Jian Wu,...
2026-07-20
大语言模型
工业部署
强化学习
推荐系统
用户建模
用国际象棋测试床建立预训练-RL联合缩放律并揭示RL机制
Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus...
2026-07-20
GRPO
国际象棋
强化学习
推理
缩放律
探究 Muon 优化器在不同优势估计器的长程 Agentic RL 中的效果
Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun
2026-07-20
Agentic RL
Muon
优化器
信用分配
强化学习
用参考答案引导的对比概率差作为token级正确性信号来塑形RLVR优势
Weiwen Xu, Jia Liu, Hou Pong Chan, Long Li, Deng Cai, Min Chen, Hao Zhang
2026-07-20
GRPO
RLVR
优势塑形
大模型推理
对比学习
用世界模型预测数据操作效果,智能体训练加速14倍、推理加速3-6倍
Zherui Yang, Fan Liu, Hao Liu
2026-07-20
世界模型
强化学习
数据科学智能体
环境转移模拟
自主智能体
让两个模型互相当考官,竞争式RL隐式评估推理过程质量。
Vladislav Beliaev
2026-07-20
GRPO
LoRA
多智能体竞争
强化学习
推理模型
把VLM二值自验证循环嵌入GRPO,无需外部监督大幅提升多模态推理
Mingyuan Wu, Jingcheng Yang, Shengyi Qian, Xudong Wang, Jize Jiang, Qifan...
2026-07-20
GRPO
RL微调
多模态推理
强化学习
自验证