仅用15k合成积木题训练,LVLM域外空间推理全面超越空间专精模型
Soohyun Ryu, Sohee Kim, Eunho Yang
2026-09-11
GRPO
合成数据
后训练
强化学习
空间智能
把广告视频生成分解为策略选择与草稿生成两阶段,用线上业务反馈训练奖励模型驱动DPO+GRPO优化。
Xingyuan Bu, Chengru Song, Hao Zhou, Tao Zhou, Dong Li, Wei Li, Shilong Li,...
2026-09-10
DPO
GRPO
在线A/B实验
奖励模型
强化学习
用难度自适应树搜索、句子熵分叉与兄弟多样性奖励扩展 RLVR 的 pass@k 推理覆盖
Youngjun Yu, Sanghwan Jang, Hwanjo Yu
2026-09-10
GRPO
RLVR
探索策略
推理覆盖
树搜索
纯后训练专用模型家族,单次调用生成幻灯片与可交互课件,用可执行探针把交互性变成可测量的奖励信号
Shangqing Tu, Daniel Zhang-Li, Yucheng Wang, Shiyu Gan, Yanpeng Wang,...
2026-09-01
GRPO
后训练
国产算力适配
奖励攻击
奖励设计
用梯度对齐实时估计样本边际贡献并约束重加权,让RFT数据利用全程自适应
Haoru Tan, Sitong Wu, Yanfeng Chen, Shizhen Zhao, Yang-Tian Sun, Tianjia...
2026-09-01
GRPO
多模态推理
强化微调
数据选择
梯度对齐
4B步骤级护栏模型,以前缀对齐数据与Balance-GRPO校正防御偏置,ASR降77.3%
Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu, Lu Sheng, Jing Shao,...
2026-08-31
Agent安全
GRPO
合成数据
强化学习
护栏模型
RCCA把评分规则级功能反馈定位到代码片段,转化为GRPO的token级优化权重。
Rui Jin, Jikai Chen, Yihan Chen, Hao Zhou, Demin Zhu, Kaichen Yang, Dong...
2026-08-31
GRPO
Web应用生成
代码生成
信用分配
奖励设计
用“提问的未来收益减去交互成本”的决策奖励训练LLM策略,学会何时追问、何时纠正。
Xiaoying Song, Anirban Saha Anik, Jinyu Liu, Qitao Tan, Geng Yuan, Lingzi Hong
2026-08-31
GRPO
LLM用户模拟
健康错误信息干预
决策框架
多轮对话
进化策略比GRPO推理覆盖更广:升Pass@1同时保住Pass@K,大参数漂移不等于灾难性遗忘
Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong,...
2026-08-28
GRPO
LLM推理
Pass@K
后训练
强化学习
把提示深度从单一标量改为在线估计的高斯分布,零额外采样实现每任务自适应引导
Zixuan Wang, Yanrui Miao, Zhengxi Lu, Teng Pan, Yiwen Qiu, Hongxing Li, Peng...
2026-08-27
GRPO
奖励稀疏
智能体强化学习
课程学习
长视野任务
把参考答案拆成原子量规条目,为VLM后训练提供细粒度、前缀定位的RL奖励
Shulin Tian, Minglun Li, Yuhao Dong, Hao Ding, Jiarui Yao, Haiwen Diao,...
2026-08-27
GRPO
后训练
多模态大模型
奖励设计
强化学习
将标注作为oracle加入RL组,解耦优势估计防反转,免CoT高效训练统一视频感知。
Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou,...
2026-08-26
GRPO
后训练
强化学习
统一视频感知
视频多模态大模型
阿里开源的电商直播全模态理解模型,用音视频时间对齐与忠实强化微调实现多项直播任务开源最佳。
Yibo Hu, Yu Qian, Mao Gu, Yingfan Tao, Yuhao Chen, Yongdong Luo, Zhuoqun...
2026-08-25
GRPO
全模态大模型
强化学习后训练
数据引擎
电商直播
把KL正则从响应侧移到查询侧,稳住训练环境漂移又不牺牲探索
Xianlei Zhou, Xiangdi Meng, Yu He, Tianyu Qi, Shuyan Guan, Xianli Zhang,...
2026-08-25
GRPO
LLM强化学习
RLVR
正则化
训练稳定性
首个用人类反馈训练的音视频联合生成思维链奖励模型,取代易被hack的专家指标
Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang...
2026-08-20
GRPO
人类偏好对齐
奖励模型
强化学习后训练
音视频联合生成
把技能选择从结果奖励噪声中拆出,用双通道信用分配单独训练
Qingyao Li, Wenxiang Jiao, Shuai Shao, Kangning Zhang, Yuan Lu, Yi Guo,...
2026-08-20
GRPO
信用分配
大模型智能体
强化学习
技能选择
按目标剩余提升空间动态重加权组相对优势,把RL优化力度转向未饱和目标
Yixuan Wang, Yifei Chen, Haichao Zhang, Haozheng Luo, Xander Wu, Jie Ni, Yun...
2026-08-18
GRPO
LLM推理
RLVR
多奖励策略优化
强化学习
首个3D世界构建智能体的评测+多模态RL训练框架,开源30B模型Pass@1超越GPT-5.5
Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li,...
2026-08-18
3D场景生成
Agentic RL
Benchmark
GRPO
具身智能
揭示LLM超出能力时产生似是而非的无效推理,CaRL训练模型学会及时认输
Xinyan Guan, Jiali Zeng, Chunlei Xin, Yaojie Lu, Hongyu Lin, Xianpei Han, Le...
2026-08-14
GRPO
强化学习
无效推理
能力边界校准
诚实性
GRPO无参考奖励+SFT-RL插值,46语言翻译比肩GPT-5
Chris Han, Pengzhi Gao, Pei Fu, Jian Luan
2026-08-12
GRPO
在线策略蒸馏
多语言LLM
强化学习
机器翻译