4B步骤级护栏模型,以前缀对齐数据与Balance-GRPO校正防御偏置,ASR降77.3%
Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu, Lu Sheng, Jing Shao,...
2026-08-31
Agent安全
GRPO
合成数据
强化学习
护栏模型
RCCA把评分规则级功能反馈定位到代码片段,转化为GRPO的token级优化权重。
Rui Jin, Jikai Chen, Yihan Chen, Hao Zhou, Demin Zhu, Kaichen Yang, Dong...
2026-08-31
GRPO
Web应用生成
代码生成
信用分配
奖励设计
用“提问的未来收益减去交互成本”的决策奖励训练LLM策略,学会何时追问、何时纠正。
Xiaoying Song, Anirban Saha Anik, Jinyu Liu, Qitao Tan, Geng Yuan, Lingzi Hong
2026-08-31
GRPO
LLM用户模拟
健康错误信息干预
决策框架
多轮对话
把游戏开发变成“引擎检查+人类验收”的可验证奖励环境,驱动世界模型自我改进
Pengfei Zhou, Hexin Wang, Zhengfeiyang Zhang, Yixing Ma, Zhenglin Wan,...
2026-08-28
世界模型
具身智能
可验证奖励
强化学习
智能体
利用伪标签错误的非对称性,无标签地将自蒸馏与RL惩罚结合于测试时训练
Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu, Weiming Lu, Jun...
2026-08-28
LLM推理
在线策略自蒸馏
强化学习
无标签学习
测试时训练
进化策略比GRPO推理覆盖更广:升Pass@1同时保住Pass@K,大参数漂移不等于灾难性遗忘
Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong,...
2026-08-28
GRPO
LLM推理
Pass@K
后训练
强化学习
300个程序化视觉推理任务+可验证奖励评分器,让视觉生成成为可训练、可验证、可优化的推理媒介
Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji, Tongxi Zhou,...
2026-08-27
交错生成
原生视觉推理
可验证奖励
基准测试
强化学习
按数据体制匹配稳定器:SWD 全局启用,数据稀缺保留归一化与双Q,数据丰沛则移除二者。
Zihao Wu, Hongyao Tang, Yi Ma, Huizhong Song, Pengyi Li, Yifu Yuan, Fei Ni,...
2026-08-27
GPU并行仿真
Sim-to-Real
可扩展训练
强化学习
机器人控制
训练一个元智能体,为每个任务即时生成、修复并进化专属 Agent 脚手架,显著放大固定底座模型能力
Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang, Zhifei Xie,...
2026-08-27
DPO
元智能体
强化学习
智能体脚手架
智能体评测
定位多教师蒸馏的预算错配根因,三个机制把能力恢复率从35.6%提到83.4%
Huan-ang Gao, Haohan Chi, Yong Yan, Shiyuan Feng, Hanlin Wu, Zheng Jiang,...
2026-08-27
LLM后训练
在线策略蒸馏
多教师蒸馏
强化学习
能力整合
混合SFT以不到1/60的算力在RLVR后全面超越下一块推理RL
Yinhao Tang, Youqing Fang, Yanan Sun, Jiangning Liu, Ziyi Wang, Xun Zhao,...
2026-08-27
LLM推理
RLVR
SFT
强化学习
无CoT数据
把参考答案拆成原子量规条目,为VLM后训练提供细粒度、前缀定位的RL奖励
Shulin Tian, Minglun Li, Yuhao Dong, Hao Ding, Jiarui Yao, Haiwen Diao,...
2026-08-27
GRPO
后训练
多模态大模型
奖励设计
强化学习
用4D高斯泼溅重建奖励取代静态3D奖励,修复流式视频生成的几何漂移而不冻结运动。
Yuanhao Ban, Jiaqi Feng, Hengguang Zhou, Xiaohuan Pei, Justin Cui, Cho-Jui Hsieh
2026-08-27
4D重建
奖励设计
强化学习
自回归扩散模型
视频生成
推理时只保留提示前缀加滑动窗口,让长思维链成本恒定,免训练提速3倍
Niklas Muennighoff, Zhengyang Wang, Zeyi Chen, Weijia Shi, Binyuan Hui, John...
2026-08-27
强化学习
测试时扩展
滑动窗口注意力
长上下文
高效推理
将标注作为oracle加入RL组,解耦优势估计防反转,免CoT高效训练统一视频感知。
Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou,...
2026-08-26
GRPO
后训练
强化学习
统一视频感知
视频多模态大模型
三系统架构+3.7万小时异构数据一阶段预训练,协同理解、预测与行动的具身基础模型。
GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi,...
2026-08-26
VLA
世界模型
具身智能
强化学习
机器人基础模型
通过有界价值头、蒙特卡洛目标与长度自适应GAE,让单样本Critic强化学习稳定媲美GRPO
Penghui Qi, Xiangxin Zhou, Wee Sun Lee
2026-08-26
PPO改进
RLHF
价值函数学习
大语言模型
强化学习
用一个 ReLU 门控把在策略蒸馏改造成合法的 RLVR 方法,零新增超参数
Wenze Lin, Jiale Zhao, Xitai Jiang, Songde Rao, Yining Li, Shenzhi Wang,...
2026-08-26
RLVR
大模型后训练
强化学习
数学推理
知识蒸馏
智能体与批评者共享参数交替进化,在轨迹中主动纠错,领先最强RL基线2.1 EM
Boyang Liu, Senjie Jin, Peixin Wang, Zhangyue Yin, Yibo Wang, Yuhao Zhou,...
2026-08-26
LLM反馈
信用分配
偏好优化
强化学习
搜索智能体
用环境扩展与智能体协作扩展两条路线,把推理模型变成能完成长周期复杂工作的系统。
Apodex Team, B. An, B. Li, B. Wang, B. Zhang, B. L. Wang, C. Feng, C. Wei,...
2026-08-25
AgentOS
多智能体协作
强化学习
技术报告
智能体