从40,000小时游戏视频训练的跨游戏通用AI代理
Loïc Magne, Anas Awadalla, Guanzhi Wang, Yinzhen Xu, Joshua Belofsky,...
2026-01-07
多任务学习
强化学习
游戏AI
行为克隆
视觉-动作模型
提出MindWatcher,一个能自主规划、调用多模态工具的智能体,通过持续RL训练和改进的GRPO算法实现SOTA工具推理性能。
Jiawei Chen, Xintian Shen, Lihao Zheng, Zhenwei Shao, Hongyuan Zhang,...
2026-01-07
MWE-Bench
ReAct范式
多模态智能体
工具集成推理
强化学习
提出认知启发的三阶段框架,通过知识内化解决视觉数学推理中的推理漂移问题
Shuhang Chen, Yunqiu Xu, Junjie Xie, Aojun Lu, Tao Feng, Zeying Huang, Ning...
2026-01-07
多模态学习
强化学习
数学问题求解
知识内化
视觉推理
大规模视觉Web智能体训练环境,简单RL训练超越GPT-5
Hao Bai, Alexey Taymanov, Tong Zhang, Aviral Kumar, Spencer Whitehead
2026-01-07
Web Agent
WebGym
强化学习
视觉智能体
通过解耦的Thinker-Generator架构和两阶段强化学习,显著提升图像生成的推理能力
Sashuai Zhou, Qiang Zhou, Jijin Hu, Hanqing Yang, Yue Cao, Junpeng Ma,...
2026-01-07
图像生成
强化学习
推理增强
模块化架构
视觉语言模型
LG AI Research推出的236B参数MoE多语言模型,支持256K上下文与六种语言
Eunbi Choi, Kibong Choi, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Hyunjik...
2026-01-06
Mixture-of-Experts
MoE架构
多语言模型
强化学习
长上下文
提出三组件框架解决VAR模型RL训练中的异步策略冲突问题
Shikun Sun, Liao Qu, Huichao Zhang, Yiheng Liu, Yangyang Song, Xian Li, Xu...
2026-01-06
强化学习
文本渲染
自回归模型
视觉生成
通过门控自适应正则化和多样性感知优化,解决扩散模型RL微调中的奖励作弊问题
Haoran He, Yuxiao Ye, Jie Liu, Jiajun Liang, Zhiyong Wang, Ziyang Yuan,...
2026-01-06
GRPO
奖励作弊
强化学习
扩散模型
文本到图像生成
7B参数混合架构模型实现SOTA推理性能
Falcon LLM Team, Iheb Chaabane, Puneesh Khanna, Suhail Mohmad, Slim Frikha,...
2026-01-06
大语言模型
强化学习
推理优化
测试时扩展
混合架构
首个RL框架实现文本指导物体平移、旋转、缩放
Jing Tan, Zhaoyang Zhang, Yantao Shen, Jiarui Cai, Shuo Yang, Jiajun Wu, Wei...
2026-01-06
几何变换
图像编辑
多模态
强化学习
扩散模型
通过对比感知损失增强VLM视觉推理能力的RL微调方法
Ahmad Rezaei, Mohsen Gholami, Saeed Ranjbar Alvar, Kevin Cannons, Mohammad...
2026-01-06
多模态推理
对比学习
强化学习
感知优化
视觉语言模型
解决LLM智能体高配置成本和静态能力问题,实现自动生成和持续优化的模块化框架
Yuchen Shi, Yuzheng Cai, Siqi Cai, Zihan Xu, Lichao Chen, Yulei Qin, Zhijian...
2026-01-05
工具合成
强化学习
智能体框架
策略优化
自动生成
提出DualityForge框架和DNA-Train训练方法,通过生成反事实视频对抗MLLM的语言先验依赖,显著降低视觉幻觉
Zhe Huang, Hao Wen, Aiming Hao, Bingze Song, Meiqi Wu, Jiahong Wu,...
2026-01-05
反事实学习
多模态大语言模型
幻觉检测
强化学习
数据增强
首个通过RL训练的端到端多模态智能体VLM,整合图像搜索、文本搜索和图像裁剪工具
Yong Xien Chng, Tao Hu, Wenwen Tong, Xueheng Li, Jiandong Chen, Haojia Yu,...
2026-01-05
多模态大模型
工具学习
强化学习
智能体推理
视觉-语言模型
提出分布创造性推理DCR框架理论性解决大语言模型推理训练中的多样性崩塌问题,保证收敛到多样化平衡点。
Max Ruiz Luyten, Mihaela van der Schaar
2026-01-05
创造力
多样性
大语言模型
强化学习
推理
重新审视交叉熵损失,通过奖励重塑策略发现精确导向的预训练分布更利于强化学习的探索空间,提升推理性能。
Haoyuan Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Keyao Wang, Weile Chen, Zihao...
2026-01-05
奖励塑造
强化学习
推理能力
策略梯度
预训练目标
构建ALE生态系统训练ROME智能体模型,提出IPA算法实现长horizon任务优化
Weixun Wang, XiaoXiao Xu, Wanhe An, Fangwen Dai, Wei Gao, Yancheng He, Ju...
2026-01-01
代码智能
多轮交互
强化学习
智能体学习
生态系统
从新闻自动生成开放端预测问题数据集OpenForesight,用GRPO训练的OpenForecaster8B在预测准确率和校准度上媲美更大规模的专有模型
Nikhil Chandak, Shashwat Goel, Ameya Prabhu, Moritz Hardt, Jonas Geiping
2026-01-01
开放端推理
强化学习
数据生成
语言模型训练
预测系统
提出FIGR方法,将可执行的图表构建集成到多轮推理中,通过强化学习学习何时以及如何外化中间结构作为视觉状态。
Meiqi Chen, Fandong Meng, Jie Zhou
2026-01-01
代码执行
多模态推理
强化学习
数学推理
视觉推理