找到 999 条结果

提出MindWatcher,一个能自主规划、调用多模态工具的智能体,通过持续RL训练和改进的GRPO算法实现SOTA工具推理性能。

Jiawei Chen, Xintian Shen, Lihao Zheng, Zhenwei Shao, Hongyuan Zhang,... 2026-01-07
MWE-Bench ReAct范式 多模态智能体 工具集成推理 强化学习

重新审视交叉熵损失,通过奖励重塑策略发现精确导向的预训练分布更利于强化学习的探索空间,提升推理性能。

Haoyuan Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Keyao Wang, Weile Chen, Zihao... 2026-01-05
奖励塑造 强化学习 推理能力 策略梯度 预训练目标

从新闻自动生成开放端预测问题数据集OpenForesight,用GRPO训练的OpenForecaster8B在预测准确率和校准度上媲美更大规模的专有模型

Nikhil Chandak, Shashwat Goel, Ameya Prabhu, Moritz Hardt, Jonas Geiping 2026-01-01
开放端推理 强化学习 数据生成 语言模型训练 预测系统