找到 999 条结果

通过四阶段训练流程(中期训练、离线强化学习、在线强化学习、模型合并)构建统一的GUI智能体,在多个基准测试中达到SOTA

Veuns-Team, Changlong Gao, Zhangxuan Gu, Yulin Liu, Xinyu Qiu, Shuheng Shen,... 2026-02-11
GUI智能体 人机交互自动化 多模态大语言模型 强化学习 模型合并

通过两阶段迭代自我反馈机制提升LLM数学推理能力的强化学习算法

Ali Hatamizadeh, Shrimai Prabhumoye, Igor Gitman, Ximing Lu, Seungju Han,... 2026-02-11
GRPO扩展 强化学习 推理优化 数学推理 策略优化