找到 979 条结果

用世界模型替代昂贵的沙箱执行训练研究智能体,在线去偏去噪,训练加速3-4倍且性能更优。

Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan... 2026-09-10
LLM后训练 世界模型 具身智能 强化学习 自动研究智能体

密集执行奖励+TITO/R3稳定化,将122B MoE模型RL训练为64.0%解题率的终端智能体

Junyao Yang, Yucheng Shi, Zhongzhi Li, Ruhan Wang, Zongxia Li, Haitao Mi,... 2026-09-10
MoE训练稳定性 PPO 可验证奖励 强化学习 终端智能体

用自然语言指令与音频上下文统一语音生成和编辑的开源基础模型,四步推理提速4.5倍

Ziyang Ma, Zhikang Niu, Wenming Tu, Tianrui Wang, Ruiqi Yan, Junxi Liu,... 2026-09-09
偏好优化 开源模型 强化学习 整流流 统一基础模型

按控制器决策的最大因果触达,把智能体视觉生成统一划分为 L0–L4 五层的综述与评估框架

Yinming Huang, Shuyuan Tu, Xi Yan, Jiahao Zhan, Zihan Yang, Zhen Xing, Hui... 2026-09-09
LLM控制器 图像与视频生成 强化学习 智能体视觉生成 综述