找到 998 条结果

VideoRLVR框架用可验证奖励优化视频模型,提升规则验证任务的推理能力

Tinghui Zhu, Sheng Zhang, James Y. Huang, Selena Song, Xiaofei Wen, Yuankai... 2026-05-20
Flow-Matching 强化学习 扩散模型 视觉推理 视频生成

提出可量化指标 ECC 与交错训练策略,系统性解决 LLM 智能体在新环境中的过早利用失败。

Ziang Ye, Wentao Shi, Yuxin Liu, Yu Wang, Zhengzhou Cai, Yaorui Shi, Qi Gu,... 2026-05-18
GRPO LLM智能体 强化学习 环境理解 自主探索