找到 76 条结果

纯后训练专用模型家族,单次调用生成幻灯片与可交互课件,用可执行探针把交互性变成可测量的奖励信号

Shangqing Tu, Daniel Zhang-Li, Yucheng Wang, Shiyu Gan, Yanpeng Wang,... 2026-09-01
GRPO 后训练 国产算力适配 奖励攻击 奖励设计

把参考答案拆成原子量规条目,为VLM后训练提供细粒度、前缀定位的RL奖励

Shulin Tian, Minglun Li, Yuhao Dong, Hao Ding, Jiarui Yao, Haiwen Diao,... 2026-08-27
GRPO 后训练 多模态大模型 奖励设计 强化学习

397B 参数科学智能体基础模型:多模态科学理解、可验证强化学习与长程智能体训练的统一

Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen, Guangran Cheng,... 2026-08-14
后训练 基础模型 多模态 强化学习 时间序列