找到 232 条结果

纯后训练专用模型家族,单次调用生成幻灯片与可交互课件,用可执行探针把交互性变成可测量的奖励信号

Shangqing Tu, Daniel Zhang-Li, Yucheng Wang, Shiyu Gan, Yanpeng Wang,... 2026-09-01
GRPO 后训练 国产算力适配 奖励攻击 奖励设计

用梯度对齐实时估计样本边际贡献并约束重加权,让RFT数据利用全程自适应

Haoru Tan, Sitong Wu, Yanfeng Chen, Shizhen Zhao, Yang-Tian Sun, Tianjia... 2026-09-01
GRPO 多模态推理 强化微调 数据选择 梯度对齐

把提示深度从单一标量改为在线估计的高斯分布,零额外采样实现每任务自适应引导

Zixuan Wang, Yanrui Miao, Zhengxi Lu, Teng Pan, Yiwen Qiu, Hongxing Li, Peng... 2026-08-27
GRPO 奖励稀疏 智能体强化学习 课程学习 长视野任务

把参考答案拆成原子量规条目,为VLM后训练提供细粒度、前缀定位的RL奖励

Shulin Tian, Minglun Li, Yuhao Dong, Hao Ding, Jiarui Yao, Haiwen Diao,... 2026-08-27
GRPO 后训练 多模态大模型 奖励设计 强化学习

阿里开源的电商直播全模态理解模型,用音视频时间对齐与忠实强化微调实现多项直播任务开源最佳。

Yibo Hu, Yu Qian, Mao Gu, Yingfan Tao, Yuhao Chen, Yongdong Luo, Zhuoqun... 2026-08-25
GRPO 全模态大模型 强化学习后训练 数据引擎 电商直播