找到 979 条结果

利用伪标签错误的非对称性,无标签地将自蒸馏与RL惩罚结合于测试时训练

Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu, Weiming Lu, Jun... 2026-08-28
LLM推理 在线策略自蒸馏 强化学习 无标签学习 测试时训练

300个程序化视觉推理任务+可验证奖励评分器,让视觉生成成为可训练、可验证、可优化的推理媒介

Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji, Tongxi Zhou,... 2026-08-27
交错生成 原生视觉推理 可验证奖励 基准测试 强化学习

把参考答案拆成原子量规条目,为VLM后训练提供细粒度、前缀定位的RL奖励

Shulin Tian, Minglun Li, Yuhao Dong, Hao Ding, Jiarui Yao, Haiwen Diao,... 2026-08-27
GRPO 后训练 多模态大模型 奖励设计 强化学习

用一个 ReLU 门控把在策略蒸馏改造成合法的 RLVR 方法,零新增超参数

Wenze Lin, Jiale Zhao, Xitai Jiang, Songde Rao, Yining Li, Shenzhi Wang,... 2026-08-26
RLVR 大模型后训练 强化学习 数学推理 知识蒸馏

用环境扩展与智能体协作扩展两条路线,把推理模型变成能完成长周期复杂工作的系统。

Apodex Team, B. An, B. Li, B. Wang, B. Zhang, B. L. Wang, C. Feng, C. Wei,... 2026-08-25
AgentOS 多智能体协作 强化学习 技术报告 智能体