找到 979 条结果

用变分后验采样扰动权重替代温度调节,为GRPO注入参数空间探索

Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych 2026-08-13
LLM后训练 RLVR 参数空间探索 变分推断 强化学习

低分辨率通读全文、按需放大关键区域,让8B模型在长文档问答上同时更准、更快、更少幻觉

Kaican Li, Weiyan Xie, Lewei Yao, Jiannan Wu, Lanqing Hong, Yongxiang Huang,... 2026-08-12
主动感知 以图思考 多模态大模型 强化学习 视觉智能体

用自演化的音频接地评分标准做过程级奖励,提升音频推理质量

Fangxu Yu, Tao Feng, Dehai Min, Zinan Lin, Weijia Xu, Michael Xu, Philip S.... 2026-08-10
大音频语言模型 强化学习 评分标准奖励 过程监督 音频推理

递归地生成已验证的长程终端智能体训练任务,低成本可扩展

Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang,... 2026-08-06
任务进化 合成数据 强化学习 监督微调 终端智能体