找到 232 条结果

用反事实证据干预把“答案是否依赖视觉证据”变成GRPO奖励,让VLM不再靠语言先验答题。

Haojie Huang, Xinlei Yu, Chengming Xu, Zhangquan Chen, Cheng Yang, Qingdong... 2026-08-11
GRPO 反事实推理 多模态大模型 奖励设计 强化学习后训练

提出SAF四阶段流水线融合GRPO与OPD优势,避免熵坍塌并稳定提升性能。

Yifan Ding, Xincheng Wei, Yoshua Y. Li, Ziheng Li, Yuquan Lu, Siyu Zhang,... 2026-08-03
GRPO RLVR 强化学习 熵坍塌 知识蒸馏

用统一策略在行动前依据当前状态重构检索经验,GRPO 端到端训练

Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei,... 2026-07-31
GRPO LLM智能体 POMDP 强化学习 经验重构