找到 232 条结果

提出RLAD框架,通过信任区域比率蒸馏将教师指导嵌入GRPO更新,实现选择性模仿

Zhaoyang Zhang, Shuli Jiang, Yantao Shen, Yuting Zhang, Dhananjay Ram, Shuo... 2026-03-02
GRPO 大语言模型 强化学习 推理增强 知识蒸馏

提出一个专为物理AI设计的多模态批评模型,通过自我参照的批评微调来提升物理推理和评估能力。

Tianyi Xiong, Shihao Wang, Guilin Liu, Yi Dong, Ming Li, Heng Huang, Jan... 2026-02-12
GRPO 具身智能 多模态批评模型 强化学习 机器人学

从单 token 对数更新出发,建立 RFT 熵变化的理论框架并推导出实用的熵裁剪方法

Shumin Wang, Yuexiang Xie, Wenhao Zhang, Yuchang Sun, Yanxi Chen, Yaliang... 2026-02-09
GRPO LLM 训练理论 强化微调 熵动力学 策略优化

将动作视为潜在变量,通过前向-逆向模型交替优化实现无标注世界建模

Yifu Qiu, Zheng Zhao, Waylon Li, Yftah Ziser, Anna Korhonen, Shay B. Cohen,... 2026-02-09
GRPO 世界模型 强化学习 潜在变量 自改进学习