找到 191 条结果

提出Z-Reward教师-学生框架,将推理增强的分数分布蒸馏到高效的学生奖励模型中

Xin Jin, Huanqia Cai, Zhen Li, Zechao Zhan, Dengyang Jiang, Aiming Hao,... 2026-06-11
奖励建模 强化学习 文本到图像生成 知识蒸馏 视觉语言模型

通过模态感知的一致性蒸馏,将世界动作模型的推理延迟从8.1秒降至348毫秒,实现23倍加速

Arman Akbari, Ci Zhang, Arash Akbari, Lin Zhao, Yixiao Chen, Weiwei Chen,... 2026-06-05
世界模型 实时控制 扩散模型 机器人 知识蒸馏

把全词表自蒸馏与RLVR奖励统一为策略梯度,稳定提升LLM推理性能。

Yifeng Liu, Shiyuan Zhang, Yifan Zhang, Quanquan Gu 2026-06-04
RLVR 大语言模型推理 强化学习 知识蒸馏 策略优化

用信任域分割策略梯度可靠区,稳定蒸馏推理小模型。

Xingrun Xing, Haoqing Wang, Boyan Gao, Ziheng Li, Yehui Tang 2026-06-03
在线策略蒸馏 小语言模型 强化学习 推理模型 知识蒸馏