找到 998 条结果

在短上下文GRPO中按推理步置信度屏蔽优势,稳定高效压缩推理链。

Han Wang, Xiaodong Yu, Jialian Wu, Jiang Liu, Ximeng Sun, Mohit Bansal, Zicheng Liu 2026-04-28
DeepScaleR GRPO 强化学习 推理压缩 步级信用分配