找到 999 条结果

用token级log概率差识别RLVR稀疏更新方向,提升推理精度

Kexin Huang, Haoming Meng, Junkang Wu, Jinda Lu, Chiyu Ma, Ziqian Chen, Xue... 2026-03-24
token级分析 大语言模型 强化学习 推理能力 策略优化

通过筛选高方差轮次和功能等价奖励,将SFT轨迹转化为高效RL训练,实现4倍计算节省同时保持OOD泛化

Junkeun Yi, Damon Mosk-Aoyama, Baihe Huang, Ritu Gala, Charles Wang, Sugam... 2026-03-24
GRPO 后训练 大语言模型 工具调用 强化学习

为动作量化的行为克隆建立理论框架,证明稳定动力学下可实现最优样本复杂度

Haoqun Cao, Tengyang Xie 2026-03-24
动作量化 强化学习 理论分析 自回归模型 行为克隆

提出MAGNet模型解决连续环境中语义视听导航任务,在目标声音间歇或静默后仍能维持目标追踪

Yichen Zeng, Hebaixu Wang, Meng Liu, Yu Zhou, Chen Gao, Kehan Chen, Gongping Huang 2026-03-24
具身导航 多模态学习 强化学习 音频-视觉融合

用强化学习直接优化循环语言模型的隐空间推理步骤,实现更准更快的隐式推理

Guo Tang, Shixin Jiang, Heng Chang, Nuo Chen, Yuhan Li, Huiming Fan, Jia Li,... 2026-03-23
强化学习 循环语言模型 早退出 隐空间推理 预训练

通过部分级标注和过程奖励强化学习,实现逐步生成可编辑的矢量素描

Xiaodan Du, Ruize Xu, David Yunis, Yael Vinker, Greg Shakhnarovich 2026-03-23
多模态学习 强化学习 生成模型 矢量图形 计算机视觉

通过读写反思学习,让LLM智能体自主构建、优化和复用技能库,实现无需参数更新的持续学习

Huichi Zhou, Siyuan Guo, Anjie Liu, Zhongwei Yu, Ziqin Gong, Bowen Zhao,... 2026-03-20
LLM 强化学习 技能学习 持续学习 智能体