找到 448 条结果

用token级log概率差识别RLVR稀疏更新方向,提升推理精度

Kexin Huang, Haoming Meng, Junkang Wu, Jinda Lu, Chiyu Ma, Ziqian Chen, Xue... 2026-03-24
token级分析 大语言模型 强化学习 推理能力 策略优化

通过筛选高方差轮次和功能等价奖励,将SFT轨迹转化为高效RL训练,实现4倍计算节省同时保持OOD泛化

Junkeun Yi, Damon Mosk-Aoyama, Baihe Huang, Ritu Gala, Charles Wang, Sugam... 2026-03-24
GRPO 后训练 大语言模型 工具调用 强化学习

提出DTR框架,通过闭环智能体决策处理非结构化表格的复杂多步推理任务

Junnan Dong, Chuang Zhou, Zheng Yuan, Yifei Yu, Qiufeng Wang, Yinghui Li,... 2026-03-23
多步推理 大语言模型 智能体框架 经验学习 表格推理

评估大语言模型在真实地缘政治危机中推理能力的时间锚定研究

Ming Li, Xirui Li, Tianyi Zhou 2026-03-19
地缘政治推理 大语言模型 战争迷雾 时间推理 评估基准