找到 999 条结果

通过可执行代码作为感知媒介,系统性提升多模态大模型在STEM领域的视觉理解能力

Tongkun Guan, Zhibo Yang, Jianqiang Wan, Mingkun Yang, Zhengtao Guo, Zijian... 2026-03-12
STEM推理 代码生成 多模态学习 强化学习 视觉感知

HCAPO:用 LLM 自身做后视评分,把稀疏终局奖励拆解到关键步骤上。

Hui-Ze Tan, Xiao-Wen Yang, Hao Chen, Jie-Jing Shao, Yi Wen, Yuteng Shen,... 2026-03-12
GRPO改进 LLM Agent 信用分配 强化学习 长程任务

通过将观测分解为对象-属性结构,实现零样本跨域奖励预测

Yijun Shen, Delong Chen, Xianming Hu, Jiaming Mi, Hongbo Zhao, Kai Zhang,... 2026-03-11
世界模型 大语言模型 奖励预测 强化学习 智能体规划

揭示内在奖励的分布锐化机制与不可避免的崩溃,提出外部奖励作为可扩展替代路径

Bingxiang He, Yuxin Zuo, Zeyuan Liu, Shangziqi Zhao, Zixuan Fu, Junlin Yang,... 2026-03-10
LLM推理 RLVR 奖励工程 强化学习 无监督学习