找到 979 条结果

利用Fisher-Rao距离检测注意力转移,动态重加权token级优势以提升MLLM跨模态推理。

Hangui Lin, Yan Shu, Zhengyang Liang, Chi Liu, Xiangrui Liu, Minghao Qin,... 2026-06-11
多模态大模型 强化学习 注意力机制 视觉推理 跨模态协调

提出使用单个LLM同时扮演Agent和环境两个角色,实现自举式协同进化,在多任务基准中平均提升超过4%

Xucong Wang, Ziyu Ma, Shidong Yang, Tongwen Huang, Pengkun Wang, Yong Wang,... 2026-06-10
Agent-环境协同进化 LLM智能体 世界模型 强化学习 自举学习

研究反馈结构对自蒸馏效果的影响,发现步骤对齐的反馈显著优于二值奖励和参考解

Semih Kara, Oğuzhan Ersoy 2026-06-10
反馈设计 强化学习 数学推理 自蒸馏 过程监督

QGF算法:测试时用Critic梯度引导流策略,避免反向传播

Zhiyuan Zhou, Andy Peng, Charles Xu, Qiyang Li, Tobias Springenberg, Kevin... 2026-06-10
强化学习 流匹配 测试时优化 离线强化学习 连续控制

从参数空间几何视角揭示OPD介于SFT和RLVR之间的独特更新轨迹与子空间锁定现象

Zhennan Shen, Yanshu Li, Qingyu Yin, Chak Tou Leong, Zhilin Wang, Yanxu... 2026-06-09
参数空间几何 在线策略蒸馏 大语言模型后训练 强化学习