找到 998 条结果

提出 L1/L2/L3 三级能力 × 物理/数字/社会/科学四规律的二维世界建模分类法

Meng Chu, Xuan Billy Zhang, Kevin Qinghong Lin, Lingdong Kong, Jize Zhang,... 2026-04-27
AI for Science 世界模型 强化学习 智能体 理论框架

用强化学习训练一个轻量 Actor 在长上下文中插入高亮标记,提升冻结 LLM 的证据利用能力。

Shaoang Li, Yanhang Shi, Yufei Li, Mingfu Liang, Xiaohan Wei, Yunchen Pu,... 2026-04-27
可迁移性 强化学习 提示优化 证据选择 长上下文

将前向KL与反向KL按token级信号混合,结合off-policy数据与轻量on-policy采样的统一蒸馏框架

Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu 2026-04-24
代码生成 大语言模型 强化学习 推理 知识蒸馏

用 RL options 框架训练 MoE 控制器,把切换率从 50%+ 压到 5% 以下。

Zeyu Shen, Peter Henderson 2026-04-24
LLM推理优化 Mixture-of-Experts Options Framework 强化学习 模型压缩

用两阶段RL课程让多模态大模型自主掌握视觉工具调用以解决复杂视觉推理

Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang,... 2026-04-23
GRPO 多模态大模型 工具调用 强化学习 视觉推理

首次系统证明在情感支持对话中,一个支持者回复可以同时包含多种支持策略,并提出两种生成方法结合认知推理与强化学习。

Jie Zhu, Huaixia Dou, Junhui Li, Lifan Guo, Feng Chen, Jinsong Su, Chi... 2026-04-21
GRPO LLM微调 强化学习 情感支持对话 策略建模