找到 999 条结果

提出Chain of Events范式,通过构建时序事件链提升MLLM的视频事件预测能力

Qile Su, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu 2026-03-19
事件预测 多模态大语言模型 强化学习 时序建模 视频理解

系统性研究LLM中间训练设计选择,揭示其与RL协同提升推理能力的机制

Bharat Runwal, Ashish Agrawal, Anurag Roy, Rameswar Panda 2026-03-19
中间训练 大语言模型训练 强化学习 推理能力 训练流水线

提出OEL框架,让语言模型从部署经验中持续自我改进

Tianzhu Ye, Li Dong, Qingxiu Dong, Xun Wu, Shaohan Huang, Furu Wei 2026-03-18
上下文蒸馏 在线学习 大语言模型 强化学习 持续学习

通过LoRA适配器、动态路由和预算强化学习,在移动设备上实现高效LLM推理。

Yelysei Bondarenko, Thomas Hehn, Rob Hesselink, Romain Lepert, Fabio Valerio... 2026-03-18
LoRA适配器 强化学习 移动端AI 边缘推理 量化

两阶段RL框架训练多模态Agent前瞻性规划能力,在7个基准上显著提升长视界任务性能

Yongyuan Liang, Shijie Zhou, Yu Gu, Hao Tan, Gang Wu, Franck Dernoncourt,... 2026-03-18
GUI控制 前瞻性规划 多模态智能体 工具使用 强化学习

用大规模社区反馈强化学习训练AI判断和提出高影响力研究想法

Jingqi Tong, Mingzhe Li, Hangcheng Li, Yongzhuo Yang, Yurong Mou, Weijie Ma,... 2026-03-17
GRPO 偏好学习 奖励模型 强化学习 科学智能体