找到 999 条结果

提出 Manager-Planner-Executor 三体架构的双记忆深度研究代理,通过交替强化学习与测试时学习解决长上下文记忆噪声与检索成本问题。

Jingyang Qiao, Weicheng Meng, Yu Cheng, Zhihang Lin, Zhizhong Zhang, Xin... 2026-04-07
多模态搜索 强化学习 智能体架构 测试时学习 深度研究代理

首次系统分析 RLVR 噪声标签机制,提出在线标签精炼方法 OLR。

Shenzhi Yang, Guangcheng Zhu, Bowen Song, Sharon Li, Haobo Wang, Xing Zheng,... 2026-04-07
GRPO RLVR 噪声标签学习 强化学习 推理大模型

让代码模型学会模拟程序执行,通过自验证和自修复提升代码正确率

Gallil Maimon, Ori Yoran, Felix Kreuk, Michael Hassid, Gal Cohen, Pierre... 2026-04-07
代码生成 强化学习 程序执行模拟 竞技编程 自验证

提出完全开源的视觉推理训练方案,通过六类任务的多任务RL实现广泛能力提升

Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu 2026-04-07
多任务学习 开放源代码 强化学习 视觉推理 视觉语言模型

SRPO将正确样本路由到GRPO、失败样本路由到SDPO,实现早期效率和长期稳定性的双重优势

Gengsheng Li, Tianyu Yang, Junfeng Fang, Mingyang Song, Mao Zheng, Haiyun... 2026-04-07
RLVR 大语言模型后训练 强化学习 策略优化 自蒸馏

通过微尺度合成数据集使MLE任务的轨迹级在线强化学习成为现实

Yuhang Zhou, Lizhu Zhang, Yifan Wu, Jiayi Liu, Xiangjun Fan, Zhuokai Zhao, Hong Yan 2026-04-07
合成数据 多智能体系统 强化学习 智能体 机器学习工程

系统性综述LLM在线策略蒸馏(OPD)的理论框架、方法分类、失败模式和工业实践

Mingyang Song, Mao Zheng 2026-04-02
在线策略学习 大语言模型 强化学习 模仿学习 知识蒸馏

允许LLM在代码生成过程中任意位置按需调用推理的新机制,实现自适应计算

Xue Jiang, Tianyu Zhang, Ge Li, Mengyang Liu, Taozhi Chen, Zhenhua Xu,... 2026-04-01
代码生成 大语言模型推理 强化学习 自适应计算

进化搜索+逐步训练框架实现GPU内核自动优化,超越Gemini-3.0-pro

He Du, Qiming Ge, Jiakai Hu, Aijun Yang, Zheng Cai, Zixian Huang, Sheng... 2026-03-31
GPU内核优化 Triton 代码生成 强化学习 进化算法