找到 999 条结果

提出StableDRL,通过无条件裁剪和自归一化解决dLLM强化学习中的奖励崩溃问题

Jianyuan Zhong, Kaibo Wang, Ding Ding, Zijin Feng, Haoli Bai, Yang Xiang,... 2026-03-09
GRPO 后训练优化 强化学习 扩散语言模型 训练稳定性

用多任务强化学习训练企业搜索智能体,在多类知识检索任务上超越闭源大模型

Jonathan D. Chang, Andrew Drozdov, Shubham Toshniwal, Owen Oertell,... 2026-03-06
信息检索 多任务学习 强化学习 测试时计算 知识智能体

通过成对比较和联合训练统一生成与验证,提升并行推理性能

Harman Singh, Xiuyu Li, Kusha Sareen, Monishwaran Maheswaran, Sijun Tan,... 2026-03-05
代码生成 并行推理 强化学习 数学推理 测试时扩展

用因果Transformer预测下一时刻嵌入,替代像素重建学习世界模型

George Bredis, Nikita Balagansky, Daniil Gavrilov, Ruslan Rakhimov 2026-03-04
Transformer 世界模型 强化学习 模型基强化学习 表征学习