找到 979 条结果

TREK扩展GRPO探索支持,提升数学和Agent性能

Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian... 2026-07-08
Agent 大语言模型 强化学习 数学推理 知识蒸馏

从专家视频演示中学习进度排名,用Spearman相关系数作为无奖励RL的奖励信号

Yuriy Maksyuta, George Bredis, Ruslan Rakhimov, Daniil Gavrilov 2026-07-08
奖励学习 强化学习 无奖励控制 视觉语言模型 视频演示

BRAID框架将文本-图像交错推理统一为MDP,联合优化文本和图像生成

Zican Hu, Xuyang Hu, Yiming Liu, Zuwei Long, Wei Liu, Yunzhuo Hao, Jiawei... 2026-07-07
TIT-CoT 多模态推理 强化学习 统一多模态模型 视觉思考奖励

通过利用LLM评分token的完整分布实现细粒度反馈的通用验证框架,在多个领域达到SOTA性能

Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea... 2026-07-07
奖励建模 强化学习 智能体 测试时缩放 验证

通过双循环框架学习可复用的漏洞复现策略,显著提升LLM代理在仓库级漏洞复现任务中的表现

Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang,... 2026-07-07
强化学习 漏洞复现 策略学习 网络安全 软件工程智能体

使用强化学习自适应调整LHC触发阈值,在保持背景率约束的同时提高信号效率

Zixin Ding, Shaghayegh Emami, Giovanna Salvi, Cecilia Tosciri, Abhijith... 2026-07-07
强化学习 流式控制 粒子物理 约束优化 触发控制

提出分布级奖励框架解决样本级RL的reward hacking问题,显著提升生成质量

Ruihang Li, Mengde Xu, Shuyang Gu, Leigang Qu, Fuli Feng, Han Hu, Wenjie Wang 2026-07-03
Flow Matching 分布匹配 强化学习 扩散模型 模型合并

提出P2R框架,将细粒度视觉推理解耦为感知定位和推理回答两个阶段,仅需最终答案监督

Hongxing Li, Xiufeng Huang, Dingming Li, Wenjing Jiang, Zixuan Wang, Haolei... 2026-07-02
多模态大模型 强化学习 感知推理解耦 细粒度视觉理解 视觉推理

结合扩散模型与价值函数的在线模型预测控制方法

Christopher Lindenberg, Kashyap Chitta 2026-07-02
世界模型 强化学习 扩散模型 模型预测控制