找到 979 条结果

系统揭示OPD的探索催化本质,诊断信号失真病理,用零开销信号调控修复训练不稳定

Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, Kam-Fai Wong 2026-07-17
在线策略蒸馏 大模型后训练 强化学习 知识蒸馏 训练动力学

用强化学习训练智能体 RAG 协调语义检索、关键词检索与段落读取三类工具。

Varun Gandhi, Jaewook Lee, Shantanu Todmal, Franck Dernoncourt, Ryan Rossi,... 2026-07-17
Agentic RAG GRPO 上下文粒度 多跳问答 强化学习

0.8B端到端文档解析模型,靠数据引擎+多组件RL奖励+策略蒸馏刷新多项OCR榜单

Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang,... 2026-07-16
OCR 多模态大模型 强化学习 文档解析 知识蒸馏

把自我改进智能体形式化为参数更新与脚手架更新两条路径,统一梳理历史、分类、应用与评估。

Zhe Ren, Yimeng Chen, Dandan Guo, Guowei Rong, Tonghui Li, R. B. Xiong,... 2026-07-16
基础模型 工具使用 强化学习 提示优化 智能体

开放权重多乐器音乐转录模型,结合合成数据预训练、真实数据微调与强化学习后训练

Simon Rouard, Michael Krause, Axel Roebel, Carl-Johann Simon-Gabriel,... 2026-07-15
Transformer 多乐器建模 开放权重模型 强化学习 自动音乐转录

通过动态构造近端教师解决OPD优化不稳定性,零计算开销实现数学推理性能大幅提升

Zhengpeng Xie, Li Lyna Zhang, Zeke Xie, Mao Yang 2026-07-13
信任区域方法 大语言模型 强化学习 数学推理 知识蒸馏

提出AGENTCANVAS和KDLOOP系统化评估 embodied agents 的架构搜索效果

Jian Zhou, Sihao Lin, Jin Li, Shuai Fu, Gengze Zhou, Qi Wu 2026-07-09
Agent Architecture Search Embodied Agents LLM Agents 强化学习 视觉语言导航

让多模态大模型通过生成SVG代码进行可视化推理,提升空间理解能力

Kangheng Lin, Jisheng Yin, Dingming Li, En Yu, Yana Wei, Han Zhou, Liang... 2026-07-08
SVG可视化 多模态推理 强化学习 思维链 空间理解