找到 979 条结果

RecVerse用认知分层记忆与轨迹级强化学习,在真实GUI环境中忠实模拟人类购物行为

Jiakai Tang, Yan Mi, Jing Yu, Yang Zhang, See-Kiong Ng, Qi Cao, Fei Sun, Xu... 2026-08-24
GUI智能体 大语言模型智能体 强化学习 推荐系统 用户行为模拟

用可插拔组件包裹静态环境,按策略弱点自动定制训练环境,显著提升智能体学习

Chengsong Huang, Zifeng Wang, Rujun Han, Jun Yan, Yanfei Chen, Zoey CuiZhu,... 2026-08-21
LLM智能体 强化学习 智能体学习 环境定制 自动化课程

用VLM编排VLA探索采集新任务数据,再经蒸馏与残差RL高效微调

Bhavya Sukhija, Oliver Groth, Mohit Shridhar, Tim Hertweck, Michael Bloesch,... 2026-08-21
VLA 强化学习 机器人操作 模仿学习

将原生编码智能体框架桥接到策略梯度训练,SWE-bench解决率最高提升9.4个百分点

Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen,... 2026-08-19
MoE SWE-bench 强化学习 智能体训练框架 编码智能体

RLVR 在提升当前任务的同时,会把未来任务的成功轨迹挤到固定预算内难以采样

Shaohang Wei, Zikun Su, Feifan Song, Wen Luo, Wei Li, Guangyue Peng, Houfeng Wang 2026-08-17
RLVR 大语言模型 强化学习 持续学习 指令跟随

397B 参数科学智能体基础模型:多模态科学理解、可验证强化学习与长程智能体训练的统一

Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen, Guangran Cheng,... 2026-08-14
后训练 基础模型 多模态 强化学习 时间序列