找到 979 条结果

首个端到端AI系统,从自然语言生成可平折的可识别折纸设计,结合神经符号方法与强化学习优化美学质量

Tom Zahavy, Shaobo Hou, Thomas Tumiel, James Doran, Francesco Faccio, Xidong... 2026-06-26
几何约束 协同创意 强化学习 生成式设计 神经符号系统

研究后训练阶段对生物推理模型泛化的不同影响

Lukas Fesser, Hanlin Zhang, Michelle M. Li, Eric Wang, Bryan Perozzi,... 2026-06-26
后训练 多模态学习 强化学习 泛化能力 生物推理

首个公开agent训练pipeline,100+实验,32B模型超越基线3.9pp

Negin Raoof, Richard Zhuang, Marianna Nezhurina, Etash Guha, Atula Tejaswi,... 2026-06-24
Agent训练 开源基准测试 强化学习 数据构建 监督微调

区分工具型与内禀型系统,提出基于分层目标、演化身份和自调节的GIC架构

Eric Xing, Mingkai Deng, Jinyu Hou 2026-06-24
世界模型 分层规划 强化学习 智能体架构 自监督学习

提出智能体数据裁剪框架,将高熵原始多模态流转换为意图对齐的结构化训练数据

Cong Wan, Zeyu Guo, Zijian Cai, Jiangyang Li, SongLin Dong, Lin Peng,... 2026-06-23
多模态学习 强化学习 数据合成 数据工程 智能体

结合真实与模拟应用环境的手机代理训练方法,大幅提升任务成功率

Zhengyang Tang, Xin Lai, Pengyuan Lyu, Xinyuan Wang, Tianyi Bai, Chenxin Li,... 2026-06-23
GUI代理 人机交互 多环境训练 强化学习 手机代理

提出大规模RL数据集和简单配方训练强终端智能体

Hamish Ivison, Junjie Oscar Yin, Rulin Shao, Teng Xiao, Nathan Lambert,... 2026-06-23
强化学习 数据生成 智能体训练 终端智能体