找到 118 条结果

提出首个面向数据分析Agent的环境感知过程奖励模型DataPRM,三元奖励+主动环境交互突破通用PRM盲区

Zhisong Qiu, Shuofei Qiao, Kewei Xu, Yuqi Zhu, Lun Du, Ningyu Zhang, Huajun Chen 2026-04-28
Data Analysis Agent LLM Agent Process Reward Model Reinforcement Learning Silent Error Detection

构建 PlayEval 基准与 PlayTester 多模态测试代理,提出 PlayCoder 多智能体框架通过"视觉驱动测试+自动修复"闭环修复 GUI 代码的隐性逻辑缺陷。

Zhiyuan Peng, Wei Tao, Xin Yin, Chenhao Ying, Yuan Luo, Yiwen Guo 2026-04-22
GUI 应用 LLM Agent 代码生成 基准测试 多智能体系统

提出 MPT 基准与 PREFINE 方法,将用户偏好建模为可修订的假设,以极少 token 解决工具调用中的潜在偏好推理问题。

Yejin Yoon, Minseo Kim, Taeuk Kim 2026-04-21
Benchmark LLM Agent Memory Mechanism Personalization Tool Use

一个具备认知库与分析器的智能体进化框架,在架构、数据、RL算法三大 AI 子领域同步发现超越人类专家的设计。

Weixian Xu, Tiantian Mi, Yixiu Liu, Yang Nan, Zhimeng Zhou, Lyumanshan Ye,... 2026-04-03
AI-for-AI LLM Agent 强化学习算法设计 数据清洗 智能体框架