真实资本下LLM交易代理的可靠性来自运行层而非模型本身
T. J. Barton, Chris Constantakis, Patti Hauseman, Annie Mous, Alaska...
2026-04-30
LLM Agent
Prompt工程
多智能体市场
失败模式分析
运行层设计
提出首个面向数据分析Agent的环境感知过程奖励模型DataPRM,三元奖励+主动环境交互突破通用PRM盲区
Zhisong Qiu, Shuofei Qiao, Kewei Xu, Yuqi Zhu, Lun Du, Ningyu Zhang, Huajun Chen
2026-04-28
Data Analysis Agent
LLM Agent
Process Reward Model
Reinforcement Learning
Silent Error Detection
TACO自演化压缩终端观测,免训练省token并保留关键证据。
Jincheng Ren, Siwei Wu, Yizhi Li, Kang Zhu, Shu Xu, Boyu Feng, Ruibin Yuan,...
2026-04-23
LLM Agent
上下文压缩
测试时适应
终端智能体
自演化
构建 PlayEval 基准与 PlayTester 多模态测试代理,提出 PlayCoder 多智能体框架通过"视觉驱动测试+自动修复"闭环修复 GUI 代码的隐性逻辑缺陷。
Zhiyuan Peng, Wei Tao, Xin Yin, Chenhao Ying, Yuan Luo, Yiwen Guo
2026-04-22
GUI 应用
LLM Agent
代码生成
基准测试
多智能体系统
首个多轮对话生成Dify/Coze工作流的评测基准,覆盖6大领域237实例
Yi Zhong, Buqiang Xu, Yijun Wang, Zifei Shan, Shuofei Qiao, Guozhou Zheng,...
2026-04-22
Agent基准
LLM Agent
可视化编排
多轮对话
工作流生成
用LLM三模块流水线按需生成1040个agent评测环境,成本降13800倍
Xirui Li, Ming Li, Derry Xu, Wei-Lin Chiang, Ion Stoica, Cho-Jui Hsieh, Tianyi Zhou
2026-04-21
LLM Agent
claw-like agents
基准测试
智能体评测
自动环境生成
用 9 个原子工具 + 四层记忆 + 自进化 SOP,把长程 LLM 智能体的 token 消耗压缩到基线的 1/3 同时保持最优任务完成率。
Jiaqing Liang, Jinyi Han, Weijia Li, Xinyi Wang, Zhoujia Zhang, Zishang...
2026-04-21
Context Engineering
LLM Agent
Memory Architecture
Self-Evolution
Token Efficiency
训练 LLM 在无任务无奖励下主动探索环境并提炼世界知识,实现真正的原生自演化。
Qifan Zhang, Dongyang Ma, Tianqing Fang, Jia Li, Jing Tang, Nuo Chen, Haitao...
2026-04-21
LLM Agent
Web Agent
世界知识
元学习
拒绝采样微调
提出 MPT 基准与 PREFINE 方法,将用户偏好建模为可修订的假设,以极少 token 解决工具调用中的潜在偏好推理问题。
Yejin Yoon, Minseo Kim, Taeuk Kim
2026-04-21
Benchmark
LLM Agent
Memory Mechanism
Personalization
Tool Use
用三 Agent 架构与四阶段训练流水线,让 30B 模型在深度搜索与研究任务上比肩百亿参数大模型。
MindDR Team, Li Auto Inc
2026-04-20
LLM Agent
多 Agent 系统
工具使用
强化学习
检索增强生成
提出分层基准 GTA-2,揭示前沿 LLM 工作流任务成功率仅 14.39%,执行框架远比模型能力更关键。
Jize Wang, Xuanxuan Liu, Yining Li, Songyang Zhang, Yijun Wang, Zifei Shan,...
2026-04-20
LLM Agent
可验证子目标
工具调用评测
执行框架评估
长视野工作流
把 LLM 技能当作代码、LLM 当作处理器,设计了一套编译+运行时系统,让技能在异构模型和 agent 框架上稳定高效执行。
Le Chen, Erhu Feng, Yubin Xia, Haibo Chen
2026-04-16
AOT/JIT
LLM Agent
Skills
异构执行
编译系统
系统性定义可自主赚取资源、跨基础设施复制与自我进化的AI智能体,分析其可行性、安全与社会风险。
Wenjie Qu, Xuandong Zhao, Jiaheng Zhang, Dawn Song
2026-04-16
AI Agent
AI治理
Agent经济
LLM Agent
分布式智能体
通过 PPI 让 LLM 动态处理任意多层级的指令冲突。
Jingyu Zhang, Tianjian Li, William Jurayj, Hongyuan Zhan, Benjamin Van...
2026-04-15
LLM Agent
Prompt 注入防御
基准评测
多智能体
指令层次
用并行上下文分支+前瞻路由让智能体按状态自选管理策略。
Zhaopeng Feng, Liangcai Su, Zhen Zhang, Xinyu Wang, Xiaotian Zhang, Xiaobin...
2026-04-13
BrowseComp
LLM Agent
Web Agent
上下文管理
深度信息检索
以外化为统一视角,重构 LLM 智能体从权重到 Harness 的演进逻辑。
Chenyu Zhou, Huacan Chai, Wenteng Chen, Zihan Guo, Rong Shan, Yuanyi Song,...
2026-04-10
Harness 工程
LLM Agent
协议
技能系统
综述
图结构+反向扩散,让 Agent 检索到可执行的最小技能包。
Dawei Li, Zongxia Li, Hongyang Du, Xiyang Wu, Shihang Gui, Yongbei Kuang, Lichao Sun
2026-04-10
Agent 技能检索
LLM Agent
Personalized PageRank
Skill 库
图结构检索
把论文拆成可验证声明,文献检索+代码执行双管齐下,标注证据等级但不替代人类判断。
Hang Xu, Ling Yue, Chaoqian Ouyang, Yuchen Liu, Libin Zheng, Shaowu Pan,...
2026-04-08
LLM Agent
RAG
代码执行
声明验证
复现性
通过上下文强化学习将agent技能内化到模型参数,实现零样本自主行为
Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Chengcheng Han, Qi Gu, Xunliang Cai,...
2026-04-03
LLM Agent
上下文学习
强化学习
技能内化
智能体
一个具备认知库与分析器的智能体进化框架,在架构、数据、RL算法三大 AI 子领域同步发现超越人类专家的设计。
Weixian Xu, Tiantian Mi, Yixiu Liu, Yang Nan, Zhimeng Zhou, Lyumanshan Ye,...
2026-04-03
AI-for-AI
LLM Agent
强化学习算法设计
数据清洗
智能体框架