主张 AI 需要独立于模型的连续性层,重建当下而非检索过去。
Samuel Sameer Tanguturi
2026-04-21
AI基础设施
存储架构
智能体
立场论文
记忆与检索
首个衡量模型能否「在没人点拨时自发识别问题本质」的基准;223个博弈论知识工作场景,最强模型仅27.9%通过。
Ankit Maloo
2026-04-21
博弈论
基准测试
智能体
知识工作
评估
用强化学习训练的工具调用Agent在胸部CT报告生成中显著超越3D视觉语言模型
Mélanie Roschewitz, Kenneth Styppa, Yitian Tao, Jiwoong Sohn, Jean-Benoit...
2026-04-17
医学AI
可解释性
强化学习
报告生成
智能体
将聚合本身视为智能体任务,通过轻量级工具导航并行轨迹实现高效跨轨迹推理
Yoonsang Lee, Howard Yen, Xi Ye, Danqi Chen
2026-04-14
多智能体协作
并行缩放
智能体
测试时计算
轨迹聚合
首篇系统综述 LLM 强化学习中信用分配的论文,梳理 2024-2026 年 47 种方法并提出粒度×方法学二维分类体系。
Chenchen Zhang
2026-04-14
信用分配
大语言模型
强化学习
推理RL
智能体
提出HDPO强化学习框架,解耦准确率与工具效率奖励,教会多模态智能体Metis“何时不用工具”。
Shilin Yan, Jintao Tong, Hongwei Xue, Xiaojun Tang, Yangyang Wang, Kunyu...
2026-04-10
GRPO
元认知
多模态大模型
工具使用
强化学习
用单个前沿教师模型结构化合成轨迹,将9B小模型在WebArena上提升至41.5%
Xing Han Lù, Siva Reddy
2026-04-10
LLM后训练
合成数据
智能体
知识蒸馏
网页导航
DBCooker:基于LLM的数据库原生函数自动合成系统,三大模块协同覆盖声明解析、参考单元复用与自适应编排,在三大主流数据库上平均准确率提升34.55%。
Wei Zhou, Xuanhe Zhou, Qikang He, Guoliang Li, Bingsheng He, Quanqing Xu, Fan Wu
2026-04-10
代码生成
大语言模型
数据库系统
智能体
软件工程
通过分层技能表示和自动化构建流程,让LLM智能体高效复用经验
Chenxi Wang, Zhuoyun Yu, Xin Xie, Wuguannan Yao, Runnan Fang, Shuofei Qiao,...
2026-04-07
工具使用
技能库
智能体
经验学习
长期规划
通过微尺度合成数据集使MLE任务的轨迹级在线强化学习成为现实
Yuhang Zhou, Lizhu Zhang, Yifan Wu, Jiayi Liu, Xiangjun Fan, Zhuokai Zhao, Hong Yan
2026-04-07
合成数据
多智能体系统
强化学习
智能体
机器学习工程
通过上下文强化学习将agent技能内化到模型参数,实现零样本自主行为
Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Chengcheng Han, Qi Gu, Xunliang Cai,...
2026-04-03
LLM Agent
上下文学习
强化学习
技能内化
智能体
自主研究管线自动发现多模态记忆架构,LoCoMo F1+411%
Jiaqi Liu, Zipeng Ling, Shi Qiu, Yanqing Liu, Siwei Han, Peng Xia, Haoqin...
2026-04-03
多模态记忆
智能体
混合检索
知识图谱
自主研究
首个支持过程评估和多模态的深度研究系统基准,覆盖100个真实任务
Fangda Ye, Yuxin Hu, Pengxiang Zhu, Yibo Li, Ziqi Jin, Yao Xiao, Yibo Wang,...
2026-04-02
基准测试
多模态评估
智能体
深度研究系统
过程评估
提出基于非对称FSM的Pare框架,通过模拟真实用户交互来评估主动助手。
Deepak Nathani, Cheng Zhang, Chang Huan, Jiaming Shan, Yinfei Yang, Alkesh...
2026-04-02
主动助手
人机交互
基准测试
大语言模型
智能体
首次系统研究LLM智能体在长期网页任务中处理用户中断的能力
Henry Peng Zou, Chunyu Miao, Wei-Chieh Huang, Yankai Chen, Yue Zhou, Hanrong...
2026-04-02
中断处理
基准测试
智能体
用户交互
网页导航
通过对比反思历史提交积累仓库特定技能,生成符合项目风格的代码
Mo Li, L. H. Xu, Qitai Tan, Ting Cao, Yunxin Liu
2026-03-30
LLM应用
代码生成
持续学习
智能体
软件工程
金融场景下LLM调用MCP工具的评测基准,含613样本与65个工具
Jie Zhu, Yimin Tian, Boyang Li, Kehao Wu, Zhongzhi Liang, Junhui Li, Xianyin...
2026-03-27
MCP
大语言模型
工具调用
智能体
评测基准
通过规划先于感知的迭代推理,让MLLM自主决定看什么、何时看、怎么看
Yaolun Zhang, Ruohui Wang, Jiahao Wang, Yepeng Tang, Xuanyu Zheng, Haonan...
2026-03-26
GRPO
多模态大语言模型
强化学习
智能体
视频理解
系统研究长视界工具使用代理的强化学习设计空间,提出STAR框架和规模感知的训练方法
Xixi Wu, Qianguo Sun, Ruiyang Zhang, Chao Song, Junlong Wu, Yiyan Qi, Hong Cheng
2026-03-24
大语言模型
工具使用
强化学习
智能体
长视界规划
通过读写反思学习,让LLM智能体自主构建、优化和复用技能库,实现无需参数更新的持续学习
Huichi Zhou, Siyuan Guo, Anjie Liu, Zhongwei Yu, Ziqin Gong, Bowen Zhao,...
2026-03-20
LLM
强化学习
技能学习
持续学习
智能体