评估大模型在流体力学/固体力学/材料/PDE四域能否通过多轮对话澄清科学任务。
Nithin Somasekharan, Youssef Hassan, Shiyao Lin, Gihan Panapitiya, Patrick...
2026-05-19
LLM评测
任务形式化
基准测试
对话澄清
智能体
冻结LLM权重,用四智能体+可训练知识图谱的闭环系统让代码生成越用越强。
Han Li, Jinyu Tian, Rili Feng, Yuqiao Du, Chong Zheng, Chenyu Wang, Chenchen...
2026-05-18
REINFORCE
代码生成
多智能体系统
强化学习
智能体
用 Hölder 平均统一 GRPO 系列聚合方式,提出动态 p 退火。
Yuxiang Chen, Dingli Liang, Yihang Chen, Ziqin Gong, Chenyang Le, Zhaokai...
2026-05-18
GRPO
Hölder 平均
大语言模型
强化学习
智能体
用检查表引导的自训练规划器+VLM奖励驱动的工具编排器,解决抽象长程图像编辑难题
Anirudh Sundara Rajan, Krishna Kumar Singh, Yong Jae Lee
2026-05-18
图像编辑
多模态大模型
工具调用
扩散模型
智能体
用100条偏好样本自演化技能与工具库,冻结VLM即可超越GPT-5的图像编辑奖励。
Yuxuan Zhang, Penghui Du, Bo Li, Cong Wei, Junwen Miao, Huaisong Zhang,...
2026-05-15
上下文学习
图像编辑
奖励建模
强化学习
智能体
首个 ICU 时序临床决策基准,用事后标注揭示 LLM 在长程推理中的两大失效模式。
Chengzhi Shen, Weixiang Shen, Tobias Susetzky, Chen, Jun Li, Yuyuan Liu,...
2026-05-14
临床决策
医疗AI
基准测试
智能体
记忆机制
用多流并行格式重塑LLM推理,解除单流chat的串行阻塞
Guinan Su, Yanwu Yang, Xueyan Li, Jonas Geiping
2026-05-13
LLM架构
可监控性
安全性
并行生成
指令微调
把“可编译”LaTeX 转成“可发表”PDF 的视觉闭环智能体
Bihui Yu, Xinglong Xu, Junjie Jiang, Jiabei Cheng, Caijun Jia, Siyuan Li,...
2026-05-12
LaTeX 排版
基准测试
文档自动化
智能体
视觉语言模型
NCBI/Ensembl/UniProt生物医学工具调用数据集,4B模型反超GPT-5.1
Xin Gao, Ruiyi Zhang, Meixi Du, Peijia Qin, Pengtao Xie
2026-05-08
LLM微调
工具调用
数据集
智能体
生物医学
通过构建4K实体/15万可供性知识库与1.4万任务,系统揭示LLM在部件级创造性工具重用上的根本性短板
Cheng Qian, Hyeonjeong Ha, Jiayu Liu, Jeonghwan Kim, Jiateng Liu, Bingxuan...
2026-05-07
LLM评测
创造性推理
可供性(affordance)
工具使用
智能体
LLM幻觉源于判别力鸿沟,提出忠实不确定性作为缓解之道
Gal Yona, Mor Geva, Yossi Matias
2026-05-05
AI可信度
LLM幻觉
不确定性量化
元认知
智能体
用 persona 合成虚拟计算机,让 agent 在上跑 2000+ 回合的月度生产力仿真。
Tao Ge, Baolin Peng, Hao Cheng, Jianfeng Gao
2026-05-01
合成数据
智能体
生产力仿真
自我改进
长时任务
Z.ai发布原生多模态智能体基座,集成CogViT与多任务RL。
V Team, Wenyi Hong, Xiaotao Gu, Ziyang Pan, Zhen Yang, Yuting Wang, Yue...
2026-04-30
GUI Agent
多模态大模型
工具调用
强化学习
智能体
通过分析基线智能体失败轨迹动态选择专用子智能体子集,在 τ-bench/τ-trait/ACEBench 上为开源 LLM 带来最高 27% 的成功率提升。
Amir Saeidi, Venkatesh Mishra, Souradeep Mukhopadhyay, Gaowen Liu, Ali...
2026-04-30
多智能体编排
失败分析
工具调用
开源大模型
智能体
首篇系统梳理 LLM 驱动对话用户模拟的综述,提出 Who/What/How 三维统一分类法。
Bo Ni, Leyao Wang, Yu Wang, Branislav Kveton, Franck Dernoncourt, Yu Xia,...
2026-04-30
大语言模型
对话系统
智能体
用户模拟
综述
清华团队零代码生成可交互 STEM 课件,3 个月课堂试点让学困生收益最大
Shangqing Tu, Yanjia Li, Keyu Chen, Sichen Zhang, Jifan Yu, Daniel Zhang-Li,...
2026-04-29
人机交互
教育技术
智能体
生成式 UI
课件生成
提出 L1/L2/L3 三级能力 × 物理/数字/社会/科学四规律的二维世界建模分类法
Meng Chu, Xuan Billy Zhang, Kevin Qinghong Lin, Lingdong Kong, Jize Zhang,...
2026-04-27
AI for Science
世界模型
强化学习
智能体
理论框架
用结构化轨迹摘要+RTV+PDR,在长程智能体编码上系统提升测试时计算增益。
Joongwon Kim, Wannan Yang, Kelvin Niu, Hongming Zhang, Yun Zhu, Eryk...
2026-04-23
LLM
SWE-Bench
代码生成
推理扩展
智能体
提出 BEHEMOTH 基准与 CluE 集群进化方法,解决异构 LLM 记忆提取难题。
Yuqing Yang, Tengxiao Liu, Wang Bill Zhu, Taiwei Shi, Linxin Song, Robin Jia
2026-04-23
LLM 记忆系统
基准评测
异构任务
智能体
自进化提示词
1978个MCP环境+19822工具,GRPO自演化闭环训练,23个基准全面领先开源基线。
Guanting Dong, Junting Lu, Junjie Huang, Wanjun Zhong, Longxiang Liu, Shijue...
2026-04-21
GRPO
MCP
可验证奖励
工具调用
强化学习