面向LLM生成Triton内核的基准,揭示任务结构主导正确性、迭代只修不快。
Han Wang, Jintao Zhang, Kai Jiang, Haoxu Wang, Jianfei Chen, Jun Zhu
2026-05-08
GPU内核
LLM代码生成
Triton
基准评测
硬件效率
首个统一评估交互式世界模型的基准,提出动作生成框架,跨4.9K任务对14个模型做九维评测。
Jianjie Fang, Yingshan Lei, Qin Wan, Ziyou Wang, Yuchao Huang, Yongyan Xu,...
2026-05-06
交互式世界模型
具身智能
动作生成框架
基准评测
相机控制
首个面向海洋科学的统一多模态语料库,含50亿token与14万指令对
Yida Xue, Ningyu Zhang, Tingwei Wu, Zhe Ma, Daxiong Ji, Zhao Wang, Guozhou...
2026-05-05
基准评测
多模态大模型
指令微调
海洋科学
知识图谱
构建 Claw 风格个人智能体训练数据合成、SFT/RL 训练与基准评测的端到端可扩展框架。
Fei Bai, Huatong Song, Shuang Sun, Daixuan Cheng, Yike Yang, Chuan Hao,...
2026-04-30
基准评测
工具调用
强化学习
数据合成
智能体训练
提出 GSI-Bench:首个生成式空间智能基准,仿真训练可提升空间编辑与理解。
Muzhi Zhu, Shunyao Jiang, Huanyi Zheng, Zekai Luo, Hao Zhong, Anzhou Li,...
2026-04-23
Sim2Real
图像编辑
基准评测
多模态大模型
生成式空间智能
提出 BEHEMOTH 基准与 CluE 集群进化方法,解决异构 LLM 记忆提取难题。
Yuqing Yang, Tengxiao Liu, Wang Bill Zhu, Taiwei Shi, Linxin Song, Robin Jia
2026-04-23
LLM 记忆系统
基准评测
异构任务
智能体
自进化提示词
首个系统评测 Agent-as-a-Judge 的基准,带工具访问 F1 平均涨 13 点。
Wentao Shi, Yu Wang, Yuyang Zhao, Yuxin Chen, Fuli Feng, Xueyuan Hao, Xi Su,...
2026-04-22
LLM-as-a-Judge
基准评测
工具使用
强化学习
智能体评估
构建了跨越47国17语、3万+奥数题的MathNet基准,并首次系统性评测模型在数学等价检索上的能力。
Shaden Alshammari, Kevin Wen, Abrar Zainal, Mark Hamilton, Navid Safaei,...
2026-04-21
向量检索
基准评测
多模态
多语言
数学推理
构建可控多模态乘法基准,用算术负荷C与强迫续写探针揭示多模态LLM的乘法失误源于计算而非感知。
Samuel G. Balter, Ethan Jerzak, Connor T. Jerzak
2026-04-21
可解释性
启发式策略
基准评测
多模态大模型
算术推理
首个要求多模态(含视频/音频)网络检索与多跳推理的搜索增强代理评测基准
Han Wang, David Wan, Hyunji Lee, Thinh Pham, Mikaela Cankosyan, Weiyuan...
2026-04-16
Benchmark
基准评测
多模态检索
多跳推理
搜索增强代理
通过 PPI 让 LLM 动态处理任意多层级的指令冲突。
Jingyu Zhang, Tianjian Li, William Jurayj, Hongyuan Zhan, Benjamin Van...
2026-04-15
LLM Agent
Prompt 注入防御
基准评测
多智能体
指令层次
首个覆盖工件级与型号级细粒度语义的制造领域MLLM基准,揭示领域知识才是性能瓶颈。
Xiangru Jian, Hao Xu, Wei Pang, Xinjian Zhao, Chengyu Tao, Qixin Zhang,...
2026-04-13
制造领域
域自适应
基准评测
多模态大模型
工业AI
首个评估LLM自主发现软件bug能力的游戏基准,30个游戏124个bug,最优模型仅发现48.39%
Shufan Jiang, Chios Chen, Zhiyang Chen
2026-04-08
LLM代理
基准评测
多智能体系统
自主bug发现
质量保证
提出将智能体个性化扎根于文件系统操作行为轨迹,包含数据引擎、诊断基准与自底向上记忆架构三件套
Shuai Liu, Shulin Tian, Kairui Hu, Yuhao Dong, Zhe Yang, Bo Li, Jingkang...
2026-04-07
LLM 智能体
个性化
基准评测
文件系统行为轨迹
智能体记忆系统
基于亿级应用流量的时间序列预测基准,揭示深度学习与基础模型的互补优势
Siqiao Xue, Zhaoyang Zhu, Wei Zhang, Rongyao Cai, Rui Wang, Yixiang Mu, Fan...
2026-04-02
基准评测
基础模型
时间序列预测
模型选择
深度学习
提出首个面向多Agent环境感知评测的端到端基准,包含2.4K高密度标注的多视点游戏视频QA对,揭示MLLM在时序推理和跨视频理解上的显著不足。
Yunzhe Wang, Runhui Xu, Kexin Zheng, Tianyi Zhang, Jayavibhav Niranjan...
2026-03-26
基准评测
多Agent系统
多模态大模型
幻觉检测
时序推理
首个面向数据智能体评测的现实多数据库集成基准
Ruiying Ma, Shreya Shankar, Ruiqi Chen, Yiming Lin, Sepanta Zeighami,...
2026-03-25
基准评测
多数据库集成
数据智能体
自然语言查询
首个评测全模态模型社交互动能力的 who-when-how 三维基准
Tianyu Xie, Jinfa Huang, Yuexiao Ma, Rongfang Luo, Yan Yang, Wang Chen,...
2026-03-18
人机对话
全模态语言模型
基准评测
多模态
社交交互
2万题音视频联合推理基准,揭示最强模型仅64.2%准确率
Arushi Goel, Sreyan Ghosh, Vatsal Agarwal, Nishit Anand, Kaousheik...
2026-03-17
基准评测
多模态大模型
视频理解
长视频
音视频推理
首个评估图像编辑模型学科推理能力的基准,揭示当前模型在知识密集型编辑中的巨大瓶颈
Mingxin Liu, Ziqian Fan, Zhaokai Wang, Leyao Gu, Zirun Zhu, Yiguo He, Yuchen...
2026-03-13
图像编辑
基准评测
多模态模型
学科推理
统一多模态模型