找到 124 条结果

提出 GSI-Bench:首个生成式空间智能基准,仿真训练可提升空间编辑与理解。

Muzhi Zhu, Shunyao Jiang, Huanyi Zheng, Zekai Luo, Hao Zhong, Anzhou Li,... 2026-04-23
Sim2Real 图像编辑 基准评测 多模态大模型 生成式空间智能

提出 BEHEMOTH 基准与 CluE 集群进化方法,解决异构 LLM 记忆提取难题。

Yuqing Yang, Tengxiao Liu, Wang Bill Zhu, Taiwei Shi, Linxin Song, Robin Jia 2026-04-23
LLM 记忆系统 基准评测 异构任务 智能体 自进化提示词

构建了跨越47国17语、3万+奥数题的MathNet基准,并首次系统性评测模型在数学等价检索上的能力。

Shaden Alshammari, Kevin Wen, Abrar Zainal, Mark Hamilton, Navid Safaei,... 2026-04-21
向量检索 基准评测 多模态 多语言 数学推理

首个覆盖工件级与型号级细粒度语义的制造领域MLLM基准,揭示领域知识才是性能瓶颈。

Xiangru Jian, Hao Xu, Wei Pang, Xinjian Zhao, Chengyu Tao, Qixin Zhang,... 2026-04-13
制造领域 域自适应 基准评测 多模态大模型 工业AI

提出将智能体个性化扎根于文件系统操作行为轨迹,包含数据引擎、诊断基准与自底向上记忆架构三件套

Shuai Liu, Shulin Tian, Kairui Hu, Yuhao Dong, Zhe Yang, Bo Li, Jingkang... 2026-04-07
LLM 智能体 个性化 基准评测 文件系统行为轨迹 智能体记忆系统

基于亿级应用流量的时间序列预测基准,揭示深度学习与基础模型的互补优势

Siqiao Xue, Zhaoyang Zhu, Wei Zhang, Rongyao Cai, Rui Wang, Yixiang Mu, Fan... 2026-04-02
基准评测 基础模型 时间序列预测 模型选择 深度学习

首个评估图像编辑模型学科推理能力的基准,揭示当前模型在知识密集型编辑中的巨大瓶颈

Mingxin Liu, Ziqian Fan, Zhaokai Wang, Leyao Gu, Zirun Zhu, Yiguo He, Yuchen... 2026-03-13
图像编辑 基准评测 多模态模型 学科推理 统一多模态模型