首次系统性揭示代码混合查询使现代检索器全面退化的鲁棒性瓶颈
Qingcheng Zeng, Yuheng Lu, Zeqi Zhou, Heli Qi, Puxuan Yu, Fuheng Zhao,...
2026-04-22
代码混合
信息检索
基准测试
多语言
嵌入模型
首个基于ART认知分类法评估MLLM视觉空间推理能力的合成基准,揭示人类与模型间30+个百分点的能力鸿沟。
Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti, Vineeth N...
2026-04-22
基准测试
多模态大语言模型
流体智能
视觉推理
认知科学
用LLM三模块流水线按需生成1040个agent评测环境,成本降13800倍
Xirui Li, Ming Li, Derry Xu, Wei-Lin Chiang, Ion Stoica, Cho-Jui Hsieh, Tianyi Zhou
2026-04-21
LLM Agent
claw-like agents
基准测试
智能体评测
自动环境生成
首个衡量模型能否「在没人点拨时自发识别问题本质」的基准;223个博弈论知识工作场景,最强模型仅27.9%通过。
Ankit Maloo
2026-04-21
博弈论
基准测试
智能体
知识工作
评估
提出分层多模态智能体框架,把 AIGC 工具作为一等动作协调生成风格一致的网页。
Yan Li, Zezi Zeng, Yifan Yang, Yuqing Yang, Ning Liao, Weiwei Guo, Lili Qiu,...
2026-04-17
AIGC
基准测试
多模态智能体
层次化规划
网页生成
用LLM模拟100个职业场景,跨10大行业测评15个前沿智能体的鲁棒性与行业专长。
Xiaomeng Hu, Yinger Zhang, Fei Huang, Jianhong Tu, Yang Su, Lianghao Deng,...
2026-04-16
Agent评测
LLM世界模型
基准测试
工具调用
环境模拟
用轻量级BERT模型替代词汇方法,高效评估LLM答案正确性
Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Emmanuel Malherbe, Céline...
2026-04-15
LLM评估
基准测试
编码器模型
自动评估
提出LARYBench基准,评估潜在动作表示在语义理解和机器人控制两个维度上的能力
Dujun Nie, Fengjiao Chen, Qi Lv, Jun Kuang, Xiaoyu Li, Xuezhi Cao, Xunliang Cai
2026-04-15
具身智能
基准测试
机器人学习
潜在动作表示
视觉-动作对齐
用彩色网格转录任务暴露 VLM 从视觉编码到语言输出间的表征-表达鸿沟。
Yunkai Zhang, Linda Li, Yingxin Cui, Xiyuan Ruan, Zeyu Zheng, Kezhen Chen,...
2026-04-15
VLM
基准测试
密集空间感知
数字失认症
表征分析
22个任务/285子任务评估大模型在三维构造、全局约束和长时序规划上的空间能力。
Jash Vira, Ashley Harris
2026-04-15
ICLR 2026
全局约束
可执行评估
基准测试
大语言模型评测
评估统一数字智能体在复杂任务中组合视觉、搜索和编码能力的基准测试
CocoaBench Team, Shibo Hao, Zhining Zhang, Zhiqi Liang, Tianyang Liu, Yuheng...
2026-04-14
Agent评估
基准测试
多模态智能体
工具使用
NVIDIA 为推测解码算法提供兼顾语义多样性与生产级吞吐评估的统一基准
Talor Abramovich, Maor Ashkenazi, Carl, Putterman, Benjamin Chislett, Tiyasa...
2026-04-14
LLM推理加速
TensorRT-LLM
vLLM
基准测试
推测解码
首个 UMM 统一代码库,标准化 15 个模型的评估与后训练,揭示架构统一≠表征统一。
Yinyi Luo, Wenwen Wang, Hayes Bai, Hongyu Zhu, Hao Chen, Pan He, Marios...
2026-04-14
后训练
基准测试
多模态大模型
架构-表征解耦
统一评估
构建405道自然科学实验预测任务,揭示LLM在实验结果预测与可靠性校准上的双重缺陷
Udari Madhushani Sehwag, Elaine Lau, Haniyeh Ehsani Oskouie, Shayan Shabihi,...
2026-04-14
LLM评估
基准测试
实验预测
校准评估
科学发现
用 3021 道菜、5.27 张/菜的多视角图,系统评测 29 个视觉语言模型在精细分类、营养估计与饮食 VQA 三大任务上的真实能力。
Song Jin, Juntian Zhang, Xun Zhang, Zeying Tian, Fei Jiang, Guojun Yin, Wei...
2026-04-14
Chain-of-Thought
VQA
基准测试
多视角
细粒度识别
基于宝可梦Z-A的3D长视距VLM基准,揭示当前视觉语言模型的物理死锁恢复瓶颈。
Ruizhi Zhang, Ye Huang, Yuangang Pan, Chuanfu Shen, Zhilin Liu, Ting Xie,...
2026-04-10
3D开放世界
具身智能
基准测试
死锁恢复
视觉语言模型
构建跨文化基准评估VLM从图像推断文物元信息能力。
Yuechen Jiang, Enze Zhang, Md Mohsinul Kabir, Qianqian Xie, Stavroula...
2026-04-10
LLM-as-Judge
VLM
基准测试
多模态评测
文化遗产
提出三级层次和组基评估的视频理解基准,揭示SOTA模型与人类差距
Chaoyou Fu, Haozhi Yuan, Yuhao Dong, Yi-Fan Zhang, Yunhang Shen, Xiaoxing...
2026-04-08
基准测试
多模态大模型
视频理解
评估方法
首次系统评估LLM代理在现实场景中使用技能的效果,发现技能收益脆弱,查询特定精炼可恢复性能
Yujian Liu, Jiabao Ji, Li An, Tommi Jaakkola, Yang Zhang, Shiyu Chang
2026-04-08
LLM代理
基准测试
技能检索
技能精炼
提出双轴(动作×对象)改写基准 LIBERO-Para 与组合指标 PRIDE,系统揭示 VLA 模型在数据稀缺微调后对同义改写的系统性崩溃。
Chanyoung Kim, Minwoo Kim, Minseok Kang, Hyunwoo Kim, Dahuin Jung
2026-04-07
VLA
基准测试
机器人操控
自然语言理解
鲁棒性评估