提出空间编辑基准+50万条合成数据+16B模型,专攻物体平移/旋转与相机视角控制。
Yicheng Xiao, Wenhu Zhang, Lin Song, Yukang Chen, Wenbo Li, Nan Jiang,...
2026-04-07
几何感知评估
合成数据
图像编辑
基准测试
扩散模型
过程验证的多模态智能体基准,评估视觉扩展与知识扩展的协同能力。
Qianshan Wei, Yishan Yang, Siyi Wang, Jinglin Chen, Binyu Wang, Jiaming...
2026-04-06
基准测试
多模态大模型
工具使用
智能体评测
视觉推理
评估Computer-Use代理多步执行轨迹级安全性的2,653实例基准
Yunhao Feng, Yifan Ding, Yingshui Tan, Xingjun Ma, Yige Li, Yutao Wu, Yifeng...
2026-04-06
基准测试
工具调用
智能体安全
红队评估
越狱
由1000余位专家贡献、覆盖7大专业领域的1346道开放性长程任务评测基准,并配套提出ShotJudge校准式自动评判框架。
Xue Liu, Xin Ma, Yuxin Ma, Yongchang Peng, Duo Wang, Zhoufutu Wen, Ge Zhang,...
2026-04-06
LLM评测
专家级任务
基准测试
开放域生成
提示工程
500题+5级层次化评估协议,证明主流视频MLLM在长视频细粒度时空证据定位上几乎全部失败(Level-5最高仅1%)。
Jiahao Meng, Tan Yue, Qi Xu, Haochen Wang, Zhongwei Ren, Weisong Liu, Yuhao...
2026-04-03
Thinking-with-Videos
基准测试
多模态大模型
时空定位
视频理解
首个覆盖17种语言、3400张数字+拍照文档的多语言解析基准,揭示开源模型在拍照与非拉丁脚本上大幅崩塌
Zhang Li, Zhibo Lin, Qiang Liu, Ziyang Zhang, Shuo Zhang, Zidun Guo, Jiajun...
2026-04-03
VLM评测
基准测试
多语言OCR
文档解析
真实场景
首个支持过程评估和多模态的深度研究系统基准,覆盖100个真实任务
Fangda Ye, Yuxin Hu, Pengxiang Zhu, Yibo Li, Ziqi Jin, Yao Xiao, Yibo Wang,...
2026-04-02
基准测试
多模态评估
智能体
深度研究系统
过程评估
提出一个三层级、自动化评估的视觉网站开发基准,揭示当前多模态编码代理在长周期任务中的系统性不足
Zehai He, Wenyi Hong, Zhen Yang, Ziyang Pan, Mingdao Liu, Xiaotao Gu, Jie Tang
2026-04-02
代码生成
基准测试
多模态模型
网站开发
自动化评估
首次提出统一的视觉生成推理基准,揭示当前AIGC模型在物理和因果推理上的严重缺陷
Haonan Han, Jiancheng Huang, Xiaopeng Sun, Junyan He, Rui Yang, Jie Hu,...
2026-04-02
因果推理
基准测试
多模态评估
视觉生成评估
零样本推理
首个强调感知中心推理的复杂视频理解基准,现有最强模型准确率仅45.96%
Shaoxuan Li, Zhixuan Zhao, Hanze Deng, Zirun Ma, Shulin Tian, Zuyan Liu,...
2026-04-02
基准测试
多模态推理
感知中心推理
视频理解
长时域推理
提出基于非对称FSM的Pare框架,通过模拟真实用户交互来评估主动助手。
Deepak Nathani, Cheng Zhang, Chang Huan, Jiaming Shan, Yinfei Yang, Alkesh...
2026-04-02
主动助手
人机交互
基准测试
大语言模型
智能体
提出MYPHONEBENCH框架,评估手机代理在完成任务时的隐私行为
Zhengyang Tang, Ke Ji, Xidong Wang, Zihan Ye, Xinyuan Wang, Yiduo Guo, Ziniu...
2026-04-02
Agent安全
GUI交互
基准测试
手机代理
隐私评估
首次系统研究LLM智能体在长期网页任务中处理用户中断的能力
Henry Peng Zou, Chunyu Miao, Wei-Chieh Huang, Yankai Chen, Yue Zhou, Hanrong...
2026-04-02
中断处理
基准测试
智能体
用户交互
网页导航
首个面向二维装配手册与实拍视频跨描绘对齐的VLM基准,揭示视觉编码器的表征鸿沟是根本瓶颈。
Zhuchenyang Liu, Yao Zhang, Yu Xiao
2026-04-02
基准测试
机理分析
装配辅助
视觉-语言模型
跨模态对齐
首个全面开源的CoT可监控性评估基准,揭示LLMs隐藏决策因素的能力与局限性
Han Wang, Yifan Sun, Brian Ko, Mann Talati, Jiawen Gong, Zimeng Li, Naicheng...
2026-04-01
AI安全
可解释性
基准测试
思维链监控
模型透明度
首个商业视觉生成系统化基准
Yan Li, Zezi Zeng, Ziwei Zhou, Xin Gao, Muzhao Tian, Yifan Yang, Mingxi...
2026-04-01
商业设计
图像生成
基准测试
多模态评估
布局控制
提出基于VQA的自动化评估框架CREval和基准CREval-Bench,解决复杂创意图像编辑的评估难题
Chonghuinan Wang, Zihan Chen, Yuxiang Wei, Tianyi Jiang, Xiaohe Wu, Fan Li,...
2026-04-01
VQA评估
图像编辑
基准测试
多模态大模型
自动评估
构建30个物理论文复现任务,评估AI智能体端到端科研复现能力,发现最佳系统仅34%正确率
Shi Qiu, Junyi Deng, Yiwei Deng, Haoran Dong, Jieyu Fu, Mao Li, Zeyu Li,...
2026-03-31
代码智能体
基准测试
物理研究
科学AI
论文复现
提出大规模多参考图像生成数据集和基准,解决现有模型在长上下文场景下的性能退化问题
Zhekai Chen, Yuqing Wang, Manyuan Zhang, Xihui Liu
2026-03-27
上下文学习
基准测试
多参考图像生成
数据集
长上下文
首个评估编码智能体迭代代码质量退化的基准,揭示代码腐化与冗余问题
Gabriel Orlanski, Devjeet Roy, Alexander Yun, Changho Shin, Alex Gu, Albert...
2026-03-27
代码智能体
代码质量
基准测试
软件工程
迭代开发