用闭式公式精确界定红队基准能证明安全到何种程度
Bandana Kaur
2026-08-06
AI 安全
基准测试
红队评估
统计功效
证据理论
解耦图像描述的覆盖率与精度,发现理解靠覆盖、生成靠精度
Zhipeng Liu, Haochen Wang, Zhaoxiang Zhang
2026-08-05
图像描述评估
基准测试
数据质量分析
文生图
视觉语言模型
用问答得分度量代理代码解释可信度,并用差分测试自动改进
Zhiyuan Pan, Sungmin Kang, Imam Nur Bani Yusuf, Abhik Roychoudhury
2026-08-05
LLM代理
基准测试
属性测试
差分测试
解释可信度
分层诊断视频世界模型:外观、控制、空间一致性与内在反应性
Yuxue Yang, Shuyao Shang, Jiahe Wang, Zitong Zhou, Liang Tan, Junhan Zeng,...
2026-08-04
世界反应性
可控视频生成
基准测试
物理仿真
视频世界模型
揭示 LLM 系统性回避删除代码的偏差,构建 CanItDelete 基准并证明训练可缓解。
Amir M. Ebrahimi, Mohammed Mehedi Hasan, Aaditya Bhatia, Gopi Krishnan...
2026-08-04
LLM 智能体
代码编辑
后训练
基准测试
程序修复
新增行为推理基准,揭示智能体面对工具映射漂移时迷信穷举搜索而非演绎。
Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria
2026-08-04
LLM推理
基准测试
工具调用
智能体评测
行为推理
首个联合评测准确率、记录完整性、溯源与成本的文档抽取基准
Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo
2026-08-03
企业文档处理
基准测试
文档信息抽取
模式引导抽取
视觉语言模型
精修 SULAND 标注并在 35 种检测器上系统评估 RGB 地雷检测的 OOD 鲁棒性。
Sagar Lekhak, Prasanna Reddy Pulakurthi, Lalit Joshi, Ramesh Bhatta, Emmett...
2026-08-03
DETR
Faster R-CNN
OOD泛化
RGB图像
UAV/UGV遥感
用冻结3D人体网格重建量化多人交互编辑的解剖与接触几何,揭示VLM裁判的饱和盲区
Jiajia Lin, Mingxuan Du, Tuowen Zhou, Benfeng Xu, Hongtao Xie
2026-07-31
人体网格重建
图像编辑
基准测试
多人交互
接触几何
首个评估LLM智能体在主机被攻陷后进行取证调查与修复的基准
Lehan Wang, Boli Chen, Ruixue Ding, Pengjun Xie, Jinwei Huang, Zhendong Liu,...
2026-07-30
LLM智能体
入侵取证
基准测试
应急响应
网络安全
提出InMind基准,证明检索式记忆无法在查询前识别隐式关联的结构性盲区。
Ruizhe Li, Mingxuan Du, Benfeng Xu, Zhendong Mao
2026-07-29
基准测试
智能体记忆
检索增强生成
评测方法论
长期记忆
以电影学院级电影语言构建的多镜头T2V/R2V基准,揭示动态美学是当前瓶颈
Shengyi Wang, Niantong Li, Guangzheng Hu, Hong Qi, Fei Ding, Weixu Qiao,...
2026-07-28
参考条件生成
基准测试
多镜头视频
电影语言
自动化评测
首个统一下游驱动基准,同时评测LLM构造数据与评估数据质量两大能力
Hao Liang, Qifeng Cai, Yibo Lin, Jianzhuo Du, Qifeng Xia, Sizhe Qiu,...
2026-07-27
SFT数据
下游评测
域适应
基准测试
数据构造
首个评测 VLM 智能体在多物体 3D 场景上执行动作的可执行基准
Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian, Huanjin Yao,...
2026-07-27
3D 场景理解
VLM 智能体
具身智能
几何评估
动作执行
从人教版教材抽取课程知识图谱,统一支撑教育大模型的评测与微调。
Hao Liang, Qihan Lin, Zhaoyang Han, Xiaochen Ma, Zhen Hao Wong, Meiyi Qiang,...
2026-07-24
K12教育
基准测试
多模态
指令微调数据
教育大模型
覆盖代码/前端/办公/安全四领域的开放代码智能体评测套件,通过构造抗 prompt 污染
Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen, Xiang Fei, Yong Mao,...
2026-07-24
LLM-as-Judge
代码智能体
前端开发
办公自动化
基准测试
面向工业级金融文档的双语智能体推理基准,揭示当前系统的推理与布局短板。
Xianfu Cheng, Shiwei Zhang, Jiyu Zhao, Jian Yang, Xinyuan Wang, Ming Zhou,...
2026-07-24
基准测试
多跳推理
文档布局理解
智能体推理
检索增强生成
在 LaMARia 数据集上横跨四大范式基准测试六种 RGB 视觉 SLAM 系统的低光照表现
Oleh Basystyi, Anna Stasyshyn, Oleksandr Kosovan, Yaroslav Prytula
2026-07-23
SLAM
UGV
VIO
低光照
基准测试
首个将视频物理推理锚定到物理定律并分阶段诊断的基准
Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian, Ziang Cao,...
2026-07-21
世界模型
基准测试
思维链
物理推理
物理智能
提出3D-Fit基准,评测LLM在多重3D空间约束下的分子生成能力
Thomas MacDougall, Maksim Kuznetsov, Roman Schutski, Rim Shayakhmetov, Maxim...
2026-07-21
三维空间约束
分子生成
基准测试
大语言模型
扩散模型