首尾片段完形填空式评测揭示视频LLM的时序对齐瓶颈
Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu, Jiahao Meng, Han Chen, Ziyu Wang,...
2026-09-11
Video-LLM
基准评测
完形填空
时序推理
视频理解
构建660个证据支撑实例,发现LLM定位研究想法中的实现关键缺陷是主要瓶颈
Yiling Ma, Yilun Zhao, Sihong Wu, Manasi Patwardhan, Arman Cohan
2026-09-11
LLM科研智能体
可复现性
基准评测
规范缺陷分析
需求澄清
封堵SWE-Bench Pro的答案泄漏并修复题目缺陷,发布731题防作弊验证版基准
Pujun Zheng, Zixin Shang, Shufan Jiang, Wenhui Tian, Dongsheng Zhu, Zerun...
2026-09-10
LLM智能体
基准评测
数据质量
软件工程
提出关系感知情感支持对话新任务,用真实伴侣与家庭访谈基准揭示大模型关系推理短板
Haichuan Hu, Yang Xiao, Mingni Tang, Jiawen Duan, Quanjun Zhang, Congqing...
2026-09-10
LLM评估
关系建模
基准评测
多方对话
心理治疗
首个用 LLM 智能体贯通自动驾驶规划器场景测试全流程的统一对话式框架
Yuan Gao, Sebastian Müller, Mattia Piccinini, Marc Kaufeld, Yuchen Zhang,...
2026-09-10
LLM智能体
场景生成
基准评测
提示工程
自动驾驶测试
用MoCap驱动深度条件视频扩散构建1.9万段合成步行视频,证明合成监督可有效迁移到真实步态估计。
Soroush Mehraban, Xin Lei Lin, Vida Adeli, Majid Mirmehdi, Amirhossein...
2026-09-09
临床运动分析
合成数据集
基准评测
步态分析
视频扩散模型
将 MNIST 改造为部分可观测探索任务,暴露多模态智能体感知状态构建的三大瓶颈
Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria
2026-09-01
POMDP
主动感知
基准评测
多模态智能体
工作记忆
提出多轮图表精修基准与多智能体系统,破解质量漂移与遗忘两大失败模式
Xueqing Wu, Ashwin Balasubramanian, Bingxuan Li, Dawei Zhu, Kai-Wei Chang,...
2026-09-01
图像编辑
基准评测
多智能体
多轮交互
科学图表生成
首个评估LLM多轮维护可执行界面的基准:单轮通过率严重高估五轮全流程可靠性
Yue Peng, Lanke Xia, Zihan Wang, Jiahao Ye, Ke Ning, Hongyi Wen
2026-09-01
LLM智能体
前端代码生成
基准评测
多轮交互
工具调用
ElephantBench闭卷探针揭示:最强模型对长尾分歧事实也仅能完整回忆52.4%
Zhuoshi Pan, Junru Lu, Yan Qian, H. Vicky Zhao, Di Yin, Xing Sun
2026-08-31
参数化记忆
基准评测
知识冲突
长尾知识
闭卷问答
27任务810实例的过程敏感基准:最强视频模型Seedance 2.0推理也仅51.0分
Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao...
2026-08-27
VLM-as-Judge
基准评测
扩散模型
视觉推理
视频生成
用迁移审计+行为测试+智能体验证三阶段协议评估编码智能体的全仓库迁移能力
Deyao Hong, Yizhe Chi, Wenyi Li, Xiaoqiu Wang, Mingju Gao, Kaisen Yang,...
2026-08-27
仓库迁移
代码智能体
基准评测
智能体验证
软件工程
交互式有状态移动沙盒,四维评测移动规划智能体的工具调用与规划能力
Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen,...
2026-08-25
LLM智能体
基准评测
多智能体协作
工具调用
移动AI
778个机器可验证长工作流任务证明验证器确认的执行经验Gene显著优于Skill
Xiao Zhang, Qumeng Sun, Jihao Li, Yiming Ren, Xiang Liu, Haoyang Zhang, Junjie Wang
2026-08-25
LLM智能体
基准评测
经验复用
长工作流
PatternEval诊断基准与PatternRL训练对齐混合思考MLLM的响应行为
Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin...
2026-08-24
基准评测
多模态大模型
奖励模型
强化学习
混合思考
119项任务、98个仓库、20个科学领域的基准,揭示编码智能体修复科学软件的失败机理
Zhipeng Xu, Jiahao Lu, Yining Zheng, Yuxin Wang, Xipeng Qiu
2026-08-21
基准评测
失败机理分析
科学计算
编码智能体
软件工程
记忆并非总是有益:正确且相关的记忆也会诱发认知陷阱,使模型推理固着、信念扭曲、性能大跌
Mengru Wang, Haozhe Luo, Zhenqian Xu, Zhixiang Cui, Haoming Xu, Qu Yang,...
2026-08-21
AI安全
LLM记忆
信念扭曲
基准评测
推理固着
LLM 与嵌入模型在 37 项任务上整体打平,但成本最高 1431 倍、吞吐低 2.5–736 倍
Adnan El Assadi, Niklas Muennighoff, Jinhyuk Lee
2026-08-21
LLM
基准评测
成本效益分析
文本嵌入
检索
155个日本长视频、1481道选择题,联合评测长视频叙事追踪与文化隐含义推理
Yuheng Huang, Jianlang Chen, Jiayang Song, Hua Qi, Aza Kai, Vincent Markert,...
2026-08-21
基准评测
多模态大模型
文化理解
视频问答
长视频理解
固定回复重放把匹配分数分解为传输损伤与契约补偿,揭示命令路径如何颠覆模型排名
Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang
2026-08-21
LLM智能体
Shell命令生成
基准评测
评测方法论
鲁棒性