找到 210 条结果

首个系统评估实时双工全模态交互的基准,含660视频与LLM时序评判框架

Chaoqun He, Mingyang Xiang, Yingjing Xu, Bokai Xu, Junbo Cui, Jie Zhou, Yuan... 2026-05-20
LLM-as-a-Judge 主动响应 多模态大模型 实时双工交互 时序对齐

提出首个基于 WISC 心理测量的交互式基准 ChildAgentEval,系统评估多模态智能体能否模拟 6-17 岁儿童的真实认知发展轨迹。

Yifan Shen, Jiawen Zhang, Jian Xu, Junho Kim, Ismini Lourentzou, Xu Cao,... 2026-05-19
儿童AI安全 多模态大模型 心理测量 技能蒸馏 智能体评估

首个无提示视频潜台词理解基准,揭示前沿多模态模型在讽刺、反讽与社会含义上的系统短板

Qi Li, Xinchao Wang 2026-05-15
基准测试 多模态大模型 社会语言学 视频理解 隐喻与反讽

提出 VAB 基准:把美学判断改为同主题集合比较,揭示前沿模型距人类专家仍有 42.4 点巨大差距。

Yichen Feng, Yuetai Li, Chunjiang Liu, Yuanyuan Chen, Fengqing Jiang, Yue... 2026-05-14
偏好判断 基准测试 多模态大模型 奖励模型 美学评估

首篇系统综述大模型时代音视觉感知/生成/交互三大支柱的统一分类法与方法论

You Qin, Kai Liu, Shengqiong Wu, Kai Wang, Shijian Deng, Yapeng Tian, Junbin... 2026-05-08
全模态对话 具身智能 多模态大模型 综述 音视频生成