找到 364 条结果

首个无提示视频潜台词理解基准,揭示前沿多模态模型在讽刺、反讽与社会含义上的系统短板

Qi Li, Xinchao Wang 2026-05-15
基准测试 多模态大模型 社会语言学 视频理解 隐喻与反讽

提出 VAB 基准:把美学判断改为同主题集合比较,揭示前沿模型距人类专家仍有 42.4 点巨大差距。

Yichen Feng, Yuetai Li, Chunjiang Liu, Yuanyuan Chen, Fengqing Jiang, Yue... 2026-05-14
偏好判断 基准测试 多模态大模型 奖励模型 美学评估

用评估技能+六阶段流水线让 Claude 自动为任意 agent 生成可执行的评估代码

Kang Zhou, Sangmin Woo, Haibo Ding, Kiran Ramnath, Subramanian Chidambaram,... 2026-05-14
LLM 评估 代码生成 基准测试 工具使用 智能体评估