← 前一天
2026-07-15
后一天 → 今日

用235道人能轻松解出、AI却频频翻车的题,诊断前沿模型的顽固盲区

Matteo Santelmo, Xiuying Wei, Israa Fakih, Felix Bauer, Juan Garcia Giraldo,...
benchmark evaluation multimodal reasoning vision-language

开放权重多乐器音乐转录模型,结合合成数据预训练、真实数据微调与强化学习后训练

Simon Rouard, Michael Krause, Axel Roebel, Carl-Johann Simon-Gabriel,...
Transformer 多乐器建模 开放权重模型 强化学习 自动音乐转录

用RGB统一视觉任务的输入输出,冻结图像编辑器零样本完成25项感知与生成任务

Timing Yang, Jinrui Yang, Xinlong Li, Yuhan Wang, Haoran Li, Yanqing Liu,...
RGB表示 可控生成 图像编辑 密集预测 统一视觉模型