VLMs地理位置推断能力强但隐私推理差,过度披露率达47.6%
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
CL-Bench:上下文学习能力基准测试
👍 23首个评估大模型从复杂上下文中学习新知识能力的基准,当前最强模型仅解决23.7%任务。
提出1400对真实场景视觉QA基准,揭示VLM空间推理与人类差距超30个百分点
提出950道高难度多轮幻觉基准,揭示前沿LLM仍存在约30%+的幻觉率
提出首个评估VLM自适应推理模式选择能力的基准,揭示准确率与模式选择能力解耦现象
通过让AI智能体重新发现已发表ML论文的核心发现,评估其全周期科学研究能力
LLM智能体评估存在混杂变量,需统一框架实现公平比较
用Wikipedia引用构建1197题GraphRAG基准,多源聚合是优势
首个针对日语金融语言理解的基准,揭示主流LLM在隐式意图识别和术语抽取上的系统性短板
首个评估视觉指令(草图/箭头)驱动图像编辑能力的分层基准,揭示现有模型在因果推理上的瓶颈
首个结合原生音频-视频输入、时序定位和人口统计学元数据的多模态理解基准
各就其位:文本到图像模型空间智能基准测试
👍 111提出SpatialGenEval基准,系统评估T2I模型的空间感知、推理与交互能力
基于横向思维谜题的环境回滚,构建评估长上下文智能体动态推理能力的基准
提出900题基准,评估智能体在多步信息检索中的穷举答案集合生成能力。
提出概念解耦的视频基准,定量评估世界模型对物理常数和直觉物理的理解
提出TRACE基准,用对比分析提升LLM检测代码奖励黑客的能力
首个多语言仓库级上下文感知的ACR评估基准,揭示LLM代码评审新见解
提出评估AI理解音视频模因能力的基准,揭示当前模型在文化理解和无文本音频上的不足
首个协作编程基准揭示AI智能体存在'协调诅咒',协作比单干成功率低30%
揭示LLM基准饱和的真正瓶颈:数据集质量与评判者能力