提出基于可执行代码的框架评估MLLMs物理推理能力,发现模型依赖视觉模式匹配而非真正物理理解
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个针对RAG系统知识提取攻击的系统性基准测试,涵盖6种攻击策略和4种防御机制
构建1780个科学工具环境与基准,揭示LLM在长序列科学推理中的瓶颈
首个聚焦功能级开发的智能体编程基准,揭示最强模型仅11%通过率的巨大挑战
首个游戏开发基准测试,评估LLM智能体在复杂多模态游戏开发任务中的表现
构建持续更新的无污染医疗基准,用自动化评分标准替代LLM-as-a-Judge评估临床推理能力
知识图谱验证的大语言模型基准测试
👍 7提出FactCheck基准,系统评估LLM在知识图谱事实验证中的能力、RAG效果与多模型共识策略
首个面向多智能体买卖谈判的LLM基准测试框架,覆盖110+任务场景
首次系统研究计算机使用代理中的动作错位问题,提出检测基准和防护机制
首个系统评估VLM在图像化文本与纯文本间性能差距的基准测试
提出首个评估图像生成模型作为GUI环境能力的基准,揭示多步规划和空间定位的关键瓶颈
提出可控扩展环境状态的基准测试,揭示语言代理在长上下文下的性能退化与失败模式
首个系统评估移动GUI代理记忆能力的基准,揭示现有代理存在4-10倍能力差距
混淆NumPy库构建伪新知识域,诊断LLM智能体的知识内化与自进化能力
首个系统评估LLM智能体一致性、不确定性和能力边界感知的车载助手基准测试
面向文本-图像到视频(TI2V)生成的推理能力基准测试,评估模型对隐式世界规则的理解
提出SocialVeil框架模拟三种通信障碍评估LLM社交智能
提出DeR²基准,通过四种评估设置解耦检索与推理,揭示LLM推理缺陷
揭示BM25在深度研究智能体中比LLM检索器更有效,并提出语料库级测试时扩展框架
BABE:生物学实验推理能力评估基准
👍 10基于真实论文构建的生物学实验推理基准,评估LLM因果推理能力