提出SPACENUM基准揭示VLMs在空间数值理解上的系统性缺陷
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提供以数据为中心的3D视觉统一框架,连接表示、数据集与学习范式
提出视觉多样性优先的多模态推理基准WorldBench
首个评估LLM智能体在渐进式双约束下自适应规划能力的动态基准
提出10K价值冲突场景基准,揭示VLM机器人难以在价值观冲突中正确选择行动
评估 LLM 编码代理在真实项目环境中的操作安全性,发现所有模型均存在显著安全风险
首个全人工标注的流式空间智能基准,揭示多模态大模型在自我中心视频流上的空间推理巨大缺口。
把网上多模态教程蒸馏为可编辑技能,靠轨迹反馈闭环修正,让VLM智能体在GUI/游戏/策略任务全面提升
通过进化参考解决方案生成更难的编程任务,解决基准饱和问题
首个评估VLM代理在3D场景中基于行动反馈的空间推理能力的基准测试
首个基于像素级确定性评估的精确视觉编辑基准,揭示当前多模态模型在基本栅格操作上的显著局限性。
首个系统评估Speech LLM指令引导语音编辑能力的双语基准测试
多模态视频理解中的视觉状态跟踪基准测试
👍 53VSTAT:834视频1500问题诊断MLLM的视觉状态跟踪能力
构建合成可信度基准,揭示现有检测器与人类在此新威胁上普遍失效。
首个韩语网页浏览智能体基准,包含400个多步推理问题,揭示模型在韩语环境下的显著性能下降
首个多流流媒体理解基准,评估MLLMs的并发流处理能力
首个面向真实个性化MCP工具的智能体评测基准,揭示SOTA模型仍难及格
提出TVIR基准与多智能体框架,攻克图文交错研究报告生成与评估难题。
首个基于分类法的语义对象对应基准,评估100个类别、100万+对应对的视觉和多模态基础模型
把多选题改造成机器人抓取任务,诊断VLA是否真懂指令语义。