真实用户的模糊查询导致VLM准确率不足50%,显式化查询可提升8-22分
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
多模态学习
具身智能
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
多模态大语言模型
可解释性
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
首个面向长期项目导向交互的记忆基准,揭示现有记忆系统在追踪动态目标状态方面的不足
评估9个小模型在日志分级任务中零样本、少样本及RAG的表现差异
轻量级塔防游戏环境,用于评估LLM的长期规划和决策能力
LLM基准测试的系统化评估
👍 34提出BENCHMARK2框架评估基准测试质量,发现显著差异并构建精简评估方案
首个评估LLM在流行病学证据推理能力的基准测试,包含三个递进难度子集。
科学AI评估工具包,覆盖七大核心能力
首个音频地理定位基准AGL1K,评估16个音频语言模型的地理推理能力