首个将第一视角视频感知与网页任务执行连接的基准,含500对视频-指令样本
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
评估多主体图像生成中属性绑定错误的基准测试与诊断方法
CHANRG基准揭示RNA结构预测器在分布外场景下泛化能力严重受限,基础模型优势消失
首个评估MLLM能否主动寻求帮助的基准,揭示了当前模型严重缺乏主动性能力。
首次揭示mask-based基准缺陷,提出像素级精确标注和PIXAR大规模基准,推动图像篡改检测从粗粒度区域标签向细粒度像素级语义理解转变。
提出锚定状态记忆机制解决长周期GUI任务的记忆瓶颈
VTC-Bench:基于32种OpenCV工具和680题,评估MLLM的视觉工具链能力。
MLLMs在离散符号理解中存在识别-推理倒置的认知错配现象
研究发现时间推理瓶颈因语言资源水平而异:低资源语言受分词质量限制,高资源语言受内部表示线性性控制
首个波斯语音频语言模型基准,16任务8000样本,揭示文化特定音频理解的挑战
评估LLM能否根据沟通场景选择性应用或抑制用户偏好
基于模拟环境的诊断基准,系统评估VLM在机器人任务中的空间推理能力
通过自然语言请求自动生成可执行、可追踪的 LLM 评估工作流
首个系统评估LLM在复杂约束下工具使用能力的基准测试
提出反向标注流水线构建多模态文档提取基准,评估20个模型在小规模参数下的结构化输出能力
首个大规模企业级智能体基准,揭示当前最强模型仅37%成功率,规划而非工具调用是核心瓶颈
提出DeepCommit流水线和EvoClaw基准,揭示前沿模型在持续软件演化中的性能崩溃现象
首个视频到网页生成基准,用细粒度视觉评分标准评估MLLM复现能力
首个大规模未解数学问题的自动化验证基准,评估AI的数学发现能力
LMEB:长时记忆嵌入基准测试
👍 74提出针对长期记忆检索的嵌入模型评估框架,涵盖4类记忆、22个数据集、193个检索任务