构建238道真实案例、每例平均54项二元核对项的幻灯片生成评测基准,显著提升人评一致性。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
为判官模型构建含偏好图与列表式评估的指令遵循评测基准
首个系统评估「生成能否帮助理解」的统一多模态模型基准,覆盖3000样本×35模型。
首个覆盖7类推理、21项任务的真实生活多图像推理基准,揭示SOTA MLLM的巨大差距
首次提出“微观世界仿真”概念,构建专家审核的显微视频基准、9.6K 数据集与微调模型。
Cryo-Bench:首个冰冻圈语义分割基准,评测14个地理基础模型。
提出长时程CLI编程基准,揭示当前最强智能体通过率不足20%,人机协作可显著提升性能。
提出多层次评估框架,揭示MLLMs在双手协调中「高级推理强、精细执行弱」的协调悖论
首个配对评估Agent Skill效果的基准,覆盖87任务18配置
三场景经济环境基准,揭示LLM长程决策中无单一模型全面占优的系统性瓶颈
首个开放域闭环世界模型基准,评测记忆一致性与动作控制
首个评估编程智能体代码上下文检索能力的过程级基准
评测基准,隔离视觉知识与推理,评估MLLM的实体识别能力
提出 VDR-Bench,揭示现有基准两大缺陷并设计多轮裁剪搜索策略
提出DDR-Bench基准,评估LLM在无预设问题下自主探索数据库并挖掘洞见的能力
提出测试维护评估基准TAM-Eval,揭示LLM在测试生成/修复/更新上的能力局限
提出代码驱动的科学图像生成框架ImgCoder和评测基准SciGenBench,揭示精度-表现力权衡
首个覆盖感知/推理/预测/决策四维度的多模态时间序列推理基准,评测30+主流模型
重新思考面向具身世界的视频生成模型
👍 46提出机器人视频生成基准RBench与大规模数据集RoVid-X
首个全模态未来预测基准,揭示当前MLLM在视听协同推理上的显著不足