按临床工作流分 20 个细粒度任务,分层评估 MLLM 从视觉感知到临床推理的 OCT 理解能力
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个评估VLM从纯截图推断Web应用交互行为的基准,揭示视觉保真度不等于交互推理能力
以成本为统一坐标轴对比攻防两类安全智能体,揭示截然不同的缩放规律。
首个针对等离子体诊断 ML 模型的传感器失效鲁棒性基准,揭示序列模型在临近扰动失效时崩塌。
首个多关键帧条件视频生成评测基准,含386样本、6项关键帧指标与4维质量评估。
提出按六种科研能力组织评测的科学数据分析基准SDABench
首个系统评测大模型高级数学证明生成与验证能力的基准套件
用理论ground库与自蒸馏让模型在用户母语中做文化适配的道德推理。
提出IdeaGene框架和IG-Bench基准,评估AI系统的科学思想谱系推理能力
首个在真实环境中评估主动agent的能力驱动基准测试
首个集成符号因果推理与数据科学执行的综合基准测试框架
提出包含42个模拟任务和18个现实世界任务的统一基准,评估通用机器人操作策略在泛化、记忆、长期执行、精度和开放语义五个维度的能力。
首个评估MLLM视听艺术理解能力的综合基准,揭示模型在艺术意图推理方面的显著短板
构建18种低资源语言的数学推理基准,揭示多语言模型在低资源语言上的持续性能差距。
构建统一的优化器理论框架和大规模基准测试,为100+优化器提供机制分类和多目标性能评估。
首次发现智能体从真实环境学习遵循对数S型缩放定律,学习速度每三月翻倍
首个系统化评估VLM数据集策划策略的基准,发现数据混合比过滤更关键
评估AI代理通过反馈迭代改进可执行策略的能力
构建覆盖15个领域433项技能的数据智能体综合评测基准
首个静脉识别数据增强综合基准,揭示准确率与鲁棒性的关键权衡