提出41K规模的MMOOC基准,联合评估多模态大模型的拒答能力与抗干扰鲁棒回答能力
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个联合评估四项能力的小时级流式视频基准,配合双层解耦的StreamMind架构
首个衡量 LLM 在固定预算下迭代优化智能体线束的基准,揭示了模型差异大于工具差异
提出评估智能体在长任务流中持续学习与技能演化的动态基准
CADENA:逐步式CAD逆向工程
👍 38逐步执行CAD操作并对比几何反馈,重建可编辑参数化程序
SWE-Touch 注入用户冲突编辑评测编码智能体共享工作空间的鲁棒性。
统一流式评估框架揭示自演化智能体收益受场景、模型与方法的共同制约。
把真实家庭改造成同步多模态录制棚,构建具身AI的长时程人-物交互数据引擎
用真实用户历史训练用户模拟器,对角色扮演智能体做人格对齐的自由多轮评测。
提出含1.2K基准与VAoT协议的See2Think框架,分离视觉状态效用与行为依赖。
提出多模态上下文学习三级能力评测基准,最强模型总分仅0.28
从42个基准的模型失败中归纳10项原子感知能力并构建3000题评测集
评测编码智能体在改代码前定位所需文件的能力,揭示检索无单一最优解
大规模自然驾驶基准,把车型/路线/情境混淆当作核心测量对象
从模糊需求出发、可向用户代理追问的480任务基准,测智能体从零构建可运行仓库的真本事
首个由盲人实拍、覆盖主动提醒/问答/交互三大任务的在线视频评测基准
首个连续第一人称视频主动协助基准 EgoServe 与训练免记忆增强智能体 EgoMemo
要求视频问答模型同时输出答案、时间片段与密集跟踪分割掩膜三类证据
首个大规模中文精神科诊断基准,通过多智能体框架评估LLM在精神科咨询和诊断中的能力
首个多主体共享记忆治理基准,综合评估记忆代理的效用、访问控制和主动遗忘能力。