构建90个Nature论文任务的基准,测试AI代理在科学发现中的真实能力
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出统一训练框架NANOGEN和综合基准DIFFUSIONBENCH,揭示ImageNet和文本生成图片性能不相关
提出层次化知识图谱和结构感知采样,构建跨图表RAG基准
从真实企业会话构建852任务的多维度代理评估基准
提出PhySciBench基准和DelveAgent框架,提升物理科学AI研究能力
构建150个真实日常任务的基准测试,用级联评估标准系统评估搜索智能体能力
将Python代码基准扩展到12种语言,揭示LLMs的Python过拟合和多语言性能差异
无干扰辐射场研究缺乏大规模基准,DF3DV-1K提供1K场景配对数据并系统评估方法
首个基于Godot游戏引擎的项目级游戏代码框架数据集与基准测试,揭示模型能力随项目规模急剧下降的现象
提出基于密集网格采样的流形几何基准框架,用有限差分法精确估计曲率、触及距离和体积,用于验证理论边界和探究网络层间几何演变。
评估语言模型代理在500天初创公司运营模拟中的长期战略规划能力
首个在真实个人桌面环境中评估AI代理个性化能力的基准测试
通过改进提示词、清理人工制品和重新设计评分方法,提升了物理理解评估的可靠性
工业产品多图像属性值提取基准测试
👍 4首个工业产品多图像理解基准,揭示MLLM跨图像整合瓶颈
首个iOS模拟器手机代理基准测试,26应用133跨应用任务
三级时间尺度自演化多模态智能体,边缘级联门+记忆驱动技能进化
首个联合评估代码智能与数据发现能力的数据密集型基准。
WEBSTEP通过语义MDP对偶实现1800任务的过程级细粒度诊断
首个医疗LLM认知韧性基准:注入虚假上下文后准确率从71%暴跌至38%
首个系统量化视频世界模型长程记忆能力的多维基准