首个法律领域端到端RAG基准,证明检索质量比LLM更关键
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出T-RANK等测试时计算方法,显著提升多语言基准测试翻译质量
提出Ref-Adv基准测试,暴露MLLM在指代表达理解上对视觉捷径的依赖
首个针对小尺度物体编辑的基准,揭示现有模型在精细定位和编辑上的严重不足
一致性三位一体:定义通用世界模型的核心原则
👍 203提出模态/空间/时间三维一致性框架及CoW-Bench基准,系统评估世界模型的物理模拟能力
首个大规模真实出行场景LLM路径规划智能体评估基准,含10万episode覆盖350+城市
提出全模态智能体基准OmniGAIA和原生全模态基础智能体OmniAtlas
首个通用Agent系统评测:5架构×5模型×6基准的全因子实验
54个GPU推理优化任务评估编程智能体,硬指标高估能力。
首个系统评估扩散模型在CT重建中性能的综合基准测试平台
提出交互式3D物理基准CHAIN,揭示VLM在结构化物理推理中的系统性失败
首个将金融推荐从行为模仿转向效用对齐的多视角对话式纵向评估基准
提出轻量级安全基准 NESSiE,测试 LLM 在简单规则遵循任务中的安全行为
首个涵盖30个任务、100+语言、50+模型的音频嵌入模型综合基准测试
前沿LLM编码了95-98%的事实,但回忆失败仍是主要瓶颈。
迈向 AI Agent 可靠性的科学
👍 16提出四维可靠性度量体系,揭示前沿模型能力提升远快于可靠性改善
在真实世界中学习情境感知
👍 8提出SAW-BENCH基准测试,评估多模态模型在第一人称视角下的空间情境感知能力
首个阿片类药物危机图学习基准,涵盖5个数据集,系统评估图学习方法在真实场景中的表现。
对HLE基准进行两阶段验证修订,消除标注噪声后模型准确率平均提升7-10个百分点
提出新范式将图像检索从独立匹配转变为语料级上下文推理,构建首个基准DISBench