提出DISCOBENCH基准,评估搜索代理在深度搜索中主动识别和澄清模糊性的能力
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个评估VLM在专业领域视频定位适应能力的基准
首个评估长期记忆系统如何不当影响决策的基准测试,揭示现有智能体普遍存在记忆诱导的谄媚问题
审计三大性能优化基准,揭示参考补丁失效、评分规则偏差和任务覆盖饱和问题
研究发现编码代理存在'构建到测试'倾向,基准测试分数无法真实反映交付物的质量
提出AFTER基准和EVOLUTION框架,研究LLM智能体程序性记忆的泛化能力
小大脑,大成就:探索紧凑型语言模型
👍 15小型语言模型在RAG系统中可媲美大型模型,且无需GPU
首个覆盖多任务和结构编辑的200万级视频编辑数据集及Goku-Edit模型
首个模拟真实开发者工作流的多轮交互式编程代理评估基准
首个系统性评估LLM智能体修复历史代码兼容性的基准测试研究
用于评估通用终端使用代理能力的基准测试平台
超越 IID:表格基础模型究竟有多通用?
👍 44统一基准评估发现表格基础模型在非IID场景中不及传统模型
提出可控基准评估视频时间逻辑推理能力,揭示模型与人类巨大差距
首个长周期真实世界计算机使用代理基准测试,揭示当前AI代理距离专业级计算机使用仍有巨大差距。
提出面向纳米技术应用的分子优化基准,用量子模拟替代代理指标
提出三层级基准测试评估LLM执行上下文安全策略的能力
首个评估世界生成中消失-重现记忆一致性的基准,测试10个SOTA模型揭示记忆瓶颈
通过440任务基准测试揭示GUI与CLI代理在不同交互模式下的执行瓶颈与互补优势
提出GauntletBench基准测试,评估AI智能体在专业复杂场景中的泛化能力
首个严格评估跨模态可解释性的诊断框架,揭示现有方法无法区分真正的空间推理与浅层捷径