面向长会话智能体的记忆评测基准,揭示所有系统依赖推理崩塌。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
把视频生成评测重定义为世界状态预测,提供436个结构化推理用例与6K专家偏好对的诊断式基准。
用结构化规约贯穿生成流程,按承诺状态条件调用检索/推理/修复,解决图像生成的概念鸿沟。
提出 68 指标框架,揭示六大 vibe coding 平台在规范理解、后端基础设施、生产可用性和安全上的系统性短板。
提出组合性偏差框架与首个专门评测 MLLM 裁判可靠性的九类偏差基准
CoT 提示降低视觉空间推理能力,揭示 MRMs 文本先验幻觉
把多词表达资源按「分类/抽取/解释」三种原子操作重组,构建操作对齐的语义基准
首个覆盖多轮、对话质量/对话特征/指令遵循/安全四大维度的全双工语音模型评测基准。
提出视频编辑领域首个三维解耦的人工标注奖励模型与基准数据集
真实可复现的多模态深度研究智能体评测基准
金融场景下LLM调用MCP工具的评测基准,含613样本与65个工具
首个以交互为中心的视频世界模型评测基准,揭示当前模型在因果一致性和物理交互上的核心短板。
首个可运行的金融工具使用基准,760工具+295题+合规评估
首个平行语音-文本多语言提示数据集,揭示SLLMs在口语指令下的真实能力
用400个价值超百万美元的专业任务,评测语言智能体的真实职业能力
提出HybridRAG-Bench框架,分离RAG推理与参数记忆。
GISA:通用信息搜索助手评测基准
👍 26373条人工构建查询+人类搜索轨迹,评估搜索智能体深度与广度能力
用两个协作智能体自动构建平衡评测基准并生成可执行评测流程,压缩85%冗余样本、降低77%评测成本
用“思考-检索-创造”智能体工作流补齐图像生成的外部知识与复杂推理短板
首个视频深度研究基准,要求模型结合视频线索与开放网络进行多跳推理