找到 364 条结果

首个评估长期记忆系统如何不当影响决策的基准测试,揭示现有智能体普遍存在记忆诱导的谄媚问题

Zhishang Xiang, Zerui Chen, Yunbo Tang, Zhimin Wei, Ruqin Ning, Yujie Lin,... 2026-07-02
基准测试 智能体记忆 记忆可靠性 谄媚行为 长期交互

统一基准评估发现表格基础模型在非IID场景中不及传统模型

Lennart Purucker, Andrej Tschalzev, Nick Erickson, Gioia Blayer, David... 2026-06-30
基准测试 数据集策展 机器学习评估 表格基础模型 非IID数据

提出面向纳米技术应用的分子优化基准,用量子模拟替代代理指标

Matthias Blaschke, Daniel Kienzle, Zsuzsanna Koczor-Benda, Julian Lorenz,... 2026-06-30
分子优化 分子生成 基准测试 纳米技术 量子模拟

首个严格评估跨模态可解释性的诊断框架,揭示现有方法无法区分真正的空间推理与浅层捷径

Sujay Belsare, Sudarshan Nikhil, Sushant Kumar, Ponnurangam Kumaraguru,... 2026-06-25
VQA 可解释性 因果推理 基准测试 多模态AI