提出关系感知情感支持对话新任务,用真实伴侣与家庭访谈基准揭示大模型关系推理短板
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
同一模型经不同语言接口自博弈对打,实力与策略系统性偏移,英语最强、希伯来语最弱。
37个LLM的合成问卷受访者不敌无语言模型的copula基线,无法替代真人样本
诊断文档抽取朴素风险保证的三种失效模式,提出四级有效性阶梯与条件化两regime定律
六模型两基准实验证明:即便从构造上消除选项顺序影响,也不必然换来LLM准确率提升
流式对话摘要中的缺失证据记忆
👍 7提出ReMEMBER,以上下文缺口为条件检索并精炼历史证据,提升流式摘要记忆召回
首个集成符号因果推理与数据科学执行的综合基准测试框架
构建覆盖15个领域433项技能的数据智能体综合评测基准
首次系统研究表格推理中的数据引用错误(DREs),提出基于critic的检测和缓解方法
揭示多模型LLM系统的精度上限由共同失败率β决定,而非常用的成对错误相关系数ρ
构建150个真实日常任务的基准测试,用级联评估标准系统评估搜索智能体能力
研究LLM在遇到合理错误论证时是否会改变正确答案,发现翻转率差异巨大(17.5%-97.3%)
首个评估AI端到端自主科学研究能力的基准,40任务10领域揭示当前系统距可靠重发现差距巨大
提出首个评估LLM生成符合目标分布样本能力的基准
提出ARCANE基准测试框架,评估角色扮演语言代理是否能随角色心理发展轨迹产生符合该阶段状态的响应。
构建1,638个标准化患者案例评估LLM临床Agent动态决策能力,发现最强模型仅完成60.4%
评估LLM代理多轮对话下主动搜索能力的200任务基准
AI评审员在综合质量上可超越顶级人类评审员,但存在事实正确性短板和视角多样性问题
数学家新创作的439道研究级数学题,前沿模型最高仅30.4%
构建首个基于全文文献的多物种植物细胞类型标记基因证据基准,揭示LLM在生物学证据归因上的关键短板。