评测LLM能否仅从聊天先例推断并遵循群组隐藏的局部社交规范
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个统一评估MLLM代码化参数化3D生成能力的基准,覆盖文本/图像/装配三类任务。
从 11039 个真实 Python 性质测试提炼 9415 个 Lean 4 验证任务。
提出自动化合成新鲜知识的演进基准,解决搜索代理评估中的测试集污染问题
首个多粒度表格表示学习基准,标准化评估20个模型在16个任务上的可复用信号质量。
提出ComBench基准测试,评估大语言模型在奥林匹克组合数学中的证明推理和构造实现能力
首个统一评估视频世界模型物理、几何、交互能力的综合基准测试
首个评估GUI智能体在专业软件中完成长时序工作流能力的基准
研究揭示 LLM 判别器在评估研究问题新颖性时存在严重不可靠性,与人类专家判断存在系统性偏差。
提出首个评估代码仓库探索能力的行级基准测试SWE-Explore
首个针对组合式视频编辑的基准测试,揭示当前模型在复杂多指令场景下的严重缺陷。
首个统一评估多模态智能体在异构3D环境中交互式空间推理能力的基准
提出12个UE5游戏加IDC反思框架评估VLM智能体多模式表现与自我改进能力
首个评估全模态视频字幕指令跟随能力的综合基准,发现格式-内容权衡现象
提出hacker-fixer循环自动加固Agent基准测试验证器,防御reward hacking
首个评估AI端到端自主科学研究能力的基准,40任务10领域揭示当前系统距可靠重发现差距巨大
GENEB:为何基因组模型难以比较
👍 49提出GENEB基准评估40个基因组模型在100任务上的表现,揭示聚合排名的不稳定性
MMAE:大规模多任务音频编辑基准
👍 46首个通用指令式音频编辑综合评估基准,覆盖7种模态和6级复杂度
提出首个评估LLM生成符合目标分布样本能力的基准
首个基于布鲁姆分类法的英阿双语VLM认知评估基准,揭示模型认知不对称性