评分标准修改可在保持基准一致的同时系统性操控 LLM 评审偏好
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过异构知识检索+多视角评审委员会+多维度解耦评估,实现自动化研究创意深度评估
首个聚焦功能级开发的智能体编程基准,揭示最强模型仅11%通过率的巨大挑战
构建持续更新的无污染医疗基准,用自动化评分标准替代LLM-as-a-Judge评估临床推理能力
20个ML任务组成的基准,评估LLM智能体的端到端科研能力,16个任务仍未超越人类SOTA
大规模挖掘网页操作流程,用LLM评判器评估和改进模型的流程生成能力
首个面向印尼文化的大规模多跳问答数据集,揭示 LLM 文化推理的系统性偏差。
基于维基百科优质文章构建实时基准,评估深度研究智能体的写作与事实准确性能力
评估AI智能体在日常工作/生活/学习场景中完成多样化任务的能力
提出Terminal-Bench 2.0基准,89个CLI任务揭示前沿模型解决率不足65%
提出因果框架LIBERTy,用结构反事实评估LLM概念解释方法的忠实性
首个检测论文-代码不一致的基准数据集,揭示LLM仅能捕获46.7%的真实差异
工具增强的阶段感知AI导师,指导本科生从想法到可发表论文
自动化粗到细生成评分标准,驱动LLM开放域任务超越GPT-5
首个评估记忆驱动科学推理的基准,通过锚点和吸引子激活提升LLM推理能力。
PUA通过操纵性提示利用LLM的偏好对齐倾向,降低事实准确性
LLM能口头表达不确定性,却无法据此做出风险敏感的放弃决策
构建半合成流水线生成5000道高质量金融问答对用于评估LLM
轻量级塔防游戏环境,用于评估LLM的长期规划和决策能力
LLM基准测试的系统化评估
👍 34提出BENCHMARK2框架评估基准测试质量,发现显著差异并构建精简评估方案