提出SpecBench基准测试,量化AI编码代理的奖励黑客现象
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
覆盖三类视频的 AI 伪影分层基准,揭示 MLLM 感知根本缺陷
首个多镜头音视频生成基准,含自适应混合评估框架与人类判断一致性达91.5%。
提出首个要求主动探索的空间智能基准,揭示行动选择比感知能力更重要
提出八套共3993题的分层金融基准,揭示传统公开榜单已饱和但新型专业任务仍有显著区分度。
在真实 ShadowHand 上构建德州扑克基准,联合评估灵巧操作、感知与闭环决策。
评估大模型在流体力学/固体力学/材料/PDE四域能否通过多轮对话澄清科学任务。
PROOFGRID 基准用机器可检验的证明代替最终答案来评测 24 个 LLM 的真实演绎推理能力。
60个真实长任务,在容器化CLI智能体中评估前沿多模态大模型。
ViMU:面向视频隐喻理解的基准测试
👍 13首个无提示视频潜台词理解基准,揭示前沿多模态模型在讽刺、反讽与社会含义上的系统短板
用 756 张手绘 Jordan 曲线图测试 VLM 的视觉拓扑层级推理能力。
首个聚焦目标感知表示的多模态表格学习基准(40数据集)
剖析工业智能体竞赛的评测设计,揭示排行榜饱和、公私榜失配与评分公式脆弱性
视觉美学基准:前沿模型能评判美吗?
👍 11提出 VAB 基准:把美学判断改为同主题集合比较,揭示前沿模型距人类专家仍有 42.4 点巨大差距。
首个 ICU 时序临床决策基准,用事后标注揭示 LLM 在长程推理中的两大失效模式。
自动化智能体评估的实证研究
👍 3用评估技能+六阶段流水线让 Claude 自动为任意 agent 生成可执行的评估代码
提出CAFE基准,用反事实属性编辑诊断可提示分割模型是否真正语义对齐。
提出 CUActSpot 基准与渲染式数据合成流水线,揭示任务多样性优于单模态数据规模化。
提出渐进式模态迁移基准与盲训练控制,揭示多模态推理的视觉变量接地瓶颈与 RL 视觉虚假提升。
数学家新创作的439道研究级数学题,前沿模型最高仅30.4%