首个多语言仓库级上下文感知的ACR评估基准,揭示LLM代码评审新见解
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
多模态学习
具身智能
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
多模态大语言模型
可解释性
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
提出评估AI理解音视频模因能力的基准,揭示当前模型在文化理解和无文本音频上的不足
首个协作编程基准揭示AI智能体存在'协调诅咒',协作比单干成功率低30%
揭示LLM基准饱和的真正瓶颈:数据集质量与评判者能力
提出DeepPlanning基准评估LLM在多日旅行和购物规划中的长期约束优化能力
推理模型在用户描述生命危险时仍坚持解数学题,暴露严重安全缺陷
FluidGym:首个全自包含、全可微分的流体控制强化学习基准平台
揭示基准漏洞+统一评估框架,4B模型训练后超越GPT-4o
提出Terminal-Bench 2.0基准,89个CLI任务揭示前沿模型解决率不足65%
首个端到端多模态深度研究基准,评估智能体的图文证据整合与报告生成能力
首个金融智能体执行安全基准,揭示50%攻击成功率
提出可控视觉轴解耦的2D平台环境,系统评估RL智能体的视觉泛化能力
224个真实后端任务基准,评估LLM智能体全生命周期开发能力
系统分析多图像视觉语言模型的失败模式,提出 MIMIC 基准和针对性改进方案
提出自动化框架,用角色驱动任务构建和智能体评估深度研究系统的报告质量与事实性
首个评估记忆驱动科学推理的基准,通过锚点和吸引子激活提升LLM推理能力。
提出FactArena框架,通过竞技场风格的多智能体对战评估LLM在整个事实核查流程中的能力
BabyVision:超越语言的视觉推理
👍 201揭示当前MLLMs在人类幼儿就能解决的基础视觉任务上存在巨大缺陷
提出NoisyBench基准测试,揭示推理模型在噪声上下文下性能骤降80%,并提出RARE奖励函数提升鲁棒性
首个面向自动驾驶世界模型的综合基准,覆盖视觉真实性、轨迹合理性、时间一致性和可控性四大维度