450 道研究生随机过程 Lean 4 基准,最强智能体证明率 34.9%
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出EASEL基准,以参考引导绘画评测多模态智能体的闭环参数化视觉动作能力
对124个Inspect评测做声明重放普查:110个显式停止,14个可重放,胜者常比排名更稳健。
300个程序化视觉推理任务+可验证奖励评分器,让视觉生成成为可训练、可验证、可优化的推理媒介
994 项最小对比对诊断揭示:GUI 定位失败主因是候选定位而非关系理解
以执行轨迹联合诊断“模型+运行时”配置的能力、可靠性与运行时敏感性
让15个前沿大模型各管一家足球俱乐部20年,测谁会“经营”而不只是“执行”。
首个逐级撤除人类方法指导、评测AI自主科研能力的跨领域项目级基准
评估并微调 LLM 用架构专属 PTX 生成真正执行目标指令、比肩前沿库的高性能 GPU 内核
开源三件套:统一基准 RelArena-α、榜首基线 TabPFN-Rel 与声明式接口 RPI
37个LLM的合成问卷受访者不敌无语言模型的copula基线,无法替代真人样本
让AI编码智能体在6小时固定算力内自主改进世界模型,64次会话63次成功提升
首个视频去反射闭环框架:物理增强合成配对数据、一步扩散去除模型与专用基准S2R-Bench
200个多周生活任务基准,七个前沿模型最高仅32.5分
统一时间序列数据集相似度基准的工具箱,揭示相似度与下游任务损失高度任务相关
用统一任务协议与自动插桩追踪,对智能体脚手架做全生命周期多维评测
用成语跨概念网络评测多模态模型的创造性解码能力。
视频全局空间感知基准,揭示最强VLM仍落后人类36分,定向训练可大幅缩小差距。
要求完整表格输出并用确定性评测衡量数据智能体在跨语言异构工作空间表现的基准。
用技能熵度量技能切换难度,构建Skill2-Bench基准并用Skill-Entropy RL训练