首个面向GDP业务工作流的智能体自我进化基准,用规则混合使测试增益可归因
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出音视频协同编辑评测基准AVE-Compass,并配套规划式智能体AVE-Agent。
365天电商模拟基准,揭示LLM智能体长期连贯性的巨大短板
评测个人智能体跨会话复用经验是否真正带来提升的归因基准
首个联合评测遥感类别广度与查询多样性的开放词汇基准
用2026世界杯104场比赛,细粒度评测大模型与智能体的赛前足球预测能力。
构建 7031 例带三阶段推理轨迹标注的医疗 VQA 基准,通过阶段替换干预定位幻觉根源。
提出可验证奖励、RTE机制和pass^k指标的多轮对话推荐评测基准
首个系统评测多模态模型视频记忆能力的认知心理学基准。
从fMRI脑信号直接回答视觉问题,并附NSD-VQA受控新基准。
WBench用289案例×5维度×22指标,对20款SOTA交互式世界模型做统一评测。
首个系统化的隐喻视频理解基准MetaphorVU-Bench与基于隐喻知识图谱的推理时增强框架MetaphorBoost
跨五个域系统研究模型生成技能全生命周期,揭示评估器能力与执行能力无关,并提出元技能显著提升技能质量。
提出GPR任务与MM-OCEAN基准,揭示MLLM 51%正确评分无证据支撑。
首个联合评测全模态感知、主动响应与多样化流式视频任务的基准。
审计152篇GFM论文,揭示领域评测乱象并提出六项改进建议
三阶段审计揭示物理VLM评测三大测量偏差,并发布干净语料+RL配方
首个统一对比长上下文LVLM与记忆增强代理的多模态长期记忆基准
提出二维评测矩阵与371题基准,专测多模态智能体能否在长程交互中保留并推理像素级视觉证据。
首个覆盖36类任务、融合结构化推理评分的图像编辑与奖励模型统一基准。