提出以结果为导向的视频生成新任务,用VLM评判结果达成与语义接地双重指标。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
4千条视触觉演示加DSR指标,识别任务成功却过度挤压物体的策略
首个按六阶段评估智能体Harness安全的基准:128个沙箱案例揭示高效用不等于安全
开源27B GUI智能体:环境闭环数据训练+子任务级示范引导,登顶开源计算机操作基准
用144对物理突变任务检验智能体改代码自救的能力,揭示机制重设计而非参数推断是真瓶颈
共享预算评测显示,LLM竞赛成绩在72格中71格低于其单题能力的离线最优分配
把视频理解重构为多轮工具增强任务,20个前沿模型全部低于60%准确率
以真实危机视频为锚构建RA-Bench,系统评测发现现有检测器与人眼在逼真AI视频面前双双失守
基于一年真实移动经验的设备端记忆基准与KEME数据合成框架,现有记忆系统远未达标
从通用编辑、真实部署到推理编辑三维覆盖,与人类偏好最对齐的图像编辑评测基准
把各类LLM路由统一为序列决策过程,并配套自动监督构建流水线、多场景基准与开源库
用多模态智能体模拟真人玩家,围绕长时程目标闭环评测九个视频世界模型
首个系统评估视频世界模型能否把人类第一人称演示跨具身转写为机器人操作视频的基准
以可执行环境为评测单元,通过环境演化式红队测试将攻击成功率推至85%
NCP-Bench 揭示:最强 LLM 叙事代理 20 轮后存活率仅 42%,长程承诺保持未解决
602段360°视频重建秋叶原,175个人工任务暴露LMM城市导航远逊人类
用凹凸互锁拼图构建无歧义基准,揭示VLM几何推理随网格增大全面崩塌
专家策展的七语言大规模重构基准,最佳模型通过率仅41.2%,跨文件协同是智能体瓶颈
自进化编程智能体经受评审提交改写自身框架,三大基准刷新SOTA并完成161天在线部署实验
首个评测LLM自主进化智能体harness能力的基准,顶尖模型最高提升16.6分、逼近人工框架