提出GUI-RobustEval基准和RoTS数据合成框架,提升GUI智能体的错误恢复能力
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
构建首个AI科学家提案方法论合理性评估基准,揭示LLM存在系统乐观偏差
YoCausal评估视频扩散模型的因果理解,发现时间箭头感知不等同于因果认知
评估 LLM 交互式因果发现能力的基准环境,区分预测准确度与机制理解
首个评估LLM异步多任务工具调用能力的基准,揭示延迟反馈对代理性能的显著影响。
提出Agent老化四机制与AgingBench基准,诊断长期部署AI Agent的可靠性退化
模型学习评估方法学特征后安全分数虚高的隐式机制
评估工业优化代理在构建修订和解释全生命周期中的可靠性基准测试
跨范式确定性空间基础模型评测基准,配套DA-Next-5M与DA-Next。
首个评估个性化和主动行为的长期用户交互智能体基准测试
首个生产级GPU内核生成基准,解决基准与生产环境不匹配问题
构建BONAFIDE基准证明主流CoT忠实性指标基本无效
用代码智能体从自然语言生成可验证的 GUI 评测环境。
首个利用视频生成模型主动合成评测场景的MLLM时空推理基准,揭示当前模型从感知到高阶推理的性能鸿沟
用蓝图+21视图+FEA 反馈,让 LLM 智能体生成满足工程约束的 STEP 装配体。
评测长程工作流中智能体能否主动发现并满足用户隐藏需求的新基准
用3DGS物理退化引擎构建首个评测退化下MLLM空间智能的大规模基准。
从asciinema录制逆向工程出1530个真实终端任务,评估前沿模型最高仅62.5%通过率
首个企业级SaaS开发编码代理基准测试,覆盖30个复杂任务和5370个验证节点
首个关注密集干扰和长距离依赖的跨域记忆评估基准,现有系统平均准确率仅27.9%