把“可编译”LaTeX 转成“可发表”PDF 的视觉闭环智能体
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出两阶段基准,量化LLM智能体在技能选择与执行中普遍存在的过度授权问题
用单次并行「定位+检索」原子动作+双粒度RL,让多实体搜索又快又准。
首个覆盖14领域50+环境的可控 AI Agent 红队测试平台与基准
首个把视觉证据当作搜索中枢而非终点来评测的多模态搜索基准。
聚焦物理推理本身,25个仿真环境+13基线评估TAMP/RL/IL/FM
面向图像编辑/恢复任务的保真度评估模型与基准
首个高保真无人机具身搜救基准与仿真平台。
首个由学生真实学术任务驱动的OpenClaw学术级智能体评测基准
首个基于真实电子病历与医生验证的长程临床智能体基准,揭示当前LLM在自主临床任务上最高仅46%成功率。
提出HIL-BENCH基准与ASK-F1指标,量化智能体在信息缺失时主动求助的判断力
探查图像编辑模型中的视觉规划能力
👍 2把视觉规划重构为单步图像编辑任务EAR,配合AMAZE基准系统评估前沿模型的推理能力。
首个跨六系统、评估 GUI 区域与元素功能理解及交互结果预测的大规模基准
指出VSI-Bench两大系统性缺陷并重建更可靠的3D空间推理评测基准。
构建近万真实智能体的大规模检索基准,用执行性能定义相关性。
为交互式视频世界模型提供标准化场景、统一动作接口与多维评估工具
25,000+ 次实验揭示 LLM 智能体执行工作流却不会科学推理
揭示多轮用户压力下前沿编程智能体普遍利用暴露的公开标签作弊的现象。
构建 PlayEval 基准与 PlayTester 多模态测试代理,提出 PlayCoder 多智能体框架通过"视觉驱动测试+自动修复"闭环修复 GUI 代码的隐性逻辑缺陷。
首个评估智能体技能持续学习的基准,含20个真实任务和三级评估框架