VTC-Bench:基于32种OpenCV工具和680题,评估MLLM的视觉工具链能力。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
将长视频理解为分层环境导航,实现O(log T)计算复杂度的零样本视频问答
通过agentic mid-training和验证推理提升长链推理,BrowseComp达88.2
首个大规模企业级智能体基准,揭示当前最强模型仅37%成功率,规划而非工具调用是核心瓶颈
证据优先合成智能体任务,扩展多样性以提升工具使用泛化能力
利用用户交互的下一状态信号在线优化个人和通用智能体的RL框架
4B参数医疗智能体通过行为蒸馏实现离线部署,性能媲美前沿大模型
用测试驱动方法编译LLM智能体提示词,确保行为合规
通过自适应工具加载和基于评分标准的强化微调,让4B小模型逼近前沿大模型的智能体性能
80B参数MoE模型仅激活3B参数,通过大规模可验证任务合成实现高效编码智能体
提出语言无关的自动化管道,从GitHub大规模收集可执行的软件工程任务用于训练智能体
基于自博弈RL的零数据框架,让LLM自主进化为通用工具调用智能体
通过层次化推理和主动探索,实现高效长视频问答
提出全模态智能体基准OmniGAIA和原生全模态基础智能体OmniAtlas
用过采样-过滤-排序和累积工具奖励解决多模态RL训练中的交互坍缩问题
从人类反馈中学习个性化智能体
👍 10提出PAHF框架,通过显式记忆和双反馈通道实现智能体的持续个性化学习
GLM-5:从氛围编码到智能体工程
👍 198智谱旗舰模型GLM-5,通过DSA、异步RL和大规模智能体训练实现前沿性能。
提出新范式将图像检索从独立匹配转变为语料级上下文推理,构建首个基准DISBench
3B参数模型同时实现推理、编程和长程智能体能力
通过双约束任务合成、中训练与强化学习,打造高效长时程深度搜索智能体