2万题音视频联合推理基准,揭示最强模型仅64.2%准确率
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
VST让视频大模型在流式观看时同步推理,兼顾实时响应与深度思考
MLLM推理+DiT上下文学习的参考视频特效迁移框架
提出主动式视频理解框架,让AI像人类解说员一样自主决定何时开口、说什么。
微软发布15B参数开源多模态推理模型,以少量算力实现数学/科学推理竞争力
通过混合知识注入框架将时间序列专家知识注入通用推理模型,解决时间序列诊断推理中的知识鸿沟问题
提出GUI-Owl-1.5模型家族,通过混合数据飞轮和多平台RL扩展实现跨设备GUI自动化
RynnBrain:开源具身智能基础模型
👍 46阿里达摩院开源具身智能基础模型,统一感知/推理/规划,四个核心能力全面超越SOTA
提出2^128码本的统一离散tokenizer,在理解、生成、编辑任务上均达到SOTA
借鉴HEVC视频编解码器思想,只编码视频中3.1%-25%的运动关键区域实现高效视觉理解
通过指令条件早期表示和子空间感知全局选择,用16%数据达到97.5%性能
首个纯视觉输入的图像编辑模型越狱攻击方法,配合安全基准与防御方案
将注意力分布视为策略,用RL优化注意力分配以提升多模态LLM视觉推理能力
多模态联合训练+Agent Swarm并行编排,实现通用智能体
提出Hive数据集:从野生音频中挖掘高纯度单事件片段,仅用0.2%数据量达到百万小时级模型的分离效果
通过分隔符令牌缩放增强多图像理解
👍 5缩放图像分隔符令牌隐藏状态,无需训练即可抑制跨图像信息泄漏
MoE架构GUI智能体,SFT+GRPO训练,跨平台SOTA性能
提出VLUAS范式,将视觉信号从被动输入转变为生成目标,实现标准VLM统一处理多模态和视觉任务
具身AI基座模型,通过3D空间推理和密集时序估计实现精准操作
三阶段解耦物理推理与视觉合成的免训练视频生成框架