10B参数多模态模型通过统一预训练和平行协调推理,在60+基准上媲美或超越100B+模型
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个完全开放的视频视觉语言模型,支持视频定位、跟踪和密集描述,性能超越专有模型
对6个前沿大模型进行语言、视觉-语言、图像生成三模态的统一安全评估,揭示安全全景的不均衡现状
通过知识蒸馏对齐教师模型的视觉注意力轨迹,让小模型获得大模型的视觉推理能力
7B小模型通过虚拟宽度扩展和两阶段RL在皮肤诊断上超越235B大模型
通过指令感知的视觉token选择和位置保持策略,在保持UI定位精度的同时大幅提升推理效率
BabyVision:超越语言的视觉推理
👍 201揭示当前MLLMs在人类幼儿就能解决的基础视觉任务上存在巨大缺陷
首个端到端多说话人转录模型,支持90分钟长音频
模块化红队测试框架,集成37种攻击方法,在20个MLLM上揭示平均49.14%的攻击成功率
首个通过RL训练的端到端多模态智能体VLM,整合图像搜索、文本搜索和图像裁剪工具