提出原生离散扩散VLA模型,统一多模态理解与生成,实现机器人长视距精准控制
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
多智能体框架将小时级原始素材自动剪辑为音乐同步的精剪短视频
系统评估LLM通过纯文本训练获得的听觉知识及其对音频理解性能的影响
通过掩码与门控融合,强制VLM利用几何token进行空间推理
首个百万级多模态图表理解数据集,通过代码引导合成生成150万高质量图表样本
构建首个大规模生物三模态对齐框架,整合图像、分类学文本和动物声音数据
通过稀疏化视觉-语言交互而非减少token数量来提升LVLM效率的新方法
用语言描述注入3D空间知识,提升视觉编码器的空间理解能力
通过在自回归序列中显式生成分割和深度token增强VLM空间推理
提出融合生物分类学结构的语言-音频预训练框架,实现未见物种的准确识别与生态特征推断
连续环境中的语义视听导航
👍 2提出MAGNet模型解决连续环境中语义视听导航任务,在目标声音间歇或静默后仍能维持目标追踪
首个评估MLLM能否主动寻求帮助的基准,揭示了当前模型严重缺乏主动性能力。
教导智能体逐步绘制矢量素描
👍 5通过部分级标注和过程奖励强化学习,实现逐步生成可编辑的矢量素描
首次揭示mask-based基准缺陷,提出像素级精确标注和PIXAR大规模基准,推动图像篡改检测从粗粒度区域标签向细粒度像素级语义理解转变。
将视频编辑分解为语义锚定和运动对齐,实现高精度指令跟随和强时序一致性
用强化学习将视频MLLM转变为主动评论者,实现机器人任务进度精确估计和零样本故障检测
提出反向标注流水线构建多模态文档提取基准,评估20个模型在小规模参数下的结构化输出能力
首个统一遥感世界模型,联合时空变化理解和未来场景预测,2B参数超越120×大模型
将典型相关分析与概念可解释性结合,实现跨模态对齐和稀疏概念分解
首个支持多服装分层、配饰、风格标注的大规模全装虚拟试穿数据集,揭示现有方法局限