找到 210 条结果

通过熵引导层选择+正交融合+RoPE交叉注意力整合SigLIP与DINO双编码器,让VLM在视觉理解与定位任务上同时提升约5%

Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad... 2026-04-06
多模态大模型 多编码器融合 自监督视觉表征 视觉定位 视觉语言模型

用稀疏自编码器定位昆虫部位,再让多模态大模型生成可解释的形态特征描述。

Vardaan Pahuja, Samuel Stevens, Alyson East, Sydne Record, Yu Su 2026-04-03
多模态大模型 弱监督定位 形态学 特征提取 生物多样性

美团 LongCat 团队提出 DiNA 范式,把视觉/音频也词表化为离散 token,用统一自回归统一多模态。

Meituan LongCat Team, Bin Xiao, Chao Wang, Chengjiang Li, Chi Zhang, Chong... 2026-04-01
MoE 原生多模态 多模态大模型 离散 token 化 自回归

首个基于掩码扩散的8B全模态统一模型,在单一架构中实现文本、图像、语音、视频的任意理解与生成

Jaeik Kim, Woojin Kim, Jihwan Hong, Yejoon Lee, Sieun Hyeon, Mintaek Lim,... 2026-04-01
全模态统一 多模态大模型 扩散模型 掩码扩散 文本-图像-语音联合建模

通过提取VLM扩散模型中间层特征注入3D生成,实现背面语义可控

Wenyue Chen, Wenjue Chen, Peng Li, Qinghe Wang, Xu Jia, Heliang Zheng,... 2026-03-30
3D生成 单视图重建 多模态大模型 扩散模型 语义控制

首个支持流式视频中动态注册个性化概念并实时问答的免训练框架与基准

Yuanhong Zheng, Ruichuan An, Xiaopeng Lin, Yuxing Liu, Sihan Yang, Huanyu... 2026-03-25
个性化理解 多模态大模型 实时交互 检索增强 流式视频

PEPO:通过视觉感知与探索耦合的token级优势估计优化多模态推理

Yunheng Li, Hangyi Kuang, Hengrui Zhang, Jiangxia Cao, Zhaojie Liu, Qibin... 2026-03-25
多模态大模型 强化学习 推理优化 策略梯度 视觉语言模型

将长视频理解为分层环境导航,实现O(log T)计算复杂度的零样本视频问答

Mohamed Eltahir, Ali Habibullah, Yazan Alshoibi, Lama Ayash, Tanveer... 2026-03-19
分层表示 多模态大模型 智能体 递归语言模型 长视频理解