找到 144 条结果

从语言和视频证据直接生成LoRA适配器,实现零样本机器人策略适应

Christian Bianchi, Siamak Yousefi, Alessio Sampieri, Andrea Roberti, Luca... 2026-06-09
元学习 参数生成 多模态学习 机器人操作 策略适应

首个面向知识与推理密集型视频理解的大规模训练语料库,通过技能导向的QA生成框架和严格质量控制,显著提升模型在知识密集型视频推理任务上的表现

Lin Fu, Zheyuan Yang, Yang Wang, Tingyu Song, Arman Cohan, Yilun Zhao 2026-06-05
后训练 多模态学习 数据集构建 知识密集推理 视频理解

提出融合音频、歌词、语义元数据和用户参与度信号的多模态音乐推荐框架,在LLaMA-3-70B等大模型上验证了多模态特征可提升Recall达95%、NDCG达79%

Srikar Prabhas Kandagatla, Sreehitha R. Narayana, Chandana Magapu, Swetha... 2026-06-05
元数据增强 多模态学习 大语言模型 序列推荐 音乐推荐

通过预测理解表示来指导像素空间生成,消除VAE瓶颈

Yuqing Wang, Zhijie Lin, Ceyuan Yang, Yang Zhao, Fei Xiao, Hao He, Qi Zhao,... 2026-06-01
图像生成 多模态学习 扩散模型 端到端训练

提出双粒度计数架构,结合区域级稀疏计数和像素级密集计数,在六个视觉领域实现高精度文本引导计数

Mengqi Lei, Shuokun Cheng, Wei Bao, Shaoyi Du, Jun-Hai Yong, Siqi Li, Yue Gao 2026-06-01
多模态学习 实例定位 点回归 物体计数 跨领域泛化

提出NAVA框架,通过原生音频-视频对齐实现高质量联合音视频生成

Longbin Ji, Guan Wang, Xuan Wei, Chenye Yang, Xiangrui Liu, Zhenyu Zhang,... 2026-05-29
MMDiT 多模态学习 扩散模型 音色控制 音视频生成