找到 272 条结果

提出CoViP框架,通过个性化图像摘要和强化学习实现上下文视觉个性化

Yeongtak Oh, Sangwon Yu, Junsung Park, Han Cheol Moon, Jisoo Mok, Sungroh Yoon 2026-02-04
上下文理解 个性化 多模态学习 强化学习 视觉语言模型

通过聚类-对比学习-检索增强生成的三阶段框架,从设计数据中提取风格知识以指导风格化设计改进。

Huaxiaoyue Wang, Sunav Choudhary, Franck Dernoncourt, Yu Shen, Stefano Petrangeli 2026-01-30
图形设计 对比学习 检索增强生成 视觉语言模型 风格迁移

用LLM式编码器实现视觉token的因果重排序,突破文档OCR的语义理解瓶颈

Haoran Wei, Yaofeng Sun, Yukun Li 2026-01-29
OCR 因果推理 文档解析 注意力机制 视觉语言模型

提出VLUAS范式,将视觉信号从被动输入转变为生成目标,实现标准VLM统一处理多模态和视觉任务

Zhixiang Wei, Yi Li, Zhehan Kan, Xinghua Jiang, Zuwei Long, Shifeng Liu,... 2026-01-28
多模态大模型 统一架构 自回归生成 视觉感知 视觉语言模型

统一VLM-Diffusion架构从网络视频学习语言驱动的未来光流预测,赋能机器人操控和视频生成

Kanchana Ranasinghe, Honglu Zhou, Yu Fang, Luyu Yang, Le Xue, Ran Xu,... 2026-01-19
光流预测 扩散模型 机器人操控 视觉语言模型 视频生成

紧凑高效的指令式图像编辑系统,2B VLM+1.6B扩散模型,4秒生成2K图像

Grigorii Alekseenko, Aleksandr Gordeev, Irina Tolstykh, Bulat Suleimanov,... 2026-01-16
图像编辑 扩散模型 指令跟随 视觉语言模型 高效推理