提出CoViP框架,通过个性化图像摘要和强化学习实现上下文视觉个性化
Yeongtak Oh, Sangwon Yu, Junsung Park, Han Cheol Moon, Jisoo Mok, Sungroh Yoon
2026-02-04
上下文理解
个性化
多模态学习
强化学习
视觉语言模型
通过生成可渲染Web代码而非直接像素来建模移动GUI状态转换
Woosung Koh, Sungjun Han, Segyu Lee, Se-Young Yun, Jamin Shin
2026-02-03
GUI代理
世界模型
代码生成
移动计算
视觉语言模型
0.9B参数VLM在文档解析达到94.5% SOTA,新增印章识别与文本定位能力
Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu,...
2026-02-02
OCR
多任务学习
布局分析
文档解析
视觉语言模型
构建1.8M高质量推理数据集,通过数据为中心策略显著提升VLM推理能力
Honglin Lin, Zheng Liu, Yun Zhu, Chonghan Qin, Juekai Lin, Xiaoran Shang,...
2026-01-30
多模态推理
思维链蒸馏
数据为中心
数据集构建
视觉语言模型
首个端到端统一文本OCR与视觉OCR的全场景方法,4B参数媲美70B模型。
Yufeng Zhong, Lei Chen, Xuanle Zhao, Wenkang Han, Liming Zheng, Jing Huang,...
2026-01-30
OCR
代码生成
多模态
强化学习
视觉语言模型
通过聚类-对比学习-检索增强生成的三阶段框架,从设计数据中提取风格知识以指导风格化设计改进。
Huaxiaoyue Wang, Sunav Choudhary, Franck Dernoncourt, Yu Shen, Stefano Petrangeli
2026-01-30
图形设计
对比学习
检索增强生成
视觉语言模型
风格迁移
用LLM式编码器实现视觉token的因果重排序,突破文档OCR的语义理解瓶颈
Haoran Wei, Yaofeng Sun, Yukun Li
2026-01-29
OCR
因果推理
文档解析
注意力机制
视觉语言模型
自由草图+VLM澄清+视觉精修,三阶段范式实现动画意图的人机协同表达
Boyu Li, Lin-Ping Yuan, Zeyu Wang, Hongbo Fu
2026-01-29
HCI
人机协同
动画生成
草图交互
视觉语言模型
提出VLUAS范式,将视觉信号从被动输入转变为生成目标,实现标准VLM统一处理多模态和视觉任务
Zhixiang Wei, Yi Li, Zhehan Kan, Xinghua Jiang, Zuwei Long, Shifeng Liu,...
2026-01-28
多模态大模型
统一架构
自回归生成
视觉感知
视觉语言模型
GeoCLIP 以卫星剪裁作地理锚点,以对比学习对齐卫星-地面语义,提高全球图像地理定位精度与泛化能力
Manthan Patel, Jonas Frey, Mayank Mittal, Fan Yang, Alexander Hansson, Amir...
2026-01-28
全球定位
卫星图像
地理定位
对比学习
视觉语言模型
揭示视觉token压缩如何使LVLM变得脆弱,并提出针对性攻击方法CAA
Xiaomei Zhang, Zhaoxi Zhang, Leo Yu Zhang, Yanjun Zhang, Guanhong Tao, Shirui Pan
2026-01-27
token压缩
对抗攻击
模型安全
视觉语言模型
鲁棒性
17个多模态交互环境系统评测VLM在多步视觉决策中的失败模式
Zirui Wang, Junyi Zhang, Jiaxin Ge, Long Lian, Letian Fu, Lisa Dunlap, Ken...
2026-01-26
多模态智能体
强化学习环境
监督微调
视觉语言模型
评估基准
提出RPE复杂度度量和逆向QA合成框架,生成大规模高难度图表推理训练数据
Zheng Liu, Honglin Lin, Chonghan Qin, Xiaoyang Wang, Xin Gao, Yu Li,...
2026-01-26
图表理解
强化学习
推理增强
数据合成
视觉语言模型
开源VLM专注泰语文档OCR,2B小模型超越GPT-5等大模型
Surapon Nonesung, Natapong Nitarach, Teetouch Jaknamon, Pittawat...
2026-01-22
OCR
低资源语言
文档理解
泰语
视觉语言模型
1B参数VLM在OCR基准上超越9B模型,支持图像定位与高效推理
Said Taghadouini, Adrien Cavaillès, Baptiste Aubertin
2026-01-21
OCR
多模态
强化学习
文档理解
视觉语言模型
统一VLM-Diffusion架构从网络视频学习语言驱动的未来光流预测,赋能机器人操控和视频生成
Kanchana Ranasinghe, Honglu Zhou, Yu Fang, Luyu Yang, Le Xue, Ran Xu,...
2026-01-19
光流预测
扩散模型
机器人操控
视觉语言模型
视频生成
系统分析多图像视觉语言模型的失败模式,提出 MIMIC 基准和针对性改进方案
Anurag Das, Adrian Bulat, Alberto Baldrati, Ioannis Maniadis Metaxas, Bernt...
2026-01-19
基准测试
多图像理解
多模态学习
注意力机制
视觉语言模型
难度过滤是多模态推理数据策划的核心,多样性启发式无额外收益
Yosub Shin, Michael Buriek, Boris Sobolev, Pavel Bushuyeu, Vikas Kumar,...
2026-01-19
多模态推理
微调
数据策划
数据筛选
视觉语言模型
10B参数多模态模型通过统一预训练和平行协调推理,在60+基准上媲美或超越100B+模型
Ailin Huang, Chengyuan Yao, Chunrui Han, Fanqi Wan, Hangyu Guo, Haoran Lv,...
2026-01-16
多模态大模型
开源模型
强化学习
推理优化
视觉语言模型
紧凑高效的指令式图像编辑系统,2B VLM+1.6B扩散模型,4秒生成2K图像
Grigorii Alekseenko, Aleksandr Gordeev, Irina Tolstykh, Bulat Suleimanov,...
2026-01-16
图像编辑
扩散模型
指令跟随
视觉语言模型
高效推理