将文档中的文字和图形统一解析为可渲染的结构化代码,而非像素裁剪
Handong Zheng, Yumeng Li, Kaile Zhang, Liang Xin, Guangwei Zhao, Hao Liu,...
2026-03-16
OCR
SVG重建
多模态
文档解析
视觉语言模型
VLM在视觉实体追踪任务上接近随机猜测,SGCoT推理链突破90%准确率
Tiedong Liu, Wee Sun Lee
2026-03-16
实体追踪
视觉语言模型
视频理解
计算复杂性
链式推理
提出家庭安全基准和双脑架构,实时检测具身智能体危险行为
Jiayue Pu, Zhongxiang Sun, Zilu Zhang, Xiao Zhang, Jun Xu
2026-03-16
具身智能
多模态推理
安全评估
实时检测
视觉语言模型
发现VLM中单个神经元可作为强分类器,实现5倍推理加速
Pierre Musacchio, Jaeyi Jeong, Dahun Kim, Jaesik Park
2026-03-16
VQA
可解释性
模型加速
视觉语言模型
训练免费方法
提出Plan-then-Control框架,用VLM自动规划电影级相机轨迹,实现多镜头视频精准控制
Songlin Yang, Zhe Wang, Xuyi Yang, Songchun Zhang, Xianghao Kong, Taiyi Wu,...
2026-03-13
多镜头视频
电影化拍摄
相机控制
视觉语言模型
视频生成
用自动生成的细粒度评分准则作为RL奖励信号,让小模型生成超越人类和大模型的图像描述
Tzu-Heng Huang, Sirajul Salekin, Javier Movellan, Frederic Sala, Manjot Bilkhu
2026-03-13
图像描述
奖励设计
强化学习
视觉语言模型
评分准则
ROVA框架通过结构化时空扰动与自反思难度调度,提升视频推理在真实世界扰动下的鲁棒性
Yangfan He, Changgyu Boo, Jaehong Yoon
2026-03-13
GRPO
具身智能
强化学习
数据增广
视觉语言模型
用VLM提取组合约束,分两阶段过滤视频生成候选并优化机器人轨迹
Gehao Zhang, Zhenyang Ni, Payal Mohapatra, Han Liu, Ruohan Zhang, Qi Zhu
2026-03-12
机器人操控
约束优化
视觉语言模型
视频生成模型
零样本学习
首个零数据三角色自进化框架,让VLM自主生成图像并提升推理能力
Zongxia Li, Hongyang Du, Chengsong Huang, Xiyang Wu, Lantao Yu, Yicheng He,...
2026-03-11
GRPO
强化学习
自进化
视觉语言模型
零数据学习
首个体育空间智能数据集CourtSI,100万QA对,25个VLM评测揭示人机差距
Yuchen Yang, Yuqing Shao, Duxiu Huang, Linfeng Dong, Yifei Liu, Suixin Tang,...
2026-03-11
3D重建
体育理解
基准测试
空间智能
视觉语言模型
用上三角矩阵W把图像特征几何变换后再与文本匹配
Pranav Mantini, Shishir K. Shah
2026-03-11
几何规范化
参数高效微调
少样本分类
模态对齐
视觉语言模型
揭示冷启动中视觉注意力不足的瓶颈,提出AVAR框架重塑注意力分配,平均提升7%
Ruilin Luo, Chufan Shi, Yizhen Zhang, Cheng Yang, Songtao Jiang, Tongkun...
2026-03-10
冷启动训练
多模态推理
强化学习
注意力机制
视觉语言模型
通过前景注意力门控与解耦的新类分支,缓解CLIP提示调优中的注意力偏移与基础-新类权衡问题。
Haoyang Li, Liang Wang, Siyu Zhou, Jiacheng Sun, Jing Jiang, Chao Wang,...
2026-03-10
CLIP
前景注意力引导
基础-新类权衡
提示调优
视觉语言模型
用工具式代理+链式推理替代直接提示,训练小型VLM规划器提升复杂图像编辑质量
Subhojyoti Mukherjee, Stefano Petrangeli, Branislav Kveton, Trung Bui,...
2026-03-10
代理规划
图像编辑
图像风格化
思维链推理
离线强化学习
提出首个针对 VLM-GUI 智能体的效率后门攻击,通过两阶段 RBI 策略在触发时让响应长度激增
Junxian Li, Tu Lan, Haozhen Tan, Yan Meng, Haojin Zhu
2026-03-10
GUI 智能体
后门攻击
响应延迟
强化学习
模型安全
用文本LLM初始化视觉编码器替代CLIP,紧凑模型达SOTA
Boqiang Zhang, Lei Ke, Ruihan Yang, Qi Gao, Tianyuan Qu, Rossell Chen, Dong...
2026-03-09
LLM初始化
模型效率
视觉编码器
视觉语言模型
视频理解
LMM 通过上下文学习匹配 CLIP 分类能力,CIRCLE 迭代伪标签进一步提升
Marco Garosi, Matteo Farina, Alessandro Conti, Massimiliano Mancini, Elisa Ricci
2026-03-06
上下文学习
图像分类
多模态学习
开放世界识别
视觉语言模型
微软发布15B参数开源多模态推理模型,以少量算力实现数学/科学推理竞争力
Jyoti Aneja, Michael Harrison, Neel Joshi, Tyler LaBonte, John Langford,...
2026-03-05
多模态大模型
推理模型
数据工程
视觉语言模型
计算机使用代理
通过参数化Lottie tokens和多模态指令,实现高质量矢量动画的自动生成。
Yiying Yang, Wei Cheng, Sijin Chen, Honghao Fu, Xianfang Zeng, Yujun Cai,...
2026-03-03
Lottie
多模态生成
矢量动画
自回归生成
视觉语言模型
提出SVG2数据集与TraSeR模型,自动生成视频时空场景图
Ziqi Gao, Jieyu Zhang, Wisdom Oluchi Ikezogwo, Jae Sung Park, Tario G. You,...
2026-03-03
场景图生成
数据集构建
目标跟踪
视觉语言模型
视频理解