用VLM直接对文档截图做多跳推理并输出像素级证据框,让RAG归属从粗粒度文本引用跃迁到可视化审计。
Peiyang Liu, Ziqiang Cui, Xi Wang, Di Liang, Wei Ye
2026-05-06
可解释AI
多模态RAG
多跳问答
视觉归属
视觉语言模型
为LVLM设计并行PVM模块,缓解长序列生成中的视觉信号衰减
Siyuan Huang, Xiaoye Qu, Yafu Li, Tong Zhu, Zefeng He, Muxin Fu, Daizong...
2026-05-05
参数高效微调
多模态大模型
多模态推理
幻觉抑制
注意力机制
用超二次曲面作为几何代理,让VLM编辑原始体参数来引导3D扩散模型实现细粒度编辑
Etai Sella, Hao Phung, Nitay Amiel, Or Litany, Or Patashnik, Hadar Averbuch-Elor
2026-05-04
3D形状编辑
3D扩散模型
视觉语言模型
训练免训练
超二次曲面
首个跨六系统、评估 GUI 区域与元素功能理解及交互结果预测的大规模基准
Hongxin Li, Xiping Wang, Jingran Su, Zheng Ju, Yuntao Chen, Qing Li, Zhaoxiang Zhang
2026-04-29
GUI智能体
人机交互
功能理解
基准测试
视觉语言模型
训练免费的提示框架,让VLM在原图上叠加SVG可视化注释来解释推理
Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung...
2026-04-28
SVG注释
人机交互
可解释AI
提示工程
视觉推理
用最后一层隐藏表征与预测误差的对齐代替反向传播,单次前向实现千亿级模型的数据估值。
Wenlong Deng, Qi Zeng, Jiaming Zhang, Minghui Chen, Zixin Ding, Christos...
2026-04-28
大语言模型
影响函数
微调
数据估值
视觉语言模型
LLM 智能体闭环合成百万级可执行 CadQuery CAD 序列,无需任何真实历史数据。
Mohammadmehdi Ataei, Farzaneh Askari, Kamal Rahimi Malekshan, Pradeep Kumar Jayaraman
2026-04-28
3D 生成
CadQuery
大语言模型智能体
数据合成
视觉语言模型
Perceval:感知级PRM实现token级优势重分配
Yingqian Min, Kun Zhou, Yifan Li, Yuhuan Wu, Han Peng, Yifan Du, Wayne Xin...
2026-04-28
幻觉抑制
强化学习
细粒度监督
视觉语言模型
过程奖励模型
提出L1-L4四层时间序列推理认知分类法,构建8.3万样本HITSR数据集,并基于Qwen3-VL训练双视图(折线图+索引-数值表)的LLaTiSA模型,通过三阶段课程微调在L1-L3 OOD任务上大幅超越GPT-4o等基线。
Yueyang Ding, HaoPeng Zhang, Rui Dai, Yi Wang, Tianyu Zong, Kaikui Liu,...
2026-04-24
多模态大模型
推理基准
时间序列
视觉语言模型
课程学习
解耦探索与任务生成,策略切换采样错误恢复轨迹,让开源数据追平闭源 70% AndroidWorld。
Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen...
2026-04-23
GUI Agent
数据合成
模仿学习
移动智能体
视觉语言模型
用可学习query token对齐MLLM与扩散模型的低成本统一多模态生成框架
Zijie Li, Yichun Shi, Jingxiang Sun, Ye Wang, Yixuan Huang, Zhiyao Guo,...
2026-04-23
图像编辑
多模态生成
扩散模型
表征对齐
视觉语言模型
提出GG-EZ框架通过区域数据过滤与模型合并实现视觉语言模型的区域适配且保留全局能力
Samuel Cahyawijaya, Peerat Limkonchotiwat, Tack Hwa Wong, Hitesh Laxmichand...
2026-04-16
东南亚
全球化因子
区域适配
文化对齐
模型合并
提出层级化 SVG 分词框架,将命令-参数组压缩为可渲染片段标记,序列长度缩减 63%。
Ximing Xing, Ziteng Xue, Zhenxi Li, Weicong Liang, Linqing Wang, Zhantao...
2026-04-15
SVG生成
几何感知
分词压缩
自回归模型
视觉语言模型
打开 Gemini 思维流黑盒,揭示思考预算与视频理解质量的真实关系。
Shivam Sharma, Sankalp Nagaonkar, Ashish Choithani, Ashutosh Trivedi
2026-04-15
LLM-as-Judge
思维链
推理评估
视觉语言模型
视频理解
158 种 Unicode 脚本 OCR 基准:低资源文字上模型几乎全面失效
Amir Hossein Kargaran, Nafiseh Nikeghbal, Jana Diesner, François Yvon,...
2026-04-15
OCR基准
多语言
幻觉分析
脚本多样性
视觉语言模型
用 3021 道菜、5.27 张/菜的多视角图,系统评测 29 个视觉语言模型在精细分类、营养估计与饮食 VQA 三大任务上的真实能力。
Song Jin, Juntian Zhang, Xun Zhang, Zeying Tian, Fei Jiang, Guojun Yin, Wei...
2026-04-14
Chain-of-Thought
VQA
基准测试
多视角
细粒度识别
系统揭示SOTA VLM在旋转/缩放/恒等变换下高度依赖数据熟悉度,缺乏真正几何推理能力。
Jason Qiu, Zachary Meurer, Xavier Thomas, Deepti Ghadiyaram
2026-04-13
MLLM评测
VLMBenchmark
几何推理
变换不变性
视觉编码器
腾讯混元具身基础模型家族,MoT+自进化训练+蒸馏,2B 小模型 SOTA 22 基准。
Tencent Robotics X, HY Vision Team, Xumin Yu, Zuyan Liu, Ziyi Wang, He...
2026-04-10
Mixture-of-Transformers
具身智能
强化学习
机器人基础模型
知识蒸馏
完全开源多模态网页智能体,纯截图操作,在浏览器任务上击败同规模开源模型
Tanmay Gupta, Piper Wolters, Zixian Ma, Peter Sushko, Rock Yuren Pang, Diego...
2026-04-10
多模态智能体
开源数据集
监督微调
网页智能体
视觉语言模型
基于宝可梦Z-A的3D长视距VLM基准,揭示当前视觉语言模型的物理死锁恢复瓶颈。
Ruizhi Zhang, Ye Huang, Yuangang Pan, Chuanfu Shen, Zhilin Liu, Ting Xie,...
2026-04-10
3D开放世界
具身智能
基准测试
死锁恢复
视觉语言模型