揭示CLIP等嵌入模型概念绑定失败的根本原因:绑定函数的高复杂性阻碍跨模态泛化,而乘积结构可实现系统性泛化。
Arnas Uselis, Darina Koishigarina, Seong Joon Oh
2026-06-01
CLIP
概念绑定
组合泛化
表示几何
视觉语言模型
NEO-ov提出端到端原生视觉语言架构,统一单图/多图/视频/空间智能,在多个基准上超越现有原生模型
Haiwen Diao, Jiahao Wang, Penghao Wu, Yuhao Dong, Yuwei Niu, Yue Zhu,...
2026-05-28
原生架构
多模态理解
空间智能
端到端学习
视觉语言模型
把视觉感知、文本推理、视觉推理拆成三个独立阶段做后训练,VLM 的视觉推理准确率涨、推理链还变短了。
Juncheng Wu, Hardy Chen, Haoqin Tu, Xianfeng Tang, Freda Shi, Hui Liu,...
2026-05-25
GRPO
后训练
强化学习
视觉感知
视觉语言模型
基于VLM的模板化RLE几何表示,统一生成刚体/可变形/铰接仿真3D资产
Ziang Cao, Yinghao Liu, Haitian Li, Runmao Yao, Fangzhou Hong, Zhaoxi Chen,...
2026-05-22
3D生成
Run-Length Encoding
仿真就绪资产
具身智能
机器人策略学习
首个评测 GUI 智能体在专业媒体后期软件中长程组合操作的基准
Haobo Hu, Xiangwu Guo, Zhiheng Chen, Difei Gao, Haotian Liu, Libiao Jin, Qi Mao
2026-05-21
GUI Agent
基准评测
媒体后期制作
视觉语言模型
计算机使用智能体
把VLM训练成导演理解分镜创意意图,再统一控制信号注入视频生成
Hongji Yang, Songlian Li, Yucheng Zhou, Xiaotong Zhao, Alan Zhao, Chengzhong...
2026-05-20
专业动画生产
可控视频生成
强化学习
扩散模型
视觉语言模型
工具增强VLM智能体+统一视频DiT,解决视频编辑请求欠指定难题
Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong,...
2026-05-20
工具调用
扩散模型
智能体
视觉语言模型
视频编辑
提出基于实体级分解的抽象图像编辑评估框架 ENTITY-RUBRICS 与 ABSTRACTEDIT 基准,揭示模型在意图理解与保持之间的根本矛盾。
Mor Ventura, Roy Hirsch, Yonatan Bitton, Regev Cohen, Roi Reichart
2026-05-20
图像编辑评估
基准数据集
多模态
抽象指令
指令跟随
差分渲染构造 82 语言 OCR 数据,DPO 实现稳定跨语言迁移
Ahmed Heakl, Youssef Mohamed, Abdullah Sohail, Rania Elbadry, Ahmed Nassar,...
2026-05-20
DPO
多语言 OCR
数据合成
文档版面理解
视觉语言模型
用自进化的视觉热图替代文本记忆与教师 LLM,为 3B VLM 智能体注入密集空间奖励。
Pan Wang, Yihao Hu, Xiujin Liu, Jingchu Yang, Hang Wang, Zhihao Wen
2026-05-19
具身智能
奖励塑形
强化学习
技能记忆
视觉语言模型
首个统一对比长上下文LVLM与记忆增强代理的多模态长期记忆基准
Xiyu Ren, Zhaowei Wang, Yiming Du, Zhongwei Xie, Chi Liu, Xinlin Yang,...
2026-05-15
RAG
多模态记忆
视觉语言模型
记忆增强代理
评测基准
用5B token长文档VQA把Qwen2.5-VL从32K扩到128K并外推至512K。
Zhaowei Wang, Lishu Luo, Haodong Duan, Weiwei Liu, Sijin Wu, Ji Luo, Shen...
2026-05-14
多模态检索
持续预训练
数据合成
视觉语言模型
长上下文
VLM规划器与VGM模拟器在双相循环中互训,从无标注种子图自演化机器人操作。
Harold Haodong Chen, Sirui Chen, Yingjie Xu, Wenhang Ge, Ying-Cong Chen
2026-05-14
DPO
GRPO
具身智能
机器人操作
自演化学习
把“可编译”LaTeX 转成“可发表”PDF 的视觉闭环智能体
Bihui Yu, Xinglong Xu, Junjie Jiang, Jiabei Cheng, Caijun Jia, Siyuan Li,...
2026-05-12
LaTeX 排版
基准测试
文档自动化
智能体
视觉语言模型
DBTrimKV:权重共享保留门+全局预算,动态分配KV缓存
Ngoc Bui, Hieu Trung Nguyen, Arman Cohan, Rex Ying
2026-05-12
KV缓存压缩
模型推理加速
注意力机制
视觉语言模型
长上下文推理
用K×K网格行/列后验探针在答案空间挑帧,按分布形状自适应每题算力
Mohamed Eltahir, Lama Ayash, Ali Habibullah, Tanveer Hussain, Naeemullah Khan
2026-05-12
测试时计算
自适应计算
视觉语言模型
训练免费推理
长视频理解
用 Pretzel 架构把冻结 VLM 与自回归流在统一因果掩码下交织,实现真正统一的多模态生成。
Ying Shen, Tianrong Chen, Yuan Gao, Yizhe Zhang, Yuyang Wang, Miguel Ángel...
2026-05-11
图像生成
归一化流
扩散模型替代
统一多模态模型
自回归Transformer
用稀疏自编码器在VLM中检测对抗攻击,无需额外对抗训练
Hao Wang, Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh, Daisuke Kawahara
2026-05-11
对抗攻击
模型安全
特征可解释性
稀疏自编码器
视觉语言模型
用上三角几何约束让多个领域适配器可堆叠成准阿贝尔群,O(1)推理并缓解灾难性遗忘。
Pranav Mantini, Shishir K. Shah
2026-05-08
CLIP适配器
多领域适应
持续学习
灾难性遗忘
知识组合
在Ego-Exo4D上用三套参数高效方法把多视角动作熟练度估计推向生成式反馈
Edoardo Bianchi, Antonio Liotta
2026-05-07
动作质量评估
参数高效微调
多视角视频理解
时序采样
视觉语言模型