仅凭闭合状态单次观测,网格锚定交叉验证多模型输出,重建部件与关节参数
Daeun Lee, Jaeah Lee, Woosung Kim, Haebeom Jung, Jaesik Park
2026-08-12
3D重建
数字孪生
视觉语言模型
视频扩散模型
铰接物体
用凹凸互锁拼图构建无歧义基准,揭示VLM几何推理随网格增大全面崩塌
Shawn Li, Wei Yang, Jike Zhong, Jiate Li, Jiawei Yang, You Qin, Ryan Rossi,...
2026-08-12
基准评测
空间推理
视觉语言模型
视频全局空间感知基准,揭示最强VLM仍落后人类36分,定向训练可大幅缩小差距。
Qifeng Zhang, Kaixiang Huang, Heng Dong, Huang Fang, Junting Chen, Junjie...
2026-08-07
VQA
具身智能
基准测试
空间智能
视觉语言模型
让多模态大模型按问题语义动态挑选3D模态并分配专家
Yue Zhang, Yingzhao Jian, Yunqiu Xu, Xiaoxiao Sun, Hehe Fan
2026-08-07
3D场景理解
多模态大模型
模态自适应路由
混合专家MoE
视觉语言模型
用VLM显式推理物体诱导效果,实现高保真视频对象擦除。
Feier Wu, Wanke Xia, Xu He, Zilang Zhou, Si Chen, Dongxia Liu, Liyang Chen,...
2026-08-07
对象-效果推理
扩散变换器
视觉语言模型
视频修复
视频物体擦除
过滤在线蒸馏中既不依赖输入又高影响的虚假教师信号
Yinuo Jiang, Yongjie Ye, Zhou Tao, Xiang Zhuang, Qiang Zhang, Huajun Chen, Tiankai Li
2026-08-06
在线策略蒸馏
大语言模型
梯度信噪比
知识蒸馏
视觉语言模型
解耦图像描述的覆盖率与精度,发现理解靠覆盖、生成靠精度
Zhipeng Liu, Haochen Wang, Zhaoxiang Zhang
2026-08-05
图像描述评估
基准测试
数据质量分析
文生图
视觉语言模型
把自动驾驶规划变成轨迹选择题,先推理后揭示候选,治好教师的锚定偏置
Zixuan Huang, Yang Zhou, Kaixuan Wang, Guli Zhang, Hongyan Xie, Yakun Zhu,...
2026-08-04
强化学习
自动驾驶
视觉语言模型
轨迹预测
链式思维推理
逐步执行CAD操作并对比几何反馈,重建可编辑参数化程序
Soslan Kabisov, Gennadiy Savrasov, Maksim Elistratov, Antonio Rodriguez,...
2026-08-04
CAD逆向工程
三维重建
基准评测
强化学习
视觉语言模型
ReBA通过分离图文负载、每张图作为等权路由实例,解决VLMoE在不同token比例下的负载失衡。
Ziang Wu, Peng Jin, Qishen Yin, Munan Ning, Hao Li, Peizhen Zhang, Li Yuan
2026-08-04
动态分辨率
混合专家模型
稀疏路由
视觉语言模型
负载均衡
首个联合评测准确率、记录完整性、溯源与成本的文档抽取基准
Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo
2026-08-03
企业文档处理
基准测试
文档信息抽取
模式引导抽取
视觉语言模型
从野外视频自监督学习离散'物理语言',先推理后渲染的物理世界模型。
Shuyao Shang, Yuqi Wang, Ruopeng Gao, Xu Chen, Tieniu Tan, Lue Fan, Zhaoxiang Zhang
2026-07-31
世界模型
扩散模型
物理世界
自监督学习
视觉语言模型
三阶段框架让VLM先调用专业视觉工具,再把工具能力内化为无工具推理。
Yang Zhou, Zixuan Huang, Sunzhu Li, Zhuo Yang, Chen Zhang, Shunian Chen,...
2026-07-31
具身智能
工具调用
强化学习
空间推理
视觉语言模型
训练单个可学习令牌在值空间检索,让VLM精准定位长视觉上下文中的相关帧。
Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem
2026-07-31
值空间检索
可学习令牌
注意力机制
视觉语言模型
视频理解
冻结 VLM 通过原子技能控制人形身体,瓶颈不在感知而在具身自意识。
Siyao Li, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng...
2026-07-30
人形动作生成
具身智能
具身评测基准
动作决策
半物理仿真
统一框架梳理机器人学习进度奖励模型:接口、构造机制、数据与评测
Jianshu Zhang, Keliang Wu, Haoran Lu, Anbang Liu, Ce Zhang, Weijie Yin,...
2026-07-28
奖励建模
强化学习
机器人学习
综述
视觉语言模型
用逐字引用+检索替代坐标框,让VLM证据归因召回率提升数倍
Zhuchenyang Liu, Yao Zhang, Yu Xiao
2026-07-28
强化学习
文档智能
文档问答
检索增强
视觉语言模型
建立原生多模态预训练的算力最优扩展定律,揭示语言与多模态目标的差异化扩展行为
Haoyuan Wu, Aoqi Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Bei Yu
2026-07-27
上下文学习
原生多模态预训练
扩展定律
混合专家MoE
算力最优
无需训练的智能体框架,通过追踪物体状态演化检测工业视频异常
Mei Yuan, Qi Long, Qifeng Wu, Zhenyang Li, Yizhou Zhao, Lei Wang, Yang Liu, Min Xu
2026-07-27
工业异常检测
无需训练
智能体推理
目标跟踪
视觉语言模型
复用预训练 VLM 自身做视觉 token 自压缩,轻量适配、极端压缩下仍强。
Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu
2026-07-27
KV-Cache
LoRA
层次信息传递
自编码器
视觉token压缩