通过焦距统一、文本像素引用和数据缩放,标准VLM无需复杂设计即可掌握多样化3D任务
Zhipeng Cai, Zhuang Liu, Yunyang Xiong, Zechun Liu, Vikas Chandra, Yangyang Shi
2026-06-01
3D理解
多视图几何
深度估计
视觉语言模型
计算机视觉
统一Transformer架构实现从无约束视频可扩展的自监督新视角合成
Ulrich Prestel, Stefan Andreas Baumann, Nick Stracke, Björn Ommer
2026-06-01
3D重建
场景表示学习
新视角合成
自监督学习
计算机视觉
将透视基础模型扩展到全景领域,统一预测深度、法线等多任务
Vukasin Bozic, Isidora Slavkovic, Dominik Narnhofer, Nando Metzger, Denis...
2026-05-28
3D重建
全景图像
基础模型
多任务学习
计算机视觉
一种通过潜在空间记忆传播和恢复流匹配实现分钟级稳定人体动画的轻量级后训练框架
Wuyang Li, Yang Gao, Mariam Hassan, Lan Feng, Wentao Pan, Po-Chien Luan,...
2026-05-27
人体动画
流匹配
视频生成
计算机视觉
长时序生成
从平面图生成一致的整栋房屋VR导览,结合2D全景生成与3D高斯溅射空间记忆
Jinrang Jia, Zhenjia Li, Yijiang Hu, Yifeng Shi
2026-05-21
三维重建
全景图像生成
室内场景合成
生成式AI
计算机视觉
通过几何占据与光学不透明度解耦,实现半透明场景中高质量反射与透射的实时渲染
Ji Shi, Xianghua Ying, Bowei Xing, Ruohao Guo, Wenzhen Yue
2026-05-20
反射透射建模
场景重建
新视角合成
计算机视觉
高斯泼溅
把平面图重建任务建模成序列到序列的自回归生成,用可学习锚点引导的解码器一次预测一个带语义标签的角点。
Hao Phung, Hadar Averbuch-Elor
2026-05-18
可变形注意力
平面图矢量化
序列生成
自回归解码
计算机视觉
在Retinexformer上引入深度、亮度、语义三模态跨注意力融合以提升低光增强。
Youssef Aboelwafa, Hicham G. Elmongui, Marwan Torki
2026-05-14
Retinexformer
Transformer
低光图像增强
多模态融合
深度估计
基于 DINOv2 的统一对应模型,用粗到细目标+稠密自蒸馏实现 SOTA 且小 3 倍快 10 倍。
Claudia Cuttano, Gabriele Trivigno, Carlo Masone, Stefan Roth
2026-04-21
DINOv2
图像匹配
自监督学习
计算机视觉
语义对应
通过融合倒数第二层特征提升科学图像长尾分类性能
Jiahao Chen, Bing Su
2026-04-07
医学图像分类
基础模型微调
科学图像
计算机视觉
长尾学习
首个基于扩散模型的文本到raw图像生成框架,支持任意目标相机
Dongyoung Kim, Junyong Lee, Abhijith Punnappurath, Mahmoud Afifi, Sangmin...
2026-04-01
ISP处理
低层视觉
图像生成
扩散模型
计算机视觉
推理时多分辨率特征融合,无需训练即可全面提升视觉基础模型
Bocheng Zou, Mu Cai, Mark Stanley, Dingfu Lu, Yong Jae Lee
2026-03-27
DINOv2
多尺度特征融合
无训练推理
视觉基础模型
计算机视觉
用高分辨率扭曲代替代价体积,实现高效准确的立体匹配
Yihan Wang, Jia Deng
2026-03-27
扭曲
深度学习
立体匹配
计算机视觉
零样本泛化
提出轻量级Plain Mask Decoder实现冻结VFM的高效图像视频分割
Niccolò Cavagnero, Narges Norouzi, Gijs Dubbelman, Daan de Geus
2026-03-27
Transformer
Vision Foundation Models
图像分割
视频分割
计算机视觉
首个任务和策略无关的主动视觉基础模型,用Canvas注意力实现高效序列推理
Yohaï-Eliel Berreby, Sabrina Du, Audrey Durand, B. Suresh Krishna
2026-03-25
Vision Transformer
主动视觉
基础模型
知识蒸馏
计算机视觉
从视频历史轨迹预测未来密集运动轨迹的生成框架
Zewei Zhang, Jia Jun Cheng Xian, Kaiwen Liu, Ming Liang, Hang Chu, Jun Chen,...
2026-03-25
视频生成
计算机视觉
轨迹预测
运动建模
通过部分级标注和过程奖励强化学习,实现逐步生成可编辑的矢量素描
Xiaodan Du, Ruize Xu, David Yunis, Yael Vinker, Greg Shakhnarovich
2026-03-23
多模态学习
强化学习
生成模型
矢量图形
计算机视觉
单张图像端到端重建铰接三维物体,渐进式结构推理实现关节预测
Haitian Li, Haozhe Xie, Junxiang Xu, Beichen Wen, Fangzhou Hong, Ziwei Liu
2026-03-20
3D重建
机器人
深度学习
计算机视觉
铰接物体
VTC-Bench:基于32种OpenCV工具和680题,评估MLLM的视觉工具链能力。
Xuanyu Zhu, Yuhao Dong, Rundong Wang, Yang Shi, Zhipeng Wu, Yinlun Peng,...
2026-03-20
基准测试
多模态大模型
智能体
视觉工具调用
计算机视觉
联合学习视频物体移除与插入,利用逆任务一致性擦除物体副作用效果
Yang Fu, Yike Zheng, Ziyun Dai, Henghui Ding
2026-03-20
扩散模型
数据集构建
物体移除
视频修复
计算机视觉