找到 63 条结果

通过焦距统一、文本像素引用和数据缩放,标准VLM无需复杂设计即可掌握多样化3D任务

Zhipeng Cai, Zhuang Liu, Yunyang Xiong, Zechun Liu, Vikas Chandra, Yangyang Shi 2026-06-01
3D理解 多视图几何 深度估计 视觉语言模型 计算机视觉

基于 DINOv2 的统一对应模型,用粗到细目标+稠密自蒸馏实现 SOTA 且小 3 倍快 10 倍。

Claudia Cuttano, Gabriele Trivigno, Carlo Masone, Stefan Roth 2026-04-21
DINOv2 图像匹配 自监督学习 计算机视觉 语义对应

首个基于扩散模型的文本到raw图像生成框架,支持任意目标相机

Dongyoung Kim, Junyong Lee, Abhijith Punnappurath, Mahmoud Afifi, Sangmin... 2026-04-01
ISP处理 低层视觉 图像生成 扩散模型 计算机视觉

推理时多分辨率特征融合,无需训练即可全面提升视觉基础模型

Bocheng Zou, Mu Cai, Mark Stanley, Dingfu Lu, Yong Jae Lee 2026-03-27
DINOv2 多尺度特征融合 无训练推理 视觉基础模型 计算机视觉

首个任务和策略无关的主动视觉基础模型,用Canvas注意力实现高效序列推理

Yohaï-Eliel Berreby, Sabrina Du, Audrey Durand, B. Suresh Krishna 2026-03-25
Vision Transformer 主动视觉 基础模型 知识蒸馏 计算机视觉

通过部分级标注和过程奖励强化学习,实现逐步生成可编辑的矢量素描

Xiaodan Du, Ruize Xu, David Yunis, Yael Vinker, Greg Shakhnarovich 2026-03-23
多模态学习 强化学习 生成模型 矢量图形 计算机视觉