找到 81 条结果

把时间做成可学习概念,教会模型感知并按指定播放速度生成视频

Yen-Siang Wu, Rundong Luo, Jingsen Zhu, Tao Tu, Ali Farhadi, Matthew... 2026-04-24
慢动作数据集 扩散模型 时间建模 自监督学习 视频理解

基于 DINOv2 的统一对应模型,用粗到细目标+稠密自蒸馏实现 SOTA 且小 3 倍快 10 倍。

Claudia Cuttano, Gabriele Trivigno, Carlo Masone, Stefan Roth 2026-04-21
DINOv2 图像匹配 自监督学习 计算机视觉 语义对应

把少量自监督任务伪装成指令,迫使多模态大模型真正用眼睛看。

Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome,... 2026-04-17
LLaVA 多模态大模型 自监督学习 视觉中心推理 视觉指令微调

ZWM用单儿童868小时第一人称视频训练,无需任务标签即可零样本完成光流/深度/分割/物理推理

Khai Loong Aw, Klemen Kotar, Wanhee Lee, Seungwoo Kim, Khaled Jedoui, Rahul... 2026-04-14
世界模型 儿童视觉发育 因果推断 脑-模型对齐 自监督学习

首次从 token 空间视角解决深度压缩自编码器的表征坍缩问题

Teng Li, Ziyuan Huang, Cong Chen, Yangfu Li, Yuanhuiyi Lyu, Dandan Zheng,... 2026-04-09
Vision Transformer 图像生成 扩散模型 自监督学习 视觉 tokenizer

仅用 DINOv3 特征实现训练无关的 one-shot 语义/部分/个性化分割,超越现有方法 7.5% mIoU

Claudia Cuttano, Gabriele Trivigno, Christoph Reich, Daniel Cremers, Carlo... 2026-03-31
DINOv3 上下文分割 自监督学习 语义对应 零样本学习

首个显式建模患者多切片关系的病理学基础模型,通过两阶段框架在16个任务上超越基线模型

Yousef Kotp, Vincent Quoc-Huy Trinh, Christopher Pal, Mahdi S. Hosseini 2026-03-31
基础模型 多切片聚合 患者级建模 自监督学习 计算病理学

通过将预测损失扩展到所有token并引入深层自监督,大幅提升视频自监督学习的密集特征质量

Lorenzo Mur-Labadia, Matthew Muckley, Amir Bar, Mido Assran, Koustuv Sinha,... 2026-03-19
世界模型 密集预测 自监督学习 视觉Transformer 视频理解