基于JEPA的自监督框架,用多视图预测学习CGM表示,实现代谢疾病预测的跨模态一致性性能
Hada Melino Muhammad, Zechen Li, Flora Salim, Ahmed A. Metwally
2026-05-11
JEPA
医疗AI
多视图学习
时间序列表示学习
自监督学习
把时间做成可学习概念,教会模型感知并按指定播放速度生成视频
Yen-Siang Wu, Rundong Luo, Jingsen Zhu, Tao Tu, Ali Farhadi, Matthew...
2026-04-24
慢动作数据集
扩散模型
时间建模
自监督学习
视频理解
构建1400+小时古兰经音频数据集,600+朗读者,提出AAM语义对齐pipeline。
Faisal Alherran
2026-04-23
古兰经
数据集
自监督学习
语音识别
音频处理
基于 DINOv2 的统一对应模型,用粗到细目标+稠密自蒸馏实现 SOTA 且小 3 倍快 10 倍。
Claudia Cuttano, Gabriele Trivigno, Carlo Masone, Stefan Roth
2026-04-21
DINOv2
图像匹配
自监督学习
计算机视觉
语义对应
TIPSv2 提出 iBOT++ 损失与多粒度文本增强,显著提升 ViT 视觉编码器的 patch-text 对齐。
Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur,...
2026-04-20
ViT
图像分割
密集预测
自监督学习
视觉-语言预训练
把少量自监督任务伪装成指令,迫使多模态大模型真正用眼睛看。
Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome,...
2026-04-17
LLaVA
多模态大模型
自监督学习
视觉中心推理
视觉指令微调
ZWM用单儿童868小时第一人称视频训练,无需任务标签即可零样本完成光流/深度/分割/物理推理
Khai Loong Aw, Klemen Kotar, Wanhee Lee, Seungwoo Kim, Khaled Jedoui, Rahul...
2026-04-14
世界模型
儿童视觉发育
因果推断
脑-模型对齐
自监督学习
首个面向符号音乐的 LilyPond 策展数据集与代码预训练编码器
Matteo Spanio, Ilay Guler, Antonio Rodà
2026-04-14
Baroque音乐
LilyPond
代码预训练
符号音乐
线性探测
首次从 token 空间视角解决深度压缩自编码器的表征坍缩问题
Teng Li, Ziyuan Huang, Cong Chen, Yangfu Li, Yuanhuiyi Lyu, Dandan Zheng,...
2026-04-09
Vision Transformer
图像生成
扩散模型
自监督学习
视觉 tokenizer
单令牌编码帧间差分,35×参数、2000×FLOPs缩减的生成式世界模型。
Tommie Kerssies, Gabriele Berton, Ju He, Qihang Yu, Wufei Ma, Daan de Geus,...
2026-04-09
世界模型
生成式模型
自动驾驶
自监督学习
视觉基础模型
2D 自然图像自编码器把 fMRI 体压为 27 token,支持 256 帧长程建模。
Peter Yongho Kim, Juhyeon Park, Jungwoo Park, Jubin Choi, Jungwoo Seo, Jiook...
2026-04-08
Transformer
fMRI
脑影像
自监督学习
表征学习
基于XEUS与SelfCTC的通用音素识别SOTA模型
Shikhar Bharadwaj, Chin-Jou Li, Kwanghee Choi, Eunjung Yeo, William Chen,...
2026-04-03
CTC损失
多语种
自监督学习
语音识别
音素识别
仅用 DINOv3 特征实现训练无关的 one-shot 语义/部分/个性化分割,超越现有方法 7.5% mIoU
Claudia Cuttano, Gabriele Trivigno, Christoph Reich, Daniel Cremers, Carlo...
2026-03-31
DINOv3
上下文分割
自监督学习
语义对应
零样本学习
首个显式建模患者多切片关系的病理学基础模型,通过两阶段框架在16个任务上超越基线模型
Yousef Kotp, Vincent Quoc-Huy Trinh, Christopher Pal, Mahdi S. Hosseini
2026-03-31
基础模型
多切片聚合
患者级建模
自监督学习
计算病理学
通过全局到局部重构学习编码what-is-where场景组成的紧凑视觉状态
Seokmin Lee, Yunghee Lee, Byeonghyun Pak, Byeongju Woo
2026-03-27
场景理解
机器人学习
状态表示学习
自监督学习
基于图加权的非对比自监督框架,联合建模失真与内容,提升无参考图像质量评估泛化性。
Mahdi Naseri, Zhou Wang
2026-03-25
图关系监督
失真组合引擎
无参考图像质量评估
自监督学习
通过正交投影消除说话人信息,聚焦合成伪迹实现高泛化深度伪造检测
Kyudan Jung, Jihwan Kim, Minwoo Lee, Soyoon Kim, Jeonghoon Kim, Jaegul Choo,...
2026-03-24
子空间投影
自监督学习
语音深度伪造检测
说话人解纠缠
零样本泛化
将视频编辑分解为语义锚定和运动对齐,实现高精度指令跟随和强时序一致性
Xinyao Zhang, Wenkai Dong, Yuxin Song, Bo Fang, Qi Zhang, Jing Wang, Fan...
2026-03-20
多模态学习
扩散模型
指令理解
自监督学习
视频编辑
利用 OSM 地图数据实现自包含的遥感 VLM 域适应,无需外部教师模型
Stefan Maria Ailuro, Mario Markov, Mohammad Mahdi, Delyan Boychev, Luc Van...
2026-03-20
OpenStreetMap
域适应
自监督学习
视觉-语言模型
遥感
通过将预测损失扩展到所有token并引入深层自监督,大幅提升视频自监督学习的密集特征质量
Lorenzo Mur-Labadia, Matthew Muckley, Amir Bar, Mido Assran, Koustuv Sinha,...
2026-03-19
世界模型
密集预测
自监督学习
视觉Transformer
视频理解