找到 81 条结果

从野外视频自监督学习离散'物理语言',先推理后渲染的物理世界模型。

Shuyao Shang, Yuqi Wang, Ruopeng Gao, Xu Chen, Tieniu Tan, Lue Fan, Zhaoxiang Zhang 2026-07-31
世界模型 扩散模型 物理世界 自监督学习 视觉语言模型

在冻结图像骨干特征上学习主/残差结构化运动 token,自监督分离相机与物体动态

Lukas Knobel, Andrew Zisserman, Yuki M. Asano 2026-07-24
冻结骨干 自监督学习 视觉Transformer 视频表示学习 运动分解

视觉预训练比文本预训练更高效,用25%token预算提升科学推理性能

Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin,... 2026-07-13
基础模型 多模态学习 科学推理 自监督学习 视觉预训练

利用自监督语音模型的音韵特征向量,无需梯度下降即可实现音素分割和识别

Shikhar Bharadwaj, Kwanghee Choi, Stephen McIntosh, Chin-Jou Li, Eunjung... 2026-07-13
低资源学习 自监督学习 语音识别 音素分割 音韵学

395次实验揭示地球观测模型缩放规律,蒸馏出高效嵌入产品

Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, Mark Elvers,... 2026-07-09
MATRYOSHKA嵌入 地球观测 知识蒸馏 缩放定律 自监督学习

提出边界中心的自监督视觉预训练框架,通过强制掩码边界建模实现强空间理解能力

Zelin Fu, Bin Tan, Changjiang Sun, Shaohui Liu, Kecheng Zheng, Yinghao Xu,... 2026-07-07
密集预测 深度估计 自监督学习 视觉预训练 边界检测

通过说话者解耦的分块回归实现高质量音节标记化,提升语音语言模型性能

Ryota Komatsu, Kota Kawakita, Takuma Okamoto, Takahiro Shinozaki 2026-07-07
自监督学习 语音标记化 语音语言模型 说话者解耦 音节发现