找到 81 条结果

通过跨模态对齐将DINOv2转变为能统一处理RGB、深度、分割等多模态输入的视觉编码器

Rishabh Kabra, Maks Ovsjanikov, Drew A. Hudson, Ye Xia, Skanda Koppula,... 2026-03-13
对比学习 知识蒸馏 自监督学习 视觉编码器 跨模态学习

通过压缩LLM潜在响应生成输出空间嵌入,无需标注数据

Parishad BehnamGhader, Vaibhav Adlakha, Fabian David Schmidt, Nicolas... 2026-03-12
信息检索 大语言模型 文本嵌入 自监督学习 表征学习

首个跨域联合自监督预训练的点云统一编码器,用三个简洁设计解决域间不一致问题

Yujia Zhang, Xiaoyang Wu, Yunhan Yang, Xianzhe Fan, Han Li, Yuechen Zhang,... 2026-03-04
3D视觉 点云 统一模型 自监督学习 跨域迁移

证明对比学习中 InfoNCE 目标函数在高维表示空间中渐近诱导出高斯分布结构

Roy Betser, Eyal Gofer, Meir Yossef Levi, Guy Gilboa 2026-03-02
InfoNCE 对比学习 理论分析 自监督学习 表征学习

将JEPA从图像块扩展到对象级表示,通过遮蔽诱导因果归纳偏置,实现高效交互感知的世界建模

Heejeong Nam, Quentin Le Lidec, Lucas Maes, Yann LeCun, Randall Balestriero 2026-02-18
世界模型 因果推理 对象表示 模型预测控制 自监督学习

通过序列级控制-效果对齐学习可迁移的潜在动作,实现跨场景零样本动作转移

Yuxin Jiang, Yuchao Gu, Ivor W. Tsang, Mike Zheng Shou 2026-02-11
动作可控生成 潜在动作学习 自监督学习 表示对齐 视频世界模型

通过动力学增强的潜在动力学模型,从无标签视频学习可迁移任务知识

Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang,... 2026-02-11
世界模型 机器人操作 自监督学习 视频生成 长时序推理

用自监督 RL 训练 LLM 成为动作条件的世界模型,提升智能体决策能力

Xiao Yu, Baolin Peng, Ruize Xu, Yelong Shen, Pengcheng He, Suman Nath,... 2026-02-06
GRPO LLM智能体 世界模型 强化学习 自监督学习

将RGB-D相机缺失深度视为自然掩码,通过掩码建模学习联合几何-外观表征

Bin Tan, Changjiang Sun, Xiage Qin, Hanat Adai, Zelin Fu, Tianxiang Zhou,... 2026-01-27
RGB-D感知 机器人操控 深度估计 深度补全 自监督学习

构建1.47亿动作片段的大规模视频动作数据集,显著提升零样本动作识别性能

Delong Chen, Tejaswi Kasarla, Yejin Bang, Mustafa Shukor, Willy Chung, Jade... 2026-01-16
动作识别 数据集构建 自监督学习 视觉语言模型 视频理解