找到 63 条结果

提出基于MoE的语义感知风格迁移框架,支持从颜色到深层次的多样化风格

Shihao Zhu, Ziheng Ouyang, Yijia Kang, Qilong Wang, Mi Zhou, Bo Li,... 2026-03-18
Diffusion Models Mixture of Experts 图像生成 计算机视觉 风格迁移

首次探索全景功能预测任务,提出PAP-12K数据集和模拟人眼中央凹视觉的PAP框架

Zixin Zhang, Chenfei Liao, Hongfei Zhang, Harold Haodong Chen, Kanghao Chen,... 2026-03-17
全景视觉 具身智能 功能预测 视觉语言模型 计算机视觉

首个全自动大规模空间感知多模态数据集构建流水线,从原始视频生成高质量3D空间标注。

Yuanyuan Gao, Hao Li, Yifei Liu, Xinhao Ji, Yuning Gong, Yuanjun Liao,... 2026-03-10
3D重建 多模态学习 数据集构建 空间智能 计算机视觉

首个实时空间感知对话运动生成方法,使虚拟智能体能实时响应用户位置并生成自然对话动作

Evonne Ng, Siwei Zhang, Zhang Chen, Michael Zollhoefer, Alexander Richard 2026-02-23
动作生成 实时推理 对话智能体 虚拟现实 计算机视觉

C-RADIOv4通过多教师蒸馏构建聚合视觉骨干模型,提升下游任务性能并支持任意分辨率

Mike Ranzinger, Greg Heinrich, Collin McCarthy, Jan Kautz, Andrew Tao, Bryan... 2026-01-27
基础模型 多分辨率训练 蒸馏 视觉编码器 计算机视觉

提出Shesha指标揭示表征稳定性与相似性独立,发现DINOv2存在"几何税"

Prashant C. Raju 2026-01-15
可解释性 模型评估 神经科学 表征学习 计算机视觉

轻量级单目深度估计框架,参数减少85%性能不降

Zeyu Ren, Zeyu Zhang, Wukai Li, Qingxiang Liu, Hao Tang 2026-01-12
单目深度估计 数据质量筛选 模型轻量化 计算机视觉 零样本学习