无需外部模块,一次性从多人多视角视频联合重建相机、场景和人体
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出基于MoE的语义感知风格迁移框架,支持从颜色到深层次的多样化风格
SING:分类器中语义不变量的分析方法
👍 17通过零空间几何与CLIP映射,量化分类器的语义不变性
全景图像中的功能预测研究
👍 10首次探索全景功能预测任务,提出PAP-12K数据集和模拟人眼中央凹视觉的PAP框架
统一因果时空注意力视觉骨干,支持流式感知、几何重建与具身控制
提出轻量级GAN模型,通过混合训练策略实现实时高分辨率合成图像的真实感增强
首个全自动大规模空间感知多模态数据集构建流水线,从原始视频生成高质量3D空间标注。
用LLM发现类别概念+VLM定位,微调ViT相关性图对齐语义区域,提升分布偏移鲁棒性
首个实时空间感知对话运动生成方法,使虚拟智能体能实时响应用户位置并生成自然对话动作
结合人类专家CoT数据与地理相似性奖励,实现细粒度图像地理定位
无需训练框架,在极端视角变化下实现4D视频重光照
通过精确建模模态间隙几何结构,用无配对文本替代昂贵图文数据训练MLLM
首个评估统一多模态模型在计算机使用任务中规划能力的基准
通过理论分析揭示数据维度决定扩散模型最优预测目标,提出可学习框架k-Diff自动优化
C-RADIOv4(技术报告)
👍 11C-RADIOv4通过多教师蒸馏构建聚合视觉骨干模型,提升下游任务性能并支持任意分辨率
基于扩散Transformer的统一多模态视频生成框架
几何稳定性:表征的缺失维度
👍 7提出Shesha指标揭示表征稳定性与相似性独立,发现DINOv2存在"几何税"
首个仅需单帧掩码的端到端视频角色替换框架
提出多头线性注意力MHLA,通过token维度分块解决全局上下文坍塌问题
AnyDepth:让深度估计变得简单
👍 11轻量级单目深度估计框架,参数减少85%性能不降