用少量时变刚性运动分量加时不变蒙皮权重,从单目视频前馈生成网格动画
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个手部逐关节可见性估计独立任务:冻结HPE骨干训轻量头,HInt上mAP达0.931
通过场景图显式丰富稀疏描述,生成语义更丰富的图像
首个零样本无训练无优化的360全景图像视频生成框架
首个通过MAE在970万页IMSLP乐谱上预训练的ViT基础模型
解耦tracking和matting,仅用图像训练实现零样本视频抠图SOTA
提出基于3D射线几何的轻量特征上采样框架,仅用16%参数实现SOTA性能
利用多视点点跟踪作为几何监督信号,提升4D新视角视频生成的几何一致性和运动保真度
构建大规模艺术文本合成数据集+支持任意形状输入的STR模型
LAS2通过纯2D架构和三阶段训练策略,在实现高效零样本立体匹配的同时显著降低延迟
通过稀疏自适应体素结构实现163倍分辨率提升的3D力学属性场预测
通过软正确性门控和教师概率缩放改进 GUI 定位自蒸馏中的教师信号质量
通过层查询构建实现ViT特征的坐标条件隐式上采样
文本-视觉协同指导的图像编辑
👍 19联合文本语义和视觉空间提示实现精准意图感知的图像编辑
首个从单视角自中心RGB视频构建可形变物理数字孪生的框架
将T2I缺陷诊断建模为结构化集合预测,支持精确定位和语义理解
融合浅层与深层特征实现高质量离散视觉token
UniSHARP:通用单目视图合成
👍 15统一多种相机类型的单目3D高斯视图合成框架
首个包含完整拓扑高精地图和超长距传感器的欧洲多模态自动驾驶数据集。
通过稀疏体素引导的自回归框架,将网格生成视为表面编织过程,实现高压缩比和高质量的3D网格生成