分阶段诊断证明双平面肋骨骨折3D重建的瓶颈在跨视图对应,侧位检测器质量是关键杠杆
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
超越像素:从视频先验到4D世界
👍 178将视频模型的最终去噪潜变量直接映射为4D动态场景,绕过RGB解码,单checkpoint跨生成器复用
从静止状态观测重建铰接物体
👍 46仅凭闭合状态单次观测,网格锚定交叉验证多模型输出,重建部件与关节参数
基于像素空间扩散的单目3D点图预测方法,无需VAE,边界更锐利
像素空间扩散模型统一3D重建与生成,无需VAE/RAE,直接优化3D表示
首个大规模视触觉可变形物体数据集,支持2D/3D世界模型系统对比
提出实例结构化3D token组,使对象成为3D表示的原生接口
无干扰辐射场研究缺乏大规模基准,DF3DV-1K提供1K场景配对数据并系统评估方法
像素对齐多层几何表示,同时实现可见表面重建与遮挡几何生成。
从单张窄视场图像实时生成可交互漫游的3D视频世界模型,支持8FPS实时交互
将任意数量视图压缩为单一全局潜在,通过流匹配生成任意分辨率的3D表面重建
UniSHARP:通用单目视图合成
👍 15统一多种相机类型的单目3D高斯视图合成框架
通过邻域注意力解码器和点梯度匹配损失提升单目3D重建的局部表面质量
统一Transformer架构实现从无约束视频可扩展的自监督新视角合成
将透视基础模型扩展到全景领域,统一预测深度、法线等多任务
在三维重建模型的特征空间里做扩散去噪,同时恢复图像与几何。
用生成式3D先验以分块条件生成方式重建高保真PBR网格场景
首个支持提示的多动物3D重建框架,可通过关键点和掩码从单张图像中联合重建多个动物实例
通过 SSD-CPU-GPU 三级缓存和轨迹自适应流式传输,在单 24GB GPU 上实现十亿级 3DGS 训练
用视频扩散先验从极稀疏视图生成高质量3D场景。