在单个高斯基元内部引入空间变化的颜色与不透明度函数,显著提升高斯泼溅的表达能力与紧凑性。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用几何上下文注意力实现长视频实时三维重建,效率与精度双超SOTA
从五大研究挑战出发,系统综述前馈式三维重建的近年进展。
使用自回归Transformer逐点生成3D高斯点云,实现从单张图像生成可驱动的4D头像
用模块化桥接方案将前馈重建与扩散生成统一为协同框架,从稀疏无位姿图像恢复高保真三维网格。
提出前馈式3D感知天气编辑框架,无需逐场景优化即可实现细粒度物理控制的视频天气转换
通过解耦几何与纹理的双网络架构,实现4K分辨率的前馈高斯泼溅新视角合成
提出锚点引导的3D跟踪实现单目视频360度动态物体重建
通过预测密度分数实现自适应高斯分配,在大幅减少高斯数量的同时保持高质量3D重建
通过可微不确定性束调整和 DINOv2 特征相似度,实现真实动态环境下的鲁棒实时 SLAM
首个端到端多视图3D重建,同时重建几何、PBR材质和HDR环境光,速度小于1秒
单张图像端到端重建铰接三维物体,渐进式结构推理实现关节预测
融合显式3D与隐式注意力的Patch级混合空间记忆机制
无需外部模块,一次性从多人多视角视频联合重建相机、场景和人体
通过增强多视图基础模型的密集匹配能力,实现高精度单目SLAM与3D重建
统一因果时空注意力视觉骨干,支持流式感知、几何重建与具身控制
首个体育空间智能数据集CourtSI,100万QA对,25个VLM评测揭示人机差距
首个全自动大规模空间感知多模态数据集构建流水线,从原始视频生成高质量3D空间标注。
用滑动窗口注意力+测试时训练的混合记忆架构,将前馈式3D重建扩展到万帧级长序列
用可微Bézier曲面从文本/图像/点云生成可编辑CAD模型,突破CAD数据标注瓶颈