使用自回归Transformer逐点生成3D高斯点云,实现从单张图像生成可驱动的4D头像
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
基于Transformer的自回归3D高斯场景生成方法,支持无条件生成、补全和大场景合成
提出分层多尺度补丁transformer架构,将计算成本降低50%同时保持高质量生成
基于闪烁的周期性和方向性特性,提出 Flickerformer 框架,实现高质量的突发图像闪烁移除
提出轻量级Plain Mask Decoder实现冻结VFM的高效图像视频分割
通过3D感知特征预训练实现高质量实时新视角合成,无需显式3D重建
通过动态混合精度量化与时间增量缓存,实现视频DiT 1.92倍加速和3.32倍内存缩减
首个端到端多视图3D重建,同时重建几何、PBR材质和HDR环境光,速度小于1秒
仅用2D图像训练,实现视频DiT的多种编辑任务,无需任何视频数据
通过空间稀疏化和动态token激活实现DiT免训练7倍加速
提出瞬态异步融合把高频事件注入低频RGB特征,首套真实帧-事件TAP基准SOTA。
通过QK-norm和降低每步token数,使INT8注意力训练匹配全精度效果
下一嵌入预测使世界模型更强大
👍 21用因果Transformer预测下一时刻嵌入,替代像素重建学习世界模型
独立训练的 Transformer 权重千差万别,但都收敛到同一低维算法核心
提出COMiT,通过迭代局部观测和递归更新构建具有语义结构的离散视觉token序列
论序列模型中的归纳偏置
👍 4Transformer在状态跟踪任务中数据效率低下,无法跨序列长度共享学习机制
用自回归 Transformer 从文本生成模块化 3D 建筑资产
用于时序因果发现的大型因果模型
👍 1预训练Foundation模型实现零样本时序因果发现
提出统一前馈框架,从单目视频联合重建4D几何与运动
首个纯Transformer端到端音频分词器,16亿参数,全面超越现有编解码器