用生成式3D先验以分块条件生成方式重建高保真PBR网格场景
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
训练无关的推理时框架,用Tweedie匹配对齐重叠窗口,生成长视频且无需微调
支持变长生成与修复的快速潜空间扩散音频模型族
证明原生DiT加x-prediction在DINOv2表征空间即可达图像生成SOTA
首个支持任意三角剖分的高分辨率网格生成模型
KVPO:面向流式自回归视频生成,在ODE原生范式下做KV语义探索的偏好对齐
无需音频压缩器,直接在原始波形空间用流匹配生成高保真音频
用人类第一人称视频做数据引擎生成物理QA,先训VLM再双通路迁移到VLA
单步训练视频扩散GRPO,6倍加速且匹配全轨迹性能。
跟随均值:参考引导的流匹配生成
👍 5用参考样本均值漂移控制预训练流匹配模型
用因果一致性蒸馏替代因果ODE蒸馏,4倍加速AR视频扩散训练,延迟减半。
用流匹配矫正不可靠文本先验,用不确定性建模细化笔画,单步扩散实现毫秒级文本超分
潜码投到定半径超球面并改用 slerp 路径,ImageNet FID 大幅提升且无需改动扩散架构
非对称参数化流速度(数据全维、噪声低秩),实现像素空间 DiT 训练及潜空间→像素微调
在双曲+欧氏乘积流形上做流匹配适配冻结视觉骨干。
提出残差潜在动作RLA,在紧凑潜在空间中流匹配预测DINO特征动力学
Cola DLM:连续潜在扩散语言模型
👍 85通过分层潜在变量分解将文本生成为连续语义先验传输再条件解码。
在VLA架构中统一集成运动感知、长期记忆与物理感知三大功能模块
MolmoAct2:面向真实部署的动作推理模型
👍 355全开源动作推理VLA模型,独创分层KV条件架构+自适应深度推理,跨多平台零样本部署并刷新多项基准。
把扩散时间步张量化,全采样组合空间,加速训练并解锁分级控制推理。