用最优传输理论修正自回归扩散模型中的条件误差,在ImageNet上达到SOTA
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
基于掩码位建模的自回归图像生成
👍 7提出BAR框架,通过掩码位建模实现离散图像生成新SOTA,gFID达0.99
黎曼流匹配+雅可比正则化,解决扩散Transformer在表征空间收敛失败的几何问题
通过耦合配对时间步的速度预测,降低流匹配训练方差并提升采样效率
提出首个评估图像生成模型作为GUI环境能力的基准,揭示多步规划和空间定位的关键瓶颈
首个评估统一多模态模型在计算机使用任务中规划能力的基准
多样性保持的分布匹配蒸馏用于快速视觉合成
👍 45通过角色分离蒸馏,在少步生成中同时保持样本多样性和感知质量
在离散扩散模型中平衡理解与生成能力
👍 17通过平稳噪声核统一掩码与均匀噪声扩散,实现理解-生成帕累托前沿突破
在x-prediction上叠加LPIPS+P-DINO感知损失,像素扩散首次超越潜在扩散
用多智能体框架将参考图像的抽象隐喻逻辑迁移至新主题,实现真正的创意转译而非像素复制
多智能体协作自动生成出版级学术插图,包含方法图与统计图
在超球面流形上对齐DINO语义特征,实现高保真重建与高效生成
通过在标记化阶段强制因果依赖,弥合标记化与生成之间的鸿沟
通过理论分析揭示数据维度决定扩散模型最优预测目标,提出可学习框架k-Diff自动优化
基于像素均值流的单步无潜变量图像生成
👍 18提出pMF方法实现单步无潜变量图像生成,ImageNet 256×256达2.22 FID
用2σ(1.6x)-1替换tanh,使FSQ同时实现100%利用率和最优精度
首个无需扩散解码器的统一自回归多模态模型,支持文本、图像、语音的任意到任意生成
提出VAE+ViT统一视觉编码器,同时支持图像理解与生成
隐式神经表示促进统一通用视觉编码
👍 7INR超网络统一识别与重建并给出强力压缩表示
通过层次化任务语义注入MoE路由,解决统一图像生成编辑中的任务干扰问题