8B-MoT 无编码器无VAE统一模型,靠空间联合重建与多专家RL蒸馏兼顾理解、生成与编辑
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
补丁重参数化让冻结语义ViT兼得理解与重建,单一视觉空间支撑生成与编辑
把身份选择、布局规划与生成统一进一个模型,让5–10人合影既保真又不重脸
以能力为单位组织440M文生图、120M编辑与27M知识数据,按依赖顺序编排课程训练通用图像生成模型
能量引导的流匹配
👍 11用随图像频谱演化的移动低通终点替换固定终点,让像素级流匹配按粗到细轨迹生成
面向快速图像与视频生成的并行解码蒸馏
👍 14训练并行解码器,用单次前向同时预测多个去噪步的速度,实现少步、高质、高多样性的扩散与流模型蒸馏。
dRAE:基于超球面码的表示自编码器
👍 12用角相似度替代欧氏距离做码本路由,解决高维视觉量化坍缩。
三体散射生成建模
👍 16把能量距离变成常数规模三体散射,实现高维一步生成
用频谱先验降低扩散模型的曝光偏差
👍 6推理时用FFT频谱对齐校正扩散模型曝光偏差,开销仅3-4%
结合隐式几何先验与尺度感知RoPE,实现大视角变化的精确可控单目新视角合成
寄存器令牌在无异常值的DiT中仍提升像素空间生成质量,并提出Register Guidance
感知流匹配:用于少步生成建模
👍 16通过在感知特征空间监督流匹配,将采样步数从35-50步减少到4-8步且保持质量
通过旋转基共享 Lloyd-Max 码本实现数据无关的 DiT 低比特量化,无需校准数据即可跨模态应用
通过场景图显式丰富稀疏描述,生成语义更丰富的图像
表征分布匹配用于一步视觉生成
👍 10通过精确估计MMD和多编码器约束优化,实现一步生成器的SOTA质量
GEAR:引导式端到端自回归图像合成
👍 34端到端联合训练VQ tokenizer和AR generator,将ImageNet训练加速10倍
无需训练的高分辨率照片拼图生成框架,通过解耦全局布局和局部瓦片生成实现高效高质量输出
MIMFlow通过掩码瓶颈解耦语义建模和像素合成,用128 tokens实现2.50 FID
提出ILLUME-X统一模型,实现高质量N-to-M自由形式交错文本-图像生成
将RLHF和OPD应用于扩散模型,提升图像生成与编辑质量