CAT:用一致性正则化解决多尺度 GAN 跨尺度轨迹错位
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用少量细节凝聚查询同时改善表示自编码器的重建与生成质量
证明原生DiT加x-prediction在DINOv2表征空间即可达图像生成SOTA
构建首个开源 100MP T2I 数据集,探索原生超高分辨率图像生成训练方案
把少步图像生成全程搬进球面隐空间,省去反复的像素-隐空间切换。
潜码投到定半径超球面并改用 slerp 路径,ImageNet FID 大幅提升且无需改动扩散架构
Qwen 团队发布 f16/f32 VAE,GSC 与 DINOv2 对齐同时破重建与可扩散性。
统一框架下的高质量图像生成与精确图像编辑模型,支持长文本渲染、多语言排版和高分辨率照片级生成
用 Pretzel 架构把冻结 VLM 与自回归流在统一因果掩码下交织,实现真正统一的多模态生成。
提出先验对齐自编码器PAE,显式塑造扩散友好流形,三项正则协同提升生成质量与收敛。
UNO:在统一多模态模型中用理解任务反向监督生成表征
梯度空间均衡多奖励,单模型同时提升扩散RL所有质量维度
京东提出统一多模态模型 JoyAI-Image,以空间智能为枢轴打通理解、生成与编辑。
把扩散时间步张量化,全采样组合空间,加速训练并解锁分级控制推理。
将Fréchet距离直接作为生成器训练损失,只需解耦估计与梯度规模。
联合图像-特征扩散中的共演化表征
👍 5CoReDi:让语义投影与扩散模型联合训练,稳定共演化提升生成质量。
基于离散扩散LLM的统一多模态模型,语义VQ+MoE主干+扩散解码器三件套打通图文
图像生成器是通用视觉学习器
👍 23把图像生成器指令微调成统一视觉模型,所有任务都重映射为 RGB 生成。
两步跳跃轨迹+梯度折扣+相似度加权,让 FLUX 等流匹配模型能稳定训练任意早期步。
首个把HOI生成与编辑统一在单一DiT中的框架,首次实现多交互编辑。