低维中间状态+并行rollout近似,刷新像素空间AR生成SOTA
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过训练时范数约束抑制RL post-training的感知质量退化
DanceOPD:在线策略生成场蒸馏
👍 81通过硬路由和单查询场匹配,实现多能力图像生成模型的统一蒸馏
通过统一智能体框架解决文本到图像生成中的上下文差距问题
提出统一训练框架NANOGEN和综合基准DIFFUSIONBENCH,揭示ImageNet和文本生成图片性能不相关
通过挖掘社区LoRA构建大规模数据集,实现高质量的风格-内容双重参考图像生成。
提出判别器引导的强化学习(DRL),在不依赖人类偏好的情况下修正流匹配模型的分布偏差
像素空间扩散的谱强制:显露信号,隐藏噪声
👍 22用时变2D-DCT低通掩码为像素空间整流流扩散提供无参数输入先验,显式化移动的频率边界。
单一离散视觉 token 实现理解生成统一的自回归框架
参考引导生成内容超分辨率与精细化
👍 9首次提出RefGC-SR²任务,利用原始高分辨率参考图联合修复生成伪影并提升分辨率。
用 Noisy ViT 编码器统一视觉空间,解耦扩散解码器与文本解码,实现理解与生成的协同提升。
首个多智能体框架,通过规划-生成-批评流程赋予任意图像生成器交错生成能力
首个在单个ViT中统一图像视频tokenization的UMM框架
将8步扩散模型蒸馏为2步生成器,通过三种技术突破2步生成的质量和稳定性瓶颈
融合浅层与深层特征实现高质量离散视觉token
用统一离散视觉token实现图像理解、生成和编辑的自回归模型
表示强制:无瓶颈统一多模态模型
👍 63通过预测理解表示来指导像素空间生成,消除VAE瓶颈
代码驱动的智能体图像生成
👍 41用代码作为画笔,将图像生成分解为概念化、草图和着色三阶段
提出DLA模块和多阶段去噪策略,整合MLLM与VAE实现高质量主题驱动图像生成
发现自然图像语义信息集中在方向分量,提出超球面流匹配 SFM。