将RLHF和OPD应用于扩散模型,提升图像生成与编辑质量
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
DanceOPD:在线策略生成场蒸馏
👍 81通过硬路由和单查询场匹配,实现多能力图像生成模型的统一蒸馏
用图像编辑替代视频生成作为世界动作模型骨干,降低推理成本并提升机器人控制性能
提出基于空间频率的自适应token压缩框架,在不损失质量的情况下将DiT加速最高3.13倍
文本-视觉协同指导的图像编辑
👍 19联合文本语义和视觉空间提示实现精准意图感知的图像编辑
首个在单个ViT中统一图像视频tokenization的UMM框架
用统一离散视觉token实现图像理解、生成和编辑的自回归模型
提出RE-Edit基准,揭示现有编辑模型在五维隐性推理上的普遍失败。
首个基于像素级确定性评估的精确视觉编辑基准,揭示当前多模态模型在基本栅格操作上的显著局限性。
自举生成器:基于流匹配的非配对视觉编辑
👍 22无需成对数据,利用预训练模型自举训练流匹配编辑模型
将50个视觉效果LoRA蒸馏到单一模块,解决部署成本和特征干扰问题
通过符号化元验证和解耦强化学习实现细粒度多模态视觉验证
首个20B参数统一框架支持文本/图像/图层生成多层可编辑设计
ETCHR:用编辑来澄清和驾驭视觉推理
👍 13用专用图像编辑器替代工具调用与统一多模态,让MLLM真正“用图像思考”。
用检查表引导的自训练规划器+VLM奖励驱动的工具编排器,解决抽象长程图像编辑难题
用100条偏好样本自演化技能与工具库,冻结VLM即可超越GPT-5的图像编辑奖励。
首个覆盖36类任务、融合结构化推理评分的图像编辑与奖励模型统一基准。
统一框架下的高质量图像生成与精确图像编辑模型,支持长文本渲染、多语言排版和高分辨率照片级生成
UNO:在统一多模态模型中用理解任务反向监督生成表征
京东提出统一多模态模型 JoyAI-Image,以空间智能为枢轴打通理解、生成与编辑。