用CoT验证式奖励模型+GCPO算法显著提升图像编辑模型的指令遵循能力
Hanzhong Guo, Jie Wu, Jie Liu, Yu Gao, Zilyu Ye, Linxiao Yuan, Xionghui...
2026-05-01
RLHF
图像编辑
奖励模型
强化学习
推理式评估
把视觉规划重构为单步图像编辑任务EAR,配合AMAZE基准系统评估前沿模型的推理能力。
Zhimu Zhou, Yanpeng Zhao, Qiuyu Liao, Bo Zhao, Xiaojian Ma
2026-04-30
图像编辑
基准测试
扩散模型
空间推理
视觉规划
提出 Meta-CoT 范式,结合三要素任务分解与五元任务组合,在 Bagel 上实现 21 任务平均 6.415(+15.8%)、ImgEdit 3.83(+11.7%) 的图像编辑能力。
Shiyi Zhang, Yiji Cheng, Tiankai Hang, Zijin Yin, Runze He, Yu Xu, Wenxun...
2026-04-29
Bagel
Chain-of-Thought
GRPO强化学习
任务分解
图像编辑
无需微调,借分块反演与NDCFG++让扩散模型实现4K高分辨率文本引导编辑
Kunho Kim, Sumin Seo, Yongjun Cho, Hyungjin Chung
2026-04-24
分类器自由引导
图像编辑
扩散模型
无调参方法
高分辨率生成
基于离散扩散LLM的统一多模态模型,语义VQ+MoE主干+扩散解码器三件套打通图文
Inclusion AI, Tiwei Bie, Haoxing Chen, Tieyuan Chen, Zhenglin Cheng, Long...
2026-04-23
图像生成
图像编辑
多模态统一模型
扩散语言模型
视觉问答
提出 GSI-Bench:首个生成式空间智能基准,仿真训练可提升空间编辑与理解。
Muzhi Zhu, Shunyao Jiang, Huanyi Zheng, Zekai Luo, Hao Zhong, Anzhou Li,...
2026-04-23
Sim2Real
图像编辑
基准评测
多模态大模型
生成式空间智能
用可学习query token对齐MLLM与扩散模型的低成本统一多模态生成框架
Zijie Li, Yichun Shi, Jingxiang Sun, Ye Wang, Yixuan Huang, Zhiyao Guo,...
2026-04-23
图像编辑
多模态生成
扩散模型
表征对齐
视觉语言模型
统一推理与生成的自动摄影图像编辑框架
Ying Zeng, Miaosen Luo, Guangyuan Li, Yang Yang, Ruiyang Fan, Linxiao Shi,...
2026-04-22
图像增强
图像编辑
多模态大模型
强化学习
扩散模型
用VLM奖励+Flow-GRPO后训练,让图像编辑更贴合人类审美。
Fan Li, Chonghuinan Wang, Lina Lei, Yuping Qiu, Jiaqi Xu, Jiaxiu Jiang,...
2026-04-22
GRPO
RLHF
人类偏好对齐
图像编辑
奖励模型
首个把HOI生成与编辑统一在单一DiT中的框架,首次实现多交互编辑。
Jiun Tian Hoe, Weipeng Hu, Xudong Jiang, Yap-Peng Tan, Chee Seng Chan
2026-04-17
Diffusion Transformer
人-物交互
可控生成
图像生成
图像编辑
基于 Focus-and-Refine 的区域化图像精修,在用户指定区域内恢复细节且严守背景不变。
Dewei Zhou, You Li, Zongxin Yang, Yi Yang
2026-04-13
LoRA
图像生成
图像编辑
多模态
局部精修
用多奖励 Langevin 动力学 + 提示感知自适应策略,在推理时免训练、免反演地引导扩散/流匹配模型
Onkar Susladkar, Dong-Hwan Jang, Tushar Prakash, Adheesh Juvekar, Vedant...
2026-04-10
Langevin 动力学
SAM2
可微分 VQA
图像编辑
奖励引导
将多模态生成重构为视觉流匹配,用图像入图像出范式统一文生图、编辑与物理指令任务。
Junchao Yi, Rui Zhao, Jiahao Tang, Weixian Lei, Linjie Li, Qisheng Su,...
2026-04-09
图像编辑
多模态生成
数据集
流匹配
视觉中心
提出空间编辑基准+50万条合成数据+16B模型,专攻物体平移/旋转与相机视角控制。
Yicheng Xiao, Wenhu Zhang, Lin Song, Yukang Chen, Wenbo Li, Nan Jiang,...
2026-04-07
几何感知评估
合成数据
图像编辑
基准测试
扩散模型
把FlowEdit速度分解为保真项与引导项,仅缩放引导项即实现稳定滑块控制。
Taichi Endo, Guoqing Hao, Kazuhiko Sumi
2026-04-03
FlowEdit
Rectified Flow
免训练
图像编辑
扩散模型
提出基于VQA的自动化评估框架CREval和基准CREval-Bench,解决复杂创意图像编辑的评估难题
Chonghuinan Wang, Zihan Chen, Yuxiang Wei, Tianyi Jiang, Xiaohe Wu, Fan Li,...
2026-04-01
VQA评估
图像编辑
基准测试
多模态大模型
自动评估
提出统一的图像生成/编辑评估基准,覆盖6任务6主题,用可解释标注揭示模型失败模式
Samin Mahdizadeh Sani, Max Ku, Nima Jamali, Matina Mahdizadeh Sani, Paria...
2026-03-31
VLM评估
人类评估
图像生成
图像编辑
评估基准
提出综合评估基准GEditBench v2和成对评估模型PVC-Judge,解决图像编辑评估难题
Zhangqi Jiang, Zheng Sun, Xianfang Zeng, Yufeng Yang, Xuanyang Zhang,...
2026-03-31
图像编辑
奖励模型
成对比较
视觉一致性
评估基准
0.39B参数统一扩散模型,在手机端实现<1秒图文生成与编辑
Kailai Feng, Yuxiang Wei, Bo Chen, Yang Pan, Hu Ye, Songwei Liu, Chenqian...
2026-03-31
图像生成
图像编辑
扩散模型
模型压缩
移动端部署
通过连续情感标注和对称对比学习实现精细可控的面部表情编辑
Jiabin Hua, Hengyuan Xu, Aojie Li, Wei Cheng, Gang Yu, Xingjun Ma, Yu-Gang Jiang
2026-03-27
图像编辑
对比学习
扩散模型
身份保持
面部表情编辑