CPI-Bench:面向真实世界图像编辑的综合、实用与智能基准 CPI-Bench: A Comprehensive,Practical and Intelligent Benchmark for Real-World Image Editing
从通用编辑、真实部署到推理编辑三维覆盖,与人类偏好最对齐的图像编辑评测基准
前置知识
图像编辑模型
接收原始图像加自然语言指令、输出编辑后图像的生成模型,如 GPT-Image-2、Nano Banana Pro、FLUX.2-klein、Qwen-Image-Edit 等。先进模型已支持图文交错的复杂指令,甚至同时输入多张参考图进行跨图编辑。
本文的全部工作都是围绕如何科学地评测这类模型展开,理解它们的能力边界(单图编辑、多图一致性、知识推理)是读懂评测设计的前提。
VLM-as-a-Judge(视觉语言模型评分)
用一个视觉语言模型代替人类标注员给生成结果打分:把原指令、原图和编辑结果一起喂给 VLM,让它按预设维度输出 1 到 5 的分数。相比 CLIP Score、PSNR 等传统相似度指标,它与人类感知判断的一致性显著更高。
CPI-Bench 的整个自动化评估框架就建立在这一范式上,且进一步为每类任务定制专属评分 prompt,这是论文方法部分的核心机制。
Spearman 相关系数与 MAE
Spearman 相关系数 $\rho$ 度量两组排名的单调一致程度,取值 $[-1,1]$,越接近 1 说明两个排行榜的次序越吻合;MAE(平均绝对误差)衡量排名位次的平均偏差大小。二者常一起用于验证代理评测与金标准的一致性。
论文用 $\rho$ 和 MAE 把 CPI-Bench 各子集排名与 Arena Image Edit Leaderboard 对比,证明其与人类偏好对齐度最高,这是验证基准效度的关键量化证据。
Arena Image Edit Leaderboard
HuggingFace 等社区运营的图像编辑竞技场排行榜:用户盲测比较两个模型的编辑结果并投票,基于海量真实人类偏好票数用 Elo 类算法排出模型名次,被公认为图像编辑领域的人类偏好金标准。
它扮演了论文中'裁判的裁判'角色——CPI-Bench 的可信度正是通过与其排名的相关性分析确立的,理解它的权威性才能理解论文的验证逻辑。
多图编辑与参考图编辑
指同时输入两张及以上图像的编辑任务,如把图 1 的主体替换成图 2 中的物体、把图 2 的风格迁移到图 1、跨图保持主体身份一致等。要求模型理解图间关系并保持一致性,难度远高于单图编辑。
现有基准完全缺失多图评测,CPI-General-Bench 划出 10 类多图任务是其最大增量贡献,也是拉开开源与闭源模型差距的核心维度。
研究动机
随着 GPT-Image-2、Nano Banana Pro 等顶级闭源模型能执行复杂的图文交错编辑指令,图像编辑正从玩具级试用快速走向真实生产部署,但评测体系严重滞后。现有主流基准如 GEdit-Bench(606 样本、11 子任务)、ImgEdit-Bench(811 样本、14 子任务)和 REDEdit-Bench(1673 样本、15 子任务)几乎全部局限于简单单图编辑:GEdit 与 ImgEdit 完全缺失视角变换任务,REDEdit 缺少单主体驱动编辑和主体重定向等关键能力,且三者均彻底忽略多图编辑。同时它们按抽象能力维度切分任务,脱离真实应用语境,无法反映模型在证件照生成、电商海报、家居渲染等场景的实际表现;更普遍缺少高难度推理编辑数据,无法评估模型的真实智能水平。后果是头部模型在饱和的单图任务上分差极小——GEdit 上的分数方差仅 0.0634,ImgEdit 仅 0.0393——排名与人类偏好榜单明显脱节,用户无从选型,研究者也难以定位优化方向。
本文的目标是本文目标是构建一个能可靠度量真实场景部署能力的图像编辑基准 CPI-Bench,从三个互补维度覆盖模型能力谱系:CPI-General-Bench 全面评估基础编辑性能,包含 24 种编辑任务、2039 个样本,特意同时纳入 14 个单图任务和 10 个多图任务以填补多图评测空白;CPI-Practical-Bench 聚焦高频真实用户应用,覆盖人像增强、电商广告创意、住宅室内设计、内容创作四大核心领域的 51 类应用场景和 558 个样本;CPI-Intelligent-Bench 专攻高难度推理编辑,包含 8 个专家领域、67 个子学科的 1181 个推理实例。三个子集难度由通用、实用到智能逐级递进,配套基于视觉语言模型(VLM)的任务级自动化评分框架,最终以 Arena Image Edit Leaderboard 的人类偏好排名为金标准,验证基准的区分度与对齐度。
与已有工作不同的是,本文的独特切入角度在于实现从『学术能力度量』到『部署价值量化』的范式转变。以往基准按添加、删除等抽象能力维度组织评测,CPI-Practical-Bench 则以真实消费者场景为轴心,用 4 个一级类目、13 个二级类型、51 个三级任务的三级层次分类法捕捉证件照生成、中外文翻译、虚拟家具摆放、多格故事生成等高频需求。其次,它是首个系统性引入多图编辑评测的基准,为多图一致性保持与跨图交互编辑这一现代工作流核心能力提供标准化测试床。第三,作者不满足于构造数据,而是把『基准本身』也作为被验证对象:将各基准产生的模型排名与 Arena 榜单对比,用 Spearman 相关系数 $\rho$ 和平均绝对误差 MAE 量化与人类偏好的一致程度,让基准的可信度有可复核的统计证据,而非自说自话。
核心方法
CPI-Bench 的整体思路是『分层能力刻度 + 自动化 VLM 评分 + 人类偏好校验』三位一体。首先把图像编辑能力拆成难度递进的三层:CPI-General-Bench(24 任务/2039 样本,14 单图 + 10 多图)测基础编辑;CPI-Practical-Bench(51 场景/558 样本)测真实部署;CPI-Intelligent-Bench(8 领域 67 子学科/1181 样本,由作者前期工作 ExpertVerse 精炼扩充而来)测推理编辑。然后为每个任务类别工程化定制专属 VLM 评分 prompt,从指令遵循、视觉自然度、物理与细节一致性等维度对编辑结果给出 1 到 5 分,其中文本编辑、风格迁移、身份一致性任务分别适配专属维度(文本指令符合度、风格保真度、主体一致性等)。最后评测 10 个主流开源与闭源模型:用 CPI-Bench 与旧基准上的分数方差检验区分度,用与 Arena Image Edit Leaderboard 的排名相关性检验与人类偏好的对齐度。
核心创新是『任务特定评分 prompt + 多图/实用/推理三维覆盖』。与 GEdit、ImgEdit 等对所有任务共用一套泛化评分标准的做法不同,CPI-Bench 为每一类编辑操作定制打分 prompt,并按任务性质动态调整评分维度:常规任务测指令遵循、视觉自然度、物理与细节一致性;文本编辑任务测文本指令符合度、文本视觉质量与整体编辑质量;风格迁移任务测风格保真度、内容保持与渲染质量;身份一致任务测主体一致性、指令符合度、图像真实感与视觉连贯性。这种精细化设计让评估能捕捉不同编辑范式的细微差异。数据层面,10 类多图任务(多图组合编辑、参考图增删改换、多主体驱动生成等)是现有基准的完全空白;实用子集以三级真实场景分类取代抽象能力分类;智能子集则通过按推理标准筛选并优化 ExpertVerse 数据,在规模、领域覆盖与任务粒度上大幅扩展。
方法步骤详情
构建流水线分四阶段。第一阶段『分类体系定义』:采用自顶向下与自底向上混合策略,先按基础编辑能力与真实应用场景两大维度系统规划初始类目,再广泛收集互联网上真实用户编辑请求,邀请领域专家做聚类分析与标注,迭代补齐理论框架遗漏的长尾需求。第二阶段『图像收集与策展』:从公开网络数据集和合法授权商业渠道精选超过 10 万张图像,覆盖人像、动物、植物、自然风光与风格化艺术作品,为每个编辑任务构建专属图像池,严格控制背景复杂度与主体特征分布,保证池内异质性以防模型过拟合特定视觉模式。第三阶段『指令生成与质量保证』:先用定制系统 prompt 驱动 VLM 结合图像池批量生成候选编辑指令(自动化生成);标注员多轮人工审查,过滤低质量或语义模糊的指令、纠正逻辑错误并手工撰写高难度复杂指令(人工过滤与增强);最后由专业技术评审多轮检验逻辑一致性、可执行性与多样性(专家验证)。第四阶段『隐私保护与人脸匿名化』:对含人脸图像用先进换脸技术替换为不可识别的合成身份,同时严格保持表情、姿态与光照一致,所有匿名化图像经二次人工核验后方可入库。
技术新颖性
技术新颖性体现在四点。其一,多图编辑评测的系统化:GEdit、ImgEdit、REDEdit 的多图任务数均为 0,CPI-General 单独划出 10 类多图任务,实测暴露出开源模型在此维度普遍跌至 3 分区间、与闭源 4 分以上的断崖式差距,证明这是被长期忽视的核心能力。其二,面向部署的实用子集:51 个三级任务全部源自真实用户高频需求,使评测结论能直接回答『哪个模型能上生产线』这一工程问题。其三,任务粒度的评分工程:VLM judge prompt 按任务逐一定制并配维度适配,替代一刀切的通用相似度指标,显著提升与人类感知的一致性。其四,『基准的基准』式元验证:用 Spearman $\rho$ 最高、MAE 最低的 Arena 对齐结果把基准可信度本身变成可量化命题,这一验证方法学对其他生成任务的基准设计同样具有借鉴价值。
实验结果
评测 10 个主流模型有三组关键发现。其一,CPI-Bench 区分度远超旧基准:分数方差从 GEdit 的 0.0634、ImgEdit 的 0.0393、REDEdit 的 0.0585 提升到 CPI-General 的 0.1428、CPI-Practical 的 0.1265、CPI-Intelligent 的 0.7282,CPI-Overall 达 0.2876。GPT-Image-2 以 4.70 居首,Seedream5 Pro 4.68、Nano Banana Pro 4.58 次之;开源最佳 FireRed 仅 3.43,JoyAI 仅 2.96。其二,多图与推理是开源模型断崖:单图任务各模型普遍 4 分左右(GPT-Image-2 单图 4.74),多图任务闭源全部超 4.0(GPT-Image-2 4.51)而开源约 3.0(QwenEdit-2511 3.13,Ref-Viewpoint 仅 1.96);翻译任务开源崩溃(1.03–1.23);推理子集闭源前三 4.68–4.77,开源仅 2.07–2.65。其三,与 Arena 榜对齐最高:除 FLUX.2-klein-9B 偏差一位外排名全部一致,Spearman 相关系数 $\rho$ 最高、MAE 最低,证实其可作为公开人类偏好的有效代理。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 模型排名与 Arena Image Edit Leaderboard 的对齐 | Spearman 相关系数 / 平均绝对误差(MAE) | CPI-Bench 在全部被评基准中相关系数最高、MAE 最低;除 FLUX.2-klein-9B 偏差 1 位外,所有模型排名与 Arena 完全一致 | GEdit-Bench / ImgEdit-Bench / REDEdit-Bench 的排名趋势与 Arena 明显分歧 | 排名对齐度显著优于所有现有基准,成为人类偏好的有效代理 |
| CPI-Overall 三子集综合评测(10 个模型) | VLM 1–5 分评分 | GPT-Image-2 4.70 最佳,Seedream5 Pro 4.68、Nano Banana Pro 4.58 次之;开源最佳 FireRed-Image-Edit 3.43 | 旧基准上闭源与开源分差很小,难以区分(如 ImgEdit 上 4.02–4.74) | 分数方差从 ImgEdit 的 0.0393 提升至 0.2876,区分度提高约 7 倍 |
| CPI-Intelligent-Bench 推理编辑(8 领域 67 子学科) | VLM 1–5 分评分 | GPT-Image-2 4.77、Seedream5 Pro 4.70、Nano Banana Pro 4.68;开源模型仅 2.07–2.65 | 闭源中的 Seedream4.5 与 Qwen Image 2.0 Pro 也仅 3.79,说明推理维度连次级闭源模型都吃力 | 子集方差 0.7282,是所有基准中区分度最高的单一维度 |
| CPI-General-Bench 多图编辑(10 类任务) | VLM 1–5 分评分 | 闭源全部超 4.0(GPT-Image-2 4.51、Seedream5 Pro 4.50);开源约 3.0(QwenEdit-2511 3.13,Ref-Viewpoint 仅 1.96) | GEdit/ImgEdit/REDEdit 均不含任何多图任务,无法评测 | 首次量化了开源与闭源模型在多图一致性与跨图推理上的真实差距 |
局限与改进
作者承认并可见的局限包括:其一,评测完全依赖 VLM judge,评分上限受裁判模型自身能力与偏好制约,论文未报告裁判模型与人类评分的逐样本一致率或置信区间,也未消融不同裁判 VLM 的影响;其二,闭源模型只能通过官方 API 黑盒评测,参数量未公开,无法控制采样设置与推理成本,分数会随 API 版本漂移;其三,与 Arena 的对齐分析停留在聚合排名层面,Arena 本身存在用户群体与提示词分布偏倚,逐任务层面的一致性未验证;其四,基准一旦公开即面临被针对性训练的污染风险,静态样本集难以长期保持区分度;其五,CPI-Intelligent-Bench 直接复用作者前期工作 ExpertVerse 并仅做筛选优化,其独立构造证据相对薄弱;其六,三子集合计 3778 条,其中实用子集 558 条分摊到 51 个任务后每类仅约 11 条,子任务粒度的指标噪声偏大。
独立分析的弱点
独立分析可见若干弱点。第一,VLM judge 的循环偏倚风险:若裁判 VLM 与某些被评编辑模型同属一个生态(如 Qwen 系或 Gemini 系),可能出现自家族偏好,论文未做换用不同裁判模型的消融实验。第二,单图任务仍趋饱和:CPI-General 单图整体上方差不大(多数模型在 4.0 左右,闭源 4.49–4.74),说明基础任务维度对头部模型已失去分辨力,应继续提高单图任务难度或转向动态出题。第三,评分合成为 1–5 总分的具体方式(各维度简单平均还是加权)缺乏说明,影响严格复现。第四,实用子集的『真实』性依赖标注员与专家的主观筛选,缺少真实用户点击、采纳等行为数据佐证 51 个任务的分布代表性。第五,开源模型在 CPI-Intelligent 上的低分可能部分源于缺少 prompt 工程而非能力缺陷,作者自己也承认推理能力常靠提示词激发,但未给出『为开源模型配推理增强提示』后的对照实验来剥离这一混淆因素。
未来方向
作者提出与可延伸的方向:其一,把基准动态化或建设在线持续评测平台,定期更换样本以防训练污染,维持区分度的长期有效性;其二,把评分维度扩展到多步编辑链、编辑可逆性乃至视频编辑等更复杂形态;其三,发布逐任务类别的细粒度排行榜,帮助研究者精确定位模型缺陷。基于本文成果的延伸:用 CPI-Bench 的任务分类体系反哺训练数据构造,将 VLM judge 分数作为强化学习的奖励信号做偏好优化;针对开源模型系统研究『推理激发』(先让 LLM 改写/分解指令再编辑)能挽回多少 CPI-Intelligent 分差,从而把能力缺陷与提示工程缺失解耦;研究 judge 模型能力与编辑模型能力之间的匹配规律,给出评测可信度的量化界;并把『与 Arena 排名对齐』这一元验证方法推广到文本生成、视频生成等其他领域的基准认证。
复现评估
复现可行性较高。论文给出了 CPI-Bench 的 HuggingFace、ModelScope 与 GitHub 链接,承诺公开数据集;基准总规模 3778 条(2039+558+1181),评测成本主要是推理调用:5 个闭源模型(GPT-Image-2、Nano Banana Pro、Seedream5 Pro、Seedream4.5、Qwen Image 2.0 Pro)需付费 API,5 个开源模型参数量在 4B–20B 之间,单张高端卡或少量多卡即可完成推理。主要不确定性在于:VLM 裁判的具体型号与任务级评分 prompt 是否随数据完整开源、闭源 API 版本随时间演进导致绝对分数漂移、以及 ExpertVerse 子集的筛选规则细节是否充分披露。总体而言,复现开源模型排名与多图/翻译短板等定性结论容易,精确复现闭源模型的绝对分数较难,整体属于中等难度的复现工作。
论文图表
用同一台便携榨汁机的三个编辑任务展示难度递进:CPI-General 的改颜色(基础编辑)、CPI-Practical 的户外野餐主题电商海报(真实应用)、CPI-Intelligent 的带中文文案的制造流程示意图生成(高难度推理),难度由通用到实用再到智能逐级上升。
用一个连续案例解释了三个子集的分层逻辑和难度梯度,是理解基准设计哲学的最直观入口。
三个实用场景的模型对比:红底证件照优化、沉浸式睡眠家居海报生成(含营销文案)、及肩内卷发型拉直,展示 GPT-Image-2、Nano Banana Pro、FireRed-Image-Edit、QwenEdit-2511 的输出差异。
让读者直观感受真实商业场景(证件照、电商海报、发型编辑)中各模型的可用性差距,是『部署价值』主张的视觉证据。
实用子集 13 类任务得分:闭源 4.33–4.73(Seedream5 Pro 4.73 最高),开源 3.52–3.89;翻译任务开源全线崩溃(QwenEdit 1.23、FLUX.2-klein-9B 1.13、JoyAI 1.03)而闭源 2.87–4.63;广告创作开源也仅 2.10–2.97。
量化了开源模型在真实商业部署场景(尤其中文文案与广告)上的短板,直接支撑『部署价值评估』的论文定位。