ContextBias:文生图模型中上下文偏移下偏见持续性的受控评估 ContextBias: Controlled Evaluation of Bias Persistence Under Context Shift in Text-to-Image Models
固定职业角色、系统变动场景上下文,量化文生图模型刻板印象的持续性
前置知识
文本生成图像扩散模型(T2I)
以扩散过程为核心的生成模型:先对图像逐步加噪,再训练网络学习反向去噪;生成时从随机噪声出发,通过文本编码器(如 T5/CLiP)经交叉注意力把文字提示注入去噪过程,逐步还原出与提示语义一致的图像。本文评测 FLUX.1、SDXL、SD 3.5、Qwen-Image 四个此类模型。
本文研究的对象就是这类模型从训练数据中学到的『概念-视觉属性』关联,理解其文本条件化机制才能明白偏见为何在生成中复现。
刻板印象偏见(角色-属性关联)
T2I 模型会复现训练数据中的共现统计,例如把医生与白大褂、机械师与男性、法官与法袍绑定,导致生成的图像在人口学特征、服饰、工具上呈现系统性的刻板模式。这类关联既可能反映真实职业外观规律,也可能是被放大的社会偏见。
本文要回答的核心问题是:这些关联在提示加入场景上下文后是 persists(持续)还是被重塑,这决定了偏见评测该怎么做。
组合泛化(Compositional Generalization)
模型把已学的概念按新方式重新组合的能力:见过『医生』和『公园』各自的表达后,能否正确生成『在公园锻炼的医生』而不是退回『医生』的默认原型。若模型组合式地表征概念,上下文改变时应相应调整人物属性;若只是贴原型,则属性不变。
论文把偏见持续性问题重新表述为组合泛化问题:上下文变了而角色属性不变,正说明角色不是按上下文条件化组合的。
归一化香农熵与偏置强度 BI
香农熵 $H(p)=-\sum_y p(y)\log p(y)$ 度量分布的分散程度。把它除以均匀分布的最大熵 $\log|\mathcal{Y}_a|$(标签数取对数)得到归一化熵,取 1 减去它即 BI:$BI=1-H(p)/\log|\mathcal{Y}_a|$,取值 0 表示完全均匀、1 表示集中在单一标签。
BI 是本文的核心指标之一,读不懂归一化熵就无法理解『无关上下文反而让属性分布更集中』这一关键发现。
卡方同质性检验(χ² homogeneity test)
检验多个分组(这里是 CF/CA-R/CA-U 三种条件)下某分类标签的频数分布是否来自同一总体的统计检验。$p<0.05$ 说明分布跨条件发生了偏移,但偏移不等于主导标签消失,因此论文要求 $p>0.05$ 且极差 $\Delta\le 5$ 个百分点才判定标签『上下文不变』。
论文反复强调 CCS 必须与 χ² 检验联合解读,否则会把『分布整体移动但主导标签仍在』误读为偏见消失。
评分者间一致性(Cohen's κ 与 Fleiss' κ)
Cohen's κ 度量两名评分者在扣除随机一致后的一致程度;Fleiss' κ 是其向三名及以上评分者的推广。κ 接近 1 表示一致性极高,本文的人类标注研究得到两两 Cohen's κ=0.912、Fleiss' κ=0.89。
论文用人类标注验证自动抽取管道(人机 κ=0.822),理解 κ 才能判断『发现是真实视觉模式而非评估器幻觉』这一主张的可信度。
研究动机
现有对 T2I 模型刻板印象的评测几乎都在『孤立提示』下进行——例如只给『一张医生的照片』,这类研究(D'Incà et al. 2024、Bianchi et al. 2023、Seshadri et al. 2024、Friedrich et al. 2025 等)已稳定记录了医生-白大褂、机械师-男性、法官-法袍等角色-属性绑定,以及跨扩散架构持续存在的性别与角色差异。但真实使用中的提示很少让人物孤立出现,而是把它放进环境与活动里,比如『医生在给病人检查』『在公园锻炼』——上下文可能强化已学关联、削弱它们、或引入竞争性视觉信号。由于已有研究普遍没有在保持角色身份固定的同时系统地变动场景与活动上下文,一个根本问题悬而未决:上下文究竟是重塑了模型学到的视觉关联,还是只在角色周围换了布景?哪些属性会随场景适应、哪些始终不变,完全没有受控的量化证据。
本文的目标是本文要建立一个能把『上下文效应』从其他混杂因素中剥离出来的受控评测体系。具体目标有三:其一,提出 ContextBias 框架,固定角色身份、只系统地变动地点与活动上下文,在无上下文(CF)、上下文相关(CA-R)、上下文无关(CA-U)三种条件下对比同一角色的视觉属性分布;其二,发布 ContextBench 基准,覆盖来自美国劳工统计局 SOC 职业分类的 92 个角色和 1,656 个语义受控提示(每角色 18 个配置),并配套 GPT-5-mini 驱动、覆盖 30 个属性维度和 Scene/Camera/Objects/People 四个群组的结构化抽取管道;其三,在 FLUX.1、SDXL、SD 3.5、Qwen-Image 四个架构各异的模型上生成 66,240 张图像(每模型 16,560 张),用偏置强度 BI 和上下文一致性 CCS 两个新指标量化持续性,并检验结论对提示改写的鲁棒性。
与已有工作不同的是,已有的偏见评测要么把偏见当作全局属性来测量——如 DALL-Eval 探测推理能力与社会偏见、D'Incà et al. 的开放集 VQA 管道无需预定义类别即可检偏——要么属于一般场景下的组合性研究(属性绑定失败、组合扩散),两者都没有在『角色固定、上下文系统变化』的受控设置中隔离上下文的因果作用;而且现有指标只报告分布层面的偏斜,无法回答『具体是哪一个标签跨条件持续存在』。本文的独特切入是三层组合:用 LLM 构建语义匹配/不匹配的地点-活动上下文库实现受控变动;用分布集中度(BI)与标签级持续性(CCS)双指标把『分布更集中』和『同一标签反复出现』区分开;再用逐标签 χ² 同质性检验与留一法提示变体测试,把持续性从特定提示措辞的伪影中解救出来。
核心方法
直觉很朴素:如果想检验文生图模型是不是真的『组合式』地表征职业,就应该把角色钉死、只转动场景,看哪些视觉属性跟着场景走、哪些纹丝不动。技术路线分四步。第一步构建基准:为 92 个角色用 GPT-4o-mini 生成并人工筛选语义相关和语义无关两套地点库与活动库,在 CF(『a photo of a r』)、CA-R(角色+相容的地点/活动)、CA-U(角色+不相容的地点/活动)三种条件下生成提示,每个基础提示再扩展两个语义等价改写及上下文替换,共 1,656 个提示。第二步生成图像:四个模型、每个提示固定推理参数、变动 10 个随机种子,得到每模型 16,560 张、总计 66,240 张图像。第三步抽取属性:GPT-5-mini 按 30 维属性模式(四个群组:Scene、Camera、Objects、People)输出封闭词表标签或带证据的开放描述,开放标签经句向量余弦聚类和 LLM 规范化合并同义表达。第四步统计量化:计算 BI 与 CCS,并用 χ² 同质性检验判定每个角色-标签对是否上下文不变。
核心创新是『固定角色、受控变动上下文』的实验设计与双重度量的结合。偏置强度 BI 作用在属性维度层面,用归一化熵度量分布集中度:$BI=1-H(p^{(a)}_{r,c})/\log|\mathcal{Y}_a|$,其中 $p^{(a)}_{r,c}$ 是角色 $r$ 在条件 $c$ 下属性 $a$ 的标签分布,取值 0(均匀)到 1(单一主导标签),并区分跨角色池化的 $BI_{pool}$ 与按角色平均的 $BI_{role}$。上下文一致性 CCS 作用在标签层面,回答『同一个标签是否跨条件持续』:先算池化流行度 $\mathrm{Prev}(r,y)=\sum_c x^{(y)}_c/\sum_c n_c$ 与百分点极差 $\Delta=\max_c p^{(a)}_{r,c}(y)-\min_c p^{(a)}_{r,c}(y)$,再定义 $\mathrm{CCS}=\mathrm{Prev}/(1+\Delta)$。与已有方法的本质区别在于:旧评测在孤立提示下测全局偏斜,既不控制上下文,也分不清『分布整体移动』与『主导标签消失』;本文要求 $p>0.05$ 且 $\Delta\le 5$ 个百分点才判定上下文不变,把 CCS 与 χ² 检验绑定解读,第一次让『哪些属性免疫上下文』成为可测量的对象。
方法步骤详情
第一步,基准构建:从美国劳工统计局 SOC 分类人工筛选并规范化 92 个角色;GPT-4o-mini 为每个角色生成相关/无关地点库 $L_{r,rel},L_{r,unrel}$ 与活动库 $T_{r,rel},T_{r,unrel}$,人工剔除罕见、不合理及依赖特定文化习俗的条目(避免引入混淆性文化先验)。提示模板:CF 为『a photo of a r』;CA-R/CA-U 为『a photo of a r doing t in a ℓ』,分别取相容/不相容的 $t$ 与 $\ell$;每个基础提示扩展两个语义等价改写,CA 条件额外加入位置与活动替换变体,最终 1,656 个提示(每角色 18 个配置)。第二步,图像生成:四个模型在除随机种子外完全相同的推理参数下,每个提示生成 10 张图,合计每模型 16,560 张、共 66,240 张。第三步,属性抽取:GPT-5-mini 按 30 维模式对每张图输出封闭词表标签或证据充分的开放描述(证据不足记 unknown);开放词表(物品、服装、活动)先用预训练句子编码器嵌入、按余弦相似度聚类成规范标签,再由只看文本、从不接触图像的 GPT-4o-mini 做结构化规范化,聚合出 $p^{(a)}_{r,c}(y)$。第四步,统计量化:池化与角色级 BI、每个标签的 Prev/Δ/CCS(跨四个生成器等权平均)、逐标签 χ² 同质性检验。第五步,双重验证:用 220 个显式属性提示(如『a photo of a male bartender』)×10 种子=每模型 2,200 张验证抽取准确率;再让 3 名标注者对 10 角色×3 条件×4 模型×10 图共 1,200 张图回答 23 个模式对齐问题,做人机一致性对照。
技术新颖性
技术新颖性体现在四个层面。其一,实验设计上首次把『上下文』作为受控自变量引入 T2I 偏见评测:CA-U 是最强条件,凡在此仍占主导的属性反映的是上下文免疫的先验而非场景合理性,这直接把偏见评测和组合泛化研究连接起来。其二,度量上提出双指标体系:BI 在维度层面刻画集中度、CCS 在标签层面刻画持续性,二者互补——BI 只能说分布更尖了,CCS 才能指出是哪个标签在撑起这个尖峰;配合逐标签 χ² 同质性检验(p 值与 Δ≤5pp 双门槛),避免了『分布偏移即偏见消失』的误读。其三,鲁棒性设计:通过语义改写和上下文替换变体加留一法 χ² 检验,证明持续性不是特定提示措辞的伪影。其四,验证闭环:抽取管道用显式属性的 ground-truth 提示校准(平均准确率 90.2%、F1 94.8),再用大规模人类标注(两两 Cohen's κ=0.912、人机 κ=0.822)证明自动化结果与人类判断高度一致,排除了『评估器自己幻觉』的替代解释。相比之下,此前的偏见测量框架只输出全局偏斜分数,无法定位具体属性,也不控制上下文。
实验结果
核心发现可以概括为三条。发现一:无关上下文不仅不抑制角色属性,反而让跨角色分布更集中——池化平均 BI 从 CF 的 0.452 升到 CA-U 的 0.499(+0.047;角色级聚类自助法 +0.045,95% CI [0.030, 0.050]),但按角色计算再平均的 BI 反而略降(0.724→0.694,−0.031),说明集中度上升是『不同角色被拉向共同默认值』的跨角色效应而非单个角色原型变尖。分群组看,Scene 最敏感(Δctx=+0.093,0.430→0.524),Objects 次之(+0.058,0.251→0.309),People 较稳定(+0.042,0.457→0.499),Camera 净变化近零(−0.003)但内部方向相反:framing 集中度大增(+0.120)、depth_of_field 变散(−0.154)、perspective 基本不变(+0.011)。维度级 BI 跨度 0.030–0.978:age_range(0.978)与 perspective(0.972)接近上限,facial_hair_present(0.030)和 eyewear_present(0.112)很分散。发现二:96,310 个被检出标签中,人口学线索最顽固——Dancer 被生成为女性的比例在四个模型上均为 98–100%(CCS=79.9,Δ=1.0pp),Carpenter/male CCS=78.2、Politician/male 62.3、Railway conductor 61.4、Detective 59.7、Flight attendant/female 42.6(Δ=2.9pp)、Nurse/female 32.0(99%,Δ=2.5pp)、Mechanic/male 40.0(94–100%,Δ=3.8pp);工具关联同样持续:Welder-手套 29–32%(CCS=10.7)、Baker-围裙 31–33%(CCS=12.6)、Baker 暖色调 95–100%(CCS=41.3,Δ=3.9pp);Doctor-白大褂只有 31–50%(CCS=9.0,仅 2/4 模型不变),Cashier-屏幕最弱(CCS=1.3),说明持续性依赖对象显著性。发现三:持续性对提示改写稳健——留一法 χ² 检验下四个模型平均 93.3% 的角色-标签元组跨所有提示变体不变(平均 p=0.72),Objects 95.0%、People 92.1%、Camera 仅 64.9%。支撑这些结论的管道本身经过验证:显式属性提示上抽取准确率 SD 3.5 90.3%、SDXL 92.1%、FLUX.1 86.4%、Qwen-Image 92.0%(平均 90.2%,F1 94.8);人类标注两两 Cohen's κ=0.912、Fleiss' κ=0.89 [0.87, 0.91],自动管道与人类共识原始一致率 0.826、κ=0.822。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 属性抽取管道验证(显式属性 ground-truth 提示,每模型 2,200 张) | 准确率 / 召回率 / F1 | 平均 90.2% / 90.2% / 94.8(SDXL 最高 92.1%/92.1%/95.9,FLUX.1 最低 86.4%/86.4%/92.7) | 无外部基线,以四个模型交叉验证 + 人类标注(κ=0.822)作为可靠性参照 | 证明下游 BI/CCS 统计建立在可靠的自动标注之上,抽取误差不足以解释观察到的持续性模式 |
| 上下文条件下的属性集中度(CF → CA-U) | 池化 Bias Intensity(归一化熵) | 0.452 → 0.499(+0.047;聚类自助 95% CI [0.030, 0.050]) | 组合式表征假设的预期方向为下降(上下文应抑制角色属性) | 方向与组合式假设相反:无关上下文使跨角色分布更集中,揭示一种上下文无关评测看不见的刻板印象持续性 |
| 提示改写鲁棒性(语义改写 + 位置/活动替换,留一法 χ²) | 角色-标签元组不变率(p>0.05)与平均 p 值 | 四模型平均 93.3% 不变(p̄=0.72):Objects 95.0%(流行度极差 0.3pp)、People 92.1%(1.8pp)、Camera 64.9%(23.5pp) | 若持续性是提示措辞伪影,不变率应随改写大幅下降 | People/Objects 属性对措辞高度稳健,Camera 最敏感,与图 3/4 的上下文敏感性排序互相印证 |
| 标签级上下文不变性(96,310 个标签,CCS 跨 4 生成器平均) | Context Consistency Score(Prev/(1+Δ),需 p>0.05 且 Δ≤5pp) | 最高 Dancer/female CCS=79.9(流行度 98–100%,Δ=1.0pp)、Carpenter/male 78.2;最低示例 Cashier/screen 仅 1.3 | 表达与配饰类维度 CCS 普遍偏低(如 Doctor/coat 9.0、Surgeon/scrubs 2.0) | 给出刻板关联强度的可排序量化:人口学 > 服饰/工具 > 表达/配饰,且区分了持久与情境敏感的属性 |
局限与改进
作者明确承认的局限有三:一是只变动了地点与活动两类上下文,光照、文化设定、人际互动等维度未涵盖;二是 92 个角色取自美国劳工统计局 SOC,基准是英语、以西方/美国为中心的,结论不能当作文化普适的刻板印象清单;三是 BI 度量的是分布集中度而非社会危害性——高集中可能只是真实的职业视觉规律,把任何具体关联解读为刻板印象需要本文测量之外的规范判断。此外抽取依赖 GPT-5-mini,会继承其职业先验(作者以人机 κ=0.822 的人注研究缓解此忧),证据不足的图像记 unknown 并被排除在频次分析外。我自己的观察补充四点:其一,评估链条存在闭源模型耦合——GPT-4o-mini 建上下文库、GPT-5-mini 抽属性,若它们的职业先验与被测生成模型同源,可能系统性低估或高估某些关联;其二,性别等敏感属性采用封闭二分词表,无法表达非二元身份,作者也承认这是仅为研究目的的简化;其三,池化 BI 上升而角色级 BI 下降的双重叙事虽然作者给出了解释,但单看任何一个聚合都会得出误导性结论,读者需要同时盯着两个口径;其四,人类标注验证规模有限(10 角色×1,200 张图),对长尾角色的覆盖未验证。
独立分析的弱点
第一,评估器循环性风险:GPT-5-mini 既是从 66,240 张图抽取属性的唯一评估器,又是与人类对比的对象;若它对某些角色(如护士应为女性)有和生成模型一样的先验,可能把生成偏见与评估偏见混在一起。改进方向:引入多个异构开源 VLM 做集成抽取并报告评估器间分歧,或对高风险维度做专门的人工全量复核。第二,人口学属性的封闭二分词表(性别只有 male/female)会系统性抹除非二元表达,且把『模型总画某性别』这类重要发现限制在二元框架内。改进方向:允许开放人口学描述并做词表敏感性分析。第三,『无关上下文』由 GPT-4o-mini 生成后人工过滤,无关性和文化中立性都没有形式化保证,CA-U 条件的强度在角色间可能不一致。改进方向:为无关性定义可操作的语义距离度量并按距离分层报告。第四,每提示仅 10 个种子、每角色 18 个配置,虽然总量 66,240 张很大,但角色层面的统计功效不均,低流行度标签(如 Doctor-白大褂 31–50%)的置信区间较宽。改进方向:对关键角色-标签对自适应加密采样并报告每对的置信区间。第五,论文止步于诊断,没有测试任何缓解手段在 ContextBias 上是否有效。改进方向:把基准当作去偏方法的回归测试集。
未来方向
作者提出的方向:把上下文维度扩展到光照、文化设定与人际互动;将角色分类扩展到 SOC 之外的更广职业、其他语言与非西方语境,检验刻板模式的文化相对性。基于本文成果可以自然延伸的方向:一是机制解释——用 cross-attention 图或表示层探针分析为什么人口学线索比服饰工具更免疫上下文,把『现象学』推进到『机制学』;二是把 ContextBias 用作去偏干预的标准评测床,系统比较提示工程、微调、表示编辑、生成后重排等缓解策略在受控上下文压力下的效果;三是把『无关上下文导致跨角色趋同(池化 BI +0.047)』这一现象单独拎出来研究——它暗示模型在冲突条件下退回全局默认原型,这与组合泛化文献中的原型回退假说可以直接对话;四是扩展到视频生成与图像编辑模型,检验时空上下文下的持续性;五是改进度量本身,例如为 CCS 设计考虑标签共现结构的推广版本,并给每个角色-标签对提供置信区间。
复现评估
复现条件总体良好但成本不低。开源情况:代码与数据集随论文发布(GitHub: github.com/Sina-Emami/ContextBias,HuggingFace: huggingface.co/datasets/shaghayegh/ContextBias),ContextBench 采用 CC BY-SA 4.0、代码 MIT 许可,1,656 个提示、上下文库和 66,240 张生成图像语料均可直接获取,四个被测模型(FLUX.1、SDXL、SD 3.5、Qwen-Image)都是公开权重。算力与费用:需要为四个模型各推理约 16,560 张图(每提示 10 种子)做完整复现,再加抽取管道验证的 2,200 张/模型,以及 GPT-5-mini 逐图属性抽取和 GPT-4o-mini 标签规范化的大批量 API 调用,GPU 与 API 开销是主要门槛。难度评估:中等偏上——论文提供了关键实现细节(推理参数除种子外固定、附录含上下文库构建、统计方法、人机一致性协议、逐维度抽取结果),χ²/自助法等统计流程描述完整;但 GPT-5-mini/GPT-4o-mini 为闭源 API,版本演进可能造成抽取结果的不可精确复现,这是复现工作里最需要警惕的一环。
论文图表
示意图展示论文的核心实验逻辑:固定同一职业角色,把放置它的场景上下文从无上下文、相关上下文到无关上下文逐级变化,观察角色关联的视觉属性(人口学特征、服饰、工具)是随场景适应还是保持不变。
这是全文问题陈述的可视化:读者第一眼就能理解『控制变量』的设计思想——角色是自变量中的常量,场景是唯一被操纵的变量,这正是与以往孤立提示评测的根本区别。