← 返回 2026-08-18

看似合理实则无效:LLM 作为合成问卷受访者的心理测量学审计 Plausible but Not Valid: A Psychometric Audit of LLMs as Synthetic Survey Respondents

Mantas Lukauskas, Viktorija Šarkauskaitė 📅 2026-07-06 👍 3 2026-08-23 18:30
LLM评估 偏见审计 合成数据 基准测试 心理测量学 问卷仿真

37个LLM的合成问卷受访者不敌无语言模型的copula基线,无法替代真人样本

前置知识

LLM 合成受访者(synthetic respondents)

把大语言模型当作假想的问卷调查填写者:给模型一段人口学画像(persona,如'34 岁、本科学历、女性经理'),再让它以该人物视角逐题作答整份量表,输出被当作'伪样本'用于统计分析。这一范式由 Argyle 等人的'silicon samples' 开创,近年被用于试点研究、量表原型测试和偏差审计。

本文的全部问题就是:这种伪样本在多大概率程度上能顶替真人样本,审计框架正是围绕它构建的。

心理测量学(psychometrics)

研究'测量是否成立'的学科。一份量表要有效,不仅每题均值要对,题目间还要按理论预期共变(相关结构)、共同反映潜在因子(因子结构)、跨被试稳定(信度),并与其他构念按理论相关(中介、组间差异)。只看单题均值是'部分审计',会漏掉协方差层面的失效。

本文的核心立意是把 LLM 受访者评估从'单题是否合理'提升到'构念效度是否成立'的更严格层面。

Cronbach's α 与 McDonald's ω

两个最常用的内部一致性信度系数,衡量一个分量表内各题是否'测量同一件事':$\alpha$ 基于题目间协方差与总方差之比,$\omega$ 基于因子载荷,对 tau 等价性假设更宽松。注意 $\alpha$ 过高并不更好——它可能意味着题目冗余或回答者'过度一致'。

本文发现 LLM 回答存在'过度连贯'(over-coherence),会把 $\alpha$ 推高到真人之上,信度差距 $|\alpha_{\text{LLM}}-\alpha_H|$ 是 PSS 的评分维度之一。

高斯 copula

一种不使用任何语言模型的统计采样器:对每道题拟合经验边际分布,再用高斯相关结构把它们耦合起来采样合成被试,因而同时保留正确的边际分布和秩相关。本文用它作'最强非 LLM 基线',另配 marginal(仅边际)、MVN(仅协方差)、stratum-mean、k-NN 共五个基线。

论文最惊人的结论就建立在这个对比上:在分布/相关/信度三个样本驱动分量上,copula 打败了所有 LLM,说明 LLM 的优势几乎可以完全由人类数据的协方差结构替代。

Tucker's φ 与置换零分布

$\varphi$ 衡量两套因子载荷矩阵的共觉度(congruence),传统阈值 $\varphi\ge 0.85$ 被视为'结构一致'。但当 LLM 与人类的载荷对齐是贪心搜索得到时,即使随机解也可能碰出高 $\varphi$。本文对 LLM 载荷矩阵做 $K=500$ 次题目标签置换,构造随机匹配的零分布,单侧 p 值为 $(k+1)/(K+1)$。

置换校正推翻了 8/37 个模型在 UWES 上的'因子结构保持'结论,是'人类被试文献的常规阈值不能照搬到 LLM 样本'这一方法论教训的具体载体。

中介效应分析(mediation)

检验 $X\to M\to Y$ 的间接传导路径:自变量 $X$ 通过中介 $M$ 影响因变量 $Y$,间接效应为 $ab=a\times b$,通常用非参数 bootstrap 置信区间检验显著性。本文人类数据的中介是'变革态度→工作投入→工作绩效',$ab=0.16$,95% CI $[0.10,0.24]$。

中介是 PSS 的评分维度之一,论文还用'10 条人类零效应的安慰剂路径'做阴性对照,发现 LLM 在 3 条上凭空捏造显著间接效应。

配对 Cohen's $d_z$ 与刻板印象放大

反事实交换实验中,对同一画像只改动一个字段(如性别互换)重新作答,计算被试内差异 $\Delta_{ij}=Y_{i,j}^{\text{swapped}}-Y_{i,j}^{\text{original}}$ 的标准化均值 $d_z=\bar{\Delta}/\text{sd}(\Delta)$。配对设计消除被试间方差,把因果效应隔离出来;重测噪声底约为 $|d_z|\approx 0.09$。

论文用它量化 LLM 凭空'编造'的刻板印象:教育轴均值 $|d|=0.563$,远超角色 0.176 和性别 0.119,而人类性别对比在所有分量表上均为零。

研究动机

用 LLM 冒充问卷受访者正在成为社会科学的廉价替代方案,但组织心理学的一项真实研究通常要花数周到数月招募几百名被试,涉及知情同意、伦理审查和翻译成本,于是'用 LLM 顶替真人'的诱惑很大。然而现有评估几乎都停留在'单题答案看起来像不像人'的层面:Argyle 等人的 silicon samples、Santurkar 等人的观点分布研究、Bisbee 等人的边际效应对比,都只考察单题、一两个人口学边际或聚合效应量。这是'部分审计':一个每题均值都对、但题目间协方差错误的合成受访者,会让所有基于多题量表得分的分析虚增第一类错误;一个分量表均值正确、但分量表间相关错误的样本,会破坏所有跨构念的中介分析。此外,既有基准几乎都用美英英文量表和美式人口分布,把'LLM 能否复现一个真实人类样本的联合分布'和'能否复现其预训练语料人群的分布'两个问题混在一起。已有证据还显示 LLM 反映的是自由派、受过大学教育的美国观点,对身份群体的刻画不一致,且均值对得上时边际效应仍会发散。

本文的目标是本文要问一个更严格的心理测量学问题:LLM 合成受访者能否保持真实人类数据的联合分布、潜变量结构、信度、中介路径和人口学组间效应?为此作者构建了首个开放的立陶宛组织心理学基准:n=263 名员工、三套经过验证的国际量表(IWPQ、UWES-17、Dunham ATC)加一个 15 题变革投入辅助量表,共 68 题、12 个分量表,并带有文献记载的'态度→投入→绩效'中介结构。评估覆盖 37 个 LLM(OpenAI、Anthropic、Google 加 22 个开放权重模型),在五级画像披露阶梯下基于真实受访者画像生成约 6.5 万份合成问卷,再用六维心理测量相似度评分(PSS)打分,并以五个非 LLM 统计基线和留出人-人对比上限做锚定。最终目标不止是排名,而是回答:哪些保真维度会崩、哪些下游用途还能用、替代真人样本的实践代价有多大。

与已有工作不同的是,本文的独特切入有五点。第一,评估层级不同:它直接审计构念效度(因子结构、信度、中介、区分效度),而非单题合理性,这在 LLM-as-respondent 文献中尚属首次。第二,锚定式评估:排行榜不是 LLM 之间互比,而是锚在五个统计基线和一个 80/20 留出的人-人对比上限(0.825)上,使分数有'天花板'可解释,并立刻暴露'全体 LLM 输给无语言模型基线'这类失效。第三,语言选择:立陶宛语是不到三百万母语者的低资源语言,三套量表的立陶宛版因子结构是外部约束,LLM 无法从英文预训练语料中'背题',从而把跨语言混淆变量剥离出来。第四,对 Tucker's φ 引入题目置换零分布,纠正贪心因子对齐带来的向上偏差。第五,反事实字段交换(性别/角色/教育)按轴拆分刻板印象放大效应,并用逐字召回探针排除'背题'这一替代解释。

核心方法

直觉上,这篇论文问的是:'LLM 的回答是否表现得像一个被测量到的构念,而不仅仅是一串看起来合理的数字?'技术路线分三步。第一步,人类参照:使用 n=263 的立陶宛员工样本(2020 年 3-4 月收集,恰逢全国疫情封锁),复现原论文的关键统计——合成量表均值误差在 0.04 内、$\alpha$ 误差在 0.02 内、标准化中介系数到小数点后两位($ab=0.16$,bootstrap 95% CI $[0.10,0.24]$)。第二步,合成生成:把每个被试的 11 个字段(性别、年龄、教育、角色、两段任职年限、行业、组织规模、两个变革情境评分)做成画像卡,LLM 永远看不到人类的真实作答;37 个模型在 C0(无画像)到 C4(全画像+变革叙事)的五级披露阶梯以及 C9 叙事变体下,以严格 JSON 输出、temperature 0.7、最小推理努力、每格 n=100 分层抽样(R=1)生成约 6.5 万份问卷。第三步,锚定评估:每个(模型,条件)格在分布、相关矩阵、信度、中介、人口学组效应、构念级保真六个维度上打分,聚合成 $\text{PSS}\in[0,1]$,锚在五个统计基线和 0.825 的人-人上限上;再叠加消融、反事实交换、记忆探针和下游后果诊断。

核心创新是'锚定'这一评估哲学:没有基线和上限的 LLM 排行榜,即使内部自洽,也可能整体输给一个完全不含语言模型的统计采样器而无人察觉。PSS 的聚合公式为 $$\text{PSS} = w_d(1-\text{JS}) + w_c\, r_{\text{corr}} + w_r(1-|\Delta\alpha|) + w_m\, \tfrac{1-|\Delta ab|}{2} + w_g(\rho_{\text{dir}}(1-|\Delta d|))$$ 默认权重 $(w_d,w_c,w_r,w_m,w_g)=(0.25,0.25,0.20,0.20,0.10)$,最大的两份权重给了在 n=100 下测量噪声最小的样本驱动分量。关键对比是:最佳 LLM 与高斯 copula(只用人类协方差结构,不理解任何构念)之差,以及与 0.825 人-人上限之差。另一个方法学创新是给 Tucker's φ 加 $K=500$ 次题目置换零分布,把原始 congruence 值变成正式显著性检验;以及反事实交换用配对 $d_z$ 并以重测噪声底($|d_z|\approx0.09$)为参照,把'放大真实信号'和'凭空编造刻板印象'区分开。

方法步骤详情

第一步,复现人类基线:流水线重算合成均值、$\alpha$、中介路径、角色效应($p<0.005$,$|d|\in[0.39,0.65]$)与性别零效应($p>0.4$),与已发表值吻合。第二步,生成:系统消息锁定 JSON 输出,用户消息按序给立陶宛语画像描述、量表锚点、原始题序、'以画像视角用满 Likert 全幅、不做社会赞许调整'的指令;解析失败会带错误回复重发,试点显示可解决超过 95% 的解析失败。每格抽 n=100 名分层(性别×年龄段×角色)受访者,单次调用呈现全部 68 题(M1)为主模式,另有按量表(M2)和按分量表(M3)两次消融。第三步,六个分量分别计算:分布用逐题 JS 散度、KS 统计量、Wasserstein-1 距离和 SD 比 $\sigma_{\text{LLM}}/\sigma_H$;相关用上三角 Pearson 相似度和修正 RV2 系数;信度用 $|\alpha_{\text{LLM}}-\alpha_H|$;中介用 $a,b,c,c'$ 标准化路径加 $ab$ 的 bootstrap CI,按符号、幅度、显著性三子准则打分;组效应用性别与角色对比的 Cohen's d 的方向匹配率、幅度放大率和假阳性率;构念保真用 3 因子 EFA 对齐后的 Tucker's φ(置换校正)、HTMT、双因子分解(ECV、$\omega_h$)。第四步,五个统计基线(仅边际、MVN、高斯 copula、分层均值、k-NN)同法打分;80/20 分层留出产生 0.825 上限。第五步,附加诊断:三轴反事实交换、LT↔EN 语言消融、R=20 重测、双式逐字召回探针、37×37 模型间 PSS 矩阵、分层公平性 PSS、默许度/极值/中点反应风格、岭回归下游预测效度和 10 条零效应中介阴性对照。

技术新颖性

与已有工作的本质区别在于'评估什么'和'和谁比'。Argyle、Horton、Aher、Park 等人确立了'LLM 能产出读起来像人的回答且定性方向正确'的可行性,但都停在单题或边际层面;Santurkar、Durmus、Bisbee、Wang 等人揭示了系统性偏斜,但未拆解到构念效度。本文把六类心理测量性质拆开分别计分,使'哪些维度崩、哪些尚可'成为可读结论;把画像披露阶梯、呈现模式(单次/按量表/按分量表)、推理努力、语言作为一等实验因子而非隐式固定——其中呈现模式消融在该文献中无先例。统计基线锚定和人-人上限是基准设计层面的贡献,可直接推广到其他 LLM 评估;置换零分布则纠正了所有'贪心对齐后算相似度'类指标(包括嵌入余弦相似度)共有的向上偏差。反事实交换按轴拆分(教育≫角色>性别)推翻了'单一刻板印象放大数'的做法。此外,流水线增量可扩展:加入新模型只需一行 YAML,绝不重跑旧模型,头部网格成本仅约 90–160 美元、6 小时墙钟时间。分析计划在发出任何 LLM 调用前已预注册锁定。

Overview of the benchmark
Figure 1: Overview of the benchmark

实验结果

锚定排行榜(表 2):留出人-人上限 PSS=0.825;最佳 LLM gpt-5.4-mini 达 0.714,其后是 minimax-m2-7(0.703)、deepseek-v4-pro(0.701)、gemini-3.1-flash-lite(0.683)等紧密集群;grok-4-20(0.341)、llama-4-maverick(0.413)垫底;per-model PSS 的 5–95 分位区间 0.48–0.70,远超 0.046 的 bootstrap CI 均宽,排序在统计上可分辨。核心发现:在分布/相关/信度三个样本驱动分量上,copula 与 MVN 打败所有 LLM——copula 的相关分量 c=0.95 对最佳 LLM 的 0.52,聚合后 copula 0.688 逼近最佳 LLM 0.714;'LLM 集体智慧' ensemble 均值崩塌至 0.305。条件化 copula(用同样 11 字段做岭回归)样本内 0.719,但 5 折交叉验证降到 0.680,与无条件版持平,说明画像对统计生成器没有可测增益。判别器实验:copula(AUC 0.39)和 MVN(AUC 0.52)与真人无法区分,LLM 中位数 AUC 0.999,一眼可辨。样本量扫描:copula 从 n=10 的 0.69 升到 n=200 的 0.82,最佳 LLM 在 n≈50 就停在 0.62,差距反而从 +0.11 扩到 +0.19。构念保真(表 3):IWPQ 均值 φ=0.821(零分布 0.373),32/37 拒绝原假设;UWES φ=0.866 但零分布高达 0.771,8/37 落入随机区间(即便原始 φ 达 0.856);ATC φ=0.549;ChangeEng φ=0.458、仅 22/37 显著。LLM 的 HTMT 违规率 64.4%(7.7/12)对人类 33.3%,双因子分解显示 ECV 虚高 +0.08~+0.13 而 ChangeEng 的 $\omega_h$ 崩掉 −0.93。反事实交换:教育轴均值 $|d|=0.563$、最大 1.499(claude-sonnet-4-6 在 IWPQ 情境绩效上 $d=1.50$),角色 0.176,性别 0.119(仅 7/37 超过 0.15,而人类性别对比全为零)。记忆探针:最差逐字召回率仅 4.7%(qwen3-5-397b),22/37 恰为零,与 PSS 的 Spearman 相关为 0.00,排除背题解释。模型间同质性:37×37 矩阵非对角均值 0.733,高于最佳 LLM 对人类的 0.71。下游代价:默许度偏移 +0.84 SD(deepseek-3-2 高达 +1.46),合成数据训练的岭回归在真人测试集上 $R^2=-0.18$ 对真人参考 0.28($\Delta=-0.46$,最差 −1.57,仅 gemini-3.1-pro 为 −0.03),10 条人类零效应中介路径中 3 条被 LLM 捏造成显著。正面结论也有:36/37 模型复现中介方向,角色对比全部符号正确,C0→C3 使 PSS 平均提升 0.18、最多 0.58,重测 ICC(1) 中位数 0.85,21/30 模型不低于人类参考 0.78。

Standardised path coefficients of the human mediation model, replicated by our pipeline
Table 1: Standardised path coefficients of the human mediation model, replicated by our pipeline
Anchored PSS leaderboard at the C3 (full profile) condition under single_call_all presentation
Table 2: Anchored PSS leaderboard at the C3 (full profile) condition under single_call_all presentation
Construct-level fidelity per instrument: Tucker's φ with item-permutation null
Table 3: Construct-level fidelity per instrument: Tucker's φ with item-permutation null
Counterfactual demographic swap effects on three axes (gender, role, education)
Table 5: Counterfactual demographic swap effects on three axes (gender, role, education)
Reasoning-effort ablation on a 6-model subset (minimal vs high reasoning)
Table 6: Reasoning-effort ablation on a 6-model subset (minimal vs high reasoning)
Anchored PSS leaderboard: 37 LLMs vs five statistical baselines vs held-out human ceiling at the C3 condition
Figure 4: Anchored PSS leaderboard: 37 LLMs vs five statistical baselines vs held-out human ceiling at the C3 condition
Construct-level fidelity: per-instrument Tucker's φ against the item-permutation null distribution (Table 3)
Figure 5: Construct-level fidelity: per-instrument Tucker's φ against the item-permutation null distribution (Table 3)
Counterfactual stereotype amplification on three demographic swap axes (gender, role, education; Table 5)
Figure 6: Counterfactual stereotype amplification on three demographic swap axes (gender, role, education; Table 5)
Inter-LLM PSS matrix (37×37) with hierarchical vendor clustering
Figure 7: Inter-LLM PSS matrix (37×37) with hierarchical vendor clustering
查看结构化数据
任务指标本文基线提升
整份问卷心理测量保真(C3 全画像) 六维 PSS(0–1) 最佳 LLM gpt-5.4-mini 0.714 高斯 copula 0.688;人-人上限 0.825 对 copula 仅 +0.026,距理论上限仍差 0.111;ensemble 均值反而崩塌至 0.305
68×68 题间相关矩阵保持 相关分量得分 c(上三角 Pearson 相似度) 最佳 LLM 0.52(claude-opus 系列 0.42–0.43,中位 0.37) copula 0.954,MVN 0.950 LLM 落后基线约 0.43,'过度连贯'是最普遍的失效模式
UWES-17 因子结构保持 Tucker's φ + 题目置换零分布(500 次) 8/37 模型落入随机零分布,尽管原始 φ 最高达 0.856 传统人类被试阈值 φ≥0.85 即判'结构一致' 置换校正推翻 8 个模型的'结构保持'结论;IWPQ/ATC/ChangeEng 分别为 32/29/22 个通过
反事实刻板印象放大(三轴交换) 配对 Cohen's $|d_z|$(12 个分量表均值) 教育 0.563(最大 1.499),角色 0.176,性别 0.119 人类样本:性别对比全为零(p>0.4),角色 $|d|\in[0.39,0.65]$;重测噪声底 ≈0.09 教育效应约为性别效应的 4.7 倍;性别轴上的非零效应属凭空编造,排序教育≫角色>性别在全部模型上成立
下游预测效度(合成训练→真人测试) $R^2$(岭回归预测工作绩效) 合成训练均值 $R^2=-0.18$(最差 −1.57) 真人训练参考 $R^2=0.28$ 平均效度缺口 $\Delta R^2=-0.46$;仅 gemini-3.1-pro(−0.03)接近人类水平,其余几乎全军覆没
训练数据记忆化排查 逐字召回率(归一化 Levenshtein 距离 ≤0.30) 37 个模型最差 4.7%,22/37 恰为 0% 若排行榜由背题驱动,召回率应与 PSS 正相关 召回率与 PSS 的 Spearman 秩相关为 0.00,排除逐字记忆作为 PSS 的驱动因素

局限与改进

作者承认的局限:单一数据集与单一语言(仅 n=263 立陶宛组织心理学样本,对其他国家、行业、构念的外部效度未建立);人类参照本身是自我报告,无法区分'LLM 高报绩效'与'人类也高报';逐字记忆被排除但'改写式接触'无法排除——模型可能见过英文原版量表并把构念级知识迁移到立陶宛题项;LLM 侧每格仅 n=100、R=1,bootstrap CI 均宽 0.046 与 top-5 集群内部差距相当;推理努力固定在最小档,仅 6 模型消融,只有 gpt-5.4(0.37)和 claude-opus-4-7(0.31)超过噪声底;供应商模型版本会漂移,无对照。我的补充观察:统计基线直接拟合人类作答数据,信息上优于只看 11 字段画像的 LLM,虽然条件化 copula 部分回应了这一点,但交叉验证后两者打平,比较仍不完全对称;反事实结论受人类样本功效限制——81% 的对比不足以检测 d<0.3 的效应(中位最小可检测 d=0.45),性别轴'接近零'可能是功效问题而非真零;C9 叙事变体与 C3 排名的 Spearman 相关仅 0.31,说明排行榜对呈现方式敏感,细粒度名次不宜过度解读;所有结论限于 Likert 量表,不能外推到开放文本回答。

独立分析的弱点

第一, ground truth 单薄:单一国家、单一行业、n=263 的样本限制了几乎所有分布级结论的精度,人-人上限 0.825 本身就由这个样本量决定;作者自己也承认 81% 的人口学对比功效不足,因此性别轴'接近零'的解读需要谨慎。改进方向:在多个国家/构念上复制基准,或用分层重采样给出上限的置信区间。第二,公平性失衡的可能:基线看得见全部 68 题人类作答,LLM 只看得见 11 个字段,若 LLM 真的'学会了构念',这个比较低估了它;条件化 copula 实验缓解但未完全消除。改进方向:让 LLM 也在少量真实作答向量上做 few-shot 条件化(作者在附录表 20 试过,差距未闭合,这反而是更强的证据),或构造全新量表的'从未见过'版本。第三,呈现敏感性:C9 与 C3 排名相关仅 0.31,M2/M3 呈现模式下被试内漂移高达 |d|=0.27–1.20,意味着任何具体名次都条件于一种提示协议。改进方向:把跨呈现模式的平均 PSS 作为主指标,或报告对协议扰动的鲁棒区间。第四,top-5 集群内差距(0.671–0.714)与 CI 宽度(0.046)同量级,n=263、R=3 的重跑成本约 8 倍,作者未做。第五,失效模式的修复方案缺席:论文诊断了范围压缩(中位 $\sigma_{LLM}/\sigma_H=0.53/0.44$)和过度连贯,但没有给出校准手段,如事后方差膨胀、分位数映射或对比解码。

未来方向

作者提出的方向:(i) 在非印欧语系样本(韩语、普通话的组织心理学数据)上复制,检验框架的范围假设;(ii) 构造全新 12 分量表的自制工具,彻底排除改写式语料暴露;(iii) 扩展到长文本开放式回答(当前限于 Likert);(iv) 对同一画像做跨时间点的纵向稳定性研究以检测模型漂移;(v) 双字段交换并报告交互项的被试内反事实敏感性研究;(vi) 研究立陶宛语文本上的指令微调/RLHF 是否移动排行榜。基于成果可延伸的方向:把 PSS 的失效模式变成可优化的训练信号,例如用方差膨胀或分位数校准把 $\sigma_{LLM}/\sigma_H$ 拉回 1、用去偏解码压制默许度偏移(+0.84 SD);把'基线锚定 + 人-人上限 + 置换零分布'三件套推广到其他 LLM 评估领域(安全性评测、嵌入相似度基准);对教育≫角色>性别的不对称做机制消融——作者提出预训练分布偏斜、线索显著性、构念重叠三种假说但未能裁决,用字段措辞长度、语料溯源实验可以检验;以及研究混合生成器(copula 采样 + LLM 重排序)能否在保留语言模型的中介/组效应贡献的同时修复样本驱动分量。

复现评估

可复现性设计是本文的强项。数据:去标识化人类数据集将以 CC-BY-NC-4.0 发布,含 datasheet(Appendix N)、SHA-256 校验和、画像卡文件 human_profiles.json;最小联合人口学单元不少于 3 人,无任何直接标识符。代码:评估 harness、五个统计基线、五条供应商认证路径(OpenAI、Anthropic、Google AI Studio、Google Vertex AI、Nexos)随仓库发布;分析计划在首次 LLM 调用前锁定于 configs/preregistration.yaml,仅两项事后补充且均为非替代性改动。流水线:逐调用磁盘缓存(内容哈希键)、逐任务 parquet 检查点,幂等且增量——新增模型只跑该模型的调用;每次调用的完整响应(模型版本、finish reason、token 数、原始文本)记录在 generation_log_*.parquet 供漂移审计。成本:37 模型头部网格约 90–160 美元 API 费用、约 6 小时墙钟时间,单人和单实验室即可承受;重测研究(R=20×30 人)与消融均在此基础设施上以配置开关完成。难度评估:运行流水线本身不难(需 API key 和基本 Python 环境),但正确解读结果需要心理测量学背景(EFA、中介、HTMT、双因子分解),且模型版本漂移意味着数月后复跑的逐字结果可能不同——作者保留了审计线索但无法控制漂移。总体属于'认真投入即可复现'的基准,在同类工作中透明度很高。