← 返回 2026-08-27

GUI-Primitives:诊断视觉语言模型 GUI 视觉定位中的空间推理失败 GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding

Md Abrar Jahin, Md Rizwan Parvez 📅 2026-08-22 👍 9 2026-09-01 18:30
GUI智能体 基准测试 最小对比对 空间推理 视觉定位 视觉语言模型

994 项最小对比对诊断揭示:GUI 定位失败主因是候选定位而非关系理解

前置知识

GUI Grounding(图形界面视觉定位)

指计算机使用代理根据自然语言指令在截图上找到目标界面元素并输出点击坐标的能力,是执行任何 GUI 操作前的第一步。模型读入截图与指令(如“点击 Save 右侧的元素”),回归输出一个像素坐标 $\hat{p} = (\hat{x}, \hat{y})$,与目标边界框比较判定对错。ScreenSpot、ScreenSpot-Pro 等基准都测这个能力,代表性定位模型包括 SeeClick、OS-Atlas、UI-TARS、UGround 等。

本文要回答的核心问题正是:定位失败时究竟是哪个基本空间技能出了错。不理解 grounding 的任务形式与输出协议(无约束坐标回归),就无法理解论文的诊断逻辑。

最小对比对(minimal pair)

源自心理语言学评估传统(Linzen et al. 2016、Marvin & Linzen 2018):对同一张截图和同一个锚点元素,只翻转指令中的一个关系词(如 left↔right),使正确目标在两个指定候选元素之间切换。靠表面统计(总点最中央、最显眼或最常被标注元素)的模型在一对孪生题上必然一对一错,对级得分为零,从而排除捷径。WHAT'S-UP(Kamath et al. 2023)把该范式带入视觉-语言评测。

本文 994 题全部以 497 个最小对组织,0.50 是强制二选一的参考水平;所有“低于参考水平”的结论都依赖这一设计,不理解最小对就看不懂指标含义。

Point-in-box 准确率与 loose 指标

主指标沿用 ScreenSpot-Pro 的 strict 规则:预测坐标 $\hat{p}=(\hat{x},\hat{y})$ 落在目标框 $[x_1,y_1,x_2,y_2]$ 内才算对。Loose 指标允许预测落在距框中心 2 倍目标对角线范围内,用于区分“亚像素级偏差”与“完全认错元素”两类错误。所有准确率配 bootstrap 95% 置信区间(2000 次重采样),配对比较用 McNemar 检验加 Holm–Bonferroni 多重校正。

论文所有数字都建立在这一对指标上,并通过 strict 与 loose 的差异(尤其在真实/合成两臂上的对比)推断失败到底是定位误差还是元素误识。

Set-of-Mark(SoM)提示

一种训练无关的推理时干预(Yang et al. 2023):在候选元素上叠加带编号的视觉标记,让模型只需“说出编号”而不必直接回归像素坐标,从而把连续定位问题转换为符号选择问题。相关变体包括需要显式 SoM 训练数据的开源方案(SoM-LLaVA)与测试时缩放方案(DiMo-GUI、RegionFocus)。

SoM 是本文三种干预中唯一有效的(GPT-5 +57.1 个百分点),它的成功方式(绕过空间技能而非修复它)是论文得出“瓶颈在候选定位”这一诊断的关键证据。

激活引导(activation steering)

不改权重、在推理时修改模型内部表示的方法:在正确定位与错误定位样本的隐藏态之间求均值差向量 $v_\ell$,再把 $\alpha v_\ell$ 加到解码层 $\ell$ 的残差流上。本文按 SteerVLM 思路在 Qwen2.5-VL-7B 的第 12–19 层实验,从 $\alpha \in \{1,2,4,6\}$ 中选出保持句子流畅的最大值 $\alpha=4.0$,并用“冗长度对照向量”验证管线本身有效。

它是论文的重要阴性结果之一(仅 +1.5pt,不显著),与 CoT 一起支撑“失败更接近感知端与跨模态绑定,而非语言侧推理或残差流表示”的结论。

Pair-consistency 与 $y=x^2$ 参考线

对一致性指模型在最小对的两道孪生题上都答对的比例。若两次预测相互独立,一致性应约等于准确率的平方 $y = x^2$;实测若系统性低于该曲线,说明孪生题之间负相关——答对“left of”反而更容易答错“right of”,即关系词被忽略。这正是 Kamath et al. (2023) 在 WHAT'S-UP 中定义的“关系失败签名”。

这是论文判断“模型没有理解关系”的直接量化证据(Figure 6 中几乎所有点位于 $y=x^2$ 之下),也是连接本文与自然图像空间推理文献的桥梁。

Fleiss' κ(标注者一致性)

Fleiss' κ 衡量多位标注者对同一分类任务的一致程度,并校正随机一致:按 Landis–Koch 标准,κ>0.8 为“几乎完美”,0.6–0.8 为“充分”。本文 5 名标注者独立核验 196 题:良定性 $\kappa_{Q1}=0.942$,目标选择 $\kappa_{Q2}=0.787$;11 题被判无效剔除后得 185 题干净核心,人类两候选选择准确率 96.9%。

基准的可信度完全取决于题目是否无歧义、答案是否唯一;κ 值和 96.9% 的人类水平是全文“65 个百分点人机差距”这一头条结论的锚点。

研究动机

计算机使用代理点击错误按钮时,我们无法判断究竟是哪个基本技能出了问题——现有基准都无法隔离空间推理。OSWorld 这类端到端基准把定位与规划、执行混在一起;ScreenSpot 和 ScreenSpot-Pro 这类粗粒度定位基准只测点击是否落在目标框内,不区分失败由哪种空间原语造成。与此同时,前沿视觉-语言模型在 GUI 定位上仍显著落后于人类:本文在人验证子集上测得最强模型 Claude Opus 4.7 仅 31–32% 的 strict 点内框准确率,与人类 96.9% 的两候选选择准确率相差约 65 个百分点;四大闭源模型挤在 24–31% 的窄带里, nominal 规模增大并未带来单调提升。更麻烦的是,模型预测有 60–92% 落在两个候选区域之外,失败的主因(找不到候选?还是理解错关系词?)在以往任何评测中都无法区分。

本文的目标是构建一个受控诊断基准 GUI-PRIMITIVES,把 GUI grounding 所需的空间能力拆解为七个能在短指令中词法实现的基本原语——水平/垂直相对位置(left/right、above/below)、包含(inside/outside)、对齐(同行/同列)、邻近(nearest/farthest)、列表序数(first/second)、遮挡(visible/hidden),以 994 个最小对比对(每原语 142 题、每关系词 71 题)逐一测量模型是否具备每项技能。在此基础上:用候选级几何分类把失败定量分解为“候选定位”与“关系理解”两个成分;检验基准分数能否预测 ScreenSpot-Pro 上的真实定位表现;并测试 SoM、CoT、激活引导三种免训练干预能否弥补技能缺口。

与已有工作不同的是,本文的独特切入是把心理语言学的最小对范式系统性移植到 GUI 截图这一视觉先验截然不同的领域。WHAT'S-UP 在自然图像上做过类似设计,RocketScience 用对比对区分物体定位与空间推理,但 GUI 的特点是文字标签无处不在、图标高度相似、布局密集,捷径风险与失败模式都不相同。方法上,本文新增加候选级分解:把每个无约束坐标预测按几何位置分类为落入目标框、干扰框或两者之外,从而把“候选定位失败”与“关系词理解失败”首次定量分离;并以 Oracle 二候选标注作为诊断上界而非可部署方案,明确区分“修补技能”与“绕过技能”。

核心方法

整体是“构造—验证—评测—诊断—干预”五段流水线(Figure 1)。构造端有两条数据臂并全程分开报告:真实臂 $n=290$,复用 UI-Vision 的元素级标注(覆盖 Web、MacOS、VS Code、Office 及专业应用),可恢复水平/垂直位置、对齐、邻近与 24 条真实列表序数题;合成臂 $n=704$,由程序化渲染器按固定布局语言(顶部工具栏、左侧列表、中央网格、可选对话框)生成,位置已知、干扰物可控——这是获得干净 containment 与 occlusion 题的唯一途径,因为真实截图标注不含父子或遮挡元数据。每个原语 142 题、每个关系词 71 题,严格 50/50 平衡。评测端覆盖 19 个 VLM(7 个闭源 API + 12 个开源权重),统一 greedy 解码($T=0$)、固定种子,按模型族处理像素/归一化坐标约定,并对闭源 API 的服务端降采样做预 resize 与坐标重标定。

核心创新是最小对构造本身:一对孪生题共享同一截图与锚点,只翻转关系词,使正确目标在两个指定候选间切换(Figure 2)。任何依赖“点最中央/最显眼/最常被标注元素”先验的模型,在一对题上必然一对一错,对级得分为零——这直接消解了粗糙基准上被显著性偏置虚高的分数。由于七个原语全部实现为二选一对比,0.50 成为强制二选一的参考水平(注意这不是无约束点击任务的随机水平,一个预测可以同时落在两个候选之外)。第二个关键设计是候选级分类:把每个预测几何归类为 target / distractor / neither / invalid 四种,就能区分“找不到候选”与“选错候选”两种性质完全不同的失败。正是这个设计把论文结论从“模型空间推理差”推进到“模型主要败在候选定位,而非关系理解”。

方法步骤详情

第一步收集截图:真实臂取自 UI-Vision 标注,合成臂由固定种子的程序化渲染器生成。第二步按原语挖掘最小对:选定锚点与两个满足对比关系的候选元素,翻转关系词生成孪生题;其中 253/497 对还变化载体模板(动词、中心名词、锚点引用方式),且该变化与关系词不混淆(附录 J.2)。第三步自动质量门过滤:要求两孪生题同截图、目标非空且互不相交、边界框有效、无重复对。第四步人工核验:5 名标注者独立对 196 题分层子集回答“指令是否良定”与“哪个候选框是目标”,得 Fleiss $\kappa_{Q1}=0.942$、$\kappa_{Q2}=0.787$,多数判无效的 11 题剔除后留下 185 题干净核心,人类准确率 96.9%。第五步评测:统一提示(只回像素坐标)、鲁棒坐标解析器(附单元测试)、闭源 API 先预 resize 到已知长边再重标定坐标(如 GPT-5 在 ScreenSpot-Pro 上约 1500/1581 条记录需要重标定,Sonnet 为 1297/1581)。第六步计算 strict/loose 指标与 bootstrap 95% CI,配对比较用 McNemar + Holm–Bonferroni。第七步对 18,886 条基线预测做候选级分类。第八步计算 pair-consistency 并与独立性参考线 $y=x^2$ 比较。第九步实施三种免训练干预(SoM 标记、原语感知 CoT、残差流激活引导),并在 10 个重合模型上分析与 ScreenSpot-Pro 的相关性。

技术新颖性

技术新颖性体现在四点。其一,诊断粒度:首个把 GUI grounding 失败分解到七个基本空间原语层面、并施加对比控制的基准,区别于 OSWorld 的端到端评测与 ScreenSpot 系列的粗粒度定位评测。其二,失败成分的定量分离:候选级分析显示 60–92% 的预测落在两候选之外,而落入候选区域的预测在水平/垂直/邻近上选对率高达 0.89–0.90——这与“模型乱点”的直觉相反,把主流失败归因于候选定位而非关系词理解。其三,诊断上界式干预:Oracle 二候选标注带来 35–57 个百分点的提升,作者明确称之为“供给了候选集的上界”而非可部署方法,这种把诊断与方案严格分开的表述方式本身具有方法论价值。其四,阴性结果同权重报告:CoT(+0.5pt)与激活引导(+1.5pt)均不显著,与 SoM 的巨大收益并列呈现,共同支撑“瓶颈在感知/跨模态绑定端”的判断。此外,论文还量化了一个此前未被报告的现象:15/19 个模型存在显著的“左偏”布局先验(均值 +0.169,$t=5.6$,$p<.001$)。

GUI-PRIMITIVES dataset construction pipeline
Figure 1: GUI-PRIMITIVES dataset construction pipeline
A contrastive pair from GUI-PRIMITIVES (details in Appendix P)
Figure 2: A contrastive pair from GUI-PRIMITIVES (details in Appendix P)
Benchmark distribution analysis
Figure 12: Benchmark distribution analysis

实验结果

基准有效性(§5.1):在 Qwen2.5-VL-7B 上,把指令配空白画布使准确率从 22.0% 跌至 6.5%($\Delta=-15.5$pt,$p=2.8\times10^{-27}$),换成同原语他题截图跌至 14.8%($\Delta=-7.2$pt,$p=1.3\times10^{-11}$),两者通过控制;重高斯模糊($\sigma=12$px)仅跌至 16.7%($\Delta=-5.3$pt,低于预注册的 10 点阈值),提示 grounding 更依赖全局布局而非细粒度 OCR。整体水平(§5.2):Claude Opus 4.7 在 185 题干净核心上达 32.4%(全基准 0.313),比人类 96.9% 低约 64.5 个百分点;GPT-5 为 0.297;开源 Qwen2.5-VL-7B(24.5%)与闭源 Claude Haiku 4.5(25.0%)统计打平,尽管体积小约两个数量级。分原语(§5.3):list-ordinal 被前五名模型解决(0.80–0.83);水平位置仅 Opus 4.7 达 0.51 参考水平;垂直位置最佳 GPT-5 仅 0.32;containment、occlusion、alignment、proximity 四项上所有模型(含四大闭源)的 95% CI 上界都低于 0.50。候选级分析(附录 R):60–92% 的预测落在两候选之外;containment/occlusion 的区域内选择率 0.548/0.554,与 0.50 无显著差异(关系词无信号),水平/垂直/邻近达 0.89–0.90。真实 vs 合成(§5.4):合成臂 loose 0.60–0.76(误差多为亚像素偏差),真实臂 strict 对所有模型近乎为 0、loose 仅 6–23%,96.2% 的真实臂预测落在两候选之外。对一致性(§5.5):系统性低于 $y=x^2$,孪生题负相关,构成关系失败签名。下游关联(§6):与 ScreenSpot-Pro 的 Spearman $\rho=+0.736$($p=0.015$,$n=10$),真实臂/合成臂内部 +0.705/+0.760,条目级逻辑回归 pseudo-$R^2=0.404$($n=15{,}810$)。干预(§7):SoM 使 GPT-5 从 30%→87%(+57.1pt,$p<10^{-50}$)、OS-Atlas 10%→52%(+42.1pt)、Qwen2.5-VL 22%→57%(+35.1pt),GPT-5 七个原语中六个提升 ≥40pt,但 Qwen2.5-VL 已饱和的 list-ordinal 反而退化 $-32.4$pt;CoT 仅 +0.5pt($p=0.51$)、激活引导 +1.5pt($p=0.066$),均不显著。

The seven elementary spatial primitives in GUI-PRIMITIVES, with their canonical relation words and two-candidate reference levels
Table 1: The seven elementary spatial primitives in GUI-PRIMITIVES, with their canonical relation words and two-candidate reference levels
Overall accuracy on GUI-PRIMITIVES for 12 representative models, alongside accuracy on the human-clean 185-item subset
Table 2: Overall accuracy on GUI-PRIMITIVES for 12 representative models, alongside accuracy on the human-clean 185-item subset
Full benchmark accuracy for all 19 evaluated models on three splits (Full / Core / Clean)
Table 3: Full benchmark accuracy for all 19 evaluated models on three splits (Full / Core / Clean)
Strict (point-in-box) vs. loose (within 2× target-diagonal) accuracy, split by image source
Table 5: Strict (point-in-box) vs. loose (within 2× target-diagonal) accuracy, split by image source
Per-primitive composition of GUI-PRIMITIVES by source arm
Table 6: Per-primitive composition of GUI-PRIMITIVES by source arm
Candidate-level classification of all baseline predictions, pooled over 19 models (strict rule)
Table 7: Candidate-level classification of all baseline predictions, pooled over 19 models (strict rule)
Shortcut controls (Qwen2.5-VL-7B, n = 994)
Figure 3: Shortcut controls (Qwen2.5-VL-7B, n = 994)
Human-clean core (185 items, 5 annotators, κ = 0.94). Human accuracy is 96.9%. The strongest model is Claude Opus 4.7 at 32.4%.
Figure 4: Human-clean core (185 items, 5 annotators, κ = 0.94). Human accuracy is 96.9%. The strongest model is Claude Opus 4.7 at 32.4%.
Per-primitive accuracy across eight representative models, with bootstrap 95% confidence intervals
Figure 5: Per-primitive accuracy across eight representative models, with bootstrap 95% confidence intervals
Pair-consistency vs. raw accuracy, per model per primitive
Figure 6: Pair-consistency vs. raw accuracy, per model per primitive
Per-model GUI-PRIMITIVES accuracy against ScreenSpot-Pro grounding accuracy. Spearman ρ = +0.736 (p = 0.015)
Figure 7: Per-model GUI-PRIMITIVES accuracy against ScreenSpot-Pro grounding accuracy. Spearman ρ = +0.736 (p = 0.015)
Intervention deltas vs. each model's baseline, with Holm-adjusted significance (paired McNemar across primitives)
Figure 8: Intervention deltas vs. each model's baseline, with Holm-adjusted significance (paired McNemar across primitives)
Per-primitive SoM delta on Claude Opus 4.7 and GPT-5
Figure 9: Per-primitive SoM delta on Claude Opus 4.7 and GPT-5
Per-model per-primitive accuracy heatmap, all 19 models
Figure 10: Per-model per-primitive accuracy heatmap, all 19 models
Item-level regression forest plot (n = 15,810, pseudo-R² = 0.404)
Figure 11: Item-level regression forest plot (n = 15,810, pseudo-R² = 0.404)
Model sensitivity analysis
Figure 13: Model sensitivity analysis
One real example of each error type (Appendix U)
Figure 29: One real example of each error type (Appendix U)
查看结构化数据
任务指标本文基线提升
GUI 空间定位诊断(185 题人类干净核心) strict point-in-box 准确率 Claude Opus 4.7:32.4%(19 个模型中最高) 人类两候选选择准确率 96.9% −64.5 个百分点(差距而非提升;差距在全 994 题、196 题核心、LLM 仲裁 100 题三个切片上均稳定)
开源小模型 vs 闭源大模型(196 题人验证核心) strict point-in-box 准确率 Qwen2.5-VL-7B:24.5% Claude Haiku 4.5:25.0% 统计打平——7B 开源模型以约两个数量级更小的体量比肩闭源模型
免训练干预 Set-of-Mark(GPT-5) 全基准(994 题)准确率 87% 30%(无干预) +57.1 个百分点($p<10^{-50}$),为任何模型在任何条件下达到的最高绝对准确率
免训练干预 Set-of-Mark(OS-Atlas-Base-7B) 全基准准确率 52% 10% +42.1 个百分点($p<10^{-50}$)
免训练干预 Set-of-Mark(Qwen2.5-VL-7B) 全基准准确率 57% 22% +35.1 个百分点($p<10^{-50}$);但其已饱和的 list-ordinal 退化 −32.4pt
原语能力预测下游定位(10 个重合模型) GUI-PRIMITIVES 与 ScreenSpot-Pro 准确率的 Spearman 相关 $\rho=+0.736$($p=0.015$;真实臂 +0.705、合成臂 +0.760;留一法区间 [+0.62, +0.86]) —(诊断性关联,无传统基线) 条目级逻辑回归(模型固定效应 + 目标面积控制)pseudo-$R^2=0.404$($n=15{,}810$)佐证
快捷方式控制验证(Qwen2.5-VL-7B,994 题) 准确率变化(配对 McNemar) 空白画布 6.5%、换图 14.8%、重模糊 $\sigma=12$px 16.7% 正常输入 22.0% −15.5pt($p=2.8\times10^{-27}$)与 −7.2pt($p=1.3\times10^{-11}$)显著通过;−5.3pt 低于预注册 10 点阈值,未严格通过

局限与改进

作者承认的局限:containment 与 occlusion 仅存在于合成臂(真实 GUI 数据缺乏可扩展的父子/遮挡元数据),这两项上“关系词无信号”的结论外部效度受限;point-in-box 是二元粗指标,loose 指标也无法刻画结构化空间误差(锚点坍缩、方向反转);只验证到 ScreenSpot-Pro,未做 OSWorld 端到端任务成功率的验证;v1 只覆盖英文静态点击目标;SoM 每题只标 2 个候选,与真实多标记拥挤场景差距大,且部署收益会继承上游检测器(OmniParser 类)的失败;闭源 API 的降采样与模型身份随时可能变化;人类 96.9% 的两候选任务与模型的无约束点击任务并非完全协议匹配。我自己的观察:每原语仅 142 题、合成臂锚点复用严重(containment 只有 4 个不同锚点槽位、occlusion 13 个),虽经锚点级/截图级 cluster 重采样保住了“低于参考水平”的结论,但多样性天然受限;相关性样本只有 10 个模型,非参数 bootstrap CI 宽达 [+0.11, +0.98];条目级回归的单原语系数都很小($|\text{coef}|\le 0.07$)且脆弱,作者也只能声明模型级关联;另外 Llama-3.2 的 1.2% “准确率”实为约 42% 题目输出默认坐标 (0,0) 的假象,提示对这类模型应单独报告拒绝/解析失败率。

独立分析的弱点

弱点一:合成臂锚点复用(containment 仅 4 个锚点)意味着模型可能在近乎相同的布局上被重复测试,改进方向是为每个锚点做程序化变体,或从 accessibility tree / DOM 中挖掘真实父子与遮挡元数据。弱点二:0.50 参考水平只约束二选一选择,无法约束“落在两候选之外”的主要失败模式,本文靠事后几何分类弥补;更好的做法是把任务改造成原生强制选择的同时保留自由坐标输出做双轨评估。弱点三:SoM 的巨大收益建立在“恰好两个候选”的玩具设定上,真实 agent 界面常有几十个标记,标记间混淆会成为新瓶颈,应在多标记拥挤场景下重新测收益并结合真实检测器管线。弱点四:相关性分析 $n=10$ 且全部来自同一评测管线,应纳入 ScreenSpot、MMBench-GUI 等独立 grounding 基准和更多模型,把 [+0.11, +0.98] 的宽置信区间收窄。弱点五:CoT 与引导两个阴性结果只在 Qwen2.5-VL-7B 一个模型上得出,改进方向是扩展到更大模型或 GUI 专训模型,并尝试多层、多向量组合的引导方案,排除“干预点选错层”的解释。弱点六:论文止步于诊断,未探索任何训练类修复——例如在最小对数据上做对比式微调——诊断与修复之间缺少闭环验证。

未来方向

作者明确提出的方向:三个靶向消融——文本遮罩(OCR 依赖)、保留布局的乱码文本(空间结构依赖)、图标字形替换(图标识别 vs 关系推理)——以把失败源进一步分解为感知或组合成分;扩展到拖拽目标预测、双向与 CJK 文字布局、OSWorld pre-action 切片、以及闭源 API 的冻结快照以抵抗漂移。基于本文成果可自然延伸的:(1) 把最小对语料用于对比式微调或偏好优化(DPO),直接修补关系绑定能力,并验证能否外溢提升 ScreenSpot-Pro 等真实基准;(2) 构建带真实父子/遮挡元数据的 GUI 标注管线,把 containment/occlusion 带入真实臂,检验合成结论的迁移性;(3) 设计结构化空间误差指标(漂移距离分布、方向反转率、锚点坍缩率)替代二元点内框,使评测对“差一点”与“完全错”敏感;(4) 系统研究 SoM 标记数量与精度的权衡曲线,为 agent 栈选择标记粒度;(5) 用七维原语画像作为模型选型与路由特征,预测具体 GUI 任务上的可靠性;(6) 把同一范式移植到移动端截图、CAD、网页 DOM 等结构化视觉域,检验“关系失败签名”的跨域普遍性。

复现评估

复现条件较好。基准、代码与网站全部公开:GitHub(Abrar2652/gui-primitives)、HuggingFace 数据集(kagnlp/gui-primitives)、项目主页(abrar2652.github.io/gui-primitives);论文承诺附带所有模型预测、逐原语 bootstrap 区间(runs/diagnostic/analysis.json)、带单元测试的坐标解析器、标注指南与 SoM/CoT/引导的实现细节。开源模型均从 HuggingFace checkpoint 加载,7B 级模型单 GPU 可运行,greedy 解码 $T=0$ 加固定种子,模型标识符与端点在附录 B 钉死(2026 年 5 月快照),合成渲染器种子固定保证语料可复现。难点有三:闭源 API 的服务端降采样必须按附录 E 实现预 resize 与坐标重标定,否则会复现论文指出的大规模假失败(GPT-5 在 ScreenSpot-Pro 上约 1500/1581 条、Sonnet 1297/1581 条记录曾需重标定);闭源评测有真实 API 成本;Pixtral-12B 与 Idefics3-8B 因 chat 模板不兼容被排除,复现者若加入新模型需自行适配解析。总体属于中等难度、关键在 API 配置细节的可复现工作。