评估开放式生成的两层元评分准则:GAMUT——事实完整性基准 Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness
用结构化元评分准则自动编译成二元检查表,评测长文本生成的事实完整性
前置知识
Decompose-Search-Verify (DSV) 流水线
长文本事实性评估的主流范式:先把模型回答拆成若干原子断言(atomic claims),再对每个断言去检索网页证据做真伪校验,最后汇总成一个精度型分数。FActScore、VeriScore 都属此类。
GAMUT 把 DSV 视为「只测精度不测召回」的代表,整套论文的动机都建立在对 DSV 这套 boolean 检查清单假设的批判之上。
LLM-as-a-Judge 与二元评分清单 (binary checklist)
用一个强 LLM 当裁判,对照一串判分准则给自由回答打分。整体 Likert 打分方差很大,所以社区转向「每条准则单独 yes/no」的二元清单形式,显著降低打分噪声、提升裁判间一致性。
GAMUT 的核心矛盾正是:结构化准则表达力强但裁判不可靠,扁平二元清单可靠却表达不了「覆盖率/顺序」——这是它两层设计的出发点。
事实完整性 (factual completeness / recall)
相对于事实精度(precision:回答里说对的比例)的另一面,指回答是否覆盖了一个「完整答案」本应包含的全部事实。现有评测几乎只关心精度,召回侧长期被忽视。
GAMUT 自我定位为「事实性缺失的那一半」,整个 benchmark 就是为了把召回从背景话题抬升为一等评测目标。
可穿戴助手场景与 CRAG-MM
CRAG-MM 是一个可穿戴设备(约 80% 为智能眼镜的第一人称)真实图像基准,覆盖植物、食物、动物、车辆、本地场所、日常物品等 10 个领域,图像常存在弱光、模糊、遮挡等真实噪声。GAMUT 用它作为图片来源,构造「日常深度研究」问题。
理解 GAMUT 的图像来源与「陌生人测试(stranger test)」等去模板化机制,才能判断基准的真实性与泛化范围。
研究动机
评估长文本生成的事实性长期被精度(precision)主导:主流的 DSV 流水线(FActScore、VeriScore 等)把回答拆成原子断言、逐条检索网页校验,能很好地抓住「说错了什么」,但对「该说的没说」几乎无能为力。少数关注召回的工作(如 Liu et al., 2025)依然沿用同一个更可疑的假设——把事实质量等同于「一串相互独立的二元真假检查」。但真实场景里这个模型反复失效:开放式问题(如「哪些传统菜肴用到某种食材」)没有固定必答项,两个列出不同菜肴的回答可以同样好;过程类问题(如某物品如何演变成今日形态)里步骤顺序错了即使每步都对也算错;事实之间还存在关系、分组、重要性差异,而一组相互独立的布尔检查天然表达不出这些结构。把事实性约简为扁平 checklist,便利了打分却扭曲了「答案好坏到底由什么决定」这一根本判断。
本文的目标是本文要把事实完整性(factual completeness / recall)提升为长文本事实性评测的一等目标,并解决「表达力 vs. 可靠性」的根本矛盾:一方面需要一种能描述开放式集合、有序流程、事实间关系、重要性分层的结构化准则,让标注者像资深评审一样表达「哪些是必答项、哪些是开放集合要够覆盖率、哪些必须按顺序说、哪些只是加分项」;另一方面又必须让 LLM 裁判稳定可重复地打分,因为裁判对扁平、二元、自包含检查的一致性远高于对复杂结构的解读。具体可量化的目标是构造一个在 1813 个真实图像问题上的、人工核验证据背书的多模态基准,并证明它能稳定区分 14 个前沿模型且对裁判选择鲁棒。
与已有工作不同的是,已有工作要么停留在 DSV 精度范式,要么在召回侧给扁平 boolean 清单加单一信号轴(如事件顺序 Zheng 2025、重要性加权召回 Wanner 2025)。最接近的 FACTS Multimodal 把人工准则事实分成 essential/non-essential 两档,但其问题只引出寥寥几条 essential 事实,且仍是「在扁平空间里同时撰写与打分」。GAMUT 抓住了一个被忽视的切入点:把「描述好答案的表达空间」与「打分的可靠空间」解耦——在结构化元准则空间里写、在机械编译出的二元准则空间里打分,从而鱼与熊掌兼得。同时它把评测对象从学术级 deep research 下放到「日常深度研究」(可穿戴助手场景),这一以真实图像为锚的开放式长问题库本身也是新的。
核心方法
直觉上,可以把 GAMUT 想成「先画一张结构图、再把它摊平成可勾选的清单」。每道题先建一份结构化元评分准则(meta-rubric),像资深评审那样把一个完整答案应当包含的内容组织起来:哪些是单点知识、哪些是必答清单、哪些是开放集合(够覆盖率即可)、哪些是必须有序的流程、哪些是实体间关系,并为每项打上 Answer-Critical / Valuable / Context 三档重要性,且对每条事实标注支撑它的网页证据片段。随后用一组固定的、可审计的机械规则把这份元准则编译成扁平的二元 pass/fail 检查清单——这正是 LLM 裁判最擅长稳定打分的形式。打分时让裁判对每个检查独立判 meets / partially meets / missing / contradicts,再按层次加权得到 GAMUT 分数。
核心创新是「两层准则表示」:把标注的表达力与打分的可靠性分别放在不同空间里。结构化元准则负责「描述好答案」(捕获开放集合的覆盖率、流程的顺序、事实间关系、重要性分层),但它只用于标注与核验;真正打分时用的是由固定规则机械编译出的扁平二元准则——开放集合变成「至少提到以下 N 项中的 2 项」这类自包含阈值检查,流程变成顺序检查(sequence check),可选步骤降到下一档重要性。这样既保留了扁平 checklist 无法表达的结构信息(通过「存在哪些检查、如何加权」来隐式保留),又继承了二元打分的低方差。和已有方法最本质的区别是:旧方法的准则都在同一扁平空间里撰写与打分,GAMUT 让结构活在描述空间、可靠检查活在打分空间。
方法步骤详情
流程分数据构造与打分两大阶段。数据构造:(1) Question Creation——从 CRAG-MM 取 1938 张真实图像,用 Gemini 3.1 Pro 生成必须依赖图像、需多步网页研究、措辞自然且通过「陌生人测试」的开放式问题;每题由两名标注者独立审、第三人仲裁,再用第二个 LLM 过滤/排序/多样化,循环到每图都有一题通过人工与自动核验,最终得 1813 题。(2) Rubric Creation——LLM 采集网页证据、撰写带引用的结构化元准则并编译成二元准则;再做自精炼(逐条复核 snippet、从头重查补全证据),随后由与作者协作的专家团队多轮人工修订。打分:模型看图答题→Gemini 3.1 Pro 对每条二元检查独立判 meets/partially/missing/contradicts→按层内公式 $s=(M+\lambda P+\mu C)/(M+P+S+|\mu|C)$ 算分(取值 $[-1,1]$)→用全局权重 $w_{AC}=0.6, w_V=0.3, w_C=0.1$ 加权,取 $\lambda=0.5, \mu=-2$,使矛盾比遗漏扣得更重。
技术新颖性
新颖性有三层。其一,方法论上提出「两层准则」这一通用菜谱,把「评估开放式生成」中长期存在的表达力—可靠性矛盾公式化地解决,且可推广到任意 rubric-based 评测,不局限于事实性。其二,结构上引入 5 种元准则类型(Simple Knowledge / Strict List / Flexible List / Process / Relationship)加 meta-insight,特别是 Flexible List 的阈值检查让「开放集合覆盖率」首次变成可打分项,Process 的 sequence check 让「顺序」可打分——这些都是扁平 checklist 在物理上没有的检查种类。其三,评测对象上首次构造以真实可穿戴图像为锚的「日常深度研究」开放式长问题库(1813 题、10 领域),并配套人工核验的证据体系(9400+ 独立网页)。编译规则的确定性、可审计、机械可复现,也使整个 pipeline 比纯人工或纯模型的方法更可信。
实验结果
Table 1 在 1813 道多模态题上评测 14 个模型(Gemini 3.1 Pro 裁判)。三大发现:(1) 基准有挑战——最强 Gemini 3.1 Pro 仅得 58.7%、最多 meets 55.2% 准则元素,最弱 Llama 3.2 11B 仅 5.1%,(2) 区分度极高且排序「自发」恢复业界共识——新/大胜过旧/小、闭源胜开源,且复现已知倾向,如两个 Qwen3-VL 变体 contradiction 率最高(8.7%/11.5%)、Claude Opus 系列最低(约 2.6–3%);(3) 主导失败是「遗漏」而非「错误」——最强模型仍近 30% 准则元素 missing,最弱约 2/3 missing。裁判鲁棒性:Claude Opus 4.8 与 Qwen3-VL 235B 重打全部题,Gemini 与 Claude 排序完全一致、分差≤1.8 Qwen3-VL 偏宽松 4–11 分但保持总体排序。Table 3 纯文本变体显示去图后所有模型升约 10–20 分且排序不变,说明视觉识别更像「恒定税负」,多模态排序真正反映知识完整性差异。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 多模态事实完整性(1813 题) | GAMUT 分数 [−1,1] (%) | Gemini 3.1 Pro 58.7%(最强) | 最弱 Llama 3.2 11B 5.1% | 最强 vs 最弱跨度 53.6 分,区分度极高 |
| 多模态事实完整性(闭源最佳) | GAMUT 分数 (%) | Gemini 3.1 Pro 58.7% | GPT-4o 34.2% | Gemini 3.1 Pro 领先 GPT-4o 24.5 分 |
| 多模态事实完整性(开源最佳) | GAMUT 分数 (%) | Qwen3-VL 235B 33.0% | Llama 4 Maverick 18.3% | Qwen3-VL 235B 领先 14.7 分 |
| 纯文本变体事实完整性(1806 题) | GAMUT 分数 (%) | Gemini 3.1 Pro 74.1%(文本版最高) | 同模型多模态 58.7% | 去掉图像恒定提升约 +15.4 分,反映视觉识别税 |
| 裁判间一致性(14 模型全量复评) | 排序一致性 / 单模型分数差 | Gemini 与 Claude 排序完全一致、分差≤1.8 分 | Qwen3-VL 235B 偏宽松 4–11 分但排序近似 | 对裁判选择鲁棒、无自我偏袒(≤0.3 分) |
局限与改进
作者承认的局限:(1) 测评对象限定在「日常深度研究」这一可穿戴助手场景,主题覆盖植物、食物、车辆、本地场所等生活领域,未必能外推到学术级或专业领域;(2) 标注成本高昂——rubric 修订需与作者紧密协作的专家团队,「通用标注池无法改进 LLM 生成的准则」,限制了规模(1813 题)与可扩展性;(3) 完全依赖 Gemini 3.1 Pro 做问题与准则构造,虽有人工把关,单一前置模型的潜在偏好与覆盖盲区并未消除。我额外观察到:打分依赖裁判对二元检查的判断,虽然 Table 2 三裁判排序一致,但 Qwen3-VL 系统性偏宽松 4–11 分,说明绝对分数对裁判仍敏感、跨研究对比应固定裁判;$\lambda=0.5, \mu=-2, w_{AC}=0.6$ 等超参是经验设定,「覆盖 Answer-Critical 即及格」会把分数压缩到中段、可能掩盖细微差异;编译规则条目繁多(短/长 flexible list、有无 optional step 等分支),实现一致性与第三方复算存在隐患。
独立分析的弱点
其一,规模与领域偏窄:1813 题全部锚定日常可穿戴图像,医疗、法律、金融、代码等高事实性风险领域缺席——改进方向是按同一两层范式扩展到高风险垂直领域并人工核验。其二,标注产能瓶颈:rubric 修订依赖与作者协作的专家团队、通用众包无法胜任,基准难以快速迭代或随时间更新(论文甚至把「事实不应随时间变化」作为筛选条件)——可用「多裁判投票 + 不一致自动触发人工」的半自动流程规模化。其三,裁判依赖与分数可压缩性:分数依赖单一裁判族,超参 $\lambda, \mu, w$ 经验设定会让分数集中中段、相邻模型差异小(如 Gemini 3.1 Pro 58.7 vs Gemini 3 Flash 57.9 仅差 0.8)——改进方向是提供标准化分数、引入更多裁判族并报告区间、做超参敏感性消融。其四,编译规则复杂:Flexible list 长短分流、Process 是否含 optional step 等分支多,第三方重算需严格对齐——建议开源形式化规约与单元测试样例。
未来方向
作者明确提到两层元准则是「rubric-based 评估开放式生成的通用菜谱」,可直接推广到事实性之外的任务(如指令遵循、写作质量、对话评估),这是最自然的延伸。基于成果还可延伸:(1) 把基准随时间维护——增加时效性问题并定期刷新网页证据,避免网页漂移使证据失联;(2) 把 GAMUT 分数作为 RL/RLHF 的奖励信号或评测目标,专门优化模型的事实召回而非精度;(3) 探索「自适应难度」——按模型能力动态选题以提升区分效率;(4) 研究如何在打分阶段引入多裁判集成与不确定性估计,进一步压缩裁判方差;(5) 把 stranger test、self-refinement 等 LLM+人工协作的数据构造流程迁移到其它需高质量参考答案的基准上。
复现评估
复现友好度中等偏上。有利因素:已公开 GitHub 仓库(https://github.com/facebookresearch/GAMUT)、数据集(1813 多模态题 + 1806 文本变体)、评测脚本与全部 prompt(Appendix A 完整给出 question generation/selection/rubric 生成/精炼/裁判/text-only 改写);编译规则、打分公式与超参($\lambda=0.5, \mu=-2, w_{AC}=0.6, w_V=0.3, w_C=0.1$)都很清楚;14 个被测模型均为公开 API 或开源权重,可重跑。难点与成本:完整复现基准构造需调用 Gemini 3.1 Pro 做大规模生成与自精炼,加多轮专家人工修订(含 90%/95% 通过率培训、10% 审计),算力与人工成本高;复现 Table 1/2/3 全量需对 14 模型 ×3 裁判 ×~1813 题打分,API 开销可观;且绝对分数对裁判敏感(Qwen3-VL 系统性偏高),跨论文对比需固定裁判与超参,否则数字不可直接比较。
论文图表
以行高表示各领域题量、横向分段表示该领域涉及的主题占比(如植物领域覆盖 habitat 35%/traits 14%/care 12% 等),各领域呈现独特主题画像而非共用少数模板。
回应「图像问题库是否会塌缩成几个模板」的质疑,证明数据构造的去模板化机制有效,是判断基准质量与泛化性的辅助证据。