FlavourBench:面向语言模型评估与后训练的可执行烹饪奖励图谱 FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth
把烹饪环境编译成稠密答案表,免裁判地为27个前沿模型连续评分排名,并验证监督可迁移
前置知识
LLM-as-a-Judge(模型裁判)
用一个强语言模型给其他模型的开放式输出打分或排序的评测方式,典型代表是 MT-Bench 的裁判评分和 Chatbot Arena 的人类偏好投票。它扩展性好,但裁判自身有位置偏差、长度偏差、自我偏好等系统性问题,而且裁判与被测系统往往同源,导致评测结论与被评测对象纠缠不清。
本文的问题出发点正是裁判纠缠:FlavourBench 的核心卖点是完全去掉模型裁判,改用推理前编译好的可执行奖励图谱查表打分。理解这一背景才能读懂它的设计动机和与 Related Work 中 Chatbot Arena、RewardBench 的对比。
可执行基准与稠密奖励图谱
像跑代码测试一样可以机械执行的评测:先把每个任务的全部合法候选答案穷举出来逐一打分,形成一张冻结的答案分数表。本文每题从8个候选食材中选3个,共 $\binom{8}{3}=56$ 个合法组合,每个组合在模型推理之前就被赋予0–100的连续分数,答题时只需一次查表,无裁判、无事后解释。
这是全文的方法基座:排行榜评分、SFT训练信号、外部验证全部围绕这张冻结分数表展开,分数表如何构建、如何归一化直接决定了所有结果的含义和边界。
锚点簇 Bootstrap 与同时置信区间
自助法通过重抽样估计统计量的抽样分布。本文按食材锚点整簇重抽(共享同一锚点的任务一起移动,避免把相关任务当独立样本),共50,000次;同时置信区间用 max-t 方法校准,保证所有27个模型的区间同时覆盖真值的概率不低于95%,而不是每个区间各自95%。
排行榜(表3)里每个分数旁的区间和排名区间都由此产生;不理解簇抽样,就无法理解为什么任务数是534个锚点簇而非1602个独立任务,也读不懂图7的排名不确定性。
Holm 校正与配对符号翻转检验
27个模型两两比较共 $\binom{27}{2}=351$ 个假设,多重比较会放大假阳性。Holm 校正是一种逐步的 p 值校正方法,控制族错误率(FWER)。本文每一对模型都在完全相同的534题上比较,用100,000次锚点簇符号翻转构造零分布,再做 Holm 校正。
论文反复强调'101/351 个比较显著'、热图中的灰色格子代表'未解决'——没有多重检验的背景,就无法理解它对'点排名不等于统计结论'的克制态度,以及为什么不存在唯一最佳模型。
LoRA SFT 与格式匹配对照
LoRA 在冻结的基座权重旁训练低秩增量矩阵,是参数高效微调的标准做法;SFT 即监督微调。格式匹配对照指控制组的训练数据与实验组的提示词、补全长度、A–H选项标签直方图完全相同,只是把最优组合轮换到不含正确答案的位置,从而把'学会输出格式'与'学会奖励函数'干净地分开。
第5章的核心结论(迁移+13.30分)完全依赖这个对照设计:没有它,分数提升可能只是模型学会了写 FINAL_SELECTION 标记行,而不是学到了烹饪奖励函数。
min–max 归一化与精确机会基线
把每题56个组合的原始效用线性缩放到0–100:$s_t(a)=100\cdot\frac{u_t(a)-\min_{b\in A_t}u_t(b)}{\max_{b\in A_t}u_t(b)-\min_{b\in A_t}u_t(b)}$,使不同任务可比。机会基线不是笼统的50分,而是该题56个冻结分数对均匀随机选择的期望值;约束族因不可行组合得0分,基线低至3.4分。
读懂基线才能理解各族的天花板与难度:替换/配对族基线约45分、最优与次优只差5.6分(高分辨率),约束族基线3.4分、top gap 达37.3分(低分辨率),这直接影响到总分加权是否合理。
研究动机
开放式语言模型评测长期面临'没有标准答案'的困境,现有做法有两条路,各有硬伤。第一条是模型裁判:让一个强模型给其他模型的开式输出打分,或像 Chatbot Arena 那样靠少量人类偏好投票排名。裁判与被测系统往往同源,存在位置、长度、自我偏好等系统性偏差;而且偏好投票稀疏,不同模型面对的任务子集不同,排名只能从稀疏选票推断,无法做严格配对比较。第二条是精确匹配:在烹饪这类开放领域用事实题或少量偏好近似质量,但'对/错'二元判定扔掉了合理答案之间的有用差异——一个接近最优的食材组合和一个荒谬组合可能同样被判错,模型间有意义的连续差距被抹平。结果是烹饪推理的评测要么被裁判纠缠,要么被粗糙的答案键浪费信息,前沿模型之间的真实差异既测不准也说不清。
本文的目标是本文要造一个'可执行'的烹饪评测:把 Epicure 烹饪环境编译成稠密答案表,每题从8个候选食材中选3个,全部 $\binom{8}{3}=56$ 个合法组合在模型推理之前就被打上0–100连续分,模型答题后查表即得分,全程无裁判、无事后解释。在此环境上作者设定了四个目标:(1)发布一个含29,904个模型无关组合分数、单一可解释0–100指标的可执行基准;(2)对27个前沿端点在同一534题上做完整面板评测(14,418条完整观测),同时给出不确定性量化与 Holm 校正的配对检验;(3)做事后稳健性检查:任务筛选、计分公式、家族权重、奖励图谱替换,以及 Recipe1MSubs 人类观察替换的留出验证;(4)用预注册的三种子 LoRA SFT 实验证明同一套奖励图谱可作为训练信号迁移到未见任务且超越格式学习。
与已有工作不同的是,独特切入是把'评测环境'当成'可发布的奖励函数'。与 SWE-bench 跑仓库测试、BFCL 验函数调用、τ-bench 查数据库状态的可执行路线相比,本文的任务空间小到可以穷举:每题只有56个组合,因此能发布稠密的偏序分数面而非单一正确键。三个设计选择明显区别于已有工作:其一,所有56个分数、任务选择哈希、解析器、推理种子和每个模型的路由在查看任何分数之前冻结并按内容哈希绑定,整个发布可精确重建;其二,'完整公共核心'只按响应完成状态和解析有效性筛选任务,选择代码在任务ID定死之前禁止加载任何食材或分数,机制上杜绝了挑易题和偏袒模型;其三,同一套图谱既用于评分也用于训练,并用格式匹配对照把'学格式'和'学奖励函数'分离。作者还反复强调 Epicure 不是'100%准确'的烹饪真理,而只是一个被发布、被哈希固定的任务奖励面,这个诚实的定位本身就是对基准文化的一种纠偏。
核心方法
直觉上,这篇论文把'出题—评分'整个环节编译成一个可重建的产物。底层是 Epicure 烹饪参考环境:1,790种食材嵌入在300维空间中,提供替换、配对、饮食可行性、区域组成等确定性操作。任务编译器把这些操作编译成三选八的选择题,分三个家族:替换(效用=0.8锚点相似+0.2组合一致性)、配对(0.65锚点亲和+0.35一致性)、约束(0.7相似+0.3一致性,附加饮食与NOVA加工等级上限硬约束,不可行组合得0分)。每题枚举全部56个合法组合,按 $s_t(a)=100\cdot\frac{u_t(a)-\min_b u_t(b)}{\max_b u_t(b)-\min_b u_t(b)}$ 在任务内归一化,冻结成0–100分数表,每题有唯一满分最优解。27个被测端点在冻结路由下作答534题(2个独立编译面板×3家族×89题),输出解析后直接查表;统计端对食材锚点做50,000次簇 bootstrap 并对全部351个模型对做 Holm 校正的配对符号翻转检验。图1把流水线概括为:Epicure 工件 → 任务编译器 → 穷举预言机 → 前沿面板 → 集合解析器 → 统计发布。
核心创新是'推理前冻结的稠密奖励面'加上'分数盲的完整公共核心'。与 LLM-as-a-judge 相比,它消灭了裁判纠缠:被测模型互不评分,也不接触 Epicure,奖励图不以工具形式暴露,考的是模型能否直接做出烹饪决策而非照抄运行时返回值。与精确匹配相比,它保留偏序信息:满分100只给该题唯一最优组合,其余合法组合按归一化效用拿部分分,两个非最优答案可以相差几十分,连续分数让模型间的细粒度差异可见。与普通基准相比,公共核心的构造是分数盲的:任务资格仅要求全部27个模型完成且解析出三个不同标签,选择顺序由固定 SHA-256 决定,选择时根本不加载分数,因此既不偏袒任何模型也不按观测分数挑易题。另一个容易被忽视的关键点:Epicure 被明确定位为'被发布并被哈希固定的参考函数'而非烹饪真理——其原始训练运行与种子已不可恢复,更换工件等于创建新的任务集身份,作者为此专门做了三个公开检查点的重打分分析来检验排名对图谱本身的依赖。
方法步骤详情
第一步,冻结工件:绑定 Epicure 数据包与应用构建的哈希,任务资格、全部分数表、解析器、任务选择哈希、推理种子和每个模型块的精确路由在查看任何分数之前固定;禁用自动回退,广告推理努力控制的端点固定为最低档且隐藏推理不计入输出。第二步,编译任务:两个独立面板各为每族生成160个候选任务;提示词给出决策上下文和8个带标签候选,要求末行以 FINAL_SELECTION 标记给出三个不同的A–H标签;解析器取标记行、大写、按无序集合排序后对冻结分数表做一次查表,解释性文本不影响得分。第三步,构造公共核心:在6个面板×家族层内按固定 SHA-256 顺序各取前89个'全部27模型完成且可解析'的任务,共534题、534个独立锚点簇;补全的矩形矩阵使每对模型共享534格配对观测。第四步,统计推断:50,000次锚点簇 bootstrap 给出点分数的同时 max-t 区间和排名区间;351对双侧配对符号翻转检验(100,000次蒙特卡洛)经 Holm 校正(族错误率 α=.05);每个模型另与精确逐题机会基线做27个配对检验(单独的 Holm 族);另做任务量精度诊断(每层5,000个分数盲子集)和广义化系数分解。第五步,事后敏感性:逐个剔除端点重跑任务选择哈希、三种替代计分公式、696种家族权重组合、用三个公开 Epicure 检查点(Cooc/Core/Chem)重算全部14,418个选择的分数。第六步,预注册SFT实验:钉住 Qwen3-0.6B 版本,270训练/72验证/84锚点不相交迁移任务,LoRA rank16、alpha 32、dropout 0.05、全线性层、3轮、AdamW、lr $10^{-4}$、有效批16、仅补全损失、贪心解码;处理组补全是该题 Epicure 最优解,对照组把同样的A–H组合轮换到同族其他提示上,提示词、行数、补全长度、标签直方图完全一致但不含任何最优解;估计量为等权家族的处理−对照分差,50,000次交叉 bootstrap 加100,000次锚点符号翻转,预注册3分为实用阈值。
技术新颖性
技术新颖性有四点。其一,穷举式答案键:534题×56组合=29,904个模型无关的组合分数作为发布物,这在开放领域评测中罕见,因为多数开放任务的答案空间无法枚举;它把'评估开放决策'转化为'查表',同时保留部分credit。其二,公共核心的分数盲构造与矩形矩阵:任务入选只看完成状态与解析有效性,选择时代码禁止加载分数,机制上排除了事后挑题;27×534的完整矩阵使每一对模型都在完全相同的任务上配对比较,而不是像竞技场那样从稀疏、不对齐的投票中推断排名。其三,不确定性表述的克制:同时 max-t 区间、bootstrap 排名区间、Holm 校正的成对图(灰格=未解决)把'点排名'与'统计可分辨'明确分开,并拒绝呈现未解决相邻模型的总序——这在排行榜文化中是方法论上的表率。其四,评测与训练共用同一奖励面,并用格式匹配对照+锚点不相交迁移+预注册实用阈值来证明'学到的是奖励函数而非输出语法';这套实验协议(先发布协议与评测器,再开训练结果)本身就可作为后续 benchmark-plus-posttraining 研究的模板。
实验结果
排行榜(表3、图2):Grok 4.6 点估计最高65.1(同时95%区间[61.0,69.2]),Gemini 3.1 Pro 65.0、GPT-5.6 Sol Pro 64.2、Muse Spark 1.2 63.8 紧随,末位是 Cohere Command R+(47.9);全部351个预注册配对比较中101个经 Holm 校正后显著,模型分成三个统计组(第1–16、17–25、26–27名),作者明确指出数据不支持唯一最佳端点。任务诊断(表2):替换/配对族的精确机会基线约45.2/45.0分,最优与次优组合的中位差仅5.6分,56个组合有56个不同分数(分辨率极高);约束族机会基线仅3.4分,top gap 达37.3分,只有4个不同分值(刻意稀疏)。面板复制(图3):两独立面板的模型分 Pearson r=0.89、Spearman ρ=0.80。任务量实验(图4):交叉设计广义化系数在534题时为0.936,达到0.90约需329题;270题子样本的中位排名相关0.952(95%范围0.897–0.980)、前五重叠80%,但点榜首仅在46.1%子样本中保留——说明全球排序可靠而'谁是第一'不可判。替代指标(表4):机会调整增益、动作百分位、精确最优率与主分数排名相关0.938–0.985,配对方向一致率≥89.2%;696种家族权重组合下相关≥0.980,榜首会在 Grok 4.6 与 Gemini 3.1 Pro 之间换人。任务筛选敏感性(图9左):剔除约束最大的 Claude Fable 5 后保留71.0%任务,排名相关0.955、方向一致率92.9%、榜首不变;其余剔除至多改变每层3题,且42项数值/类别比较经 Holm 校正后无一显著(选中与未选中任务无系统差异)。图谱替换(表5、图10):三个公开检查点显著改变逐题分数(任务级秩相关0.660–0.752,精确最优一致率仅27.7%–38.4%),但模型级排名相关仍达0.903–0.957、方向一致率86.9%–91.7%,三者榜首都是 Grok 4.6;不过分层 bootstrap 中两个图谱给出同一榜首的比例仅38.9%–53.8%。外部验证(表6、图11):Recipe1MSubs 的10,747个测试事件中3,282个精确映射到1,790词表,得1,469个唯一有向对、357个源食材;三个检查点把人类观察目标排在同食物组百分位0.806/0.800/0.780(机会0.5,Holm p<10⁻⁴),594个训练集未见对上仍达0.754/0.735/0.718,全词表 Hit@10 为0.133–0.172(解析随机基线0.0056)。SFT实验(表8、图8):84个锚点不相交迁移题上 Epicure SFT 得44.20 对格式对照30.90(+13.30,95%CI 6.52–20.29,p=1.70×10⁻⁴),三种子效应全正(+12.86/+13.34/+13.70);公共534图谱复制+11.73(95%CI 8.98–14.54,p=1.00×10⁻⁵);格式对照在迁移集上仅改变基座0.90分(p=0.790),公共图谱上提升3.05分(p=0.021,源于消除解析失败:训练组解析率100%对基座89.29%);分族看约束族收益最大(迁移+21.51、公共+20.21),替换+11.16、配对+7.23(迁移)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 完整公共核心总榜(534题×27模型) | FlavourBench Score(0–100) | Grok 4.6:65.1(同时95% CI 61.0–69.2) | 亚军 Gemini 3.1 Pro 65.0;末位 Command R+ 47.9 | 351个配对比较中101个 Holm 校正后显著;榜首与亚军不可分辨,未宣称唯一最佳 |
| 替换/配对族任务(各178题) | 家族均分 对 精确机会基线 | 头部模型普遍60–74分 | 45.2(替换)/ 45.0(配对) | 高出随机组合基线约15–28分,且该两族56个组合56个不同分值 |
| 约束族任务(178题) | 家族均分 | Grok 4.6:58.2(族内最高) | 精确机会基线3.4 | +54.8;该族仅4个不同分值、top gap 37.3,是区分头部与尾部的关键族 |
| 双独立面板复制 | 模型分 Pearson r / Spearman ρ | 0.89 / 0.80 | — | 宽排序跨独立编译面板稳定复制 |
| SFT 锚点不相交迁移(84题) | 均分(3种子平均) | Epicure SFT:44.20 | 格式匹配对照 30.90(未改基座 29.99) | +13.30(95% CI 6.52–20.29,p=1.70×10⁻⁴),三种子全正 |
| SFT 公共图谱复制(534题) | 均分(3种子平均) | Epicure SFT:43.33 | 格式对照 31.60(未改基座 28.56) | +11.73(95% CI 8.98–14.54,p=1.00×10⁻⁵),三种子全正 |
| Recipe1MSubs 人类观察替换验证 | 同食物组秩百分位(机会=0.5) | Cooc 0.806 / Core 0.800 / Chem 0.780;训练未见对 0.754/0.735/0.718 | 0.5(同组随机) | Holm 校正后 p<10⁻⁴;Hit@10 0.133–0.172 对随机解析基线0.0056 |
局限与改进
作者承认的局限有四层。第一,分数度量的是'与已发布奖励图的一致性'而非普适人类味觉:主运行时的原始训练运行与种子不可恢复,已发表的 Epicure 系列论文并未验证这个确切工件;用 Cooc/Core/Chem 重打分虽能恢复宽排序,但候选集当初仍是原运行时选的,因此图谱依赖检验是条件性的。第二,Recipe1MSubs 的配方与 Epicure 语料共享 Recipe1M 祖先,这是'标签独立'而非'语料独立'的收敛验证,且只覆盖替换组件,不验证配对与约束。第三,题内 min–max 归一化丢弃绝对效用幅度;任务只是受限的食材三选,不涉及完整食谱生成、感官执行、安全建议或长程厨房规划。第四,SFT 只做了一个0.6B模型、一种算法、三个种子;公共图谱复制复用同一批适配器,是任务复制而非训练复制。我的补充观察:完整核心规则把估计量限定在'所有端点都能完成'的题上,这对输出格式守规矩的头部模型更友好,名册变化会改变任务集(去 Fable 5 只保留71%);结果绑定具体路由与采集日期;约束族只有4个不同分值却与高分辨率的两族等权计入总分,榜首之争(65.1对65.0)完全可能被权重选择翻转;作者自己的半数子样本实验显示点榜首仅在46.1%抽样中保留,说明'谁是第一'在此数据上本质不可回答;此外约束族的零分不可行组合设计使低分模型可能主要败在违反硬约束而非品味差距。
独立分析的弱点
独立分析可见四个弱点。其一,奖励面的外部效度薄弱:唯一的真实世界校验只针对替换几何,且语料与训练数据同源;若 Epicure 的配对或约束效用本身有系统性偏差,27个模型会被一致地引向错误方向,而排行榜对此完全沉默——改进方向是为三族各找独立语料(菜单搭配数据库、食谱评论、营养学约束)做类似 Recipe1MSubs 的外部校验,尤其要补上配对与约束两族。其二,任务形态单一且可被专门准备:'三选八+FINAL_SELECTION 标记行'的格式一旦公开,后续模型的预训练或后训练就可能吸收这一分布,固定工件的可执行性反而放大污染风险——改进方向是定期用新锚点重新编译面板(内容寻址机制天然支持版本化),或引入参数化的连续任务空间与滚动私有保留集。其三,等权平均掩盖家族结构:约束族分辨率极低(4个分值)却占总分三分之一,而作者自己的权重扫描(696种组合)显示榜首会换人,等权总分制造了不必要的'伪第一'——改进方向是按信息量或难度加权、分层报告,或把'统计组'而非点排名作为官方结论。其四,complete-core 筛选与端点名册耦合:换名册即换任务集,跨论文、跨期数字不可直接比较,且对解析能力弱的模型系统性不利——改进方向是发布按名册分层的任务集元数据,或改用旋转核心/锚点配额设计,并为解析失败设计独立的格式分通道,避免语法错误污染烹饪能力测量。
未来方向
作者明确留下的接口有三处:Epicure 图谱同时暴露 SFT、偏好学习和标量奖励接口,本文只测了 SFT,用 RL 方法直接优化这个稠密奖励面、或用偏好对训练奖励模型(对照 RewardBench 的思路)都是自然延伸;区域组成任务已编译但因无法形成同等完整的公共核心而只作补充轨道,扩充名册后可纳入主榜;作者也指出需要人类感官与烹饪结果验证,这是整个'可执行烹饪评测'路线走向现实效度的关键一步。基于成果还可延伸:把'编译—冻结—穷举—查表'管线复制到其他可穷举的开放决策域(葡萄酒配餐、药物配伍禁忌、色彩搭配、植物搭配轮作);在更大模型与多种训练算法(全参数微调、DPO、GRPO 类 RL)上检验迁移效应是否随规模与算法变化,作者明说本文不比较训练算法与规模;研究'点榜首不可辨识'对排行榜设计的普遍含义,推广同时置信区间与统计分组报告的实践;测试工具调用条件下模型查询 Epicure 能提分多少(排名时刻意禁用,这个差距本身有信息量);以及把锚点簇 bootstrap + Holm 配对图这套统计封装成通用排行榜工具包。
复现评估
复现性是这篇论文最强的卖点之一,发布物是内容寻址的:两个精确任务集(534题与534锚点,含提示词、候选、56组合分数、预言机来源、任务层与任务集摘要);27模型清单与每模型的精确路由(表9)、回退策略与路由摘要;构成14,418格矩阵的全部响应记录(原始文本、完成状态、用量、延迟、解析输出、分数、摘要)以及提供方尝试事件;冻结的联合分析计划、50,000次 bootstrap 与100,000次符号翻转的输出、全部351个配对行;三个公开检查点的奖励图谱与20,000次评分器敏感性分析;哈希绑定的 Recipe1MSubs 协议与聚合验证工件;以及迁移实验的冻结计划、格式对照数据、六份训练清单、两套留出评估的原始生成、重抽样输出和适配器哈希。官方验证器与资产构建器可从本地文件重建排行榜 CSV、配对 CSV、LaTeX 表格与矢量图,完全无需访问模型提供商;写入一次、断点续跑、冲突即失败、回退禁用的工程约束也写得很清楚。训练实验只需 Qwen3-0.6B + LoRA rank16 × 3种子(约270题×3轮),单卡即可承担,复现门槛很低。真正的门槛在于自己重新采集前沿面板:需要27个端点的 API 权限与预算(其中 GLM 5.3 依赖 Z.ai 一次性书面许可,绑定哈希且无长期端点),这部分实际上只能复用发布的原始响应。总体评价:复现统计结论与训练实验非常容易,复现采集则基本依赖发布数据,但作者对此完全透明。
论文图表
左图:主榜前十在原始图谱与 Cooc/Core/Chem 三个公开检查点下的点排名轨迹;右图:与主图谱的模型秩相关(0.903–0.957)和配对方向一致率(86.9%–91.7%)。
直接检验'排名是否绑死在某个嵌入上':局部任务分数大幅改变(任务级秩相关低至0.660),但聚合模型序稳定——这是论文对外部效度问题最诚实的自检,也是理解其局限的关键图。