← 返回 2026-08-18

迈向开放可复现的关系学习:RelArena-α 统一基准、TabPFN-Rel 关系引擎与 RPI 预测接口 Advancing Open and Reproducible Relational Learning: RelArena-α, TabPFN-Rel and RPI

Adrian Hayler, Klemens Flöge, Alan Arazi, Rishabh Ranjan, Jure Leskovec, Felix Birkel, Brendan Roof, Anurag Garg, Kristina Collins, Lydia Sidhoum, Jonas Kübler, Siyuan Guo, Oscar Key, Jan Hendrik Metzen, Rylee Grace, David Salinas, Arthur Cahu, Simon Bing, Benjamin Jäger, Tuana Çelik, Mihir Manium, Vitor Monteiro, Jake Robertson, Jerry Chen, Eliott Kalfon, Tomás Pereda, Lilly Wehrhahn, Dominik Safaric, Tobias Schroeder, Georg Grab, Diana Kriuchkova, Clara Cornu, Philipp Singer, Nick Erickson, Vahid Balazadeh, Marie Salmon, Simone Alessi, Kürşat Kaya, Philipp Jund, Léo Grinsztajn, Yann LeCun, Bernhard Schölkopf, Madelon Hulsebos, Lennart Purucker, Sauraj Gambhir, Frank Hutter, Noah Hollmann 📅 2026-08-17 👍 28 2026-08-23 18:30
TabPFN 关系学习 可复现性 基准测试 开源框架 表格基础模型

开源三件套:统一基准 RelArena-α、榜首基线 TabPFN-Rel 与声明式接口 RPI

前置知识

关系学习(Relational Learning)

在关系数据库(多张通过主键-外键关联的表)上做预测任务的机器学习分支,典型任务如"根据用户的历史行为表预测其是否会点击某广告"。主流做法分两派:一派用图神经网络(GraphSAGE、RelGNN、RelGT)直接在由表构成的图上做消息传递;另一派把多表"扁平化"成一张大表再用表格学习器(LightGBM、TabPFN)预测。

本文正是围绕这两派方法的公平比较展开:RelBench v1 的 21 个实体级预测任务是全文的评测舞台,理解任务定义与两派范式才能读懂为何扁平化的 TabPFN-Rel 能压过 GNN 系方法。

TabPFN 与表格基础模型(TFM)

TabPFN 是一类在海量合成任务上预训练的表格基础模型,推理时不做梯度训练,而是把带标签的"上下文行"与查询行一起送入 Transformer,直接 in-context 地输出预测,类似 LLM 的上下文学习。TabPFN-3 是最新版本,能处理的行数更多、还支持文本列(TabPFN-3-Plus 能力)。

TabPFN-Rel 是本文发布的旗舰模型,本质是"深度特征合成 + TabPFN-3 上下文学习"的组合;理解上下文学习机制才能明白其上下文选择(新近性×多样性)改进为何零成本有效。

深度特征合成(Deep Feature Synthesis)

featuretools 库提出的自动化特征工程方法:沿数据库 schema 中主键-外键构成的路径,对相关表的行做聚合(COUNT、MEAN、MAX 等)生成特征。深度 1 聚合直接相邻表(如 COUNT(results)),深度 2 跨两跳(如 MEAN(results.races.round)),路径数随深度指数增长。

这是 TabPFN-Rel 与 RDBLearn 把关系数据库变成单表的核心手段;论文发现调参只搜聚合深度 $d \in \{2,3,4\}$ 且默认最浅深度已具竞争力,直接关系到该指数级开销能否砍掉。

Elo 评分与 Bradley-Terry 模型

Elo 起源于国际象棋的相对实力评分,Bradley-Terry 模型用最大似然从成对胜负数据拟合各方法的强度参数,两者结合可把逐任务的 pairwise 胜负汇总成一个全局分数:分数差 $\Delta E$ 对应胜率 $1/(1+10^{-\Delta E/400})$,400 分差距约等于 91% 胜率。语言模型社区(如 Chatbot Arena)和表格基准 TabArena 均用它做聚合。

RelArena-α 用 Elo 解决关系学习"聚合标准各自为政"的乱象(回归任务有人用 $R^2$、有人用不同参考模型归一化的 MAE),读懂 Elo 才能正确解读论文的主榜单 Figure 2。

RelBench 基准与评估协议

RelBench 是关系学习最广泛使用的基准,v1 含 21 个实体级预测任务(分类报 ROC AUC,回归报 MAE)。其官方协议把数据库冻结在一个固定测试截断点,测试实体之间互不可见标签;但方法若不使用 RelBench 的数据加载逻辑,就可能在实体自己的时间戳处读取数据库,从而获得截断点之后数年的额外信息。

论文指出 KumoRFM-2 与 relational transformer 系列正是在 rel-f1 上吃了这种协议差异的红利(重评后 ROC AUC 降超 10 点、MAE 升超 40%),这是全文批判与重建基准的出发点。

研究动机

作者对 RelBench v1 上全部已报告方法做系统审计,发现五个交织的问题。一,不可复现:RelGNN 逐任务配置在 9 个维度上变化、隐含超 25,000 种组合的搜索空间,KumoRFM-2 在 5 个维度上诱导 384 种组合,但调参过程均无文档。二,不可比:rel-f1 测试时间戳跨度 3–6 年,KumoRFM-2 与 relational transformer 系列在实体时间戳处读库,获得固定截断点后数年的额外信号,改用官方协议重评后两个分类任务 ROC AUC 降超 10 点、回归 MAE 升超 40%;2026 年初 rel-event/user-ignore 的时序泄漏修复使受影响方法 ROC AUC 一致降 2–6 点。三,聚合标准缺失:回归任务被不同参考模型归一化的 MAE、原始均值、几何均值、$R^2$、胜场数等互不兼容地汇总,多篇论文还丢弃 21 个任务中的 3–6 个。四,务实基线被弱化甚至出错:RelBench v2 自动补全任务的 LightGBM 基线测试时只收到 NaN,得到 50% ROC AUC 与负 $R^2$。五,论文到实践无通路:唯一的预测查询语言 PQL 实现专有,且无法表达 rel-avito/user-clicks 等需多跳聚合的任务。

本文的目标是论文目标是发布开源三件套,系统性修复上述五个问题。第一,RelArena-α 在 RelBench v1 的 21 个实体级预测任务上统一数据加载、评估协议与调参预算:借鉴 TabArena 的做法,把提交分为遵循标准化调参(随机/网格搜索 + 验证集早停)的 model 提交和自带调参策略的 system 提交,经统一模型 API 重跑所有方法(作者投入数百 GPU 小时),并用 bencheval 计算带自助置信区间的 Elo、平均排名、临界差异图、胜率矩阵。第二,TabPFN-Rel 是为 TabPFN-3 定制的关系引擎,以 1821 的 Elo 排名模型榜第一,证明把关系数据库扁平化成单表仍是极具竞争力的务实路线。第三,RPI 用纯 YAML 声明式配置定义数据库与预测任务,用户两行代码即可在自己的数据库上运行 RelArena-α 中任何模型,配套完整文档、agent skill、全部 21 个任务的示例配置与 Kaggle 示例。作者希望以 α 版本吸引社区反馈,把关系学习推向非教条的开放协作轨道。

与已有工作不同的是,独特切入角度在于:这是第一个不提出新模型架构、而是先对整个领域做审计式体检再动手建基础设施的工作。作者逐项检查了 GraphSAGE、RelGNN、RelGT、KumoRFM(-2)、RT、PluRel、RT-J、RDBLearn 等方法的代码可得性、逐任务调参、调参文档、搜索空间大小、评估协议、聚合方式、任务覆盖和可安装性(Table 1),并坦承自己近期论文也曾复制自报基线,从而把"社区惯例有问题"上升为需要制度性解决的公共品问题。方法论上,他们把表格学习社区经过验证的基准工程(TabArena 的 bencheval、Bradley-Terry Elo、临界差异图)整体迁移到关系学习,并首创 model/system 双轨提交制度:model 提交锁死随机/网格搜索与统一搜索空间以隔离方法论增益,system 提交(如 RT-PluRel 的顺序调参)允许自由调参以追踪端到端最优管线,既不压制调参创新又保证科学结论可靠。此外,作者主动披露"既发基准又参评"的利益冲突,靠全开源让一切设计选择可被独立审查——这种透明度在基准论文中相当罕见。

核心方法

直觉上,关系学习缺的不是新模型,而是让所有模型站在同一起跑线的"竞技场"和把数据库变成预测任务的"入口"。技术路线上 RelArena-α 是核心框架:运行时经 RelBench 拉取全部 21 个实体级预测任务的数据库(不重分发数据,遵守各自许可证),所有方法通过统一模型 API 完成拟合与评估,保证训练、调参、评估看到完全相同的数据状态(含 2026 年初 rel-event/user-ignore 的泄漏修复版);model 提交用文档化搜索空间做随机/网格搜索,system 提交自带调参但必须遵守同一数据状态与评估协议。结果表交给 TabArena 的 bencheval 包,用 Bradley-Terry 最大似然拟合 pairwise 胜负得到 Elo(锚定 constant-global 为 1000 分,400 分差距约 91% 胜率),并输出平均排名、临界差异图、胜率矩阵。TabPFN-Rel 是旗舰基线:先深度特征合成把多表压平成单表,再由 TabPFN-3 上下文学习直接预测。RPI 把定义任务从写 Python 换成写 YAML,输出 RelArena-α 任务。三者分别对应"可比"、"强基线"、"可落地"。

核心创新有三处。第一,model/system 双轨制:过去基准要么禁止自定义调参(压制创新),要么放任自流(比较被混淆),RelArena-α 用同一输入输出与时间约束下的两条榜单同时回答"纯方法论谁强"和"端到端管线谁强",是对 RelGNN 隐含 25,000+ 组合搜索空间却无文档这类乱象的制度性改进。第二,TabPFN-Rel 相对 RDBLearn 的四项实质改动:修复调参期的数据漂移,使内层分割像外层评估一样在验证截断点冻结数据库;喂入 TFM 的行数提高一个数量级并统一到更可扩展的 TabPFN-3 骨干(同时消掉 RDBLearn 在三个 TFM 骨干间选择的调参轴);featuretools 预处理后重挂实体表文本列,利用 TabPFN-3-Plus 的文本能力(仅 API 版,另发布无文本 OSS 版);用兼顾新近性与多样性的上下文选择替代随机子采样,并在测试时把验证样本并入上下文。第三,RPI 把 RelBench 任务生成声明式化——YAML 描述数据库与任务即可两行代码调用任何模型,填补 scikit-learn/HuggingFace 式统一接口在关系学习中的空白。

方法步骤详情

流程分四步。步骤一(数据接入):运行时经 RelBench 拉取 rel-f1、rel-avito、rel-stack 等数据库,锁定含时序泄漏修复的统一数据状态。步骤二(特征化与拟合,以 TabPFN-Rel 为例):先用 featuretools 沿主键-外键路径做深度特征合成生成扁平表,深度 $d \in \{2,3,4\}$ 按验证集调参;预处理后重挂实体表文本列(API 版),TabPFN-3 从带标签的上下文行 in-context 预测查询行,上下文按新近性与多样性权衡选取,测试时把验证样本也并入上下文。其余 model 提交(GraphSAGE、RelGT、RelGNN、RDBLearn)走同一 API,按文档化搜索空间做随机/网格搜索,预算按调参算力大致对齐(附录 B)。步骤三(评估):所有方法在相同测试截断点与数据状态下输出 21 个任务的 ROC AUC(分类)与 MAE(回归)。步骤四(聚合):结果表送入 bencheval,用 Bradley-Terry 拟合 pairwise 胜负得 Elo,constant-global 锚定 1000 分,附自助置信区间、平均排名与临界差异图;RT-PluRel 作为 system 提交单独标识。RPI 侧由用户写 YAML 声明数据库与任务后,两行代码调用任意模型。

技术新颖性

(1) 首次在关系学习中对全部已报告方法做统一重跑——此前社区普遍复制自报数字,作者花数百 GPU 小时重建缺失训练脚本、修 bug、对齐 API,这套基线数据本身即是新贡献。(2) model/system 提交的形式化是首个把"调参是否标准化"显式编码进基准规则的方案,可在同一框架内隔离方法论增益与端到端管线增益。(3) Elo + bencheval 的聚合标准直接解决回归任务归一化各自为政(LightGBM/RDL/AutoGluon/RelGT 归一、$R^2$、几何均值等)的乱象,并与 LM 社区的 Elo 传统接轨。(4) TabPFN-Rel 的上下文选择机制(新近性×多样性权衡 + 验证样本复用)是零额外运行成本的改进,验证样本复用对时序预测尤其合理——更近的验证样本往往信息量更大。(5) 调参实验(Figure 3)发现多数方法调参无可靠收益、TabPFN-Rel 默认最浅深度 $d{=}2$ 即具竞争力,暗示深度特征合成的指数级物化开销可大幅削减,这是把"调参科学"引入关系学习的开端。代价是单种子榜单与未完全对齐的运行时间。

The TabPFN-Rel harness, illustrated on rel-f1/driver-top3.
Figure 1: The TabPFN-Rel harness, illustrated on rel-f1/driver-top3.

实验结果

(1) Elo 主榜(Figure 2):模型榜 TabPFN-Rel (API) 1821 分居首,OSS 版 1706,GraphSAGE 1658,RelGT 1575,RDBLearn 1548,RelGNN 1506,constant-per-entity 1256,constant-global 锚定 1000;加入 system 后 RT-PluRel 以 1861 登顶。扁平化表格方法整体压制 GNN 系。(2) 文本消融:去文本使 TabPFN-Rel 从 1821 跌至 1706,115 分跌幅超过 GraphSAGE 与 RelGT 约 83 分的差距,且几乎全部来自含自由文本列的 rel-event/user-ignore 与 rel-avito/user-clicks。(3) 常数预测器惊人地强:constant-per-entity(无特征无模型)在 4 个任务上胜过 RelGNN、另 4 个胜过 RelGT;全榜只有 TabPFN-Rel 与 RT-PluRel 在全部 21 个任务上超越它;rel-stack/post-votes 上几乎无方法显著更优。(4) 成本:单种子榜单耗数百小时墙钟;剔除预处理后 RT-PluRel 平均比 TabPFN-Rel (API) 慢 5 倍、比 OSS 版慢 30 倍;TabPFN-Rel 的 CPU 特征合成可能主导自身耗时。(5) 可调性(Figure 3):RelGNN 调参收益显著,GraphSAGE 较小,其余多数方法无可靠改进;TabPFN-Rel 默认 $d{=}2$ 已与验证选优的更深配置相当,指数级物化成本或可省去。

Reproducibility and comparability of methods reporting RelBench v1 results.
Table 1: Reproducibility and comparability of methods reporting RelBench v1 results.
Runtimes of RelArena-α (Appendix B).
Table 2: Runtimes of RelArena-α (Appendix B).
Per-task scores including the trivial LightGBM baseline (Appendix D).
Table 4: Per-task scores including the trivial LightGBM baseline (Appendix D).
Per-task scores including the constant predictors (Appendix D).
Table 5: Per-task scores including the constant predictors (Appendix D).
Tuning improvement breakdown per method (Appendix).
Table 6: Tuning improvement breakdown per method (Appendix).
Elo over the 21 RelArena-α tasks: the model leaderboard (left) and the combined model + system leaderboard (right).
Figure 2: Elo over the 21 RelArena-α tasks: the model leaderboard (left) and the combined model + system leaderboard (right).
Improvement of each method's tuned configuration over its own default.
Figure 3: Improvement of each method's tuned configuration over its own default.
查看结构化数据
任务指标本文基线提升
RelArena-α 21 个实体级预测任务(模型榜) Elo(Bradley-Terry,锚定 1000) TabPFN-Rel (API) 1821;TabPFN-Rel (OSS) 1706 GraphSAGE 1658;RDBLearn 1548;RelGT 1575;RelGNN 1506 较最强 GNN 基线 GraphSAGE 高 163 分;较 RelGNN 高 315 分
模型 + 系统综合榜 Elo RT-PluRel(system 提交)1861;TabPFN-Rel (API) 1826 统一调参下的模型榜首 TabPFN-Rel(模型榜口径 1821) 端到端最优,但运行时间平均比 TabPFN-Rel (API) 慢 5 倍、比 (OSS) 慢 30 倍
文本特征消融(集中于 rel-event/user-ignore、rel-avito/user-clicks) Elo 带文本的 API 版 1821 无文本的 OSS 版 1706 文本贡献 115 分,超过 GraphSAGE 与 RelGT 之间约 83 分的差距
与无学习常数预测器的逐任务对比 逐任务胜负数 / 显著性 仅 TabPFN-Rel 与 RT-PluRel 在全部 21 个任务上超越 constant-per-entity constant-per-entity(Elo 1256,仅用训练历史输出每实体最优常数) 该常数预测器在 4 个任务上分别胜过 RelGNN 与 RelGT;rel-stack/post-votes 上几乎无方法显著更优
调参敏感性(全部方法 × 21 任务) 调优配置相对默认配置的提升(%) RelGNN 获益显著,GraphSAGE 较小,TabPFN-Rel/RDBLearn/RelGT 无可靠改进 各方法默认超参配置 TabPFN-Rel 默认 $d{=}2$ 已接近验证选优结果,提示可砍掉指数级特征物化成本

局限与改进

作者承认的局限:单种子评估;调参预算虽对齐但运行时间方差仍大,可能偏袒昂贵方法;"既发基准又发模型"存在结构性利益冲突,只能靠开源透明缓解;只覆盖 RelBench v1 的 21 个实体级预测任务,推荐、属性预测、外键预测、自动补全等任务类型未纳入;时间戳边界不统一——GNN 系与 RT-PluRel 在截断点与实体时间戳对齐时把测试时间戳处的行作额外上下文,TabPFN-Rel 与 RDBLearn 不用,作者坦言不清楚其合法性与影响量级;缺少"自动特征工程 + 传统表格学习器"的更强扁平化基线,RDBLearn 评测剔除非 PyPI 包 LimiX 可能略削弱其配置,v1.1 也晚于基线截止日未评。我的补充观察:Elo 只编码相对胜负、不编码运行成本,1821 分的 API 版依赖闭源模型与文本能力,OSS 版即掉 115 分,实践者需在分数与可控性间权衡;榜单建立在 RelBench v1 数据质量未受系统审查的前提上,rel-f1 跨年测试时间戳这类任务设计本身是否合理,作者也留作开放问题。

独立分析的弱点

(1) 单种子 + Elo 的统计功效有限,bootstrap 只能部分缓解,且 Bradley-Terry 拟合未建模任务间胜负的相关性(同一数据库上的任务高度相关),改进方向是多种子重跑并按数据库分层拟合。(2) 运行时间不在排名内,Elo 接近的方法实际成本可差数十倍(RT-PluRel 慢 5–30 倍),应并行发布"成本归一化"分数或帕累托前沿图,否则实践者无法做性价比决策。(3) 调参只做到"算力大致匹配",而 Figure 3 显示多数方法调参无益,说明搜索空间可能过小或方向错误,应按方法运行时间比例缩放试验数并公开敏感性曲线。(4) 文本能力绑定闭源 API,OSS 版与 API 版同榜(1706 vs 1821)易被误读为同一系统波动,建议分榜或强制标注。(5) RPI 高表达、少防护,YAML 误配(如泄漏性时间截断)要等社区用久才暴露,可加静态泄漏检查器自动审查任务配置。(6) constant-per-entity 能在 4 个任务上胜过 RelGNN/RelGT,暗示这些任务对强方法不敏感,应逐任务审计数据质量与可分性,而非只做总量聚合。

未来方向

作者提出的方向:与学术和开源社区合作扩充 RelArena-α 基线并进一步标准化调参;把框架扩展到推荐、实体属性预测、关系属性预测、外键预测、自动补全等更多任务类型,前提是先弄清哪些任务类型对应实践者的真实需求;审计 RelBench 底层数据库与任务质量;统一各方法的时间戳边界语义;持续降低运行成本(尤其 CPU 密集的预处理);把 RPI 的规范标准与另一独立团队的实体级预测任务接口工作合并;TabPFN-Rel 将与后续模型版本协同演进。基于本文成果可延伸的方向:结合 Figure 3 的发现研究"浅层特征合成 + 更强上下文学习"的廉价管线,把深度 2 之外的物化开销省掉;把关系基础模型(RT 系)与扁平化表格管线融合、各取所长——作者称之为该领域最激动人心的开放问题;在 Elo 框架内加入成本维度,发展多目标基准方法学;利用 RPI 的声明式规范做自动泄漏检测与任务正确性验证,甚至让 LLM agent 直接从数据库 schema 生成任务配置(发布已附带 agent skill,这是自然延伸)。

复现评估

三个组件全部开源,仓库为 https://github.com/PriorLabs/relarena。RelArena-α 不重分发数据,运行时经 RelBench 拉取并遵守各自许可证(附录 G),数据获取零门槛。TabPFN-Rel 提供 API 版(依赖托管模型,支持文本)与完全本地可跑但无文本的 OSS 版;RDBLearn v1 评剔除了非 PyPI 的 LimiX 并说明理由,RT-PluRel 的顺序调参协议在附录 F 公开。主要门槛是算力:完整单种子榜单耗数百小时墙钟,部分数据集上某些方法慢到不实用,TabPFN-Rel 的 CPU 特征合成可能主导耗时;但复现个别方法或少数任务单机可行。文档完善:贡献新基线有流程文档与 agent skill,RPI 附全部 21 个任务的 YAML 示例与 Kaggle 示例,附录 B 详述调参协议、附录 D 提供重跑数据。总体难度中等偏高:可得性极好,但算力紧张的团队难以复现全榜,建议从 TabPFN-Rel (OSS) 加少量任务起步。