迈向开放可复现的关系学习:RelArena-α 统一基准、TabPFN-Rel 关系引擎与 RPI 预测接口 Advancing Open and Reproducible Relational Learning: RelArena-α, TabPFN-Rel and RPI
开源三件套:统一基准 RelArena-α、榜首基线 TabPFN-Rel 与声明式接口 RPI
前置知识
关系学习(Relational Learning)
在关系数据库(多张通过主键-外键关联的表)上做预测任务的机器学习分支,典型任务如"根据用户的历史行为表预测其是否会点击某广告"。主流做法分两派:一派用图神经网络(GraphSAGE、RelGNN、RelGT)直接在由表构成的图上做消息传递;另一派把多表"扁平化"成一张大表再用表格学习器(LightGBM、TabPFN)预测。
本文正是围绕这两派方法的公平比较展开:RelBench v1 的 21 个实体级预测任务是全文的评测舞台,理解任务定义与两派范式才能读懂为何扁平化的 TabPFN-Rel 能压过 GNN 系方法。
TabPFN 与表格基础模型(TFM)
TabPFN 是一类在海量合成任务上预训练的表格基础模型,推理时不做梯度训练,而是把带标签的"上下文行"与查询行一起送入 Transformer,直接 in-context 地输出预测,类似 LLM 的上下文学习。TabPFN-3 是最新版本,能处理的行数更多、还支持文本列(TabPFN-3-Plus 能力)。
TabPFN-Rel 是本文发布的旗舰模型,本质是"深度特征合成 + TabPFN-3 上下文学习"的组合;理解上下文学习机制才能明白其上下文选择(新近性×多样性)改进为何零成本有效。
深度特征合成(Deep Feature Synthesis)
featuretools 库提出的自动化特征工程方法:沿数据库 schema 中主键-外键构成的路径,对相关表的行做聚合(COUNT、MEAN、MAX 等)生成特征。深度 1 聚合直接相邻表(如 COUNT(results)),深度 2 跨两跳(如 MEAN(results.races.round)),路径数随深度指数增长。
这是 TabPFN-Rel 与 RDBLearn 把关系数据库变成单表的核心手段;论文发现调参只搜聚合深度 $d \in \{2,3,4\}$ 且默认最浅深度已具竞争力,直接关系到该指数级开销能否砍掉。
Elo 评分与 Bradley-Terry 模型
Elo 起源于国际象棋的相对实力评分,Bradley-Terry 模型用最大似然从成对胜负数据拟合各方法的强度参数,两者结合可把逐任务的 pairwise 胜负汇总成一个全局分数:分数差 $\Delta E$ 对应胜率 $1/(1+10^{-\Delta E/400})$,400 分差距约等于 91% 胜率。语言模型社区(如 Chatbot Arena)和表格基准 TabArena 均用它做聚合。
RelArena-α 用 Elo 解决关系学习"聚合标准各自为政"的乱象(回归任务有人用 $R^2$、有人用不同参考模型归一化的 MAE),读懂 Elo 才能正确解读论文的主榜单 Figure 2。
RelBench 基准与评估协议
RelBench 是关系学习最广泛使用的基准,v1 含 21 个实体级预测任务(分类报 ROC AUC,回归报 MAE)。其官方协议把数据库冻结在一个固定测试截断点,测试实体之间互不可见标签;但方法若不使用 RelBench 的数据加载逻辑,就可能在实体自己的时间戳处读取数据库,从而获得截断点之后数年的额外信息。
论文指出 KumoRFM-2 与 relational transformer 系列正是在 rel-f1 上吃了这种协议差异的红利(重评后 ROC AUC 降超 10 点、MAE 升超 40%),这是全文批判与重建基准的出发点。
研究动机
作者对 RelBench v1 上全部已报告方法做系统审计,发现五个交织的问题。一,不可复现:RelGNN 逐任务配置在 9 个维度上变化、隐含超 25,000 种组合的搜索空间,KumoRFM-2 在 5 个维度上诱导 384 种组合,但调参过程均无文档。二,不可比:rel-f1 测试时间戳跨度 3–6 年,KumoRFM-2 与 relational transformer 系列在实体时间戳处读库,获得固定截断点后数年的额外信号,改用官方协议重评后两个分类任务 ROC AUC 降超 10 点、回归 MAE 升超 40%;2026 年初 rel-event/user-ignore 的时序泄漏修复使受影响方法 ROC AUC 一致降 2–6 点。三,聚合标准缺失:回归任务被不同参考模型归一化的 MAE、原始均值、几何均值、$R^2$、胜场数等互不兼容地汇总,多篇论文还丢弃 21 个任务中的 3–6 个。四,务实基线被弱化甚至出错:RelBench v2 自动补全任务的 LightGBM 基线测试时只收到 NaN,得到 50% ROC AUC 与负 $R^2$。五,论文到实践无通路:唯一的预测查询语言 PQL 实现专有,且无法表达 rel-avito/user-clicks 等需多跳聚合的任务。
本文的目标是论文目标是发布开源三件套,系统性修复上述五个问题。第一,RelArena-α 在 RelBench v1 的 21 个实体级预测任务上统一数据加载、评估协议与调参预算:借鉴 TabArena 的做法,把提交分为遵循标准化调参(随机/网格搜索 + 验证集早停)的 model 提交和自带调参策略的 system 提交,经统一模型 API 重跑所有方法(作者投入数百 GPU 小时),并用 bencheval 计算带自助置信区间的 Elo、平均排名、临界差异图、胜率矩阵。第二,TabPFN-Rel 是为 TabPFN-3 定制的关系引擎,以 1821 的 Elo 排名模型榜第一,证明把关系数据库扁平化成单表仍是极具竞争力的务实路线。第三,RPI 用纯 YAML 声明式配置定义数据库与预测任务,用户两行代码即可在自己的数据库上运行 RelArena-α 中任何模型,配套完整文档、agent skill、全部 21 个任务的示例配置与 Kaggle 示例。作者希望以 α 版本吸引社区反馈,把关系学习推向非教条的开放协作轨道。
与已有工作不同的是,独特切入角度在于:这是第一个不提出新模型架构、而是先对整个领域做审计式体检再动手建基础设施的工作。作者逐项检查了 GraphSAGE、RelGNN、RelGT、KumoRFM(-2)、RT、PluRel、RT-J、RDBLearn 等方法的代码可得性、逐任务调参、调参文档、搜索空间大小、评估协议、聚合方式、任务覆盖和可安装性(Table 1),并坦承自己近期论文也曾复制自报基线,从而把"社区惯例有问题"上升为需要制度性解决的公共品问题。方法论上,他们把表格学习社区经过验证的基准工程(TabArena 的 bencheval、Bradley-Terry Elo、临界差异图)整体迁移到关系学习,并首创 model/system 双轨提交制度:model 提交锁死随机/网格搜索与统一搜索空间以隔离方法论增益,system 提交(如 RT-PluRel 的顺序调参)允许自由调参以追踪端到端最优管线,既不压制调参创新又保证科学结论可靠。此外,作者主动披露"既发基准又参评"的利益冲突,靠全开源让一切设计选择可被独立审查——这种透明度在基准论文中相当罕见。
核心方法
直觉上,关系学习缺的不是新模型,而是让所有模型站在同一起跑线的"竞技场"和把数据库变成预测任务的"入口"。技术路线上 RelArena-α 是核心框架:运行时经 RelBench 拉取全部 21 个实体级预测任务的数据库(不重分发数据,遵守各自许可证),所有方法通过统一模型 API 完成拟合与评估,保证训练、调参、评估看到完全相同的数据状态(含 2026 年初 rel-event/user-ignore 的泄漏修复版);model 提交用文档化搜索空间做随机/网格搜索,system 提交自带调参但必须遵守同一数据状态与评估协议。结果表交给 TabArena 的 bencheval 包,用 Bradley-Terry 最大似然拟合 pairwise 胜负得到 Elo(锚定 constant-global 为 1000 分,400 分差距约 91% 胜率),并输出平均排名、临界差异图、胜率矩阵。TabPFN-Rel 是旗舰基线:先深度特征合成把多表压平成单表,再由 TabPFN-3 上下文学习直接预测。RPI 把定义任务从写 Python 换成写 YAML,输出 RelArena-α 任务。三者分别对应"可比"、"强基线"、"可落地"。
核心创新有三处。第一,model/system 双轨制:过去基准要么禁止自定义调参(压制创新),要么放任自流(比较被混淆),RelArena-α 用同一输入输出与时间约束下的两条榜单同时回答"纯方法论谁强"和"端到端管线谁强",是对 RelGNN 隐含 25,000+ 组合搜索空间却无文档这类乱象的制度性改进。第二,TabPFN-Rel 相对 RDBLearn 的四项实质改动:修复调参期的数据漂移,使内层分割像外层评估一样在验证截断点冻结数据库;喂入 TFM 的行数提高一个数量级并统一到更可扩展的 TabPFN-3 骨干(同时消掉 RDBLearn 在三个 TFM 骨干间选择的调参轴);featuretools 预处理后重挂实体表文本列,利用 TabPFN-3-Plus 的文本能力(仅 API 版,另发布无文本 OSS 版);用兼顾新近性与多样性的上下文选择替代随机子采样,并在测试时把验证样本并入上下文。第三,RPI 把 RelBench 任务生成声明式化——YAML 描述数据库与任务即可两行代码调用任何模型,填补 scikit-learn/HuggingFace 式统一接口在关系学习中的空白。
方法步骤详情
流程分四步。步骤一(数据接入):运行时经 RelBench 拉取 rel-f1、rel-avito、rel-stack 等数据库,锁定含时序泄漏修复的统一数据状态。步骤二(特征化与拟合,以 TabPFN-Rel 为例):先用 featuretools 沿主键-外键路径做深度特征合成生成扁平表,深度 $d \in \{2,3,4\}$ 按验证集调参;预处理后重挂实体表文本列(API 版),TabPFN-3 从带标签的上下文行 in-context 预测查询行,上下文按新近性与多样性权衡选取,测试时把验证样本也并入上下文。其余 model 提交(GraphSAGE、RelGT、RelGNN、RDBLearn)走同一 API,按文档化搜索空间做随机/网格搜索,预算按调参算力大致对齐(附录 B)。步骤三(评估):所有方法在相同测试截断点与数据状态下输出 21 个任务的 ROC AUC(分类)与 MAE(回归)。步骤四(聚合):结果表送入 bencheval,用 Bradley-Terry 拟合 pairwise 胜负得 Elo,constant-global 锚定 1000 分,附自助置信区间、平均排名与临界差异图;RT-PluRel 作为 system 提交单独标识。RPI 侧由用户写 YAML 声明数据库与任务后,两行代码调用任意模型。
技术新颖性
(1) 首次在关系学习中对全部已报告方法做统一重跑——此前社区普遍复制自报数字,作者花数百 GPU 小时重建缺失训练脚本、修 bug、对齐 API,这套基线数据本身即是新贡献。(2) model/system 提交的形式化是首个把"调参是否标准化"显式编码进基准规则的方案,可在同一框架内隔离方法论增益与端到端管线增益。(3) Elo + bencheval 的聚合标准直接解决回归任务归一化各自为政(LightGBM/RDL/AutoGluon/RelGT 归一、$R^2$、几何均值等)的乱象,并与 LM 社区的 Elo 传统接轨。(4) TabPFN-Rel 的上下文选择机制(新近性×多样性权衡 + 验证样本复用)是零额外运行成本的改进,验证样本复用对时序预测尤其合理——更近的验证样本往往信息量更大。(5) 调参实验(Figure 3)发现多数方法调参无可靠收益、TabPFN-Rel 默认最浅深度 $d{=}2$ 即具竞争力,暗示深度特征合成的指数级物化开销可大幅削减,这是把"调参科学"引入关系学习的开端。代价是单种子榜单与未完全对齐的运行时间。
实验结果
(1) Elo 主榜(Figure 2):模型榜 TabPFN-Rel (API) 1821 分居首,OSS 版 1706,GraphSAGE 1658,RelGT 1575,RDBLearn 1548,RelGNN 1506,constant-per-entity 1256,constant-global 锚定 1000;加入 system 后 RT-PluRel 以 1861 登顶。扁平化表格方法整体压制 GNN 系。(2) 文本消融:去文本使 TabPFN-Rel 从 1821 跌至 1706,115 分跌幅超过 GraphSAGE 与 RelGT 约 83 分的差距,且几乎全部来自含自由文本列的 rel-event/user-ignore 与 rel-avito/user-clicks。(3) 常数预测器惊人地强:constant-per-entity(无特征无模型)在 4 个任务上胜过 RelGNN、另 4 个胜过 RelGT;全榜只有 TabPFN-Rel 与 RT-PluRel 在全部 21 个任务上超越它;rel-stack/post-votes 上几乎无方法显著更优。(4) 成本:单种子榜单耗数百小时墙钟;剔除预处理后 RT-PluRel 平均比 TabPFN-Rel (API) 慢 5 倍、比 OSS 版慢 30 倍;TabPFN-Rel 的 CPU 特征合成可能主导自身耗时。(5) 可调性(Figure 3):RelGNN 调参收益显著,GraphSAGE 较小,其余多数方法无可靠改进;TabPFN-Rel 默认 $d{=}2$ 已与验证选优的更深配置相当,指数级物化成本或可省去。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| RelArena-α 21 个实体级预测任务(模型榜) | Elo(Bradley-Terry,锚定 1000) | TabPFN-Rel (API) 1821;TabPFN-Rel (OSS) 1706 | GraphSAGE 1658;RDBLearn 1548;RelGT 1575;RelGNN 1506 | 较最强 GNN 基线 GraphSAGE 高 163 分;较 RelGNN 高 315 分 |
| 模型 + 系统综合榜 | Elo | RT-PluRel(system 提交)1861;TabPFN-Rel (API) 1826 | 统一调参下的模型榜首 TabPFN-Rel(模型榜口径 1821) | 端到端最优,但运行时间平均比 TabPFN-Rel (API) 慢 5 倍、比 (OSS) 慢 30 倍 |
| 文本特征消融(集中于 rel-event/user-ignore、rel-avito/user-clicks) | Elo | 带文本的 API 版 1821 | 无文本的 OSS 版 1706 | 文本贡献 115 分,超过 GraphSAGE 与 RelGT 之间约 83 分的差距 |
| 与无学习常数预测器的逐任务对比 | 逐任务胜负数 / 显著性 | 仅 TabPFN-Rel 与 RT-PluRel 在全部 21 个任务上超越 constant-per-entity | constant-per-entity(Elo 1256,仅用训练历史输出每实体最优常数) | 该常数预测器在 4 个任务上分别胜过 RelGNN 与 RelGT;rel-stack/post-votes 上几乎无方法显著更优 |
| 调参敏感性(全部方法 × 21 任务) | 调优配置相对默认配置的提升(%) | RelGNN 获益显著,GraphSAGE 较小,TabPFN-Rel/RDBLearn/RelGT 无可靠改进 | 各方法默认超参配置 | TabPFN-Rel 默认 $d{=}2$ 已接近验证选优结果,提示可砍掉指数级特征物化成本 |
局限与改进
作者承认的局限:单种子评估;调参预算虽对齐但运行时间方差仍大,可能偏袒昂贵方法;"既发基准又发模型"存在结构性利益冲突,只能靠开源透明缓解;只覆盖 RelBench v1 的 21 个实体级预测任务,推荐、属性预测、外键预测、自动补全等任务类型未纳入;时间戳边界不统一——GNN 系与 RT-PluRel 在截断点与实体时间戳对齐时把测试时间戳处的行作额外上下文,TabPFN-Rel 与 RDBLearn 不用,作者坦言不清楚其合法性与影响量级;缺少"自动特征工程 + 传统表格学习器"的更强扁平化基线,RDBLearn 评测剔除非 PyPI 包 LimiX 可能略削弱其配置,v1.1 也晚于基线截止日未评。我的补充观察:Elo 只编码相对胜负、不编码运行成本,1821 分的 API 版依赖闭源模型与文本能力,OSS 版即掉 115 分,实践者需在分数与可控性间权衡;榜单建立在 RelBench v1 数据质量未受系统审查的前提上,rel-f1 跨年测试时间戳这类任务设计本身是否合理,作者也留作开放问题。
独立分析的弱点
(1) 单种子 + Elo 的统计功效有限,bootstrap 只能部分缓解,且 Bradley-Terry 拟合未建模任务间胜负的相关性(同一数据库上的任务高度相关),改进方向是多种子重跑并按数据库分层拟合。(2) 运行时间不在排名内,Elo 接近的方法实际成本可差数十倍(RT-PluRel 慢 5–30 倍),应并行发布"成本归一化"分数或帕累托前沿图,否则实践者无法做性价比决策。(3) 调参只做到"算力大致匹配",而 Figure 3 显示多数方法调参无益,说明搜索空间可能过小或方向错误,应按方法运行时间比例缩放试验数并公开敏感性曲线。(4) 文本能力绑定闭源 API,OSS 版与 API 版同榜(1706 vs 1821)易被误读为同一系统波动,建议分榜或强制标注。(5) RPI 高表达、少防护,YAML 误配(如泄漏性时间截断)要等社区用久才暴露,可加静态泄漏检查器自动审查任务配置。(6) constant-per-entity 能在 4 个任务上胜过 RelGNN/RelGT,暗示这些任务对强方法不敏感,应逐任务审计数据质量与可分性,而非只做总量聚合。
未来方向
作者提出的方向:与学术和开源社区合作扩充 RelArena-α 基线并进一步标准化调参;把框架扩展到推荐、实体属性预测、关系属性预测、外键预测、自动补全等更多任务类型,前提是先弄清哪些任务类型对应实践者的真实需求;审计 RelBench 底层数据库与任务质量;统一各方法的时间戳边界语义;持续降低运行成本(尤其 CPU 密集的预处理);把 RPI 的规范标准与另一独立团队的实体级预测任务接口工作合并;TabPFN-Rel 将与后续模型版本协同演进。基于本文成果可延伸的方向:结合 Figure 3 的发现研究"浅层特征合成 + 更强上下文学习"的廉价管线,把深度 2 之外的物化开销省掉;把关系基础模型(RT 系)与扁平化表格管线融合、各取所长——作者称之为该领域最激动人心的开放问题;在 Elo 框架内加入成本维度,发展多目标基准方法学;利用 RPI 的声明式规范做自动泄漏检测与任务正确性验证,甚至让 LLM agent 直接从数据库 schema 生成任务配置(发布已附带 agent skill,这是自然延伸)。
复现评估
三个组件全部开源,仓库为 https://github.com/PriorLabs/relarena。RelArena-α 不重分发数据,运行时经 RelBench 拉取并遵守各自许可证(附录 G),数据获取零门槛。TabPFN-Rel 提供 API 版(依赖托管模型,支持文本)与完全本地可跑但无文本的 OSS 版;RDBLearn v1 评剔除了非 PyPI 的 LimiX 并说明理由,RT-PluRel 的顺序调参协议在附录 F 公开。主要门槛是算力:完整单种子榜单耗数百小时墙钟,部分数据集上某些方法慢到不实用,TabPFN-Rel 的 CPU 特征合成可能主导耗时;但复现个别方法或少数任务单机可行。文档完善:贡献新基线有流程文档与 agent skill,RPI 附全部 21 个任务的 YAML 示例与 Kaggle 示例,附录 B 详述调参协议、附录 D 提供重跑数据。总体难度中等偏高:可得性极好,但算力紧张的团队难以复现全榜,建议从 TabPFN-Rel (OSS) 加少量任务起步。
论文图表