BDH-CQ:基于循环潜在推理的上下文学习 BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
150M参数模型融合循环记忆与潜在迭代推理,以$0.0007/题刷新ARC成本-精度前沿
前置知识
上下文学习(In-Context Learning, ICL)
模型不经任何梯度更新,仅凭推理时输入中附带的少量示例就掌握新技能的能力。Transformer通过注意力把示例编码进激活,使后续输出遵循示例隐含的模式;本文的模型则改用循环记忆状态逐条累积示例信息,实现同样的“从示例学规则”。
BDH-CQ的核心卖点就是在推理时纯靠演示学会从未见过的任务。理解ICL“无参数更新”这一约束,才能看懂它与测试时训练、转导优化方法的本质区别。
思维链(Chain-of-Thought, CoT)及其代价
CoT让自回归模型先生成中间自然语言推理步骤再给出答案,相当于提供一块“草稿纸”工作区。但每个中间状态都要经离散词表投影、逐token自回归生成、再被读回,推理链越长,token消耗、延迟与推理算力线性上涨。
论文的出发点正是CoT“推理绑定串行叙述”带来的成本问题。理解这一点才能明白作者为什么要走“中间推理不解码为语言”的潜在推理路线,以及$0.0007/题的成本从何而来。
潜在推理(Latent Reasoning)
让模型在连续隐向量空间中反复变换内部状态、只解码最终答案,而不把每一步转成自然语言。代表工作Coconut把上一步的最终隐状态直接回喂为下一步输入;循环深度模型则反复施加同一共享模块。连续状态可同时保存多个候选假设并行探索。
BDH-CQ在结构化潜在工作区 $H_r$ 中迭代计算正是这一范式。论文多处与Coconut、循环深度模型、looped Transformer对比,不懂潜在推理就无法理解这些对比的针对性。
ARC-AGI基准与pass@k指标
ARC每个任务给出少量“输入-输出”彩色网格演示,要求推断变换规则并精确应用到新输入,答案逐格可验证。pass@k表示允许提交k个候选、任一正确即得分;此外还有“严格任务准确率”(该任务所有测试输入全对)与“测试对准确率”(单个输入层面)之分。
本文全部数字(29.5% pass@2、77.92%测试对、18.5个百分点一致性缺口)都建立在这些指标的区别上,不懂区分会误读论文“部分成功”的行为学含义。
BDH架构、循环记忆与线性注意力
BDH(Dragon Hatchling)是后Transformer序列模型:高维正激活、低秩通信(ReLU低秩变换+线性注意力)构成可循环的联想状态,类似快速权重记忆——状态随输入线性修正(最简特例 $S_t = S_{t-1} + U_\theta(D_t)$),无需不断增长的KV缓存。该家族还包含迭代求精解数独的BDH约束求解系统。
BDH-CQ的公式 $S_t = U_\theta(S_{t-1}, D_t)$ 与线性注意力一脉相承,“记忆、适应与推理共用一套计算织物”的说法只有理解BDH才能领会。
成本-精度帕累托前沿
在“每题推理成本×准确率”平面上,帕累托前沿指没有其他系统能在不牺牲精度的情况下更便宜(或同等成本下更准)的点集。ARC Prize官方排行榜按分数-成本平面发布各系统数据点,但成本可能是硬件估算、实测或API定价,口径需要区分。
本文的核心声明是“突破帕累托前沿”,Figure 2的解读完全依赖这一概念;同时作者用自家computed cost对比他人reported cost的口径问题,是批判性阅读本文的关键。
转导式求解器(HRM/TRM)
HRM、TRM等递归求解器在评测ARC时把测试任务的演示对做数据增强并参与优化,每个谜题还配有学习的身份嵌入,预测经多增强投票产生。这相当于“见过考题再做优化”:未见过的新任务必须先做反向传播适应才能评估,ARC Prize统计其成本为$1.48/题(HRM)与$1.76/题(TRM)。
这是BDH-CQ最重要的对照组。只有理解转导范式的特殊性,才能体会本文“无任务ID、无测试时梯度更新、纯演示学习”的差异化主张以及其成本优势的来源。
研究动机
当前最强的推理范式是“思维链+可验证奖励强化学习”:模型先生成大段自然语言中间步骤再作答,配合演示示例可灵活获取新技能。但这条路线把推理与串行叙述绑定——每个中间状态都要经离散词表投影、逐token自回归生成、再被读回,推理链越长,token消耗、延迟和推理算力线性上涨。另一条线上,潜在推理(Coconut、循环深度模型)虽能在连续空间迭代,却与上下文学习长期割裂:CoT语言模型靠生成token分配额外算力,而HRM、TRM等紧凑递归求解器在ARC上采用转导管线——把评测任务的演示对做增强并参与优化、给每个谜题配身份嵌入,未见过的新任务必须先反向传播适应才能评估,成本高达$1.48-$1.76/题;API大模型如GPT 5.6 Luna (Low)达到34.2% pass@2但要$0.040/题。也就是说,“从演示中学新任务”与“在潜在空间迭代求解”此前没有一个便宜、干净的系统把它们合在一起。
本文的目标是本文的目标是构建并系统评测BDH-CQ:一个把上下文学习与循环潜在推理合并进同一计算织物的推理系统。具体要求是:(1)演示在推理时持续更新循环记忆,查询随后在高维结构化潜在工作区中迭代求解,中间推理状态完全不解码为语言;(2)不使用任务标识符、评测任务的演示对不参与训练、推理时不更新任何参数——模型只能靠上下文中的演示学会新变换;(3)在公开ARC-AGI-1评测集400题上按排行榜pass@2约定评测,同时核算每题美元成本,目标是突破既有成本-精度帕累托前沿;(4)用受控ARC式干预回答“模型从演示中学到了什么、规则执行多一致、哪些概念仍困难”,而非只报告总分。最终150M参数配置达成29.5% pass@2、约$0.00070/题的computed cost,效率主张与行为学分析并重。
与已有工作不同的是,独特切入角度在于对“记忆”与“工作区”的功能解耦:BDH-CQ不把演示压缩成单个任务向量,而是逐条顺序摄入,循环状态按 $S_t = U_\theta(S_{t-1}, D_t)$ 演化,承担注意力/快速权重式的上下文关联,同时避免不断增长的显式KV缓存;之后再用固定参数在潜在工作区迭代 $H_{r+1} = F_\theta(H_r, S_K)$ 完成计算。这与Coconut把连续思维塞回自回归token流、与HRM/TRM按谜题做测试时优化的路线都不同:任务信息只经由上下文写入记忆,潜在计算施加变换而不做谜题级适配。作者还把ARC当作可控、可精确验证的行为学基底,提出“演示条件化算子schema”的概念——演示把一个可复用的视觉操作绑定到当前任务——并用冻结模型后的受控任务检验绑定容量、外推、组合与执行一致性。
核心方法
直觉上,BDH-CQ像“先看完例题、再在心里解题”:它先逐条消化K个演示,每消化一条就用固定参数更新一次循环联想记忆 $S_t = U_\theta(S_{t-1}, D_t)$,其中 $D_t$ 是第t条演示的内容;演示读完后,把查询输入 $x^\star$ 与最终记忆 $S_K$ 一起编码为工作区初态 $H_0 = E_\theta(x^\star, S_K)$,随后在工作区 $H_r$ 中迭代R步 $H_{r+1} = F_\theta(H_r, S_K)$——这一阶段纯在连续隐空间进行,不产生任何语言token,单个状态可同时保留多个候选假设——最后由 $\hat{y} = G_\theta(H_R)$ 解码出答案网格。架构上它继承BDH(Dragon Hatchling):高维正激活、ReLU低秩变换与线性注意力组合的后Transformer序列模型,具备循环联想状态。完整评测系统还包括输入变换、候选构造、排序与推理管线;具体维度、更新规则与训练配方保持专有。150M参数配置每题约需0.85 H200 GPU-秒,按$3/H200小时计算约$0.00070/题。
核心创新是让记忆、适应与推理共享一套计算织物,但承担不同角色:$S_t$ 是随证据演化的上下文记忆,负责演示条件化的学习;$H_r$ 是承载当前查询计算的工作区;两者都由同一组固定参数 $\theta$ 驱动,推理时不更新任何参数。与已有方法的本质区别有三:其一,HRM/TRM的ARC管线是转导的——每个增强谜题有身份嵌入、演示参与优化,而BDH-CQ没有任务ID、无测试时训练,未见过的新任务纯靠演示绑定一个可复用视觉算子(作者称之为演示条件化算子schema);其二,Coconut的连续思维仍在自回归token序列内部展开,BDH-CQ则把推理完全移出token流,在结构化多向量工作区中并行保存候选假设;其三,它是首个把这条路线作为完整系统按“分数-成本”平面核算并交由独立黑盒审计的方案——$0.00070/题的成本与29.5% pass@2由Bielik与NYU的合作者在无权重访问下复现。
方法步骤详情
流程分四步。第一步,训练数据构建:在私有策划样本与公开ARC式数据(ARC-AGI-1训练集、RE-ARC、ConceptARC、ARC-Heavy、ARC-GEN100K)的混合集上训练150M参数模型,并施加额外数据增强。第二步,训练目标:任务形如 $T_i = \{(x_{i,j}, y_{i,j})\}_{j=1}^{K_i} \cup \{(x^{test}_{i,q}, y^{test}_{i,q})\}_{q=1}^{Q_i}$,模型在前序示例已并入循环上下文的条件下预测后续输出,要求精确重建目标网格,教会系统“利用前面的例子”。第三步,推理执行:按序摄入K条演示更新记忆 $S$;编码查询得 $H_0$;以推理努力档位(LOW/MEDIUM/HIGH,训练时见过不同潜在推理长度)决定迭代步数R;解码 $\hat{y}$;按排行榜pass@2约定产出最多两个排序候选。第四步,评估协议:ARC-AGI-1公开400题两候选评测;ConceptARC 160题、每题3个测试输入;受控实验在模型冻结后用确定性oracle生成传播/复制/排序/嵌套四族新任务,做外推曲线与short/supported上下文对照,定位失败是外推失败还是执行瓶颈。
技术新颖性
技术新颖性体现在四方面。第一,架构接口层面:把线性注意力式的记忆修正(论文指出 $S_t = S_{t-1} + U_\theta(D_t)$ 是最简特例)与按深度循环的工作区迭代组合成一个系统级接口——此前潜在推理文献(Coconut、循环深度、looped Transformer)要么绑定自回归token流,要么不处理演示学习。第二,评测姿态层面:与HRM($1.48/题)、TRM($1.76/题)的转导优化对照,本文坚持无任务身份、无测试时梯度更新,使“上下文学会”这一主张可被干净检验。第三,方法论层面:冻结模型后用确定性oracle生成受控任务族,单一因子变化传播距离、复制数、序列长度、嵌套深度,并设short/supported上下文对照,把失败精确定位——长度8排序仅3/24输出维度正确(输出构造整体失败),而深度5嵌套全部维度正确、单元格精度超过99.9%(仅单个包含关系出错),这是罕见的细粒度能力解剖。第四,透明度层面:维度与配方专有是短板,但独立黑盒审计与字节级可重复请求(重复运行419/419输入完全一致)提供了可信度支撑。
实验结果
ARC-AGI-1公开400题:pass@1为97/400(24.25%),pass@2为118/400(29.50%,Wilson 95%区间[25.24, 34.15]),测试对pass@2为130/419(31.03%);每题约0.85 H200秒、$0.00070/题,比GPT 5.6 Luna (Low)(34.2%,$0.040/题)便宜约57倍(对方降价80%后仍约11倍),突破既有成本-精度帕累托前沿。ConceptARC:严格任务pass@2为95/160(59.38%,语义ID)与96/160(60.00%,不透明ID),测试对77.92%;家族差异大——ExtendToBoundary、FilledNotFilled、TopBottom2D达9/10,Copy与Order仅2/10(但Copy测试对19/30,能局部正确、不能一致执行)。受控实验:传播与复制在各测试水平均48/48全对;排序长度6为29/36、7为8/24、8为1/24(仅3/24维度正确);嵌套深度5为29/36但维度全对、单元格精度>99.9%;supported演示把深度5嵌套从19/24提到24/24、长度8排序从0/24到13/24。颜色置换绑定2-8个时96/96全对。组合:旋转+重定位72/72、反射+重定位47/72、颜色交换单独26/72且组合0/72。不透明复现聚合不变(96 vs 95)。努力档位:HIGH 29.5%、MEDIUM 27%(省11%)、LOW 21%(省22%);MIN努力111/400($0.000884)vs STANDARD 118/400($0.00265),McNemar $p=0.167$ 不显著;重复请求字节级一致(419/419)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ARC-AGI-1 公开评测集(400题) | pass@2 | 29.50%(118/400),Wilson 95%区间 [25.24, 34.15] | GPT 5.6 Luna (Low) 34.2%($0.040/题);排行榜此前成本-精度帕累托前沿 | 精度低约4.7个百分点,但$0.00070/题便宜约57倍(OpenAI降价80%后仍约11倍),在前沿左外侧建立新成本效率SOTA |
| ARC-AGI-1 公开评测集(419个测试对) | 测试对 pass@2 | 31.03%(130/419),pass@1为25.78%(108/419) | 同系统任务级pass@2为29.50% | 测试对与任务级仅差1.53个百分点,但52/160任务在ConceptARC上呈现部分正确(见一致性分析) |
| ConceptARC(160题/480测试对) | 严格任务 pass@2 / 测试对 pass@2 | 59.38%(95/160,语义ID)/ 60.00%(96/160,不透明ID);测试对77.92%(374/480) | 语义ID vs 密码学不透明ID+概念混合批次的双重复现 | 两条件聚合几乎不变(差1题、配对6对6),排除语义任务ID与概念分组批次的请求侧混淆 |
| 受控传播/复制任务(冻结模型后生成) | held-out输出精确率 | 传播距离2-8与复制1-4个锚点均48/48全对(pass@1与pass@2) | 演示仅覆盖传播距离1-3、复制1-2个 | 在全部测试范围内完全外推,未触及天花板 |
| 受控排序任务(按高度排2-8根柱) | held-out输出精确率 pass@2 | 长度≤5饱和;长度6为29/36,7为8/24,8为1/24(仅3/24输出维度正确) | short上下文0/24;supported上下文(含1个长度8演示)13/24 | 长序列存在输出构造与执行双重瓶颈,演示支持可恢复13/24 |
| 受控嵌套任务(1-5层包含关系) | held-out输出精确率 pass@2 | 深度≤4饱和;深度5为29/36,且36个输出维度全对、单元格精度>99.9% | short上下文19/24;supported上下文24/24 | 深度悬崖主要是外推失败而非执行失败,匹配演示可完全消除 |
| 算子组合实验(3×3 motif,72输出/条件) | held-out pass@2 | 重定位72/72;旋转单独72/72、+重定位72/72;反射单独72/72、+重定位47/72;颜色交换单独26/72、组合0/72 | 各算子单独执行作为对照 | 组合能力依算子与颜色表征而异:旋转可完全组合,反射部分可组合,颜色交换基本不可组合 |
| 推理努力缩放 | pass@2 / 相对成本 | HIGH 29.5%(成本0%);MEDIUM 27%(省11%);LOW 21%(省22%) | MIN努力111/400($0.000884/题)vs STANDARD 118/400($0.00265/题) | 潜在思考量是单调的计算-精度旋钮,但MIN与STANDARD的差异统计上不显著(McNemar $p=0.167$) |
局限与改进
作者坦承的局限:(1)不透明ID复现只排除请求侧线索混淆,不能排除训练数据暴露或checkpoint选择的影响,也不使ConceptARC成为全新基准;(2)标识符替换与批次混合两个干预未做因子化拆分;(3)绝对精度仍有限——29.5%低于GPT 5.6 Luna的34.2%,卖点是效率而非精度;(4)MIN与STANDARD的差异统计不显著($p=0.167$),四个端点均偏向STANDARD只是点估计。我自己的观察:(1)“computed cost”(实测硬件时间×$3/H200小时)与排行榜上其他系统的reported cost(硬件估算或API定价)口径不一致,横向比较有水分;(2)Copy/Order严格任务准确率仅2/10、任务内一致性缺口18.5个百分点(52/160任务部分正确),说明它并未真正“归纳规则”,更像学到了任务相关的模式匹配;(3)维度、更新规则与训练配方全部专有,无法独立核查训练数据与评测集间是否存在污染;(4)结论限定在视觉网格域,语言与数学上的可迁移性未经检验;(5)黑盒审计由论文合作者(Bielik、NYU)执行,独立性有限。
独立分析的弱点
独立分析出的弱点与改进方向:(1)任务内一致性缺口——ConceptARC上52/160任务只答对1-2个测试输入,说明潜在推理没有稳定绑定规则;可改进:训练时引入跨测试对的一致性正则,或“同一记忆支持多个查询”的多查询目标,迫使绑定出的schema可一致执行。(2)输出构造瓶颈——长度8排序仅3/24输出维度正确,模型连输出形状都错;可改进:把“输出尺寸估计”与“内容填充”解耦为两阶段解码,或先预测网格拓扑再填格子。(3)组合的表征依赖——颜色交换在固定布局家族26/72、洗牌家族仅1/24,组合0/72,说明模型走了布局捷径;可改进:用平衡颜色多重性的课程消除捷径,再引入显式算子组合训练信号。(4)演示覆盖敏感——深度5嵌套在short上下文19/24、supported 24/24,外推脆弱;可改进:推理时自适应生成或检索与测试复杂度匹配的额外演示。(5)域窄——只在ARC式视觉任务上验证,语言与数学的循环记忆适配完全未测;可改进:在BDH语言模型基础上联合训练文本演示条件化,验证论文展望中的混合路线。
未来方向
作者提出的方向:(1)规模扩展——BDH-CQ天然支持张量分片、易于训练到1T规模;早期实验显示1B到600B预训练符合Transformer式缩放律且保留潜在推理能力,作者将检验能力边界是否随规模可预测移动;(2)广度扩展——ARC-AGI-2是下一个视觉推理目标,本文的诊断(输出构造、条件绑定、演示覆盖、多算子组合)直接构成开发议程;数独等约束满足域可检验长程潜在求精;语言与数学推理检验文本演示的循环记忆适配;(3)混合架构——BDH层同时支持语言建模与潜在推理,未来可在需要通信、验证或工具使用时解码言语化步骤,结合连续计算的带宽效率与语言的可验证性,作者以人类语言与概念推理部分分离的证据(Fedorenko & Varley, 2016)作为动机。基于本文成果可延伸的:把受控生成器标准化为公开的能力探针套件;研究潜在工作区中多假设并行的机制解释;刻画演示覆盖度与推理时算力分配的关系,形成“按需买演示”的成本理论。
复现评估
复现现状分两面看。不利面:模型权重、潜在空间维度、记忆更新规则的实现细节与完整训练配方均为专有;受控任务生成器只有文字描述、未发布代码;因此第三方无法从头复刻模型,也无法独立核查训练数据与评测集之间是否存在污染。有利面:所有评测集公开(ARC-AGI-1公开评测400题、ConceptARC 160题);推理成本极低——每题约0.85 H200秒,单张H200跑完400题×2候选大约只需6分钟机时,外部研究者验证其报告分数与成本主张的门槛很低;论文还提供了独立黑盒审计(Bielik与NYU合作者按书面协议、无权重访问复现29.5%)、语义/不透明ID双重复现,以及字节级可重复性证据(重复运行419/419输入完全一致),透明度工程做得认真。综合评估:外部可验证、内部难复刻——成本与精度数字可信度较高,但机制层面(数据、配方、维度)只能信任作者;若日后开源权重与生成器,可信度等级会显著提升。
论文图表
一个ARC任务的完整示例:输入含两个由灰色列分隔的二值面板,演示暗示输出应标记两个面板共同占用的单元格(交集关系),查询要求把该规则迁移到新输入。规则没有任何文字命名,只能从示例推断。
直观说明ARC任务格式,以及为什么它是可控、可精确验证的行为学测试床——这是全文评测与行为分析的方法论前提。