CoVA-SFT:面向视觉抽象链的大规模数据集 CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions
构建5.2万条带视觉工作区的多模态推理轨迹,教模型在纯文本推理中内化视觉草稿纸
前置知识
Chain-of-Thought (CoT) 思维链
让大语言模型在给出最终答案前先自回归地生成一系列中间推理步骤的范式。它把难题分解为可逐步完成的小步骤,大幅提升数学证明、编程等任务的准确率,是 o1、DeepSeek-R1 等推理模型的基础接口。CoT 的有效性依赖一个前提:中间状态本身适合用语言表达。
本文的出发点正是 CoT 的边界:当中间状态是视觉或结构化的(棋局、迷宫、图邻接),文本 CoT 被迫把问题串行化成不自然的散文。理解 CoT 的工作方式才能明白作者为什么要让模型在思维链中交织视觉抽象。
交错式多模态推理 (Interleaved Reasoning)
推理轨迹不只有文本 token,还按步骤插入图像或其他模态的表征,插入的图像作为中间状态参与后续推理。现有工作大致分三类:解读题目给出的输入图像(如 Zebra-CoT)、通过外部工具编程渲染图像再回喂(如 CodePlot-CoT、MathCanvas)、以及用连续视觉 token 替换部分文本轨迹(如 Mirage、CoVT)。
本文的定位必须放在这三条路线的坐标系里看:CoVA-SFT 数据面向『纯文本输入、推理中从零构建视觉工作区』,而其微调模型属于潜 token 路线,论文在 Table 1 与 Table 2 中与前两类基线做了系统对照。
潜视觉 Token (Latent Visual Tokens)
把一张图像用视觉编码器压缩成固定数量的连续嵌入向量(本文为 128 个),当作语言模型词表之外的『软 token』插入序列,模型可以自回归地生成这些连续向量。训练时通常用回归或余弦相似度目标,把模型预测的嵌入对齐到目标图像的编码嵌入上,而非让模型输出离散的像素或图块。
CoVA-SFT 微调后的模型产出的『视觉工作区』正是这种潜 token:论文的双目标损失 $\mathcal{L}_{SFT}=\mathcal{L}_{visual}+\gamma\mathcal{L}_{text}$ 中,$\mathcal{L}_{visual}$ 就是逐 token 的余弦对齐损失,这是方法与评估的核心机制。
SFT 与约束满足问题 (CSP)
监督微调(SFT)用标注好的输入-输出轨迹直接优化模型模仿目标行为,是与 RL 相对的训练方式。约束满足问题(CSP)是寻找满足全部约束的赋值的问题,典型如数独、斑马谜题、座位安排;CSP 求解器可以验证解的存在性与唯一性,因此能程序化地生成带标准答案的题目。
本文用 SFT 蒸馏 agent 生成的多模态轨迹;同时其大量训练任务(座位安排、逻辑谜题、数独、装箱、调度)依赖 CSP 求解器程序化生成并保证唯一解,理解这两点才能看懂附录 B 的数据构造与附录 E 的训练配置。
研究动机
长思维链(CoT)让 LLM 在中间状态天然是语言的任务(如数学证明、编程)上收益巨大,但当中间状态本质上是视觉或结构化的时候,纯文本 CoT 强迫模型把问题串行化成不自然的散文。典型例子是国际象棋:人类看一眼真实棋盘远比解读一长串代数记谱容易,而文本 CoT 必须把棋局、迷宫、图邻接等状态逐字重写,每推一步都要在文本中重新枚举全部邻接结构,极易出错且难以回溯。实验数据印证了这一短板:Qwen3-Think 在 Graph 推理上只有 44.5%、在 Game 模拟上只有 19.3%。另一方面,社区缺乏教模型『从零构建并维护内部视觉工作区』的大规模多步自校正数据集——Zebra-CoT 的视觉内容是对题目输入图像的观察,Math-VR 局限于数学绘图,现有资源在规模、领域多样性和序列推理深度上都不足,导致研究视觉中间表示的学者缺少完整的训练与验证资源。
本文的目标是本文的目标是构建并验证一个大规模结构化语料 CoVA-SFT,教会多模态语言模型在解决纯文本推理问题时,在推理过程中交织文本与视觉抽象、构建并维护内部视觉工作区。具体包括三项交付:其一,发布含 51,904 条样本、222,046 个多模态推理步骤的训练集,覆盖 Table、Graph、Layout、Game、Math 五大布局族和 17 个复杂任务,每条轨迹附显式 rationale、agent 式渲染与验证循环;其二,配套发布 CoVA-Bench——从相同 17 个任务中 held-out 的 1,700 个测试样本(每任务 100 个),保证可复现评估;其三,通过微调 Qwen3-VL-8B-Thinking 验证该数据集『可学习、有挑战』,并系统量化 interleaved 视觉推理相对 text-only 基线与外部工具式基线的得失,明确指出当前仍不及强 text-only CoT 的开放差距。
与已有工作不同的是,本文的独特切入在于重新定义『视觉抽象的角色』。先前工作要么把推理锚定在题目给出的已有图像上(Zebra-CoT 的输入即多模态),要么用外部工具显式生成图像作草稿(CodePlot-CoT、MathCanvas、Visual Sketchpad),后者存在『外部执行边界』——渲染错误会向后续推理传播且恢复机会有限;要么像 Mirage、CoVT 那样用连续视觉 token 替换部分文本轨迹,但缺少大规模训练数据支撑。CoVA-SFT 首次面向『纯文本输入 → 推理中从零构造视觉工作区』的设定:合成端用三阶段 agent 管线(rationale 先行 → Matplotlib 编程渲染 → 验证自校正闭环)保证数据质量,训练端再把渲染图像编码为潜视觉 token 内化进模型参数,使视觉状态的构建与维护不越过模型自身的推理边界。
核心方法
直觉上,这模仿了人类在草稿纸上画表格、家族树、示意图辅助思考的行为。技术路线分两段。先是数据合成:用 Claude 4.5 Sonnet 作为 agent 生成器执行三阶段管线(Figure 3)——(1) Rationale & QA Formulation:模型先论述为什么该任务需要视觉工作区、应当画什么,并生成对应问答对;(2) Agentic Rendering:逐步生成交错推理轨迹,每次通过 Matplotlib 工具调用编程式渲染当前视觉工作区,渲染出的图像回喂给模型作为后续上下文;(3) Verification & Self-Correction:模型对照题面检查渲染图像的结构一致性,发现错误就重新进入渲染循环重画。数据覆盖五大抽象族:Table(约束满足类)、Graph(关系推理类)、Layout(空间网格类)、Game(棋盘模拟类)、Math(几何绘图类)。后是训练:以 Qwen3-VL-8B-Thinking 为底座做 SFT,模型不仅产出最终文本答案,还要产出中间的潜视觉轨迹;每张交错图像用固定 128 个视觉 token 编码,以文本交叉熵加视觉余弦相似度的双目标联合优化,视觉编码器在训练中保持解冻。
核心创新是『从看图推理到画图并在心中保持图像』的转变。与 Zebra-CoT 等教模型解读输入图像不同,CoVA-SFT 的图像是模型自己在推理中构造的工作区;与 MathCanvas 等外部工具调用不同,本文把渲染结果编码为 128 个潜视觉 token 直接内化,训练目标为 $\mathcal{L}_{SFT} = \mathcal{L}_{visual} + \gamma\,\mathcal{L}_{text}$,其中文本部分是标准自回归交叉熵 $\mathcal{L}_{text}$,视觉部分 $\mathcal{L}_{visual} = \frac{1}{N}\sum_{i=1}^{N}\ell_{cos}(e_i,\hat{e}_i)$ 把模型预测的第 $i$ 个潜视觉 token 嵌入 $e_i$ 与真值渲染图像的归一化目标嵌入 $\hat{e}_i$ 做余弦对齐。该双目标(沿用 Zhang et al. 2025 的公式化)显式监督『语言生成』与『视觉状态演化』两条线索,鼓励模型在整个长推理视野中维持有据可依的多模态表征,从而既避免外部执行边界,也避免把视觉状态串行化为散文时的信息损失。
方法步骤详情
数据构造分三步。第一步 Rationale & QA:题目或程序化生成、或取自开源数据集——Seating Arrangement 用约束满足算法(直线/圆形两种布局、18 个约束模板)迭代加约束直至存在唯一有效座位方案;Logic Puzzle 取自 Zebra Puzzles 仓库,采样 $n$ 房屋 $m$ 属性并加权加约束直至 CSP 求解器得到唯一解;3D Cube 程序化采样体素结构并渲染,问题含外露表面积、指定涂面数立方体计数、移除高亮块后表面积变化三类;其余 14 个任务来自 ARC、Chess(FEN 记谱)、2D Maze、Sudoku、CLUTRR、GRAM 图着色、GraphInstruct、ProsQA、装箱、调度 CSP、Math-VR、MathNet、ACP Bench、SpatialEval 等开源仓库(完整清单见 Table B.1)。第二步 Agentic Rendering:Claude 4.5 Sonnet 逐步写出推理文本,每遇状态更新就调用 Matplotlib 渲染(如迷宫中蓝色路径配方向箭头、家族树用红/灰/绿边区分新增/已验证/查询对象),图像回喂后再写下一步。第三步 Verification:逐图检查与题面的结构一致性,不合格即重画。训练侧配置:解冻视觉编码器,AdamW 学习率 $5\times10^{-5}$、cosine 调度、50 步 warmup、全局 batch 16、训练 2 个 epoch、最大响应长度 32,768,在 8 张 H200(80GB)上以 FSDP2 + bf16 + FlashAttention v2 + Liger Kernel 完成。
技术新颖性
技术新颖性有四点。其一,数据设定新:首个针对『文本-only 输入、推理中从零构建视觉工作区』的大规模语料,51.9K 轨迹、222,046 个视觉步骤、17 个任务,规模与结构化程度超越 Zebra-CoT、Math-VR 等既有 interleaved 数据(Table 1 明确了这一区别)。其二,合成管线新:rationale 先行(先说清为什么画、画什么)+ 编程式 Matplotlib 渲染 + 验证自校正闭环,把数据质量控制从『祈祷模型别错』变成显式的反思机制。其三,训练目标新:双目标损失联合监督文本自回归与潜视觉 token 的余弦对齐,把『生成图像』转化为『预测图像的连续嵌入』,相比离散视觉 token 生成是更平滑的归纳偏置,也使视觉状态维护内生于解码过程。其四,评测配套:与数据集同源 held-out 的 CoVA-Bench(1,700 样本、每任务 100 个)一并发布,并给出 text-only、外部工具式、潜 token 三类基线的系统对照,使『数据是否可学、是否有挑战』可以被复现检验。
实验结果
Table 2 给出主结果。CoVA-SFT 基线在 17 任务 held-out 测试集上平均 38.2%,在 interleaved 阵营断层领先:比第二名 MathCanvas(16.8%)高 21.4 个百分点(超过 2 倍),更远超 CodePlot-CoT(12.9%)、Zebra-CoT(11.2%)、TwGI(0.9%)——后三者依赖外部渲染,渲染错误会传播进后续推理且难以恢复,TwGI 的中间图像常不连贯、几乎无法提供长程 grounding。但对比 text-only 基线整体仍落后:Qwen3-Think 45.1%、Qwen3-VL-Instruct 46.0%、Qwen3-VL-Thinking 51.2%。分域看:Graph 是唯一全面超越 text-only 的领域,62.0% 对最强 Qwen3-VL-Instruct 的 57.0%,其中 ProsQA 93.8%(text-only 仅 23.0/31.0)、CLUTRR 83.6%(37.0/39.0),作者解释为图的节点/边/可达性信息天然视觉却难以在散文中维护,文本 CoT 每步都要重新枚举邻接结构;Maze 77.0% 也超过 text-only 的 48.0/50.0。Layout 53.4%、Table 47.2% 低于最强 text-only(76.3%/80.3%),其中 Scheduling 34.5% 对 95.0% 差距显著。Math 最弱,仅 8.5% 对 27.3%(MathNet 4.9%、Math-VR 10.9%),作者归因于数学推理已有成熟的符号记法、VLM 处理文本符号流畅,潜视觉 token 反而是昂贵的绕路。Game 内部剧烈分化:Maze 大涨,但 Chess 0.0%、Sudoku 0.0%、ARC 3.3% 完全失败。总体结论:学习连续潜视觉表征在结构/关系型任务上是有效的归纳偏置,但尚未整体追平强 text-only CoT,这被作者明确标为开放挑战。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| CoVA-Bench 17任务混合推理(vs interleaved 基线) | 平均准确率 (%) | 38.2 | 16.8(MathCanvas,最强 interleaved 基线) | +21.4 个百分点(超过 2 倍) |
| Graph 推理(4任务) | 平均准确率 (%) | 62.0 | 57.0(Qwen3-VL-Instruct,最强 text-only) | +5.0,唯一全面超越 text-only 的领域 |
| ProsQA | 准确率 (%) | 93.8 | 23.0(Qwen3-Think)/ 31.0(Qwen3-VL-Thinking) | +70.8 |
| Maze | 准确率 (%) | 77.0 | 50.0(Qwen3-VL-Thinking) | +27.0 |
| Math 推理(3任务) | 平均准确率 (%) | 8.5 | 27.3(Qwen3-VL-Thinking) | -18.8(落后,作者归因于符号记法已足够) |
| Scheduling CSP | 准确率 (%) | 34.5 | 95.0(Qwen3-VL-Thinking) | -60.5(严重落后) |
局限与改进
作者承认三点局限:一是数据蒸馏自 Claude 4.5 Sonnet,验证自校正循环虽能捕获大量结构不一致,但文本轨迹或渲染代码中的细微幻觉会进入训练分布并直接蒸馏给下游,可能框定下游模型精度的上限;二是视觉抽象受渲染工具编程能力约束,只覆盖静态 2D 结构(表格、拓扑图、布局网格、几何坐标图),不含开放世界空间模拟或连续机器人环境,学到的抽象偏符号/示意而非连续感知;三是双目标训练开销显著大于纯文本 SFT,$\mathcal{L}_{SFT}=\mathcal{L}_{visual}+\gamma\mathcal{L}_{text}$ 需要仔细调参且内存带宽更高,复杂任务多达 8 个以上连续视觉状态,推理时需要更长上下文窗口和更多算力来动态维护工作区。我的补充观察:评估依赖 LLM-as-judge(Gemini-2.5-flash),对结构化答案的判分可能引入噪声且未报告与精确匹配的一致性;数据分布极不均衡(Math-VR 占 32.4%,Seating 仅 1.6%),长尾任务(Chess/Sudoku/ARC)训练后性能崩塌;实验只有单一 backbone(8B)、单一 token 预算(128)、单一损失权重,没有任何消融,无法判断各设计(潜 token 内化 vs 显式回喂、$\gamma$ 取值、128 token 数量)的边际贡献;『超过 interleaved 基线 2 倍』的对照方法(TwGI、Zebra-CoT 等)并非为这些任务设计,对比的公平性值得斟酌。
独立分析的弱点
独立分析四个弱点。其一,长尾崩塌:任务占比从 32.4%(Math-VR)到 1.6%(Seating)横跨约 20 倍,Chess 与 Sudoku 微调后反而跌至 0.0%,ARC 仅 3.3%,说明潜 token 难以承载需要精确符号状态跟踪的任务;改进方向是对长尾任务重采样或课程学习,并对精确状态类任务保留文本/代码表征的混合输出。其二,蒸馏天花板:生成器自身的推理错误经自检仍会漏入数据,且自检只以『结构一致性』为准,无法保证推理逻辑正确,训练分布的错误会变成模型的能力上限;改进方向是引入程序化验证器(这些任务大多有唯一解或可执行检查)做硬过滤,或从 SFT 转向可验证奖励的 RL。其三,潜 token 不可解释、不可中途纠错:一旦内部视觉状态偏离真值,后续推理全盘皆错,且人类无法审查模型『脑中』的棋盘;改进方向是显式渲染与潜 token 混合使用、加状态一致性正则、或周期性触发『重绘校验』步骤。其四,推理成本:8 个以上视觉状态 × 128 token 显著拉长上下文、推高算力;改进方向是让模型学会按需启用视觉工作区、以增量 diff 替代全图重绘、或对工作区做压缩摘要后再维护。
未来方向
作者明确把『仍不及强 text-only CoT 基线(51.2% vs 38.2%)』留作未来工作的开放挑战。基于本文成果可以延伸的方向有:(1) 可验证奖励的 RL 阶段——Chess、数独、装箱、调度等任务有精确答案或可执行检查器,非常适合在 SFT 之上用 RL 修正蒸馏偏差、突破生成器上限;(2) 动态工作区管理——选择性重绘、只更新变化的子图、多分辨率抽象,降低长视野下的上下文与算力成本;(3) 把五大抽象族从静态 2D 扩展到视频、真实图像、机器人仿真等连续感知域,弥补『符号化而非感知化』的缺口;(4) 混合路由——按任务类型动态决定用文本符号、外部工具渲染还是潜 token,让 Math 这类符号记法占优的任务不再被迫走视觉绕路;(5) scaling 研究——更大 backbone、不同 token 预算、$\gamma$ 与 $\ell_{cos}$ 设计的消融,检验结论是否随规模成立;(6) 对潜视觉 token 做探针分析,验证其是否真的编码了几何/拓扑状态而非退化为噪声;(7) 与 test-time scaling 结合,采样多条工作区路线再用验证器筛选,提升 Chess/Sudoku 等精确任务的可靠性。
复现评估
复现条件总体良好。数据已在 HuggingFace 开源(tsunghanwu/cova),新创建部分采用 CC BY 4.0 许可,14 个外部源数据集的仓库 URL 在 Table B.1 中逐一列出并遵循各自许可。训练配置披露完整(Table E.1):Qwen3-VL-8B-Thinking 底座、AdamW、学习率 $5\times10^{-5}$、cosine 调度、warmup 50 步、全局 batch 16、2 个 epoch、每图 128 视觉 token、SFT 损失权重 $\gamma$(表中记为 λ)= 1.0、最大响应 32,768。算力需求:8 张 H200(80GB),配 FSDP2、bf16、FlashAttention v2、Liger Kernel——对学术实验室是不低但可负担的规模(8B 模型、51.9K 样本、2 epoch)。评估用 CoVA-Bench 1,700 样本加 Gemini-2.5-flash 作 judge,成本可控。主要不确定性:三阶段 agent 管线的完整 prompt 细节未见公开,从零复现数据合成需 Claude 4.5 Sonnet API 开销且质量依赖该模型;训练代码是否开源文中未明确说明。总体评级:用官方数据复现训练与评测难度中等,完全复现数据生成管线难度中高。
论文图表
对比示意图:左侧标准文本推理把天然视觉的问题(如棋局)强行串行化为冗长散文;右侧经 CoVA-SFT 训练的模型在推理过程中构建并维护(潜)视觉工作区,文本与视觉抽象交替推进。
一图点明论文的核心主张与问题设定,是理解『为什么需要这个数据集』的入口。
数据集全景图:51.9K 样本、222K 图像、17 个数据源、5 大抽象类型(Table/Graph/Layout/Game/Math),并给出各任务样本占比(Math-VR 32.4%、Maze 7.8%、Bin Packing 7.2%、Chess/Sudoku/图着色各 5.4% 等),同时展示排课表、亲属推理、几何题等任务的『PROMPT → 逐步推理+重绘 → 答案』示例轨迹。
展示数据规模、任务构成与分布不均衡程度,帮助判断数据覆盖面与长尾风险,也直观呈现五类视觉抽象分别长什么样。
跨多页的 17 任务训练样本集锦,展示完整交错轨迹:迷宫逐步延伸路径并重绘、国际象棋从 FEN 画盘并高亮最佳着法 g5f6、ARC 四折旋转对称的『假设-验证-矛盾-修正规则』过程、数独逐格填充、CLUTRR 家族树用红/灰/绿边区分新增/已验证/查询关系、最大流增广路径分析、图着色逐点赋色、三角网格轴向坐标移动追踪、装箱与座位安排、3D 立方体邻居计数与表面积双法验算、MathNet 生成函数推导、Math-VR 参数平面三角形区域、ACP 前置条件检查表、逻辑谜题填表验证。
唯一直观展示『视觉抽象长什么样、推理如何与图像逐步交替、验证循环如何工作』的材料,理解数据形态与质量的必看素材。
14 个外部源数据集及其仓库 URL 清单:ARC Interleaved(Zebra-CoT)、GraphInstruct、CLUTRR、SpatialEval、ProsQA(Coconut)、Math-VR、MathNet、ACP Bench、Bin Packing(ACCORD)、Scheduling CSP(constraint-sat-1000)、GRAM 图着色、Puzzle-Bench 数独、2D Maze、Chess 数据集。
数据来源与许可合规的完整清单,是复现数据管线和判断数据血缘的依据。
17 个任务逐项对比 CoVA-SFT 与两个 text-only 基线(Qwen3-Think、Qwen3-VL-Thinking):大涨的有 ProsQA 93.8 vs 23.0/31.0、CLUTRR 83.6 vs 37.0/39.0、Maze 77.0 vs 48.0/50.0;崩塌的有 Chess 0.0、Sudoku 0.0、ARC 3.3、Scheduling 34.5 vs 93.0/95.0、MathNet 4.9 vs 32.0/32.0、GraphInstruct 82.0 vs 97.0/100.0。
平均分掩盖的成败细节都在这里:能看到潜视觉推理具体在哪类任务生效、在哪类任务失效,是评估方法适用边界的最细粒度证据。
SFT 全部超参:底座 Qwen3-VL-8B-Thinking、优化器 AdamW、学习率 5e-5、cosine 调度、warmup 50 步、全局 batch 16、2 个 epoch、每图 128 视觉 token、SFT 损失权重 λ=1.0、最大响应长度 32,768。
复现训练实验的唯一完整配置来源,配合附录 E 的硬件信息(8×H200、FSDP2、bf16)可估算算力成本。