面向自监督跨表征学习的一致性驱动协同演化 Consistency-Driven Co-Evolution for Self-Supervised Cross-Representation Learning
用图表-表格-代码三表征一致性作为自监督信号协同优化多模态跨表征理解
前置知识
多模态大语言模型(MLLM)
能同时处理图像和文本的视觉-语言模型,如 Qwen3-VL、InternVL。它把图像编码为视觉 token 再与文本 token 一起送入 LLM 主干,从而具备「看图说话」的能力,是本文 $M_\theta$(从图表生成代码/表格)的核心载体。
本文的 $M_\theta$ 必须用 MLLM 才能直接吃进 chart 图像 $v$,理解其坐标轴、刻度、数据系列后输出表格 $t$ 与可视化代码 $c$;读懂本文必须理解 MLLM 的视觉感知局限与误差来源。
策略优化与GRPO
强化学习中更新策略 $\pi$ 的范式。PPO 通过裁剪重要性比率 $\text{clip}(\rho, 1-\epsilon, 1+\epsilon)$ 限制更新步长并加 KL 惩罚;GRPO(Group Relative Policy Optimization)则对一组采样轨迹用组内均值/标准差归一化计算优势 $A=(r-\mu)/(\sigma+\delta)$,免去额外 value 网络。本文把一致性奖励作为「即插即用」信号接入 GRPO/DAPO/GSPO。
CoCoEvolve@Train 的训练目标(Eq.8/15/16)本质就是 PPO 式裁剪损失加 KL,只是奖励来自跨模型一致性;不理解 GRPO 的优势归一化就看不懂两模型如何耦合更新。
循环一致性(Cycle Consistency)
源自 CycleGAN 的自监督思想:若无配对数据,可让 $A\to B\to A$ 的往返重建一致,从而无标注地学到跨域映射。本文把 chart $V$、table $T$、code $C$ 构成 $V\to T\to C\to V$ 的完整循环,用一圈下来结果是否自洽作为监督信号。
本文的核心创新就是把 cycle consistency 从视觉单表征扩展到「图表-表格-代码」三表征,并用确定性代码执行器 $h$ 闭合循环,这是理解整个方法论的钥匙。
奖励塑造与防合谋(Reward Hacking)
在 RL 中设计奖励函数引导模型学到的行为。若只奖励两模型互相一致,它们会「合谋」产出语义错误但彼此一致的输出(退化解)。本文用个体接地奖励(与原图 $v$ 对齐)和不对称权重 $\lambda_\theta=0.7$ 来抑制这种退化。
理解作者为何给 $M_\theta$ 高个体权重、给 $M_\psi$ 高一致性权重(Eq.7、Tab.6、Fig.11),是读懂奖励设计精妙之处与防 reward hacking 的关键。
图表理解与 chart-to-code 生成
从图表图像抽取结构化表格(chart-to-table)或重建绘图代码(chart-to-code)的任务。一个 chart 可对应多种有效表格布局、多种绘图库写法,因此是天然的「一对多」问题,监督标注既贵又模糊。
这是本文要解决的核心应用场景;理解其一对多本质,才能明白为何需要「约束 $s$」把映射 ground 成严格一对一。
研究动机
同一份数据可表达为 chart 图像 $v$、表格 $t$、可视化代码 $c$ 三种表征,它们彼此本应语义自洽,但现有工作把它们割裂成独立的有监督任务(chart-to-table、chart-to-code),面临三层根本困难。其一,映射天然「一对多」:一张图可对应多种表格布局、多种绘图程序,使标注空间爆炸且定义不清——作者在 §B.1 用 ChartNet 假设的「一对一」标注做 SFT,反而让 $M_\theta$ 的沙箱执行成功率 $\downarrow 11.31\%$、$M_\psi$ 在多项指标上 $\downarrow$ 最多 $21.25\%$。其二,固定监督无法泛化:在 chart-to-table / chart-to-code 上训练,反方向(table-to-chart)与未见组合(table-to-code)性能 $\downarrow$ 最多 $31.82\%$(§B.2)。其三,作者在 §B.3 案例分析中发现模型错误高度跨表征关联——表格里的数值错误会传染到代码与渲染图,且三种表征常相互矛盾(如表格只含左子图信息而代码却试图重建双子图),说明问题根源是共享的「图表理解缺陷」而非单表征误差。
本文的目标是本文要构造一个原则性的、免标注的优化信号,使其同时满足三个性质:(1) 任务无关——不依赖某一具体边(如 chart-to-code);(2) 方向无关——对 $V\Leftrightarrow T$、$T\Leftrightarrow C$、$V\Leftrightarrow C$ 六个方向一视同仁;(3) 表征无关——对 chart/table/code 任意组合可泛化。更进一步,作者希望该信号能在训练时(CoCoEvolve@Train)与推理时(CoCoEvolve@Test)都发挥作用,让两个模型 $M_\theta$、$M_\psi$ 通过图表-表格-代码循环协同演化、彼此互相提供越来越强的监督,最终在四个基准的六任务上系统提升跨表征理解,并能迁移到域外域内任务。
与已有工作不同的是,现有思路要么把每条边当成独立有监督任务(需要昂贵标注、忽略三表征间的语义冗余),要么把 cycle consistency 局限在视觉单表征或特定域。CoCoEvolve 的独特切入是双管齐下:先用「显式约束 $s$」把一对多映射 ground 成严格一对一对应(§3.1 的 $g_\psi(\cdot|s)$),再把「三表征一致性」本身当作无需任何标注的自监督信号,统一 cycle consistency 与 co-training,用一个确定性沙箱执行器 $h$ 闭合循环——这样既绕开了标注瓶颈,又能施加全局语义约束、自然泛化到任意方向与组合。
核心方法
直觉非常朴素:若 chart、table、code 都正确地表达同一份数据,它们经循环往返应当相互一致;这种「一致性」无需任何人工标注,却同时刻画了结构、视觉、语义三层面的自洽,是比单任务 ground truth 更强的全局信号。技术路线上,作者把问题形式化为三空间 $\mathcal{V}/\mathcal{T}/\mathcal{C}$ 及六任务循环,定义三个方向映射 $f_\theta:\mathcal{V}\to\mathcal{T}$(多模态模型 $M_\theta$)、$g_\psi:\mathcal{T}\to\mathcal{C}$(语言模型 $M_\psi$,并由约束 $s$ 条件化为 $g_\psi(\cdot|s)$)、$h:\mathcal{C}\to\mathcal{V}$(确定性 Docker 沙箱执行器)。两个模型在共享循环上协同:$M_\theta$ 采 $K_\theta$ 条轨迹,每条再由 $M_\psi$ 条件采样 $K_\psi$ 条子轨迹,用层级奖励打分后接 GRPO/PPO 式更新,且同一目标在测试时复用做 co-optimization。
核心创新点是把「跨表征一致性」首次显式提升为优化信号,并与已有方法的本质区别在于三点。第一,不依赖任何标注——奖励完全由沙箱执行结果(代码能否渲染、渲染出的图是否相似)与轻量 embedding 相似度(CLIP/DINOv2/CodeBERT)计算,训练阶段 API 成本为 $0$。第二,方向与表征无关——一致性奖励天然对称,对六个方向等价,因而能泛化到训练时未见过的反方向与组合。第三,把 cycle consistency 与 co-training 统一:两模型在采样与奖励上双向耦合($M_\psi$ 以 $M_\theta$ 输出为条件、$M_\theta$ 的优势跨 $K_\psi$ 子轨迹边际化),随训练推进互相增强。为防止两模型合谋产出「互相一致但语义错误」的退化解,作者引入个体接地奖励(与原始 $v$ 对齐)与不对称权重。
方法步骤详情
完整训练流程如下。(1) 对每张无标注图 $v\in\mathcal{V}$,$M_\theta$ 采样 $K_\theta=4$ 条 rollout $o_\theta^{(i)}=(\hat{s}^{(i)},\hat{t}^{(i)},\hat{c}_\theta^{(i)})$。(2) 对每条 $o_\theta^{(i)}$,$M_\psi$ 条件采样 $K_\psi=4$ 条 $o_\psi^{(i,k)}$,得代码 $\hat{c}_\psi^{(i,k)}$。(3) 用沙箱 $h$ 把所有 $\hat{c}$ 渲染回图 $\hat{v}=h(\hat{c})$。(4) 计算层级奖励:代码一致性 $F_c=\omega_e\mathbf{1}[\text{both exec}]+\omega_s\cdot\text{sim}_c(\hat{c}_\theta,\hat{c}_\psi)$(Eq.3/4,含基准锚定 $e_{base}$ 归一化),视觉一致性 $F_v$ 对 $\{\text{clip,ssim,ocr,dino}\}$ 四维加权(Eq.5),格式奖励 $F_f$(Eq.6)。(5) 拼成总奖励 $R_\pi=\lambda_f F_f+\lambda_c F_c+\lambda_v F_v(\hat{v}_\pi,v)+\lambda_v' F_v(\hat{v}_\theta,\hat{v}_\psi)$(Eq.7),其中跨模型项 $F_c,F_v(\hat{v}_\theta,\hat{v}_\psi)$ 强制互一致,单模型项 $F_v(\hat{v}_\pi,v)$ 防合谋。(6) 计算 $M_\theta$ 的边际化优势 $A_\theta=(\bar{r}_\theta-\mu_\theta)/(\sigma_\theta+\delta)$(跨 $K_\psi$ 子轨迹求均,Eq.17/18)与 $M_\psi$ 的组内优势(Eq.19),用裁剪比率损失加 KL 惩罚做 PPO/GRPO 式更新(Eq.8/15/16)。(7) 推理时 CoCoEvolve@Test 冻结两模型,对 $K_\theta\times K_\psi$ 候选用同一 $R$ 选最优(Eq.9)。监督扩展下,teacher $\mathcal{M}$ 以概率 $\alpha$ 把条件替换为真值 $(s_{gt},t_{gt})$ 并追加约束/表格奖励 $R_s,R_t$(Eq.11-13),$\alpha$ 线性退火(Eq.14)。
技术新颖性
技术新颖性体现在四方面。其一,奖励不对称设计(Tab.6):给负责多模态感知的 $M_\theta$ 高个体权重 $\lambda_v=0.7$、低一致性 $\lambda_c=\lambda_v'=0.05$、高执行权重 $\omega_e=0.9$;给单模态翻译的 $M_\psi$ 高一致性 $\lambda_c=\lambda_v'=0.2$——这种「按角色配权」既是合理归纳偏置又构成防合谋机制(Fig.11 验证)。其二,把测试时一致性 co-optimization 与训练时 co-evolution 共用同一目标,使 @Test 能在不微调时仍提升并显著降低 API 成本($0.8637\to0.2382$ 美元/样本)。其三,与监督信号无缝兼容(teacher $\mathcal{M}$+线性退火),可在自监督与弱监督之间平滑过渡。其四,CoCoEvolve@Eval 评测套件把 LLM/MLLM-as-Judge 从单一 0-100 粗分拆成五维细粒度评分(共 27 指标),规避了大模型在宽区间打分上的不可靠性,本身也是方法论贡献。
实验结果
在四个基准、九个模型(Qwen3-VL 2B/4B、InternVL3.5-4B、Qwen3 1.7B/4B/8B、DeepSeek-Coder 1.3B/6.7B、Llama-3.2-3B)上,CoCoEvolve 全面提升跨表征理解,且训练-测试可叠加。代码评估(Tab.1):@Train+@Test 把 Qwen3-8B 沙箱执行率推到 $100.00\%$(基线 $82.75\%$),rule-as-judge 最多 $\uparrow17.48\%$、LLM-as-judge 最多 $\uparrow26.57\%$;即便是较小的 Qwen3-VL-2B,执行率也从 $58.56\%\to93.36\%$。图表评估(Tab.2):rule-as-judge 最多 $\uparrow6.79\%$、MLLM-as-judge 最多 $\uparrow3.33\%$,如 Qwen3-8B 视觉准确率 $55.72\to78.56$。表格评估(Fig.4):rule-as-judge 最多 $\uparrow15.64\%$、MLLM-as-judge 最多 $\uparrow24.72\%$。域外泛化(Fig.9):仅在 10,298 条 ChartCoder 上微调,迁移到 ChartNet 提升最多 $\uparrow35.68\%$、ChartMimic $\uparrow37.97\%$;在 Chart2Code 各复杂度任务上 chart+figure→code 修改提升 $\uparrow46.88\%$、chart+instruction→code 修改 $\uparrow45.44\%$。算法泛化(Fig.5):一致性地嵌入 GRPO/DAPO/GSPO 均提升,执行 $\uparrow18.71\%$、代码 $\uparrow6.96\%$、图表 $\uparrow12.15\%$、表格 $\uparrow3.36\%$,DAPO 最稳。消融(Fig.3)显示 teacher 在 train+test 同时开启最均衡。失败分析(Fig.10)显示 CoCoEvolve 把总体错误率降低 $\uparrow35.10\%$、@Train+@Test 正确率提升 $\uparrow41.38\%$,主要砍掉数据相关错误。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| X→C 代码沙箱执行率 | Execution Success (%) | Qwen3-8B @Train+@Test: 100.00 | Qwen3-8B: 82.75 | +17.25 绝对,多模型平均显著提升 |
| X→C 规则评测 | Rule-as-Judge m@4 | Qwen3-8B @Train+@Test: 64.16 | Qwen3-8B: 52.27 | ↑11.89 (相对最高 ↑17.48% 跨模型) |
| X→C LLM 评测 | LLM-as-Judge m@4 | Qwen3-8B @Train+@Test: 60.62 | Qwen3-8B: 43.07 | ↑17.55 (相对最高 ↑26.57% 跨模型) |
| C→V 图表 MLLM 评测 | MLLM-as-Judge M@4 | Qwen3-8B @Train+@Test: 76.46 | Qwen3-8B: 40.07 | ↑36.39 (平均 ↑3.33%~↑24.72%) |
| 表格抽取(MLLM) | MLLM-as-Judge M@4 | 最高 ~+24.72% 相对提升 | 基线模型 | ↑24.72% |
| 域外 chart+figure→code 修改 | Chart2Code 代码生成 | CoCoEvolve | Qwen3-VL-4B/4B 基线 | ↑46.88% |
| 推理 API 成本 | $/sample | CoCoEvolve@Test: 0.2382 | Baseline: 0.8637 | 成本降至 ~27.6% |
局限与改进
作者在 §A 明确承认两点局限:其一,目前只在 1B–8B 的小模型上验证,未触及数百 B(如 480B)的大模型,co-evolution 动态与架构规模的交互尚不清楚;其二,方法只处理静态 chart 图像,对动态/动画可视化(帧间时序语义)完全未探索。我补充几点观察:第一,沙箱 $h$ 仅预装 matplotlib/seaborn/plotly 等常见库,对非主流绘图库或极复杂交互代码可能判为执行失败,导致 $F_v$ 奖励缺失;第二,表格/约束评测的「真值」$t_{gt},s_{gt}$ 由 Gemini-3-Pro 生成并通过 outcome-grounded 过滤得到(§C),本质上仍含 MLLM 噪声,可能把模型能力的天花板钉在 judge 模型水平附近;第三,训练仅 200 步、2 epoch、$B=8$,规模偏小,奖励曲线是否在更大算力下持续收敛未验证;第四,方法对「真的一致但都错」的系统性偏差仍依赖与原图 $v$ 的视觉相似度来兜底,若原图本身信息不足(如低分辨率)则防合谋机制会失效。
独立分析的弱点
从独立分析看,几个可改进弱点及方向:(1) 一致性奖励的视觉相似度依赖 CLIP/DINOv2/SSIM/OCR 四项加权,但这些指标对「数据正确而风格略异」的代码可能误判——改进方向是引入更细粒度的数据级对齐奖励(如渲染后用 OCR+表格回抽做数值匹配);(2) 不对称权重靠人工设定(Tab.6),跨数据集迁移需重调——可改为元学习或自适应权重搜索;(3) $M_\psi$ 完全依赖 $M_\theta$ 的 $(\hat{s},\hat{t})$ 做条件,$M_\theta$ 早期噪声会通过 teacher 退火缓解但仍可能误导——可引入 $M_\psi$ 反向回灌 $M_\theta$ 的双向条件或对抗判别;(4) 评测虽多维度但仍用 GPT-5-mini/Gemini-3-Pro 做 judge,存在 judge 偏置(论文自身 §3.5 也承认),可加入人评或更多 judge 做交叉校验;(5) cycle 只覆盖三表征,未纳入原始数据 DataFrame、SQL/查询等更上游表征,扩展表征维度可强化全局一致性。
未来方向
作者提出的方向:扩展到更大规模 MLLM/LLM 家族(如 480B)以研究架构与 co-evolution 的交互;把框架延伸到动态/动画可视化,使视觉、表格、代码联合建模时序语义。基于本成果可延伸的方向:把一致性信号推广到更广义的「数据-表征」循环(如 JSON↔图表↔自然语言描述、3D 场景↔代码↔图像);与 test-time scaling / 推理期搜索结合,把 @Test 的 $K_\theta\times K_\psi$ 候选搜索做成树搜索或 MCTS;把防合谋机制形式化为博弈论中的纳什均衡分析;探索纯自监督(teacher $\mathcal{M}$ 完全关闭)在更大算力下的自举(bootstrap)能力,逼近「自我博弈」式持续进化。
复现评估
复现评估中等偏友好。作者提供了项目主页 https://xhguo7.github.io/CoCoEvolve/ 并承诺开源;论文附录详尽——§C 给出数据构造三阶段过滤流程与阈值($l_{input}=l_{code}=l_{table}=l_{constraint}=8192$、$l_{timeout}=60s$)、§E 给出三层符号体系($f_\theta/g_\psi/h$、$M_\theta/M_\psi$、$\pi_\theta/\pi_\psi$)、所有奖励权重与子权重(Tab.6)、沙箱预装库清单(matplotlib/seaborn/plotly/pandas/numpy 等),§F 给出 27 个评测指标的完整数学定义(CLIP/DINOv2/CodeBLEU/UniXcoder 等),可以说关键细节齐全。算力门槛适中:训练仅需 4×H100 96GB、每 run 72–86 小时;评测单样本 71.88–128.72 秒。主要复现难点在于:(1) 沙箱 Docker 环境与代码执行超时的严格复刻;(2) LLM/MLLM judge 用 GPT-5-mini/Gemini-3-Pro,需对应 API 与成本(基线 $0.8637/样本);(3) 真值 $t_{gt},s_{gt}$ 由 Gemini-3.1-Pro 生成,需复跑 outcome-grounded 过滤,存在轻微随机性。整体而言,方法清晰、配置透明,具备较高可复现性。
论文图表
展示 chart 图像、数据表、可视化代码三者构成六任务循环($V\Leftrightarrow T$、$T\Leftrightarrow C$、$V\Leftrightarrow C$),并点明其内在一对多、监督模糊、计算成本高的三大挑战。
这是理解全文问题定义的入口图,定义了所有后续方法与评测围绕的六任务循环。
比较基线、非微调 @Test、SFT 三种设置,显示在 ChartNet 假设的「一对一」标注上做 SFT 反而多任务下降(执行率 ↓11.31%、$M_\psi$ 最多 ↓21.25%)。
用对照实验直接论证「一对多标注是病态监督」,是约束定义 $s$ 的动机支柱。
比较基线、非微调 @Test、SFT(含约束的固定 chart-to-table/code 对),显示固定监督在训练任务上 ↓最多 25.19%、反方向 ↓25.10%、未见组合 ↓31.82%。
证明即使加了约束,固定监督仍无法泛化到反方向与未见组合,奠定「方向/表征无关一致性信号」的必要性。
案例图:给定一张双子图 chart,模型抽取的表格只含左子图信息,代码却试图重建双子图且数值错误,渲染图布局扭曲——错误跨表征传播。
定性揭示两类失败模式(错误跨表征相关、表征间高度不一致),是设计一致性奖励的直接经验依据。
Qwen3-4B-VL 在基线、@Train、@Train+@Test 下的五维失败分布,显示数据相关错误被大幅削减,总体正确率提升 ↑41.38%。
把「提升」落到具体失败类别,揭示数据准确性与信息完整性是跨表征理解的关键瓶颈。