← 返回 2026-09-11

图像Tokenizer即视觉语言:统一多模态模型中的损失分析研究 Studying Image Tokenizers as Visual Languages in Unified Multimodal Models

Siting Li, Zhengyang Wang, Simon Shaolei Du, Xi Chen, Yang Liu 📅 2026-09-08 👍 18 2026-09-12 18:30
图像Tokenizer 多模态预训练 损失分析 统一多模态模型 缩放定律 自回归建模

以任务级验证损失为透镜,揭示图像tokenizer对统一自回归多模态联合建模的重塑作用。

前置知识

离散图像Tokenizer(VQGAN类)

采用编码器-量化器-解码器架构:编码器把图像 $x\in\mathbb{R}^{H\times W\times 3}$ 映射为 $K$ 个连续向量 $f\in\mathbb{R}^{K\times D}$;量化器维护码本 $Z\in\mathbb{R}^{B\times D}$($B$ 为词表大小),把每个向量替换为最近码本条目,其索引序列就是自回归模型看到的"图像token";解码器从量化向量重建图像。训练用向量量化损失 $\mathcal{L}_{VQ}=\|\mathrm{sg}(f)-z\|_2^2+\beta\|f-\mathrm{sg}(z)\|_2^2$ 加自编码损失(L2+LPIPS+GAN对抗损失)。

本文的研究对象就是这类tokenizer,其词表大小 $B$、判别器类型、语义损失等设计轴是全部案例分析的变量,不懂码本机制就无法理解"token空间不同导致损失不可直接比较"这一核心论点。

rFID(重建FID)

在ImageNet-1K验证集上计算真实图像与tokenizer重建图像两个分布之间的Fréchet Inception Distance,衡量重建的分布级保真度,数值越低越好。它是tokenizer论文最常报告的"下游无关"指标,配合PSNR/SSIM、LPIPS等共同描述重建质量。

论文的核心发现之一就是rFID与统一多模态训练中的"多模态可学习性"可能背离(如GigaTok-DINO把rFID从0.81降到0.51但VQAv2反而下降),理解rFID是什么才能体会这一反直觉结论的分量。

纯自回归统一多模态建模

用单一Transformer通过next-token prediction同时建模文本token和图像token(Chameleon、Liquid等路线)。典型序列格式如T2I为 $\{\text{prompt}\}\langle boi\rangle\{\text{image tokens}\}\langle eoi\rangle$,I2T则反过来以图像开头生成文本。它与强预训练语言模型兼容,图像与文本共享同一模型、同一词表和同一训练目标。

本文的测试床就是纯AR统一模型,四类验证损失(text/image/T2I/I2T)都定义在这种序列格式与损失掩码规则之上,这是理解实验设计的前提。

验证损失与缩放定律

留出集上的平均负对数似然 $\mathcal{L}=-\frac{1}{T(\mathcal{N})}\sum_{t}\sum_{i\in S(t)}\ln p(t_i|t_{<i})$,语言建模中经典的缩放定律指出它随算力/数据/模型规模近似幂律下降(log-log图上呈直线)。Kaplan等以此预测训练,Chameleon、Liquid等用它论证混合模态训练的稳定性。

整篇论文的方法论就是把逐任务验证损失当作测量信号,必须理解幂律缩放和"平均损失掩盖任务差异"的含义,才能读懂为何要按任务分别分析损失。

持续预训练与监督微调(SFT)

持续预训练指在已有文本预训练模型上继续用混合模态数据训练,把语言模型扩展为多模态模型;SFT则在指令遵循数据上短程微调,激发问答、生成等下游能力。本文采用WSD(Warmup-Stable-Decay)调度做持续预训练,再用cosine调度做2个epoch的SFT。

论文的损失-性能分析横跨两个阶段:预训练损失能否预测SFT后的基准表现是关键问题之一,训练配方(数据配比、学习率、batch size)也是被控制的实验变量。

点互信息(PMI)

$\mathrm{PMI}(x;y)=\log\frac{p(x,y)}{p(x)p(y)}$,衡量两个符号共同出现的频率超出随机共现的程度,是分布语义学中衡量词-词关联的经典量。论文用它度量图像token与物体类别词之间的统计关联强度。

第6.3节用PMI证明语义监督让图像token与COCO物体词绑得更紧("更好的视觉词汇"解释),这是理解tokenizer语义监督作用机制的量化证据。

研究动机

统一多模态模型(如Chameleon、Liquid、Emu3.5)用同一个自回归模型同时建模文本和图像token,其中离散图像tokenizer把像素转成可与文本并列建模的离散符号,本质上定义了语言模型必须学习、对齐和使用的"视觉语言"。然而现有tokenizer研究几乎都在联合建模语境之外进行:一条路线依赖下游无关指标,如ImageNet-1K上的重建FID(rFID)或zero-shot/线性探测分类准确率——但此前工作(UniTok、ETT等)已观察到更好的重建或分类指标并不必然转化为更好的下游表现;另一条路线通过仅生成或仅理解的端到端流水线报告基准分数,无法回答"图文token在同一模型、同一目标下联合建模时互相如何影响"。具体来说,GigaTok用DINO判别器把rFID从0.81降到0.51,没人验证过这个收益能否迁移到统一模型;UniTok加CLIP式语义损失使rFID变差,其对联合训练的影响同样未知。结果就是压缩率、辅助损失这些tokenizer设计决策,是在完全不了解其对图文联合建模影响的情况下被优化的。

本文的目标是本文的目标是建立一个受控的纯自回归持续预训练测试床,把tokenizer的影响从数据、模型和训练配方的混杂中剥离出来,系统回答:图像tokenizer作为"视觉语言"如何塑造统一多模态建模。技术上分三层:(1)构建基于Qwen3(0.6B/1.7B/4B,另有8B做配方验证)的持续预训练+监督微调配方,在冻结tokenizer、相同数据和超参的条件下比较不同视觉token空间;(2)定义text、image、T2I(文生图)、I2T(图生文)四个任务的验证损失,先搞清它们如何随数据和模型规模缩放、能否作为tokenizer比较信号,以及与下游生成/理解基准的相关性;(3)以损失为测量透镜,重审三个tokenizer设计轴——判别器类型、语义监督、词表大小——对联合建模和下游性能的影响,最终给出"tokenizer选择应同时考虑重建保真度与各任务联合建模难度"的可操作结论。

与已有工作不同的是,本文的独特切入是把tokenizer当作"视觉语言"而非预处理模块,并首次在图文联合训练语境下用逐任务损失系统研究它。与已有损失分析的差别在于:Kaplan等、Aghajanyan等的混合模态缩放定律、Chameleon的compute-loss曲线、Liquid的干扰分析、Tong的IsoFLOP视觉-语言不对称性,全都在固定token空间内用损失研究缩放或稳定性,而本文问的是"损失在跨图像tokenizer时应如何解读"。与ETT的差别在于:ETT把tokenizer与下游模型端到端联调,本文冻结tokenizer、比较固定的视觉词表空间,从而隔离token空间本身的因果效应。方法上的关键新意还有两处:一是提出词表归一化损失 $\mathcal{L}^*=\mathcal{L}/\log_2 B$ 来消除词表规模带来的数值尺度差异;二是识别出I2T损失因计算在共享文本词表上而成为跨tokenizer一致的诊断信号——这两点都源于"不同tokenizer定义不同预测空间"这一被以往工作忽视的视角。

核心方法

直觉上,图像tokenizer定义了语言模型要学的一门新语言,衡量这门语言好不好学,最直接的办法是看模型预测这些token时的验证损失,再检验损失能否预测下游生成与理解质量。技术路线分五步:(1)词表扩展——把预训练Qwen3(0.6B/1.7B/4B)的词表加入 $B$ 个可学习图像token嵌入(从匹配原嵌入均值与协方差的多元正态分布初始化),扩展LM head,并加入 $\langle boi\rangle$/$\langle eoi\rangle$ 特殊token,10%的T2I样本改为无条件生成以支持评测时的classifier-free guidance;(2)持续预训练——最大数据规模60M样本:6.6M纯文本(DataComp-LM)+53.3M图文对(LAION-Aesthetics美学分≥5.5并经InternVL3-1B重写caption、JourneyDB经GPT-3.5重写、BLIP3o-60K短caption),图文样本按80%:20%分配给T2I/I2T目标,图像统一缩放到256×256、切成16×16=256个token;(3)损失只计算在监督token上(条件next-token prediction,prompt和条件模态只作上下文不计损失);(4)SFT——在4.9M指令样本(1M LMSYS-Chat纯文本+2.9M Mini-Gemini多模态指令与caption+1M文生图样本)上微调2个epoch;(5)评测——GenAI-Bench(VQAScore)、MJHQ-30K(gFID)、VQAv2、GQA等。配方可靠性用8B模型对照Liquid-7B验证:GenAI 0.73 vs 0.72、VQA均值60.83 vs 61.40基本持平。

核心创新有四个层面。第一,逐任务损失分解:论文发现text、image、T2I、I2T四个损失虽都近似幂律缩放,但缩放模式和tokenizer排名彼此矛盾(UniTok文本损失最高却T2I损失最低),任何单一或平均损失都太粗糙——这与语言建模中"一个损失打天下"的惯例形成本质区别。第二,token空间不可比性及其校正:不同tokenizer定义不同的图像token空间,论文实证表明固定tokenizer时T2I损失与生成质量强相关(Pearson $r=-0.954$),但跨tokenizer时该关系系统性漂移;词表归一化 $\mathcal{L}^*=\mathcal{L}/\log_2 B$ 能消除IBQ家族内的部分漂移,残余差距与rFID相关;而计算在共享文本词表上的I2T损失天然提供了跨tokenizer的共同比较基准。第三,因果归因消融:通过把T2I样本改写成I2T格式、去掉图像token预测目标(Text+I2T训练),证明tokenizer对文本建模难度的跨模态影响来自图像token预测目标本身,而非caption任务。第四,用这套损失透镜揭示重建保真度与"多模态可学习性"可以背离——这是对"rFID越高越好"这一领域默认假设的直接挑战。

方法步骤详情

完整流程如下。步骤一,准备7个tokenizer作为自变量:IBQ-1024/8192/16384(0.1B,PatchGAN判别器,rFID分别为2.24/1.87/1.37)、GigaTok(0.6B,16384,带语义损失,rFID 0.81)、GigaTok-DINO(同上但换DINO判别器,rFID 0.51)、UniTok与UniTok-sem(作者自训的0.8B单码本变体,DINOv2-S判别器,rFID 1.86/2.23),统一为单码本、$K=16\times16$、输入256×256。步骤二,构建输入序列:T2I格式为 $\{\text{prompt}\}\langle boi\rangle\{\text{image tokens}\}\langle eoi\rangle\langle eos\rangle$,I2T为 $\langle boi\rangle\{\text{image tokens}\}\langle eoi\rangle\{\text{prompt}\}\{\text{text}\}\langle eos\rangle$,仅粗体监督token计入损失。步骤三,持续预训练:WSD调度(0.03预热比、最后20%线性衰减),0.6B模型上网格搜索lr∈{3e-5,1e-4}×batch size∈{512,1024,2048},因不同任务偏好不同超参,主实验取折中配置lr=3e-5、bs=512并复用于1.7B/4B;更大的学习率(0.6B的3e-4、4B的1e-4)导致损失尖峰。步骤四,计算四任务验证损失:留出50k纯文本+50k图文样本(与训练同分布,以LAION为代理),按训练同款掩码规则求平均负对数似然。步骤五,下游评测:预训练checkpoint直接测GenAI-Bench VQAScore与MJHQ-30K gFID;退火后再做SFT(cosine调度、峰值lr 5e-5、bs=1024、2 epochs)并复测生成与VQAv2/GQA理解。步骤六,诊断性消融:Text+I2T训练(去除图像生成目标)、PMI与n-gram熵测量、词表归一化损失 $\mathcal{L}^*$ 分析。

技术新颖性

技术新颖性体现在方法论而非模型结构上。其一,把"逐任务验证损失"升级为跨tokenizer比较的诊断工具,并指出了以往损失分析完全忽略的陷阱:T2I损失定义在不同的图像token空间上,跨tokenizer的绝对值不可比——这是一个看似简单但被整个领域忽视的度量学问题,词表归一化 $\mathcal{L}^*=\mathcal{L}/\log_2 B$(以 $B$ 元均匀分布的熵为参考)是第一个系统校正方案。其二,识别I2T损失作为跨tokenizer稳定信号:因为它计算在所有tokenizer共享的文本词表上,实验证明它在跨tokenizer、跨超参、跨规模下都与生成质量保持一致关系,甚至能中等程度预测SFT后的VQA表现——这给社区提供了一个无需训练下游模型即可比较tokenizer的实用信号。其三,Text+I2T消融设计巧妙地把"图像token预测"与"图像token作caption条件"两条通路解耦,证明跨模态干扰走前者、而I2T差异走后者,这是对图文互相影响机制的首个因果性证据。其四,对语义监督给出了"更好的视觉词汇"而非"更简单的局部视觉语法"的机制解释:PMI在COCO物体词上提升约+0.051 bits,而3-gram、7-gram经验熵反而更高。局限在于只覆盖单码本tokenizer和固定的token数与分辨率。

实验结果

论文有八条主要发现,逐一来看。(1)缩放行为按任务分化:在0.6B模型、12M/24M/48M数据以及0.6B/1.7B/4B模型、12M数据的网格上,四个损失都近似幂律下降,但模式不同——文本损失主要由语言模型初始化决定(数据缩放下几乎不动,约2.88-2.89),图像侧损失降幅大(LAION-T2I约从8.0降至6.5量级);T2I损失紧贴无条件图像损失,I2T损失虽算在文本上却与纯文本损失行为不同。没有任何一个tokenizer排名能跨任务成立:UniTok文本损失最高(约2.883)但T2I损失最低,GigaTok文本损失最低但T2I最高。(2)固定tokenizer时(GigaTok),T2I损失与GenAI VQAScore相关性达 $r=-0.954$(p=2.55e-18,$R^2=0.910$),与MJHQ gFID $r=+0.956$(p=2.48e-21);I2T损失也相关(GenAI $r=-0.917$),说明它捕捉了超越caption预测的训练进度。(3)跨tokenizer时T2I关系漂移而I2T保持一致;词表归一化后IBQ家族内关系更一致,同词表16384下固定GenAI=0.64时T2I损失与rFID负相关(重建越差、达到同等质量所需T2I损失越低)。(4)损失能预测SFT后表现:GigaTok内T2I-MJHQ $r=+0.973$($R^2=0.947$);跨tokenizer的I2T损失与GenAI $r=-0.859$、MJHQ $r=+0.877$、VQAv2 $r=-0.617$、GQA $r=-0.590$(中等相关);双种子复现VQAv2/GQA相对差异小于1%。(5)Table 3显示rFID与可学习性背离:GigaTok-DINO把rFID从0.81改善到0.51,但损失无一显著改善、GenAI持平于0.720、VQAv2从52.25降到51.31;UniTok-sem的rFID最差(2.23)却取得最低T2I损失(5.848 vs UniTok的6.264)、最低I2T损失(1.655)、更高GenAI(0.690 vs 0.670)和VQAv2(61.28 vs 57.21)。(6)图像token空间影响文本建模:UniTok-sem比UniTok、IBQ-1024比IBQ-8192在联合训练中文本损失更低(约0.01量级),去掉图像生成目标后该差距消失而I2T差距保留。(7)语义监督使I2T损失改善集中在COCO物体词上,PMI提高约+0.051 bits,但3/7-gram熵不降反升。(8)词表大小影响非单调:归一化后IBQ-8192的T2I/图像损失最低、IBQ-16384的I2T最好,但下游(GenAI、VQAv2)仍是最大的16384最佳,可能经由更高的重建保真度起作用。

Tokenizers studied in our framework: IBQ, GigaTok, and UniTok.
Table 1: Tokenizers studied in our framework: IBQ, GigaTok, and UniTok.
Recipe validation. Our 8B model obtains similar GenAI-Bench, WISE, and VQA (Mean) scores to Liquid-7B, while trailing on MJHQ-30K.
Table 2: Recipe validation. Our 8B model obtains similar GenAI-Bench, WISE, and VQA (Mean) scores to Liquid-7B, while trailing on MJHQ-30K.
Tokenizer comparison at 0.6B model scale.
Table 3: Tokenizer comparison at 0.6B model scale.
Validation losses scale with data size differently across tasks for the 0.6B model.
Figure 2: Validation losses scale with data size differently across tasks for the 0.6B model.
Validation losses scale with model size differently across tasks on 12M data.
Figure 3: Validation losses scale with model size differently across tasks on 12M data.
Both T2I loss and I2T loss align with text-to-image generation quality when tokenizer type is controlled.
Figure 4: Both T2I loss and I2T loss align with text-to-image generation quality when tokenizer type is controlled.
T2I loss does not align with text-to-image generation quality across tokenizers (the first two plots), while I2T loss aligns with generation quality (the last two plots).
Figure 5: T2I loss does not align with text-to-image generation quality across tokenizers (the first two plots), while I2T loss aligns with generation quality (the last two plots).
After vocabulary normalization, a more consistent T2I loss–performance relation exists across IBQ tokenizers.
Figure 6: After vocabulary normalization, a more consistent T2I loss–performance relation exists across IBQ tokenizers.
The T2I loss–performance relation shift is related to differences in reconstruction fidelity.
Figure 7: The T2I loss–performance relation shift is related to differences in reconstruction fidelity.
Both I2T and T2I loss show strong correlation with post-SFT generation performance when tokenizer type is controlled.
Figure 8: Both I2T and T2I loss show strong correlation with post-SFT generation performance when tokenizer type is controlled.
I2T loss shows moderate correlation with both generation and understanding performance after SFT across tokenizers.
Figure 9: I2T loss shows moderate correlation with both generation and understanding performance after SFT across tokenizers.
Changing the image token space can reduce interference between image-token and text-token modeling in joint training.
Figure 10: Changing the image token space can reduce interference between image-token and text-token modeling in joint training.
Semantic supervision strengthens object-level image-token–word alignment ("better visual words").
Figure 11: Semantic supervision strengthens object-level image-token–word alignment ("better visual words").
Semantic supervision does not consistently reduce empirical image-token n-gram entropy.
Figure 12: Semantic supervision does not consistently reduce empirical image-token n-gram entropy.
Vocabulary size changes task-specific validation losses with no simple monotonic trend.
Figure 13: Vocabulary size changes task-specific validation losses with no simple monotonic trend.
The largest vocabulary brings the best downstream performance among the IBQ variants.
Figure 14: The largest vocabulary brings the best downstream performance among the IBQ variants.
查看结构化数据
任务指标本文基线提升
统一多模态配方验证(文生图) GenAI-Bench VQAScore↑ 本文8B配方模型 0.73(持续预训练仅见60M样本) Liquid-7B 0.72(90M样本) +0.01,以约2/3的数据量追平,验证测试床可靠性
统一多模态配方验证(文生图) MJHQ-30K gFID↓ 10.55 Liquid-7B 5.47 落后(配方定位是可靠测试床而非SOTA)
视觉理解(SFT后) VQAv2 准确率↑ UniTok-sem 61.28(T2I损失5.848、I2T损失1.655) UniTok 57.21(T2I损失6.264、I2T损失1.670) +4.07,尽管其rFID更差(2.23 vs 1.86),证明语义监督改善可学习性
文生图(SFT后) GenAI-Bench VQAScore↑ UniTok-sem 0.690 UniTok 0.670 +0.020,语义监督同时提升生成
重建保真度 vs 下游(负迁移案例) rFID↓ / VQAv2↑ GigaTok-DINO:rFID 0.51,VQAv2 51.31,GenAI 0.720 GigaTok:rFID 0.81,VQAv2 52.25,GenAI 0.720 rFID改善0.30但VQAv2反降0.94——重建收益未转化为联合建模收益
损失-生成质量相关性(固定tokenizer) Pearson r(T2I损失 vs GenAI VQAScore) r=-0.954(p=2.55e-18,R²=0.910) I2T损失对照 r=-0.917(R²=0.841) 两者都强相关,验证损失可作为训练进度信号
损失-理解相关性(跨tokenizer,SFT后) Pearson r(I2T损失 vs VQAv2) r=-0.617(R²=0.380) GQA r=-0.590(R²=0.348) 中等相关,caption拟合信息量有限但不可忽略

局限与改进

作者明确承认的局限:研究范围限定在单码本tokenizer,多子码本方案被排除;固定了token数 $K=16\times16$ 和分辨率256×256,any-resolution和1D高压缩tokenizer留待未来;配方验证显示8B模型在MJHQ-30K上明显落后Liquid-7B(10.55 vs 5.47)、WISE也略低(0.38 vs 0.41),测试床是可靠的但非SOTA;I2T损失与VQAv2/GQA只是中等相关($R^2$约0.35-0.38),caption拟合不决定问答能力,对TextVQA等需要OCR能力的专项基准关系更不一致;词表超过16384后重建保真度与可学习性谁是主导因素尚不清楚。我自己的观察:其一,损失定义在有损的latent code上,绝对值不能像BPB那样解释为原始数据的描述长度,即使做了词表归一化,跨tokenizer比较仍需rFID辅助,实践中等于要同时看两个指标,可操作性打了折扣;其二,词表归一化只在IBQ家族内验证,其对其他架构的普适性未证;其三,绝大多数配置为单种子运行(仅一组GigaTok配置做了双种子检验,VQAv2/GQA相对差异<1%),相关性结论对随机性的稳健性证据有限;其四,60M样本、最多8B的规模相对工业实践偏小,Liquid曾发现模态间干扰随容量增大而消退,本文观察到的跨模态效应在大规模下是否保持同样强度未知;其五,rFID与T2I损失-性能关系残差的联系只是相关性证据,未建立因果。

独立分析的弱点

独立分析有五个弱点。第一,跨tokenizer的损失绝对值仍不可比:词表归一化 $\mathcal{L}^*=\mathcal{L}/\log_2 B$ 只消除词表规模因素,残余差距还与rFID相关,意味着实践者做tokenizer选型时依然要同时追踪损失与rFID两套指标,"用单一损失信号选tokenizer"的目标没有完全达成——改进方向是建立包含重建保真度的解析校正模型,或转向像素/比特域的可比量。第二,I2T损失对理解任务的预测力中等(VQAv2 $r=-0.617$,$R^2=0.380$),不能替代下游评测,对OCR类任务(TextVQA)更不可靠——改进方向是引入SFT后的损失或多任务加权损失,或按benchmark类型分桶建模。第三,设计轴覆盖窄:判别器只对比了PatchGAN vs DINO一种替换,语义监督只测了UniTok一种on/off,结论(如"DINO判别器无益联合建模")可能是特定实现的产物——改进方向是系统扫描多种判别器与语义目标(DINOv2不同层、SAM、CLIP变体)。第四,单种子为主、规模偏小,且论文自己指出文本损失的趋势不能单独归因于多模态持续预训练,0.6B-4B上成立的排序可能随规模漂移——改进方向是关键对比配2-3个种子,并加一个约10×算力的验证点。第五,测试床与SOTA有明显差距(MJHQ gFID 10.55 vs Liquid的5.47),在损失-性能关系更接近SOTA的训练区间是否同样成立存疑——改进方向是在更强配方(如加扩散头或更大图文数据)上复测关键相关性。

未来方向

作者明确提出的方向包括:研究any-resolution图像tokenizer(改变输入分辨率会改变可用视觉细节);研究可变 $K$ 或1D高压缩tokenizer(改变序列长度与token预算);把词表研究推进到 $B>16384$ 区间,厘清重建保真度与多模态可学习性谁是主导因素。基于本文成果可以自然延伸的方向:其一,把I2T损失做成"模型内tokenizer选择器"——用小型语言模型在几小时内筛选候选tokenizer而无需训练完整下游模型,形成可发布的自动化评测流程;其二,面向联合可学习性设计tokenizer训练目标,例如直接把I2T损失或图文PMI作为tokenizer训练的辅助项,验证"为联合训练而优化视觉词汇"是否可行;其三,对跨模态干扰做理论刻画(梯度冲突、表示几何、词表正交性),解释为何图像token预测目标会改变文本损失;其四,把损失透镜扩展到连续tokenizer与AR+扩散混合架构(BLIP3-o、Transfusion类)以及MoE统一模型,检验结论的架构普适性;其五,量化图像token空间对语言能力保持/遗忘的长期影响,为统一模型的tokenizer-语言模型联合设计提供依据。

复现评估

复现条件总体较好。数据全部公开:持续预训练用DataComp-LM、LAION-Aesthetics(美学分≥5.5)、JourneyDB、BLIP3o-Pretrain-Short-Caption,SFT用LMSYS-Chat、Mini-Gemini、BLIP3o-60K;语言骨干Qwen3(0.6B/1.7B/4B/8B)开源权重可直接下载;IBQ与GigaTok tokenizer有公开权重,UniTok两个变体(0.8B)由作者自己训练,需要约0.8B规模的tokenizer训练算力。论文给出了完整的配方细节:数据配比、序列格式、损失掩码规则、WSD/cosine调度参数、超参网格(lr∈{3e-5,1e-4}×bs∈{512,1024,2048})以及提示词列表(附录),验证集为与训练同分布的50k+50k样本,规则明确。算力方面,主实验以0.6B模型、60M样本、bs=512为主,单节点多卡在数天量级可完成单点实验,学术实验室可负担;但7个tokenizer×多超参×多规模的完整网格,加上每个配置的SFT和生成评测(GenAI-Bench、MJHQ-30K的VQAScore/gFID打分),总成本显著放大;8B配方验证需要更高算力。未明确声明代码开源(预印本),复现UniTok变体与数据预处理管道需一定工程量。综合评估:复现单点0.6B实验为中等难度,完整复现全部图表为中等偏高难度。