← 返回 2026-08-25

RIBOSPAN:面向多功能RNA建模的长上下文RNA基础模型 RIBOSPAN: A Long-Context RNA Foundation Model for Versatile RNA Modeling

Ziyuan Wang, Bohao Tang, Fei Zhang, Shuo Han, Pengfei Liu 📅 2026-08-24 👍 3 2026-08-30 18:30
RNA基础模型 mRNA设计 双向Transformer 掩码语言建模 离散扩散 长上下文

首个原生10240核苷酸上下文的十亿级双向RNA基础模型,统一长RNA表征学习与全长mRNA设计

前置知识

掩码语言建模(MLM)

BERT式预训练目标:随机选出部分token(如15%或40%位置),其中约80%替换为[MASK]、10%换成随机token、10%保持不变,让模型基于未被遮盖的双向上下文恢复原token,损失是被遮位置的负对数似然 $\mathcal{L}_{\mathrm{MLM}}=-\frac{1}{|M|}\sum_{i\in M}\log p_\theta(x_i|\tilde{x})$。

RIBOSPAN的全部预训练与重建评测都建立在这个目标上,两阶段掩码率(15%→40%)是全文最重要的实验变量之一。

RoPE与YaRN位置扩展

RoPE(旋转位置编码)把相对位置信息编码为注意力打分中的旋转操作。YaRN是推理时的上下文扩展技术:按旋转次数对高频/低频维做NTK-by-parts插值(文中 $\alpha=1,\beta=4$),并用注意力温度 $t(s)=1/(0.1\ln s+1)^2$ 重缩放logit,在不改权重的情况下扩大可用位置范围。

论文的核心对照之一就是「短上下文模型+YaRN外推」与「原生10K预训练」的表征质量差异,理解YaRN才能读懂第3.2节结论。

注意力隔离的序列打包

把微批次内多条变长序列按长度排序、贪心装入一个固定窗口(如10,240 token)的bin,省去padding浪费;同时用Transformer Engine的packed attention把注意力限制在各序列内部,位置索引在边界归零,保证序列之间零信息泄漏。

这是RIBOSPAN以85.7B token规模训练10K上下文的工程基础,也是其长上下文评测结论可信(无跨序列串扰)的前提。

离散扩散与AdaLN-Zero条件化

离散扩散生成:训练时按时间步 $t$ 将部分token替换为[MASK],模型学习一次恢复多个位置,目标 $\mathcal{L}_{\mathrm{diff}}=\mathbb{E}_t\frac{1}{tL}\sum_{i\in M_t}-\log p_\theta(x_i|z_t,c,t)$(MDLM式)。AdaLN-Zero则把条件 $c$ 通过调制MLP变成每层的scale/shift/gate参数注入网络。

论文第4节的全长mRNA生成框架完全建立在这两者之上,同义密码子扩散是在此基础上对CDS搜索空间的约束。

零样本突变适应度评分(masked-marginal)

不训练任何任务头,直接用预训练模型打分:把所有突变位置同时遮盖、其余位置保留野生型序列,取 $s(x^{mut})=\sum_{i\in M}[\log p_\theta(x^{mut}_i|\tilde{x})-\log p_\theta(x^{WT}_i|\tilde{x})]$ 作为该突变的适应度分数,再与实验测量的DMS适应度算Spearman相关。

RNAGym基准的统一评测协议,理解表8中RIBOSPAN与RNA-FM、Evo2-7B对比的前提。

线性探针(linear probing)

冻结预训练模型的全部参数,只把表征(如最终层mean-pooling后的序列向量)输入Ridge回归或L2逻辑回归等线性模型来预测下游标签。探针越强说明表征本身线性可分性越好,排除了微调能力的干扰。

mRNABench六大任务和RNA类型10-NN基准都用这一范式,是理解「RIBOSPAN表征质量最优」这一主张的评测方式。

研究动机

mRNA是模块化注释但功能高度耦合的分子:5′ UTR、CDS、3′ UTR共同决定翻译起始与延伸、RNA折叠、分子稳定性、亚细胞定位以及与RNA结合蛋白的相互作用,一个区域的序列改动可能通过结构重排波及通常归因于另一区域的表型,这对治疗性/合成mRNA的多约束设计(翻译效率、稳定性、可制造性)尤为关键。现有RNA基础模型难以支撑这种全转录本建模:代表性密集双向编码器RNA-FM、RiNALMo、AIDO.RNA的预训练上下文仅约1,024 token,而成熟mRNA经常超过该长度,只能截断或分块,完整上下文信息被迫丢弃。两条「加长序列」的路线又各有取舍:EVA等decoder-only因果模型只看上游,每个位置的表征无法同时整合两侧信息;HydraRNA(状态空间混合架构)、RNAret(线性retention)、BiRNA-BERT(BPE把多个核苷酸压成一个token)虽然降低算力,却要么放弃了每层的全连接核苷酸交互,要么牺牲了固定的单核苷酸分辨率。

本文的目标是本文的目标是填补一个明确的能力空白:训练首个同时具备单核苷酸tokenization、所有层密集双向自注意力、十亿级参数量、并以10,240 nt原生上下文预训练的RNA基础模型,让5′ UTR、CDS、3′ UTR及其跨区依赖落入统一的高分辨率表征空间。具体拆成三件事:一是在RNAcentral v26.0加Ensembl的6,760万条序列、857亿核苷酸token上,以1.61B参数、10,240 token原生窗口做两阶段掩码预训练;二是建立首个系统性评估RNA长上下文表征的基准,度量长程信息整合、上下文表征组织与扰动传播的空间范围;三是在同一骨干上构建首个基于长上下文基础模型的全栈mRNA设计框架,支持全长生成、全转录本重设计以及保持蛋白序列的同义密码子优化。

与已有工作不同的是,本文最独特的切入是「原生长期预训练不可被事后位置扩展替代」这一可检验的论断。作者承认Position Interpolation、YaRN等RoPE类方法能扩大预训练模型的可用位置范围,但指出位置扩展只改变位置编码的几何,从未让骨干在预训练阶段见过全长转录本尺度的序列交互,因此学不到跨UTR-CDS的真实远程依赖。与效率架构路线(SSM/线性注意力)不同,本文坚持每层dense all-to-all注意力;与BPE token压缩路线不同,坚持单核苷酸固定分辨率。工程上提出注意力隔离的变长序列打包,让10K窗口以高利用率训练而互不泄漏;方法学上则首创把「长上下文表征质量」本身变成可测量对象——通过成分保持的局部重排构造配对干预,用 $\Delta\mathrm{CS}$、$C_{\mathrm{cross}}$、$D_{\mathrm{distal}}$ 三个指标量化上下文敏感性与扰动局域性的权衡,从而能公平比较短上下文外推、YaRN扩展、高效架构与原生长期模型。

核心方法

核心直觉:要让模型理解完整mRNA,就必须让它在训练时「见过」完整mRNA——不是靠推理时外推位置编码,而是在10,240 nt窗口内直接做掩码重建。技术上,RIBOSPAN是1.61B参数的32层pre-norm双向Transformer编码器:维度2,048、32头(每头64维)、FFN 5,440(SwiGLU)、RoPE旋转维64、词表16(单核苷酸+[CLS]/[SEP])。语料合并RNAcentral v26.0(13个RNA类)与Ensembl 115/Ensembl Genomes 62中带完整CDS和UTR注释的蛋白编码转录本,经归一化(U→T)、去重后共6,757万条训练序列、857亿token,另按类和物种分层构建9万条验证/测试集。训练在Megatron-LM改造的BERT流水线上以BF16进行:15%掩码率训6个epoch,再以40%掩码率续训2个epoch,全局batch 2,048条序列。

核心创新由三个「第一」构成。其一,架构组合上的空白填补:此前没有任何RNA模型同时做到单核苷酸tokenization、全层密集双向自注意力和≥10K原生上下文的十亿参数——密集编码器只有1K上下文,长上下文模型要么是因果注意力(EVA),要么用SSM/线性机制(HydraRNA、RNAret)或token压缩(BiRNA-BERT)。论文用严格对照证明原生上下文本身的因果贡献:同语料、同架构、同mask schedule下,10K-15在10,240 token处的MLM loss为0.724,而同规模的1K-15直接外推恶化到0.982,差距只能归因于预训练窗口长度。其二,注意力隔离序列打包:多条RNA按长度贪心装入10K bin,attention限制在各序列内部、位置索引边界重置、padding不计损失,兼顾了效率与正确性。其三,方法学创新:用「成分保持的局部重排」作为配对干预,把长上下文表征质量分解为上下文分化和扰动局域性两个正交维度,首次揭示YaRN「恢复分化但扩散失控」与SSM「限制扩散但分化不足」的互补缺陷。

方法步骤详情

步骤一,数据治理:三源独立清洗,统一大写、U→T、非法符号→N,SeqKit精确去重;Ensembl转录本按注释完整性(CDS/起止密码子/两侧UTR齐全)、编码一致性(CDS长为3的倍数)、序列质量(N≤5%、无>50 nt同聚物)过滤。步骤二,样本构造:每条RNA加[CLS]/[SEP],超长截断;按长度排序贪心装箱进10,240 token的bin,packed attention隔离各序列边界、位置索引重置。步骤三,两阶段MLM:选中位置80%换[MASK]、10%随机、10%不变(span≤3 nt);15%掩码训6 epoch(AdamW,峰值LR $5\times10^{-5}$,cosine),再以40%掩码续训2 epoch(LR $1\times10^{-5}$),得到10K-15/10K-40/1K-15/1K-40四个变体。步骤四,评测:mRNA重建(MLM loss+argmax恢复率)、长上下文基准(对中心区间做成分保持重排,算ΔCS、Ccross、Ddistal)、冻结表征RNA类型10-NN、RNAGym零样本masked-marginal评分、mRNABench线性探针。步骤五,生成:骨干上接AdaLN-Zero条件化离散扩散块,时间步 $t$ 与设计条件 $c$ 经调制MLP注入每层,MDLM式目标训练,CDS去噪限制在同义密码子等价类内以保持蛋白序列。

技术新颖性

新颖性首先在于「组合即创新」:单核苷酸分辨率×每层密集双向注意力×10K原生上下文×十亿参数的四元组在RNA领域此前是空白,而且作者没有停留在组合,而是用1K/10K双分支对照实验把「原生上下文」从相关因素提升为因果因素——四个变体共享语料、架构与mask schedule,性能差异只能来自预训练窗口。其次,长上下文表征基准是全新的评测学贡献:成分保持重排排除了核苷酸身份这一混杂变量;$\Delta\mathrm{CS}$ 度量重排后区域分离的增量、$C_{\mathrm{cross}}$ 度量跨区同碱基相似度、$D_{\mathrm{distal}}$ 只在最远25%位置上度量表征漂移,三者共同刻画了一个此前无法量化的问题——上下文敏感性与扰动局域性之间的权衡,并据此诊断出YaRN与HydraRNA的对称缺陷。第三,同义密码子扩散把离散扩散的搜索空间约束到保持编码蛋白的等价类内,是「蛋白保持式CDS优化」与「全转录本联合生成」在长上下文骨干上的自然统一,此前GEMORNA需分区建模、mRNAutilus面向去噪而非表征迁移。

Architecture and downstream use of RIBOSPAN. Single-nucleotide RNA sequences are encoded by 32 bidirectional Transformer layers into transferable nucleotide-level representations for downstream RNA modeling.
Figure 1: Architecture and downstream use of RIBOSPAN. Single-nucleotide RNA sequences are encoded by 32 bidirectional Transformer layers into transferable nucleotide-level representations for downstream RNA modeling.
Overview of the RIBOSPAN-based conditional discrete-diffusion framework for full-length mRNA generation and redesign. Diffusion timesteps and design conditions are incorporated through AdaLN-Zero-conditioned blocks to guide nucleotide denoising, with synonymous-codon constraints for CDS-preserving optimization.
Figure 5: Overview of the RIBOSPAN-based conditional discrete-diffusion framework for full-length mRNA generation and redesign. Diffusion timesteps and design conditions are incorporated through AdaLN-Zero-conditioned blocks to guide nucleotide denoising, with synonymous-codon constraints for CDS-preserving optimization.

实验结果

重建:10,240 token、15%掩码下10K-15的MLM loss为0.72417、全局恢复准确率94.76%,而同规模1K-15直接外推恶化到0.98153、AIDO-CDS为1.15072;40%重掩码续训把重腐蚀下10K恢复率从0.83769提升到0.85887。长上下文基准(10,240 nt):10K变体ΔCS约0.406、Ccross约0.30、Ddistal仅0.0008-0.0012;短模型加YaRN虽恢复ΔCS至0.41-0.45,但Ddistal暴涨一个数量级以上(0.016-0.030);HydraRNA扩散最小(0.000667)却ΔCS仅0.314、Ccross高达0.522。冻结RNA类型10-NN(89,955条、25类):10K-15准确率0.8989、纯度0.8593,全面超过RNA-FM(0.8650)、RiNALMo、AIDO-CDS(0.8051)、HydraRNA;长RNA(>1,024 nt)优势最显著(0.8894 对 0.8099),8类中6类纯度最高;Rfam上RNA-FM(0.9905)略胜。RNAGym零样本(70个assay、111.7万突变):1K-40最优(Spearman 0.2524、AUROC 0.6280、MCC 0.1904),四个checkpoint全部超过外部编码器,仅逊于7B decoder-only的Evo2-7B(0.2760)。mRNABench线性探针:10K-15总体最强,HL 0.6522、MRL 0.4827、TE 0.7610、eCLIP 0.4767,六任务中五项第一;唯一例外VEP由1K-15拿下(0.3480),提示短上下文保留局部变异敏感性,10K优势集中在需跨区整合的转录本级表型。

Backbone configuration of RIBOSPAN.
Table 1: Backbone configuration of RIBOSPAN.
RNA-class composition of the pretraining corpus and held-out sets.
Table 2: RNA-class composition of the pretraining corpus and held-out sets.
RIBOSPAN pretraining variants.
Table 3: RIBOSPAN pretraining variants.
Masked language modeling loss on the mRNA subset of the pretraining test split.
Table 4: Masked language modeling loss on the mRNA subset of the pretraining test split.
Global nucleotide reconstruction accuracy on the mRNA subset of the pretraining test split.
Table 5: Global nucleotide reconstruction accuracy on the mRNA subset of the pretraining test split.
Final-layer long-context representation metrics at 10,240 nt.
Table 6: Final-layer long-context representation metrics at 10,240 nt.
RNA-type representation quality measured by leave-one-out 10-NN accuracy and neighborhood purity.
Table 7: RNA-type representation quality measured by leave-one-out 10-NN accuracy and neighborhood purity.
Zero-shot mutation-fitness performance on RNAGym.
Table 8: Zero-shot mutation-fitness performance on RNAGym.
Frozen full-transcript linear-probe performance on mRNABench.
Table 9: Frozen full-transcript linear-probe performance on mRNABench.
Hyperparameters for RIBOSPAN pretraining.
Table 12: Hyperparameters for RIBOSPAN pretraining.
Long-context representation metrics at 1,024–8,192 nt.
Table 13: Long-context representation metrics at 1,024–8,192 nt.
Paired model comparisons at 10,240 nt.
Table 15: Paired model comparisons at 10,240 nt.
RNAGym performance by RNA category.
Table 23: RNAGym performance by RNA category.
Length sweep of final-layer long-context representation metrics. ∆CS, Ccross, and Ddistal are shown across input lengths; error bars denote 95% bootstrap confidence intervals.
Figure 3: Length sweep of final-layer long-context representation metrics. ∆CS, Ccross, and Ddistal are shown across input lengths; error bars denote 95% bootstrap confidence intervals.
t-SNE visualization of frozen RNA sequence representations across Overall Biotype, Functional, Regulatory, Long RNA (> 1,024 nt), and Rfam label spaces.
Figure 4: t-SNE visualization of frozen RNA sequence representations across Overall Biotype, Functional, Regulatory, Long RNA (> 1,024 nt), and Rfam label spaces.
查看结构化数据
任务指标本文基线提升
mRNA掩码重建(10,240 token,15%掩码) MLM loss(越低越好) RIBOSPAN-10K-15:0.72417 AIDO.RNA-CDS直接外推:1.15072;RIBOSPAN-1K-15外推:0.98153 loss降低约37%(相对1K自身外推)
mRNA全局重建(10,240 token,40%掩码) 全序列argmax恢复准确率 RIBOSPAN-10K-40:0.85887 AIDO.RNA-CDS:0.77791;RIBOSPAN-1K-40外推:0.80264 准确率提升约8.1个百分点(对AIDO-CDS)
长上下文表征(10,240 nt) ΔCS(上下文分离增量,越高越好) RIBOSPAN-10K-15:0.405962 HydraRNA:0.313846;AIDO-CDS直接外推:0.208178 较HydraRNA高约29%
长上下文表征(10,240 nt) D_distal(远端表征扩散,越低越好) RIBOSPAN-10K-15:0.000785 AIDO-CDS+YaRN:0.025390 扩散降低约32倍
冻结RNA类型检索(Overall Biotype,89,955条25类) leave-one-out 10-NN准确率 RIBOSPAN-10K-15:0.898861 RNA-FM:0.865033;HydraRNA:0.861264 提升约3.4个百分点
冻结RNA类型检索(Long RNA,>1,024 nt) 10-NN准确率 RIBOSPAN-10K-40:0.891010 RNA-FM:0.809924;RiNALMo:0.755867 提升约8.1个百分点(对RNA-FM)
零样本突变适应度(RNAGym,70 assay/111.7万突变) Spearman r RIBOSPAN-1K-40:0.2524 最佳外部编码器RiNALMo:0.2080;Evo2-7B(decoder-only):0.2760 较最佳外部编码器提升约21%;编码器中第一
全转录本性质预测(mRNABench-HL) Pearson r RIBOSPAN-10K-15:0.6522 HydraRNA:0.6228;AIDO-CDS:0.5613 提升约2.9个百分点
全转录本性质预测(mRNABench-TE) Pearson r RIBOSPAN-10K-15:0.7610 HydraRNA:0.7505;RNA-FM:0.6045 提升约1.1个百分点
RNA结合蛋白结合(mRNABench-eCLIP,40个子任务) AUPRC RIBOSPAN-10K-15:0.4767 HydraRNA:0.4611;RNA-FM:0.3507 提升约1.6个百分点

局限与改进

作者承认或明显留白的局限:其一,生成框架只给出形式化描述,没有任何生成质量、性质达成度或湿实验数据,RL后训练闭环整体推迟到「即将发表的期刊论文」,「全栈设计框架」目前是半成品;其二,RNAGym上绝对预测力仍低(最佳Spearman 0.2524、AUROC 0.628),离可靠突变效应预测有距离;其三,长上下文基准仅50条转录本(5个长度组×10条),虽有bootstrap、配对dz与BH校正,样本量限制了统计功效。我自己的观察:10K模型在变异中心任务(RNAGym、VEP)稳定输给自己1K版本,作者仅以「短上下文保留细粒度局部敏感性」假说解释,无机制分析或消融;mRNABench超长序列(eCLIP最长约20.5万nt)仍需分块加长度加权平均,10K上下文并未端到端覆盖全长;语料U→T并丢弃非ACGT符号,修饰碱基信息全部丢失;与RiNALMo等基线的训练token数与算力不对齐,冻结表征优势有多少来自85.7B大语料而非10K上下文,并未完全解耦。

独立分析的弱点

弱点一:生成能力完全未经验证。扩散框架没有多样性、结构正确性、5′ UTR活性或翻译效率的任何定量结果,mRNA药物最关心的免疫原性等指标缺席;改进方向是补齐与mRNAutilus、GEMORNA的统一生成基准对比并给出湿实验闭环数据。弱点二:评测与训练分布同源。RNA类型基准直接取自预训练held-out测试集,Rfam家族内高度同源序列可能互为近邻,10-NN分数有同源泄漏风险;改进是做物种级或家族级隔离的去同源划分。弱点三:密集双向注意力在10K上下文上算力与显存随长度平方增长,论文未报告吞吐、延迟或与FlashAttention的对比,落地成本不明;可给出效率剖析或蒸馏到线性变体。弱点四:$D_{\mathrm{distal}}$ 低被正面解读为「远程传播校准良好」,但表征对远端扰动几乎不动也可能是表征僵化,无法编码真实的长程功能耦合(如ORF-UTR翻译调控互作);应用有真值的远端依赖数据集做正反两向验证。弱点五:15%→40%两阶段掩码是经验选择,缺少掩码率、阶段长度与上下文长度的联合scaling曲线,宜发布小规模消融供社区低成本复用配方。

未来方向

作者明确规划的:完整RIBOSPAN设计系统——把RNA性质预测器作为奖励/反馈、以强化学习后训练形成闭环多维序列优化,连同模型checkpoint与设计序列的生物学功能评估将在期刊版发表。基于本文成果可自然延伸的:把长上下文表征基准扩展为社区标准,纳入远端结构接触、RBP结合位点等有真值的长程依赖读出;在10K骨干上做全转录本二级结构预测与antisense/siRNA靶点设计;系统研究「上下文长度×掩码率×数据量」的scaling law,特别是解释并修复1K/10K在变异任务上的权衡(例如局部-全局双分辨率输出头);将同义密码子扩散与mRNA稳定性和免疫逃逸目标(避免dsRNA、优化修饰核苷兼容性)结合成多目标RL;把 $\Delta\mathrm{CS}$/$D_{\mathrm{distal}}$ 这类干预式诊断迁移到蛋白质与全基因组基础模型上评估其长上下文健康度;以及在VEP上引入跨区上下文感知的微调,检验10K表征经任务适配后能否反超1K版本。

复现评估

复现条件总体较好。开源:论文给出GitHub代码库与HuggingFace权重入口,1.61B参数、BF16格式。数据全公开且清洗规则完备:RNAcentral v26.0、Ensembl 115、Ensembl Genomes 62,附录给出逐条过滤标准(表11)、数据划分(表10)与全部超参(表12:batch 2,048、峰值LR 5e-5/1e-5、cosine、2,000步warmup、6+2 epoch)。评测协议高度可复现:RNAGym用官方流程与统一masked-marginal评分,mRNABench v1.2.2固定10个种子切分与线性探针,长上下文基准的重排构造、采样与统计检验(bootstrap、Cohen's dz、BH校正)全部公式化。主要门槛在预训练算力:857亿token×8 epoch的10K密集注意力训练估计需数十张A100/H100级GPU运行数周,普通实验室难以从零复现,但下载权重后做探针、微调与评测单卡即可;生成框架因RL后训练未随本文发布,设计流水线暂无法完整复现。