1. RNA二级结构预测的背景与挑战

RNA二级结构预测是计算生物学和生物信息学领域的核心问题之一。RNA分子通过碱基配对形成的二级结构直接影响其三维构象和生物学功能。准确预测RNA二级结构对于理解非编码RNA的调控机制、设计RNA疫苗和RNA药物具有关键意义。

传统预测方法主要分为两类:基于热力学模型的算法(如RNAfold)和基于统计学习的算法(如CONTRAfold)。这些方法虽然计算效率高,但在复杂结构(如假结)预测上表现有限。近年来,深度学习技术特别是卷积神经网络(CNN)和预训练语言模型的应用,显著提升了预测精度。例如,SPOT-RNA和UFold等模型通过端到端学习,在某些基准测试中达到了接近实验解析的准确率。

然而,现有评估体系存在三个关键缺陷:

  1. 数据集冗余问题 :主流基准(如ArchiveII)仅通过序列相似性去重,导致训练集和测试集可能包含结构高度相似的RNA
  2. 评估指标局限 :传统指标如F1分数只评估碱基对恢复率,无法反映高阶拓扑结构的正确性
  3. 泛化能力高估 :模型在已知RNA家族内表现良好,但在新家族或低相似度序列上性能骤降

关键发现:我们的实验表明,基于预训练语言模型的预测器在标准测试集上F1分数可达0.75+,但在严格去重的分布外测试中可能降至0.2以下,而传统热力学方法保持0.3左右的稳定表现。

2. CHANRG基准的设计原理

2.1 结构感知的数据去冗余流程

CHANRG基准从Rfam 15.0数据库的1000万条序列出发,采用三级过滤管道:

  1. 序列完整性筛查 :剔除含有非标准碱基或结构注释不完整的序列
  2. 高严格度序列去重 :使用CD-HIT在99%相似度阈值下聚类
  3. 结构层面去冗余 :基于bpRNA-CosMoS算法计算结构相似性,移除CosMoS得分>0.9的冗余结构

经过处理,最终得到170,083条结构非冗余的RNA序列。值得注意的是,在序列去重后,结构去重仍移除了33倍的冗余序列,这表明许多序列差异较大的RNA可能具有高度相似的二级结构。

2.2 层次化分割策略

CHANRG采用基于RNA架构分类体系的分割设计,包含五种评估场景:

分割类型 序列数 描述 生物学意义
验证集(Val) 14,070 分布内评估 标准性能基准
测试集(Test) 14,070 分布内评估 方法比较
GenA 12,499 "复杂未分类"架构 结构类型迁移
GenC 4,424 训练未见的RNA家族 进化距离测试
GenF 1,797 低多样性家族 稀疏数据挑战

这种设计能系统评估模型在三种分布外(OOD)场景下的泛化能力:新型结构类型(GenA)、远缘进化关系(GenC)和有限训练样本(GenF)。

3. 深度学习方法在CHANRG上的表现

3.1 三类预测器的比较

我们评估了29种预测方法,可分为三大类:

  1. 结构化解码器(SD) :如EternaFold、RNAfold,结合热力学模型与统计优化
  2. 直接神经预测器(DL) :如SPOT-RNA、bpFold,直接学习序列到结构的映射
  3. 基础模型预测器(FM) :如RNA-FM、ERNIE-RNA,使用预训练语言模型作为特征提取器

在标准测试集(Test)上,FM类以平均0.673的F1分数领先,DL类为0.349,SD类为0.302。但在OOD场景下,FM类平均保留仅26.7%的性能,而DL类和SD类分别保留82.5%和92.3%。

3.2 典型模型案例分析

以表现最佳的FM模型RiNALMo-giga为例:

  • Test集:F1=0.7579
  • GenA:F1=0.2509(下降66.9%)
  • GenC:F1=0.1651(下降78.2%)
  • GenF:F1=0.2260(下降70.2%)

相比之下,传统方法RNAfold在Test集F1=0.3013,在OOD场景平均仅下降4.2%。这种"性能反转"现象表明,当前深度学习模型可能过度拟合训练数据的结构模式。

4. 泛化挑战的深层原因

4.1 长度因素的影响

通过控制序列长度(50-200nt)的对比实验,我们发现:

  • GenA序列中位长度211nt,长于Test集的128nt
  • GenC(93nt)和GenF(89nt)则短于Test集
  • 长度匹配后FM类的OOD缺陷依然存在

这表明序列长度差异不能完全解释泛化差距,结构新颖性才是关键因素。

4.2 结构覆盖与连接错误

通过多尺度评估指标,我们识别出FM模型的两类典型错误:

  1. 覆盖失败 :在OOD场景下,FM模型的召回率从0.61骤降至0.14,表明大量真实碱基对未被预测
  2. 连接错误 :即使正确预测了局部螺旋区域,全局拓扑结构的组装正确率不足20%

例如在一个109nt的GenA案例中:

  • RiNALMo-giga预测了64%的碱基对
  • 但拓扑F1仅0.045,远低于RNAfold的0.185
  • 模型将正确预测的螺旋错误连接成完全不同的架构

5. 技术实现与优化

5.1 无填充计算框架

传统实现使用密集张量并填充至批次内最长序列,导致:

  • 平均38%的计算资源浪费在填充区域
  • 预测结果可能受批次组成影响(最高3%的预测翻转)

我们开发了基于NestedTensor的参考实现,特点包括:

  1. 动态处理变长序列,排除填充位置
  2. 对称性感知:输出层执行(y + y⊤)/2平均
  3. 相比密集实现,降低3.3倍延迟和6.7倍内存占用

5.2 评估指标体系

CHANRG采用四级评估指标:

  1. 碱基对F1:局部配对恢复率
  2. 茎区F1:螺旋段识别准确率
  3. 拓扑F1:高阶结构组装正确率
  4. 拓扑图编辑距离(GED):整体结构相似性

这种多层次评估能更全面地反映预测质量,特别是捕捉高阶结构错误。

6. 实践建议与未来方向

基于CHANRG的评估结果,我们提出以下建议:

对于方法开发者

  • 不应仅优化标准测试集性能
  • 需要在架构设计中显式考虑OOD泛化
  • 结合物理约束(如热力学稳定性)可能提升鲁棒性

对于使用者

  • 对已知RNA家族,FM模型仍是最佳选择
  • 对新发现或稀有RNA,传统方法可能更可靠
  • 应同时查看碱基对和拓扑指标

未来研究方向包括:

  • 开发融合物理原理与深度学习的混合模型
  • 设计针对结构泛化的训练策略
  • 扩展至三级结构预测

CHANRG基准和评估工具已开源,为社区提供了更严格的测试平台。这项工作揭示了当前RNA结构预测深度学习方法的局限性,也为开发真正通用的预测工具指明了方向。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐