走进学院
学院资讯
科研动态
学生培养

DNA序列越长越好?北京中关村学院团队提出基因表达预测新框架Prism

日期: 2026-04-30

仅凭一段 DNA 序列及其对应的表观遗传信息,能否预测出细胞中基因的表达水平?这是基因组学的核心难题之一。

近日,北京中关村学院、中国人民大学高瓴人工智能学院团队在国际顶级机器学习会议 ICLR 2026 上以 Oral 口头报告形式发表研究成果,提出轻量级框架 Prism。该工作系统指出了当前基因表达预测领域 “一味追求更长序列” 这一思路的局限,转而聚焦于如何有效整合基因附近的多模态表观基因组信号,学习高维特征的多种组合,消除其中的混淆干扰。最终,Prism 以仅 2,000 个碱基对的短序列输入,在两种人类细胞系的全部评测指标上超越了此前的方法。

论文链接:https://arxiv.org/abs/2602.21550

延长序列,究竟有没有用?

基因的表达受到调控元件的驱动,而这些增强子有时位于目标基因数十万个碱基对以外。这一生物学事实,使得 “输入更长的 DNA 序列让模型看得更远” 成为过去几年的主流研究方向。状态空间模型(SSM)因其线性复杂度而兴起,Caduceus、Seq2Exp 等方法相继在 20 万碱基对的超长序列上报告了更好的预测结果。

研究团队设计了一组系统实验,在训练阶段将输入序列的长度从 100 个碱基对依次变化到 10,000 个碱基对,直接观察性能的变化情况。结果显示,Caduceus 的预测准确率在输入超过 2000 个碱基对后持续下降;Seq2Exp 虽引入了掩码机制以过滤无关区域,但其在 20 万碱基对上取得的成绩,与仅用 500 个碱基对时基本相当,本质只是减缓了增加输入长度带来的性能下降,而非真正利用长序列信息提升了性能。

团队进一步对在 20 万碱基对训练的 Seq2Exp 模型进行测试阶段长度截断实验发现,即便在推断时输入压缩到 2,500 个碱基对,模型性能也几乎没有变化,表明 Seq2Exp 并没有真正学会利用远端序列中的调控信息;即便是基于超长序列训练的模型,其实际依赖的也只是转录起始位点附近的近端区域。

 

ScreenShot_2026-04-30_155112_763.png不同输入序列长度下各模型的预测性能对比

ScreenShot_2026-04-30_142607_233.png

测试阶段缩短输入长度实验(Shortening at test time)

被长期忽视的关键:近端信号

既然长序列的收益有限,在当前机器学习建模中,真正影响预测质量的因素是什么?

研究团队的答案是:基因转录起始位点附近的多模态表观基因组信号。基因表达具有细胞类型特异性,同一段 DNA 序列在不同细胞中的表达水平可以相差悬殊。H3K27ac(活跃调控元件的组蛋白乙酰化标志)、DNase-seq(染色质可及性)、Hi-C(染色质空间组织)等表观基因组信号,正是细胞特异性调控状态的直接载体。空间上看,增强子虽然可能距离目标基因较远,但远端调控元件可通过染色质环化等三维结构与启动子区域发生联系;因此,基因近端的 H3K27ac、DNase-seq 等表观基因组信号可能在一定程度上反映远端调控状态。这为短序列结合表观基因组信号仍能取得较好预测效果提供了生物学解释。

研究团队系统评估了各类信号的单独贡献。H3K27ac 的加入带来了较为显著的性能提升,与其直接标记活跃调控元件的生物学功能高度吻合,因此被界定为前景信号;DNase-seq 和 Hi-C 反映的是背景染色质状态,单独加入时增益有限,属于背景信号。

然而,当研究者将所有信号拼接后一起输入模型训练时,一个问题随之出现:如果在测试阶段移除背景信号,模型性能会出现严重下降,尽管这些信号的独立贡献本来很小。这说明,简单拼接的方式可能使模型对背景染色质状态形成非稳健依赖。尽管 DNase-seq、Hi-C 等信号能够反映染色质开放性和三维结构信息,但它们与基因表达之间的关系并不总是稳定对应;在特定训练数据中,模型可能利用这些背景状态中的统计相关性进行预测,从而降低对信号缺失或分布变化的鲁棒性。

 

ScreenShot_2026-04-30_142632_573.png

各类表观基因组信号对预测性能的贡献分析

(左)单独加入每类信号时的性能变化;(右)在训练时使用全部信号、测试时分别移除各类信号后的性能变化。前景信号贡献显著,移除背景信号则导致性能明显下降。

Prism:有效整合多模态信号

针对上述混淆问题,研究团队提出了 Prism 框架,其核心目标是:让模型充分利用多模态表观基因组信号中的有效调控信息,同时对背景染色质状态保持鲁棒,不被虚假关联所误导。

Prism 由三个模块构成。信号编码器将原始表观基因组信号编码为高维特征表示,提取其中的调控信息。混淆因子编码器是方法的核心,这是一个轻量级的一维卷积网络,通过无监督方式自动学习 n 组权重向量,每组向量代表一种高维空间中背景染色质状态的组合方式,无需任何人工标注。在训练阶段,Prism 对全部学到的加权后的高维背景状态施加后门调整(Backdoor Adjustment),来减缓模型对于某一个特定的染色体状态可能的过度虚假依赖。预测器则以 Caduceus 模型为骨干,融合 DNA 序列和经过干预校正后的表观基因组特征,输出最终的基因表达预测值。

 

151414_435.pngPrism整体架构图。表观基因组信号S同时输入信号编码器gθ和混淆因子编码器gω,后者无监督学习n组背景状态权重向量C;预测器h⬚结合DNA序列X与经因果后门调整后的表观基因组特征,输出基因表达预测值Y。

 

Prism 的训练损失由三部分组成:标准预测损失、正则化损失(使模型对背景状态的变化保持稳定)以及促进不同背景状态表示多样性的均匀损失。在参数量方面,Prism 的混淆因子编码器仅在 Caduceus(574K 参数)基础上额外引入约 11K 参数,总量为 585K,不到 Seq2Exp(110 万参数)的一半。

Prism 的实验结果

研究在覆盖 18,377 个蛋白编码基因的 K562 和 GM12878 两种人类细胞系上进行了全面评测,与 Enformer、Caduceus、EPInformer、Seq2Exp 等多个代表性基线方法进行对比。

结果清晰地表明,Prism 在所有细胞系和全部评测指标上均超越了此前的方法。在 GM12878 细胞系上,Prism 的 Pearson 相关系数达到 0.9016,超越 Seq2Exp-soft 的 0.8951;在 K562 细胞系上,MSE 由 0.1856 降至 0.1789。值得注意的是,Prism 实现上述性能所使用的输入序列长度仅为 2000 个碱基对,就达到了基因表达预测的全面最优性能(State-of-the-Art)。

此外,研究团队对 Prism 学习到的背景状态权重进行可视化分析。对于同一个基因,两组学习到的权重向量彼此有明显差异,说明模型确实捕捉到对同一局部表观基因组环境的不同解读,而非重复表示;跨基因来看,两组权重的相对模式却保持高度一致,暗示模型学到了一种可泛化的背景状态分离策略,也说明模型相似但强度不同。这与基因组学中广泛使用的 ChromHMM 方法在概念上吻合,后者同样通过表观基因组信号的组合方式来无监督定义染色质功能状态。

 

ScreenShot_2026-04-30_142553_281.pngPrism学习到的混淆因子权重向量(a₁,a₂)对三个基因的可视化。同一基因内两组权重互补,跨基因的相对模式高度一致,反映出模型学到了具有泛化能力的背景染色质状态表示。

结语

Prism 的工作为基因表达预测领域提供了一个新的研究视角:如何整合多模态表观基因组信号,是一个过去被忽略的研究方向。通过识别背景信号引入的混淆效应并以推断方法加以解决,Prism 以极小的计算代价实现了预测性能的改进。

从“看清结构”到“设计功能”:FlexRibbon蛋白质基座模型发布
Xᴬᴵ年轻派 | 学生杨一凡:“我给自己招了一个博士生,放手给它做科研”