在蛋白质和DNA研究已广受关注的今天,多糖(Glycan)作为生命体系中占据重要作用的分子,仍是一片亟待探索的科学高地。多糖由不同的单糖组成,构成方式高度分支、不规则、复杂多变,广泛参与细胞识别、免疫反应、病毒侵染等关键生物过程。但正因为结构的“难读性”,多糖长期以来都是机器学习难以攻克的“盲点”。
如今,一项来自北京大学、北京中关村学院、清华大学与中国科学院等院校科研团队合作的研究打破了这一局限。他们提出的GlycanAA模型和预训练版本PreGlycanAA首次实现了基于多糖层级的原子级多糖建模,实现了数据结构到多任务功能预测的完整链条,相关工作已被人工智能领域国际顶级会议ICML 2025接收[1]。
全原子建模:让AI真正“看见”多糖结构
多糖不是线性序列,而是具有多分枝的树状结构,且每个单糖内部还有精细的原子结构。例如在病毒侵入中,多糖往往作为“识别码”与病毒表面蛋白结合,绑定位置的原子排列方式将直接决定病毒是否成功附着。
传统多糖建模方法中,大多只将多糖看作是由单糖与糖苷键组成的图结构,忽略了每个单糖内部的原子构型与键合细节。研究团队指出,此类建模方式虽然在某些简单任务上有效,但很难捕捉功能决定因素。事实上,许多如多糖与蛋白质的结合亲和力等决定功能,恰恰依赖于原子之间的空间关系与共价作用。
为解决这一问题,研究团队基于多糖的天然多层级结构提出了GlycanAA模型。该模型将多糖表示为一类同时包含原子级和单糖级节点的全原子级异构图。具体来说,图中包含以下两类节点与三类边:
·原子节点:表示单糖中的非氢原子;
·单糖节点:表示多糖中的基本组成单糖;
·边类型:包括原子-原子(共价键)、原子-单糖(归属关系)与单糖-单糖(糖苷键)三类。
基于此,研究团队创新性地提出了一种分层信息传递机制(Hierarchical Message Passing),该机制基于RGCN实现,包含三个信息传递阶段:
1. 原子-原子传递(Atom-Atom):此阶段中模型会学习每个单糖内部的原子间的共价键结构,比如C-O、C-N等键位和键型,捕获单糖的精细原子特征。
2. 原子-单糖传递(Atom-Monosaccharide):模型将原子级特征聚合到所属单糖节点,形成包含原子组成与连接方式的综合表征。此阶段完成从原子到单糖模块的信息整合,使每个单糖具备完整的结构意识。
3. 单糖-单糖传递(Monosaccharide-Monosaccharide):最后阶段中,模型将学习单糖间通过糖苷键连接形成的空间排列,提取多糖的全局拓扑特征。最终生成的多糖级表征将用于下游任务。
值得注意的是,GlycanAA在输出时将不会使用原子级数据特征,而是以单糖为最小单位聚合特征。此方法可以消除冗余信息,并提升特征表达的判别性。

图1 GlycanAA示意图
让AI自学4万条多糖:多糖预训练模型PreGlycanAA
GlycanAA虽然结构设计精妙,但其对多糖结构与功能关系的理解仍处于初级阶段,还不具备对多糖内在规律的深刻理解。为此,研究团队构建了全球首套高质量多糖数据集,针对所提出的全原子异构图设计了一套自监督预训练机制,并打造了预训练版模型 PreGlycanAA。
研究团队以多糖开源数据库 GlyTouCan 为基础,从中筛选出结构完整、无标签污染、信息闭环的多糖样本,最终构建出包含 40,781 条多糖 的预训练数据集。此数据集具有三大特点:
1. 高质量:剔除了所有存在不确定单糖类型或连接方式的结构;
2. 结构完整:只保留“单一连通结构”的多糖,以确保预训练过程中可学习到的是多糖内在关系;
3. 无数据泄漏:移除了所有在下游任务中出现的样本,避免预训练阶段“偷看答案”。
在此之上,研究团队提出了一种名为多尺度掩码预测(Multi-Scale Masking)的方法完成预训练。此机制分为两个方面:
1. 原子级掩码(Atom-scale masking):对于多糖中的所有重原子,模型会以为比例随机选择一部分节点掩码,并将它们标记为特殊类型Unknown-Atom。
2. 单糖级掩码(Monosaccharide-scale masking):同样地,模型也会随机以比例选择部分单糖节点掩码,并标记为特殊类型Unknown-Monosaccharide。但为了避免模型依靠原子构成便可推断出单糖类型从而使得任务过于简单,研究团队进一步将被掩码单糖所含有的原子节点类型一并标记为Unknown-Atom。

图2 预训练示意图
掩码比例设定的合理性也被充分分析。研究团队通过敏感性分析得到当原子掩码率为 0.45、单糖掩码率为 0.15 时,模型在多个任务中达到最佳效果。

图3 PreGlycanAA在不同掩码比设定下Taxonomy任务的Macro-F1平均值
实验结果:实现多糖机器学习领域新SOTA
在多糖基准GlycanML上,GlycanAA 和 PreGlycanAA 被投放于 11 个下游任务中。结果显示:
·非预训练模型中,GlycanAA在10个任务上取得了最好的成绩,并且在加权平均排名中也领先于所有其他对比模型;
·PreGlycanAA在所有任务中超越了GlycanAA,在加权平均排名中排名第一,证明了所提出预训练策略的强大优势。
特别的,研究团队在传统的单糖级图神经网络(如RGCN、GCN、GAT等)之上加入了小分子全原子级模型(如Graphormer、GraphGPS等)作为对比模型。结果表明,GlycanAA和PreGlycanAA在多糖结构建模方面显著超越了单糖级模型与小分子模型。

表1 GlycanML基准测试结果
特别的,研究团队在传统的单糖级图神经网络(如RGCN、GCN、GAT等)之上加入了小分子全原子级模型(如Graphormer、GraphGPS等)作为对比模型。结果表明,GlycanAA和PreGlycanAA在多糖结构建模方面显著超越了单糖级模型与小分子模型。
多糖AI落地应用:细节决定成败
GlycanAA模型通过层级信息传递机制,成功将多糖建模为异构全原子图,并进一步通过多尺度遮蔽预测方法进行预训练,推出了PreGlycanAA模型,为多糖研究提供了全新的视角和技术路径。随着技术的不断发展,该模型有望在疫苗研发、癌症免疫治疗、个性化医疗等领域发挥重要作用,尤其是在多糖相关的生物标志物筛选、疫苗设计和抗体糖基化研究等方面带来革命性的进展。
研究团队表示:"为使这些技术成果能够在实际应用中发挥更大作用,我们正致力于将 GlycanAA 和 PreGlycanAA 与现有的生物医药研究工具结合,帮助科研人员和行业专家更加便捷地利用这些技术。在此过程中,我们也在积极推动相关技术和数据的开源共享,以此促进多糖研究领域的进一步发展,让医学研究和药物开发变得更加简单、精准、高效。"
尽管多糖机器学习领域在科研中已经取得了显著进展,要将这些成果真正落地并转化为广泛应用,还需要面对众多细节问题。当前技术尚无法完全解析多糖与免疫系统的复杂互作机制,也难以全面捕捉疾病状态下多糖结构的动态变化。这些关键科学问题的解决,既需要扩充高质量的多糖数据,也依赖于算法层面的持续优化。接下来,研究团队计划通过更先进的结构化学习方法,重点提升模型在多糖功能预测、蛋白质-多糖相互作用等核心任务中的性能表现,以增强技术在具体应用场景中的精准度和可操作性。
研究团队期待与全球范围内的研究人员、药物开发公司以及医学专家紧密合作,共同推动这些技术落地,为多糖研究和实际应用带来更多的创新与突破。
【注】本文相关论文第一作者徐明皓为北京大学&北京中关村学院博士研究生,第二作者宋佳泽系本文作者,为北京大学硕士研究生;论文通讯作者为北京大学助理教授、北京中关村学院共建导师张文涛。
[1] Xu, M., Song, J., Wu, K., Zhou, X., Cui, B., & Zhang, W. (2025). Modeling All-Atom Glycan Structures via Hierarchical Message Passing and Multi-Scale Pre-training. arXiv preprint arXiv:2506.01376.



