近日,北京中关村学院导师何亮、邓攀、曹川、鞠富松、刘海广、秦涛等人参与的蛋白质工程领域研究取得突破,学术论文已发表于《自然·机器智能》,指导作者为北京中关村学院院长、中关村人工智能研究院理事长刘铁岩。研究团队开发的µProtein框架,攻克了蛋白质设计领域长期存在的“大海捞针”式核心挑战——在浩如烟海的突变组合中,如何高效找到功能更优的蛋白质序列。这项研究为药物研发、酶工程和抗体设计开辟了全新路径。
完整论文链接:
https://www.nature.com/articles/s42256-025-01103-w

为什么蛋白质工程如此困难?
蛋白质工程通过定向改造或设计蛋白质分子,使其具备特定功能(譬如能高效降解塑料或靶向治疗癌症的蛋白质),在医药、能源和环保等领域具有重大应用价值。然而,庞大的潜在突变空间与有限的实验室筛选能力之间的矛盾,严重限制了最优序列的发现效率。想象一下,你要在宇宙中寻找一颗特定的星星——蛋白质的可能突变组合数量比宇宙中的原子总数还要多!一个只有300个氨基酸的蛋白质,其可能的突变组合数量将达到 20300,这是一个天文数字,即使在只考虑四个点位突变的情况下也有约种变体。传统实验方法如深度突变扫描 (DMS) 只能系统测试单点突变及少量多点突变,面对多点突变的组合爆炸问题显得力不从心。更麻烦的是,蛋白质中的氨基酸相互作用(上位效应,epistasis)让突变效果无法简单相加——就像炒菜,盐和糖单独加效果可以预测,但一起加可能产生意想不到的风味。
AI破局:µProtein框架的创新之道

图1:μProtein 的框架概览
为此,研究团队提出了 μProtein 框架,通过结合 μFormer(一个能够准确预测突变效应的深度学习模型用于建模蛋白质适应度景观)与 μSearch(一种强化学习算法用于高效探索蛋白质适应度景观),来加速蛋白质工程。μProtein 能够利用单点突变数据,预测包含复杂多位点突变的最优序列,这得益于其对上位效应的建模能力以及多步搜索策略。除了在基准数据集上表现优异外,μProtein 还在仅使用单点突变数据训练的条件下,成功在湿实验中发现了 β-内酰胺酶的多位点高增益功能突变体,其活性水平超过了已知的最高水平之一。这些结果表明,μProtein 能够在庞大的蛋白质序列空间中发现关键突变,提供了一种稳健而高效的蛋白质优化方法。
两大核心组件:µFormer + µSearch
(1)µFormer:蛋白质的"适应度地图"
µFormer是一个深度学习模型,能够理解蛋白质序列中的"语言规则"。它通过预训练学习了3000多万个蛋白质序列的规律,再通过微调掌握特定蛋白质的"方言"。与传统方法不同,µFormer采用了创新的成对掩码语言模型 (Pairwise Masked Language Model),在预训练期间不仅让模型预测单个氨基酸,同时通过预测掩码对的方式让模型捕捉氨基酸之间的相互依赖作用。
在微调阶段,除了复用预训练的编码器权重之外,µFormer额外设计了三组评分模块:序列级、片段级和残基级评分模块。这些模块的组合使用使得 µFormer 能够精确、全面地建模蛋白质序列-功能映射。值得注意的是,为了降低数据过拟合的风险,评分模块选择采用尽可能小的模型规模,以减少引入新的模型参数。

图2 :µFormer采用“预训练+微调”范式精确建模蛋白质序列-功能映射
研究团队在 78 个 DMS 数据集上,将 μFormer 与十余种最新模型进行了系统比较。结果表明,μFormer 的整体表现优于所有对比方法:在超过一半的数据集中,其预测结果与真实适应度的相关性高于 0.7,部分数据集甚至超过 0.9,体现出μFormer在不同蛋白质和功能类型中的稳健性。值得注意的是,即便在包含插入、删除突变(Indels)的任务中,μFormer 仍保持最佳性能,凸显了其作为“预测先知”的广泛适用性。

图3 :µFormer 在多项基准任务和数据集上表现出色
(2)µSearch:蛋白质的"智能导航员"

图4:µSearch 模型流程示例,突变第15位为脯氨酸Pro
如果把蛋白质序列空间比作一片广袤的森林,µSearch就是一位经验丰富的向导。它采用了基于强化学习的近端策略优化(PPO)算法,以µFormer为"指南针",逐步探索最优路径。与随机搜索相比,µSearch能更高效地找到高适应度的突变组合,就像在迷宫中找到出口的最短路径。

图5:µSearch 在多项蛋白质适应性景观基准上展现了出色的高效性
研究团队进一步对 μSearch 的独立性能进行了系统评估。结果显示,在多种适应度景观模拟任务中,μSearch 相较于八种常用探索算法展现出更高的样本利用效率和搜索质量。在实际的TEM-1蛋白与头孢噻肟 (cefotaxime) 体系实验中,μSearch 能够以显著更少的查询次数发现其他方法无法触及的高适应度序列,凸显了其在复杂适应度景观中卓越的导航与优化能力。
实验验证:β-内酰胺酶突变的惊艳结果
研究团队将µProtein应用于β-内酰胺酶TEM-1的优化,目标是提高其对头孢噻肟的水解活性。有趣的是,在头孢噻肟于50年前首次问世时,TEM-1完全无法降解这种抗生素,而此后才逐渐出现能够分解它的突变体。

图6 :µProtein从野生型序列出发通过多步突变探索高适应度区域
研究团队仅使用单点突变数据训练µFormer,让µSearch探索包含2-3个氨基酸变化的突变空间。结果令人振奋:在测试的200个模型设计的突变体中,47个 (23.5%) 表现出比野生型更高的活性,而其中一个双突变组合G236S;T261V的活性甚至超过了已知的最高活性四突变体。
更令人惊讶的是,µProtein发现的突变分布与自然进化的突变有很大不同——它找到了自然界中罕见但功能更强的突变组合,如T261V、T261I等,这些突变在自然进化的菌株中几乎不存在。
为何µProtein能"预见"未来突变?
µProtein的成功秘诀在于,在准确建模蛋白质的适应性景观的同时,更好地捕捉了上位效应——即多个突变组合产生的非线性效应,这一点对于蛋白质工程尤其重要;此外,配套的高效搜索算法也让模型的效果得以充分发挥。研究显示,µFormer在预测高阶突变体的适应度时,表现远超简单的加性模型。
当研究团队将TEM-1突变体的嵌入向量通过t-SNE降维可视化时,发现随着活性增加,突变体在隐空间中沿着第一维度清晰排列,高活性突变体聚集在右侧。这意味着µFormer"理解"了蛋白质功能与序列的关系,而不仅仅是记住突变数量。

图7 :µProtein在TEM-1上的嵌入向量可视化
应用前景:不止于β-内酰胺酶
µProtein的潜力远不止于此。研究团队指出,该框架可广泛应用于:
1. 抗体设计:快速筛选高亲和力抗体变体
2. 酶优化:设计工业用酶的高活性突变体
3. 药物耐药性预测:提前预判病原体可能的耐药突变路径
4. 蛋白质再设计:通过多轮“干、湿”结合实验创造与已知序列相似度更低而功能更强的蛋白质
未来展望:AI驱动的蛋白质工程新时代
这项研究代表了AI驱动蛋白质工程的新范式:从有限实验数据出发,通过深度学习建模适应度景观,再用强化学习高效探索最优突变路径。
未来,研究团队将整合3D结构数据以更好捕捉空间上接近的上位性相互作用,并扩展框架以处理多种表型和环境条件。随着计算能力的提升和实验数据的积累,µProtein有望成为蛋白质工程领域的"标准工具",加速生物技术、医药和农业领域的创新。
正如文中所言:"通过结合强大的适应度预测模型和高效的强化学习策略,µProtein为蛋白质工程提供了一个多功能框架,弥合了基于序列的预测与功能性蛋白质优化之间的差距。
该研究系北京中关村学院导师何亮、邓攀、曹川、鞠富松、刘海广、秦涛等人任职于微软科学智能研究院期间与团队合作所作工作,其指导作者刘铁岩现为北京中关村学院院长、北京中关村学院党委书记、中关村人工智能研究院理事长。



