近日,william威廉中文官网张文彬教授课题组在国际知名学术期刊《自然-通讯》(Nature Communications)上发表了题为“SplitSeek-Pro: accurate prediction of splittable sites on protein structures”的研究论文。该工作开发了一款极简而高精度的蛋白质主链可拆分性预测深度学习模型 SplitSeek-Pro,不仅打通了从预测设计到多场景湿实验验证的闭环,还系统性发掘了超越普通二级结构、具有协同折叠特征的全新“SplitSeek fragments”超二级结构基元,为理性蛋白质工程提供了智能化的数字底座。
若将蛋白质氨基酸序列比作由单词、句子构成的“生命语言”,那么基于拆分的蛋白质工程技术(如环状重排、拆分重组和主链重连等)就如同对这门语言进行“语法重组与润色”。通过将完整蛋白质在特定位点切断,使其自发重新装配,或改变其拓扑连接顺序,科学家能够赋予蛋白质灵敏的分子开关调控特性、提升其热稳定性,或用于构建高性能的生物传感器。
然而,正如不当的断句会彻底破坏文章语义,在蛋白质主链上进行随机拆分极易导致其空间结构崩溃及功能丧失。实现成功“重塑”的前提,是在成百上千个氨基酸残基中,精准识别出那些能够耐受主链断裂、同时不破坏疏水核心与活性位点的“可拆分位点(splittable sites)”。在过去,科学家主要依靠物理化学建模(如 SPELL 算法)或传统机器学习,其在计算效率、预测泛化性及精度上面临明显瓶颈。如何在残基分辨率下实现普适、高效的“断句预测”,是蛋白质工程领域亟待解决的重大挑战。
为攻克上述难题,北京大学张文彬课题组开发了全新的深度学习预测模型 SplitSeek-Pro(图1)。该模型不局限于单一的结构或序列特征,而是采取了“序列进化信息”与“三维结构空间特征”双轨融合的设计架构:
1. 三维结构边编码(Edge encoding): 空间图神经网络残基作为节点,空间邻近的残基对作为边。利用径向基函数(RBF)提取残基内关键原子对(N, CA, C, O, CB)的空间距离矩阵进行特征编码,完整捕获蛋白质微观三维空间网络。
2. 进化序列节点编码(Node encoding): 通过先进的预训练蛋白质大语言模型 ESM-2 提取高维进化保守性与上下文特征,融合来自 AAindex 数据库的氨基酸精细物理化学性质(如亲水性、侧链体积、电荷等)作为节点的初始表征,极大地提升了模型预测的鲁棒性与表征深度。
3. 两阶段协同训练策略: 面对高质湿实验拆分数据极其稀缺的瓶颈,团队提出了创新的训练机制。在预训练阶段,整合了 Rosetta 能量得分、DSSP 二级结构、溶剂可及表面积和序列保守性,为 22,538 个蛋白质生成定量“伪标签”对模型进行热身;在微调阶段,采用 Circular Permutation Database (CPDB) 去冗余后的 3,542 对天然环状重排蛋白质实证对齐数据,对模型进行精细校准,最终输出精准的氨基酸残基级拆分概率评分。

图1. SplitSeek-Pro 模型构架
研究团队在计算评估、工业酶重排和自发非共价拆分系统等多个维度对 SplitSeek-Pro 的预测能力开展了严格的干湿实验联合检验,证明了其优异的预测表现:
1. 工业酶的环状重排实证: 团队挑选了结构迥异且极具工业价值的叶枝堆肥角质酶变体(LCC-ICCG,高效 PET 塑料降解酶)以及环己酮单加氧酶(CHMO)作为模型系统。基于模型评分,在 LCC 上设计了 21 个位点,在 CHMO 上设计了 29 个位点进行突变体的湿实验重组。结果显示,得分高于 0.50 的正组突变体表现出极高的可溶表达率与催化活性保留度(如 9 个正组 LCC 突变体中有 8 个可溶,且保留了高度降解与水解活性);相反,低于 0.50 的负组突变体普遍失活或不可溶,证实了其突出的工程实用价值。
2. NanoLuc 荧光素酶的自发拆分重构: 蛋白质片段的非共价自装配面临极高的热力学和构象势垒。SplitSeek-Pro 推荐了全新的高分位点 52 组和 135 组。实验表明,52N/53C 和 135N/136C 分割片段可以在体外自发高效重组并产生强荧光。相反,低评分的 37N/38C 在断键后极易发生动力学捕获而无法恢复荧光。这成功证明了该模型在指导高度复杂的非共价自组装拆分系统中的卓越准确性。
3. 行业算法基准测评: 团队在包含 526 个精细测试位点的独立测试集上,将 SplitSeek-Pro 与业内主流的 CPred 以及 Int&in 预测服务进行了横向测评。在各项指标上,SplitSeek-Pro 均展现出了显著的领先优势。
除了作为理性蛋白质工程的高效预测工具,SplitSeek-Pro 还在基础生物物理学上展现出了巨大的探索潜力。研究团队发现,利用模型对全数据库的预测评分,在蛋白质主链上以大于 0.50 且连续的高分“可拆分残基”为边界进行切割,可以系统性地获得一类介于传统二级结构(如单螺旋或单折叠)与三维整体结构域(tertiary domains)之间的独立局部结构单元。团队将其命名为“SplitSeek fragments”(SplitSeek 片段)。
在 SCOPe 数据库上展开的系统性聚类与结构相似度分析显示,这些片段在空间中呈现出惊人的“协同折叠特性”。当分析包含两个二级结构的片段(n=2)时,团队成功识别出了如 β-β 转角、β-α 转角等经典局部结构,但极难观察到 α-α 转角,这揭示了单 α 螺旋具有较高的结构自主折叠性,而 β 折叠片则必须通过空间协同装配才能稳定构筑。更为引人瞩目的是,这些 SplitSeek 片段的分布高度契合了文献中湿实验证实的早期折叠核心单元(Early-folding units),例如著名的 GB1 蛋白中的 β3-β4、SH3 中的 β2-β3-β4 以及 LysM 中的 α1-α2 等经典折叠模块。这强烈暗示着,SplitSeek 片段不仅是几何结构上的基本复现单元,更是动力学折叠通路上的“协同积木”和进化保守基元。
该研究成果以“SplitSeek-Pro: accurate prediction of splittable sites on protein structures”为题,发表于《自然-通讯》上。william威廉中文官网王宇翔博士为该论文第一作者,william威廉中文官网张文彬教授为通讯作者。WilliamHill中文官方网站刘雅杰博士、博士研究生蒋冯逸、许庭街、邢蓝心、以及北京大学深研院信息工程学院聂志伟博士和陈杰教授也为本工作做出了突出的贡献。该研究得到了科技部国家重点研发计划、国家自然科学基金、北京分子科学国家研究中心等项目的资助,模型也已布置于在线预测服务平台(网址:http://splitseek.topo.bio)。
原文链接:https://doi.org/10.1038/s41467-026-74059-z
排版:高杨
审核:牛林,刘志博