留言板

尊敬的读者、作者、审稿人, 关于本刊的投稿、审稿、编辑和出版的任何问题, 您可以本页添加留言。我们将尽快给您答复。谢谢您的支持!

姓名
邮箱
手机号码
标题
留言内容
验证码

基于定制门控系统的活性肽多任务预测模型

叶序韬 图尔逊娜依·艾力 冯鑫 曹鉴华 周飒 仲飞亮 罗学刚

叶序韬, 图尔逊娜依·艾力, 冯鑫, 等. 基于定制门控系统的活性肽多任务预测模型[J]. 浙江农林大学学报, 2026, 43(X): 1−11 doi:  10.11833/j.issn.2095-0756.20260196
引用本文: 叶序韬, 图尔逊娜依·艾力, 冯鑫, 等. 基于定制门控系统的活性肽多任务预测模型[J]. 浙江农林大学学报, 2026, 43(X): 1−11 doi:  10.11833/j.issn.2095-0756.20260196
YE Xutao, Tuerxunnayi Aili , FENG Xin, et al. A multi-task prediction model for bioactive peptides optimized by a custom gating system[J]. Journal of Zhejiang A&F University, 2026, 43(X): 1−11 doi:  10.11833/j.issn.2095-0756.20260196
Citation: YE Xutao, Tuerxunnayi Aili , FENG Xin, et al. A multi-task prediction model for bioactive peptides optimized by a custom gating system[J]. Journal of Zhejiang A&F University, 2026, 43(X): 1−11 doi:  10.11833/j.issn.2095-0756.20260196

本文已在中国知网网络首发,可在知网搜索、下载并阅读全文。

基于定制门控系统的活性肽多任务预测模型

DOI: 10.11833/j.issn.2095-0756.20260196
基金项目: 国家级大学生创新训练计划(202510057002);国家重点研发计划项目(2022YFF1103305)
详细信息
    作者简介: 叶序韬(ORCID: 0009-0008-7979-227X),从事人工智能交叉的生物应用研究。E-mail: 23044311@mail.tust.edu.cn
    通信作者: 罗学刚(ORCID: 0000-0002-7975-0722),教授,博士,从事微生态健康功能及益生制品研究。E-mail: luoxuegang@tust.edu.cn
  • 中图分类号: TP391;TQ464

A multi-task prediction model for bioactive peptides optimized by a custom gating system

  • 摘要:   目的  针对传统活性肽鉴定筛选周期长、研发成本高,现有采用单一数据嵌入方式机器学习的肽活性预测模型难以区分同一功能下不同作用靶点的肽段特征等问题,研究一种组合定制门控单元、对比学习和交叉注意力机制功能的活性肽多任务预测模型。  方法  将蛋白质序列、结构预训练模型、多肽物理化学预测模型与Transformer编码器相结合,并采用专家门控系统优化模型架构、综合靶点结构、序列及物理化学性质信息,进行活性肽-靶点分类优化和预测。  结果  建立一种新型活性肽多任务预测模型Biopepformer,该模型在降血脂生物活性肽靶点分类任务中显示出高整体准确率(0.899)与加权F1分数(0.902);在结合预测二分类任务中F1分数=0.958、平均准确率=0.959和平均曲线下面积(AUC)=0.952,性能显著优于传统机器学习模型的效果。进一步消融实验表明,多任务学习框架与门控多专家单元是模型性能提升的关键。将预训练模型迁移至降血糖生物活性肽数据集进行微调,在模型靶点结合预测中,F1分数=0.969、整体准确率=0.969和平均AUC=0.976,在靶点分类任务中,平均准确率=0.863和加权F1分数=0.884,展现出跨靶点泛化的潜力。  结论  Biopepformer可为不同靶点的活性肽挖掘和设计提供高效虚拟筛选工具,也为功能活性肽的生物活性功能挖掘提供了新的思路。图6表1参25
  • 图  1  不同生物活性肽数据集按靶点的分布

    Figure  1  Distribution of different bioactive peptide datasets by target

    图  2  Biopepformer的构建流程

    Figure  2  Construction process of Biopepformer

    图  3  模型在5折交叉验证下对模型的性能评估

    Figure  3  Performance evaluation of the model under 5-fold cross-validation

    图  4  Biopepformer与目前主流的生物活性肽判别器的性能对比

    Figure  4  Performance comparison between Biopepformer and current mainstream bioactive peptide discriminators

    图  5  Biopepformer核心模块消融实验性能对比

    Figure  5  Performance comparison of ablation experiments on the core modules of Biopepformer

    图  6  Biopepformer在降血糖生物活性肽数据集的5折交叉验证性能评估

    Figure  6  Performance evaluation of Biopepformer on the hypoglycemic bioactive peptide dataset using 5-fold cross-validation

    表  1  特征工程消融实验结果

    Table  1.   Results of feature engineering ablation experiments

    实验组任务类型准确率率F1分数精准率召回率
    无物化性质结合预测0.927±0.0160.926±0.0160.926±0.0160.927±0.016
    无ProT5序列嵌入结合预测0.920±0.0240.918±0.0260.919±0.02560.920±0.024
    无靶点嵌入靶点预测0.576±0.0360.556±0.0350.542±0.0360.576±0.036
      说明:数值为平均值±标准差。
    下载: 导出CSV
  • [1] DA Jiayi, et al. Postbiotic-mediated obesity reduction via bioactive peptide ETLVK and gut microbiota in HFD mice[J]. Journal of Agricultural and Food Chemistry, 2025, 73(36): 22436−22447. DOI: 10.1021/acs.jafc.5c07319.
    [2] LAFIA A T, GOMES W P C, MELCHERT W R. Bioactive peptides from whey proteins: production, purification, identification, mechanism of action and biofunctionality in foods[J]. International Dairy Journal, 2026, 177: 106595. DOI: 10.1016/j.idairyj.2026.106595.
    [3] ZHANG Ruihao, LI Yonghui, JIANG Qinbo, et al. ESMR4FBP: a pLM-based regression prediction model for specific properties of food-derived peptides optimized multiple bionic metaheuristic algorithms[J]. Food Chemistry, 2025, 464: 141840. DOI: 10.1016/j.foodchem.2024.141840.
    [4] DU Zhenjiao, DING Xingjian, HSU W, et al. pLM4ACE: a protein language model based predictor for antihypertensive peptide screening[J]. Food Chemistry, 2024, 431: 137162. DOI: 10.1016/j.foodchem.2023.137162.
    [5] CUI Zhiyong, ZHANG Zhiwei, ZHOU Tianxing, et al. A TastePeptides-Meta system including an umami/bitter classification model Umami_YYDS, a TastePeptidesDB database and an open-source package Auto_Taste_ML[J]. Food Chemistry, 2023, 405: 134812. DOI: 10.1016/j.foodchem.2022.134812.
    [6] LIU Jian, GENG Aoyun, CUI Feifei, et al. NeuroCL: a deep learning approach for identifying neuropeptides based on contrastive learning[J]. Analytical Biochemistry, 2025, 705: 115920. DOI: 10.1016/j.ab.2025.115920.
    [7] MA Chang, LIU Runcheng, LU Jiarui, et al. PEER: a comprehensive and multi-task benchmark for protein sequence understanding[C]//Advances in Neural Information Processing Systems 35. Neural Information Processing Systems Foundation, Inc. (NeurIPS), 2022: 35156−35173. DOI: 10.52202/068431-2548.
    [8] AHMED S, SCHADUANGRAT N, CHUMNANPUEN P, et al. GRU4ACE: enhancing ACE inhibitory peptide prediction by integrating gated recurrent unit with multi-source feature embeddings[J]. Protein Science, 2025, 34(6): e70026. DOI: 10.1002/pro.70026.
    [9] BALLANTYNE C M, NORATA G D. The evolving landscape of targets for lipid lowering: from molecular mechanisms to translational implications[J]. European Heart Journal, 2025, 46(44): 4737−4750. DOI: 10.1093/eurheartj/ehaf606.
    [10] MALICK W A, CHOI D, LANGSTED A, et al. Challenges in achieving LDL cholesterol targets and novel approaches to lipid lowering[J]. European Journal of Preventive Cardiology, 2025, 32(13): 1136−1144. DOI: 10.1093/eurjpc/zwaf123.
    [11] HU Fan, HU Yishen, ZHANG Weihong, et al. A multimodal protein representation framework for quantifying transferability across biochemical downstream tasks[J]. Advanced Science, 2023, 10(22): 2301223. DOI: 10.1002/advs.202301223.
    [12] YI Xilong, TAN Yingzhu, LIN Huikang, et al. CACLENS: a multitask deep learning system for enzyme discovery[J]. Advanced Science, 2026, 13(9): e18063. DOI: 10.1002/advs.202518063.
    [13] LIN Zeming, AKIN H, RAO R, et al. Evolutionary-scale prediction of atomic-level protein structure with a language model[J]. Science, 2023, 379(6637): 1123−1130. DOI: 10.1126/science.ade2574.
    [14] ELNAGGAR A, HEINZINGER M, DALLAGO C, et al. ProtTrans: toward understanding the language of life through self-supervised learning[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2022, 44(10): 7112−7127. DOI: 10.1109/TPAMI.2021.3095381.
    [15] MINKIEWICZ P, IWANIAK A, DAREWICZ M. BIOPEP-UWM database of bioactive peptides: current opportunities[J]. International Journal of Molecular Sciences, 2019, 20(23): 5978. DOI: 10.3390/ijms20235978.
    [16] LI Jianqiang, BOLLATI C, D’ADDUZIO L, et al. Food-derived peptides with hypocholesterolemic activity: production, transepithelial transport and cellular mechanisms[J]. Trends in Food Science & Technology, 2024, 143: 104279. DOI: 10.1016/j.tifs.2023.104279.
    [17] KIM S, CHEN Jie, CHENG Tiejun, et al. PubChem in 2021: new data content and improved web interfaces[J]. Nucleic Acids Research, 2021, 49(D1): D1388−D1395. DOI: 10.1093/nar/gkaa971.
    [18] TOMBLING B, ZHANG Yuhui, HUANG Yenhua, et al. The emerging landscape of peptide-based inhibitors of PCSK9[J]. Atherosclerosis, 2021, 330: 52−60. DOI: 10.1016/j.atherosclerosis.2021.06.903.
    [19] HU Gui’e, QIN Yebi, QU Mei, et al. Hypoglycemic effects and mechanisms of animal-derived blood peptides in C2C12 myotubes and alloxan-induced diabetic mice[J]. Journal of Functional Foods, 2026, 136: 107134. DOI: 10.1016/j.jff.2025.107134.
    [20] HAMADOU M. Bioactive peptides and metabolic health: a mechanistic review of the impact on insulin sensitivity, lipid profiles, and inflammation[J]. Applied Food Research, 2025, 5(2): 101056. DOI: 10.1016/j.afres.2025.101056.
    [21] SU Jingqian, LUO Yingsheng, HU Shan, et al. Advances in research on type 2 diabetes mellitus targets and therapeutic agents[J]. International Journal of Molecular Sciences, 2023, 24(17): 13381. DOI: 10.3390/ijms241713381.
    [22] RATHORE A S, CHOUDHURY S, ARORA A, et al. ToxinPred 3.0: an improved method for predicting the toxicity of peptides[J]. Computers in Biology and Medicine, 2024, 179: 108926. DOI: 10.1016/j.compbiomed.2024.108926.
    [23] SU Jin, ZHOU Xibin, ZHANG Xuting, et al. ProTrek: Navigating the protein universe through Tri-Modal contrastive learning[J]. bioRxiv, 2024. DOI: 10.1101/2024.05.30.596740.
    [24] TANG Hongyan, LIU Junning, ZHAO Ming, et al. Progressive layered extraction (PLE): a novel multi-task learning (MTL) model for personalized recommendations[C]//Fourteenth ACM Conference on Recommender Systems. ACM, 2020: 269-278. DOI: 10.1145/3383313.3412236.
    [25] SU Liangcai, PAN Junwei, WANG Ximei, et al. STEM: unleashing the power of embeddings for multi-task recommendation[J]. Proceedings of the 38th AAAI Conference on Artificial Intelligence, 2024: 9002–9010. DOI: 10.1609/aaai.v38i8.28749.
  • [1] 廖彦超, 刘妍, 张钧橙, 闵伟红.  糖基化改性对核桃肽结构及功能特性的影响 . 浙江农林大学学报, 2025, 42(2): 219-229. doi: 10.11833/j.issn.2095-0756.20240621
    [2] 杨凡, 杨博凯, 李荣荣.  基于图像分割和深度学习的人造板表面缺陷检测 . 浙江农林大学学报, 2024, 41(1): 176-182. doi: 10.11833/j.issn.2095-0756.20230280
    [3] 张吉玲, 陈钢, 曹光球, 林思祖, 郑宏, 李勇.  机械损伤及埋土深度对杉木萌蘖及抗氧化酶活性的影响 . 浙江农林大学学报, 2021, 38(2): 304-310. doi: 10.11833/j.issn.2095-0756.20200323
    [4] 倪蕴琪, 唐静仪, 洪惠.  包埋肉桂精油的牦牛骨蛋白肽-钙螯合物的制备及抑菌效果 . 浙江农林大学学报, 2021, 38(3): 597-604. doi: 10.11833/j.issn.2095-0756.20200503
    [5] 王晶, 刘茗, 冯歌林, 方伟, 高竞, 梁辰飞, 秦华, 陈俊辉, 徐秋芳.  评价芽孢杆菌脂肽产量及底物碳利用效率的新方法 . 浙江农林大学学报, 2019, 36(6): 1182-1189. doi: 10.11833/j.issn.2095-0756.2019.06.016
    [6] 谢依娜, 赵乐静, 刘云根, 王妍, 侯磊, 李晓琳.  基于耦合协调模型的旅游型美丽乡村复合生态系统协调发展 . 浙江农林大学学报, 2018, 35(4): 743-749. doi: 10.11833/j.issn.2095-0756.2018.04.020
    [7] 陈丽萍, 李平衡, 莫路锋, 周国模, 李金荣.  基于通量源区模型的雷竹林生态系统碳通量信息提取 . 浙江农林大学学报, 2016, 33(1): 1-10. doi: 10.11833/j.issn.2095-0756.2016.01.001
    [8] 王改萍, 徐涛, 樊莉丽, 彭方仁, 吕昕, 陈琳月.  楸树花粉壁蛋白质提取及特异性 . 浙江农林大学学报, 2016, 33(1): 65-70. doi: 10.11833/j.issn.2095-0756.2016.01.009
    [9] 张海强, 陈建明, 张珏锋.  褐飞虱类酵母共生菌菌体蛋白质提取方法的比较 . 浙江农林大学学报, 2015, 32(2): 173-180. doi: 10.11833/j.issn.2095-0756.2015.02.002
    [10] 胡玥昕, 江洪, 王颖.  基于系统动力学的校园碳收支测算模型及应用 . 浙江农林大学学报, 2014, 31(6): 850-859. doi: 10.11833/j.issn.2095-0756.2014.06.005
    [11] 周佳平, 林新春, 徐英武.  拟南芥SEPALLATA3蛋白质原核表达与纯化 . 浙江农林大学学报, 2014, 31(1): 14-18. doi: 10.11833/j.issn.2095-0756.2014.01.003
    [12] 张小果, 乔桂荣, 李翠云, 刘明英, 蒋晶, 李海营, 邱文敏, 卓仁英.  旱柳根系蛋白质双向电泳体系的建立 . 浙江农林大学学报, 2011, 28(4): 653-661. doi: 10.11833/j.issn.2095-0756.2011.04.021
    [13] 马进, 刘志高, 郑钢.  差异蛋白质组学及其在植物盐胁迫响应研究中的应用 . 浙江农林大学学报, 2011, 28(1): 139-143. doi: 10.11833/j.issn.2095-0756.2011.01.022
    [14] 于彬, 郭彦青, 彭方仁.  杨树越冬期间储藏蛋白质的动态变化规律 . 浙江农林大学学报, 2007, 24(6): 692-695.
    [15] 黄华宏, 童再康, 朱玉球, 高燕会, 许长寿, 何福基.  矮化杉木蛋白质组的差异凝胶电泳分析 . 浙江农林大学学报, 2006, 23(3): 265-269.
    [16] 文桂峰, 孙芳利, 于红卫.  苦槠木染色深度影响因素初探 . 浙江农林大学学报, 2004, 21(1): 6-9.
    [17] 高峰.  复杂系统的自适应预测控制模型及其仿真 . 浙江农林大学学报, 2001, 18(4): 433-437.
    [18] 刘力, 林新春, 叶丽敏.  雷竹不同栽培类型竹笋的蛋白质组成 . 浙江农林大学学报, 2001, 18(3): 271-273.
    [19] 崔晓华.  高校健康教育中医生的任务和作用 . 浙江农林大学学报, 1995, 12(4): 449-451.
    [20] 刘力, 刘超纲, 余世袁.  啤酒麦糟制备蛋白饲料过程中蛋白质的转化* . 浙江农林大学学报, 1995, 12(1): 40-45.
  • 加载中
  • 链接本文:

    https://zlxb.zafu.edu.cn/article/doi/10.11833/j.issn.2095-0756.20260196

    https://zlxb.zafu.edu.cn/article/zjnldxxb/2026//1

图(6) / 表(1)
计量
  • 文章访问数:  20
  • HTML全文浏览量:  7
  • PDF下载量:  2
  • 被引次数: 0
出版历程
  • 收稿日期:  2026-03-16
  • 修回日期:  2026-06-03

基于定制门控系统的活性肽多任务预测模型

doi: 10.11833/j.issn.2095-0756.20260196
    基金项目:  国家级大学生创新训练计划(202510057002);国家重点研发计划项目(2022YFF1103305)
    作者简介:

    叶序韬(ORCID: 0009-0008-7979-227X),从事人工智能交叉的生物应用研究。E-mail: 23044311@mail.tust.edu.cn

    通信作者: 罗学刚(ORCID: 0000-0002-7975-0722),教授,博士,从事微生态健康功能及益生制品研究。E-mail: luoxuegang@tust.edu.cn
  • 中图分类号: TP391;TQ464

摘要:   目的  针对传统活性肽鉴定筛选周期长、研发成本高,现有采用单一数据嵌入方式机器学习的肽活性预测模型难以区分同一功能下不同作用靶点的肽段特征等问题,研究一种组合定制门控单元、对比学习和交叉注意力机制功能的活性肽多任务预测模型。  方法  将蛋白质序列、结构预训练模型、多肽物理化学预测模型与Transformer编码器相结合,并采用专家门控系统优化模型架构、综合靶点结构、序列及物理化学性质信息,进行活性肽-靶点分类优化和预测。  结果  建立一种新型活性肽多任务预测模型Biopepformer,该模型在降血脂生物活性肽靶点分类任务中显示出高整体准确率(0.899)与加权F1分数(0.902);在结合预测二分类任务中F1分数=0.958、平均准确率=0.959和平均曲线下面积(AUC)=0.952,性能显著优于传统机器学习模型的效果。进一步消融实验表明,多任务学习框架与门控多专家单元是模型性能提升的关键。将预训练模型迁移至降血糖生物活性肽数据集进行微调,在模型靶点结合预测中,F1分数=0.969、整体准确率=0.969和平均AUC=0.976,在靶点分类任务中,平均准确率=0.863和加权F1分数=0.884,展现出跨靶点泛化的潜力。  结论  Biopepformer可为不同靶点的活性肽挖掘和设计提供高效虚拟筛选工具,也为功能活性肽的生物活性功能挖掘提供了新的思路。图6表1参25

English Abstract

叶序韬, 图尔逊娜依·艾力, 冯鑫, 等. 基于定制门控系统的活性肽多任务预测模型[J]. 浙江农林大学学报, 2026, 43(X): 1−11 doi:  10.11833/j.issn.2095-0756.20260196
引用本文: 叶序韬, 图尔逊娜依·艾力, 冯鑫, 等. 基于定制门控系统的活性肽多任务预测模型[J]. 浙江农林大学学报, 2026, 43(X): 1−11 doi:  10.11833/j.issn.2095-0756.20260196
YE Xutao, Tuerxunnayi Aili , FENG Xin, et al. A multi-task prediction model for bioactive peptides optimized by a custom gating system[J]. Journal of Zhejiang A&F University, 2026, 43(X): 1−11 doi:  10.11833/j.issn.2095-0756.20260196
Citation: YE Xutao, Tuerxunnayi Aili , FENG Xin, et al. A multi-task prediction model for bioactive peptides optimized by a custom gating system[J]. Journal of Zhejiang A&F University, 2026, 43(X): 1−11 doi:  10.11833/j.issn.2095-0756.20260196
  • 活性肽是具有特定营养与生理功能的天然活性物质,在功能食品和生物医药领域具有广泛的应用前景[12]。但传统活性肽筛选存在需大量湿实验验证、筛选周期长、研发成本高等问题,而基于机器学习的预测模型可以有效提高功能性肽的筛选效率。如ESMR4FBP通过优化LSTM模型可提升预测抗氧化肽的准确率[3]; pLM4ACE采用多种嵌入方式搭配不同的模型,可确认筛选血管紧张素转换酶抑制肽的最佳模型[4];UmamiYYDS可通过机器学习预测7种风味肽并输出相关的分数[5];NeuroCL可将对比学习与交叉注意力结合,用于神经肽识别,性能显著优于传统模型[6]。在各类模型架构中,多任务预测凭借其独特的优势得到了广泛应用,其核心是在单个模型框架内同步学习多个相关的预测任务,通过共享特征表示实现任务间的信息互补,相较于单任务模型可有效提升模型的泛化能力与学习效率[7],已成为当前生物信息学领域处理复杂生物数据的主流方法之一。如GRU4ACE模型便通过多任务学习框架结合门控单元实现了血管紧张素转化酶抑制肽的高效识别,其平衡准确率可达 0.948,验证了该架构在活性肽预测场景的有效性[8]。这些模型的应用,有力推动了特定场景下的生物活性肽虚拟筛选,减轻了湿实验负担。随着活性肽研发的深入,同一功能下的多靶点分类成为领域核心需求,即对具备同类生理功能的活性肽,细分其具体作用靶点。以降血脂活性肽为例,其均以调节脂质代谢为核心功能,但作用靶点涵盖3-羟基-3-甲基戊二酰辅酶A(3-hydroxy-3-methylglutaryl-coenzyme A reductase,HMG-CoA)还原酶、前蛋白转化酶枯草杆菌蛋白酶/kexin 9型(proprotein convertase subtilisin/kexin type 9,PCSK9)、过氧化物酶体增殖物激活受体α(peroxisome proliferator-activated receptor α,PPAR-α)、胰脂肪酶等多种类型[910];精准的靶点分类可明确活性肽的作用机制,避免表型筛选的机制模糊问题,为功能食品、低副作用候选药物研发提供精准依据,缩小湿实验筛选范围。

    精准的活性预测与靶点分类依赖对生物分子的全面特征表征,多模态数据融合为此提供了可行方案。本研究中的多模态指来自不同数据源、具备不同生物学语义的特征类型,包括多肽序列模态、靶点结构模态与多肽理化性质模态;多模态融合可突破单一特征的表征局限,更全面地刻画多肽-靶点配对[11]。近年来,预训练蛋白语言模型的发展为多模态特征提取与融合提供了技术支撑,多模态模型也已在蛋白功能预测等领域展现出显著优于单模态模型的性能[1214]。现有活性肽分析模型在特定场景虽然表现良好,但仍存在标签设置模糊、难以适配同一功能下不同靶点的筛选场景等问题,且这种不同靶点的冗杂数据会导致模型泛化能力下降。同时,单一的输入特征无法涵盖肽的特征信息、作用靶点结构实现数据融合,限制了模型精度的提高[12]。目前尚无研究将多模态融合应用于活性肽靶点分类任务,也未开发适配同功能多靶点细分筛选的专用模型,这一空白限制了活性肽虚拟筛选技术的发展。

    为了提升生物活性肽的筛选精度,本研究基于多任务学习的深度学习框架,集成了门控单元、对比学习和Transformer编码器,开发了Biopepformer深度学习模型。与现有的生物活性肽预测模型不同,Biopepformer具有通过多任务架构实现多模态学习的优势,融合了多肽序列、作用靶点结构和物理化学性质多维度信息,可更精准地界定生物活性肽的作用范围,为生物活性肽功能探究提供新思路。

    • 采用多肽序列-多肽物理化学性质-靶点蛋白三元组数据,开展Biopepformer的作用预测数据集构建。降血脂生物活性肽数据集通过BioPep-UWM数据库检索及文献人工整理获得,含5类共267条序列[1518];靶点蛋白质结构从PDB数据库中搜集。为评估模型泛化能力,通过手动收集了降血糖生物活性肽数据集(3类共591条序列)[19]。降血脂肽生物活性包括HMG-CoA还原酶抑制剂、PCSK9抑制剂、PPARα激动剂、胰脂肪酶抑制剂和胆固醇酯酶抑制剂[20]。降血糖肽生物活性包括二肽基肽酶4(dipeptidyl peptidase 4,DPP4)抑制剂,胰高血糖素样肽1(glucagon-like peptide 1,GLP-1)类似肽,和麦芽糖酶-葡糖淀粉酶(maltase-glucoamylase,MGA)抑制剂[21]。所有数据集均采用5折分层交叉验证,数据集详细信息见https://github.com/XutaoYe/peptide_prediction。

    • 使用预训练蛋白质语言模型(protein language model,pLM)ProtT5,蛋白质结构嵌入模型ProTreck,以及Toxinpred对多肽物理化学性质进行预测[2223]。其中序列嵌入为1×1 024维向量,结构嵌入为1×1 024维向量,多肽性质使用Toxinpred预测的10类理化性质。同时为了表示生理作用,在物理化学性质中增加作用维度,用0表示拮抗,用1表示激活。

    • 为解决多任务学习的特征冲突与负迁移问题,将TA-GMEU作为核心特征提取模块,在多肽、靶点支路各设置1个独立单元,每个单元含1个全局共享专家和2个任务专属专家,引入L2正则化缓解过拟合,采用LeakyReLU激活函数避免梯度消失[24]

    • 参考CACLENS的多任务专家门控以设计专家层[12]。对于输入特征$ x\in {R}^{{{\text{d}}_{\text{model}}}} $,单个专家网络$ \mathcal{E}(x) $的计算过程为:

      $$ {h}_{1}=\text{LayerNorm}({W}_{1}x+{b}_{1}) \text{;} $$
      $$ {h}_{2}=\text{LeakyReLU}({h}_{1}\text{,}\alpha =0.01) \text{;} $$
      $$ \mathcal{E}(x)=\text{LayerNorm}({W}_{2}{h}_{2}+{b}_{2}) 。 $$

      其中,$ {W}_{1},{W}_{2}\in{R}^{512 \times 512} $、$ {b}_{1},{b}_{2}\in{R}^{512} $为可学习参数,$ \alpha =0.01 $为LeakyReLU的负斜率。对3个专家网络进行分工,分别关注不同的特征以实现多任务学习:全局共享专家学习所有任务通用底层特征;分类任务专属专家服务于靶点分类任务;结合预测任务专属专家服务于结合预测核心任务。

    • 引入固定权重偏置强化核心任务的专家特征贡献。基础权重计算公式为:

      $$ {w}^{\text{cls}}(x)=\text{Softmax}\left[W_{\text{g}}^{\text{cls}} \text{LeakyReLU}\left(W_{\text{g}1}^{\text{cls}}x+b_{\text{g}1}^{\text{cls}}\right)+b_{\text{g}}^{\text{cls}}\right] 。 $$

      其中,$ W_{\text{g}1}^{\text{cls}}\in {R}^{256\times 512} $、$ W_{\text{g}}^{\text{cls}}\in {R}^{3\times 256} $为可学习权重参数,$ {w}^{\text{cls}}=[{w}_{\text{shared}},{w}_{\text{cls}}{,{{w}_{\text{bind}}}]}^{\text{T}} $为分类任务的基础权重向量,满足$ {w}_{\text{shared}}+{w}_{\text{cls}}{+w}_{\text{bind}}=1 $。引入固定权重偏置,强化共享专家与分类专属专家的贡献,调整后的权重为:

      $$ w_{\text{adj}}^{\text{cls}}=\text{Softmax}\left({w}^{\text{cls}}\odot {b}_{\text{cls}}\right) 。 $$

      其中,$ {b}_{\text{cls}}=[1.2,\;0.5,\;0.5] $为分类任务专属权重偏置,$ \odot $为哈达玛积。针对靶点预测任务,门控网络对所有专家分配权重,通过固定偏置强化共享专家与结合预测任务专属专家的贡献,基础权重计算公式为:

      $$ {w}^{\text{bind}}\left(x\right)=\text{Softmax}\left[W_{\text{g}}^{\text{bind}}\text{LeakyReLU}\left(W_{\text{g}1}^{\text{bind}}x+b_{\text{g}1}^{\text{bind}}\right)+b_{\text{g}}^{\text{bind}}\right] 。 $$

      其中,$ W_{\text{g1}}^{\text{bind}}\in {R}^{256\times 512} $、$ W_{\text{g}}^{\text{bind}}\in {R}^{3\times 256} $为可学习权重参数,$ {w}^{\text{bind}}=[{w}_{\text{shared}},{w}_{\text{cls}},{w}_{\text{bind}}{]}^{\text{T}} $为结合预测任务的基础权重向量。

      结合预测任务同样引入任务自适应权重偏置,调整后的权重为:

      $$ w_{\text{adj}}^{\text{bind}}=\text{Softmax}\left({w}^{\text{bind}} \odot {b}_{\text{bind}}\right) 。 $$

      其中,$ {\boldsymbol{b}}_{\text{bind}}=[0.3,1.2,0.5{]}^{\text{T}} $为结合预测任务专属权重偏置。多肽支路与靶点支路分别通过独立的TA-GMEU,最终输出两组任务特异性特征:①多肽支路。靶点分类任务特征$ H_{\text{pep}}^{\text{cls}} $、结合预测任务特征$ H_{\text{pep}}^{\text{bind}} $。②靶点支路。靶点分类任务特征$ H_{\text{tar}}^{\text{cls}} $、结合预测任务特征$ H_{\text{tar}}^{\text{bind}} $。

      模型的关键超参数基于预实验结果与相关文献经验进行设置[12],具体取值如下:批次大小为32,隐藏层维度为512,初始学习率设为1e-4,采用AdamW优化器并设置权重衰减为1e-5;监督对比损失温度系数(temperature)为0.07,难样本比例为0.2;训练轮次设为100,采用基于验证集F1分数的早停策略(patience=10,min delta=0.001)。

    • 构建了双向交叉注意力交互模块。模块采用两个独立的多头注意力层分别学习两个方向的交互模式,同时补充了残差连接、层归一化与前馈网络。将TA-GMEU单元输出的结合特征扩展序列维度,构建交叉注意力的查询(query,Q)、键(key,K)、值(value,V)矩阵。

    • 采用Transformer标准缩放点积注意力计算,计算公式为:

      $$ \text{Attention}\left(Q,K,V\right)=\text{Softmax}\left(\frac{Q{K}^{T}}{\sqrt{{d}_{k}}}\right)V 。 $$

      其中,$ {d}_{k} $为单头注意力的维度,注意力头数h=8。

    • 多头注意力将QKV分别映射到h个独立的特征子空间,分别计算注意力后拼接输出,实现不同维度交互特征的并行提取,计算公式为:

      $$ \text{MHCA}(Q,K,V)=\text{Concat}({\text{head}}_{1},{\text{head}}_{2},...,{\text{head}}_{h}){W}^{O} 。 $$

      其中,$ W_{i}^{Q},W_{i}^{K},W_{i}^{V}\in {R}^{512\times 64} $、$ {W}^{O}\in {R}^{512\times 512} $为可学习参数。

      基于多头注意力机制,构建双向交叉注意力计算,分别得到多肽感知靶点的注意力特征,与靶点感知多肽的注意力特征:

      $$ H_{\text{pep}}^{\text{attn}}={\text{MHCA}}_{\text{pep2tar}}\left({Q}_{\text{pep}},{K}_{\text{tar}},{V}_{\text{tar}}\right) \text{;} $$
      $$ H_{\text{tar}}^{\text{attn}}={\text{MHCA}}_{\text{tar2pep}}\left({Q}_{\text{tar}},{K}_{\text{pep}},{V}_{\text{pep}}\right) 。 $$

      其中,$ {\text{MHCA}}_{\mathrm{pep}2\text{tar}} $与$ {\text{MHCA}}_{\mathrm{tar}2\text{pep}} $为2个独立的多头注意力层,分别学习2个方向的交互模式,避免参数共享导致的特征学习冲突。

    • 针对多靶点多肽场景,在负样本构建中自动规避多肽的所有真实作用靶点,对于批次内N个样本,首先对特征进行L2归一化,计算样本间的相似度矩阵:

      $$ \text{Sim}\left({{\textit{z}}}_{i},{{\textit{z}}}_{j}\right)=\frac{{{\textit{z}}}_{i}{{\textit{z}}}_{j}}{\tau } 。 $$

      其中,$ {{\textit{z}}}_{i} $,$ {{\textit{z}}}_{j} $为L2归一化后的特征向量,$ \tau $为温度系数,本研究设置$ \tau $=0.07。

      构建正负样本掩码。对于样本i,正样本掩码$ \text{po}{\text{s}}_{\text{mask}\left(i,j\right)=1} $,当且仅当样本i与样本j属于同一靶点类别且$ i\neq j $;负样本掩码$ {\text{neg}}_{\text{mask}\left(i,j\right)=1} $,当且仅当样本i与样本j属于不同类别靶点,且对应靶点不为多肽的真实作用靶点。引入了难例挖掘策略,对每个样本i选取相似度最高的前M个负样本作为难负样本,$ M=\max [1,\text{int}(N\times r)] $,其中,r为难负样本比例,本研究设置r=0.2。最终的监督对比损失计算公式为:

      $$ {\mathcal{L}}_{scl}=-\frac{1}{{N}_{\text{pos}}}\sum\limits_{i=1}^{N}{\sum}_{j\colon {{pos}_{mask}}\left(i,j\right)=1}\ln \left(\frac{exp\left[Sim\left({{\textit{z}}}_{i},{{\textit{z}}}_{j}\right)\right]}{{\displaystyle\sum}_{k\colon {{pos}_{mask}}\left(i,k\right)=1}exp\left[Sim\left({{\textit{z}}}_{i},{{\textit{z}}}_{k}\right)\right]+{\displaystyle\sum}_{k\in {{hard}_{neg}}\left(i\right)}exp\left[Sim\left({{\textit{z}}}_{i},{{\textit{z}}}_{k}\right)\right]}\right)。 $$

      其中,$ {N}_{\text{pos}} $为批次内正样本对的总数,$ \text{har}{\text{d}}_{\text{neg}\left(i\right)} $为样本i的难负样本集合。本研究分别对多肽支路的分类特征$ H_{\text{pep}}^{\text{cls}} $计算多肽分类监督对比损失$ \mathcal{L}_{\text{scl}}^{\text{pep}} $,对靶点支路的分类特征$ H_{\text{tar}}^{\text{cls}} $计算靶点分类监督对比损失$ \mathcal{L}_{\text{scl}}^{\text{tar}} $。

      总损失为3个子任务损失的加权求和,重点优化结合预测核心任务,同时通过对比损失辅助提升特征表征能力,计算公式为:

      $$ {{L}}_{\text{total}}={\lambda }_{\text{pep}}{L}_{\text{scl}}^{\text{pep}}+{\lambda }_{\text{tar}}{L}_{\text{scl}}^{\text{tar}}+{\lambda }_{\text{bind}}{{L}}_{\text{lsce}} 。 $$

      其中,$ {\lambda }_{\text{pep}} $、$ {\lambda }_{\text{tar}} $、$ {\lambda }_{\text{bind}} $为损失权重,本研究分别设置为0.25、0.25、0.50,平衡3个任务的优化梯度。

    • 采用5个核心分类指标对模型性能进行5折交叉验证评估。这些指标包括准确率,精确率,召回率,加权F1分数,ROC-AUC。将Biopepformer与现有肽预测模型进行比较,选取主流的肽性质预测机器学习模型(XGBoost、随机森林、支持向量机SVM、LSTM,CNN,RNN,LightGBM)和目前在肽分类任务上表现较好的SOTA模型(pLM4ACE、peptitideBERT)作为对比模型。其中传统的机器学习模型输入特征为1024维序列向量拼接11维多肽性质,pLM4ACE 输入特征为基于ESM2嵌入的320维向量[13],peptitideBERT使用其训练权重进行微调。

    • 通过逐一移除模型中的多模态特征、TA-GMEU单元、监督对比学习模块、双向交叉注意力模块,对比各模块移除后的模型性能变化,验证各模块对模型性能的贡献。

    • 采用降血糖生物活性肽数据集作为迁移学习的对象,将在降血脂肽数据集上完成预训练的Biopepformer模型,迁移至降血糖生物活性肽数据集进行微调与测试,测试模型的跨靶点泛化能力。

    • 利用Python的Streamlit库开发了一款用户友好型的肽生物活性预测交互页面,该应用程序采用了Biopepformer模型。这款用户友好型程序允许研究人员上传表格文件进行批量预测,程序能够预测肽的降血糖活性和降血脂活性,并且输出可能作用的靶点信息。该文件可在https://github.com/XutaoYe/peptide_prediction获取。

    • 图1为这2个数据集的分布情况。为解决负样本数据缺失的问题,以多肽真实结合靶点为正样本,将多肽与非其真实靶点的其他靶点配对作为负样本,通过设定正负样本1∶4生成负样本。为避免多靶点多肽带来的数据标注错误,在生成负样本的时候排除了多靶点多肽的所有靶点标签。

      图  1  不同生物活性肽数据集按靶点的分布

      Figure 1.  Distribution of different bioactive peptide datasets by target

      Biopepformer同时完成2项任务的端到端训练,包括多肽-靶点结合活性二分类预测、多肽作用靶点多分类辅助任务。模型的输入为多肽ProtT5序列嵌入、基于Toxinpred预测的多肽理化特征和靶点蛋白ProTreck结构嵌入组成的三元组数据。通过特征融合层完成输入维度的统一映射后,经2条独立的TA-GMEU单元分别完成多肽与靶点特征的独立提取,实现通用生物学特征与靶点预测任务的分离学习。针对靶点预测任务,通过双向交叉注意力交互模块深度建模多肽与靶点的互作模式,最终输出靶点分类特征与结合活性预测结果。为避免多任务学习中的负迁移,采用的TA-GMEU单元通过“全局共享专家+任务专属专家”的并行结构,配合任务门控权重机制,平衡不同任务的优化梯度。

      构建了活性肽高通量筛选工作流:先将待筛选多肽序列、候选靶点蛋白结构与功能信息输入Biopepformer;随后靶点分类塔预测多肽对应的作用靶点,对候选靶点进行筛选;结合预测塔评估多肽与靶点的结合活性可行性(图2)。

      图  2  Biopepformer的构建流程

      Figure 2.  Construction process of Biopepformer

    • 采用5折分层交叉验证策略对Biopepformer的性能进行无偏评估。模型靶点预测结果如图3A所示。在仅正样本的5靶点多分类任务中,Biopepformer整体准确率达0.899,加权F1分数达0.902,展现出优异的靶点分类能力(图3C)。进一步统计了5个靶点的单靶点结合预测准确率,结果如图3D所示。在结合活性预测的二分类任务框架下,模型整体预测准确率达0.959,加权F1分数达0.958,高于纯序列多分类任务的性能,证实了多任务学习框架对靶点分类能力的增益。与纯序列多分类结果一致,模型对样本量充足、序列特征显著的PL、HMG-coA靶点表现出最优的预测性能,而对小样本的PCSK9靶点仍保持了稳定的分类能力,验证了模型在小样本场景下的鲁棒性。各折次损失曲线快速收敛且无明显训练-验证差距,最终平均验证损失低至0.381;验证准确率稳定在0.940~0.970;5折平均AUC达0.952,表明模型对活性肽-靶点的良好匹配能力(图3B、E、F)。

      图  3  模型在5折交叉验证下对模型的性能评估

      Figure 3.  Performance evaluation of the model under 5-fold cross-validation

    • Biopepformer在所有评估指标上均显著优于所有基线模型(图4)。其性能优势主要源于基于Transformer的架构设计。与传统机器学习模型依赖手工提取的理化特征不同,Biopepformer通过大规模预训练学习到了多肽序列与靶点结构之间的深层交互模式,其自注意力机制能够有效捕捉多肽与靶点的关键信息,从而更精准地建模关联信息。相比之下,传统机器学习模型(如随机森林、SVM)受限于单一特征嵌入,难以充分挖掘复杂的生物分子交互信息;而深度学习模型(如LSTM、CNN)在处理长程依赖关系和全局特征提取方面仍存在不足。目前的SOTA模型,pLM4ACE仅使用ESM2对序列进行嵌入,输入到传统的机器学习模型中进行下游分类任务。最优模型逻辑回归仅针对二分类场景的线性边界优化,无法建模多靶点对应的高维非线性类别边界,在多分类任务中出现严重的特征区分度不足。而PeptideBERT虽然是基于Transformer架构构建,依赖大规模微调数据才能避免过拟合、发挥性能优势。本研究的降血脂肽数据集仅300余条样本,属于典型的小样本场景。PeptideBERT在微调过程中极易出现过拟合,无法有效学习多类决策边界。

      图  4  Biopepformer与目前主流的生物活性肽判别器的性能对比

      Figure 4.  Performance comparison between Biopepformer and current mainstream bioactive peptide discriminators

    • 为量化Biopepformer各模块对多肽-靶点结合活性预测性能的贡献,进行了消融实验。检验了交叉验证中测试集与训练集的分布情况,以避免数据泄露。特征工程消融实验表明,多模态融合策略是靶点配对任务的关键,将靶点蛋白结构信息与多肽信息同时传入模型参与损失,可以显著提升靶点分类性能(表1)。模块消融实验表明:多任务学习框架和TA-GMEU为性能核心驱动因素(图5)。移除多任务学习框架(MultiTask-Off)后,模型平均加权F1分数降至0.932,为所有消融变体最低,证明该框架引导模型学习更具生物学意义的通用特征。移除TA-GMEU(GME-Off)后,模型平均加权F1分数从0.936降至0.935,性能标准差从0.0141升至0.0236,训练稳定性下降,证实该单元通过独立学习通用和任务特异性特征,解决多任务学习的特征冲突与负迁移问题。值得注意的是,移除监督对比学习模块(SupCon-Off)后,模型的性能反而上升。初步推测是因为降血脂肽数据集为小样本多分类场景,该模块移除后模型可聚焦核心任务优化。整体消融实验明确多模态融合、独立特征提取与多任务联合学习,是提升现有生物活性肽预测模型性能瓶颈的关键。

      表 1  特征工程消融实验结果

      Table 1.  Results of feature engineering ablation experiments

      实验组任务类型准确率率F1分数精准率召回率
      无物化性质结合预测0.927±0.0160.926±0.0160.926±0.0160.927±0.016
      无ProT5序列嵌入结合预测0.920±0.0240.918±0.0260.919±0.02560.920±0.024
      无靶点嵌入靶点预测0.576±0.0360.556±0.0350.542±0.0360.576±0.036
        说明:数值为平均值±标准差。

      图  5  Biopepformer核心模块消融实验性能对比

      Figure 5.  Performance comparison of ablation experiments on the core modules of Biopepformer

    • 为评估Biopepformer的泛化能力,将其迁移至样本量更大的降血糖活性肽数据集进行微调。结果表明模型在该数据集上的准确率、精确率、召回率与加权F1分数均有提升(图6A)。5折交叉验证显示训练损失与验证准确率平稳收敛(图6B、F)。针对DPP4、GLP-1受体、MGA等3类靶点,模型多类别分类表现优异。整体分类准确率达0.863,加权 F1分数为0.884,靶点结合预测任务的准确率和F1分数均为0.975(图6C、D)。ROC曲线进一步证实模型具备极强的样本判别能力,5折平均AUC高达0.976±0.009(图6E),初步验证了模型在更大生物活性肽数据集上的良好泛化潜力。

      图  6  Biopepformer在降血糖生物活性肽数据集的5折交叉验证性能评估

      Figure 6.  Performance evaluation of Biopepformer on the hypoglycemic bioactive peptide dataset using 5-fold cross-validation

    • 靶向同一生物功能但作用于不同分子靶点的活性肽细分筛选,是阐明作用机制并降低脱靶风险的关键前提。已有研究多聚焦于单一靶点的二分类预测或基于序列的多类识别,未整合靶点结构信息,导致模型难以区分功能相似但结合口袋不同的肽段特征[4]。多任务学习与多模态融合为突破这一局限提供了可能,但现有架构面临特征冲突与负迁移挑战[12]。本研究通过构建任务自适应门控多专家单元与双向交叉注意力机制,首次实现了多肽序列、靶点结构与理化性质三模态信息的联合学习,并在同一框架下同步完成结合活性预测与靶点分类任务[25]

      本研究首次将多肽序列、靶点结构与理化性质三类模态信息纳入统一的多任务学习框架,同步完成靶点分类与结合活性预测。在降血脂活性肽数据集上,模型靶点分类整体准确率达0.899、加权F1分数为0.902,结合预测F1分数为0.958,平均AUC为0.952。消融实验证实,多模态融合是该性能的核心支撑。移除靶点结构嵌入后靶点分类准确率骤降至0.576,表明仅凭序列信息无法有效分离同功能异靶点的肽段特征,而结构信息的引入让模型得以捕捉与靶点之间的潜在关联。

      任务自适应门控多专家单元通过“共享专家+任务专属专家”的解耦设计,缓解了多任务学习中的特征冲突。移除该单元后模型训练稳定性下降。监督对比损失在小样本多靶点场景下被移除后性能反而小幅上升,提示严格对比可能放大类内噪声,在数据稀缺时需谨慎设计辅助目标。与现有方法相比,传统机器学习模型受限于一维嵌入而无法学习多靶点高维决策边界。Biopepformer则凭借多模态信息互补与自适应任务平衡,在所有指标上大幅领先,表明了合理架构对抑制小样本过拟合的决定性作用。

      本研究建立了多任务分类模型Biopepformer。该模型整合了多任务学习框架、TA-GMEU单元等核心模块,实现了多肽与靶点多模态数据融合,同步完成了结合活性预测与靶点分类任务,在降血脂、降血糖数据集上表现优异。这些结果共同表明,多模态融合与门控多专家多任务架构是突破同功能多靶点精细分类瓶颈的有效策略,为功能活性肽的高通量虚拟筛选和作用机制解析提供了新的技术路线。

    • 本研究基于多任务学习框架,集成TA-GMEU单元、双向交叉注意力与对比学习策略,开发了Biopepformer多任务预测模型,实现了多肽多模态信息融合及双任务同步预测。Biopepformer在降血脂肽数据集上性能显著优于主流模型。消融实验证实,多模态数据融合是模型性能优异的关键。迁移学习结果表明,该模型具有在更大数据集上的泛化潜力。综上所述,多模态数据融合与独立特征提取是提升活性肽预测精度的有效策略,可为活性肽虚拟筛选及功能研究提供新的思路。虽然Biopepforme展现出优异的鲁棒性,但其预测精度仍受限于较小的数据集规模,尤其对小样本靶点,且尚未整合分子对接或蛋白质相互作用网络等更深层信息。未来研究将扩展多肽-靶点互作数据库,纳入额外的生物学模态并探索预训练策略,以进一步提升模型的泛化性与可解释性。

参考文献 (25)

目录

    /

    返回文章
    返回