-
活性肽是具有特定营养与生理功能的天然活性物质,在功能食品和生物医药领域具有广泛的应用前景[1−2]。但传统活性肽筛选存在需大量湿实验验证、筛选周期长、研发成本高等问题,而基于机器学习的预测模型可以有效提高功能性肽的筛选效率。如ESMR4FBP通过优化LSTM模型可提升预测抗氧化肽的准确率[3]; pLM4ACE采用多种嵌入方式搭配不同的模型,可确认筛选血管紧张素转换酶抑制肽的最佳模型[4];UmamiYYDS可通过机器学习预测7种风味肽并输出相关的分数[5];NeuroCL可将对比学习与交叉注意力结合,用于神经肽识别,性能显著优于传统模型[6]。在各类模型架构中,多任务预测凭借其独特的优势得到了广泛应用,其核心是在单个模型框架内同步学习多个相关的预测任务,通过共享特征表示实现任务间的信息互补,相较于单任务模型可有效提升模型的泛化能力与学习效率[7],已成为当前生物信息学领域处理复杂生物数据的主流方法之一。如GRU4ACE模型便通过多任务学习框架结合门控单元实现了血管紧张素转化酶抑制肽的高效识别,其平衡准确率可达 0.948,验证了该架构在活性肽预测场景的有效性[8]。这些模型的应用,有力推动了特定场景下的生物活性肽虚拟筛选,减轻了湿实验负担。随着活性肽研发的深入,同一功能下的多靶点分类成为领域核心需求,即对具备同类生理功能的活性肽,细分其具体作用靶点。以降血脂活性肽为例,其均以调节脂质代谢为核心功能,但作用靶点涵盖3-羟基-3-甲基戊二酰辅酶A(3-hydroxy-3-methylglutaryl-coenzyme A reductase,HMG-CoA)还原酶、前蛋白转化酶枯草杆菌蛋白酶/kexin 9型(proprotein convertase subtilisin/kexin type 9,PCSK9)、过氧化物酶体增殖物激活受体α(peroxisome proliferator-activated receptor α,PPAR-α)、胰脂肪酶等多种类型[9−10];精准的靶点分类可明确活性肽的作用机制,避免表型筛选的机制模糊问题,为功能食品、低副作用候选药物研发提供精准依据,缩小湿实验筛选范围。
精准的活性预测与靶点分类依赖对生物分子的全面特征表征,多模态数据融合为此提供了可行方案。本研究中的多模态指来自不同数据源、具备不同生物学语义的特征类型,包括多肽序列模态、靶点结构模态与多肽理化性质模态;多模态融合可突破单一特征的表征局限,更全面地刻画多肽-靶点配对[11]。近年来,预训练蛋白语言模型的发展为多模态特征提取与融合提供了技术支撑,多模态模型也已在蛋白功能预测等领域展现出显著优于单模态模型的性能[12−14]。现有活性肽分析模型在特定场景虽然表现良好,但仍存在标签设置模糊、难以适配同一功能下不同靶点的筛选场景等问题,且这种不同靶点的冗杂数据会导致模型泛化能力下降。同时,单一的输入特征无法涵盖肽的特征信息、作用靶点结构实现数据融合,限制了模型精度的提高[12]。目前尚无研究将多模态融合应用于活性肽靶点分类任务,也未开发适配同功能多靶点细分筛选的专用模型,这一空白限制了活性肽虚拟筛选技术的发展。
为了提升生物活性肽的筛选精度,本研究基于多任务学习的深度学习框架,集成了门控单元、对比学习和Transformer编码器,开发了Biopepformer深度学习模型。与现有的生物活性肽预测模型不同,Biopepformer具有通过多任务架构实现多模态学习的优势,融合了多肽序列、作用靶点结构和物理化学性质多维度信息,可更精准地界定生物活性肽的作用范围,为生物活性肽功能探究提供新思路。
-
采用多肽序列-多肽物理化学性质-靶点蛋白三元组数据,开展Biopepformer的作用预测数据集构建。降血脂生物活性肽数据集通过BioPep-UWM数据库检索及文献人工整理获得,含5类共267条序列[15−18];靶点蛋白质结构从PDB数据库中搜集。为评估模型泛化能力,通过手动收集了降血糖生物活性肽数据集(3类共591条序列)[19]。降血脂肽生物活性包括HMG-CoA还原酶抑制剂、PCSK9抑制剂、PPARα激动剂、胰脂肪酶抑制剂和胆固醇酯酶抑制剂[20]。降血糖肽生物活性包括二肽基肽酶4(dipeptidyl peptidase 4,DPP4)抑制剂,胰高血糖素样肽1(glucagon-like peptide 1,GLP-1)类似肽,和麦芽糖酶-葡糖淀粉酶(maltase-glucoamylase,MGA)抑制剂[21]。所有数据集均采用5折分层交叉验证,数据集详细信息见https://github.com/XutaoYe/peptide_prediction。
-
使用预训练蛋白质语言模型(protein language model,pLM)ProtT5,蛋白质结构嵌入模型ProTreck,以及Toxinpred对多肽物理化学性质进行预测[22−23]。其中序列嵌入为1×1 024维向量,结构嵌入为1×1 024维向量,多肽性质使用Toxinpred预测的10类理化性质。同时为了表示生理作用,在物理化学性质中增加作用维度,用0表示拮抗,用1表示激活。
-
为解决多任务学习的特征冲突与负迁移问题,将TA-GMEU作为核心特征提取模块,在多肽、靶点支路各设置1个独立单元,每个单元含1个全局共享专家和2个任务专属专家,引入L2正则化缓解过拟合,采用LeakyReLU激活函数避免梯度消失[24]。
-
参考CACLENS的多任务专家门控以设计专家层[12]。对于输入特征$ x\in {R}^{{{\text{d}}_{\text{model}}}} $,单个专家网络$ \mathcal{E}(x) $的计算过程为:
其中,$ {W}_{1},{W}_{2}\in{R}^{512 \times 512} $、$ {b}_{1},{b}_{2}\in{R}^{512} $为可学习参数,$ \alpha =0.01 $为LeakyReLU的负斜率。对3个专家网络进行分工,分别关注不同的特征以实现多任务学习:全局共享专家学习所有任务通用底层特征;分类任务专属专家服务于靶点分类任务;结合预测任务专属专家服务于结合预测核心任务。
-
引入固定权重偏置强化核心任务的专家特征贡献。基础权重计算公式为:
其中,$ W_{\text{g}1}^{\text{cls}}\in {R}^{256\times 512} $、$ W_{\text{g}}^{\text{cls}}\in {R}^{3\times 256} $为可学习权重参数,$ {w}^{\text{cls}}=[{w}_{\text{shared}},{w}_{\text{cls}}{,{{w}_{\text{bind}}}]}^{\text{T}} $为分类任务的基础权重向量,满足$ {w}_{\text{shared}}+{w}_{\text{cls}}{+w}_{\text{bind}}=1 $。引入固定权重偏置,强化共享专家与分类专属专家的贡献,调整后的权重为:
其中,$ {b}_{\text{cls}}=[1.2,\;0.5,\;0.5] $为分类任务专属权重偏置,$ \odot $为哈达玛积。针对靶点预测任务,门控网络对所有专家分配权重,通过固定偏置强化共享专家与结合预测任务专属专家的贡献,基础权重计算公式为:
其中,$ W_{\text{g1}}^{\text{bind}}\in {R}^{256\times 512} $、$ W_{\text{g}}^{\text{bind}}\in {R}^{3\times 256} $为可学习权重参数,$ {w}^{\text{bind}}=[{w}_{\text{shared}},{w}_{\text{cls}},{w}_{\text{bind}}{]}^{\text{T}} $为结合预测任务的基础权重向量。
结合预测任务同样引入任务自适应权重偏置,调整后的权重为:
其中,$ {\boldsymbol{b}}_{\text{bind}}=[0.3,1.2,0.5{]}^{\text{T}} $为结合预测任务专属权重偏置。多肽支路与靶点支路分别通过独立的TA-GMEU,最终输出两组任务特异性特征:①多肽支路。靶点分类任务特征$ H_{\text{pep}}^{\text{cls}} $、结合预测任务特征$ H_{\text{pep}}^{\text{bind}} $。②靶点支路。靶点分类任务特征$ H_{\text{tar}}^{\text{cls}} $、结合预测任务特征$ H_{\text{tar}}^{\text{bind}} $。
模型的关键超参数基于预实验结果与相关文献经验进行设置[12],具体取值如下:批次大小为32,隐藏层维度为512,初始学习率设为1e-4,采用AdamW优化器并设置权重衰减为1e-5;监督对比损失温度系数(temperature)为0.07,难样本比例为0.2;训练轮次设为100,采用基于验证集F1分数的早停策略(patience=10,min delta=0.001)。
-
构建了双向交叉注意力交互模块。模块采用两个独立的多头注意力层分别学习两个方向的交互模式,同时补充了残差连接、层归一化与前馈网络。将TA-GMEU单元输出的结合特征扩展序列维度,构建交叉注意力的查询(query,Q)、键(key,K)、值(value,V)矩阵。
-
采用Transformer标准缩放点积注意力计算,计算公式为:
其中,$ {d}_{k} $为单头注意力的维度,注意力头数h=8。
-
多头注意力将Q、K、V分别映射到h个独立的特征子空间,分别计算注意力后拼接输出,实现不同维度交互特征的并行提取,计算公式为:
其中,$ W_{i}^{Q},W_{i}^{K},W_{i}^{V}\in {R}^{512\times 64} $、$ {W}^{O}\in {R}^{512\times 512} $为可学习参数。
基于多头注意力机制,构建双向交叉注意力计算,分别得到多肽感知靶点的注意力特征,与靶点感知多肽的注意力特征:
其中,$ {\text{MHCA}}_{\mathrm{pep}2\text{tar}} $与$ {\text{MHCA}}_{\mathrm{tar}2\text{pep}} $为2个独立的多头注意力层,分别学习2个方向的交互模式,避免参数共享导致的特征学习冲突。
-
针对多靶点多肽场景,在负样本构建中自动规避多肽的所有真实作用靶点,对于批次内N个样本,首先对特征进行L2归一化,计算样本间的相似度矩阵:
其中,$ {{\textit{z}}}_{i} $,$ {{\textit{z}}}_{j} $为L2归一化后的特征向量,$ \tau $为温度系数,本研究设置$ \tau $=0.07。
构建正负样本掩码。对于样本i,正样本掩码$ \text{po}{\text{s}}_{\text{mask}\left(i,j\right)=1} $,当且仅当样本i与样本j属于同一靶点类别且$ i\neq j $;负样本掩码$ {\text{neg}}_{\text{mask}\left(i,j\right)=1} $,当且仅当样本i与样本j属于不同类别靶点,且对应靶点不为多肽的真实作用靶点。引入了难例挖掘策略,对每个样本i选取相似度最高的前M个负样本作为难负样本,$ M=\max [1,\text{int}(N\times r)] $,其中,r为难负样本比例,本研究设置r=0.2。最终的监督对比损失计算公式为:
其中,$ {N}_{\text{pos}} $为批次内正样本对的总数,$ \text{har}{\text{d}}_{\text{neg}\left(i\right)} $为样本i的难负样本集合。本研究分别对多肽支路的分类特征$ H_{\text{pep}}^{\text{cls}} $计算多肽分类监督对比损失$ \mathcal{L}_{\text{scl}}^{\text{pep}} $,对靶点支路的分类特征$ H_{\text{tar}}^{\text{cls}} $计算靶点分类监督对比损失$ \mathcal{L}_{\text{scl}}^{\text{tar}} $。
总损失为3个子任务损失的加权求和,重点优化结合预测核心任务,同时通过对比损失辅助提升特征表征能力,计算公式为:
其中,$ {\lambda }_{\text{pep}} $、$ {\lambda }_{\text{tar}} $、$ {\lambda }_{\text{bind}} $为损失权重,本研究分别设置为0.25、0.25、0.50,平衡3个任务的优化梯度。
-
采用5个核心分类指标对模型性能进行5折交叉验证评估。这些指标包括准确率,精确率,召回率,加权F1分数,ROC-AUC。将Biopepformer与现有肽预测模型进行比较,选取主流的肽性质预测机器学习模型(XGBoost、随机森林、支持向量机SVM、LSTM,CNN,RNN,LightGBM)和目前在肽分类任务上表现较好的SOTA模型(pLM4ACE、peptitideBERT)作为对比模型。其中传统的机器学习模型输入特征为
1024 维序列向量拼接11维多肽性质,pLM4ACE 输入特征为基于ESM2嵌入的320维向量[13],peptitideBERT使用其训练权重进行微调。 -
通过逐一移除模型中的多模态特征、TA-GMEU单元、监督对比学习模块、双向交叉注意力模块,对比各模块移除后的模型性能变化,验证各模块对模型性能的贡献。
-
采用降血糖生物活性肽数据集作为迁移学习的对象,将在降血脂肽数据集上完成预训练的Biopepformer模型,迁移至降血糖生物活性肽数据集进行微调与测试,测试模型的跨靶点泛化能力。
-
利用Python的Streamlit库开发了一款用户友好型的肽生物活性预测交互页面,该应用程序采用了Biopepformer模型。这款用户友好型程序允许研究人员上传表格文件进行批量预测,程序能够预测肽的降血糖活性和降血脂活性,并且输出可能作用的靶点信息。该文件可在https://github.com/XutaoYe/peptide_prediction获取。
-
图1为这2个数据集的分布情况。为解决负样本数据缺失的问题,以多肽真实结合靶点为正样本,将多肽与非其真实靶点的其他靶点配对作为负样本,通过设定正负样本1∶4生成负样本。为避免多靶点多肽带来的数据标注错误,在生成负样本的时候排除了多靶点多肽的所有靶点标签。
Biopepformer同时完成2项任务的端到端训练,包括多肽-靶点结合活性二分类预测、多肽作用靶点多分类辅助任务。模型的输入为多肽ProtT5序列嵌入、基于Toxinpred预测的多肽理化特征和靶点蛋白ProTreck结构嵌入组成的三元组数据。通过特征融合层完成输入维度的统一映射后,经2条独立的TA-GMEU单元分别完成多肽与靶点特征的独立提取,实现通用生物学特征与靶点预测任务的分离学习。针对靶点预测任务,通过双向交叉注意力交互模块深度建模多肽与靶点的互作模式,最终输出靶点分类特征与结合活性预测结果。为避免多任务学习中的负迁移,采用的TA-GMEU单元通过“全局共享专家+任务专属专家”的并行结构,配合任务门控权重机制,平衡不同任务的优化梯度。
构建了活性肽高通量筛选工作流:先将待筛选多肽序列、候选靶点蛋白结构与功能信息输入Biopepformer;随后靶点分类塔预测多肽对应的作用靶点,对候选靶点进行筛选;结合预测塔评估多肽与靶点的结合活性可行性(图2)。
-
采用5折分层交叉验证策略对Biopepformer的性能进行无偏评估。模型靶点预测结果如图3A所示。在仅正样本的5靶点多分类任务中,Biopepformer整体准确率达0.899,加权F1分数达0.902,展现出优异的靶点分类能力(图3C)。进一步统计了5个靶点的单靶点结合预测准确率,结果如图3D所示。在结合活性预测的二分类任务框架下,模型整体预测准确率达0.959,加权F1分数达0.958,高于纯序列多分类任务的性能,证实了多任务学习框架对靶点分类能力的增益。与纯序列多分类结果一致,模型对样本量充足、序列特征显著的PL、HMG-coA靶点表现出最优的预测性能,而对小样本的PCSK9靶点仍保持了稳定的分类能力,验证了模型在小样本场景下的鲁棒性。各折次损失曲线快速收敛且无明显训练-验证差距,最终平均验证损失低至0.381;验证准确率稳定在0.940~0.970;5折平均AUC达0.952,表明模型对活性肽-靶点的良好匹配能力(图3B、E、F)。
-
Biopepformer在所有评估指标上均显著优于所有基线模型(图4)。其性能优势主要源于基于Transformer的架构设计。与传统机器学习模型依赖手工提取的理化特征不同,Biopepformer通过大规模预训练学习到了多肽序列与靶点结构之间的深层交互模式,其自注意力机制能够有效捕捉多肽与靶点的关键信息,从而更精准地建模关联信息。相比之下,传统机器学习模型(如随机森林、SVM)受限于单一特征嵌入,难以充分挖掘复杂的生物分子交互信息;而深度学习模型(如LSTM、CNN)在处理长程依赖关系和全局特征提取方面仍存在不足。目前的SOTA模型,pLM4ACE仅使用ESM2对序列进行嵌入,输入到传统的机器学习模型中进行下游分类任务。最优模型逻辑回归仅针对二分类场景的线性边界优化,无法建模多靶点对应的高维非线性类别边界,在多分类任务中出现严重的特征区分度不足。而PeptideBERT虽然是基于Transformer架构构建,依赖大规模微调数据才能避免过拟合、发挥性能优势。本研究的降血脂肽数据集仅300余条样本,属于典型的小样本场景。PeptideBERT在微调过程中极易出现过拟合,无法有效学习多类决策边界。
-
为量化Biopepformer各模块对多肽-靶点结合活性预测性能的贡献,进行了消融实验。检验了交叉验证中测试集与训练集的分布情况,以避免数据泄露。特征工程消融实验表明,多模态融合策略是靶点配对任务的关键,将靶点蛋白结构信息与多肽信息同时传入模型参与损失,可以显著提升靶点分类性能(表1)。模块消融实验表明:多任务学习框架和TA-GMEU为性能核心驱动因素(图5)。移除多任务学习框架(MultiTask-Off)后,模型平均加权F1分数降至0.932,为所有消融变体最低,证明该框架引导模型学习更具生物学意义的通用特征。移除TA-GMEU(GME-Off)后,模型平均加权F1分数从0.936降至0.935,性能标准差从
0.0141 升至0.0236 ,训练稳定性下降,证实该单元通过独立学习通用和任务特异性特征,解决多任务学习的特征冲突与负迁移问题。值得注意的是,移除监督对比学习模块(SupCon-Off)后,模型的性能反而上升。初步推测是因为降血脂肽数据集为小样本多分类场景,该模块移除后模型可聚焦核心任务优化。整体消融实验明确多模态融合、独立特征提取与多任务联合学习,是提升现有生物活性肽预测模型性能瓶颈的关键。实验组 任务类型 准确率率 F1分数 精准率 召回率 无物化性质 结合预测 0.927±0.016 0.926±0.016 0.926±0.016 0.927±0.016 无ProT5序列嵌入 结合预测 0.920±0.024 0.918±0.026 0.919± 0.0256 0.920±0.024 无靶点嵌入 靶点预测 0.576±0.036 0.556±0.035 0.542±0.036 0.576±0.036 说明:数值为平均值±标准差。 Table 1. Results of feature engineering ablation experiments
-
为评估Biopepformer的泛化能力,将其迁移至样本量更大的降血糖活性肽数据集进行微调。结果表明模型在该数据集上的准确率、精确率、召回率与加权F1分数均有提升(图6A)。5折交叉验证显示训练损失与验证准确率平稳收敛(图6B、F)。针对DPP4、GLP-1受体、MGA等3类靶点,模型多类别分类表现优异。整体分类准确率达0.863,加权 F1分数为0.884,靶点结合预测任务的准确率和F1分数均为0.975(图6C、D)。ROC曲线进一步证实模型具备极强的样本判别能力,5折平均AUC高达0.976±0.009(图6E),初步验证了模型在更大生物活性肽数据集上的良好泛化潜力。
-
靶向同一生物功能但作用于不同分子靶点的活性肽细分筛选,是阐明作用机制并降低脱靶风险的关键前提。已有研究多聚焦于单一靶点的二分类预测或基于序列的多类识别,未整合靶点结构信息,导致模型难以区分功能相似但结合口袋不同的肽段特征[4]。多任务学习与多模态融合为突破这一局限提供了可能,但现有架构面临特征冲突与负迁移挑战[12]。本研究通过构建任务自适应门控多专家单元与双向交叉注意力机制,首次实现了多肽序列、靶点结构与理化性质三模态信息的联合学习,并在同一框架下同步完成结合活性预测与靶点分类任务[25]。
本研究首次将多肽序列、靶点结构与理化性质三类模态信息纳入统一的多任务学习框架,同步完成靶点分类与结合活性预测。在降血脂活性肽数据集上,模型靶点分类整体准确率达0.899、加权F1分数为0.902,结合预测F1分数为0.958,平均AUC为0.952。消融实验证实,多模态融合是该性能的核心支撑。移除靶点结构嵌入后靶点分类准确率骤降至0.576,表明仅凭序列信息无法有效分离同功能异靶点的肽段特征,而结构信息的引入让模型得以捕捉与靶点之间的潜在关联。
任务自适应门控多专家单元通过“共享专家+任务专属专家”的解耦设计,缓解了多任务学习中的特征冲突。移除该单元后模型训练稳定性下降。监督对比损失在小样本多靶点场景下被移除后性能反而小幅上升,提示严格对比可能放大类内噪声,在数据稀缺时需谨慎设计辅助目标。与现有方法相比,传统机器学习模型受限于一维嵌入而无法学习多靶点高维决策边界。Biopepformer则凭借多模态信息互补与自适应任务平衡,在所有指标上大幅领先,表明了合理架构对抑制小样本过拟合的决定性作用。
本研究建立了多任务分类模型Biopepformer。该模型整合了多任务学习框架、TA-GMEU单元等核心模块,实现了多肽与靶点多模态数据融合,同步完成了结合活性预测与靶点分类任务,在降血脂、降血糖数据集上表现优异。这些结果共同表明,多模态融合与门控多专家多任务架构是突破同功能多靶点精细分类瓶颈的有效策略,为功能活性肽的高通量虚拟筛选和作用机制解析提供了新的技术路线。
-
本研究基于多任务学习框架,集成TA-GMEU单元、双向交叉注意力与对比学习策略,开发了Biopepformer多任务预测模型,实现了多肽多模态信息融合及双任务同步预测。Biopepformer在降血脂肽数据集上性能显著优于主流模型。消融实验证实,多模态数据融合是模型性能优异的关键。迁移学习结果表明,该模型具有在更大数据集上的泛化潜力。综上所述,多模态数据融合与独立特征提取是提升活性肽预测精度的有效策略,可为活性肽虚拟筛选及功能研究提供新的思路。虽然Biopepforme展现出优异的鲁棒性,但其预测精度仍受限于较小的数据集规模,尤其对小样本靶点,且尚未整合分子对接或蛋白质相互作用网络等更深层信息。未来研究将扩展多肽-靶点互作数据库,纳入额外的生物学模态并探索预训练策略,以进一步提升模型的泛化性与可解释性。
A multi-task prediction model for bioactive peptides optimized by a custom gating system
doi: 10.11833/j.issn.2095-0756.20260196
- Received Date: 2026-03-16
- Rev Recd Date: 2026-06-03
-
Key words:
- bioactive peptides /
- multi-task deep learning /
- protein language model /
- customized gating system
Abstract:
| Citation: | YE Xutao, Tuerxunnayi Aili , FENG Xin, et al. A multi-task prediction model for bioactive peptides optimized by a custom gating system[J]. Journal of Zhejiang A&F University, 2026, 43(X): 1−11 doi: 10.11833/j.issn.2095-0756.20260196 |
DownLoad: