2)基于机器学习(machine learning,ML)的预测方法。该预测方法是通过对AMPs的已知数据信息进行学习,进行推理、归纳、综合或模型拟合后,找出AMPs的特点和规律,并将其推广到未知AMPs数据来进行预测的方法
[44]。该方法采取有监督学习方式将AMPs预测转变为分类问题,主要适用于模型相对复杂且缺乏一般性理论的AMPs的预测。近10年来,ML预测方法的重点已经转移到一种高度数据驱动的方法上
[50]。ML的基本流程主要包括学习、预测和验证3个阶段
[44]。在第1阶段,先从文献或公共数据库收集AMPs序列,构建AMPs数据集;然后,通过分类算法设计和相关参数学习训练得到相应的预测模型,并将待测AMPs提交给训练好的预测模型,通过计算机处理输出相应的预测结果。最后,根据不同的评价指标进行检验和优化调整
[45]。由于ML无法直接读取AMPs的序列排布、理化性质、抗菌活性等信息,所以必须先提取AMPs特征并用数学描述来表达特质,因此,ML的核心问题是如何设计具有高精度的分类算法。目前,ML的预测方法包括二分类学习法、多分类学习法和多标签学习法
[44]。利用二分类学习法对AMPs进行预测时,通常将全部AMPs样本划分为2类,即AMPs和非AMPs,常见的算法包括人工神经网络(artificial neural network,ANN)、支持向量机(support vector machine,SVM)和随机森林(random forest,RF)等
[45]。Lata等
[53]开发了一种基于ANN、SVM和QSAR的AMPs分类工具,发现了AMPs的C端和N端中的独特基序。Chersakov等
[54]使用高通量筛选方法,对数千种AMPs的抗菌效果进行了ANN模型训练,发现对多药耐药菌有效的高效AMPs。Torrent等
[55]通过SVM对AMPs进行了分类与预测,预测准确率达到了75%~90%。Okella等
[56]基于SVM在APD3提交的127种鱼源AMPs中,根据其理化性质筛选出基序候选物。其中,肽Pleurocidin中第2~19位氨基酸的A15_B基序表现最强的抗菌潜力。Maccari等
[57]使用RF模型设计并验证了2种天然AMPs和1种具有非天然氨基酸AMPs的抗菌活性。随着预测手段的发展,人们逐渐将AMPs的样本属性扩展到多种类别。Lata等
[58]和Joseph等
[59]基于AMPs序列特征分别利用SVM和RF算法,采用“一类对其余”策略对二分类学习法进行改进,建立了多分类学习法,将AMPs的类别扩展到了至少3个。随着研究的不断深入,多标签学习法被用于处理AMPs样本序列和抗菌活性存在“一对多”关系数据
[44]。