REVIEW

Artificial Intelligence in Lignocellulase Engineering: Applications and Recent Advances

  • ZHOU Jiaan , 1, 2 ,
  • GAO Le 3 ,
  • LI Zhongqiu 4 ,
  • LIU Chunlong , 1, *
Expand
  • 1 Northeast Institute of Geography and Agroecology, Chinese Academy of Sciences, Harbin 150081, China
  • 2 University of Chinese Academy of Sciences, Beijing 100049, China
  • 3 Tianjin Institute of Industrial Biotechnology, Chinese Academy of Sciences, Tianjin 300308, China
  • 4 Institute of Animal Science, Heilongjiang Academy of Agricultural Sciences, Harbin 150086, China
* professor, E-mail:

Received date: 2025-02-28

  Online published: 2025-09-12

Abstract

Lignocellulose, the primary component of plant cell walls, is the most abundant and renewable biomass resource on earth. Its rich polysaccharide content holds tremendous potential for the development of livestock feed resources. However, the intricate and recalcitrant structure of lignocellulose limits its digestibility and utilization by livestock. Biological degradation of lignocellulose using microorganisms and their secreted enzymes offers advantages including low energy consumption, minimal pollution, and high environmental compatibility. By employing artificial intelligence algorithms such as deep learning and machine learning, researchers can efficiently extract key features from enzyme sequences and structures while predicting their performance. These approaches can effectively address the time-consuming and labor-intensive challenges associated with traditional enzyme engineering. This review summarized recent advances in applying artificial intelligence to lignocellulase engineering for lignocellulose biodegradation, aiming to provide insights for the development of lignocellulose-based feed resources and sustainable green manufacturing.

Cite this article

ZHOU Jiaan , GAO Le , LI Zhongqiu , LIU Chunlong . Artificial Intelligence in Lignocellulase Engineering: Applications and Recent Advances[J]. Chinese Journal of Animal Nutrition, 2025 , 37(9) : 5811 -5823 . DOI: 10.12418/CJAN2025.473

木质纤维素是植物细胞壁的核心组分,富含木质纤维素的生物质年产量高达1 400亿t[1],是陆地生物圈中固定碳的主要形式[2]。基于基因型和环境因素等多重影响,木质纤维素组成在不同植物组织、不同植物种类甚至同一种类内部均有所差异(35%~50%纤维素、20%~30%半纤维素和20%~30%木质素)[2-3],纤维素、半纤维素、木质素通过糖苷键、醚键、酯键等方式交联,构成坚韧的细胞壁结构。木质素对酶解位点的空间屏蔽及纤维素结晶区的高稳定性,导致木质纤维素降解和资源化利用难度很大[4-5]。针对木质纤维素的降解,目前主要的预处理方法有物理法、化学法和生物法[2],其中生物法主要依靠天然或酶工程改造后的酶,将木质纤维素转化为简单糖类[2],该方法因低能耗、少污染、高环境兼容性等优势备受关注。酶工程是利用突变和筛选技术,针对木质纤维素酶的结构和功能进行改造获得性能更优的酶。但传统实验方法如结构生物学和定向进化,存在技术复杂、时间长和筛选效率低等局限性[6]。深度学习和机器学习等人工智能技术擅长处理大规模数据,能高效地从酶序列和酶结构中提取关键特征,不仅可以预测酶的功能和性质,还可以加速新酶的理性设计,为木质纤维素酶的开发提供了新的策略和机会[7-8]。本文将对人工智能在木质纤维素生物降解领域中酶工程应用方面的研究进展进行综述,以期为木质纤维素在饲料资源开发及绿色生物制造领域的研究与应用提供参考。

1 木质纤维素的生物降解与酶工程

1.1 木质纤维素结构的复杂性

木质纤维素是植物次生细胞壁的主要成分,由纤维素形成网状骨架,半纤维素和木质素填充其间,其中包含少量脂类、蛋白质、果胶等聚合物[5]。木质纤维素紧密复杂的结构为植物细胞提供了强大的机械支撑和防护作用(图1),但这也是木质纤维素难降解的主要原因。
图1 植物细胞壁及木质纤维素组成结构图

Fig.1 structure diagram of plant cell wall and lignocellulose composition

纤维素由β-1,4-葡萄糖苷键连接的葡萄糖单元构成,通过氢键相互作用,形成稳定的三维结构[4]。半纤维素主要由五碳糖(木糖、阿拉伯糖)和六碳糖(甘露糖、葡萄糖)通过β-1,3-或β-1,4-糖苷键等连接而成[2,9],在降解过程中会释放出多种异质性的单糖或低聚糖[9]。在次生细胞壁中,木聚糖的特殊结构(扁平化的双螺旋带状结构)通过氢键促使纤维素和半纤维素紧密结合[5]。木质素由不同单体(香豆醇、松柏醇和芥子醇)通过醚键连接在一起[2],在木质纤维素中充当粘连剂,与木聚糖、纤维素粘连在一起[10]。此外,木质素还与碳水化合物(如甘露聚糖、阿拉伯糖)通过稳定的共价键形成木质素-碳水化合物复合物[2]

1.2 木质纤维素的营养特性

木质纤维素的化学组成和物理特性,使其作为家畜饲料资源潜力巨大。木质纤维素中丰富的六碳糖和五碳糖是动物关键的营养物质。作为不溶性膳食纤维,适量的木质纤维素还可以促进家畜肠胃蠕动、维持肠道微生态平衡以及提高养分消化率。
家畜依赖其前胃或后肠中的微生物分解木质纤维素,可将木质纤维素中的纤维物质降解为有益的短链脂肪酸(乙酸、丙酸、丁酸),从而提高饲料的能量利用率[11-12]。此外,短链脂肪酸可为有益菌提供营养,维持肠道正常生理功能[13]。木质纤维素的持水性可增大饲粮的体积,增加家畜的饱腹感,并刺激肠道蠕动促进毒素排出[14];此外,木质纤维素在水性介质中会膨胀形成具有纤维特性的基质,并在粗颗粒饲料周围形成网络结构,有助于改善肠道内水分和营养物质的分布与吸收,提高消化率[15]

1.3 木质纤维素的生物降解

木质纤维素的抗降解结构限制了其营养利用,较高含量的木质纤维素还会抑制内源消化酶与其他营养成分的接触。破坏木质纤维素的结构能够提高动物的饲料利用率,同时推动农业废弃物资源化利用。
降解木质纤维素可通过物理法、化学法和生物法。物理法(如粉碎、研磨、膨化等)是通过机械作用破坏其晶体结构,提高水解过程中的可及性,但难破坏木质素-纤维素结构。化学法是利用试剂(如酸、碱、氧化剂或有机溶剂),选择性地溶解木质纤维素内的连接键[16],但成本高、易产生污染。生物法是依赖微生物及其分泌的酶系,通过多酶协同分步降解木质纤维素,具有反应条件温和、能耗低、环境友好等优势[2]
生物法依赖真菌、细菌。真菌分泌的酶活性较细菌分泌的酶更强,其中水解酶(如纤维素酶、半纤维素酶)通过切断糖苷键实现纤维素与半纤维素的分解,氧化酶(如锰过氧化物酶和漆酶)通过氧化还原反应裂解木质素结构单元。此外,真菌的非酶氧化系统可与木质素酶协同作用。根据作用和降解机制的不同,自然界中木质纤维素降解的关键真菌可分为变色真菌、木材降解真菌(软腐真菌、棕腐真菌、白腐真菌)[17-18](表1)。
表1 木质纤维素降解真菌分类及降解特性

Table 1 Classifications and degradation properties of lignocellulose-degrading fungi

分类
Classifications
代表真菌
Representative fungi
降解特性
Degradation properties
参考文献
References
软腐真菌
Soft rot fungi
曲霉属(Aspergillus)、
脉孢菌属(Neurospora)、
木霉属(Trichoderma)
能够降解植物表面层的多糖,产生的
漆酶和过氧化物酶参与木质素的降解
[17]
棕腐真菌
Brown rot fungi
密褐褶菌(Gloeophyllum trabeum)、
凹痕粉孢革菌(Coniophora puteana)、
褐腐菌(Postia placenta)
能够迅速代谢纤维素和半纤维素,
不具备降解木质素的酶,但可以通过
铁催化的芬顿反应降解纤维素
[17]
白腐真菌
White rot fungi
黄孢原毛平革菌(Phanerochaete
chrysosporium)、肉原毛平革菌(Phanerochaete
carnosa)、变色栓菌(Trametes versicolor)、
平菇(Pleurotus ostreatus)、
朱红密孔菌(Pycnoporus cinnabarinus)
能够分解所有木质纤维素成分
(木质素、纤维素和半纤维素),
具备将木质素彻底矿化
为二氧化碳的独特能力
[17]
染色真菌
Stain fungi
拟长喙壳属(Ceratocystiopsis)、
长喙壳菌属(Ophiostoma)
能渗透到木材内部,主要利用边材中的糖类、
淀粉、树脂和蜡质等简单营养物质,具有去除
无定形多糖成分(如果胶和半纤维素)的能力
[18]
较于真菌,细菌能耐受更大范围的pH和温度变化,来自极端环境的极端嗜热菌在高温(65~79 ℃)下依然可有效降解木质纤维素[19]。细菌种类繁多(表2)、代谢途径灵活、易于繁殖,在生物燃料生产和木质纤维素生物质转化领域具有明显优势[20]
表2 木质纤维素降解细菌分类及降解特性

Table 2 Classifications and degradation properties of lignocellulose-degrading bacteria

分类
Classifications
降解特性
Degradation properties
参考文献
References
鞘氨醇单胞菌属、假单胞菌属、红球菌属、诺卡菌属、链霉菌属
Sphingomonas, Pseudomonas, Rhodococcus, Nocardia and Streptomyces
具有较强木质素降解能力 [19]
梭菌属、纤维素单胞菌属、芽孢杆菌属、瘤胃球菌属、拟杆菌属、地芽孢杆菌属
Clostridium, Cellulomonas, Bacillus, Ruminococcus, Bacteroides and Geobacillus
具有较强纤维素降解能力 [19]
嗜热厌氧杆菌属、栖热厌氧杆菌属
Thermoanaerobacterium and Thermoanaerobacter
具有较强半纤维素降解能力 [21]

1.4 木质纤维素降解酶与酶工程

木质纤维素的降解依赖多种酶的协同作用。纤维素酶将纤维素降解为葡萄糖。半纤维素酶将甘露聚糖和木聚糖分别降解为甘露糖、木糖。木质素酶通过氧化反应裂解木质素,最终氧化为二氧化碳和水(表3)。
表3 木质纤维素降解酶及其功能

Table 3 Lignocellulose-degrading enzymes and their functions

类别
Categories
EC编号
EC number

Enzymes
功能
Functions
参考文献
References


纤维素酶
Cellulase
EC 3.2.1.4 内切葡萄糖苷酶 随机水解纤维素链的无定形区域,
转化为不同长度的寡糖
[22]
EC 3.2.1.91 外切葡萄糖苷酶 分别从纤维素链的还原端和
非还原端释放纤维二糖
[22]
EC 3.2.1.21 β-葡萄糖苷酶 将纤维二糖水解为葡萄糖 [22]


半纤维素酶
Hemicellulase
EC 3.2.1.78 β-甘露聚糖酶 作用于甘露聚糖主链 [23]
EC 3.2.1.25 β-甘露糖苷酶 从甘露聚糖和甘露寡糖的非还原端释放甘露糖 [23]
EC 3.2.1.22 β-葡萄糖苷酶 裂解β-D-1,4-葡萄糖吡喃糖 [23]
EC 3.1.1.6 乙酰甘露聚糖酯酶 裂解乙酰基与半乳糖葡聚糖之间的连接 [23]
EC 3.2.1.37 β-木糖苷酶 从木聚糖的非还原端释放木糖 [23]
EC 3.2.1.8 内切1,4-β-木聚糖酶 水解木聚糖主链中的糖苷键 [23]
EC 3.1.1.6 乙酰木聚糖酯酶 去除乙酰木聚糖中的O-乙酰基 [23]
EC 3.2.1.139 α-葡萄糖醛酸酶 裂解葡萄糖醛酸残基与
葡萄糖醛木聚糖主链之间的α-1,2键
[23]
EC 3.2.1.51 α-富糖苷酶 降解木葡聚糖寡糖 [23]


木质素酶
Ligninase
EC 1.10.3.2 漆酶 氧化酚类化合物和芳香胺 [2]
EC 1.11.1.14 木质素过氧化物酶(Lip)、
锰过氧化物酶(Mnp)
LiP通过其高氧化还原电位和铁卟啉中心的
循环作用,直接氧化木质素并促进芳香
环裂解;MnP通过氧化Mn2+生成Mn3+络合物,
进一步作用于酚类化合物,生成自由基
[2]
为获得性能更强的木质纤维素降解酶,目前研究主要聚焦于极端环境(热泉、酸性土壤)中微生物新酶的挖掘与酶工程改造。酶工程旨在通过改变氨基酸序列优化蛋白质性质,其主要策略为定向进化和理性设计(图2)。
图2 定向进化、理性设计步骤

Fig.2 Directed evolution and rational design steps

理性设计依托对蛋白质三维结构及功能关系的认识,预测突变位点。当信息不足时,定向进化采用饱和或随机突变构建变体文库,经多轮筛选验证逐步获得预期功能变体。酶工程在木质纤维素酶的改良中已得到有效应用,其通过不同策略,可显著提升酶催化活性、提高酶热稳定性等(表4)。
表4 木质纤维素的酶工程应用案例

Table 4 Cases of enzyme engineering applications in lignocellulose

类别
Categories

Enzymes
来源
Sources
突变方法
Mutation
methods
改进的属性
Improved
properties
参考文献
References


纤维素酶
Cellulase
内切葡聚糖酶Cel12A 新阿波罗栖热袍菌 多步易错PCR 催化活性 [24]
内切葡聚糖酶Cel8A 热纤梭菌 随机易错PCR+
共识引导突变
热稳定性 [25]
内切葡聚糖酶Cel12B 海栖热袍菌 易错PCR 催化活性+热稳定性 [26]
β-葡萄糖苷酶BGL1 黑曲霉 易错PCR 催化活性 [27]


半纤维素酶
Hemicellulase
木聚糖酶GH11 环状芽胞杆菌 定点饱和突变 催化性能 [28]
木聚糖酶GH11 嗜热脂肪地芽孢杆菌 错误引导PCR+定点
饱和突变+定点突变
热稳定性 [29]

木质素酶
Ligninase
漆酶 枯草芽孢杆菌 定点突变 热稳定性 [30]
漆酶 枯草芽孢杆菌 定点突变 有机溶剂耐受性 [31]

2 人工智能在酶工程中的应用

得益于酶筛选方法及高通量技术的突破,生物催化知识显著扩展。传统的实验方法难以应对日益复杂的需求,计算方法在生物催化领域日益凸显。机器学习和深度学习等人工智能技术,凭借其对海量酶数据中信息的深度挖掘,在酶热稳定性预测、最适pH预测、酶-底物互作等方面都涌现出许多先进方法[32](表5)。
表5 人工智能在酶工程中的应用

Table 5 Applications of artificial intelligence in enzyme engineering

应用
Applications
模型类型
Model types
模型
Models
算法
Algorithms
应用详情
Application
details
参考文献
References


酶的性能优化
Enzyme performance
optimization


机器学习
SAAFEC 梯度提升决策树 预测酶突变后热稳定性变化 [33]
OphPred K-最近邻算法+
极端梯度提升
预测酶最适pH范围,辅助快速筛选
给定pH范围内具有最佳活性的酶
[34]
TOME 随机森林 预测最佳生长和催化温度 [35]
SoluProt 随机森林 预测蛋白质在大肠杆菌中的
表达和溶解度
[36]


深度学习
ACDC-NN 卷积神经网络 仅凭序列即可实现大规模
蛋白质热稳定性预测
[37]
ThermoNet 卷积神经网络+
Transformer编码器
预测蛋白质热稳定性,
并提供原子层面的环境解释
[38]
DDMut 卷积神经网络 预测蛋白质单点与多点突变
热稳定性变化
[39]
EpHod 残差轻注意力网络+
支持向量回归
预测酶最适pH范围 [40]
预测酶类别
Prediction of
enzyme categories
机器学习 ECPred K-最近邻算法+
支持向量
完整或部分EC编号预测 [41]


预测酶功能
Prediction of
enzyme functions


深度学习
DeepGOPlus 卷积神经网络 利用酶结构和序列信息预测酶功能 [42]
DeepFRI 图卷积网络 通过酶序列的特征和接触图
预测酶功能
[43]

预测酶点位
Prediction of
enzyme sites
机器学习 MAHOMES 随机森林 预测蛋白质中结合的催化
金属离子
[44]
深度学习 3DCNN 卷积神经网络 预测特定酶反应位点 [45]

底物识别
Substrate recognition


机器学习
pNPred 随机森林 预测硫解酶对对硝基苯基酯的
底物特异性
[46]
AdenylPred 随机森林 预测腺苷酸生成酶的功能和底物分类 [47]
深度学习 ESP 图形神经网络+Transformer+
梯度提升决策树
预测酶的底物特异性 [48]


提高转化率
Conversion rate
机器学习 innov’SAR 偏最小二乘回归 优化突变组合以提高酶活性 [49]


深度学习
SolventNet 卷积神经网络 预测液相酸催化反应的反应速率 [50]
DLkcat 卷积神经网络+图神经
网络+注意力机制
根据底物结构和蛋白质序列
对酶进行催化常数(Kcat)预测
[51]


系统工程
System engineering


机器学习
ART/EVOLVE 贝叶斯集成方法 预测能改善色氨酸代谢的启动子组合 [52]
原文献未命名 马尔可夫决策 预测代谢模型中酶的调节水平 [53]


深度学习
GC-ANN 多层感知机(MLP)+
神经网络(NN)
从上游酶浓度预测途径流量 [54]
iPROBE 多层感知机 从上游酶浓度预测途径产率 [55]

3 人工智能与木质纤维素酶工程

3.1 机器学习在木质纤维素酶工程中的应用

机器学习在酶设计领域已经成为加速传统实验和数值模拟的重要方法,算法的核心是从已有的数据中发现规律。这些数据是通过将研究对象的特征(酶序列、二级和三级结构、突变信息、氨基酸的理化性质等)转化为计算机易于理解的数字描述符。机器学习主要分为有监督和无监督学习。无监督学习的目的是探索数据内部的结构模式,根据数据相似性进行聚类。与无监督学习不同,有监督学习需要将一个或多个目标属性指定为标签,从而指导模型学习输入数据与输出之间的映射关系。
目前已研究出多种高精度机器学习算法,显著推进了木质纤维素酶的酶工程。2005年,Capriotti等[56]开发的经典在线工具I-Mutant2.0基于支持向量机(SVM),通过整合酶的突变信息、温度、pH及突变位点的氨基酸邻域数量信息(关键优势)构建特征向量,并可额外输入突变残基的相对溶剂可及面积(若结构已知)(图3)。该工具不仅能作为分类器预测突变对蛋白质稳定性的影响方向(稳定化/去稳定化),还能作为回归器预测蛋白质折叠自由能变的变化量(ΔΔG)值[56]。凭借高精度、操作简便的Web界面及快速的预测能力,I-Mutant2.0已广泛应用于酶定向进化的预筛选环节。
图3 I-Mutant2.0原理

Fig.3 Principle of I-Mutant2.0

嗜酸性真菌中的内切葡聚糖酶因独特的嗜酸性备受关注,但在实际工业应用中面临不耐热的问题。为了充分发挥其工业催化潜力,中国科学院天津工业生物技术研究所吴信研究员团队对嗜酸性真菌Acidomyces richmondensis中的内切葡聚糖酶(ArCel5A)开展理性改造研究:通过对糖苷水解酶5(GH5)家族Cel5A活性中心高度保守亚位点的同源序列比对,锁定了ArCel5A中7个关键氨基酸位点(184H、N227、E228、Y299、E337、W370、Y379),其中Y299位点在超过1 000个同源序列中保守性达100%,且预测其B因子高、柔性大,因此将其选为关键突变靶点;利用I-Mutant2.0计算Y299位点饱和突变的ΔΔG值,筛选出Y299C为最优突变(ΔΔG=0.34 kcal/mol,1 kcal≈4.19 kJ);随后将突变体在里氏木霉中异源表达,发酵94 h后酶活性达5 800 U/mL,较野生型显著提升85.2%,其纯化物在十二烷基硫酸钠-聚丙烯酰胺凝胶电泳(SDS-PAGE)上呈现清晰的约60 kDa的单一条带;热稳定性测试显示:经70 ℃处理30 min和80 ℃处理10 min后,突变体ArCel5A-Y299C分别保留了93.83%和91.48%的初始活性,而野生型的残余活性则分别降至76.85%和71.22%,与野生型相比,突变体的热稳定性显著提升了16.98%~20.26%[57]
碱性漆酶是理想的生物催化剂,多数已表征的担子菌漆酶的最适pH处于酸性范围,这限制了它们在工业应用中碱性条件下的使用。传统实验室方法挖掘新型碱性漆酶,通常劳动密集且费时。Wan等[58]通过整合机器学习与计算生物学策略,构建了一套针对担子菌漆酶最适pH的精准预测方法:在特征重要性分析中,采用排列特征重要性(permutation feature importance)和SHAP(SHapley Additive exPlanations)技术解析数据特征影响,发现5个机器学习模型(RFSRC、GLM、LGBM、KKNN、EARTH)均表现出特征依赖性差异,氨基酸组成比其他特征类型更重要,GLM、EARTH和KKNN模型中宿主相关特征贡献率达40%~60%,而生化特性[如2,6-二甲苯酚(2,6-DMP)结合能、糖基化位点]及二级结构信息虽权重较低,仍被证明具有不可忽略的预测价值。基于此流程成功筛选出75个候选碱性漆酶(pH≥7.0),并锁定14个高置信目标,通过实验验证紫丁香蘑(L. nuda)的漆酶LnLccA(pH 10.0)和LnLccB(pH 9.0)不仅展现强碱性催化活性(最高达2.93 nkat/mg)与稳定性(pH 9.0下24 h残活率>80%),还发现与酸性漆酶相比,来自担子菌的碱性漆酶在其表面拥有更多的非极性芳香族残基。芳香族残基有助于稳定酶三级结构的疏水作用,并且对蛋白质折叠、蛋白质-蛋白质相互作用和配体结合至关重要。因此,尽管与其他残基相比,LnLccs表面芳香族残基的绝对数量较低,但这种细微的差异可能足以促成它们的最适碱性pH,而这一机制可能已被机器学习模型识别出来[58]
以上案例都通过“特征优化-机器预测-实验闭环”的创新范式,为挖掘或改造出新木质纤维素酶提供了高效计算筛选工具与分子机制新认知。

3.2 深度学习在木质纤维素酶工程中的应用

随着高通量测序技术的发展,酶相关实验数据快速增长。数据库(如BRENDA、PDB和UniProt)已收录了海量的酶学数据,涵盖了酶的序列信息、理化性质、三维结构等关键参数(表6)。数据的快速增长为酶的功能预测和理性设计提供了重要基础,同时也对数据的整合、挖掘要求更高。机器学习方法在处理大规模数据时受限于计算效率和处理速度,且模型的解释性较差,导致研究者难以从预测结果中提取具有生物学意义的规律。深度神经网络具有多层隐藏层和复杂神经元结构(如使用卷积或复合激活函数)。这使其能直接从原始数据中自动学习任务所需的特征[59],这种能力可从大规模的酶序列数据中挖掘序列与功能之间的深层次联系。复杂神经元结构(如卷积神经网络、循环神经网络或Transformer架构)可以自动提取酶序列中的关键特征,例如活性位点、结构域以及序列进化中的保守区域,并捕捉序列中多个区域的复杂相互作用。通过非线性激活函数和多层网络结构,能够模拟自然选择和遗传变异的过程,从而预测酶的功能并指导酶的设计和优化。
表6 酶工程数据库与数据概览

Table 6 Enzyme engineering databases and data overview

数据库
Databases
介绍
Introduction
全部/部分参数
Full/partial parameters
数据量
Data volume


BRENDA


包含了丰富的酶催化反应动力学数据
一般信息 81 890
催化常数(Kcat)/米氏常数(Km) 39 183
Km 177 712
天然底物 179 353
生物体 16 026 174
pH范围 13 032


UniProt


提供了与蛋白质相关的详细信息
跨膜区域 212 715 270
其他感兴趣区域 195 586 492
其他结合位点 97 763 710
感兴趣区域 101 108 216
活性位点 19 418 846
其他感兴趣位点 5 127 271


PDB


存储和分享已知的蛋白质及其他生物
大分子的三维结构数据
水解酶 51 297
转移酶 38 970
氧化还原酶 20 407
裂解酶 9 442
转位酶 2 326
异构酶 5 293
连接酶 4 014

ProThermDB

集中了关于蛋白质热稳定性的丰富数据
自由能变化 10 379
pH 13 307
ACDC-NN-Seq、DDMut和ThermoNet等先进的深度学习模型利用神经网络的强大特征提取、信息长短程捕捉能力在预测突变热稳定性方面的预测准确度和速度较I-Mutant2.0等机器学习模型进一步提高[37-39]。但诸多机器学习与深度学习模型之间并没有进行统一的精度测试,为客观地比较各个模型的预测精度,Pancotti等[60]对全新突变样本进行严格筛选,创建了测试集S669,并在其基础上对多个机器学习和深度学习模型进行了精度测试,从结果中发现深度学习方法的精度普遍高于大部分机器学习方法(表7)。
表7 不同模型方法的测试精度

Table 7 Testing accuracy of different model methods

方法类型
Method types
模型名称
Model names
皮尔逊相关系数Pearson’s correlation coefficient
总评估
Overall assessment
直接预测
Direct prediction
反向预测
Reverse prediction

深度学习
Deep learning
ACDC-NN 0.61 0.46 0.45
ThermoNet 0.51 0.39 0.38


机器学习
Machine learning
MUpro 0.32 0.25 0.20
I-Mutant2.0 0.32 0.36 0.15
SAAFEC 0.26 0.36 -0.01
Dynamut2 0.36 0.34 0.17
DUET 0.41 0.41 0.23
INPS 0.55 0.43 0.33
纤维素酶在化学品和生物燃料生产中具有巨大潜力。纤维素酶通常是模块化的,由1个催化结构域和1个由柔性连接区连接的碳水化合物结合模块(CBM)组成,其与底物之间的相互作用极其复杂,相比于相互作用模式更简单的酶,这种复杂性阻碍了对纤维素酶进行深入的探索。Schaller等[61]提出了一种基于深度学习的方法,旨在预测纤维素酶的结合亲和力:该研究团队基于体素化三维结构数据(催化结构域采用50Å立方体编码,碳水化合物结合模块采用30Å立方体编码,共构建10个特征通道),构建双分支卷积神经网络模型。利用模拟生成的大规模数据集预训练回归模型,再采用实验测定的精确结合能数据集进行微调,显著提升模型预测精度,较传统的2D-LIE方法提升22.7%。为进一步解析结构-功能关系,该研究团队将该回归模型转换为二分类模型(以结合能ΔG=0 kJ/mol为阈值区分强和弱结合类别),并采用梯度加权类激活映射(Grad-CAM)技术进行可解释性分析。以TrCel7A野生型和W38A/W40A变体为研究对象,通过对比野生型与突变体的类激活热力图,量化显示W38A突变导致强结合类激活信号衰减63%,W40A突变导致衰减73%,实验验证二者分别造成结合能劣化+8.2 kJ/mol(与模型预测一致)。在突变体中观察到Leu152疏水区域的激活补偿性现象,该位点激活信号增强,据此提出L152Y突变方案以构建新疏水核心,经实验验证,该突变使结合活性提升40%。该研究通过“机器学习预测-Grad-CAM解释-实验验证”的闭环范式,证实特定芳香族残基对酶-底物亲和力的核心调控作用,为复杂酶系统的理性设计提供了可计算化解决方案。
另一项纤维素酶挖掘研究中,攻克了纤维素酶最适温度与pH的高通量预测难题,其创新性集成序列相似性筛选与深度/机器学习双模块,通过BLASTx比对(比特分值>50)从海量宏基因组重叠群中识别三类纤维素酶(内切/外切葡聚糖酶及β-葡萄糖苷酶)作为数据,集成模型采用“多层感知机-支持向量机-随机森林”的形式,基于6524维序列特征预测酶学性质,经100次六倍交叉验证证实对超嗜热纤维素酶召回率达0.84;随后,从牛瘤胃数据中经双重筛选锁定PersiCel5/PersiCel6新型酶,克隆表达后实测最适温度(45 ℃/65 ℃)与pH(7.5/7.0)精确匹配预测分类(误差<1.5 ℃)[62]
深度学习在应对该领域固有的复杂性和数据挑战方面展现出不可替代的优势。实例中的双分支卷积神经网络能够高效建模催化结构域与碳水化合物结合模块的相互作用,并通过预训练策略结合微调有效克服高质量实验数据稀缺的瓶颈问题,这是单纯机器学习难以达到的。在机器学习的局限之处,深度学习展现出独特价值:其强大的无监督与自监督预训练能力,可充分挖掘海量未标记或弱标记数据。不仅如此,Grad-CAM等可解释性技术与深度学习结合,打破了“黑箱”预测,实现了酶-底物相互作用关键区域与调控位点的精准解析,为理性设计提供了可以解释的解决方案。可以预见,随着算法的创新、计算资源的普及以及多组学数据的整合,深度学习将持续推动木质纤维素酶的改造、挖掘。

4 小结与展望

木质纤维素结构的复杂性(纤维素结晶区的高稳定性、木质素的空间屏蔽效应)是影响其高效降解的瓶颈,木质纤维素酶作为高效、绿色的生物催化剂,在木质纤维素降解与资源化利用中展现出巨大的应用潜力。传统酶工程存在效率低、周期长的问题,通过深度学习和机器学习算法,人工智能可从海量酶序列与结构数据中提取关键特征,为酶工程提供精准预测,显著加速新型木质纤维素酶的理性设计与定向进化。
随着算力提升与算法迭代,蛋白质结构预测大语言模型(如AlphaFold)和分子动力学模拟技术为木质纤维素酶精准设计提供了新路径,基于强化学习的动态进化策略实现了活性位点的原子级调控,生成模型与蛋白质语言模型使人工智能具备了从头设计新型酶分子的能力。技术的协同创新将推动酶工程从被动适应自然进化转向根据需求快速设计全新酶,为绿色生物制造与能源领域提供核心支撑。
[1]
VIDAL N, VENTURA M, ORFILA M, et al. MgO-based catalysts for selective delignification of lignocellulosic waste and carboxylic acids production under mild hydrothermal conditions[J]. Biomass and Bioenergy, 2025,199:107936.

[2]
HU Y Z, PRIYA A, CHEN C, et al. Recent advances in substrate-enzyme interactions facilitating efficient biodegradation of lignocellulosic biomass:a review[J]. International Biodeterioration & Biodegradation, 2023,180:105594.

[3]
LU Z Y, LIU J B, NAN T G, et al. Indigenous lignocellulose-degrading consortium efficiently degrade traditional Chinese medicine residues[J]. Industrial Crops and Products, 2025,226:120641.

[4]
刘冠成, 张喆, 龙鑫, 等. 纤维素材料在水溶液中吸附净化的研究进展[J]. 吉林大学学报(理学版), 2025, 63(1):173-181.

LIU G C, ZHANG Z, LONG X, et al. Research progress of adsorption purification for cellulose materials in aqueous solutions[J]. Journal of Jilin University (Science Edition), 2025, 63(1):173-181. (in Chinese)

[5]
RAO J, LV Z W, CHEN G G, et al. Hemicellulose:structure,chemical modification,and application[J]. Progress in Polymer Science, 2023,140:101675.

[6]
徐沛, 汪卫华, 宁洪伟, 等. 人工智能辅助的酶分子改造应用进展[J]. 生物工程学报, 2024, 40(6):1728-1741.

XU P, WANG W H, NING H W, et al. Progress in the application of artificial intelligence-assisted molecular modification of enzymes[J]. Chinese Journal of Biotechnology, 2024, 40(6):1728-1741. (in Chinese)

[7]
ABRAMSON J, ADLER J, DUNGER J, et al. Accurate structure prediction of biomolecular interactions with AlphaFold 3[J]. Nature, 2024, 630(8016):493-500.

[8]
ZHOU B X, ZHENG L R, WU B H, et al. Protein engineering with lightweight graph denoising neural networks[J]. Journal of Chemical Information and Modeling, 2024, 64(9):3650-3661.

[9]
秦世宁, 姜淑贞, 杨维仁, 等. 纤维高效降解微生物的选育及其在畜禽生产中的应用研究进展[J]. 动物营养学报, 2024, 36(10):6234-6247.

DOI

QIN S N, JIANG S Z, YANG W R, et al. Research progress in selection and breeding of fiber efficient degrading microorganisms and their application in livestock and poultry production[J]. Chinese Journal of Animal Nutrition, 2024, 36(10):6234-6247. (in Chinese)

DOI

[10]
KIRUI A, ZHAO W C, DELIGEY F, et al. Carbohydrate-aromatic interface and molecular architecture of lignocellulose[J]. Nature Communications, 2022, 13(1):538.

DOI PMID

[11]
GHARECHAHI J, VAHIDI M F, SHARIFI G, et al. Lignocellulose degradation by rumen bacterial communities:new insights from metagenome analyses[J]. Environmental Research, 2023,229:115925.

[12]
来金良, 吕尊周, 姚玥州, 等. 饲粮粗纤维水平对中新鸭生长性能、屠宰性能、肠道发育及盲肠菌群结构的影响[J]. 动物营养学报, 2023, 35(12):7805-7816.

DOI

LAI J L, LV Z Z, YAO Y Z, et al. Effects of dietary crude fiber levels on growth performance,slaughter performance,intestinal development and cecal flora structure of Zhongxin ducks[J]. Chinese Journal of Animal Nutrition, 2023, 35(12):7805-7816. (in Chinese)

[13]
张德明, 黄嘉訸, 李劲树, 等. 猪肠道微生物及其代谢产物与肠道屏障研究进展[J]. 畜牧兽医学报, 2022, 53(5):1334-1344.

DOI

ZHANG D M, HUANG J H, LI J S, et al. Research progress of gut microbiota,metabolites and gut barrier in pigs[J]. Acta Veterinaria et Zootechnica Sinica, 2022, 53(5):1334-1344. (in Chinese)

[14]
冯焱, 赵睿, 王雷, 等. 饲粮纤维源及水平对单胃动物采食量和繁殖性能的影响[J]. 动物营养学报, 2019, 31(3):987-993.

FENG Y, ZHAO R, WANG L, et al. Effects of dietary fiber source and level on feed intake and reproductive performance of monogastric animals[J]. Chinese Journal of Animal Nutrition, 2019, 31(3):987-993. (in Chinese)

[15]
KHERAVII S K, SWICK R A, CHOCT M, et al. Coarse particle inclusion and lignocellulose-rich fiber addition in feed benefit performance and health of broiler chickens[J]. Poultry Science, 2017, 96(9):3272-3281.

DOI PMID

[16]
ZHOU M, TIAN X J. Development of different pretreatments and related technologies for efficient biomass conversion of lignocellulose[J]. International Journal of Biological Macromolecules, 2022,202:256-268.

[17]
ANDLAR M, REZIĆ T, MARDETKO N, et al. Lignocellulose degradation:an overview of fungi and fungal enzymes involved in lignocellulose degradation[J]. Engineering in Life Sciences, 2018, 18(11):768-778.

[18]
GOODELL B. Fungi involved in the biodeterioration and bioconversion of lignocellulose substrates[M]. Cham:Springer,2020:369-397.

[19]
CHUKWUMA O B, RAFATULLAH M, TAJARUDIN H A, et al. A review on bacterial contribution to lignocellulose breakdown into useful bio-products[J]. International Journal of Environmental Research and Public Health, 2021, 18(11):6001.

[20]
BLAIR E M, NAVARATNA T A, AHERN C B, et al. Genomic and transcriptomic characterization of carbohydrate-active enzymes in the anaerobic fungus Neocallimastix cameroonii var.constans[J/OL]. BioRxiv, 2025, doi:https://doi.org/10.1101/2025.01.29.635548.

[21]
JIANG Y J, XIN F X, LU J S, et al. State of the art review of biofuels production from lignocellulose by thermophilic bacteria[J]. Bioresource Technology, 2017, 245(Pt B):1498-1506.

DOI PMID

[22]
SIQUEIRA J G W, RODRIGUES C, VANDENBERGHE L P D S, et al. Current advances in on-site cellulase production and application on lignocellulosic biomass conversion to biofuels:a review[J]. Biomass and Bioenergy, 2020,132:105419.

[23]
DE SOUZA T S P, KAWAGUTI H Y. Cellulases, hemicellulases,and pectinases:applications in the food and beverage industry[J]. Food and Bioprocess Technology, 2021, 14(8):1446-1477.

[24]
BASIT A, TAJWAR R, SADAF S, et al. Improvement in activity of cellulase Cel12A of Thermotoga neapolitana by error prone PCR[J]. Journal of Biotechnology, 2019,306:118-124.

[25]
ANBAR M, GUL O, LAMED R, et al. Improved thermostability of Clostridium thermocellum endoglucanase Cel8A by using consensus-guided mutagenesis[J]. Applied and Environment Microbiology, 2012, 78(9):3458-3464.

[26]
SHI X, ZHENG F, PAN R, et al. Engineering and comparative characteristics of double carbohydrate binding modules as a strength additive for papermaking applications[J]. BioResources, 2014, 9(2):3117-3131.

[27]
LARUE K, MELGAR M, MARTIN V J J. Directed evolution of a fungal β-glucosidase in Saccharomyces cerevisiae[J]. Biotechnology for Biofuels, 2016,9:52.

[28]
MIN K, KIM H, PARK H J, et al. Improving the catalytic performance of xylanase from Bacillus circulans through structure-based rational design[J]. Bioresource Technology, 2021,340:125737.

[29]
XING H G, ZOU G, LIU C Y, et al. Improving the thermostability of a GH11 xylanase by directed evolution and rational design guided by B-factor analysis[J]. Enzyme and Microbial Technology, 2021,143:109720.

[30]
MOLLANIA N, KHAJEH K, RANJBAR B, et al. Enhancement of a bacterial laccase thermostability through directed mutagenesis of a surface loop[J]. Enzyme and Microbial Technology, 2011, 49(5):446-452.

DOI PMID

[31]
RASEKH B, KHAJEH K, RANJBAR B, et al. Protein engineering of laccase to enhance its activity and stability in the presence of organic solvents[J]. Engineering in Life Sciences, 2014, 14(4):442-448.

[32]
王雅丽, 付友思, 陈俊宏, 等. 酶工程:从人工设计到人工智能[J]. 化工学报, 2021, 72(7):3590-3600.

WANG Y L, FU Y S, CHEN J H, et al. Enzyme engineering:from artificial design to artificial intelligence[J]. CIESC Journal, 2021, 72(7):3590-3600. (in Chinese)

[33]
LI G, PANDAY S K, ALEXOV E. SAAFEC-SEQ:a sequence-based method for predicting the effect of single point mutations on protein thermodynamic stability[J]. International Journal of Molecular Sciences, 2021, 22(2):606.

[34]
ZARETCKII M, BUSLAEV P, KOZLOVSKII I, et al. Approaching optimal pH enzyme prediction with large language models[J]. ACS Synthetic Biology, 2024, 13(9):3013-3021.

[35]
GADO J, BECKHAM G, PAYNE C M. Improving enzyme optimum temperature prediction with resampling strategies and ensemble learning[J]. Journal of Chemical Information and Modeling, 2020, 60(8):4098-4107.

DOI PMID

[36]
HON J, MARUSIAK M, MARTINEK T, et al. SoluProt:prediction of soluble protein expression in Escherichia coli[J]. Bioinformatics, 2021, 37(1):23-28.

[37]
PANCOTTI C, BENEVENUTA S, REPETTO V, et al. A deep-learning sequence-based method to predict protein stability changes upon genetic variations[J]. Genes, 2021, 12(6):911.

[38]
LIU C, WU J X, CHEN Y B, et al. Advances in zero-shot prediction-guided enzyme engineering using machine learning[J]. ChemCatChem, 2025, 17(5):e202401542.

[39]
ZHOU Y Z, PAN Q S, PIRES D E V, et al. DDMut:predicting effects of mutations on protein stability using deep learning[J]. Nucleic Acids Research, 2023, 51(W1):W122-W128.

[40]
GADO J E, KNOTTS M, SHAW A Y, et al. Deep learning prediction of enzyme optimum pH[J/OL]. BioRxiv, 2023,doi:10.1101/2023.06.22.544776.

[41]
DALKIRAN A, RIFAIOGLU A S, MARTIN M J, et al. ECPred:a tool for the prediction of the enzymatic functions of protein sequences based on the EC nomenclature[J]. BMC Bioinformatics, 2018, 19(1):334.

[42]
KULMANOV M, HOEHNDORF R. DeepGOPlus:improved protein function prediction from sequence[J]. Bioinformatics, 2020, 36(2):422-429.

[43]
GLIGORIJEVIĆ V, RENFREW P D, KOSCIOLEK T, et al. Structure-based protein function prediction using graph convolutional networks[J]. Nature Communications, 2021, 12(1):3168.

DOI PMID

[44]
FEEHAN R, COPELAND M, FRANKLIN M W, et al. MAHOMES Ⅱ:a webserver for predicting if a metal binding site is enzymatic[J]. Protein Science, 2023, 32(4):e4626.

[45]
TORNG W, ALTMAN R B. High precision protein functional site detection using 3D convolutional neural networks[J]. Bioinformatics, 2019, 35(9):1503-1512.

DOI PMID

[46]
ROBINSON S L, SMITH M D, RICHMAN J E, et al. Machine learning-based prediction of activity and substrate specificity for OleA enzymes in the thiolase superfamily[J]. Synthetic Biology, 2020, 5(1):ysaa004.

[47]
FENNER K, ELSNER M, LUEDERS T, et al. Methodological advances to study contaminant biotransformation:new prospects for understanding and reducing environmental persistence?[J]. ACS ES & T Water, 2021, 1(7):1541-1554.

[48]
KROLL A, RANJAN S, ENGQVIST M K M, et al. A general model to predict small molecule substrates of enzymes based on machine and deep learning[J]. Nature Communications, 2023, 14(1):2787.

DOI PMID

[49]
LI G Y, QIN Y C, FONTAINE N T, et al. Machine learning enables selection of epistatic enzyme mutants for stability against unfolding and detrimental aggregation[J]. ChemBioChem, 2021, 22(5):904-914.

DOI PMID

[50]
CHEW A K, JIANG S L, ZHANG W Q, et al. Fast predictions of liquid-phase acid-catalyzed reaction rates using molecular dynamics simulations and convolutional neural networks[J]. Chemical Science, 2020, 11(46):12464-12476.

DOI PMID

[51]
KROLL A, LERCHER M J. Machine learning models for the prediction of enzyme properties should be tested on proteins not used for model training[J/OL]. BioRxiv, 2023,doi:10.1101/2023.02.06.526991.

[52]
ZHANG J, PETERSEN S D, RADIVOJEVIC T, et al. Combining mechanistic and machine learning models for predictive engineering and optimization of tryptophan metabolism[J]. Nature Communications, 2020, 11(1):4880.

DOI PMID

[53]
BRITTON S, ALBER M, CANNON W R. Enzyme activities predicted by metabolite concentrations and solvent capacity in the cell[J]. Journal of the Royal Society Interface, 2020, 17(171):20200656.

[54]
AJJOLLI NAGARAJA A, CHARTON P, CADET X F, et al. A machine learning approach for efficient selection of enzyme concentrations and its application for flux optimization[J]. Catalysts, 2020, 10(3):291.

[55]
KARIM A S, DUDLEY Q M, JUMINAGA A, et al. In vitro prototyping and rapid optimization of biosynthetic enzymes for cell design[J]. Nature Chemical Biology, 2020, 16(8):912-919.

[56]
CAPRIOTTI E, FARISELLI P, CASADIO R. I-Mutant2.0:predicting stability changes upon mutation from the protein sequence or structure[J]. Nucleic Acids Research, 2005, 33(Suppl.2):W306-W310.

[57]
董浩帆. 基于深度学习的酶理性改造中突变位点预测[D]. 硕士学位论文. 天津: 天津科技大学, 2024.

DONG H F. Prediction of mutation sites in enzymatic transformation based on deep learning[D]. Master’s Thesis.Tianjin: Tianjin University of Science and Technology, 2024. (in Chinese)

[58]
WAN X, SHAHREAR S, CHEW S W, et al. Discovery of alkaline laccases from basidiomycete fungi through machine learning-based approach[J]. Biotechnology for Biofuels and Bioproducts, 2024, 17(1):120.

[59]
JANIESCH C, ZSCHECH P, HEINRICH K. Machine learning and deep learning[J]. Electronic Markets, 2021, 31(3):685-695.

[60]
PANCOTTI C, BENEVENUTA S, BIROLO G, et al. Predicting protein stability changes upon single-point mutation:a thorough comparison of the available tools on a new dataset[J]. Briefings in Bioinformatics, 2022, 23(2):bbab555.

[61]
SCHALLER K S, KARI J, BORCH K, et al. Binding prediction of multi-domain cellulases with a dual-CNN[EB/OL].(2022-07-06)[2025-02-01].https://arxiv.org/abs/2207.02698.

[62]
FOROOZANDEH SHAHRAKI M, ARIAEENEJAD S, FALLAH ATANAKI F, et al. MCIC:automated identification of cellulases from metagenomic data and characterization based on temperature and pH dependence[J]. Frontiers in Microbiology, 2020,11:567863.

Outlines

/