RESEARCH PAPER

Construction and Evaluation of Near-Infrared Spectroscopy Prediction Model for Starch Content of Total Mixed Ration Based on Machine Learning Algorithms

  • YU Zijia , 1 ,
  • A Rong 1 ,
  • TUO Zhengjun 2 ,
  • LUO Yaping 3 ,
  • LI Mengmeng , 1, *
Expand
  • 1 State Key Laboratory of Animal Nutrition and Feeding, College of Animal Science and Technology, China Agricultural University, Beijing 100193, China
  • 2 Animal Husbandry Workstation of Ningxia Hui Autonomous Region, Yinchuan 750002, China
  • 3 Yunxiang Agriculture (Qingdao) Co., Ltd., Qingdao 266110, China
*associate professor, E-mail:

Received date: 2025-04-13

  Online published: 2025-11-14

Abstract

This study aimed to construct and evaluate a near-infrared spectroscopy (NIRS) prediction model for starch content in total mixed rations (TMR) using machine learning algorithms. From February 2022 to June 2024, a total of 778 TMR samples were collected from 160 large-scale dairy farms across 18 provinces and cities in China. Combining NIRS technology with machine learning algorithms, the study assessed the effects of different spectral preprocessing methods, different calibration set data sizes and 10 machine learning algorithms on TMR starch content prediction model. The results showed as follows: 1) the principal component regression (PCR) and partial least squares (PLS) models built using raw near-infrared spectral data achieved the best prediction performance, with root mean squared prediction error (RMSPE) of 6.53% and 6.55%, respectively. 2) When using PCR and PLS methods for modeling, the NIRS models established exhibited high prediction accuracy (RMSPE of 6.93% and 7.05%, respectively) when the calibration set data size reached or exceeded 396 samples. 3) The prediction accuracy [RMSPE≥8.38% and concordance correlation coefficient (CCC)<0.80] of models constructed based on algorithms such as support vector machine with linear kernel, support vector machine with radial basis function kernel, decision tree, random forest, multiple linear regression, ridge regression, Lasso regression and elastic net regression was slightly lower than that of the PCR and PLS models (RMSPE<7.00% and CCC=0.88). In conclusion, the optimal modeling strategy determined in this study is raw spectral data+PLS/PCR algorithms. Based on this strategy, NIRS data can be obtained in actual farm production by scanning fresh TMR samples to predict starch content, thereby enabling rapid, real-time and accurate monitoring of dietary starch content.

Cite this article

YU Zijia , A Rong , TUO Zhengjun , LUO Yaping , LI Mengmeng . Construction and Evaluation of Near-Infrared Spectroscopy Prediction Model for Starch Content of Total Mixed Ration Based on Machine Learning Algorithms[J]. Chinese Journal of Animal Nutrition, 2025 , 37(11) : 7910 -7923 . DOI: 10.12418/CJAN2025.643

全混合日粮(total mixed ration,TMR)是根据反刍动物在不同生长发育和生产阶段的营养需求,综合运用营养调控技术与科学搭配原则,通过特制的搅拌机将粗饲料、精饲料以及矿物质、维生素等预混料按特定配比充分混合制成的营养均衡型饲粮[1-3]。淀粉是TMR中碳水化合物的重要组成成分,是评价饲粮营养价值的重要指标[4]。淀粉是以葡萄糖为基本单元的同质多糖[5],易被反刍动物消化利用,是维持和提高动物生产性能的重要基础。饲粮淀粉含量过低会导致奶牛产奶量下降,降低生产效率[6];而含量过高则可能引发亚急性或急性瘤胃酸中毒等代谢疾病,损害机体健康[7]。因此,准确测定TMR淀粉含量对于科学评价饲粮营养价值、调控动物营养代谢及保障机体健康具有重要意义。目前,TMR淀粉含量的测定主要采用酶解法,其原理是将待测样品经热稳定性α-淀粉酶、淀粉葡萄糖苷酶和葡萄糖氧化酶依次处理后[8],通过分光光度计比色测定D-葡萄糖含量,进而换算得出淀粉含量。酶解法虽准确性高、适用性广,但其检测成本较高、耗时较长,难以实现快速和实时检测[9]。因此,开发和建立TMR淀粉含量的快速测定方法,将有助于更精准地评价饲粮营养价值,促进牧场生产中的降本增效。
近红外光谱(near-infrared spectroscopy,NIRS)技术是一种基于样品中有机物对光谱吸收特性的分析技术,可用于定性和定量分析[10]。该技术具有检测效率高、非破坏性、多组分同时检测及绿色无污染等优点[10-11],目前已在国内外饲料常规养分检测领域得到广泛应用[12-13]。Mentink等[14]使用NIRS技术结合偏最小二乘(partial least squares,PLS)法对110份TMR样品进行了定标建模和模型验证,所构建的TMR淀粉含量NIRS预测模型具有较高的准确性[验证集n=4,决定系数(R2)>0.80]。Buonaiuto等[15]将NIRS技术与主成分回归(principal component regression,PCR)法结合对205份TMR样品进行分析评估,建立了TMR淀粉含量的NIRS预测模型[验证集n=62,预测决定系数( R P 2)=0.83,一致性相关系数(CCC)=0.92]。Pereira-Crespo等[16]评估了主成分分析(principal component analysis,PCA)法对125份TMR样品中淀粉含量的预测能力,结果显示NIRS预测模型的准确性较高(验证集n=32,R2=0.99)。曹明月等[17]利用NIRS技术结合PLS法对542份奶牛TMR样品进行评估,结果显示NIRS预测模型对淀粉含量的预测效果不理想[验证集n=61,验证决定系数(RSQV)=0.562,验证相对分析误差(RPDV)=1.504]。尽管前期的研究表明NIRS技术可用于构建TMR淀粉含量的预测模型,但仍存在建模算法较为单一、建模数据量偏小及缺乏足够规模或独立的验证集用于全面评估模型性能等问题。因此,立足于我国本土饲料原料种类及其配比特点,建立能够精准预测TMR淀粉含量的NIRS模型是当前牧场实践中亟待解决的关键技术问题。
机器学习算法能够从高维、复杂的数据中有效提取信息,自动分析规律并对未知数据做出决策或预测,具有自学习和容错能力强等优点[18-19]。以往研究多采用NIRS技术结合传统算法(如PLS和PCR)构建NIRS模型。本研究则引入具备回归分析的支持向量机(support vector machine,SVM)、决策树和随机森林等机器学习算法进行TMR淀粉含量的预测,旨在分析不同光谱预处理方法、不同定标集数据量以及不同机器学习算法对预测效果的影响,从而筛选出最优NIRS预测模型,为TMR淀粉含量的测定提供一种准确、快速、经济且可靠的分析方法。

1 材料与方法

1.1 TMR样品的采集

本试验于2022年2月至2024年6月期间,从全国18个省市的160家规模化奶牛场采集了涵盖高产牛、中产牛、低产牛和新产牛等不同生理阶段奶牛的TMR样品共778份。采用多点取样法进行采样,每次取样量约为2 kg,采集的样品用于NIRS扫描及实验室湿化学分析。

1.2 光谱采集

将混合均匀的TMR样品装入样品杯(占样品杯的1/3~2/3),采用光栅型漫反射式NIRS仪(AuroraNir,Carl Zeiss,德国)进行扫描。仪器有效波长范围为950~1 650 nm,扫描速度为100次/s,分辨率为1 nm。扫描前先将仪器预热30 min,每份样品重复扫描2次,取2次测定的平均值作为样品的原始光谱。

1.3 淀粉含量测定

光谱采集完成后,将TMR样品置于65 ℃烘箱中干燥48 h,随后使用小型锤片式粉碎机(鼎力DLF-20)进行粗粉碎并过4.2 mm筛,将粗粉碎后的样品通过旋转式分样仪(PT100,Retsch,德国)进行分样处理,采用旋风式样品磨(CT293,FOSS,丹麦)进行细粉碎并过2.0 mm筛,得到颗粒均匀的样品用于淀粉含量测定。淀粉含量参照AOAC(2014)[20]的方法测定。准确称取100~500 mg样品置于螺旋盖玻璃管中,每个样品设2个重复,并设2个空白管作为对照。向各管中加入30 mL醋酸缓冲液使样品充分悬浮,再加入0.1 mL热稳定α-淀粉酶,涡旋振荡混匀。将所有试管于100 ℃水浴反应1 h,期间分别于10、30和50 min时旋转混匀。水浴结束后冷却至室温,加入20 mL去离子水,上下颠倒4次混匀。取1.5 mL样品溶液至离心管中,1 000×g离心10 min,取上清液用去离子水稀释10倍作为待测液。分别取不同浓度(0、250、500、750和1 000 μg/mL)的0.1 mL葡萄糖工作标准溶液及待测液于玻璃管中,向各管中加入3.0 mL葡萄糖氧化酶试剂,涡旋振荡混匀后于50 ℃水浴反应20 min。使用分光光度计在505 nm波长处测定吸光度,根据标准曲线计算样品中葡萄糖含量,再乘以换算系数0.9得到淀粉含量,最终结果以干物质基础表示。

1.4 光谱预处理与预测模型建立

将778份样品按85%和15%的比例随机分配至定标集(n=658)和验证集(n=120)。定标集用于建立NIRS预测模型并进行内部验证;验证集作为独立数据集在整个研究过程中保持固定,仅用于最终对所有模型的准确性和精确性进行外部评估。定标集和验证集中淀粉含量的统计描述见表1。使用R 4.4.1软件对分集后的光谱数据进行分析。NIRS仪采集的光谱数据不仅包含样品本身信息,还会受到外部因素的干扰(如物理状态和噪声等)。为提高模型的预测效果与稳定性,在采用化学计量学方法建立样品的近红外定标模型时,需通过有效的光谱预处理方法消除光谱中的噪声与无关信息[21-22]。本研究中分别采用标准正态变量变换(standard normal variant,SNV)、一阶导数(1st derivative)、二阶导数(2nd derivative)、去趋势(Detrend)、多元散射校正(multiplicative scatter correction,MSC)、SNV+Detrend、MSC+一阶导数和SNV+一阶导数方法对光谱数据进行预处理。其中,SNV和MSC处理的目的与原理基本相同,主要是用来消除样品颗粒间因散射引起的误差;一阶或二阶导数处理可消除基线漂移并增强光谱特征峰;Detrend处理则通过去除光谱数据中的线性趋势,从而有效消除基线漂移。
表1 定标集和验证集中淀粉含量的统计描述

Table 1 Statistical description of starch content in calibration set and validation set

数据集
Databases
样品数量
Number of samples
平均值
Mean/%
标准差
SD/%
最小值
Min/%
最大值
Max/%
定标集Calibration set 658 26.51 3.33 11.85 34.19
验证集Validation set 120 26.22 3.75 11.79 32.53
为了评估建模数据量对模型性能的影响,从总定标集(n=658)中随机抽取5%(n=36)、6%(n=40)、7%(n=48)、8%(n=56)、9%(n=60)、10%(n=68)、20%(n=132)、40%(n=264)、60%(n=395)、80%(n=527)和100%(n=658)的数据作为定标集,并基于这些定标集建立预测TMR淀粉含量的PCR和PLS模型。所有模型均使用固定的独立验证集(n=120)进行性能评估。
基于机器学习中的10种回归算法,包括PCR、PLS、线性核函数支持向量机(SVM_Linear)、径向基核函数支持向量机(SVM_Radial)、决策树、随机森林、多元线性回归、岭回归、Lasso回归和弹性网络回归,分别建立TMR淀粉含量的预测模型。模型分析通过R 4.4.1软件完成,使用caret包进行PCR和PLS分析,e1071包进行SVM_Linear和SVM_Radial分析,rpart包进行决策树分析,randomForest包进行随机森林分析,lm函数进行多元线性回归分析,glmnet包进行岭回归、Lasso回归和弹性网络回归分析。TMR淀粉含量NIRS预测模型的构建与评估流程如图1所示。
图1 TMR淀粉含量NIRS预测模型的构建与评估流程图

TMR:全混合日粮 total mixed ration;SNV:标准正态变量变换 standard normal variant;Detrend:去趋势;MSC:多元散射校正 multiplicative scatter correction;PCR:主成分回归 principal component regression;PLS:偏最小二乘 partial least squares;SVM_Linear:线性核函数支持向量机 support vector machine with linear kernel;SVM_Radial 径向基核函数支持向量机 support vector machine with radial kernel。

Fig.1 Flowchart of construction and evaluation of TMR starch content NIRS prediction model

1.5 模型内部验证和外部评估

使用定标集数据建立PCR和PLS定标模型后,采用交互验证的方法,以定标决定系数(coefficient of determination for calibration, R c a l 2)、定标标准偏差(standard error of calibration,SEC)、交叉验证相关系数(1 minus the variance ration,1-VR)、交叉验证标准误差(standard error of cross validation,SECV)为依据对定标模型进行内部评估,并筛选出最优模型的参数设置。其中 R c a l 2和1-VR越接近1,且SEC和SECV越小,表明模型的预测精准性越好。
使用固定验证集(n=120)对所有内部验证最优的NIRS模型进行外部评估,以检验其预测准确性与精确性。通过综合分析预测均方根误差(root mean squared prediction error,RMSPE)[23]和CCC[24]来选择最优的预测模型。RMSPE越小,代表模型的预测准确性越高。基于残差分析的原理,RMSPE可进一步分解为均值误差、斜率误差和随机误差。均值误差和斜率误差越小代表模型的预测准确性越高。CCC代表模型的准确性和精确性,CCC越接近1,表明模型的预测精准性越高。计算公式如下:
RMSPE= n i = 1 [ Y i - f ( X 1 , , X p ) i ] 2 n Y -×100;
CCC= 2 × S f ( X 1 , , X p ) Y S Y 2 + S f 2 ( X 1 , , X p ) + [ Y - - f - ( X 1 , , X p ) ] 2;
均值误差= [ f - ( X 1 , , X p ) - Y - ] 2 i = 1 n [ Y i - f ( X 1 , , X p ) i ] 2 / n×100 ;
斜率误差= [ S f ( X 1 , , X p ) - r × S Y ] 2 i = 1 n [ Y i - f ( X 1 , , X p ) i ] 2 / n×100 ;
随机误差=100-均值误差-斜率误差。
式中,Yi 为第i个观测值;f(X1,…,Xp)i 为使用X变量的第i个模型预测值;n为数据点的数量;Sf(X1,…,Xp)Y为观测值与预测值之间的协方差; S Y 2为观测值的方差;Sf(X1,…,Xp)2为预测值的方差;SY为观测值的标准差;Sf(X1,…,Xp) 为预测值的标准差;r为预测值和观测值之间的相关系数; Y - f -(X1,…,Xp)分别代表观测值和预测值的平均值。

2 结果

2.1 不同光谱预处理方法对TMR淀粉含量NIRS预测模型的影响

图2为定标集的近红外原始光谱及经SNV、一阶导数、二阶导数、Detrend、MSC、SNV+Detrend、MSC+一阶导数和SNV+一阶导数等不同方法处理后的光谱。其中,SNV、MSC、Detrend和SNV+Detrend处理修正了光谱间的相对基线平移和偏移,使光谱更紧密;而一阶导数、二阶导数、MSC+一阶导数和SNV+一阶导数处理则能增加并突出特征谱峰,提升了光谱分辨率。经不同方法预处理后的光谱所构建的TMR淀粉含量NIRS预测模型的内部验证与外部评估结果见表2表3,基于原始光谱建立的PCR和PLS模型的评估见图3。内部验证结果显示,当采用PCR法建立预测TMR淀粉含量的定标模型时,使用原始光谱数据建模的效果最好, R c a l 2、SEC、1-VR和SECV分别为0.78、1.56、0.61和2.08;当采用PLS法建立预测TMR淀粉含量的定标模型时,使用MSC+一阶导数预处理方法建模的效果最好, R c a l 2、SEC、1-VR和SECV分别为0.79、1.53、0.60和2.10。外部评估结果显示,使用原始光谱数据对TMR淀粉含量进行PCR建模的准确性最高(RMSPE=6.53%),而使用原始光谱数据及SNV、一阶导数和SNV+一阶导数预处理后的光谱数据进行PCR建模的精准性一致(CCC=0.88)。当使用原始光谱数据及SNV和一阶导数预处理后的光谱数据进行PCR建模时,模型均表现出较低的均值误差和斜率误差。使用原始光谱数据对TMR淀粉含量进行PLS建模的准确性最高(RMSPE=6.55%),而使用原始光谱数据及SNV和SNV+一阶导数预处理后的光谱数据进行建模的精准性较高(CCC=0.88)。当使用原始光谱数据进行PLS建模时,模型表型出较低的均值误差和斜率误差。使用MSC进行预处理时,PCR和PLS模型的预测准确性和精确性(RMSPE分别为8.21%和9.54%,CCC分别为0.83和0.78)均低于其他数据预处理方法。
图2 TMR样品的近红外原始光谱与预处理后的光谱

A:原始光谱 raw spectra;B:SNV处理后的光谱 SNV-processed spectra;C:一阶导数处理后的光谱 1st derivative-processed spectra;D:二阶导数处理后的光谱 2nd derivative-processed spectra;E:Detrend处理后的光谱 Detrend-processed spectra;F:MSC处理后的光谱 MSC-processed spectra;G:SNV+Detrend处理后的光谱 SNV+Detrend-processed spectra;H:MSC+一阶导数处理后的光谱 MSC+1st derivative-processed spectra;I:SNV+一阶导数处理后的光谱SNV+1st derivative-processed spectra。

Fig.2 Raw and preprocessed near-infrared spectra of TMR samples

图3 基于近红外原始光谱建立的PCR和PLS模型的评估

A:PCR模型 PCR model;B:PLS模型 PLS model。

Fig.3 Evaluation of PCR and PLS models established based on raw near-infrared spectra

表2 不同预处理方法下进行PCR建模的内部验证与外部评估

Table 2 Internal validation and external evaluation of PCR modeling under different preprocessing methods

项目
Items
原始光谱
Raw
spectra
标准正态
变量变换
SNV
一阶导数
1st
derivative
二阶导数
2nd
derivative
去趋势
Detrend
多元散
射校正
MSC
标准正态变量
变换+去趋势
SNV+
Detrend
多元散射校
正+一阶导数
MSC+1st
derivative
标准正态变量
变换+一阶导数
SNV+1st
derivative
内部验证Internal validation
定标决定系数 R c a l 2 0.78 0.77 0.77 0.76 0.76 0.77 0.73 0.78 0.76
定标标准偏差SEC 1.56 1.59 1.59 1.64 1.62 1.60 1.72 1.56 1.64
交叉验证相关系数1-VR 0.61 0.61 0.60 0.57 0.61 0.61 0.56 0.61 0.61
交叉验证标准误差SECV 2.08 2.08 2.11 2.17 2.08 2.07 2.22 2.08 2.08
外部评估External evaluation
验证集样品数量
Number of samples in validation set
120 120 120 120 120 120 120 120 120
观测平均值Observed mean/% 26.22 26.22 26.22 26.22 26.22 26.22 26.22 26.22 26.22
预测平均值Predicted mean/% 26.21 26.18 26.23 26.19 26.20 27.44 26.12 25.82 26.15
预测均方根误差RMSPE/% 6.53 6.81 6.62 6.90 7.14 8.21 7.21 6.88 6.74
均值误差Mean bias/% 0.008 0 0.060 0 0.002 0 0.040 0 0.010 0 31.720 0 0.319 5 5.060 0 0.190 0
斜率误差Slope bias/% 0.070 0 0.430 0 0.002 0 0.060 0 0.780 0 0.130 0 0.160 5 0.530 0 1.190 0
随机误差Random bias/% 99.922 0 99.510 0 99.996 0 99.900 0 99.210 0 68.150 0 99.520 0 94.410 0 98.620 0
一致性相关系数CCC 0.88 0.88 0.88 0.87 0.86 0.83 0.86 0.87 0.88
表3 不同预处理方法下进行PLS建模的内部验证与外部评估

Table 3 Internal validation and external evaluation of PLS modeling under different preprocessing methods

项目
Items
原始光谱
Raw
spectra
标准正态
变量变换
SNV
一阶导数
1st
derivative
二阶导数
2nd
derivative
去趋势
Detrend
多元散
射校正
MSC
标准正态变量
变换+去趋势
SNV+
Detrend
多元散射校
正+一阶导数
MSC+1st
derivative
标准正态变量
变换+一阶导数
SNV+1st
derivative
内部验证Internal validation
定标决定系数 R c a l 2 0.79 0.77 0.78 0.76 0.78 0.77 0.77 0.79 0.76
定标标准偏差SEC 1.54 1.59 1.55 1.63 1.57 1.60 1.61 1.53 1.63
交叉验证相关系数1-VR 0.49 0.51 0.58 0.58 0.52 0.50 0.52 0.60 0.60
交叉验证标准误差SECV 2.37 2.33 2.15 2.17 2.30 2.35 2.31 2.10 2.10
外部评估External evaluation
验证集样品数量
Number of samples in validation set
120 120 120 120 120 120 120 120 120
观测平均值Observed mean/% 26.22 26.22 26.22 26.22 26.22 26.22 26.22 26.22 26.22
预测平均值Predicted mean/% 26.24 26.23 26.22 26.18 26.21 28.03 26.17 25.74 26.14
预测均方根误差RMSPE/% 6.55 6.67 6.81 6.86 7.15 9.54 7.17 7.00 6.77
均值误差Mean bias/% 0.013 0 0.002 0 0.000 6 0.070 0 0.009 0 52.280 0 0.075 2 6.820 0 0.210 0
斜率误差Slope bias/% 0.000 3 0.310 0 0.004 0 0.130 0 1.400 0 0.010 0 0.677 8 0.250 0 0.550 0
随机误差Random bias/% 99.986 7 99.688 0 99.995 4 99.800 0 98.591 0 47.710 0 99.247 0 92.930 0 99.240 0
一致性相关系数CCC 0.88 0.88 0.87 0.87 0.86 0.78 0.86 0.87 0.88

2.2 不同定标集数据量对TMR淀粉含量NIRS预测模型的影响

图4-A表4可知,随着定标集数据量从36增加至658,采用PCR法建立的TMR淀粉含量NIRS预测模型的RMSPE呈下降趋势,从13.89%下降至6.53%,CCC呈上升趋势,从0.32上升至0.88,表明模型的准确性和精确性随数据量的增加逐渐升高。PCR模型的均值误差分别为1.046 9%、0.178 4%、0.429 8%、8.959 3%、4.799 4%、0.781 0%、0.231 6%、0.139 9%、0.057 6%、0.178 1%和0.008 3%,斜率误差分别为7.524 2%、5.061 6%、2.635 2%、4.812 0%、8.859 8%、3.098 2%、0.142 6%、0.304 4%、0.061 9%、0.296 9%和0.069 6%。由图4-B表5可知,采用PLS法建立的TMR淀粉含量NIRS预测模型的RMSPE呈下降趋势,从13.77%下降至6.55%,CCC呈上升趋势,从0.34上升至0.88,表明模型的准确性和精确性随数据量的增加逐渐升高。PLS模型的均值误差分别为0.667 3%、0.029 1%、0.097 9%、9.764 0%、5.045 8%、0.377 7%、0.408 9%、0.599 4%、0.000 8%、0.053 9%和0.012 8%,斜率误差分别为7.284 6%、3.095 7%、3.820 0%、4.353 9%、8.921 3%、1.169 8%、0.033 9%、0.090 0%、0.111 2%、0.010 0%和0.000 3%。上述结果表明,当采用PCR和PLS法建立TMR淀粉含量NIRS预测模型时,定标集数据量≥396时,模型预测的准确性较高,RMSPE分别为6.53%~6.93%和6.55%~7.05%。
图4 基于不同定标集数据量建立的PCR和PLS模型的RMSPE

PCR:主成分回归 principal component regression;PLS:偏最小二乘 partial least squares;RMSPE:预测均方根误差 root mean squared prediction error。

Fig.4 RMSPE of PCR and PLS models established based on different calibration set data sizes

表4 基于不同定标集数据量进行PCR建模的外部评估

Table 4 External validation PCR modeling based on different calibration set data sizes

项目
Items
数据量Data sizes
5%
(n=36)
6%
(n=40)
7%
(n=48)
8%
(n=56)
9%
(n=60)
10%
(n=68)
20%
(n=133)
40%
(n=265)
60%
(n=396)
80%
(n=528)
100%
(n=658)
验证集样品数量
Number of samples in validation set
120 120 120 120 120 120 120 120 120 120 120
观测平均值Observed mean 26.22 26.22 26.22 26.22 26.22 26.22 26.22 26.22 26.22 26.22 26.22
预测平均值Predicted mean 26.60 26.36 26.05 27.04 26.76 26.41 26.32 26.15 26.27 26.15 26.21
预测均方根误差RMSPE/% 13.89 12.21 10.18 10.35 9.37 8.02 7.90 7.29 6.93 6.89 6.53
均值误差Mean bias/% 1.046 9 0.178 4 0.429 8 8.959 3 4.799 4 0.781 0 0.231 6 0.139 9 0.057 6 0.178 1 0.008 3
斜率误差Slope bias/% 7.524 2 5.061 6 2.635 2 4.812 0 8.859 8 3.098 2 0.142 6 0.304 4 0.061 9 0.296 9 0.069 6
随机误差Random bias/% 91.428 9 94.760 0 96.935 0 86.228 7 86.340 8 96.120 8 99.625 8 99.555 7 99.880 5 99.525 0 99.922 1
一致性相关系数CCC 0.32 0.53 0.70 0.72 0.78 0.83 0.82 0.85 0.86 0.86 0.88
表5 基于不同定标集数据量进行PLS建模的外部评估

Table 5 External validation PLS modeling based on different calibration set data sizes

项目
Items
数据量Data sizes
5%
(n=36)
6%
(n=40)
7%
(n=48)
8%
(n=56)
9%
(n=60)
10%
(n=68)
20%
(n=133)
40%
(n=265)
60%
(n=396)
80%
(n=528)
100%
(n=658)
验证集样品数量
Number of samples in validation set
120 120 120 120 120 120 120 120 120 120 120
观测平均值Observed mean 26.22 26.22 26.22 26.22 26.22 26.22 26.22 26.22 26.22 26.22 26.22
预测平均值Predicted mean 26.52 26.28 26.14 27.07 26.78 26.35 26.35 26.07 26.22 26.18 26.24
预测均方根误差RMSPE/% 13.77 11.85 10.24 10.34 9.44 7.80 7.67 7.31 7.05 6.63 6.55
均值误差Mean bias/% 0.667 3 0.029 1 0.097 9 9.764 0 5.045 8 0.377 7 0.408 9 0.599 4 0.000 8 0.053 9 0.012 8
斜率误差Slope bias/% 7.284 6 3.095 7 3.820 0 4.353 9 8.921 3 1.169 8 0.033 9 0.090 0 0.111 2 0.010 0 0.000 3
随机误差Random bias/% 92.048 1 96.875 2 96.082 1 85.882 1 86.032 9 98.452 5 99.557 2 99.310 6 99.888 0 99.936 1 99.986 9
一致性相关系数CCC 0.34 0.54 0.70 0.71 0.78 0.83 0.83 0.85 0.86 0.88 0.88

2.3 不同机器学习算法对TMR淀粉含量NIRS预测模型的影响

表6所示,PCR和PLS模型的RMSPE分别为6.53%和6.55%;CCC均为0.88;均值误差分别为0.008 3%和0.012 8%;斜率误差分别为0.069 6%和0.000 3%。SVM_Linear、SVM_Radial、决策树、随机森林、多元线性回归、岭回归、Lasso回归和弹性网络回归算法建模的RMSPE分别为11.17%、13.55%、14.49%、13.51%、9.05%、12.33%、8.38%和9.74%;CCC分别为0.53、0.23、0.21、0.27、0.79、0.37、0.77和0.71;均值误差分别为1.390 0%、1.975 8%、0.108 3%、0.753 0%、0.427 4%、0.209 3%、0.013 6%和0.004 9%;斜率误差分别为1.344 2%、0.257 4%、8.951 7%、1.793 9%、8.114 0%、1.043 2%、3.862 3%和0.493 1%,预测精准性略低于PCR和PLS模型。
表6 基于不同机器学习算法构建的TMR淀粉含量预测模型的外部评估

Table 6 External model evaluation of TMR starch concentration prediction models based on different machine learning algorithms

项目
Items
主成分
回归
PCR
偏最
小二乘
PLS
线性核函
数支持
向量机
SVM_
Linear
径向核
函数支
持向量机
SVM_
Radial
决策树
Decision
tree
随机森林
Random
forest
多元线
性回归
MLR
岭回归
Ridge
regression
Lasso回归
Lasso
regression
弹性网
络回归
Elastic net
regression
验证集样品数量
Number of samples in validation set
120 120 120 120 120 120 120 120 120 120
观测平均值Observed mean 26.22 26.22 26.22 26.22 26.22 26.22 26.22 26.22 26.22 26.22
预测平均值Predicted mean 26.21 26.24 26.57 26.72 26.35 26.53 26.38 26.37 26.20 26.24
预测均方根误差RMSPE/% 6.53 6.55 11.17 13.55 14.49 13.51 9.05 12.33 8.38 9.74
均值误差Mean bias/% 0.008 3 0.012 8 1.390 0 1.975 8 0.108 3 0.753 0 0.427 4 0.209 3 0.013 6 0.004 9
斜率误差Slope bias/% 0.069 6 0.000 3 1.344 2 0.257 4 8.951 7 1.793 9 8.114 0 1.043 2 3.862 3 0.493 1
随机误差Random bias/% 99.922 1 99.986 9 97.265 8 97.766 8 90.940 0 97.453 1 91.458 6 98.747 5 96.124 1 99.502 0
一致性相关系数CCC 0.88 0.88 0.53 0.23 0.21 0.27 0.79 0.37 0.77 0.71

3 讨论

原始光谱不仅包含样品本身信息,还会受到外部因素的干扰,一般需要采取有效的光谱预处理方法消除光谱数据的噪声和无关信息[21-22]。本研究利用NIRS技术建立了TMR淀粉含量的预测模型。其中,直接使用原始光谱数据进行PCR和PLS建模的预测准确性表现最好,经SNV、一阶导数及SNV+一阶导数预处理后的模型预测准确性较高,而经二阶导数、Detrend、SNV+Detrend及MSC+一阶导数预处理后的模型预测准确性较差,经MSC预处理后的模型预测准确性最差。SNV处理假定每条光谱各波长点的吸收值满足正态分布,通过对每条光谱进行单独校正,使转换后的数据遵循标准正态分布,主要用于消除因样品颗粒间因散射引起的误差。MSC处理的目的与SNV处理基本一致,但它是对一组光谱数据进行校正。这2种处理方法均可能因过度校正而导致部分有效信息丢失。导数(一阶导数、二阶导数)处理可以提高光谱分辨率,分辨一些重叠在一起的峰,有效降低光谱的干扰,消除基线漂移问题[23,25]。但光谱数据经导数预处理后,会放大噪声水平、降低信噪比,这可能是导致模型预测准确性下降的主要原因。Detrend是一种重要的光谱预处理方法,可以去除光谱数据中的线性趋势,从而有效消除基线漂移。但本研究中TMR样品的光谱数据信息可能存在线性关系,Detrend处理可能错误地去除了这些有用信息,从而导致模型预测性能较差。MSC+一阶导数是MSC和一阶导数2种预处理方法的结合。研究结果显示,经MSC+一阶导数预处理后的模型预测准确性相较于单独MSC预处理有所提高,但相较于单独一阶导数预处理有所降低;经SNV+一阶导数预处理后的模型预测准确性相较于单独SNV预处理有所提高,却低于单独一阶导数预处理的效果。本研究中原始光谱数据的一致性较好,更能完整反映样本信息,这可能是导致预处理后模型预测效果未得到显著改善的主要原因。
本研究采用PCR和PLS法建立预测TMR淀粉含量的NIRS模型,结果表明,当定标集数据量≥396时,模型预测准确性较好,PCR模型的RMSPE≤6.93%,PLS模型的RMSPE≤7.05%。定标集数据量过小时模型易出现过拟合现象,即在定标集上表现良好,但在验证集上预测性能下降,还可能会降低模型稳定性,尤其在模型结构复杂时预测准确性更差。充足的数据量有助于降低过拟合风险,提高模型的稳定性,并支持构建更复杂的预测模型。在前人研究中,Mentink等[14]以110份TMR样品作为定标集,利用NIRS技术结合PLS法建立的淀粉含量预测模型准确性较好(R2>0.80);Buonaiuto等[15]采用化学方法与NIRS技术对205份TMR样品进行分析,所建淀粉含量NIRS模型的预测准确性较高( R P 2=0.83,CCC=0.92);Pereira-Crespo等[16]对125份TMR样品进行分析建立的NIRS模型也表现出较高的预测准确性(R2=0.99)。不过,曹明月等[17]的研究结果与上述结果存在差异,其对542份奶牛TMR进行NIRS评定,所建立的淀粉含量快速检测模型的预测能力较差,RSQV和RPDV分别为0.562和1.504,均低于可用于样品预测的临界值(0.66和2.00),无法用于实际预测。本研究结果表明,当定标集数据量≥396时,所建立的PCR和PLS模型预测效果较好,该结果与前人的研究结果有一定偏差,特别是与曹明月等[17]的研究差异较大。尽管其研究中定标集数据量(n=481)更大,但建立的TMR淀粉含量预测模型的预测能力仍较差。推测可能是由于畜群类型、生长阶段和营养需求不同,导致TMR配方组成差异较大,且搅拌工艺上也各有不同,从而影响了模型的准确性。
除此之外,NIRS测定结果还可能受仪器影响,仪器型号不同也会影响模型的预测效果。同时,淀粉含量的化学测定过程中存在的操作误差或系统误差,也可能导致测量值误差较大,最终影响模型的预测准确性。
本研究结果表明,采用传统的NIRS建模算法(PCR和PLS)所建模型的预测效果较好,而其余机器学习算法(SVM_Linear、SVM_Radial、决策树、随机森林、多元线性回归、岭回归、Lasso回归和弹性网络回归)所建模型的预测效果略差。PCR法是用于分析多元共线性问题的一种方法,其通过PCA对自变量进行转换,再基于提取的主成分开展回归分析,可有效消除多元共线性的影响,提高模型的稳定性和预测能力[23]。PLS法作为一种经典的线性建模方法,结合了因子分析与回归分析,是光谱数据分析中常用的多元校正方法,能够充分利用全部有效信息构建模型,具有良好的预测性能;目前关于TMR中淀粉含量的NIRS预测模型研究也大多采用PLS法[14-16]。根据本研究的模型评估结果,推测TMR光谱数据可能存在线性信息,因此更适用于PCR法和PLS法建模(RMSPE分别为6.53%和6.55%)。SVM是一种强大的传统机器学习监督学习算法,广泛应用于分类和回归分析,适用于处理小数据集和高维数据[18,26]。本研究的数据量较大(658行)、变量维度较低(352列),不符合SVM的优势适用条件,因此SVM算法的2种核函数模型对TMR中淀粉含量的预测效果较差(RMSPE分别为11.17%和13.55%)。决策树是一种主要用于解决分类和回归问题的监督学习算法,所构建的模型呈树形结构[27],比较直观且易于理解,能够处理数值型和类别型数据,但在模型复杂时容易过拟合,这可能限制了其在TMR淀粉含量NIRS预测模型中的应用。本研究中采用决策树建模的预测性能较差(RMSPE=14.49%)。随机森林可通过构建多个决策树来减少过拟合[27],从而提升模型的预测能力与稳定性,既可以用于分类又可以用于回归,不过该算法更适用于处理高维度数据,且模型解释性较差。而本研究的数据集属于低变量维度,采用随机森林建模的预测效果不佳(RMSPE =13.51%)。多元线性回归是一种最直接的线性统计方法,用于模拟一个因变量(响应变量)与多个自变量(解释变量)之间的线性关系,适用于线性关系分析,但容易出现共线性和过拟合问题,可能不适合构建复杂模型。本研究中采用多元线性回归所建模型的RMSPE为9.05%,预测性能较差。岭回归、Lasso回归和弹性网络回归都是线性回归的变体,通过引入正则化项来解决过拟合问题。其中,岭回归是通过引入L2正则化项减小方差,但同时可能降低模型的可解释性、增加偏差,导致模型预测效果变差(RMSPE=12.33%);Lasso回归是将惩罚项由L2范数变为L1范数进行特征选择,帮助减少模型的复杂度和减少过拟合问题,但对噪声数据较敏感,从而影响模型的稳定性(RMSPE=8.38%);而弹性网络回归则结合了岭回归与Lasso回归的优势,通过同时使用L1和L2范数解决多重共线性问题[28],并通过参数α和λ控制惩罚项大小,但其对参数调整的要求较高,参数设置不当易导致模型性能不佳(RMSPE=9.74%)。本研究比较了10种机器学习算法的建模效果,结果表明对于TMR淀粉含量这类线性特征显著的数据,PCR和PLS仍是最优建模算法;非线性算法(如SVM和决策树等)可能因光谱与淀粉含量的线性主导特性而未显现优势。

4 结论

本研究构建了基于NIRS的TMR淀粉含量预测模型。结果表明,使用原始光谱数据所构建的模型预测效果最好;当采用PCR和PLS法进行建模,在定标集数据量≥396时,模型预测准确性较高;与PCR和PLS模型相比,基于SVM_Linear、SVM_Radial、决策树、随机森林、多元线性回归、岭回归、Lasso回归和弹性网络回归算法所构建的模型预测精度略低。因此,本研究所确立的最优建模策略为原始光谱数据+PLS/PCR算法。在实际生产中可通过扫描TMR鲜样的NIRS数据预测淀粉含量,这为实现牧场快速、实时、精准监测饲粮淀粉含量及反刍动物精准营养调控提供了低成本和可靠的解决方案。
[1]
闫祥洲, 马慧慧, 李文嘉, 等. 肉牛全混合日粮(TMR)饲喂关键技术及应用[J]. 饲料研究, 2022, 45(24):137-141.

YAN X Z, MA H H, LI W J, et al. Key techniques and application of TMR feeding for beef cattle[J]. Feed Research, 2022, 45(24):137-141. (in Chinese)

[2]
李晓琴, 哈斯亚提·托逊江,艾比布拉·伊马木.奶牛全混合日粮(TMR)的稳定性及其对粒度和营养品质的影响[J]. 饲料研究, 2018(5):54-57.

LI X Q, HASIYATI T, AIBIBULA Y. Stability of total mixed diet (TMR) for dairy cows and its effect on grain size and nutritional quality[J]. Feed Research, 2018(5):54-57. (in Chinese)

[3]
王得文, 武志锋, 刘长波. 全混合日粮与传统方式饲喂肉牛增重效果的对比[J]. 畜牧兽医杂志, 2024, 43(4):42-44.

WANG D W, WU Z F, LIU C B. Comparison of weight gain effects between fully mixed diet and traditional feeding methods for beef cattle[J]. Journal of Animal Science and Veterinary Medicine, 2024, 43(4):42-44. (in Chinese)

[4]
雷龙, 李强, 冯志, 等. 酶解法测定常用饲料原料中淀粉的含量[J]. 饲料工业, 2017, 38(8):59-61.

LEI L, LI Q, FENG Z, et al. Determination of starch content in common feeds by enzymatic hydrolysis method[J]. Feed Industry, 2017, 38(8):59-61. (in Chinese)

[5]
王改琴, 丁子儒, 邬本成, 等. 不同淀粉的形态结构、营养特性及质量控制技术研究进展[J]. 中国畜牧杂志, 2021, 57(8):54-59.

WANG G Q, DING Z R, WU B C, et al. Studies on the morphological structure,nutritional characteristics and quality control of different starches[J]. Chinese Journal of Animal Science, 2021, 57(8):54-59. (in Chinese)

[6]
齐志国, 王俊, 金银姬, 等. 2022年北京市奶牛场粗饲料营养成分检测分析报告[J]. 饲料研究, 2023, 46(22):110-118.

QI Z G, WANG J, JIN Y J, et al. Analysis report of roughage nutrient composition in Beijing dairy farm in 2022[J]. Feed Research, 2023, 46(22):110-118. (in Chinese)

[7]
梁高沣, 李永, 白东宁, 等. 反刍动物淀粉营养研究进展[J]. 家畜生态学报, 2021, 42(6):7-12,18.

LIANG G F, LI Y, BAI D N, et al. Research progress on starch nutrition of ruminants[J]. Acta Ecologae Animalis Domastici, 2021, 42(6):7-12,18. (in Chinese)

[8]
王建伟. 饲料中淀粉含量测定方法的对比研究[J]. 甘肃畜牧兽医, 2021, 51(8):66-67,75.

WANG J W. Comparative study on methods for determination of starch content in feed[J]. Gansu Animal and Veterinary Sciences, 2021, 51(8):66-67,75. (in Chinese)

[9]
季少雄, 解彪, 任凯, 等. 饲料中淀粉含量的检测技术研究进展[J]. 中国畜牧杂志, 2024, 60(12):5-11.

JI S X, XIE B, REN K, et al. Research progress of the detection technology for starch content in feed[J]. Chinese Journal of Animal Science, 2024, 60(12):5-11. (in Chinese)

[10]
邵晨阳, 赵一墨, 鹿莉莉, 等. 近红外光谱快速分析技术的应用研究进展[J]. 化学通报, 2024, 87(8):898-912.

SHAO C Y, ZHAO Y M, LU L L, et al. Progress in the application of near-infrared spectroscopy for rapid analysis[J]. Chemistry, 2024, 87(8):898-912. (in Chinese)

[11]
程柳洋, 仲崇亮, 骆雅萍, 等. 近红外光谱技术在动物生产中的应用[J]. 中国畜牧兽医, 2024, 51(12):5277-5289.

CHENG L Y, ZHONG C L, LUO Y P, et al. Application of near-infrared reflectance spectroscopy technology in animal production[J]. China Animal Husbandry & Veterinary Medicine, 2024, 51(12):5277-5289. (in Chinese)

[12]
张书阅, 熊安然, 潘予琮, 等. 燕麦草常规营养成分含量近红外预测模型的建立[J]. 动物营养学报, 2022, 34(2):1334-1342.

ZHANG S Y, XIONG A R, PAN Y C, et al. Near infrared prediction model establishment for conventional nutrient contents of oat grass[J]. Chinese Journal of Animal Nutrition, 2022, 34(2):1334-1342. (in Chinese)

[13]
杨松, 岳嘉豪, 程柳洋, 等. 基于便携式近红外光谱仪建立苜蓿干草纤维品质预测模型[J]. 动物营养学报, 2025, 37(2):1376-1387.

YANG S, YUE J H, CHENG L Y, et al. Prediction model for fiber quality of alfalfa hay established based on portable near infrared spectrometer[J]. Chinese Journal of Animal Nutrition, 2025, 37(2):1376-1387. (in Chinese)

[14]
MENTINK R L, HOFFMAN P C, BAUMAN L M. Utility of near-infrared reflectance spectroscopy to predict nutrient composition and in vitro digestibility of total mixed rations[J]. Journal of Dairy Science, 2006, 89(6):2320-2326.

[15]
BUONAIUTO G, CAVALLINI D, MAMMI L M E, et al. The accuracy of NIRS in predicting chemical composition and fibre digestibility of hay-based total mixed rations[J]. Italian Journal of Animal Science, 2021, 20(1):1730-1739.

[16]
PEREIRA-CRESPO S, BOTANA A, VEIGA M, et al. Prediction of quality of total mixed ration for dairy cows by near infrared reflectance spectroscopy and empirical equations[J]. Journal of Applied Animal Research, 2022, 50(1):69-79.

[17]
曹明月, 郑爱荣, 娄渊志, 等. 奶牛全混合日粮常规营养成分含量近红外快速检测模型的构建与应用[J]. 动物营养学报, 2020, 32(7):3420-3427.

CAO M Y, ZHENG A R, LOU Y Z, et al. Construction and application of near infrared reflectance spectroscope rapid detection model for routine nutritional components contents of total mixed ration in dairy cattle[J]. Chinese Journal of Animal Nutrition, 2020, 32(7):3420-3427. (in Chinese)

[18]
黄叶群, 周晗林, 童秀平, 等. 机器学习算法在预测茉莉花茶风味品质中的应用[J]. 粮油食品科技, 2024, 32(5):142-150.

HUANG Y Q, ZHOU H L, TONG X P, et al. Application of machine learning algorithms in predicting flavor and quality of jasmine tea[J]. Science and Technology of Cereals,Oils and Foods, 2024, 32(5):142-150. (in Chinese)

[19]
李帅, 柴春祥, 刘建福. 机器学习算法在食品气味表征中的应用[J]. 中国食品学报, 2024, 24(8):486-501.

LI S, CHAI C X, LIU J F. Application of machine learning algorithms in food odor characterization[J]. Journal of Chinese Institute of Food Science and Technology, 2024, 24(8):486-501. (in Chinese)

[20]
Dietary starch in animal feeds and pet food: enzymatic-colorimetric method[M]//LATIMER G W. Official methods of analysis of AOAC international. 22nd ed. New York: AOAC Publications, 2023.

[21]
张银, 周孟然. 近红外光谱分析技术的数据处理方法[J]. 红外技术, 2007, 29(6):345-348.

ZHANG Y, ZHOU M R. Methods for data process of near infrared spectroscopy analysis[J]. Infrared Technology, 2007, 29(6):345-348. (in Chinese)

[22]
第五鹏瑶, 卞希慧, 王姿方, 等. 光谱预处理方法选择研究[J]. 光谱学与光谱分析, 2019, 39(9):2800-2806.

DIWU P Y, BIAN X H, WANG Z F, et al. Study on the selection of spectral preprocessing methods[J]. Spectroscopy and Spectral Analysis, 2019, 39(9):2800-2806. (in Chinese)

[23]
BANDEMER H. Bibby,J.,H.Toutenburg:prediction and improved estimation in linear models.J.Wiley & Sons,Chichester-New York-Brisbane-Toronto 1977.201 pp.,£7.95[J]. Biometrical Journal, 1978, 20(7/8):826.

[24]
LIN L I. A concordance correlation coefficient to evaluate reproducibility[J]. Biometrics, 1989, 45(1):255-268.

[25]
褚小立, 袁洪福, 陆婉珍. 近红外分析中光谱预处理及波长选择方法进展与应用[J]. 化学进展, 2004, 16(4):528-542.

CHU X L, YUAN H F, LU W Z. Progress and application of spectral data pretreatment and wavelength selection methods in NIR analytical technique[J]. Progress in Chemistry, 2004, 16(4):528-542. (in Chinese)

[26]
邱渝镔, 安文含, 田彦法, 等. 基于机器学习算法的某地源热泵系统能耗研究[J]. 区域供热, 2024(5):86-98.

QIU Y B, AN W H, TIAN Y F, et al. Research on energy consumption of a ground source heat pump system based on machine learning algorithms[J]. District Heating, 2024(5):86-98. (in Chinese)

[27]
侯钊, 双卫兵. 机器学习算法的概述及其在生物医学中的应用[J]. 中国医学工程, 2025, 33(3):72-78.

HOU Z, SHUANG W B. Overview of machine learning algorithms and their applications in biomedicine[J]. China Medical Engineering, 2025, 33(3):72-78. (in Chinese)

[28]
ZOU H, HASTIE T. Regularization and variable selection via the elastic net[J]. Journal of the Royal Statistical Society Series B:Statistical Methodology, 2005, 67(2):301-320.

Outlines

/