1.一种基于光谱技术、电导率测量和机器学习的瓜果质量预测方法,其特征在于包括以下步骤:S1:采摘处于成熟期的鲜嫩瓜果,瓜果先经冷冻干燥处理之后,用高速研磨机研磨成粉末,对瓜果粉末进行分组编号,建立多个逐一编号的瓜果核心种质群体;
S2:对步骤S1每个种质群体的瓜果样品,分别检测其近红外光谱数据和电导率数据,以及检测包括蛋白质含量和氨基酸FAA含量两方面指标的营养数据,获得相应的数据集;
S3:对步骤S2数据集中的近红外光谱数据和电导率数据进行预处理,以消除噪声偏差;
S4:之后对预处理后的近红外光谱数据进行特征波长选择,将选择的特征波长下的吸光度值数据以及电导率数据融合在一个数据集中,将数据集划分为测试集和训练集;
S5:利用岭回归模型构建瓜果蛋白质和FAA回归预测模型,根据步骤S3划分的测试集和训练集,利用所述构建的预测模型进行训练和测试;之后进行瓜果蛋白质和FAA含量的检测时,先按照步骤S2‑S3的方法获得近红外光谱数据和电导率数据,经预处理及特征选择后,输入至训练后的预测模型中,即可得到对应瓜果蛋白质和FAA含量数据。
2.如权利要求1所述的一种基于光谱技术、电导率测量和机器学习的瓜果质量预测方法,其特征在于步骤S1中所述瓜果为瓠瓜,每个种质群体采集9个商品成熟期的瓠瓜果实,将这9个果实分为三组,每组三个果实,从每组果实的中间部分取样,样品在冷冻干燥机中冷冻干燥3‑4天,用高速研磨机研磨成粉末。
3.如权利要求1所述的一种基于光谱技术、电导率测量和机器学习的瓜果质量预测方法,其特征在于步骤S2中,每个种质群体的瓜果样品分为三部分进行检测,第一部分检测蛋白质数据,第二部分使用日立L‑8900氨基酸分析仪分析FAA含量,第三部分检测近红外光谱数据和电导率数据,近红外光谱数据通过近红外分析仪扫描获取,电导率数据的检测过程是:对瓜果粉末进行压片处理,然后使用精密电导率仪对压片后的样品进行电导率测量。
4.如权利要求1所述的一种基于光谱技术、电导率测量和机器学习的瓜果质量预测方法,其特征在于步骤S2中所述近红外光谱数据是由在直角坐标系中的n个数据点构成的曲线数据,数据点的横坐标和纵坐标分别是波长和吸光度值;
步骤S3对近红外光谱数据进行预处理,采用下列两种方法之一:
1)通过应用多重散射校正法MSC对原始光谱数据进行预处理,可以消除噪声和基线漂移的干扰,MSC校正的基本公式如下:MSC=(Rsample‑Rmin)/(Rref‑Rmin)
上述公式中Rsample是待校正的一条原始光谱曲线在波长i的一个数据点处的吸光度测试值,Rmin是待校正的一条原始光谱曲线的不同波长下吸光度值对比的最小值,Rref是所有原始光谱曲线在同一个波长i下的吸光度的平均值,MSC值是待校正的一条原始光谱曲线在波长i下的吸光度校正值;i是1~n的整数;
2)通过标准归一化变量SNV方法对原始光谱数据进行预处理,用于消除因光照强度差异和基线漂移造成的差异,SNV校正的基本公式如下:SNV=(Xi‑μ)/σ
其中,Xi是待校正的一条原始光谱曲线在波长i的一个数据点处的吸光度测试值,μ是待校正的一条原始光谱曲线的不同波长下吸光度值的平均值,σ是待校正的一条原始光谱曲线的不同波长下吸光度值的标准偏差;
SNV校正值是待校正的一条原始光谱曲线在波长i下的吸光度校正值;
所述标准偏差σ的计算公式如下:
5.如权利要求1所述的一种基于光谱技术、电导率测量和机器学习的瓜果质量预测方法,其特征在于步骤S3中对电导率数据的预处理是进行标准化处理,以便与光谱数据结合后进行模型训练,标准化公式如下:其中,Z是待校正的样品的电导率校正值,Y是待校正的样品的电导率测试值,α是所有样品的电导率的均值,γ是所有样品的电导率数据的标准偏差,通过此方法,将电导率数据标准化到与光谱数据相似的量级,便于后续融合和分析。
6.如权利要求1所述的一种基于光谱技术、电导率测量和机器学习的瓜果质量预测方法,其特征在于步骤S4的具体操作步骤如下:
1)分别以蛋白质含量和氨基酸FAA含量的数据为评测结果,利用竞争性自适应重加权采样算法CARS对预处理后的近红外光谱数据进行特征波长提取,分别获得通过蛋白质识别的近红外光谱数据的特征波长,以及通过FAA识别的近红外光谱数据的特征波长;
2)在光谱数据选择的特征波长的基础上,将电导率数据作为一个额外的物理特征,与选取的光谱数据的特征波长一起输入到多模态分析模型中;
假设提取了m个光谱特征波长的吸光度值,表示为:
Xspectral=[x1,x2,...,xm]
每个样品对应一个电导率值d,将电导率数据作为一个额外的特征,与光谱特征向量拼接,形成融合后的特征向量:Xfused=[x1,x2,...,xm,d]
蛋白质识别融合后的特征向量Xfused作为输入传递给回归模型,模型输出蛋白质含量预测值;
FAA识别融合后的特征向量Xfused作为输入传递给回归模型,模型输出FAA含量预测值。
7.如权利要求6所述的一种基于光谱技术、电导率测量和机器学习的瓜果质量预测方法,其特征在于步骤S5中所述岭回归模型用于建立输入层数据与输出层数据之间的关系,从而实现对未知样品的预测,所述输入层数据为蛋白质识别或FAA识别融合后的特征向量Xfused,输出层数据为蛋白质含量或FAA含量。
8.如权利要求1所述的一种基于光谱技术、电导率测量和机器学习的瓜果质量预测方法,其特征在于利用S5中的训练集用来训练预测模型,测试集用来测试模型的性能;并基于2
测试集的预测值与实际值的决定系数R和RMSE作为指标判定模型的有效性:2
在决定系数R和均方根误差(RMSE)的公式中,yi表示第i个样本的真实值, 表示第i个样本的预测值,yi是所有样本真实值的均值,m是样本数量。