利索能及
我要发布
收藏
专利号: 2024103314786
申请人: 淮阴工学院
专利类型:发明专利
专利状态:已下证
更新日期:2026-04-09
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于3D‑2D特征融合的果实识别定位方法,其特征在于,包括以下步骤:

(1)通过深度摄像头获取果实的点云数据,并对点云数据进行预处理;使用最近邻算法K‑NN对每个点构建其局部邻域;将预处理后的点云数据转换成张量格式并对坐标进行归一化操作,每个点包括三维坐标信息(x,y,z)以及颜色信息;

(2)通过PointNet++获取点云数据的局部、全局特征和结果特征;将步骤(1)获取的局部邻域内的点作为输入,经过特征提取模块得到每个点的局部特征;将得到的每个点的局部特征通过局部区域聚合模块进行聚合操作,获取更广泛的局部上下文信息;将聚合后的特征经过区域上下文编码器,得到编码后的特征信息;将编码后的特征信息经过全局特征汇聚模块,得到表征整个点云数据的全局特征;经过特征提取和聚合过程后,PointNet++网络最终输出点云的结果特征;

(3)通过摄像头获取果实的二维图像,并进行数据预处理;对每张果实图像添加相应的标签数据,将数据集划分为训练集、验证集和测试集;采用VGG模型对训练集进行训练,使用验证集对训练好的VGG模型进行评估,将训练好的VGG模型应用到测试集中查看性能;在训练好的VGG模型中,利用卷积层和池化层提取果实图像的全局特征,将提取到的高级抽象特征表示转换成张量形式;利用全连接层和softmax得到图像的结果特征;

(4)将点云数据的全局特征和图像的全局特征进行多尺度特征提取,分别通过反卷积层和点卷积转换后,沿通道维度拼接得到不同尺度下的整体特征;接着将图像的结果特征和点云的结果特征与上述的整体特征进行特征融合,得到融合特征集;

(5)将融合特征集划分为训练集、验证集和测试集,其中融合特征的训练集作为输入,采用YOLOv5模型进行深度学习训练;设置综合的损失函数来计算目标检测任务中真实标签和预测标签之间的误差;

(6)使用融合特征的验证集和测试集分别对训练好的模型进行验证和评估;模型将输出检测到的目标物体的位置、类别和置信度等信息;对模型输出的目标检测结果进行非极大值抑制操作来消除冗余的检测结果;将处理后的检测结果可视化到原始图像中,以便通过可视化来评估模型的性能;

步骤(4)所述将图像的结果特征和点云的结果特征与整体特征进行特征融合通过以下公式实现:

其中,K表示特征提取网络中用于从输入数据中提取浅层特征的部分,J表示特征提取网络中用于从浅层特征中提取更深层特征的部,L表示特征提取网络中用于从深度特征中获取模型输出结果的部分,JP、KP和LP表示处理点云数据对应的网络部分,JI、KI和LI表示处理图像数据对应的网络部分,F表示融合特征,RF表示结果特征,GF表示整体特征。

2.根据权利要求1所述的一种基于3D‑2D特征融合的果实识别定位方法,其特征在于,步骤(1)所述对点云数据进行预处理包括去除噪声点、滤波、去除离群点。

3.根据权利要求1所述的一种基于3D‑2D特征融合的果实识别定位方法,其特征在于,步骤(2)所述特征提取模块通过多层感知机对点云中每个点进行特征提取,得到点级的特征表示:fi+1=MLP(ui+1)

其中,fi+1表示第i+1层的特征表示,ui+1表示第i+1层的输入,MLR表示多层感知机,用于对输入进行非线性变换。

4.根据权利要求1所述的一种基于3D‑2D特征融合的果实识别定位方法,其特征在于,步骤(2)所述局部区域聚合模块将提取的点级特征通过最大池化的聚合策略进一步融合局部信息,以捕获局部特征之间的关系和信息:其中,TN(i)表示中心点的特征表示,N(i)表示该中心点周围的邻域点集合, 表示经过局部区域聚合后的中心点的特征表示,MAXPOOL表示对特征进行的最大池化操作。

5.根据权利要求1所述的一种基于3D‑2D特征融合的果实识别定位方法,其特征在于,步骤(2)所述区域上下文编码器通过多层感知机来捕获点云中不同区域之间的上下文信息,理解点云中各个部分之间的联系和结构;所述全局特征汇聚模块通过最大池化的聚合策略和拼接操作将整个点云的全局信息进行综合和汇总,得到全局特征表示:其中,gi表示全局特征表示, 表示更新的每个点的特征表示,f1:N表示点云数据中所有点的特征表示,MLR表示多层感知机用于对所有点的特征进行非线性映射,MAXPOOL表示对特征进行的最大池化操作,fi表示点云中第i个点的特征表示,CONCAT表示对点云局部特征与全局特征进行拼接操作。

6.根据权利要求1所述的一种基于3D‑2D特征融合的果实识别定位方法,其特征在于,步骤(3)所述数据预处理包括去噪、大小调整、灰度处理。

7.根据权利要求1所述的一种基于3D‑2D特征融合的果实识别定位方法,其特征在于,步骤(4)所述沿通道维度拼接得到不同尺度下的整体特征通过以下公式实现:其中,SX表示小尺度特征的输入,SZ表示中尺度特征的输入,SD表示大尺度特征的输入,表示小尺度特征的输出, 表示中尺度特征的输出, 表示大尺度特征的输出,S表示拼接得到不同尺度下的整体特征,PCONV表示点卷积操作,DECONV表示反卷积操作,CCT表示沿通道维度的拼接操作。

8.根据权利要求1所述的一种基于3D‑2D特征融合的果实识别定位方法,其特征在于,步骤(5)所述训练集、验证集和测试集的比为8:1:1。

9.根据权利要求1所述的一种基于3D‑2D特征融合的果实识别定位方法,其特征在于,步骤(5)所述综合损失函数为:其中,L表示综合损失,OL表示目标存在性损失,CL表示分类损失,BL表示边界框回归损失,α表示目标存在性损失的权重参数,β表示边界框回归损失的权重参数,UP和UT分别表示预测框与真实框的交并比,C表示类别数量,yi表示真实标签的one‑hot编码形式,pi表示模型输出的概率值,x、y分别是预测框的中心坐标,w、h分别是预测框的宽度和高度,xh、yh、wh、hh分别是真实框的中心坐标、宽度和高度。