利索能及
我要发布
收藏
专利号: 2018113512631
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于多视角图像的三维物体模型分类方法,其特征在于,所述方法包括以下步骤:

S1:基于冯氏光照反射模型对三维物体点云格式的数据进行渲染,得到三维物体多视角图像;

S2:随机选择每一个类别内的多个三维物体实例,将其对应的经过S1所得的图像进行复制,扩充该对应类别数据量,得到数据分布平衡的训练数据集;

S3:从S2得到的数据集中,随机选择连续视角图像,将其输入经过预训练的三维卷积神经网络进行目标数据集的训练;

S4:调整三维卷积神经网络卷积核大小,使得模型具有更好的分类效果。

2.如权利要求1所述的一种基于多视角图像的三维物体模型分类方法,其特征在于:所述步骤S1中,以三维物体质心设定为三维坐标系原点,以X,Y轴为水平面,所有物体直立向上摆放,并且围绕物体圆周等间隔角度地设定36个视角点,间隔角度θinter=10°,每一个视角点上设立一个面向物体质心的虚拟相机,同时,每一个虚拟视角点与水平面的夹角θplane为30°,应用冯氏光照反射模型计算每一个虚拟相机下的物体图像,得到每一个物体的36幅图像。

3.如权利要求1或2所述的一种基于多视角图像的三维物体模型分类方法,其特征在于:所述步骤S2中,为避免训练数据集中每一个类别数据量不同而导致分类模型具有偏置性,将训练数据集进行扩展以得到数据分布更加平衡的训练数据集,操作过程如下:首先,统计数据集中每个类别的样本数量Xi,i∈k,其中k为分类类别数,设定每一个类别中的样本数量扩充至Xp,计算公式如下:然后,根据当前类别样本数量与扩充后的数据量比较,确定扩充数据量的类别,即,当Xi>Xp,则无需扩展该类数据;当Xi<Xp,则扩充该类别样本数量;

最后,对每一个需要扩充数据量的类别,随机的选取该类别内多个样本Xij,j∈Ni,Ni为第i类类别的样本数量,将其复制作为该类别的新样本,重复该操作直到该类别数量扩充至Xp。

4.如权利要求1或2所述的一种基于多视角图像的三维物体模型分类方法,其特征在于:所述步骤S3中,设计一个三维卷积神经网络具体如下:该三维卷积神经网络一共具有八个卷积层,五个池化层以及三个全连接层,其中,每一个卷积层的卷积核为三维,设定为v×

3×3,其中v是卷积核的深度,3×3分别为卷积核的宽度和高度,所有卷积操作的步长stride均为1,经过三维卷积层后得到的也是三维特征图,每一层的卷积核数量依次是64、

128、256、256、512、512、512、512,三维卷积计算如下:

其中,(x,y,z)为特征图的坐标,i表示第i个卷积层,j表示第j个特征图, 表示第i层的第j个特征图在位置(x,y,z)的值,(p,q,r)为卷积核的坐标, 表示卷积核在(p,q,r)位置与前一层第m个特征图的连接权值,bij为第i层第j个特征图的偏置,ReLU表示修正线性单元激活函数,其公式如下:同时,为保证下一层特征图的简便计算,在每一次进行三维卷积操作都会对上一层的特征图进行适当的填充边缘操作;

池化层采用的最大池化操作,将第一层池化层融合区域为1×2×2,同时池化操作的步长设定为1×2×2。而其他池化层的融合区域设定为2×2×2,步长为2×2×2,以此达到融合不同视角图像特征的作用,最大池化操作计算公式如下:其中x′∈[2x-1,2x+1],y′∈[2y-1,2y+1],z′∈[2z-1,2z+1], 为第i层第j个特征图在位置(x,y,z)的数值;

三个全连接层的神经元个数分别为4096、4096、k,其中k表示待分类数据类里的类别数,最后的全连接层后紧接一个Softmax分类器得到每一个类别的概率分布,概率计算公式如下:其中,pi为模型预测物体属于第i类的概率,zi为最后一层全连接层第i个神经元的输出,将确定的模型在视频分类数据集UCF101进行预训练。

5.如权利要求1或2所述的一种基于多视角图像的三维物体模型分类方法,其特征在于:保证其他网络参数设置不变,仅将每一个卷积层的卷积核尺寸进行变化,对比各个设定下的分类效果,选取分类效果最佳的参数设定作为模型的最后设置,操作过程如下,采用两种策略:一是将每一个卷积核的深度v固定,二是将卷积核的深度v随着层数的变化而变化;

对于策略一,分别选取1、3、5、7作为卷积核的深度v,其中深度为1的卷积核相当于分别在每个视角图像上做卷积操作,并没有融合不同视角图像上的特征;对于策略二,分别采用递减设定与先升后降设定,根据上述两种策略观察效果选取最佳设定。