利索能及
我要发布
收藏
专利号: 2018110028336
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种面向deskVR的手势跟踪识别联合策略方法,其特征在于,包括以下步骤:(1)搭建五区域卷积神经网络模型,所述五区域卷积神经网络模型由若干个不同的卷积层、池化层、激活层和全连接层组成;

(2)选取训练集,并设置五区域卷积神经网络模型的训练参数;

(3)根据五区域卷积神经网络模型及其训练参数,以最小化损失函数为目标训练模型,得到深度图像手势估计神经网络模型;

(4)利用合成的深度数据集,统计数据集中各手势占图片面积比例的分布,测定在识别准确性和速度上达到最佳性能时的手面积比Rate,设定为策略选择阈值;

(5)利用深度摄像机获取实时的深度图像帧,并对图像帧预处理;

(6)根据最近邻算法,在每个独立的人体区域上检测手部区域;若能够检测出手部区域,则执行步骤(7),若检测不到,则返回步骤(5);

(7)将检测出的手部深度图归一化处理,并计算出手图像面积所占比例rate,若rate>Rate,则执行步骤(8),若rate

(8)基于快速模型的手势识别方法对步骤(7)传入的深度帧进行手势关节点识别,并转到步骤(10);所述基于快速模型的手势识别方法的具体步骤为:(8-1)根据深度图提取手的二维轮廓S,并将深度图映射到三维点云P中,具有关节参数θ={θ1,θ2,…,θ26}的3D手模型(8-2)根据三维点云P,快速点云拟合,使用ICP算法重复迭代,解出最优化能量方程:minE3D+E2D+Ewrist,得到手势关节点三维信息,三维信息能量函数的方程为:其中,E3D为三维信息能量函数,ω1为点云在最优化能量方程中所占权重系数,x表示三维点云P中的3D点, 是手姿势θ在手模型 上的x的映射,用2D轮廓E2D模拟对齐渲染的手模型的2D轮廓与从传感器数据中提取的二维轮廓S,其能量方程为:其中,ω2为二维轮廓信息在最优化能量方程中所占权重系数,p是渲染二维轮廓S中的

2D点,∏s(p,θ)表示p在从传感器获得二维轮廓S上的投影点,Ewrist表示腕部对准能量,在优化中使用前臂的简化概念,其强制腕关节沿其轴线定位,其能量方程为:其中,ω3为腕部信息在最优化能量方程中所占权重系数,k0(θ)是腕关节的3D位置,l是由PCA提取的与腕带对应3D点的2D线;

(8-3)添加刚体约束,包括:每个手指上的两个关节角度保持相互匹配;基部指骨无碰撞;基骨和中骨保持一起移动;小拇指和中指保持一起移动;手指握拳时,外展程度为0,否则为默认的45°阈值;

(9)基于五区域卷积神经网络模型对步骤(7)传入的深度帧的手势关节点;

(10)通过深度摄像机的参数,将关节点坐标从图像坐标系转换到物理坐标系,并最终映射三维手势模型。

2.根据权利要求1所述的面向deskVR的手势跟踪识别联合策略方法,其特征在于,步骤(1)中,所述五区域卷积神经网络模型由6个具有3×3内核的卷积层和3个2×2内核的池化层组成,每个卷积层后面跟着一个ReLU激活层,两个池化层之间通过残差连接增加特征图尺寸。

3.根据权利要求1所述的面向deskVR的手势跟踪识别联合策略方法,其特征在于,步骤(2)中,所述的训练集为数据集ICVL。

4.根据权利要求1所述的面向deskVR的手势跟踪识别联合策略方法,其特征在于,步骤(3)中,所述五区域卷积神经网络模型的训练过程为:(3-1)根据手部二值图像检测并绘制其外部轮廓,然后根据道格拉斯-普克算法,求出轮廓的封闭多边形,确定封闭多边形的中心;

(3-2)以该封闭多边形的中心为中心提取一个立方体,将立方体重新调整大小,深度值归一化为[-1,1]作为ConvNet的输入;

(3-3)深度值归一化后的图像作为输入,先进入网络通过六个卷积层进行特征提取,将输出特征映射到五个特征区域:R1,R2,R3,R4,R5,其中,R1-R4分别为以图像四个顶点为顶点且沿着特征图边缘提取的固定大小区域,R5为以图像中心为区域中心提取的同样大小区域,以图像中心为区域中心,五个特征区域作为分支,分别馈送到两个全连接层进行回归,每个回归器的丢失率为0.5;

(3-4)训练使用最小批量为128的随机梯度下降,使用0.0005的重量衰减和0.9的动量,学习率从0.005开始,每5万次迭代后除以10,模型训练达到200000次迭代。

5.根据权利要求1所述的面向deskVR的手势跟踪识别联合策略方法,其特征在于,步骤(4)中,所述策略选择阈值的测定方法为:(4-1)标准化手的图像面积,得到手的标准面积,所述的标准面积为手指完全伸展,手掌面向摄像头,在距摄像头0.7m处所成像手的面积,所述标准化的公式为:其中,S′是原始图像面积,S是标准面积,是标准化后的手部图像面积相较于标准面积的比率,μ是将原始图像标准化的转换系数;

(4-2)从合成的深度数据集中随机选出2000帧具有时间序列的深度帧作为测试集,统计其中深度帧的分布,将距离误差阈值设置为15mm,根据不同面积比率 测试关节识别点准确率以及相应的实时速度,得到准确性和速度之间的平衡点,得到最佳性能时的手面积比Rate,设定为策略选择阈值。

6.根据权利要求1或5所述的面向deskVR的手势跟踪识别联合策略方法,其特征在于,步骤(4)中,所述策略选择阈值的手面积比Rate为60%。

7.根据权利要求1所述的面向deskVR的手势跟踪识别联合策略方法,其特征在于,步骤(5)中,所述的预处理具体步骤为:对实时深度图像帧进行中值滤波处理,然后进行图像前景提取操作,最后进行膨胀与腐蚀操作。

8.根据权利要求7所述的面向deskVR的手势跟踪识别联合策略方法,其特征在于,所述中值滤波处理的公式为:D2(x,y)=med{D1(x-k,y-l)}(k,l∈W)

其中,D2(x,y)为滤波处理后的深度图像,D1(x,y)为原始图像,(x,y)为坐标处的深度值,W代表二维滤波模板,k表示模板的长度,l表示模板的宽度。

9.根据权利要求7所述的面向deskVR的手势跟踪识别联合策略方法,其特征在于,所述图像前景提取操作的公式为:其中,fg(x,y)表示前景图像中(x,y)处的逻辑值,d(x,y)表示深度图像(x,y)坐标处的深度值。