1.一种基于深度学习的智能自动巡航滑板的语音交互方法,其特征在于,包括如下步骤:S1、采集用户的语音指令数据,实时记录并转化为音频信号,生成语音数据;
S2、将采集的语音数据输入whisper模型,进行语音识别,提取语音数据中的频域特征,并转化为文本命令;
S3、对转化后的文本命令进行自然语言处理,解析用户的意图并生成与之对应的控制指令;
S4、将生成的控制指令输入改进的aMacP算法,根据whisper模型中当前梯度和历史梯度信息计算动量平均值,并调整学习率,优化更新whisper模型;
S5、将生成的控制指令传递给滑板执行相应的操作,控制滑板的加速、减速、转向或启用、停止自动巡航功能,并根据实时传感器数据调节滑板的运行状态;
S6、在滑板执行完用户指令后,通过语音合成技术反馈执行结果,并根据滑板当前状态提供必要的实时更新。
2.根据权利要求1所述的一种基于深度学习的智能自动巡航滑板的语音交互方法,其特征在于,所述S1具体包括:通过麦克风采集用户的语音指令数据,并通过采样率转换将语音指令数据转化为数字音频信号,对采集到的数字音频信号进行频域分析,去除背景噪音和无关信号,生成语音数据。
3.根据权利要求1所述的一种基于深度学习的智能自动巡航滑板的语音交互方法,其特征在于,所述S2具体包括:S21、将采集的语音数据输入whisper模型,计算语音数据的最大值和最小值,并通过归一化将语音数据的幅度压缩到0到1之间,语音数据的均值并从每个数据点中减去均值,使得语音数据的平均值为0,得到音频信号,计算音频信号的标准差,并将音频信号除以标准差,调整音频信号的波动范围;
S22、将音频信号按预设时间步分为多个时间窗口,每个窗口包含若干音频样本,使用短时傅里叶变换对每个时间窗口进行计算,得到窗口的频谱图,频谱图中的每个数据点表示频率成分在特定时间点上的幅度和相位;
S23、对频谱图中的每个频率成分计算模长,即复数的幅度,对于每个频率点,计算实部和虚部的平方和,并取平方根,得到幅度值,将每个时间窗口内所有频率成分的幅度值提取出来,形成幅度谱;
S24、将每个频谱图和幅度谱作为独立通道,使用多个卷积核对输入的频谱图和幅度谱进行卷积,对每个卷积核,定义一个滑动窗口,在频谱图和幅度谱上从左到右、从上到下滑动,计算卷积核与输入数据的局部区域的点积,卷积结果经过ReLU激活函数,生成局部特征图;
S25、将生成的多个局部特征图的二维像素值按行或列顺序排列展平成一维向量,将展平后的向量输入到全连接层通过预设权重矩阵和偏置项,并进行ReLU激活生成特征向量;
S26、将生成的特征向量输入到whisper模型中预训练好的解码器中,解码器接收特征向量,利用先前的语言模型和上下文信息开始预测第一个字符,解码器基于特征向量和语言模式生成第一个字符的概率分布,选择概率最高的字符作为输出,生成的字符被嵌入到特征向量中,作为输入传递给下一时间步;
S27、解码器继续基于当前特征和前一个字符,预测下一个字符,并重复过程,每个预测的字符都依赖于之前的输出和当前输入的特征,逐步生成最终的文本文本。
4.根据权利要求1所述的一种基于深度学习的智能自动巡航滑板的语音交互方法,其特征在于,所述S3具体包括:S31、对文本命令进行分词处理,根据文本命令中的空格、标点符号进行分词,将文本命令拆分为独立的词,使用预设的动作词语匹配表进行匹配;
S32、对分词后的每个独立的词,逐一与匹配表中的动作词进行比对,查找匹配的控制指令,输出匹配到的控制指令,组成滑板的控制命令。
5.根据权利要求1所述的一种基于深度学习的智能自动巡航滑板的语音交互方法,其特征在于,所述S4具体包括:S41、将生成的控制指令输入改进的aMacP算法,通过softmax函数得到的类别概率分布,生成预测输出,对于每个控制指令,输出一个概率分布,表示控制指令属于每个类别的概率;
S42、获取one‑hot编码形式的真实标签,真实标签的对应类别为1,其它类别为0,对每个类别,计算预测概率与真实标签之间的交叉熵,即对每个类别的预测概率和真实标签进行对数计算,计算它们的乘积,并对所有类别求和,得到交叉熵损失;
S43、计算whisper模型中交叉熵损失函数相对于每个参数的偏导数,得到梯度,并存储之前的历史梯度,根据预设的衰减系数对历史梯度进行加权,并与当前梯度进行预设权重的加权相加,生成动量平均值;
S44、若动量平均值小于等于预设范围阈值,说明当前梯度与历史梯度之间的差异较小,whisper模型参数更新较为平稳,表示训练过程稳定,若如果动量平均值大于预设范围阈值,说明当前梯度与历史梯度之间的差异较大,whisper模型参数更新幅度较大,表示训练过程不稳定;
S45、当训练过程稳定时,按照预设比例增加学习率,当训练过程不稳定时,按照预设比例减小学习率,在每次训练更新后重复操作,直到动量平均值在预设范围内。
6.根据权利要求5所述的一种基于深度学习的智能自动巡航滑板的语音交互方法,其特征在于,所述改进的aMacP算法具体包括:从频谱图中选择预设的低频区间,通常是0‑1000Hz范围,筛选频谱图的低频部分并保留,去除高频部分,对提取的低频部分,计算各个频率成分的分布;
通过对频率成分的分布进行统计,获得频率成分的集中程度,如果低频部分的强度全部集中在预设阈值以上的频率范围,则表示音调较高,反之则表示音调较低;
依据判断结果,对当前时间窗口的频域特征分配学习权重,音调高时对应预设权重为最少为0.7,音调低时对应权重最多为0.3,将权重乘以当前时间窗口内频域特征向量的每一维度值,形成加权后的频域特征;
将加权后的频域特征重新输入whisper模型进行优化更新,重复操作直至所有时间窗口特征完成权重分配。
7.根据权利要求1所述的一种基于深度学习的智能自动巡航滑板的语音交互方法,其特征在于,所述S5具体包括:S51、根据控制指令分析执行的操作类型,当指令要求加速、减速或转向时,电机功率、刹车强度或转向角度会相应调整,如果指令为加速,电机功率会增加以提高速度,如果指令为减速,刹车强度将增加以减少速度,如果指令为转向,电机转向角度会调整以改变滑板方向;
S52、在语音指令为启用自动巡航模式时,滑板会根据当前速度、道路状况以及设定的巡航模式自动调节行驶速度,根据预设目标,电机输出会根据实时速度变化调整;
S53、滑板会持续监测加速度、倾斜角度、速度和位置信息,通过传感器获得的数据判断滑板的运行状态,如果检测到快速加速、减速或偏离轨道,控制指令会根据传感器数据动态调整电机功率和刹车强度。
8.根据权利要求1所述的一种基于深度学习的智能自动巡航滑板的语音交互方法,其特征在于,所述S6具体包括:S61、在滑板执行完用户语音指令后,通过语音合成技术将执行结果转化为语音反馈,根据滑板的执行状态,将执行结果生成文本内容,利用语音合成技术将文本转换为语音并播放给用户;
S62、根据滑板的当前状态,提供必要的实时更新,若滑板进入自动巡航模式,语音合成技术会反馈自动巡航已启用,并根据滑板当前的速度、方向的信息实时更新状态,当速度变化时,实时播报当前速度;
S63、在执行过程中,若系统检测到异常情况,包括传感器数据更新异常或运行状况不稳定,立即通过语音合成提供反馈,提醒用户相关问题。