1.一种具有鲁棒性的多模态情感分析方法,其特征在于,所述具有鲁棒性的多模态情感分析方法,包括:获取待预测对象的文本、音频和视频三种模态特征序列中的至少一个,对于缺失的模态特征序列,通过训练好的模态翻译模块生成所缺失的模态,从而得到三种模态特征序列;
将三种模态特征序列输入到训练好的情感预测模块中,得到待预测对象的情感预测结果;
其中,所述将三种模态特征序列输入到训练好的情感预测模块中,得到待预测对象的情感预测结果,包括:将三种模态特征序列分别经过一维卷积操作,将三种模态特征序列映射到同一个特征空间;
将三种模态特征序列分别经过门控循环单元,引入归纳偏置;
引入全零初始化的特殊序列MMSeq,将特殊序列MMSeq与引入归纳偏置的三种模态特征序列分别加入位置编码和模态类型编码;
将加入位置编码和模态类型编码的特殊序列MMSeq和三种模态特征序列在时序维度进行拼接,经过多模态理解变换器处理,得到变换后的多模态拼接特征;
将多模态理解变换器输出中的特殊序列MMSeq部分取出,作为最终的统一多模态表征,将其经过全连接层后得到情感预测结果;
所述多模态理解变换器采用公式表示如下:
其中,MUM表示多模态理解掩膜,LN表示层归一化,FFN表示前馈神经网络, 表示多模态理解变换器第一层的输入,XU表示时序维度拼接后的多模态特征, 表示多模态理解变换器第m层的输出;
进一步地,MUM由如下公式计算:
其中, 表示 MUM的 输出,X表 示MUM 的输入 ,分别表示网络的权重,dk=dv=d/h,d表示特征维度,h表示U
多头注意力机制中头的个数, 为注意力矩阵,下标ij表示矩阵MASK的第i行第j列,当其值为0时,表示i处的字符可以关注到j处的字符,当其值为‑∞时,表示i处的字符无法关注到j处的字符。
2.根据权利要求1所述的具有鲁棒性的多模态情感分析方法,其特征在于,所述具有鲁棒性的多模态情感分析方法,还包括训练模态翻译模块,所述训练模态翻译模块,包括:将训练样本中文本、音频和视频三个模态特征序列分别通过一个全连接层映射到同一个特征空间;
对于要翻译的目标模态序列,在其首部嵌入一个零初始化的特殊字符[multi],并删除模态序列的最后一个字符;
为多模态特征分别加入位置编码和模态类型编码;
将加入位置编码和模态类型编码的多模态特征在时序维度进行拼接,输入到多模态生成变换器,生成多模态拼接特征;
将多模态拼接特征中属于目标模态的特征取出,将其经过全连接层后映射回其原先的维度,得到翻译输出的模态序列,并使用损失函数进行训练,以获得训练好的模态翻译模块。
3.根据权利要求2所述的具有鲁棒性的多模态情感分析方法,其特征在于,所述多模态生成变换器采用公式表示如下:其中,MGM表示多模态生成掩膜,LN表示层归一化,FFN表示前馈神经网络, 表示多模态生成变换器第一层的输入,XG表示时序维度拼接后的多模态特征, 表示多模态生成变换器第m层的输出;
进一步地,MGM由如下公式计算:
其中, 表示 MG M的输 出,X 表示M GM的 输入,分别表示网络的权重;dk=dv=d/h,d表示特征维度,h表示多G
头注意力机制中头的个数, 为注意力矩阵,下标ij表示矩阵MASK 的第i行第j列,当其值为0时,表示i处的字符可以关注到j处的字符,当其值为‑∞时,表示i处的字符无法关注到j处的字符。