1.一种模型无关的多模态情感分析方法,其特征在于,所述模型无关的多模态情感分析方法,包括:
获取包括文本模态、音频模态和视频模态的多模态特征数据,将三个模态的特征数据经过基础多模态情感分析模型,得到多模态情感预测结果;
将音频模态的特征数据经过音频单模态模型,得到音频模态情感预测结果;将视频模态的特征数据经过视频单模态模型,得到视频模态情感预测结果;融合多模态情感预测结果、音频模态情感预测结果和视频模态情感预测结果,得到有偏多模态情感预测结果;
将多模态情感预测结果用一个可学习的参数替代,并与音频模态情感预测结果和视频模态情感预测结果相融合,形成非文本模态下的反事实情感预测结果;
将文本模态数据中类间分布差异小于第一阈值或词频小于第二阈值的关键词掩盖,作为反事实文本,并提取反事实文本对应的文本模态的特征数据,与音频模态和视频模态的特征数据一起输入到基础多模态情感分析模型,得到反事实的多模态情感预测结果,然后将反事实的多模态情感预测结果与用可学习参数替代的音频模态情感预测结果和视频模态情感预测结果相融合,得到文本模态下的反事实情感预测结果;
将有偏多模态情感预测结果减去非文本模态下的反事实情感预测结果和文本模态下的反事实情感预测结果,得到无偏的情感预测结果。
2.根据权利要求1所述的模型无关的多模态情感分析方法,其特征在于,所述融合多模态情感预测结果、音频模态情感预测结果和视频模态情感预测结果,得到有偏多模态情感预测结果,采用公式表示如下:其中,h(za,zm,zv)表示有偏多模态情感预测结果,za表示音频模态情感预测结果,zv表示视频模态情感预测结果,zm表示多模态情感预测结果。
3.根据权利要求1所述的模型无关的多模态情感分析方法,其特征在于,所述将多模态情感预测结果用一个可学习的参数替代,并与音频模态情感预测结果和视频模态情感预测结果相融合,形成非文本模态下的反事实情感预测结果,采用公式表示如下:其中, 表示非文本模态下的反事实情感预测结果,za表示音频模态情感预测结果,zv表示视频模态情感预测结果, 表示多模态情感预测结果用一个可学习的参数cm替代的结果。
4.根据权利要求1所述的模型无关的多模态情感分析方法,其特征在于,所述将反事实的多模态情感预测结果与用可学习参数替代的音频模态情感预测结果和视频模态情感预测结果相融合,得到文本模态下的反事实情感预测结果,采用公式表示如下:其中, 表示文本模态下的反事实情感预测结果,z′m表示反事实的多模态情感预测结果, 表示音频模态情感预测结果用一个可学习的参数ca替代的结果, 表示视频模态情感预测结果用一个可学习的参数cv替代的结果。
5.根据权利要求1所述的模型无关的多模态情感分析方法,其特征在于,所述将有偏多模态情感预测结果减去非文本模态下的反事实情感预测结果和文本模态下的反事实情感预测结果,得到无偏的情感预测结果,采用公式表示如下:其中, 表示无偏的情感预测结果,λ1、λ2分别为非文本模态下的反事实情感预测结果和文本模态下的反事实情感预测结果 的权重,za表示音频模态情感预测结果,zv表示视频模态情感预测结果,zm表示多模态情感预测结果,h(za,zm,zv)表示有偏多模态情感预测结果。
6.根据权利要求1所述的模型无关的多模态情感分析方法,其特征在于,所述模型无关的多模态情感分析方法,还包括:计算多模态情感预测结果、音频模态情感预测结果和视频模态情感预测结果的联合交叉熵损失,以及计算多模态情感预测结果有偏多模态情感预测结果与非文本模态下的反事实情感预测结果、有偏多模态情感预测结果与文本模态下的反事实情感预测结果的KL散度损失,进行基础多模态情感分析模型、音频单模态模型和视频单模态模型的联合训练。