1.基于大数据的职业技能评估方法,其特征在于,包括:对作答文本和语料库进行分词处理获得若干字词,对所有字词进行词性标注并聚类,将字词在不同词性中出现频率最大值与字词在每个词性中出现频率的累加值的比值作为字词的词性影响值;其中,根据文本生成模型将企业内部资料生成多个文本,作为职业技能评估的语料库;
对字词进行分组,在作答文本中,将目标字词的词性影响值与目标字词组中每个字词的词性影响值累加值的比值作为第一影响度,并将所有目标字词的第一影响度的均值作为文本影响度,其中,目标字词为同时在作答文本和语料库中出现的任意一个字词,目标字词组为含目标字词的字词组;
在语料库中,将目标字词的词性影响值与目标字词组中每个字词的词性影响值累加值的比值作为第二影响度,将所有目标字词的第二影响度均值作为语料库中文本的第三影响度,将目标字词在语料库中所有文本的第三影响度均值作为语料影响度;
计算目标字词的文本影响度和语料影响度的词意相似度,满足关系式:,其中, 表示字词 的词意相似度, 表示字词 的文本影响度, 表示字词 的语料影响度, 表示归一化函数,字词 即为目标字词;将词意相似度与目标字词的初始TF‑IDF值的乘积作为TF‑IDF修正值,TF‑IDF修正值能够反映作答文本与语料库的相关性,以进行职业技能评估。
2.根据权利要求1所述的基于大数据的职业技能评估方法,其特征在于,所述对作答文本和语料库进行分词处理获得若干字词包括:对生成的文本数据进行清洗,去除文本中的标点符号以及空白字符并保留数字及特殊字符,使用UTF‑8编码格式对文本数据进行统一编码,并将文本数据进行归一化处理;
使用正向最大匹配算法对作答文本和语料库中每个文本进行分词处理,获得若干字词。
3.根据权利要求1所述的基于大数据的职业技能评估方法,其特征在于,所述对所有字词进行词性标注并聚类包括:使用自然语言处理结合字词所在上下文对每个字词进行词性标注;
根据字词的词性利用预设聚类算法对所有字词进行聚类,获得名词类、动词类和形容词类。
4.根据权利要求1所述的基于大数据的职业技能评估方法,其特征在于,所述TF‑IDF修正值的计算方式替换为:,其中, 表示字词 的TF‑IDF修
正值, 表示字词 的词意相似度, 表示字词 的距离相似度, 表示字词 的初始TF‑IDF值,字词 即为目标字词;
计算目标字词在作答文本中的位置信息与目标字词在语料库中的位置信息的差值,并将差值进行负相关映射的结果作为目标字词的距离相似度;
所述目标字词在作答文本中的位置信息包括:
使用词嵌入模型将每个字词转换为词向量;
将每个字词组中第一个字词作为起始字词;
目标字词在作答文本中的位置信息满足关系式:
,其中, 表示字词 在作答文本中的位置信息, 表示字词 与第 个字词组中起始字词之间的欧式距离, 表示第 个字词组中字词的总数, 表示目标字词组的总数,字词 即为目标字词;
根据获得目标字词在作答文本中的位置信息的方法,获得目标字词在语料库中的位置信息。
5.基于大数据的职业技能评估系统,其特征在于,包括:处理器;以及存储器,所述存储器存储有计算机指令,当所述计算机指令由处理器运行时,使得设备执行根据权利要求1‑4的任意一项所述的基于大数据的职业技能评估方法。