1.一种数据标签的确定方法,其特征在于,所述方法包括:
对样本数据集中包括的样本数据进行抽样,得到多个抽样数据,所述样本数据集中包括的样本数据已标注标签;
根据所述多个抽样数据构建第一球树;
将所述第一球树广播至N个搜索进程,并将N份样本数据分配给所述N个搜索进程,所述N份样本数据是对所述样本数据集中包括的样本数据划分得到,所述N为大于2的正整数;
通过所述N个搜索进程,并行地从所述第一球树包括的至少一个叶子节点中,确定所述N份样本数据中每个样本数据所属的叶子节点;
对于所述样本数据集中包括的任一样本数据A,令i=1,将第一距离与第二距离进行比较,所述第一距离是指第一节点中位于中心位置处的样本数据与所述样本数据A之间的距离,所述第二距离是指第二节点中位于中心位置处的样本数据与所述样本数据A之间的距离,所述第一节点和所述第二节点是指以深度为i‑1的节点为根节点的子树中的两个深度为1的节点,所述i大于或等于1且小于所述第一球树的总深度;
当所述第一距离小于所述第二距离,且所述第一节点不是叶子节点时,令i=i+1,进入以所述第一节点为根节点的子树中,返回将第一距离与第二距离进行比较的步骤,直至所述第一节点是叶子节点时,将最终确定的第一节点确定为所述样本数据A所属的叶子节点;
当所述第一距离大于所述第二距离,且所述第二节点不是叶子节点时,令i=i+1,进入以所述第二节点为根节点的子树中,返回将第一距离与第二距离进行比较的步骤,直至所述第二节点是叶子节点时,将最终确定的第二节点确定为所述样本数据A所属的叶子节点;
将属于同一个叶子节点的样本数据划分为一个数据分区,以得到所述多个数据分区,每个数据分区中包括多个样本数据;
根据所述多个数据分区中包括的样本数据,并行地构建每个数据分区对应的第二球树;
根据构建得到的多个第二球树确定目标数据的标签,所述目标数据是指待确定标签的数据。
2.如权利要求1所述的方法,其特征在于,所述根据构建得到的多个第二球树确定目标数据的标签,包括:根据所述目标数据,从构建得到的每个第二球树中,确定出一组候选样本数据,每组候选样本数据中包括K个候选样本数据,所述K大于或等于1;
从确定出的多组候选样本数据中,选择K个样本数据;
根据选择出的K样本数据确定所述目标数据的标签。
3.如权利要求2所述的方法,其特征在于,所述根据所述目标数据,从构建得到的每个第二球树中,确定出一组候选样本数据,包括:对于构建得到的任一第二球树A,令j=1,将第三距离与第四距离进行比较,所述第三距离是指第三节点中位于中心位置处的样本数据与所述目标数据之间的距离,所述第四距离是指第四节点中位于中心位置处的样本数据与所述目标数据之间的距离,所述第三节点和所述第四节点是指所述第二球树A中以深度为j‑1的节点为根节点的子树中的两个深度为1的节点;
当所述第三距离小于所述第四距离,且所述第三节点不是叶子节点时,令j=j+1,进入以所述第三节点为根节点的子树中,返回将第三距离与第四距离进行比较的步骤,直至所述第三节点是叶子节点时,从最终确定的第三节点包括的样本数据中确定出M个候选样本数据,所述M小于或等于所述K;
当所述M小于所述K,或者,最终确定的第四距离与第五距离之间的差值小于第一半径时,判断最终确定的第四节点是否为叶子节点,所述第五距离是指所述M个候选样本数据与所述目标数据之间的最大距离,所述第一半径是指最终确定的第四节点中的样本数据所围成的圆形区域的半径;
若最终确定的第四节点是叶子节点,则从最终确定的第四节点中确定出L个候选样本数据,并根据所述M个候选样本数据和所述L个候选样本数据确定一组候选样本数据,所述L小于或等于所述K;
若最终确定的第四节点不是叶子节点,则按照确定所述M个候选样本数据和所述L个候选样本数据的方式,从以最终确定的第四节点为根节点的子树中,确定出一组候选样本数据。
4.一种数据标签的确定装置,其特征在于,所述装置包括:
抽样模块,用于对样本数据集中包括的样本数据进行抽样,得到多个抽样数据,所述样本数据集中包括的样本数据已标注标签;
第一构建模块,用于根据所述多个抽样数据构建第一球树;
分区模块包括第一确定子模块和划分子模块,所述第一确定子模块包括广播单元、第一确定单元、第一比较单元、第二确定单元、第三确定单元,所述广播单元,用于将所述第一球树广播至N个搜索进程,并将N份样本数据分配给所述N个搜索进程,所述N份样本数据是对所述样本数据集中包括的样本数据划分得到,所述N为大于2的正整数;
所述第一确定单元,用于通过所述N个搜索进程,并行地从所述第一球树包括的至少一个叶子节点中,确定所述N份样本数据中每个样本数据所属的叶子节点;
所述第一比较单元,用于对于所述样本数据集中包括的任一样本数据A,令i=1,将第一距离与第二距离进行比较,所述第一距离是指第一节点中位于中心位置处的样本数据与所述样本数据A之间的距离,所述第二距离是指第二节点中位于中心位置处的样本数据与所述样本数据A之间的距离,所述第一节点和所述第二节点是指以深度为i‑1的节点为根节点的子树中的两个深度为1的节点,所述i大于或等于1且小于所述第一球树的总深度;
所述第二确定单元,用于当所述第一距离小于所述第二距离,且所述第一节点不是叶子节点时,令i=i+1,进入以所述第一节点为根节点的子树中,返回将第一距离与第二距离进行比较的步骤,直至所述第一节点是叶子节点时,将最终确定的第一节点确定为所述样本数据A所属的叶子节点;
所述第三确定单元,用于当所述第一距离大于所述第二距离,且所述第二节点不是叶子节点时,令i=i+1,进入以所述第二节点为根节点的子树中,返回将第一距离与第二距离进行比较的步骤,直至所述第二节点是叶子节点时,将最终确定的第二节点确定为所述样本数据A所属的叶子节点;
所述划分子模块,用于将属于同一个叶子节点的样本数据划分为一个数据分区,以得到所述多个数据分区,每个数据分区中包括多个样本数据;
第二构建模块,用于根据所述多个数据分区中包括的样本数据,并行地构建每个数据分区对应的第二球树;
确定模块,用于根据构建得到的多个第二球树确定目标数据的标签,所述目标数据是指待确定标签的数据。
5.如权利要求4所述的装置,其特征在于,所述确定模块包括:
第二确定子模块,用于根据所述目标数据,从构建得到的每个第二球树中,确定出一组候选样本数据,每组候选样本数据中包括K个候选样本数据,所述K大于或等于1;
选择子模块,用于从确定出的多组候选样本数据中,选择K个样本数据;
第三确定子模块,用于根据选择出的K样本数据确定所述目标数据的标签。
6.如权利要求5所述的装置,其特征在于,所述第二确定子模块包括:
第二比较单元,用于对于构建得到的任一第二球树A,令j=1,将第三距离与第四距离进行比较,所述第三距离是指第三节点中位于中心位置处的样本数据与所述目标数据之间的距离,所述第四距离是指第四节点中位于中心位置处的样本数据与所述目标数据之间的距离,所述第三节点和所述第四节点是指所述第二球树A中以深度为j‑1的节点为根节点的子树中的两个深度为1的节点;
第四确定单元,用于当所述第三距离小于所述第四距离,且所述第三节点不是叶子节点时,令j=j+1,进入以所述第三节点为根节点的子树中,返回将第三距离与第四距离进行比较的步骤,直至所述第三节点是叶子节点时,从最终确定的第三节点包括的样本数据中确定出M个候选样本数据,所述M小于或等于所述K;
判断单元,用于当所述M小于所述K,或者,最终确定的第四距离与第五距离之间的差值小于第一半径时,判断最终确定的第四节点是否为叶子节点,所述第五距离是指所述M个候选样本数据与所述目标数据之间的最大距离,所述第一半径是指最终确定的第四节点中的样本数据所围成的圆形区域的半径;
第五确定单元,用于若最终确定的第四节点是叶子节点,则从最终确定的第四节点中确定出L个候选样本数据,并根据所述M个候选样本数据和所述L个候选样本数据确定一组候选样本数据,所述L小于或等于所述K;
第六确定单元,用于若最终确定的第四节点不是叶子节点,则按照确定所述M个候选样本数据和所述L个候选样本数据的方式,从以最终确定的第四节点为根节点的子树中,确定出一组候选样本数据。
7.一种数据标签的确定装置,其特征在于,所述装置包括:
处理器;
用于存储处理器可执行指令的存储器;
其中,所述处理器被配置为执行权利要求1‑3任一项所述方法的步骤。
8.一种计算机可读存储介质,所述计算机可读存储介质上存储有指令,其特征在于,所述指令被处理器执行时实现权利要求1‑3任一项所述方法。