1.一种分类数据挖掘系统中数据隐私保护方法,其中,系统中处理数据的各个属性按分布式垂直划分的方式分配给各个参与方,其特征在于,数据隐私保护方法包括如下步骤:步骤001.首先,各参与方分别将其隐私数据以密文形式,通过随机排序方式分布在其对应的随机数据中;然后,各参与方根据各自对应的随机数据进行合作计算,分别获得处理数据中各个属性的信息熵;
步骤002.通过针对计算过程中计算结果采用加密传输的方式,各参与方根据处理数据中各个属性的信息熵进行合作计算,分别获得处理数据中各个属性的信息增益;
步骤003.针对处理数据中各个属性的信息增益进行比较,获得最大信息增益所对应的属性,将该属性作为最佳分裂属性,以最佳分裂属性为节点进行分裂;
步骤004.判断是否满足终止分裂条件,是则结束,否则返回步骤001。
2.根据权利要求1所述一种分类数据挖掘系统中数据隐私保护方法,其特征在于,所述步骤001之前,初始化,针对处理数据中的属性预设目标属性,其余属性为候选属性,表示第i个参与方对应系统中所述处理数据中第l个候选属性中第tl个类别的类别数据,其中,i∈{1,…,I},I为参与方的总数,l∈{1,…,L},L为处理数据中候选属性的个数,tl为对应处理数据中第l个候选属性中的第tl个类别,tl∈{1,…,Tl},Tl为处理数据中第l个候选属性对应的类别的总数;并且,若第i个参与方所对应的各个候选属性当中不包括第l个候选属性,则所述步骤001具体包括如下步骤:
步骤00101.第I个参与方PI随机产生加解密密钥(e,d),PI保存解密密钥d,并将加密密钥e分发给其他所有参与方;
步骤00102.第I个参与方PI通过加密密钥e,针对 进行加密获得 并将发送给第1个参与方P1;
步骤00103.第1个参与方P1根据 采用加密密钥e,通过 针对 进行加密获得 并将 发送给第2个参与方P2;
步骤00104.第2个参与方P2按上述步骤同样的方式,针对 进行加密获得依次方式类推,依序针对所有参与方,直至第(I-1)个参与方P(I-1)针对进行加密获得步骤00105.第(I-1)个参与方P(I-1)根据A1l1A2l1…A(I-1)l1AIl1、…、分别计算获得 其中, 表示参与方对应处理数据第l个候选属性中第tl个类别的概率值,即针对l∈{1,…,L}和tl∈{1,…,Tl},获得参与方分别对应处理数据各个候选属性中各个类别的概率值步骤00106.第(I-1)个参与方P(I-1)生成一组随机数R1,R2,…,RM,并且将 与e(R1),e(R2),…,e(RM)随机排序,将序列发送至第I个参与方PI;
步骤00107.第I个参与方PI根据解密密钥d,针对接收到的序列中的各个元素进行解密,并保持序列中元素顺序不变,针对各个元素进行处理获得 log(R1),log(R2),…,log(RM),发送至第1个参与方P1;
步骤00108.第1个参与方P1针对接收到的序列中的各个元素分别加上随机数R,即log(R1)+R,log(R2)+R,…,log(RM)+R,发送至第(I-1)个参与方P(I-1);
步骤00109.第(I-1)个参与方P(I-1)计算 并且将发送至第1个参与方P1;
步骤00110.第1个参与方P1计算 并发送至第(I-1)个参与方P(I-1);
步骤00111.第(I-1)个参与方P(I-1)根据 和 获得步骤00112.第(I-1)个参与方P(I-1)针对处理数据中所有的候选属性,l∈{1,…,L},分别按上述步骤00101至步骤00111,分别获得对应各个候选属性的步骤00113.第(I-1)个参与方P(I-1)根据分别对应各个候选属性的 针对对应候选属性的所有类别tl∈{1,…,Tl},按如下公式:计算获得e(Entropy(Sl)),其中,Entropy(Sl)为处理数据中第l个候选属性的信息熵,进而针对l∈{1,…,L},分别获得处理数据中各个候选属性的信息熵,S为处理数据中所有属性的集合。
3.根据权利要求2所述一种分类数据挖掘系统中数据隐私保护方法,其特征在于,所述步骤002具体包括如下步骤:步骤00201.第(I-1)个参与方P(I-1)向第1个参与方P1发送e(|Sl|),其中Sl表示处理数据中第l个候选属性,|Sl|表示处理数据第l个候选属性中所包含类别数据的数量;
步骤00202.第1个参与方P1计算 并计算
并将 发送至第I个参与方PI,其中R'为参与方P1私有的一个随机数;
步骤00203.第I个参与方PI根据解密密钥d,针对 进行解密获得并发送给第(I-1)个参与方P(I-1);
步骤00204.第(I-1)个参与方P(I-1)根据如下公式:计算获得 并发送给第1个参与方P1;
-R'
步骤00205.第1个参与方P1计算e(Entropy(Sl)) =e(-R'Entropy(Sl)),并将e(-R'Entropy(Sl))发送至第(I-1)个参与方P(I-1);
步 骤00206.第(I-1)个 参 与方 P(I-1)根据 和e(-R'Entropy(Sl))获得
步骤00207.第(I-1)个参与方P(I-1)根据如下公式:计算获得 和
步骤00208.第(I-1)个参与方P(I-1)根据如下公式:计算获得处理数据第l个候选属性的信息增益Gain(Sl,S),进而针对l∈{1,…,L},分别获得处理数据各个候选属性的信息增益,其中,Sv为处理数据中的目标属性,Entropy(Sv)的计算方法参照上述步骤针对候选属性计算Entropy(Sl)的方法。
4.根据权利要求3所述一种分类数据挖掘系统中数据隐私保护方法,其特征在于,所述步骤003具体包括如下步骤:步骤00301.第I个参与方PI重新随机产生加解密密钥(e',d'),PI保存解密密钥d',并将加密密钥e'分发给其他所有参与方;
步骤00302.第I个参与方PI根据l∈{1,…,L},针对各个候选属性的信息增益Gain(Sl,S),分别进行加密e'(ml),并发送至第(I-1)个参与方P(I-1),其中,ml=Gain(Sl,S);
步骤00303.第(I-1)个参与方P(I-1)随机生成队列 通过加密秘钥e',针对随机队列中的每一个元素进行加密,更新队列 再针对对应各个候选属性的e'(ml),计算-1e'(ml)×e'(mj) =e'(ml-mj),并将e'(ml-mj)进行随机扰动后添加至队列 中,将队列发送至第I个参与方PI,其中,j∈{1,…,L},且l<j;
步骤00304.第I个参与方PI根据解密密钥d',分别针对序列中的各个元素进行解密,如果结果大于0,则扰动表对应元素为+1,如果结果小于0,则对应的元素为-1,获得一个由+1和-1组成的差分矩阵 发送至第(I-1)个参与方P(I-1);
步骤00305.第(I-1)个参与方P(I-1)针对差分矩阵 中每一个ml,将每一个ml对应候选属性中所所有类别数据进行相加,依次针对所有ml按大小进行排序;
步骤00306.第(I-1)个参与方P(I-1)根据ml的排序结果,获得最大信息增益所对应的候选属性,将该候选属性作为最佳分裂属性,由任何一个参与方以最佳分裂属性为节点进行分裂。
5.根据权利要求4所述一种分类数据挖掘系统中数据隐私保护方法,其特征在于,所述步骤00306中,第(I-1)个参与方P(I-1)将最佳分裂属性发送至其它所有参与方。