利索能及
我要发布
收藏
专利号: 202510253348X
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种面向公平性和平衡约束优化的人口普查聚类方法,其特征在于,包括以下步骤:步骤1,获取人口普查抽样数据集X;

步骤2,使用布谷鸟搜索算法进行优化,选取初始人口聚类中心;

步骤3,在K值选择区间内进行轮廓系数比较法,选取人口调查聚类最佳K值;

步骤4,进行加权欧式距离优化迭代;

步骤5,引入公平性和平衡约束;

步骤6,迭代直至达到收敛条件;

步骤2包括:

步骤2‑1,初始化num_nest个巢,每个巢里随机生成K个候选初始人口聚类中心,num_nest公式为:(1),

其中,n为人口普查抽样数据集样本数量;

计算每个巢的误差平方和SSE作为适应度:(2),

其中,表示在第i个簇里的人口调查样本点, 为第i个簇的人口聚类中心, 为第i个簇;

步骤2‑2,先随机选一个巢a,然后随机选取两个不同的巢 和 ,将两个不同的巢 和线性组合成一个新巢 ,比较新巢 与巢a的适应度,如果新巢 的适应度小于巢a的适应度,则用新巢 替换a,否则不替换;

所述线性组合的公式为:

(3),

其中,为随机步长因子,取值为0到1;

步骤2‑3,对每个巢进行Levy飞行,每个巢进行Levy随机搜索以增加多样性:(4),

其中 是Levy分布参数, 是Levy飞行的初始巢, 是 经过Levy飞行新合成的巢, 是Levy飞行的步长;

Levy分布的步长计算公式为:(5),

(6),

其中,和 是从正态分布中生成的随机变量 ) (0,1),是Levy分布的一个参数; 是伽马函数;

使用以下边界处理策略:

(7);

其中, 是人口普查抽样数据集X的上限, 是人口普查抽样数据集X的下限;

步骤2‑4,重复步骤2‑1 步骤2‑3进行迭代,直至达到最大迭代次数,输出最佳初始化聚~类中心。

2.根据权利要求1所述的方法,其特征在于,步骤3包括:步骤3‑1,计算第i个人口普查样本的类内距离 :(8),

其中, 为第i个人口普查样本所属簇的编号, 为第i个人口普查样本所属簇, 是第i个人口普查样本所属簇中的样本数, 和 分别表示第i个人口普查样本和第j个人口普查样本; 和 所属簇相同;

步骤3‑2,计算人口普查数据分析最近簇的类间距离 :(9),

其中, 表示编号等于c的簇;

步骤3‑3,计算每个人口普查样本的轮廓系数;

步骤3‑4,对于当前K值,计算平均轮廓系数 ;

步骤3‑5,选取平均轮廓系数最大的K值作为簇数,进行步骤4。

3.根据权利要求2所述的方法,其特征在于,步骤3‑3包括:第i个人口普查样本的轮廓系数 的计算公式为:(10)。

4.根据权利要求3所述的方法,其特征在于,步骤3‑4包括:采用如下公式计算平均轮廓系数 :(11)。

5.根据权利要求4所述的方法,其特征在于,步骤4包括:步骤4‑1,计算第m个特征的标准差 :(12),

其中, 是人口普查抽样数据集X中第i个人口普查样本的第m个特征值,n是人口普查样本总数, 表示第m个特征所有样本的均值;

步骤4‑2,计算权重w时,通过每个特征的标准差来确定权重:(13),

其中 表示第m个特征的权重;

步骤4‑3,计算加权欧氏距离。

6.根据权利要求5所述的方法,其特征在于,步骤4‑3中,采用如下公式计算加权欧氏距离:(14),

其中, 是第i个人口普查样本到第j个人口普查样本的加权欧氏距离, 是第j个聚类中心的第m个特征,M为人口普查样本的特征总数。

7.根据权利要求6所述的方法,其特征在于,步骤5包括:通过使用指示矩阵,人口敏感属性的公平性表示成:(15),

其中,F表示人口抽样数据敏感属性的指示矩阵,Y表示簇标签的指示矩阵;

通过算术平均不等式,当 时,得到:(16),

其中, 表示第h个簇大小,k表示簇的总数;

使用指示矩阵将公式(16)表示为:(17),

其中,tr表示矩阵的迹;

使用拉格朗日乘子法得出目标代价函数:(18),

其中, 表示分布在第c个簇时的目标代价, 表示第i个人口普及样本到第c个簇的质心的加权欧式距离。

8.一种电子设备,其特征在于,包括处理器和存储器,所述存储器存储有程序代码,当所述程序代码被所述处理器执行时,使得所述处理器执行如权利要求1至7中任一项所述的方法的步骤。

9.一种存储介质,其特征在于,存储有计算机程序或指令,当所述计算机程序或指令在计算机上运行时,执行如权利要求1至7中任一项所述的方法的步骤。