1.基于地理坐标与物种分类双重匹配的植物数据库功能性状补全方法,其特征在于,包括以下步骤:步骤1,获取研究区每个样地的物种数据,计算物种在样地的相对丰度,并使用全球植物名录TPL数据库对物种名称进行标准化;
步骤2,获取不同来源的植物功能性状数据;
步骤3,将收集到的植物功能性状数据统一数据格式,并对数据中的物种拉丁名按属名和种名进行拆分;根据数据中的地理坐标信息将植物功能性状数据转为样点格式POI数据;
步骤4,将研究区中的样地数据转为样点格式POI数据,通过给样地的样点格式POI数据建立缓冲区的方式抓取植物功能性状的POI数据,得到研究区样地与植物功能性状数据的匹配关系表,并记录匹配成功时的缓冲区半径;
步骤5,根据研究区样地与植物功能性状数据的匹配关系表,提取匹配成功的研究区样地数据和对应的植物功能性状数据,根据样地中所包含物种的物种名称对匹配到的植物功能性状数据中的物种名称进行二次筛选,整理出适配样地物种的植物功能性状数据;
步骤6,将匹配成功的植物功能性状数据填入对应的研究区样地数据中,清点每个样地的植物功能性状数据,整理出未被匹配到的植物物种信息和仍有功能性状数据缺失的植物物种信息,并根据在样地中的数量占比选择剔除数据或采用分层贝叶斯方法BHPMF对空缺数据进行插值;
步骤7,提取物种的相对高度、相对基径和相对密度指标,计算物种的重要性,并将物种的重要性作为权重,计算植物群落加权平均性状值,将物种在样地中的相对丰度代入香农指数公式,得到每个样地的香农指数。
2.根据权利要求1所述的方法,其特征在于,步骤1中,采用如下公式计算物种在样地的相对丰度:,
其中 为第i种物种的相对丰度; 为样地中第i种物种的个体数量; 为样地中所有物种个体数量之和。
3.根据权利要求2所述的方法,其特征在于,步骤1中,通过R语言中植物名录plantlist包的植物名称查询函数完成对样地中物种名称的标准化,如果植物名称查询函数TPL无法查询到对应结果,则通过中国植物志进行补充查询。
4.根据权利要求3所述的方法,其特征在于,步骤3包括:
步骤3‑1,对收集到的植物功能性状数据进行格式统一,清除带有空值、无地理坐标或物种名的数据;
步骤3‑2,删除数据中的无关字符;
步骤3‑3,为每条植物功能性状数据设置唯一编号;
步骤3‑4,对数据中的物种拉丁名进行拆分,按属名和种名的形式分开表示;
对标准化后的植物功能性状数据进行格式转换,根据数据中的经纬度信息将数据转为空间矢量格式,使植物功能性状数据以样点格式POI数据的形式表示。
5.根据权利要求4所述的方法,其特征在于,步骤3‑4包括:
将植物功能性状数据的文件格式改为工作表文件格式,使用地理信息系统软件ArcMap,在工具箱ArcToolbox中选择转换工具,通过Excel转表将植物功能性状数据转为表格,再通过添加XY数据功能填入经纬度信息,选择对应的坐标系,将植物功能性状数据以样点格式POI数据的形式表示。
6.根据权利要求5所述的方法,其特征在于,步骤4中,采用步骤3的方法将研究区中的样地数据按经纬度信息转为样点格式POI数据的形式表示,且样地的样点格式POI数据与植物功能性状数据的样点格式POI数据坐标系相同,转换完成后,为样地的样点格式POI数据建立缓冲区,抓取缓冲区内的植物功能性状数据的样点格式POI数据,得到样地的样点格式POI数据与植物功能性状数据的样点格式POI数据的匹配关系,并记录匹配成功时的缓冲区半径。
7.根据权利要求6所述的方法,其特征在于,步骤4中,使用程序编辑器Rtudio软件中的sf::st_read()函数分别读取样地的样点格式POI数据和植物功能性状数据的样点格式POI数据;通过简单要素sf包中的st_buffer()函数为样点格式POI数据创建圆形缓冲区,分别使用5km、20km、50km三种长度作为缓冲区半径;
使用函数st_join()执行空间连接,筛选出落在缓冲区内的植物功能性状数据的样点格式POI数据;使用函数complete.cases()过滤掉未匹配成功的空值记录;使用函数as.data.frame()将匹配结果的sf对象转为标准数据框格式,通过函数merge()整合统计匹配成功的样地的样点格式POI数据和植物功能性状数据的样点格式POI数据的编号,生成样地的样点格式POI数据和植物功能性状数据的样点格式POI数据的地理坐标匹配表。
8.根据权利要求7所述的方法,其特征在于,步骤5包括:结合样地数据中的物种中文名和植物拉丁名对每条植物功能性状数据进行如下三次匹配:第一次匹配是用植物功能性状数据中的物种中文名与样地数据中的物种中文名进行匹配,只对比中文字符,检查是否完全一致,第一次匹配存在两种结果,分别是匹配成功和匹配失败;
第二次匹配是用植物功能性状数据中的物种拉丁名的属名部分与样地数据中的物种拉丁名进行匹配,检验是否存在包含关系,即地理位置匹配成功的样地数据的物种拉丁名中是否包含植物功能性状数据中的物种拉丁名的属名部分的字符,第二次匹配存在两种结果,分别是包含和不包含;
第三次匹配是用植物功能性状数据中的物种拉丁名的种名部分与样地数据中的物种拉丁名进行匹配,检验是否存在包含关系,即地理位置匹配成功的样地数据的物种拉丁名中是否包含植物功能性状数据中的物种拉丁名的种名部分的字符,第三次匹配存在两种结果,分别是包含和不包含。
9.根据权利要求8所述的方法,其特征在于,步骤6包括:对未匹配到功能性状数据和功能性状数据仍有缺失的物种进行统计,如果物种在样地的相对丰度低于阈值10%则剔除物种,否则采用分层贝叶斯方法BHPMF对进行插值,公式为:,
其中,E为期望值,n为行索引,m为列索引,L为层次构造的层数, 为原始的对象和性状矩阵, 为行侧潜在向量, 为列侧潜在向量, 和 为层间正则强度, 为节点的父节点在第l‑1层的潜在向量; , 为填补值的标准差; 为指示变量,标记位置 是否有观测值,当 的(n,m)为非缺失值时取 ,否则为0;对于自下而上的方法,用l+1替换l‑1,并将父节点 替换为子节点 。
10.根据权利要求9所述的方法,其特征在于,步骤7包括:提取物种的相对高度、相对基径和相对密度指标,计算物种重要性IV,并将物种重要性作为权重,与匹配到的功能性状数据结合,计算群落加权性状值CWM并对群落加权性状值CWM进行正态检验Shapiro.test,对不满足正态分布的群落加权性状值CWM进行log对数转换,具体计算公式为:,
,
其中,S为样地中的物种总数, 为第i个物种在每个样方中的个体性状值;X1表示相对高度,X2表示相对基径,X3表示相对密度;
最后,将步骤1计算出的相对丰度和统计出的样地物种总数带入到香农指数公式,得到每个样地的香农指数:,
其中S是物种数;
将匹配成功的植物功能性状数据、计算出的群落加权性状值、香农指数填入数据库对应的样地信息中,完善数据库中的植物功能性状内容。