利索能及
我要发布
收藏
专利号: 2018109862384
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于字典树的中文地理编码方法,其特征在于,所述中文地理编码方法包括以下步骤:

1).地址要素级别划分,将地址要素级别划分为11级别,分别是:1级,中国;2级,省、直辖市;3级,省会、地级市;4级,区、县、地级市;5级,街道、乡镇;6级,社区、村;7级,地片、区片;8级,道路、街巷;9级,楼牌号;10级,门牌号;11级,POI标志物;

2).将标准化的字符串分割,将得到的字符串,按照地址要素级别划分;

3).构建字典树,过程如下:

3.1.构建字典树节点,构建节点类,类里实例域包含地址要素、地址要素级别、标准地址、经纬度、父地址引用、节点是否可用;

3.2.收集整理尽可能多的标准信息地址串,用于数据的构建,字典树的生成;

3.3.将整理好的标准信息地址串拆分成地址要素;

3.4.将拆分好的地址要素,标记好要素级别,将分好的要素级别持久化到数据库,以便后期构建字典树查询使用;

3.5.将标记好的地址要素,通过Google地图API或者百度地图API获取当前节点的经纬度;

3.6.初始化根节点,将信息地址串拆分为地址要素,例如要素节点“中国”,从数据库获取当前节点的要素级别,通过百度地图API获取当前地址要素节点的经纬度,将这些值初始化到根节点中;

3.7.查询地址串的要素级别为2的地址要素,初始化下级节点,并将父节点下一个指向引用指向本节点,本节点的父地址要素的引用指向父节点,并如3.6一样将节点数据域初始化,形成二级节点,以此类推直至叶节点,完成此信息地址串的构建;

3.8.重复3.3-3.8步骤,将信息地址串拆分,然后依次建树,最后形成一个庞大的字典树;

4).信息地址串的匹配,过程如下:

4.1.信息地址串标准化,过程如下:

4.1.1.将信息地址人工拆分标记,然后送入到隐含的马尔科夫训练模型训练,通过(1)式,据统计语言设计方法,统计出某种非标准地址要素映射到标准地址要素的概率,从(2)式获得的概率,其中#是当前地址要素的在样本中的次数,估计当前的输入地址要素与标准地址要素偏差概率;

其中在(1)式中,Ot为某种不标准地址要素,St为标准地址要素;

4.1.2.通过得到的马尔科夫模型标准化信息地址串,将地址串标准化;

4.2.把标准化的地址串分割成标准的地址要素,输入到步骤3)所得到的字典树,搜寻对应的叶子节点,获得叶子节点的必须信息,例如邮编,经纬度,则完成搜索。

2.如权利要求1所述一种基于字典树的中文地理编码方法,其特征在于,所述在步骤3)中,根据标准化的信息地址串,将地址串拆分,构建成字典树;在构建字典树的基础上,通过标准化信息地址串,查找到叶子节点信息,完成搜索。