宜配屋

利用Python抓取行政区划码的方法

yipeiwu_com6年前 (2020-03-06)Python爬虫

前言

国家统计局网站上有相对比较齐的行政区划码，对于一些网站来说这是非常基础的数据，所以写了个Python程序将这部分数据抓取下来。

注意：抓取下来以后还要进行简单的人工的整理

示例代码：

# -*- coding:utf-8 -*-
'''
获取国家统计局上的行政区划码
'''
import requests,re
base_url = 'http://www.stats.gov.cn/tjsj/tjbz/xzqhdm/201504/t20150415_712722.html'
 
def get_xzqh():
 html_data = requests.get(base_url).content
 pattern = re.compile('<p class="MsoNormal" style=".*?"><span lang="EN-US" style=".*?">(\d+)<span>.*?</span></span><span style=".*?">(.*?)</span></p>')
 areas = re.findall(pattern,html_data)
 print "code,name,level"
 for area in areas:
  print area[0],area[1].decode('utf-8').replace(u'　',''),area[1].decode('utf-8').count(u'　')
 
if __name__=='__main__':
 get_xzqh()

注意事项：

另外，关于国家地区表的信息，还有另外一种获取渠道，那就是QQ软件自带的国家地区信息表。（文件名为LocList.xml），一般的存储位置为：C:\Program Files\Tencent\QQ\I18N\2052

如需中文版安装中文版QQ即可获取，如需英文版则安装英文版QQ。国际版在1033目录。

code都是按照ISO3166标准写的，极易导入数据库。

总结

以上就是利用Python获取行政区划码的全部内容，希望本文的内容对大家学习或者使用python能有所帮助，如果有疑问大家可以留言交流。

利用Python抓取行政区划码的方法

相关文章

python2使用bs4爬取腾讯社招过程解析

python正则表达式爬取猫眼电影top100

python实现的爬取电影下载链接功能示例

python实现的一只从百度开始不断搜索的小爬虫

python爬虫框架scrapy实现模拟登录操作示例

© YiPeiWu.com 【宜配屋】粤ICP备17031333号

Powered By Z-BlogPHP. Theme by TOYEAN.

宜配屋

利用Python抓取行政区划码的方法

相关文章

python2使用bs4爬取腾讯社招过程解析

python正则表达式爬取猫眼电影top100

python实现的爬取电影下载链接功能示例

python实现的一只从百度开始不断搜索的小爬虫

python爬虫框架scrapy实现模拟登录操作示例

© YiPeiWu.com 【宜配屋】 粤ICP备17031333号 var _hmt = _hmt || [];(function() { var hm = document.createElement("script"); hm.src = "https://hm.baidu.com/hm.js?8aa60ae04b767b2af31903508928acc0"; var s = document.getElementsByTagName("script")[0]; s.parentNode.insertBefore(hm, s);})();

Powered By Z-BlogPHP. Theme by TOYEAN.

© YiPeiWu.com 【宜配屋】粤ICP备17031333号