宜配屋

解决python读取几千万行的大表内存问题

yipeiwu_com6年前 (2020-03-06)Python基础

Python导数据的时候，需要在一个大表上读取很大的结果集。

如果用传统的方法，Python的内存会爆掉，传统的读取方式默认在内存里缓存下所有行然后再处理，内存容易溢出

解决的方法：

1）使用SSCursor(流式游标)，避免客户端占用大量内存。(这个cursor实际上没有缓存下来任何数据，它不会读取所有所有到内存中，它的做法是从储存块中读取记录，并且一条一条返回给你。)

2）使用迭代器而不用fetchall,即省内存又能很快拿到数据。

import MySQLdb.cursors

conn = MySQLdb.connect(host='ip地址', user='用户名', passwd='密码', db='数据库名', port=3306,
   charset='utf8', cursorclass = MySQLdb.cursors.SSCursor)
cur = conn.cursor()
cur.execute("SELECT * FROM bigtable");
row = cur.fetchone()
while row is not None:
 do something
 row = cur.fetchone()

cur.close()
conn.close()

需要注意的是，

1、因为SSCursor是没有缓存的游标,结果集只要没取完，这个conn是不能再处理别的sql，包括另外生成一个cursor也不行的。

如果需要干别的，请另外再生成一个连接对象。

2、每次读取后处理数据要快，不能超过60s，否则mysql将会断开这次连接，也可以修改 SET NET_WRITE_TIMEOUT = xx 来增加超时间隔。

以上这篇解决python读取几千万行的大表内存问题就是小编分享给大家的全部内容了，希望能给大家一个参考，也希望大家多多支持【听图阁-专注于Python设计】。

解决python读取几千万行的大表内存问题

相关文章

python导包的几种方法(自定义包的生成以及导入详解)

python 容器总结整理

Python使用pymongo库操作MongoDB数据库的方法实例

Django与遗留的数据库整合的方法指南

Python实现时间序列可视化的方法

© YiPeiWu.com 【宜配屋】粤ICP备17031333号

Powered By Z-BlogPHP. Theme by TOYEAN.

宜配屋

解决python读取几千万行的大表内存问题

相关文章

python导包的几种方法(自定义包的生成以及导入详解)

python 容器总结整理

Python使用pymongo库操作MongoDB数据库的方法实例

Django与遗留的数据库整合的方法指南

Python实现时间序列可视化的方法

© YiPeiWu.com 【宜配屋】 粤ICP备17031333号 var _hmt = _hmt || [];(function() { var hm = document.createElement("script"); hm.src = "https://hm.baidu.com/hm.js?8aa60ae04b767b2af31903508928acc0"; var s = document.getElementsByTagName("script")[0]; s.parentNode.insertBefore(hm, s);})();

Powered By Z-BlogPHP. Theme by TOYEAN.

© YiPeiWu.com 【宜配屋】粤ICP备17031333号