使用python进行拆分大文件的方法
作者:IBoyMan 时间:2022-06-23 17:54:04
python按指定行数把大文件进行拆分
如图大文件有7000多万行,大小为16G
需要拆分成多个200万行的小文件
代码如下:
# -*- coding:utf-8 -*-
from datetime import datetime
def Main():
source_dir = '/data/u_lx_data/zhangqm/sh/yanjie/liuxuesheng/jz_yuanshi_list0206.txt'
target_dir = '/data/u_lx_data/zhangqm/sh/yanjie/liuxuesheng/split/'
# 计数器
flag = 0
# 文件名
name = 1
# 存放数据
dataList = []
print("开始。。。。。")
print(datetime.now().strftime('%Y-%m-%d %H:%M:%S'))
with open(source_dir,'r') as f_source:
for line in f_source:
flag+=1
dataList.append(line)
if flag == 2000000:
with open(target_dir+"jz_yuanshi_list_"+str(name)+".txt",'w+') as f_target:
for data in dataList:
f_target.write(data)
name+=1
flag = 0
dataList = []
# 处理最后一批行数少于200万行的
with open(target_dir+"jz_yuanshi_list_"+str(name)+".txt",'w+') as f_target:
for data in dataList:
f_target.write(data)
print("完成。。。。。")
print(datetime.now().strftime('%Y-%m-%d %H:%M:%S'))
if __name__ == "__main__":
Main()
结果如下:
总 * 生39个文件,最后一个文件行数760821,这样就OK啦
经测试16G文件所需时间如图:不到两分钟
来源:https://blog.csdn.net/IBoyMan/article/details/79419347
标签:python,拆分,大文件
0
投稿
猜你喜欢
Apple在Safari 4中抛弃品牌视觉设计
2009-02-26 13:05:00
终结IE6下背景图片闪烁问题
2009-03-04 10:11:00
Pytorch使用MNIST数据集实现CGAN和生成指定的数字方式
2022-01-14 07:38:10
Django2.1集成xadmin管理后台所遇到的错误集锦(填坑)
2022-04-01 02:43:55
使用Termux在手机上运行Python的详细过程
2021-10-26 10:23:52
CentOS 7 安装python3.7.1的方法及注意事项
2023-03-10 21:23:53
不要像HP一样考验客户的耐心
2009-09-14 23:25:00
用CSS设计多种文本框与按钮样式风格
2007-08-10 13:11:00
解决SQLServer最大流水号的两个好方法
2009-01-13 14:15:00
利用Pygame绘制圆环的示例代码
2022-04-02 12:55:05
python 根据正则表达式提取指定的内容实例详解
2023-07-18 01:23:48
django的模型类管理器——数据库操作的封装详解
2024-01-12 19:12:53
Go语言开发redis封装及简单使用详解
2024-05-08 10:53:30
oracle 存储过程加密的方法
2009-03-06 10:58:00
BootStrap modal实现拖拽功能
2024-04-18 09:43:48
python递归调用中的坑:打印有值, 返回却None
2023-11-02 23:07:42
教你pycharm运行Django第一个项目
2021-08-25 16:40:07
Python绘图Matplotlib之坐标轴及刻度总结
2023-10-01 15:56:39
浅谈 Mousewheel 事件
2010-08-16 12:37:00
Python实现统计单词出现的个数
2022-11-01 12:19:30