使用python进行拆分大文件的方法

作者:IBoyMan 时间:2022-06-23 17:54:04 

python按指定行数把大文件进行拆分

如图大文件有7000多万行,大小为16G

使用python进行拆分大文件的方法

需要拆分成多个200万行的小文件

代码如下:


# -*- coding:utf-8 -*-
from datetime import datetime

def Main():
source_dir = '/data/u_lx_data/zhangqm/sh/yanjie/liuxuesheng/jz_yuanshi_list0206.txt'
target_dir = '/data/u_lx_data/zhangqm/sh/yanjie/liuxuesheng/split/'

# 计数器
flag = 0

# 文件名
name = 1

# 存放数据
dataList = []

print("开始。。。。。")
print(datetime.now().strftime('%Y-%m-%d %H:%M:%S'))

with open(source_dir,'r') as f_source:
 for line in f_source:
  flag+=1
  dataList.append(line)
  if flag == 2000000:
   with open(target_dir+"jz_yuanshi_list_"+str(name)+".txt",'w+') as f_target:
    for data in dataList:
     f_target.write(data)
   name+=1
   flag = 0
   dataList = []

# 处理最后一批行数少于200万行的
with open(target_dir+"jz_yuanshi_list_"+str(name)+".txt",'w+') as f_target:
 for data in dataList:
  f_target.write(data)

print("完成。。。。。")
print(datetime.now().strftime('%Y-%m-%d %H:%M:%S'))

if __name__ == "__main__":
Main()

结果如下:

使用python进行拆分大文件的方法

总 * 生39个文件,最后一个文件行数760821,这样就OK啦

经测试16G文件所需时间如图:不到两分钟

使用python进行拆分大文件的方法

来源:https://blog.csdn.net/IBoyMan/article/details/79419347

标签:python,拆分,大文件
0
投稿

猜你喜欢

  • Apple在Safari 4中抛弃品牌视觉设计

    2009-02-26 13:05:00
  • 终结IE6下背景图片闪烁问题

    2009-03-04 10:11:00
  • Pytorch使用MNIST数据集实现CGAN和生成指定的数字方式

    2022-01-14 07:38:10
  • Django2.1集成xadmin管理后台所遇到的错误集锦(填坑)

    2022-04-01 02:43:55
  • 使用Termux在手机上运行Python的详细过程

    2021-10-26 10:23:52
  • CentOS 7 安装python3.7.1的方法及注意事项

    2023-03-10 21:23:53
  • 不要像HP一样考验客户的耐心

    2009-09-14 23:25:00
  • 用CSS设计多种文本框与按钮样式风格

    2007-08-10 13:11:00
  • 解决SQLServer最大流水号的两个好方法

    2009-01-13 14:15:00
  • 利用Pygame绘制圆环的示例代码

    2022-04-02 12:55:05
  • python 根据正则表达式提取指定的内容实例详解

    2023-07-18 01:23:48
  • django的模型类管理器——数据库操作的封装详解

    2024-01-12 19:12:53
  • Go语言开发redis封装及简单使用详解

    2024-05-08 10:53:30
  • oracle 存储过程加密的方法

    2009-03-06 10:58:00
  • BootStrap modal实现拖拽功能

    2024-04-18 09:43:48
  • python递归调用中的坑:打印有值, 返回却None

    2023-11-02 23:07:42
  • 教你pycharm运行Django第一个项目

    2021-08-25 16:40:07
  • Python绘图Matplotlib之坐标轴及刻度总结

    2023-10-01 15:56:39
  • 浅谈 Mousewheel 事件

    2010-08-16 12:37:00
  • Python实现统计单词出现的个数

    2022-11-01 12:19:30
  • asp之家 网络编程 m.aspxhome.com