python读取hdfs并返回dataframe教程

作者:王发北 时间:2022-03-22 17:15:33 

不多说,直接上代码


from hdfs import Client
import pandas as pd

HDFSHOST = "http://xxx:50070"
FILENAME = "/tmp/preprocess/part-00000" #hdfs文件路径
COLUMNNAMES = [xx']

def readHDFS():
'''
读取hdfs文件

Returns:
df:dataframe hdfs数据
'''
client = Client(HDFSHOST)
# 目前读取hdfs文件采用方式:
# 1. 先从hdfs读取二进制数据流文件
# 2. 将二进制文件另存为.csv
# 3. 使用pandas读取csv文件
with client.read(FILENAME) as fs:
content = fs.read()
s = str(content, 'utf-8')
file = open("data/tmp/data.csv", "w")
file.write(s)
df = pd.read_csv("data/tmp/data.csv", names=COLUMNNAMES)
return df

补充知识:Python连接HDFS实现文件上传下载及Pandas转换文本文件到CSV

1. 目标

通过hadoop hive或spark等数据计算框架完成数据清洗后的数据在HDFS上

爬虫和机器学习在Python中容易实现

在Linux环境下编写Python没有pyCharm便利

需要建立Python与HDFS的读写通道

2. 实现

安装Python模块pyhdfs

版本:Python3.6, hadoop 2.9

读文件代码如下


from pyhdfs import HdfsClient
client=HdfsClient(hosts='ghym:50070')#hdfs地址
res=client.open('/sy.txt')#hdfs文件路径,根目录/
for r in res:
 line=str(r,encoding='utf8')#open后是二进制,str()转换为字符串并转码
 print(line)

写文件代码如下


from pyhdfs import HdfsClient
client=HdfsClient(hosts='ghym:50070',user_name='hadoop')#只有hadoop用户拥有写权限
str='hello world'
client.create('/py.txt',str)#创建新文件并写入字符串

上传本地文件到HDFS


from pyhdfs import HdfsClient
client = HdfsClient(hosts='ghym:50070', user_name='hadoop')
client.copy_from_local('d:/pydemo.txt', '/pydemo')#本地文件绝对路径,HDFS目录必须不存在

3. 读取文本文件写入csv

Python安装pandas模块

确认文本文件的分隔符


# pyhdfs读取文本文件,分隔符为逗号,
from pyhdfs import HdfsClient
client = HdfsClient(hosts='ghym:50070', user_name='hadoop')
inputfile=client.open('/int.txt')
# pandas调用读取方法read_table
import pandas as pd
df=pd.read_table(inputfile,encoding='gbk',sep=',')#参数为源文件,编码,分隔符
# 数据集to_csv方法转换为csv
df.to_csv('demo.csv',encoding='gbk',index=None)#参数为目标文件,编码,是否要索引

来源:https://blog.csdn.net/wwangfabei1989/article/details/82349933

标签:python,hdfs,dataframe
0
投稿

猜你喜欢

  • IE中选择符的4095限制

    2009-10-09 13:25:00
  • python的类方法和静态方法

    2021-04-14 21:05:22
  • Javascript 注册事件浅析

    2024-04-28 10:20:22
  • Go语言CSP并发模型实现MPG

    2024-05-22 17:46:48
  • .NET Framework SQL Server 数据提供程序连接池

    2024-01-27 05:05:23
  • 浅析Python 3 字符串中的 STR 和 Bytes 有什么区别

    2021-02-20 00:51:59
  • python书籍信息爬虫实例

    2023-11-17 11:15:49
  • Python多继承以及MRO顺序的使用

    2022-04-01 19:35:50
  • Django 实现将图片转为Base64,然后使用json传输

    2023-06-14 06:42:28
  • 浅谈Python处理PDF的方法

    2023-09-17 13:20:49
  • HTML5硝烟弥漫

    2009-07-06 14:44:00
  • Python实现清理微信僵尸粉功能示例【基于itchat模块】

    2021-10-29 20:45:46
  • tensorflow 1.0用CNN进行图像分类

    2022-08-17 17:32:29
  • Keras搭建孪生神经网络Siamese network比较图片相似性

    2023-01-27 04:16:28
  • SQL SERVER的优化建议与方法

    2024-01-20 15:14:58
  • 使用Python编写一个模仿CPU工作的程序

    2021-04-28 05:28:25
  • JavaScript编写推箱子游戏

    2024-03-17 17:47:32
  • Python3如何使用range函数替代xrange函数

    2022-08-25 06:09:59
  • Python3.7实现中控考勤机自动连接

    2022-08-07 16:24:22
  • Python判断对象是否为文件对象(file object)的三种方法示例

    2021-05-27 09:46:17
  • asp之家 网络编程 m.aspxhome.com