python读取hdfs并返回dataframe教程
作者:王发北 时间:2022-03-22 17:15:33
不多说,直接上代码
from hdfs import Client
import pandas as pd
HDFSHOST = "http://xxx:50070"
FILENAME = "/tmp/preprocess/part-00000" #hdfs文件路径
COLUMNNAMES = [xx']
def readHDFS():
'''
读取hdfs文件
Returns:
df:dataframe hdfs数据
'''
client = Client(HDFSHOST)
# 目前读取hdfs文件采用方式:
# 1. 先从hdfs读取二进制数据流文件
# 2. 将二进制文件另存为.csv
# 3. 使用pandas读取csv文件
with client.read(FILENAME) as fs:
content = fs.read()
s = str(content, 'utf-8')
file = open("data/tmp/data.csv", "w")
file.write(s)
df = pd.read_csv("data/tmp/data.csv", names=COLUMNNAMES)
return df
补充知识:Python连接HDFS实现文件上传下载及Pandas转换文本文件到CSV
1. 目标
通过hadoop hive或spark等数据计算框架完成数据清洗后的数据在HDFS上
爬虫和机器学习在Python中容易实现
在Linux环境下编写Python没有pyCharm便利
需要建立Python与HDFS的读写通道
2. 实现
安装Python模块pyhdfs
版本:Python3.6, hadoop 2.9
读文件代码如下
from pyhdfs import HdfsClient
client=HdfsClient(hosts='ghym:50070')#hdfs地址
res=client.open('/sy.txt')#hdfs文件路径,根目录/
for r in res:
line=str(r,encoding='utf8')#open后是二进制,str()转换为字符串并转码
print(line)
写文件代码如下
from pyhdfs import HdfsClient
client=HdfsClient(hosts='ghym:50070',user_name='hadoop')#只有hadoop用户拥有写权限
str='hello world'
client.create('/py.txt',str)#创建新文件并写入字符串
上传本地文件到HDFS
from pyhdfs import HdfsClient
client = HdfsClient(hosts='ghym:50070', user_name='hadoop')
client.copy_from_local('d:/pydemo.txt', '/pydemo')#本地文件绝对路径,HDFS目录必须不存在
3. 读取文本文件写入csv
Python安装pandas模块
确认文本文件的分隔符
# pyhdfs读取文本文件,分隔符为逗号,
from pyhdfs import HdfsClient
client = HdfsClient(hosts='ghym:50070', user_name='hadoop')
inputfile=client.open('/int.txt')
# pandas调用读取方法read_table
import pandas as pd
df=pd.read_table(inputfile,encoding='gbk',sep=',')#参数为源文件,编码,分隔符
# 数据集to_csv方法转换为csv
df.to_csv('demo.csv',encoding='gbk',index=None)#参数为目标文件,编码,是否要索引
来源:https://blog.csdn.net/wwangfabei1989/article/details/82349933
标签:python,hdfs,dataframe
0
投稿
猜你喜欢
IE中选择符的4095限制
2009-10-09 13:25:00
python的类方法和静态方法
2021-04-14 21:05:22
Javascript 注册事件浅析
2024-04-28 10:20:22
Go语言CSP并发模型实现MPG
2024-05-22 17:46:48
.NET Framework SQL Server 数据提供程序连接池
2024-01-27 05:05:23
浅析Python 3 字符串中的 STR 和 Bytes 有什么区别
2021-02-20 00:51:59
python书籍信息爬虫实例
2023-11-17 11:15:49
Python多继承以及MRO顺序的使用
2022-04-01 19:35:50
Django 实现将图片转为Base64,然后使用json传输
2023-06-14 06:42:28
浅谈Python处理PDF的方法
2023-09-17 13:20:49
HTML5硝烟弥漫
2009-07-06 14:44:00
Python实现清理微信僵尸粉功能示例【基于itchat模块】
2021-10-29 20:45:46
tensorflow 1.0用CNN进行图像分类
2022-08-17 17:32:29
Keras搭建孪生神经网络Siamese network比较图片相似性
2023-01-27 04:16:28
SQL SERVER的优化建议与方法
2024-01-20 15:14:58
使用Python编写一个模仿CPU工作的程序
2021-04-28 05:28:25
JavaScript编写推箱子游戏
2024-03-17 17:47:32
Python3如何使用range函数替代xrange函数
2022-08-25 06:09:59
Python3.7实现中控考勤机自动连接
2022-08-07 16:24:22
Python判断对象是否为文件对象(file object)的三种方法示例
2021-05-27 09:46:17