python读取pdf格式文档的实现代码

作者:十年如梦> 时间:2023-12-10 07:25:49 

python读取pdf文档

一、 准备工作


安装对应的库
pip install pdfminer3k
pip install pdfminer.six

二、部分变量的含义

PDFDocument(pdf文档对象)
PDFPageInterpreter(解释器)
PDFParser(pdf文档分析器)
PDFResourceManager(资源管理器)
PDFPageAggregator(聚合器)
LAParams(参数分析器)

三、PDFMiner类之间的关系

python读取pdf格式文档的实现代码

PDFMiner的相关文档(点击跳转)

四、代码实现


#!/usr/bin/env python
# -*- coding:utf-8 -*-
# datetime:2021/3/17 12:12
# software: PyCharm
# version: python 3.9.2

def changePdfToText(filePath):
"""
解析pdf 文本,保存到同名txt文件中

param:
filePath: 需要读取的pdf文档的目录
introduced module:
from pdfminer.pdfpage import PDFPage
from pdfminer.pdfparser import PDFParser
from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
from pdfminer.converter import PDFPageAggregator
from pdfminer.layout import LAParams
from pdfminer.pdfdocument import PDFDocument, PDFTextExtractionNotAllowed
import os.path
"""
file = open(filePath, 'rb') # 以二进制读模式打开
# 用文件对象来创建一个pdf文档分析器
praser = PDFParser(file)
# 创建一个PDF文档
doc = PDFDocument(praser, '') # praser :上面创建的pdf文档分析器 ,第二个参数是密码,设置为空就好了
# 连接分析器 与文档对象
praser.set_document(doc)
# 检测文档是否提供txt转换,不提供就忽略
if not doc.is_extractable:
raise PDFTextExtractionNotAllowed
# 创建PDf 资源管理器 来管理共享资源
rsrcmgr = PDFResourceManager()
# 创建一个PDF设备对象
laparams = LAParams()
device = PDFPageAggregator(rsrcmgr, laparams=laparams)
# 创建一个PDF解释器对象
interpreter = PDFPageInterpreter(rsrcmgr, device)
result = [] # 内容列表
# 循环遍历列表,每次处理一个page的内容
for page in PDFPage.create_pages(doc):
interpreter.process_page(page)
# 接受该页面的LTPage对象
layout = device.get_result()
for x in layout:
 if hasattr(x, "get_text"):
 result.append(x.get_text())
 fileNames = os.path.splitext(filePath) # 分割
 # 以追加的方式打开文件
 with open(fileNames[0] + '.txt', 'a', encoding="utf-8") as f:
  results = x.get_text()
  # print(results) 这个句可以取消注释就可以在控制台将所有内容输出了
  f.write(results) # 写入文件

# 调用示例 :

# path = u'E:\\1.pdf'
# changePdfToText(path)

利用PyPDF2实现了对pdf文字内容的提取


from PyPDF2 import PdfFileReader

# 定义获取pdf内容的方法
def getPdfContent(filename):
 # 获取PdfFileReader对象
 pdf = PdfFileReader(open(filename, "rb"))
 content = "" #content是输出文本
 for i in range(0,pdf.getNumPages()): #遍历每一页
   pageObj = pdf.getPage(i)
   try:
     extractedText = pageObj.extractText()#导出每一页的内容,如果当前页有图片的话就跳过
     content += extractedText + "\n"
   except BaseException:
     pass
 return content.encode("ascii", "ignore")

# 将获取的内容写入txt文件
with open("test.txt","w") as f:
 count=0 #count的作用是限制每一行的文字个数,本人设置的是十行
 #将获取的文本变成字符串并用空白隔开
 for item in str(getPdfContent("test.pdf")).split(" "):
   # 如果当前文字以句号结尾就换行
   if item[-1]==".":
     f.write(item+"\n")
     count=0
   else:
     f.write(item+" ")
     count +=1
   # 如果写了十个字就换行
   if count==10:
     f.write("\n")
     # 重置count
     count = 0

总结

来源:https://blog.csdn.net/snqfyyzs/article/details/115356431

标签:python,读取,pdf
0
投稿

猜你喜欢

  • 在pandas多重索引multiIndex中选定指定索引的行方法

    2023-07-07 22:04:16
  • python利用线程生成不同尺寸的缩略图实例详解

    2023-07-07 08:47:55
  • python如何提升爬虫效率

    2021-12-17 22:18:24
  • 教你利用python实现企业微信发送消息

    2023-09-06 11:20:55
  • vue项目使用高德地图的定位及关键字搜索功能的实例代码(踩坑经验)

    2024-05-09 15:21:01
  • Python利用物理引擎Pymunk编写一个解压小游戏

    2022-03-08 16:15:45
  • python中get和post有什么区别

    2022-04-17 16:45:15
  • python字典遍历数据的具体做法

    2022-04-19 16:45:33
  • 基于Python实现拆分和合并GIF动态图

    2021-09-09 18:05:57
  • 在微信小程序中获取用户位置的详细过程

    2024-04-29 13:43:02
  • 使用javascript将时间转换成今天,昨天,前天等格式

    2024-04-10 10:42:20
  • python实现自主查询实时天气

    2021-07-02 22:43:09
  • python实现输入数字的连续加减方法

    2023-04-10 09:29:22
  • Python入门基础之import机制

    2023-12-25 11:39:12
  • Python函数返回值实例分析

    2022-06-23 06:59:07
  • css基础教程属性篇

    2008-07-23 12:44:00
  • centos 安装python3.6环境并配置虚拟环境的详细教程

    2021-06-10 12:24:49
  • HTML和SEO基础知识:H标签全透视

    2010-09-21 16:45:00
  • 浅谈pandas筛选出表中满足另一个表所有条件的数据方法

    2022-08-12 14:29:13
  • MySQL制作具有千万条测试数据的测试库的方法

    2024-01-22 07:00:36
  • asp之家 网络编程 m.aspxhome.com