python怎样读取pdf的本文内容
Admin 2021-05-21 群英技术资讯 980 次浏览
python怎样读取pdf本文内容?一些新手可能对于python读取pdf文本内容不是很清楚,因此下面给大家分享python读取pdf文档的实现代码,有这方面学习需要的朋友可以参考学习。
一、 准备工作
安装对应的库 pip install pdfminer3k pip install pdfminer.six
二、部分变量的含义
PDFDocument(pdf文档对象)
PDFPageInterpreter(解释器)
PDFParser(pdf文档分析器)
PDFResourceManager(资源管理器)
PDFPageAggregator(聚合器)
LAParams(参数分析器)
三、PDFMiner类之间的关系

PDFMiner的相关文档(点击跳转)
四、代码实现
#!/usr/bin/env python # -*- coding:utf-8 -*- # datetime:2021/3/17 12:12 # software: PyCharm # version: python 3.9.2 def changePdfToText(filePath): """ 解析pdf 文本,保存到同名txt文件中 param: filePath: 需要读取的pdf文档的目录 introduced module: from pdfminer.pdfpage import PDFPage from pdfminer.pdfparser import PDFParser from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter from pdfminer.converter import PDFPageAggregator from pdfminer.layout import LAParams from pdfminer.pdfdocument import PDFDocument, PDFTextExtractionNotAllowed import os.path """ file = open(filePath, 'rb') # 以二进制读模式打开 # 用文件对象来创建一个pdf文档分析器 praser = PDFParser(file) # 创建一个PDF文档 doc = PDFDocument(praser, '') # praser :上面创建的pdf文档分析器 ,第二个参数是密码,设置为空就好了 # 连接分析器 与文档对象 praser.set_document(doc) # 检测文档是否提供txt转换,不提供就忽略 if not doc.is_extractable: raise PDFTextExtractionNotAllowed # 创建PDf 资源管理器 来管理共享资源 rsrcmgr = PDFResourceManager() # 创建一个PDF设备对象 laparams = LAParams() device = PDFPageAggregator(rsrcmgr, laparams=laparams) # 创建一个PDF解释器对象 interpreter = PDFPageInterpreter(rsrcmgr, device) result = [] # 内容列表 # 循环遍历列表,每次处理一个page的内容 for page in PDFPage.create_pages(doc): interpreter.process_page(page) # 接受该页面的LTPage对象 layout = device.get_result() for x in layout: if hasattr(x, "get_text"): result.append(x.get_text()) fileNames = os.path.splitext(filePath) # 分割 # 以追加的方式打开文件 with open(fileNames[0] + '.txt', 'a', encoding="utf-8") as f: results = x.get_text() # print(results) 这个句可以取消注释就可以在控制台将所有内容输出了 f.write(results) # 写入文件 # 调用示例 : # path = u'E:\\1.pdf' # changePdfToText(path)
from PyPDF2 import PdfFileReader
# 定义获取pdf内容的方法
def getPdfContent(filename):
# 获取PdfFileReader对象
pdf = PdfFileReader(open(filename, "rb"))
content = "" #content是输出文本
for i in range(0,pdf.getNumPages()): #遍历每一页
pageObj = pdf.getPage(i)
try:
extractedText = pageObj.extractText()#导出每一页的内容,如果当前页有图片的话就跳过
content += extractedText + "\n"
except BaseException:
pass
return content.encode("ascii", "ignore")
# 将获取的内容写入txt文件
with open("test.txt","w") as f:
count=0 #count的作用是限制每一行的文字个数,本人设置的是十行
#将获取的文本变成字符串并用空白隔开
for item in str(getPdfContent("test.pdf")).split(" "):
# 如果当前文字以句号结尾就换行
if item[-1]==".":
f.write(item+"\n")
count=0
else:
f.write(item+" ")
count +=1
# 如果写了十个字就换行
if count==10:
f.write("\n")
# 重置count
count = 0
关于python怎样读取pdf文本内容的介绍就到这,希望对大家学习有一定的帮助,想要了解更多python读取pdf内容的方法,大家可以继续关注其他相关文章。
文本转载自脚本之家
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:mmqy2019@163.com进行举报,并提供相关证据,查实之后,将立刻删除涉嫌侵权内容。
猜你喜欢
分词工具在Python中,会经常使用到,而比较常的分词工具有jieba 分词、pkuseg 分词、FoolNLTK 分词和THULAC,这四种,那么究竟哪个更好用呢?
使用pyautogui库获取屏幕对应坐标。因为使用XPath无法点击到页面的播放按钮,所以使用pyautogui库进行对应位置的点击。屏幕尺寸为1920×1080,在不化Chrom浏览器的情况下,获取到播放按钮的坐标为(676, 860)运行此程序,可以每秒输出鼠标对应的位置
这篇文章主要介绍了pygame实现井字棋之第二步逻辑实现,文中有非常详细的代码示例,对正在学习python的小伙伴们有非常好的帮助,需要的朋友可以参考下
这篇文章主要介绍了pygame实现井字棋之第二步逻辑实现,文中有非常详细的代码示例,对正在学习python的小伙伴们有非常好的帮助,需要的朋友可以参考下
这篇文章主要介绍了python中heapq堆排算法的实现,该模块提供了堆排序算法的实现。堆是二叉树,最大堆中父节点大于或等于两个子节点,最小堆父节点小于或等于两个子节点。下面文章更多详细介绍,需要的小伙伴可以参考一下
成为群英会员,开启智能安全云计算之旅
立即注册关注或联系群英网络
7x24小时售前:400-678-4567
7x24小时售后:0668-2555666
24小时QQ客服
群英微信公众号
CNNIC域名投诉举报处理平台
服务电话:010-58813000
服务邮箱:service@cnnic.cn
投诉与建议:0668-2555555
Copyright © QY Network Company Ltd. All Rights Reserved. 2003-2020 群英 版权所有
增值电信经营许可证 : B1.B2-20140078 粤ICP备09006778号 域名注册商资质 粤 D3.1-20240008