使用Python 提取PDF文本和图片

Python--从PDF提取文本的方法总结 使用pdfplumber、pdfminer、fitz/pymupdf 三个库实现从PDF提取文本,对比分析三个库的提取效率 阅读详情

从PDF中提取内容能帮助我们获取文件中的信息,以便进行进一步的分析和处理。此外,在遇到类似项目时,提取出来的文本或图片也能再次利用。要在Python中通过代码提取PDF文件中的文本和图片,可以使用 Spire.PDF for Python 这个第三方库。具体操作方法查阅下文。

  • Python 提取PDF文本
  • Python 提取PDF页面中指定矩形区域的文本
  • Python 提取PDF图片

安装 Spire.PDF for Python

本文中用到的Python PDF库支持在各种 Python 程序中创建、读取、编辑、转换和保存 PDF 文档。要安装此产品,可使用以下 pip 命令。

pip install Spire.PDF

要了解详细安装教程,参考: 如何在 VS Code 中安装 Spire.PDF for Python

使用 Python 提取PDF文本

Spire.PDF for Python 提供的 PdfPageBase.ExtractText() 方法能提取一个 PDF 页面中文本。根据你的具体需求,你可以选择仅提取某页中的文本,或者遍历所有页面以提取整个PDF文件中的文本。完整Python代码如下:

from spire.pdf import *
from spire.pdf.common import *

# 创建PdfDocument类的实例
pdf = PdfDocument()

# 加载PDF文档
pdf.LoadFromFile("大数据.pdf")

# 创建一个TXT文件来保存提取的文本
extractedText = open("Output/提取文本.txt", "w", encoding="utf-8")

# 遍历文档的每一页
for i in range(pdf.Pages.Count):
    # 获取页面
    page = pdf.Pages.get_Item(i)
    # 从页面提取文本
    text = page.ExtractText()
    # 将文本写入TXT文件
    extractedText.write(text + "\n")

extractedText.close()
pdf.Close()

使用 Python 提取PDF页面中指定矩形区域的文本

如果你只需要提取某个PDF页面中指定区域的文本,你可以指定一个矩形范围然后使用 PdfPageBase.ExtractText(RectangleF rectangleF) 方法提取其中的文本内容。完整Python代码如下:

from spire.pdf import *
from spire.pdf.common import *

# 创建PdfDocument类的对象
pdf = PdfDocument()

# 加载PDF文档
pdf.LoadFromFile("大数据.pdf")

# 获取第一页
page = pdf.Pages.get_Item(0)

# 从页面的指定矩形区域提取文本
text = page.ExtractText(RectangleF(0.0, 400.0, 770.0, 180.0))

# 将提取的文本保存到TXT文件中
extractedText = open("Output/PDF文本.txt", "w", encoding="utf-8")
extractedText.write(text)
extractedText.close()
pdf.Close()

使用 Python 提取PDF图片

除了提取文本外,Spire.PDF for Python 还提供了 PdfPageBase.ExtractImages() 方法来提取PDF文件中的图片。要提取一个PDF文件中的所有图片并保存到指定路径,参考以下Python代码。

from spire.pdf import *
from spire.pdf.common import *

# 创建PdfDocument类的实例
pdf = PdfDocument()

# 加载PDF文档
pdf.LoadFromFile("大数据.pdf")

# 创建一个列表来存储图篇
images = []

# 遍历文档的每一页
for i in range(pdf.Pages.Count):
    # 获取页面
    page = pdf.Pages.get_Item(i)
    # 从页面提取图片并存储在创建的列表中
    for img in page.ExtractImages():
        images.append(img)

# 保存图像
i = 0
for image in images:
    i += 1
    image.Save("Output/图片/图片-{0:d}.png".format(i), ImageFormat.get_Png())

pdf.Close()

在这里插入图片描述

关于Python的技术储备

在这里给大家分享一些免费的课程供大家学习,下面是课程里面的截图,扫描最下方的二维码就能全部领取,如果图片失效点击蓝色字体便可跳转哦~点这里哦

1.Python所有方向的学习路线

在这里插入图片描述

2.学习软件

工欲善其事必先利其器。学习Python常用的开发软件都在这里了,给大家节省了很多时间。
在这里插入图片描述

3.学习资料

在这里插入图片描述

4.实战资料

实践是检验真理的唯一标准。这里的压缩包可以让你再闲暇之余帮你提升你的个人能力。
在这里插入图片描述

5.视频课程

在这里插入图片描述

好啦今天的分享就到这里结束了,快乐的时光总是短暂呢,想学习更多课程的小伙伴不要着急,有更多惊喜哦~在这里插入图片描述

Python识别PDF扫描PDF纯图PDF,OCR提取汉字的10大方法,力推RapidOCRPDF 可识别纯图PDF 加密签名的PDF 重点是开源免费,某些方面准确度比百度OCR高 翻了很久GitHub 最推荐RapidOCRPDF 可识别纯图PDF 加密签名的PDF 重点是开源免费,准确程度比百度OCR高,缺点是不支持还原面格式 阅读详情

相关推荐

python读取xps文件_Python操作PDF-文本图片提取使用PyPDF2PyMuPDF

PDF文件格式如今,可移植文档格式(PDF)属于最常用的数据格式。在1990年,PDF文档的结构由Adobe定义。PDF格式的思想是,对于通信过程中涉及的双方(创建者,作者或发送者以及接收者)而言,传输的数据/文档看起来完全相同。工具库适用于PythonPDF工具,模块库的可用解决方案范围有些混乱,需要花一点时间弄清楚什么是什么,以及哪些项目需要连续维护。根据我们的研究,以下是最新的候选人:...

weixin_31974443的博客 1425

使用Spire.PDF for Python插件从PDF文件提取文字图片信息

本文主要探讨了如何使用Spire.PDF for Python插件从PDF文件提取文字图片信息。首先,我们介绍了Spire.PDF插件的功能用途。接着,通过实例演示了如何使用该插件提取PDF文件的文字图片信息,并对提取过程中的方法步骤进行了详细说明。最后,我们总结了本文的主要内容,指出了其中的不足之处,并提出了未来研究方向。通过本文的介绍,我们可以看到Spire.PDF for Python插件在提取PDF文件中的文字图片信息方面具有非常方便高效的特点。

这家伙很懒,什么都没有留下 4336

Python 提取PDF文本图片

PDF提取内容能帮助我们获取文件中的信息,以便进行进一步的分析处理。此外,在遇到类似项目时,提取出来的文本图片也能再次利用。要在Python中通过代码,可以使用这个第三方库。具体操作方法查阅下文。本文中用到的Python PDF库支持在各种 Python 程序中创建、读取、编辑、转换保存 PDF 文档。要安装此产品,可使用以下 pip 命令。

2201_76124692的博客 1814

chatgpt赋能pythonPython读取扫描形成的PDF文件

本文由chatgpt生成,文章没有在chatgpt生成的基础上进行任何的修改。以上只是chatgpt能力的冰山一角。作为通用的Aigc大模型,只是展现它原本的实力。对于颠覆工作方式的ChatGPT,应该选择拥抱而不是抗拒,未来属于“会用”AI的人。🧡AI职场汇报智能办公文案写作效率提升教程 🧡专注于AI+职场+办公方向。下图是课程的整体大纲下图是AI职场汇报智能办公文案写作效率提升教程中用到的ai工具。

「 虚幻私塾」 1503

chatgpt赋能pythonPython提取扫描PDF:一篇SEO文章

本文由chatgpt生成,文章没有在chatgpt生成的基础上进行任何的修改。以上只是chatgpt能力的冰山一角。作为通用的Aigc大模型,只是展现它原本的实力。对于颠覆工作方式的ChatGPT,应该选择拥抱而不是抗拒,未来属于“会用”AI的人。🧡AI职场汇报智能办公文案写作效率提升教程 🧡专注于AI+职场+办公方向。下图是课程的整体大纲下图是AI职场汇报智能办公文案写作效率提升教程中用到的ai工具。

laod112的博客 658

使用 Python 读取 PDF: 提取文本图片

通过 Spire.PDF for Python,你会发现处理 PDF 文件变得如此简单。无论是读取文件、逐页分析文字,还是把珍贵的插图保存下来,只需要短短的十几行代码就能搞定。这大大提升了文档处理的效率,让你能专注于下一步的数据分析或业务逻辑。现在就去试试吧,用代码解放你的双手!

asdzx67的博客 395

python提取pdf中的文字图片_Python操作PDF-文本图片提取使用PyPDF2PyMuPDF)...

PDF文件格式如今,可移植文档格式(PDF)属于最常用的数据格式。在1990年,PDF文档的结构由Adobe定义。PDF格式的思想是,对于通信过程中涉及的双方(创建者,作者或发送者以及接收者)而言,传输的数据/文档看起来完全相同。工具库适用于PythonPDF工具,模块库的可用解决方案范围有些混乱,需要花一点时间弄清楚什么是什么,以及哪些项目需要连续维护。根据我们的研究,以下是最新的候选人:...

weixin_34931370的博客 1249

Python操作PDF-文本图片提取使用PyPDF2PyMuPDF

PDF文件格式 如今,可移植文档格式(PDF)属于最常用的数据格式。在1990年,PDF文档的结构由Adobe定义。PDF格式的思想是,对于通信过程中涉及的双方(创建者,作者或发送者以及接收者)而言,传输的数据/文档看起来完全相同。 工具库 适用于PythonPDF工具,模块库的可用解决方案范围有些混乱,需要花一点时间弄清楚什么是什么,以及哪些项目需要连续维护。根据我们的研究,以下是最新的候选人: PyPDF2:一个Python库,用于提取文档信息内容,逐页拆分文档,合并文档,裁剪页面并添加水印

douyh的专栏 9632

python读取xps文件_Python操做PDF-文本图片提取使用PyPDF2PyMuPDF

PDF文件格式现在,可移植文档格式(PDF)属于最经常使用的数据格式。在1990年,PDF文档的结构由Adobe定义。PDF格式的思想是,对于通讯过程当中涉及的双方(建立者,做者或发送者以及接收者)而言,传输的数据/文档看起来彻底相同。html工具库适用于PythonPDF工具,模块库的可用解决方案范围有些混乱,须要花一点时间弄清楚什么是什么,以及哪些项目须要连续维护。根据咱们的研究,如下是...

weixin_29865333的博客 1037

Python 读取PDF文档内容 提取PDF文本图片

许多企业机构选择将重要文件,如合同、报告等,保存为PDF格式以进行存储管理。有时候,我们需要读取这些文档中的内容,包括文字图片等,以便进一步分析文档内容、提取关键信息或将其集成到其他系统中。这篇文章将探讨如何通过Python实现PDF文本图片提取。,它支持在多种场景下提取PDF文档中的文本图片。希望以上关于使用Python实现PDF文本图片提取的内容能对你有所帮助。三、Python 实现PDF文本图片提取/读取PDF文档内容。下面我们来看如何借助这个库提取PDF文档中的文本图片

nuclear2011的博客 9165

Python提取PDF文本图片

Spire.PDF for Python

weixin_45866698的博客 1923

Python提取PDF文本图片,以及提前PDF页面中指定矩形区域的文本

PDF提取内容能帮助我们获取文件中的信息,以便进行进一步的分析处理。此外,在遇到类似项目时,提取出来的文本图片也能再次利用。要在Python中通过代码提取PDF文件中的文本图片,可以使用这个第三方库。具体操作方法查阅下文。Python 提取PDF文本Python 提取PDF页面中指定矩形区域的文本Python 提取PDF图片安装。

m0_62283350的博客 1579

【数据提取Python 提取PDF中的文字图片

PDF提取内容能帮助我们获取文件中的信息,以便进行进一步的分析处理。此外,在遇到类似项目时,提取出来的文本图片也能再次利用。要,可以借助这个第三方库。具体操作方法查阅下文。本文中用到的Python PDF库支持在各种 Python 程序中创建、读取、编辑、转换保存 PDF 文档。要安装此产品,使用以下 pip 命令。

Eiceblue的专栏 1922

【办公自动化】用PythonPDF文件转存为图片

因工作中的某些奇葩要求,需要将PDF文件的每页内容转存成按顺序编号的图片。用第三方软件或者在线转换也可以,但批量操作还是Python方便,所谓搞定办公自动化,Python出山,一统天下;Python出征,寸草不生~ O(∩_∩)O

m0_64336780的博客 1万+

Python PyPDF2、pdfplumber 提取 PDF 文本图片内容

Python PyPDF2、pdfplumber 提取 PDF 文本图片内容Python PyPDF2、pdfplumber 提取 PDF 文本图片内容安装库安装 pdfplumber安装 PyPDF2内容提取代码图片提取文本提取完整代码 Python PyPDF2、pdfplumber 提取 PDF 文本图片内容 说明 本方法提取图片并不算完整,我测试用的是阿里2017年双十一的一份P...

kkcoder 1万+

Python 提取PDF文本

Python提取PDF文本

m0_65482549的博客 324

Python+pymupdf处理PDF文档案例6则

推荐图书:《Python程序设计(第3)》,(ISBN:978-7-302-55083-9),清华大学出社,2020年6月第1次印刷,7月第2次印刷京东购买链接:https://it...

Python小屋 1691

Python 提取 PDF 文本的简单方法

你好,我是征哥,一般情况下,Ctrl+C 是最简单的方法,当无法 Ctrl+C 时,我们借助于 Python,以下是具体步骤:第一步,安装工具库1、tika — 用于从各种文件格式中进行文档类型检测内容提取2、wand — 基于 ctypes 的简单 ImageMagick 绑定3、pytesseract — OCR 识别工具创建一个虚拟环境,安装这些工具python...

somenzz的博客 6988
上一篇: 提取微信聊天记录详细教程
下一篇: Python入门实例教程
程序员小八
博客等级 码龄5年 6958粉丝 · 889原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值