python提取pdf表格数据并保存到excel中 - 代码天地

python提取pdf表格数据并保存到excel中

编程语言 2023-10-04 22:45:28 阅读次数: 0

pdfplumber操作pdf文件

python开源库pdfplumber，可以较为方便地获取pdf的各种信息，包含pdf的基本信息（作者、创建时间、修改时间…）及表格、文本、图片等信息，基本可以满足较为简单的格式转换功能。
一、pdfplumber安装及导入
跟其他包一样，支持使用pip安装，安装命令：

pip install pdfplumber

在这里插入图片描述
安装成功后，可直接用import导入，导入命令：

import pdfplumber

二、pdfplumber基础使用
1、基础知识
（1）pdfplumber有2个基础类
PDF和Page，PDF用来处理整个文档，Page用来处理整个页面。

类	用法简介
pdfplumber.PDF	.metadata，获取pdf基础信息，返回字典格式，包含作者、创建时间等。 .pages，返回pdfplumber.Page实例的列表，每一个实例包含pdf每一页的信息
pdfplumber.Page	pdfplumber核心功能，对PDF的大部分操作都是基于这个类，包括提取文本、表格等

（2）pdfplumber读取pdf文件方式

pdfplumber.open(‘文件路径’)，返回pdfplumber.PDF类的实例。
如果pdf有密码，加入password参数：
pdfplumber.open(‘文件路径’,password=‘密码’)

2、获取pdf基础信息

读取pdf文件，并输出pdf文件的基础信息

import pdfplumber
# 打开pdf文件，有密码加入password参数
pdf_info =pdfplumber.open(r'test.pdf')
meta_data = pdf_info.metadata  # pdf的基础信息
page_con = len(pdf_info.pages)  # 获取pdf的总页数
print('pdf文件的基础信息：\n', meta_data)
print('pdf共%s页' % page_con)

在这里插入图片描述
3、pdfplumber提取表格数据
提取表格数据主要用到extract_tables()和extract_table()两种方法，这两种提取方式各有不同。
用以下pdf文档，作为演示文档。

猜你喜欢

转载自blog.csdn.net/LHJCSDNYL/article/details/124207996

python提取pdf表格数据并保存到excel中

用python提取PDF表格内容保存到excel

提取PDF内容保存到Excel--Python3实现

Python提取PDF电子发票内容保存到Excel

python 数据如何保存到excel中

读取excel表格数据进行处理，在保存到excel表格

Python提取JSON文件中的指定数据并保存在CSV或Excel表格文件内

python[番外篇]：python数据如何保存到excel中

python读取mongoDb数据库保存到Excel中

python读取Excel数据保存到mongoDB中

Python如何爬取数据保存到Excel中？

python提取pdf中的表格

python实现同一word中的表格分别提取并保存到不同文件下

python京东爬虫保存到表格中

python提取excel表格数据

python读取excel数据，保存到mysql

Python实现分析pdf或者Word形式简历，并且保存到Excel中

python 算法测试结果自动保存到excel表格

将爬取的数据保存到Excel表格

【Python提取Excel表格中符合条件的数据】

python3从本地excel表格获取账号，实现后台系统的登录，并获取运费后保存到表格中

Python提取PDF中表格数据

#代码人生# 把PDF中的表格提取到Excel中

教你将python运行的数据保存到xlsx表格中

将添加的表格框中数据保存到_data中，

python识别pdf中的表格并保存execl

MFC表格控件内容保存到Excel

Python提取PDF中的信息，写入Excel

arcgis如何计算栅格数据像元值和坐标值并保存到excel表格中

Python爬虫数据保存到MongoDB中

今日推荐

国产云输入法——仅华为无云端数据上传安全问题

开源日报 | 工业开源项目OGG 1.0；姐姐，你要和我一起配置火狐吗；苹果AI遥遥落后？Fedora 40

开放签电子签章：停止新增，优化体验，前进更进（五一假期前工作）

开源日报 | 中学生开源前端动画引擎；全球首个Llama3 8B中文版开源模型；联想电脑恐出局；Linus讽刺AI炒作

“百模大战”必有一战 | 2024中国“百模大战”竞争格局分析

最强开源大模型 Llama 3 上架 Gitee AI

周排行

自媒体文章如何提高原创度以及如何检测原创度

开启qq邮箱的smtp服务

Qt程序单次启动（QSingleApplication类）

国外的外包网站

更新IDEA主题——放飞代码风格

cocos2dx 实现搓牌效果（翻牌效果），包括铺平动画

dict和json之间的互相转换

angular的一些思考

. Fibonacci数列是这样定义的： F[0] = 0 F[1] = 1 for each i ≥ 2: F[i] = F[i-1] + F[i-2] 因此，Fibonacci数列就形如：0, 1

洛谷P1064 金明的预算方案

每日归档

更多

2024-04-25(22)

2024-04-24(36)

2024-04-23(26)

2024-04-22(39)

2024-04-21(0)

2024-04-20(6)

2024-04-19(5)

2024-04-18(0)

2024-04-17(5)

2024-04-16(70)