python提取pdf表格数据并保存到excel中

pdfplumber操作pdf文件

python开源库pdfplumber,可以较为方便地获取pdf的各种信息,包含pdf的基本信息(作者、创建时间、修改时间…)及表格、文本、图片等信息,基本可以满足较为简单的格式转换功能。
一、pdfplumber安装及导入
跟其他包一样,支持使用pip安装,安装命令:

pip install pdfplumber

在这里插入图片描述
安装成功后,可直接用import导入,导入命令:

import pdfplumber

二、pdfplumber基础使用
1、基础知识
(1)pdfplumber有2个基础类
PDF和Page,PDF用来处理整个文档,Page用来处理整个页面。

用法简介
pdfplumber.PDF .metadata,获取pdf基础信息,返回字典格式,包含作者、创建时间等。 .pages,返回pdfplumber.Page实例的列表,每一个实例包含pdf每一页的信息
pdfplumber.Page pdfplumber核心功能,对PDF的大部分操作都是基于这个类,包括提取文本、表格等

(2)pdfplumber读取pdf文件方式

pdfplumber.open(‘文件路径’),返回pdfplumber.PDF类的实例。
如果pdf有密码,加入password参数:
pdfplumber.open(‘文件路径’,password=‘密码’)

2、获取pdf基础信息

读取pdf文件,并输出pdf文件的基础信息

import pdfplumber
# 打开pdf文件,有密码加入password参数
pdf_info =pdfplumber.open(r'test.pdf')
meta_data = pdf_info.metadata  # pdf的基础信息
page_con = len(pdf_info.pages)  # 获取pdf的总页数
print('pdf文件的基础信息:\n', meta_data)
print('pdf共%s页' % page_con)

在这里插入图片描述
3、pdfplumber提取表格数据
提取表格数据主要用到extract_tables()和extract_table()两种方法,这两种提取方式各有不同。
用以下pdf文档,作为演示文档。

猜你喜欢

转载自blog.csdn.net/LHJCSDNYL/article/details/124207996