python读取pdf文档表格内容 python读取pdf并写入excel

转载

数据分析大师 2024-02-10 09:39:20

文章标签 python读取pdf文档表格内容 python 数据分析大数据 linux 文章分类 Python 后端开发

现在，各类数据分析的书籍，都可以在网上找到PDF版本；同时，百度文库、各类数据统计文库、行业研究等众多论文报告，是通过PDF的形式去展示输出的；

但是，令人都头疼的是，各类数据分析书中，PDF版本中的表格数据，我们想转化成自己的数据库文件，或者EXCEL文件，却是很难编辑；

今天，就给大家解决这个问题，利用Python，将PDF中的表格和数据读取出来，并写入EXCEL中保存到本地；

先上代码，代码只有30行；

源PDF文件中的表格数据：

python读取pdf文档表格内容 python读取pdf并写入excel_大数据

代码：

# -*- coding: utf-8 -*-
"""
Created on 0721 2019
@author: Chan
请确保你在运行这个代码的时候，已经安装了pdfplumber库
如果没有安装，请在[附件-命令提示符]下输入：
pip install pdfplumber
"""


import pdfplumber
import xlwt


# 定义保存Excel的位置
workbook = xlwt.Workbook()  #定义workbook
sheet = workbook.add_sheet('Sheet1')  #添加sheet
i = 0 # Excel起始位置


path = input("请输入PDF文件位置：")
#path = "aaaaaa.PDF"  # 导入PDF路径
pdf = pdfplumber.open(path)
print('\n')
print('开始读取数据')
print('\n')


for page in pdf.pages:
    # 获取当前页面的全部文本信息，包括表格中的文字
    # print(page.extract_text())
    for table in page.extract_tables():
        # print(table)
        for row in table:
            print(row)
            for j in range(len(row)):
                sheet.write(i, j, row[j])
            i += 1
        print('---------- 分割线 ----------')


pdf.close()


# 保存Excel表
workbook.save('保存路径/文件名.xls')
print('\n')
print('写入excel成功')
print('保存位置：')
print('保存路径/文件名.xls')
print('\n')
input('PDF取读完毕，按任意键退出')

最终导出的EXCEL文件：

python读取pdf文档表格内容 python读取pdf并写入excel_数据分析_02

简简单单30行代码，就将PDF中的表格数据读取出来，并写入EXCEL啦；

python读取pdf文档表格内容 python读取pdf并写入excel_大数据_03

拓展：

1、pdfplumber简介

Pdfplumber是一个可以处理pdf格式信息的库。可以查找关于每个文本字符、矩阵、和行的详细信息，也可以对表格进行提取并进行可视化调试。

2、pdfplumber安装

安装直接采用pip即可。命令行中输入

pip install pdfplumber

3、简单使用

import pdfplumber
with pdfplumber.open("path/to/file.pdf") as pdf:
    first_page = pdf.pages[0]
    print(first_page.chars[0])

pdfplumber.pdf中包含了.metadata和.pages两个属性。

.metadata是一个包含pdf信息的字典。

.pages是一个包含页面信息的列表。

每个pdfplumber.page的类中包含了几个主要的属性。

.page_number 页码

.width 页面宽度

.height 页面高度

.objects/.chars/.lines/.rects 这些属性中每一个都是一个列表，每个列表都包含一个字典，每个字典用于说明页面中的对象信息，包括直线，字符，方格等位置信息。

4、一些常用的方法

.extract_text() 用来提取页面中的文本，将页面的所有字符对象整理为的那个字符串

.extract_words() 返回的是所有的单词及其相关信息
.extract_tables() 提取页面的表格

本文章为转载内容，我们尊重原作者对文章享有的著作权。如有内容错误或侵权问题，欢迎原作者联系我们进行内容更正或删除文章。

上一篇：python中有像C语言一样的交互窗口吗 python能和c交互吗

下一篇：vcenter磁盘archive是干什么的 vcenter server的作用和功能

提问和评论都可以，用心的回复会被更多人看到评论

发布评论

相关文章

官方博客	全部文章	热门标签	班级博客
了解我们	网站地图	意见反馈

鸿蒙开发者社区	51CTO学堂
51CTO	软考资讯