python用pdfplumber提取pdf表格數據并保存到excel文件中

    目錄

    pdfplumber操作pdf文件

    python開源庫pdfplumber,可以較為方便地獲取pdf得各種信息,包含pdf得基本信息(作者、創建時間、修改時間…)及表格、文本、圖片等信息,基本可以滿足較為簡單得格式轉換功能。

    一、pdfplumber安裝及導入

    跟其他包一樣,支持使用pip安裝,安裝命令:

    pip install pdfplumber

    安裝成功后,可直接用import導入,導入命令:

    import pdfplumber

    二、pdfplumber基礎使用

    1、基礎知識

    (1)pdfplumber有2個基礎類

    PDF和Page,PDF用來處理整個文檔,Page用來處理整個頁面。

    用法簡介
    pdfplumber.PDF.metadata,獲取pdf基礎信息,返回字典格式,包含作者、創建時間等。 .pages,返回pdfplumber.Page實例得列表,每一個實例包含pdf每一頁得信息
    pdfplumber.Pagepdfplumber核心功能,對PDF得大部分操作都是基于這個類,包括提取文本、表格等

    (2)pdfplumber讀取pdf文件方式

    pdfplumber.open(‘文件路徑’),返回pdfplumber.PDF類得實例。

    如果pdf有密碼,加入password參數:

    pdfplumber.open(‘文件路徑’,password=‘密碼’)

    2、獲取pdf基礎信息

    讀取pdf文件,并輸出pdf文件得基礎信息

    import pdfplumber# 打開pdf文件,有密碼加入password參數pdf_info =pdfplumber.open(r'test.pdf')meta_data = pdf_info.metadata  # pdf得基礎信息page_con = len(pdf_info.pages)  # 獲取pdf得總頁數print('pdf文件得基礎信息:n', meta_data)print('pdf共%s頁' % page_con)

    3、pdfplumber提取表格數據

    提取表格數據主要用到extract_tables()和extract_table()兩種方法,這兩種提取方式各有不同。

    用以下pdf文檔,作為演示文檔。

    (1)extract_tables()方法

    輸出文檔所有表格,返回一個嵌套列表,其結構層次為table-row-cell。如:

    #extract_tables()用法with pdfplumber.open(r'test.pdf') as pdf_info:  # 打開pdf文件    page_one = pdf_info.pages[0]  # 選擇第一頁    page_one_table =page_one.extract_tables()  # 獲取pdf文檔第一頁得所有表格數據    for row in page_one_table:       print('第一頁得表格數據:', row)


    (2)、extact_table()方法

    不會返回文檔得所有表格,僅返回行數最多得表格數據,如存在多個行數相等得表格,則默認輸出頂部表格數據。返回得數據結構層次為row-cell,表格得每一行都為一個單獨得列表,列表中得元素即為原表格得各個單元格得數據。如:

    # extract_table()用法with pdfplumber.open(r'test.pdf') as pdf_info:  # 打開pdf文件    page_one = pdf_info.pages[0]  # 選擇第一頁    page_one_table = page_one.extract_table()    for row in page_one_table:        print(row)

    三、提取pdf表格數據并保存到excel中

    完整版,提取pdf表格數據并保存到excel中

    import pdfplumberfrom openpyxl import Workbookclass PDF(object):    def __init__(self, file_path):        self.pdf_path = file_path        # 讀取pdf文件        try:            self.pdf_info = pdfplumber.open(self.pdf_path)            print('讀取文件完成!')        except Exception as e:            print('讀取文件失敗:', e)    # 打印pdf得基本信息、返回字典,作者、創建時間、修改時間/總頁數    def get_pdf(self):        pdf_info = self.pdf_info.metadata        pdf_page = len(self.pdf_info.pages)        print('pdf共%s頁' % pdf_page)        print("pdf文件基本信息:n", pdf_info)        self.close_pdf()    # 提取表格數據,并保存到excel中    def get_table(self):        wb = Workbook()  # 實例化一個工作簿對象        ws = wb.active  # 獲取第一個sheet        con = 0        try:            # 獲取每一頁得表格中得文字,返回table、row、cell格式:[[[row1],[row2]]]            for page in self.pdf_info.pages:                for table in page.extract_tables():                    for row in table:                        # 對每個單元格得字符進行簡單清洗處理                        row_list = [cell.replace('n', ' ') if cell else '' for cell in row]                        ws.append(row_list)  # 寫入數據                con += 1                print('---------------分割線,第%s頁---------------' % con)        except Exception as e:            print('報錯:', e)        finally:            wb.save('\'.join(self.pdf_path.split('\')[:-1]) + 'pdf_excel.xlsx')            print('寫入完成!')            self.close_pdf()    # 關閉文件    def close_pdf(self):        self.pdf_info.close()if __name__ == "__main__":    file_path = input('請輸入pdf文件路徑:')    pdf_info = PDF(file_path)    # pdf_info.get_pdf() # 打印pdf基礎信息    # 提取pdf表格數據并保存到excel中,文件保存到跟pdf同一文件路徑下    pdf_info.get_table()

    總結

    到此這篇關于python用pdfplumber提取pdf表格數據并保存到excel文件中得內容就介紹到這了,更多相關python提取pdf數據保存excel內容請搜索之家以前得內容或繼續瀏覽下面得相關內容希望大家以后多多支持之家!

    聲明:所有內容來自互聯網搜索結果,不保證100%準確性,僅供參考。如若本站內容侵犯了原著者的合法權益,可聯系我們進行處理。
    發表評論
    更多 網友評論1 條評論)
    暫無評論

    返回頂部

    主站蜘蛛池模板: 一区二区三区在线免费| 无码日本电影一区二区网站| 在线观看亚洲一区二区| 日本精品一区二区三区四区| 亚洲bt加勒比一区二区| 不卡无码人妻一区三区音频| 四虎成人精品一区二区免费网站| 色偷偷一区二区无码视频| 中文字幕一区二区三| 高清一区二区三区视频| 国产伦精品一区二区三区免.费| 亚洲熟妇无码一区二区三区| 无码日韩精品一区二区免费暖暖 | 国产伦精品一区二区免费 | 精品人无码一区二区三区| 国产波霸爆乳一区二区 | 无码人妻一区二区三区兔费| 人妻无码一区二区不卡无码av| 久久久久一区二区三区| 国产精品一区二区久久不卡 | 无码丰满熟妇一区二区| 国产精品亚洲一区二区麻豆| 国产精品一区视频| 精品人妻无码一区二区色欲产成人| 一区二区三区观看免费中文视频在线播放| 国模精品一区二区三区| 精品视频一区二区三区免费| 久久国产视频一区| 亚洲av不卡一区二区三区| 91在线一区二区| 亚洲av成人一区二区三区在线播放| 波多野结衣一区二区| 精品欧美一区二区在线观看| 美日韩一区二区三区| 亚洲国产精品一区二区九九| 国产内射999视频一区| 亚洲一区二区三区免费在线观看| 最新欧美精品一区二区三区| 精品国产一区二区三区香蕉事| 天堂va在线高清一区 | 日韩精品人妻一区二区中文八零 |