亚洲精品久久久中文字幕-亚洲精品久久片久久-亚洲精品久久青草-亚洲精品久久婷婷爱久久婷婷-亚洲精品久久午夜香蕉

您的位置:首頁技術(shù)文章
文章詳情頁

python從PDF中提取數(shù)據(jù)的示例

瀏覽:2日期:2022-07-06 16:48:11

01

前言

數(shù)據(jù)是數(shù)據(jù)科學(xué)中任何分析的關(guān)鍵,大多數(shù)分析中最常用的數(shù)據(jù)集類型是存儲在逗號分隔值(csv)表中的干凈數(shù)據(jù)。然而,由于可移植文檔格式(pdf)文件是最常用的文件格式之一,因此每個數(shù)據(jù)科學(xué)家都應(yīng)該了解如何從pdf文件中提取數(shù)據(jù),并將數(shù)據(jù)轉(zhuǎn)換為諸如“csv”之類的格式,以便用于分析或構(gòu)建模型。

在本文中,我們將重點討論如何從pdf文件中提取數(shù)據(jù)表。類似的分析可以用于從pdf文件中提取其他類型的數(shù)據(jù),如文本或圖像。我們將說明如何從pdf文件中提取數(shù)據(jù)表,然后將其轉(zhuǎn)換為適合于進(jìn)一步分析和構(gòu)建模型的格式。我們將給出一個實例。

python從PDF中提取數(shù)據(jù)的示例

02

示例:使用Python從PDF文件中提取一個表格

a)將表復(fù)制到Excel并保存為table_1_raw.csv

python從PDF中提取數(shù)據(jù)的示例

數(shù)據(jù)以一維格式存儲,必須進(jìn)行重塑、清理和轉(zhuǎn)換。

b)導(dǎo)入必要的庫

import pandas as pdimport numpy as np

c)導(dǎo)入原始數(shù)據(jù),重新定義數(shù)據(jù)

df=pd.read_csv('table_1_raw.csv', header=None)df.values.shapedf2=pd.DataFrame(df.values.reshape(25,10))column_names=df2[0:1].values[0]df3=df2[1:]df3.columns = df2[0:1].values[0]df3.head()

python從PDF中提取數(shù)據(jù)的示例

d)使用字符串處理工具進(jìn)行數(shù)據(jù)糾纏

我們從上面的表格中注意到,x5、x6和x7列是用百分比表示的,所以我們需要去掉percent(%)符號:

df4[’x5’]=list(map(lambda x: x[:-1], df4[’x5’].values))df4[’x6’]=list(map(lambda x: x[:-1], df4[’x6’].values))df4[’x7’]=list(map(lambda x: x[:-1], df4[’x7’].values))

e)將數(shù)據(jù)轉(zhuǎn)換為數(shù)字形式

我們注意到列x5、x6和x7的列值數(shù)據(jù)類型為string,因此我們需要將它們轉(zhuǎn)換為數(shù)值數(shù)據(jù),如下所示:

df4[’x5’]=[float(x) for x in df4[’x5’].values]df4[’x6’]=[float(x) for x in df4[’x6’].values]df4[’x7’]=[float(x) for x in df4[’x7’].values]

f)查看轉(zhuǎn)換數(shù)據(jù)的最終形式

df4.head(n=5)

python從PDF中提取數(shù)據(jù)的示例

g)導(dǎo)出最終數(shù)據(jù)到一個csv文件

df4.to_csv(’table_1_final.csv’,index=False)

以上就是python從PDF中提取數(shù)據(jù)的示例的詳細(xì)內(nèi)容,更多關(guān)于python 提取PDF數(shù)據(jù)的資料請關(guān)注好吧啦網(wǎng)其它相關(guān)文章!

標(biāo)簽: Python 編程
相關(guān)文章:
主站蜘蛛池模板: 日本一级特黄刺激爽大片 | 思思久久q6热在精品国产 | 日本免费一区二区视频 | 黑人性视频做爰全过程视频 | 久久99热这里只频精品6中文字幕 | 黄色片免费在线看 | 精品推荐 国产 | 成人毛片在线播放 | 国产乱子精品免费视观看片 | 在线视频一区二区 | 尤物国产视频 | 欧美激情二区三区 | 国产精品美女在线观看 | 福利午夜在线 | 中文日韩| 欧美桃色 | 在线欧美v日韩v国产精品v | 日韩精品一区二区三区免费视频 | 怡红院免费va男人的天堂 | 久久久久久极精品久久久 | 我要看黄色特级黄色录像 | 国产精品久久久久久久久久久搜索 | 狠狠色成人综合网图片区 | 日韩欧美一区二区三区 | 久久亚洲综合色 | 一级毛片不卡免费看老司机 | 欧美一区二区三区在观看 | 日本一二区免费 | 亚洲综合在线一区 | 亚洲精品女同一区二区三区 | 国产自自拍 | 你操综合| 日本免费一级 | 1000部拍拍拍18勿入免费凤凰福利 | 久久爱影视i | 91精品国产综合久久婷婷 | 国产精品一区久久 | 特黄特色一级特色大片中文 | 99久久综合九九亚洲 | 国产97色在线 | 亚洲 | 综合久久久久久久综合网 |