亚洲精品久久久中文字幕-亚洲精品久久片久久-亚洲精品久久青草-亚洲精品久久婷婷爱久久婷婷-亚洲精品久久午夜香蕉

您的位置:首頁(yè)技術(shù)文章
文章詳情頁(yè)

python中scrapy處理項(xiàng)目數(shù)據(jù)的實(shí)例分析

瀏覽:82日期:2022-07-04 15:29:04

在我們處理完數(shù)據(jù)后,習(xí)慣把它放在原有的位置,但是這樣也會(huì)出現(xiàn)一定的隱患。如果因?yàn)樾聰?shù)據(jù)的加入或者其他種種原因,當(dāng)我們?cè)俅蜗胍獑⒂眠@個(gè)文件的時(shí)候,小伙伴們就會(huì)開(kāi)始著急卻怎么也翻不出來(lái),似乎也沒(méi)有其他更好的搜集辦法,而重新進(jìn)行數(shù)據(jù)整理顯然是不現(xiàn)實(shí)的。下面我們就一起看看python爬蟲(chóng)中scrapy處理項(xiàng)目數(shù)據(jù)的方法吧。

1、拉取項(xiàng)目

$ git clone https://github.com/jonbakerfish/TweetScraper.git$ cd TweetScraper/$ pip install -r requirements.txt #add ’--user’ if you are not root$ scrapy list$ #If the output is ’TweetScraper’, then you are ready to go.

2、數(shù)據(jù)持久化

通過(guò)閱讀文檔,我們發(fā)現(xiàn)該項(xiàng)目有三種持久化數(shù)據(jù)的方式,第一種是保存在文件中,第二種是保存在Mongo中,第三種是保存在MySQL數(shù)據(jù)庫(kù)中。因?yàn)槲覀冏ト〉臄?shù)據(jù)需要做后期的分析,所以,需要將數(shù)據(jù)保存在MySQL中。

抓取到的數(shù)據(jù)默認(rèn)是以Json格式保存在磁盤(pán) ./Data/tweet/ 中的,所以,需要修改配置文件 TweetScraper/settings.py 。

ITEM_PIPELINES = { # ’TweetScraper.pipelines.SaveToFilePipeline’:100,#’TweetScraper.pipelines.SaveToMongoPipeline’:100, # replace `SaveToFilePipeline` with this to use MongoDB ’TweetScraper.pipelines.SavetoMySQLPipeline’:100, # replace `SaveToFilePipeline` with this to use MySQL}#settings for mysqlMYSQL_SERVER = '18.126.219.16'MYSQL_DB = 'scraper'MYSQL_TABLE = 'tweets' # the table will be created automaticallyMYSQL_USER = 'root' # MySQL user to use (should have INSERT access granted to the Database/TableMYSQL_PWD = 'admin123456' # MySQL user’s password

內(nèi)容擴(kuò)展:

scrapy.cfg是項(xiàng)目的配置文件

from scrapy.spider import BaseSpiderclass DmozSpider(BaseSpider):name = 'dmoz'allowed_domains = ['dmoz.org']start_urls = [ 'http://www.dmoz.org/Computers/Programming/Languages/Python/Books/', 'http://www.dmoz.org/Computers/Programming/Languages/Python/Resources/']def parse(self, response): filename = response.url.split('/')[-2] open(filename, ’wb’).write(response.body)

到此這篇關(guān)于python中scrapy處理項(xiàng)目數(shù)據(jù)的實(shí)例分析的文章就介紹到這了,更多相關(guān)python爬蟲(chóng)中scrapy如何處理項(xiàng)目數(shù)據(jù)內(nèi)容請(qǐng)搜索好吧啦網(wǎng)以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持好吧啦網(wǎng)!

標(biāo)簽: Python 編程
相關(guān)文章:
主站蜘蛛池模板: 婷婷 综合| 最新三级网站 | 欧美精品久久久久久久影视 | 麻豆成人在线视频 | 成年人免费网站在线观看 | 大陆国语自产精品视频在 | 国产精选在线播放 | 欧美精品亚洲精品日韩一区 | 在线中文字幕日韩 | 国产性生活| 夭天色综合 | 国产精品一区二区欧美视频 | 国产视频不卡在线 | 深夜释放自己黄瓜视频 | 中国大陆一级毛片 免费 | 国产精品1页 | 成人免费视频一区二区三区 | 天天色综| 欧美三级一区二区 | 久久综合丁香激情久久 | 国产αv | 玖草资源在线 | 亚洲乱码中文字幕综合 | 久久久久久久久女黄9999 | 1769国产精品视频免费观看 | 韩国18videos极品 | 欧美色片在线观看 | 免费一级网站 | a色毛片免费视频 | 亚洲欧洲日产国码久在线观看 | 欧美日韩aa一级视频 | 麻豆一区二区三区在线观看 | 可以在线观看的黄色网址 | 真人一级毛片免费完整视 | 456亚洲老头视频 | 久久久久亚洲 | 国产我不卡| 99久久精品免费看国产麻豆 | 日韩欧美中 | 女人被男人狂躁视频免费 | 欧美一级大片免费看 |