亚洲精品久久久中文字幕-亚洲精品久久片久久-亚洲精品久久青草-亚洲精品久久婷婷爱久久婷婷-亚洲精品久久午夜香蕉

您的位置:首頁技術文章
文章詳情頁

python - Scrapy ItemLoader數據清洗疑問

瀏覽:95日期:2022-06-30 08:28:51

問題描述

在使用scrapy抓取數據時,利用itemloader這個類,使用selector取出的值為空時,進入scrapy.Field()里調用filter(),selector取值不為空的確返回'有值',如果selector取出[]或'',那么value進入filter()之后,并不會返回'無值'

def filter(value): if value:return '有值' else:return '無值' # 下面就簡寫了,熟悉的應該能看的懂 scrapy.Field(filter())

有什么辦法將抓取為空的值,經過filyer()之后變成'無值'

問題解答

回答1:

謝邀~不太了解Scrapy,所以題主這個我不太好說我用PHP自己寫的爬蟲大體思路是:1.先是根據正則和一些循環,把要收集的頁面放到隊列里,按類別分類,例如分頁的列表頁一個隊列,列表里的數據內容頁一個隊列。2.然后利用xpath來爬取相關內容頁的數據,爬取的過程中對一些爬取到的數據進行如題主所需的那樣進行處理。3.組裝數據,按照自己所需的標準保存數據。

大體就是這樣,我絕對大部分爬蟲框架也大概都是這種思路吧,無非是在此基礎上增加了,反爬機制,多線程,多進程,增量爬取等等功能。所以,題主找到你這個框架的爬取數據那里進行處理或組裝數據的地方進行處理都行。

標簽: Python 編程
相關文章:
主站蜘蛛池模板: 成人免费网站视频 | 国产精品合集一区二区三区 | 久久9966精品国产免费 | 欧美a级片免费观看 | 特黄特级高清免费视频毛片 | 国产91色综合久久免费 | 91老色批网站免费看 | 黄页成人免费网站 | 欧美成人另类人妖 | 曰本一级毛片免费 | 亚洲黄色美女 | 国产96福利视频在线观看 | 国产在线精品福利大全 | 国产综合免费视频 | 亚洲不卡视频 | 一级全黄男女免费大片 | julia一区二区中文字幕 | 麻豆传媒免费网站 | 1000部国产拍拍拍拍在线观看 | 操比视频网站 | 久久国产一级毛片一区二区 | 美女任你躁免费视频 | 国产玖玖在线观看 | 在线免费观看国产精品 | 韩国免费播放一级毛片 | 亚洲美女在线播放 | 老司机成人福利视频在线观看免费 | 麻豆小视频在线观看 | 久久久久亚洲 | 久久九九国产精品怡红院 | 一本大道香蕉中文日本不卡高清二区 | 波多野结中文字幕在线69视频 | 四月色 | 国产另类在线观看 | 一本大道香蕉中文日本不卡高清二区 | 日韩欧美亚洲一区二区综合 | 国产成人亚洲精品77 | 亚洲大片在线观看 | 国产精品欧美亚洲 | 中文字幕在线观看一区二区 | 97精品国产91久久久久久 |