亚洲精品久久久中文字幕-亚洲精品久久片久久-亚洲精品久久青草-亚洲精品久久婷婷爱久久婷婷-亚洲精品久久午夜香蕉

您的位置:首頁(yè)技術(shù)文章
文章詳情頁(yè)

Java爬蟲(chóng)技術(shù)框架之Heritrix框架詳解

瀏覽:2日期:2022-08-28 14:41:40

Heritrix是一個(gè)由Java開(kāi)發(fā)的開(kāi)源Web爬蟲(chóng)系統(tǒng),用來(lái)獲取完整的、精確的站點(diǎn)內(nèi)容的深度復(fù)制,

具有強(qiáng)大的可擴(kuò)展性,運(yùn)行開(kāi)發(fā)者任意選擇或擴(kuò)展各個(gè)組件,實(shí)現(xiàn)特定的抓取邏輯。

一、Heritrix介紹

Heritrix采用了模塊化的設(shè)計(jì),用戶可以在運(yùn)行時(shí)選擇要用的模塊。它由核心類(core classes)和插件模塊(pluggable modules)構(gòu)成。

核心類可以配置,但不能被覆蓋,插件模塊可以由第三方模塊取代。所以我們就可以用實(shí)現(xiàn)了特定抓取邏輯的第三方模塊來(lái)取代默認(rèn)的插件模塊,從而滿足自己的抓取需要。

CrawlController(下載控制器)整個(gè)下載過(guò)程的總控制者,整個(gè)抓取工作的起點(diǎn),決定整個(gè)抓取任務(wù)的開(kāi)始和結(jié)束。每個(gè)URI都有一個(gè)獨(dú)立的線程,它從邊界控制器(Frontier)獲取新的URI,然后傳遞給Processor chains(處理鏈)經(jīng)過(guò)一系列Processor(處理器)處理。

Java爬蟲(chóng)技術(shù)框架之Heritrix框架詳解

二、Heritrix架構(gòu)

中央控制器 CrawlController 是核心組件,決定了整個(gè)抓取任務(wù)的開(kāi)始與結(jié)束。

用戶在 Heritrix web UI 控制臺(tái)設(shè)置抓取任務(wù)后,heritrix首先構(gòu)造XMLSettingsHandler對(duì)象,然后調(diào)用CrawlController的構(gòu)造函數(shù),構(gòu)造一個(gè)CrawlController實(shí)例并初始化,這樣,CrawlController就具備了運(yùn)行條件。

此時(shí),只需調(diào)用 requestCrawlStart()方法就可以啟動(dòng)線程池和Frontier,以便向線程池中工作線程提供抓取用的URL鏈接。

Java爬蟲(chóng)技術(shù)框架之Heritrix框架詳解

Heritrix 3.x 的框架主要分為 Engine 和 Component

三、一些API

org.archive.crawler.framework.CrawlJob;

org.archive.crawler.postprocessor.CandidatesProcessor;org.archive.modules.CrawlURI;

等等

抓取任務(wù)CrawlOrder類:是整個(gè)抓取工作的起點(diǎn)。一次抓取任務(wù)包括許多屬性,建立一個(gè)任務(wù)的方式有很多種,最簡(jiǎn)單的一種就是根據(jù)默認(rèn)的order.xml來(lái)配置。

中央控制器CrawlController:該類決定著抓取任務(wù)的開(kāi)始和結(jié)束。它包含以下幾個(gè)組件:

CrawlOrder:該類保存了order.xml的屬性配置;

CrawlScope:決定當(dāng)前抓取范圍;

ProcessorChainList:處理器鏈;

Frontier:一次抓取任務(wù)需要設(shè)定一個(gè)Frontier,以此來(lái)不斷為其每個(gè)線程提供URI;

ToePool:它是一個(gè)線程池,管理了所有在當(dāng)前任務(wù)中抓取過(guò)的Host名稱和Server名稱。

中央控制器CrawlControllr的類結(jié)構(gòu)如圖所示:

Java爬蟲(chóng)技術(shù)框架之Heritrix框架詳解

Frontier鏈接制造工廠:它表示一種為線程提供鏈接的工具,通過(guò)一些特定的算法來(lái)決定哪個(gè)鏈接將接下來(lái)被送入處理器鏈中,同時(shí),它本身也負(fù)責(zé)一定的日志和狀態(tài)報(bào)告功能。

BdbFrontier類:它是用Berkeley DB 實(shí)現(xiàn)的,Berkeley DB 就是一個(gè)HashTable,它能夠按“key/value”方式保存數(shù)據(jù),能夠?yàn)閼?yīng)用程序提供可伸縮的、高性能的、有事務(wù)保護(hù)功能的嵌入式數(shù)據(jù)庫(kù)。

Heritrix的多線程ToeThread和ToePool:要想更快更有效地抓取網(wǎng)頁(yè),必須采用多線程,Heritrix則采用多線程機(jī)制,提供了一個(gè)標(biāo)準(zhǔn)的線程池ToePool,用于管理所有的抓取線程。

處理器鏈 Processor:包括PreProcessor、Fetcher、Extractor、Writer、PostProcessor五種。

四、應(yīng)用

作為爬蟲(chóng)模塊,爬取數(shù)據(jù)

Java爬蟲(chóng)技術(shù)框架之Heritrix框架詳解

到此這篇關(guān)于爬蟲(chóng)技術(shù)框架之Heritrix框架詳解的文章就介紹到這了,更多相關(guān)爬蟲(chóng)技術(shù)框架 Heritrix內(nèi)容請(qǐng)搜索好吧啦網(wǎng)以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持好吧啦網(wǎng)!

標(biāo)簽: Java
相關(guān)文章:
主站蜘蛛池模板: 人与牲动交xxxxbbbb高清 | 日韩欧美一区二区久久黑人 | 国产精品国产午夜免费福利看 | 中文三 级 黄 色 片 | 国产丝袜按摩女技师在线 | 中文日韩字幕一区在线观看 | 欧美区一区二区三 | 曰本人一级毛片免费完整视频 | 一区二区国产一区二区a4yy | 中文无码久久精品 | 国产毛片一级国语版 | 国产99久久亚洲综合精品 | 久草资源在线播放 | 久久久99精品免费观看精品 | 国产精品亚洲欧美一级久久精品 | 亚洲爆乳无码一区二区三区 | 男女晚上激烈的拍拍拍免费看 | 女人国产香蕉久久精品 | 亚州视频一区二区 | 看特级大黄一片 | 免费大片黄国产在线观看 | 日韩欧美在线观看视频一区二区 | 久久天天综合 | 国产精品国产三级国产在线观看 | 成人毛片免费观看视频 | 亚洲在线网 | 国产大片线上免费观看 | 给我一个可以看片的www日本 | 黄色电影毛片 | 日本高清免费中文字幕不卡 | 国产免费久久精品99久久 | 亚洲综合欧美色综合小说 | 青青青视频蜜桃一区二区 | 日韩美一区二区 | 色久视频 | 免费国产调教视频在线观看 | 99视频在线 | 中文字幕一区精品欧美 | 国产精品亚洲片在线va | 国产高清一级视频在线观看 | 成人午夜精品网站在线观看 |