<big id="hnnln"></big>
        <meter id="hnnln"><font id="hnnln"></font></meter>

        <big id="hnnln"><meter id="hnnln"><font id="hnnln"></font></meter></big>

        行業動態基于Heritrix的網絡爬蟲實現

                基于Heritrix的網絡爬蟲實現。

                網絡爬蟲, 是一種可以根據網頁之間的鏈接關系, 在Internet中自動抓取網頁的程序, 它可以有條理的, 自動的遍歷萬維網信息空間。它通過HTTP協議來訪問網頁, 同時, 通過跟蹤鏈接來遍歷整個Web空間。本系統的網絡爬蟲, 基于Heritrix實現。Heritrix是一個由Java開發的、開源的Web網絡爬蟲框架。

                本系統的網絡爬蟲為要包括:網頁分類器 (根據主題策略將網頁分為主題相關和主題不相關兩類) 、信息提取器 (以主題相關網頁作為提取對象, 提取文本信息和鏈接信息) 和網頁抓取器 (抓取“篩選”過的網頁) 。

        本文地址:http://www.65567109.cn/article/22843.html
        相關文章:
        最新文章:
        上海快三