搜索引擎建立網頁索引,處理的對象是文本文件。對于搜索引擎爬蟲來說,抓取下來的網頁包括各種格式,如html、圖片、doc、pdf,多媒體、動態網頁及其他格式等。這些文件抓取下來后,需要把這些文件中的文本信息提取出來。準確提取這些文檔的信息,一方面對搜索引擎的搜索準確性有重要作用,另一方面對于搜索引擎爬蟲正確跟蹤其他鏈接也有一定的影響。
對于doc、pdf等由專業廠商提供的軟件生成的文檔,廠商都會提供相應的文本提取接口。搜索引擎爬蟲只需要調用這些插件的接口,就可以輕松地提取文檔中的文本信息和文件相關的其他信息。
HTML等文檔不一樣,HTML有一套自己的語法,通過不同的命令標識符來表示不同的字體、顏色、位置等版式,提取文本信息時需要把這些標識符都過濾掉。過濾標識符并非難事,因為這些標識符都有一定的規則,只要按照不同的標識符取得相應的信息即可。但在識別這些信息的時候,需要同步記錄許多版式信息,例如文字的字體大小、是否是標題、是否是加粗顯示、是否是頁面的關鍵詞等,這些信息有助于計算單詞在網頁中的重要程度。同時,對于HTML網頁來說,除了標題和正文以外,會有許多廣告鏈接以及公共的頻道鏈接,這些鏈接和文本正文一點關系也沒有,在提取網頁內容的時候,也需要過濾這些無用的鏈接。例如某個網站有“產品介紹”頻道,因為導航條在網站內每個網頁都有,若不過濾導航條鏈接,在搜索“產品介紹”的時候,則網站內每個網頁都會搜索到,無疑會帶來大量垃圾信息。過濾這些無效鏈接需要統計大量的網頁結構規律,抽取一些共性,統一過濾;對于一些重要而結果特殊的網站,還需要個別處理。這就需要搜索引擎爬蟲的設計有一定的擴展性。
對于多媒體、圖片等文件,一般是通過鏈接的錨文本(即鏈接文本)和相關的文件注釋來判斷這些文件的內容。例如有一個鏈接文字為“故宮的照片”,其鏈接指向一張bmp格式的圖片,那么搜索引擎爬蟲就知道這張圖片的內容是“故宮的照片”。這樣,在搜索“故宮”和“照片”的時候都能讓搜索引擎找到這張圖片。另外,許多多媒體文件中都有文件屬性,考慮這些屬性也可以更好地了解文件的內容。
動態網頁一直是網絡蜘蛛面臨的難題。所謂動態網頁,是相對于靜態網頁而言的,是由程序自動生成的頁面,這樣的好處是可以快速統一更改網頁風格,也可以減少網頁所占服務器的空間,但同樣給網絡蜘蛛的抓取帶來一些麻煩。由于開發語言不斷增多,動態網頁的類型也越來越多,如asp、jsp、php等。這些類型的網頁對于搜索引擎爬蟲來說,可能還稍微容易一些。搜索引擎爬蟲比較難于處理的是一些腳本語言(如VBScript和JaVaScript)生成的網頁,如果要完善地處理好這些網頁,網絡蜘蛛需要有自己的腳本解釋程序。對于許多數據是放在數據庫的網站,需要通過本網站的數據庫搜索才能獲得信息,這樣給網絡蜘蛛的抓取帶來很大的困難。對于這類網站,如果網站設計者希望這些數據能被搜索引擎搜索,則需要提供一種可以遍歷整個數據庫內容的方法。
對于網頁內容的提取,一直是搜索引擎爬蟲中重要的技術。整個系統一般采用插件的形式,通過一個插件管理服務程序,遇到不同格式的網頁采用不同的插件處理。這種方式的好處在于擴充性好,以后每發現一種新的類型,就可以把其處理方式做成一個插件補充到插件管理服務程序中。
由于網站的內容經常在變化,因此搜索引擎爬蟲也需要不斷地更新其抓取網頁的內容,這就需要搜索引擎爬蟲按照一定的周期去掃描網站,查看哪些頁面是需要更新的頁面,哪些頁面是新增頁面,哪些頁面是已經過期的死鏈接。
搜索引擎的更新周期對搜索引擎搜索的查全率有很大影響。如果更新周期太長,則總會有一部分新生成的網頁搜索不到;周期過短,技術實現會有一定難度,而且會對帶寬、服務器的資源都有浪費。搜索引擎爬蟲并不是所有的網站都采用同一個周期進行更新,對于一些重要的更新量大的網站,更新的周期短,如有些新聞網站,幾個小時就更新一次;相反,對于一些不重要的網站,更新的周期就長,可能一兩個月才更新一次。
一般來說,搜索引擎爬蟲在更新網站內容的時候,不用把網站網頁重新抓取一遍,對于大部分網頁,只需判斷網頁的屬性(主要是日期),把得到的屬性和上次抓取的屬性相比較,如果一樣則不用更新。