无遮挡色视频真人免费-国产男女性潮高清免费网站-久久国产精品二国产精品-色老二导航

專注抖音視頻、谷歌推廣20年
證券簡稱:思億歐 證券代碼:839255
1對1的貼心服務13603054593

您當前的位置:首頁 >> SEO知識 >> 網(wǎng)站幫助

搜索引擎是如何抓取網(wǎng)站內(nèi)容的

發(fā)布時間:2020-06-22 00:54:20瀏覽次數(shù):

搜索引擎建立網(wǎng)頁索引,處理的對象是文本文件。對于搜索引擎爬蟲來說,抓取下來的網(wǎng)頁包括各種格式,如html、圖片、doc、pdf,多媒體、動態(tài)網(wǎng)頁及其他格式等。這些文件抓取下來后,需要把這些文件中的文本信息提取出來。準確提取這些文檔的信息,一方面對搜索引擎的搜索準確性有重要作用,另一方面對于搜索引擎爬蟲正確跟蹤其他鏈接也有一定的影響。

對于doc、pdf等由專業(yè)廠商提供的軟件生成的文檔,廠商都會提供相應的文本提取接口。搜索引擎爬蟲只需要調(diào)用這些插件的接口,就可以輕松地提取文檔中的文本信息和文件相關(guān)的其他信息。

HTML等文檔不一樣,HTML有一套自己的語法,通過不同的命令標識符來表示不同的字體、顏色、位置等版式,提取文本信息時需要把這些標識符都過濾掉。過濾標識符并非難事,因為這些標識符都有一定的規(guī)則,只要按照不同的標識符取得相應的信息即可。但在識別這些信息的時候,需要同步記錄許多版式信息,例如文字的字體大小、是否是標題、是否是加粗顯示、是否是頁面的關(guān)鍵詞等,這些信息有助于計算單詞在網(wǎng)頁中的重要程度。同時,對于HTML網(wǎng)頁來說,除了標題和正文以外,會有許多廣告鏈接以及公共的頻道鏈接,這些鏈接和文本正文一點關(guān)系也沒有,在提取網(wǎng)頁內(nèi)容的時候,也需要過濾這些無用的鏈接。例如某個網(wǎng)站有“產(chǎn)品介紹”頻道,因為導航條在網(wǎng)站內(nèi)每個網(wǎng)頁都有,若不過濾導航條鏈接,在搜索“產(chǎn)品介紹”的時候,則網(wǎng)站內(nèi)每個網(wǎng)頁都會搜索到,無疑會帶來大量垃圾信息。過濾這些無效鏈接需要統(tǒng)計大量的網(wǎng)頁結(jié)構(gòu)規(guī)律,抽取一些共性,統(tǒng)一過濾;對于一些重要而結(jié)果特殊的網(wǎng)站,還需要個別處理。這就需要搜索引擎爬蟲的設(shè)計有一定的擴展性。

對于多媒體、圖片等文件,一般是通過鏈接的錨文本(即鏈接文本)和相關(guān)的文件注釋來判斷這些文件的內(nèi)容。例如有一個鏈接文字為“故宮的照片”,其鏈接指向一張bmp格式的圖片,那么搜索引擎爬蟲就知道這張圖片的內(nèi)容是“故宮的照片”。這樣,在搜索“故宮”和“照片”的時候都能讓搜索引擎找到這張圖片。另外,許多多媒體文件中都有文件屬性,考慮這些屬性也可以更好地了解文件的內(nèi)容。

動態(tài)網(wǎng)頁一直是網(wǎng)絡(luò)蜘蛛面臨的難題。所謂動態(tài)網(wǎng)頁,是相對于靜態(tài)網(wǎng)頁而言的,是由程序自動生成的頁面,這樣的好處是可以快速統(tǒng)一更改網(wǎng)頁風格,也可以減少網(wǎng)頁所占服務器的空間,但同樣給網(wǎng)絡(luò)蜘蛛的抓取帶來一些麻煩。由于開發(fā)語言不斷增多,動態(tài)網(wǎng)頁的類型也越來越多,如asp、jsp、php等。這些類型的網(wǎng)頁對于搜索引擎爬蟲來說,可能還稍微容易一些。搜索引擎爬蟲比較難于處理的是一些腳本語言(如VBScript和JaVaScript)生成的網(wǎng)頁,如果要完善地處理好這些網(wǎng)頁,網(wǎng)絡(luò)蜘蛛需要有自己的腳本解釋程序。對于許多數(shù)據(jù)是放在數(shù)據(jù)庫的網(wǎng)站,需要通過本網(wǎng)站的數(shù)據(jù)庫搜索才能獲得信息,這樣給網(wǎng)絡(luò)蜘蛛的抓取帶來很大的困難。對于這類網(wǎng)站,如果網(wǎng)站設(shè)計者希望這些數(shù)據(jù)能被搜索引擎搜索,則需要提供一種可以遍歷整個數(shù)據(jù)庫內(nèi)容的方法。

對于網(wǎng)頁內(nèi)容的提取,一直是搜索引擎爬蟲中重要的技術(shù)。整個系統(tǒng)一般采用插件的形式,通過一個插件管理服務程序,遇到不同格式的網(wǎng)頁采用不同的插件處理。這種方式的好處在于擴充性好,以后每發(fā)現(xiàn)一種新的類型,就可以把其處理方式做成一個插件補充到插件管理服務程序中。

由于網(wǎng)站的內(nèi)容經(jīng)常在變化,因此搜索引擎爬蟲也需要不斷地更新其抓取網(wǎng)頁的內(nèi)容,這就需要搜索引擎爬蟲按照一定的周期去掃描網(wǎng)站,查看哪些頁面是需要更新的頁面,哪些頁面是新增頁面,哪些頁面是已經(jīng)過期的死鏈接。

搜索引擎的更新周期對搜索引擎搜索的查全率有很大影響。如果更新周期太長,則總會有一部分新生成的網(wǎng)頁搜索不到;周期過短,技術(shù)實現(xiàn)會有一定難度,而且會對帶寬、服務器的資源都有浪費。搜索引擎爬蟲并不是所有的網(wǎng)站都采用同一個周期進行更新,對于一些重要的更新量大的網(wǎng)站,更新的周期短,如有些新聞網(wǎng)站,幾個小時就更新一次;相反,對于一些不重要的網(wǎng)站,更新的周期就長,可能一兩個月才更新一次。

一般來說,搜索引擎爬蟲在更新網(wǎng)站內(nèi)容的時候,不用把網(wǎng)站網(wǎng)頁重新抓取一遍,對于大部分網(wǎng)頁,只需判斷網(wǎng)頁的屬性(主要是日期),把得到的屬性和上次抓取的屬性相比較,如果一樣則不用更新。

聯(lián)系我們
地址:深圳市龍崗區(qū) 龍城大道85號萬科龍崗云中心16層
13603054593
版權(quán)所有:深圳市西企網(wǎng)科技有限公司|抖音短視頻推廣_抖音短視頻運營_深圳SEO公司,技巧,效果怎么樣 粵ICP備15110110號
X

截屏,微信識別二維碼

微信號:13603054593

(點擊微信號復制,添加好友)

打開微信

主站蜘蛛池模板: 久久精品国产清高在天天线| 亚洲国产精品久久久久爰色欲 | 最近中文字幕在线mv视频在线| 久久天天躁狠狠躁夜夜| 超碰国产精品久久国产精品99| 国产精品怡红院在线观看| 天堂8在线天堂资源bt| 丁香狠狠色婷婷久久综合| 人妻少妇久久久久久97人妻| 内射夜晚在线观看| 亚洲av日韩av永久无码绿巨人| 亚洲中文久久久精品无码| 妓女爽爽爽爽爽妓女8888| 丁香五月亚洲春色| 少妇人妻偷人精品视频| 美女胸又www又黄的网站| 成人爽a毛片免费视频| 无码人妻一区二区三区精品视频 | 老太脱裤让老头玩ⅹxxxx| 内谢少妇xxxxx8老少交| 国产激情精品一区二区三区 | 国产手机在线精品| 男人的天堂免费a级毛片无码| 亚洲ⅴ国产v天堂a无码二区| 国产欧美日韩一区二区三区| 欧美自拍嘿咻内射在线观看| 亚洲s色大片在线观看| 国产精自产拍久久久久久蜜| 人妻人人添人妻人人爱| 国产一三四2021不卡| 久久狠狠高潮亚洲精品| 亚洲av永久无无码精品一区二区三区 | 免费国产黄网站在线观看视频| 色天使久久综合网天天| 又粗又黄又爽视频免费看| 亚洲美免无码中文字幕在线| 亚洲av永久无码天堂网毛片| 97久久香蕉国产线看观看| 亚洲欧美国产国产综合一区| 久久97久久97精品免视看秋霞| 国产裸体舞一区二区三区|