首先要了解概念。何為robots,robots.txt是一個(gè)純文本文件,用于聲明該網(wǎng)站中不想被蜘蛛訪(fǎng)問(wèn)的部分,或者指定蜘蛛抓取的部分。簡(jiǎn)而言之,robots.txt不是規定,而是一種約定,需要蜘蛛自覺(jué)遵守的一種習俗。
當蜘蛛訪(fǎng)問(wèn)一個(gè)站點(diǎn)時(shí),它會(huì )首先檢查該站點(diǎn)是否存在robots.txt。如果找到,蜘蛛就會(huì )按照該文件中的內容來(lái)確定抓取的范圍,如果該文件不存在,那么蜘蛛就沿著(zhù)鏈接直接抓取。
robots.txt的存在路徑:放置在一個(gè)站點(diǎn)的根目錄下,而且文件名必須全部小寫(xiě)。
robots的常見(jiàn)語(yǔ)法:
User-agent:*
是針對哪個(gè)搜索引擎蜘蛛。這里的*代表搜索引擎,*是通配符。
Allow
定義的是允許蜘蛛抓取某個(gè)欄目或文件
Allow:/cgi-bin/
這里定義的是允許訪(fǎng)問(wèn)cgi-bin目錄
Allow:/* .htm$
允許訪(fǎng)問(wèn)以“。htm”為后綴的URL,$指的是匹配行結束符,*指的是匹配任何字符。
Disallow
定義的是禁止蜘蛛抓取某個(gè)欄目或文件
Disallow:/admin/
這里定義是禁止抓取admin目錄
Disallow:/cgi-bin/*.htm
禁止抓取/cgi-bin/目錄下的所有以“。htm”為后綴的URL
Disallow:/*?*
禁止抓取網(wǎng)站中所有包含問(wèn)號“?”的網(wǎng)址
robots.txt的用法
sitemap:http://www.google.com/sitemap.xml
sitemap:URL全稱(chēng)(包含http://部分)
是告訴搜索引擎蜘蛛這個(gè)頁(yè)面是網(wǎng)站地圖。
補充:
robots.txt不能刪除搜索引擎中已收錄的頁(yè)面,但robots meta標簽可以解決這個(gè)問(wèn)題。
robots.txt文件主要是限制整個(gè)站點(diǎn)或者目錄的蜘蛛訪(fǎng)問(wèn)情況,而robots meta標簽主要是針對某個(gè)具體的頁(yè)面。
如:<meta name=“robots”content=“index,follow”>
robots meta標簽語(yǔ)法
name=“robots”表示所有的搜索引擎,可以針對某個(gè)具體搜索引擎寫(xiě)為name=“Baiduspider”
content部分有四個(gè)指令,以英文逗號隔開(kāi)
index指令告訴蜘蛛可以抓取該頁(yè)面
follow指令表示蜘蛛可以爬行該頁(yè)面上的鏈接
共有四種組合:
<meta name=“robots”content=“index,follow”>
<meta name=“robots”content=“noindex,follow”>
<meta name=“robots”content=“index,nofollow”>
<meta name=“robots”content=“noindex,nofollow”>
特殊寫(xiě)法:
<meta name=“robots”content=“index,follow”>可以寫(xiě)成<meta name=“robots”content=“all”>
<meta name=“robots”content=“noindex,nofollow”>可以寫(xiě)成<meta name=“robots”content=“none”>
網(wǎng)站地圖的制作,在織夢(mèng)后臺可以生成。另外還可以用到老虎地圖工具,用工具去生成。方法可以在工具介紹里查詢(xún)。