对于所有站长来说,robots.txt再也是熟悉不过了,我们平时做站都会用上robots.txt,对于菜鸟来说也要懂得robots.txt怎么写.同时还要注意robots.txt格式等等.
robots.txt基本介绍
robots.txt文件必须放置在一个站点的根目录下,而且文件名必须全部小写。robots.txt是一个纯文本文件,在这个文件中网站管理者可以声明该网站中不想被robots访问的部分,或者指定搜索引擎只收录指定的内容。通俗地说,是用robots.txt来告诉给搜索引擎知,这个网站哪些地方可以爬行抓取,哪些地方不可以到达,也可以通过robots.txt来阻所有搜索引擎抓取网站的所有内容.当一个搜索机器人(有的叫搜索蜘蛛)访问一个站点时,它会首先检查该站点根目录下是否存在robots.txt,如果存在,搜索机器人就会按照该文件中的内容来确定访问的范围;如果该文件不存在,那么搜索机器人就沿着链接抓取。robots.txt写作语法
首先,我们来看一个robots.txt范例:http://www.seo020.org/robots.txt(广州seo老牛的博客)
访问以上具体地址,我们可以看到robots.txt的具体内容如下:
User-agent: *
Disallow: /seo-news/
Disallow: /wlyx/
Disallow: /seo-case/具体语法分析:其中#后面文字为说明信息;User-agent:后面为搜索机器人的名称,后面如果是*,则泛指所有的搜索机器人;Disallow:后面为不允许访问的文件目录。
所以我们平时在网站还没有做好前会这样写
User-agent: *
Disallow: /
这样是要禁止所有搜索引擎访问网站的所有内容.但是有些私隐的目录想通过robots.txt阻止搜索引擎的访问,我们可以我样写
User-agent: *
Disallow: /01/
Disallow: /02/
Disallow: /03/
其中01,02,03是指目录
有时禁止某个搜索引擎的访问(下例中的BadBot)
User-agent: BadBot
Disallow: /
或者只允许某个搜索引擎的访问(下例中的Crawler)
User-agent: Crawler
Disallow:User-agent: *
Disallow: /
注意常见的robots.txt文件错误写法
1颠倒了顺序: 错误写成
User-agent: *
Disallow: GoogleBot
正确的是:
User-agent: GoogleBot
Disallow: *
2把多个禁止命令放在一行中:
例如,错误地写成
Disallow: /css/ /cgi-bin/ /images/
正确的应该是
Disallow: /css/
Disallow: /cgi-bin/
Disallow: /images/
3行前有大量空格
例如写成
Disallow: /cgi-bin/
尽管在标准没有谈到这个,但是这种方式很容易出问题。
4 404重定向到另外一个页面:
当Robot访问很多没有设置robots.txt文件的站点时,会被自动404重定向到另外一个Html页面。这时Robot常常会以处理robots.txt文件的方式处理这个Html页面文件。虽然一般这样没有什么问题,但是最好能放一个空白的robots.txt文件在站点根目录下。5采用大写。例如
USER-AGENT: EXCITE
DISALLOW:
虽然标准是没有大小写的,但是目录和文件名应该小写:
user-agent:GoogleBot
disallow:
6语法中只有Disallow,没有Allow!
错误的写法是:
User-agent: Baiduspider
Disallow: /john/
allow: /jane/
7忘记了斜杠/
错误的写做:
User-agent: Baiduspider
Disallow: css
正确的应该是
User-agent: Baiduspider
Disallow: /css/
通过以上的robots.txt文件详解,相信再菜的鸟也不菜了,再也不用问人robots.txt 怎么写怎么写了.虽然不是什么高含量技术,但也是要懂得的基本知识.广州seo老牛祝你成为一个robots.txt制作高手.
◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。
