robots文件生成

robots.txt是什么文件？
搜索引擎通过一种程序"蜘蛛"(又称spider)，自动访问互联网上的网页并获取网页信息。您可以在您的网站中创建一个纯文本文件robots.txt，在这个文件中声明该网站中不想被蜘蛛访问的部分，这样，该网站的部分或全部内容就可以不被搜索引擎访问和收录了，或者可以通过robots.txt指定使搜索引擎只收录指定的内容。搜索引擎爬行网站第一个访问的文件就是robots.txt。

请详细介绍robots.txt文件？
文件位置
robots.txt文件应该放在网站根目录下。举例来说，当搜索引擎访问一个网站时，首先会检查该网站中是否存在robots.txt这个文件，如果robots机器人程序找到这个文件，它就会根据这个文件的内容，来确定它访问权限的范围。wordpress的robots文件位置没在wordpress网站根节目上传过robots.txt,当搜寻引擎和用户拜访某个文件时，wordpress程序会主动生成一个robots.txt给搜寻引擎和用户;若是我们上传编写的robots.txt到网站根节目，用户和搜寻引擎蛛蛛拜访的就是我们上传的文件，wordpress就不会再产生那个文件了。只有服务器找不到robots的时候wordpress才会生成这个文件。
文件格式
"robots.txt"文件包含一条或多条记录，这些记录通过空行分开(以CR、CR/NL、or NL作为结束符)，每一条记录的格式如下所示:"<field>:<optionalspace><value><optionalspace>"在该文件中可以使用#进行注释，具体使用方法和UNIX中的惯例一样。该文件中的记录通常以一行或多行User-agent开始，后面加上若干Disallow行，详细情况如下:User-agent:该项的值用于描述搜索引擎机器人robot的名字。在"robots.txt"文件中，如果有多条 User-agent记录，说明有多个robot会受到该协议的约束。所以，"robots.txt"文件中至少要有一条User- agent记录。如果该项的值设为*(通配符)，则该协议对任何搜索引擎机器人均有效。在"robots.txt"文件中，"User-agent:*"这样的记录只能有一条。Disallow:该项的值用于描述不希望被访问到的一个URL，这个URL可以是一条完整的路径，也可以是部分的，任何以Disallow开头的URL均不会被robot访问到。例如:"Disallow: /help"对/help.html 和/help/index.html都不允许搜索引擎访问，而"Disallow: /help/"则允许robot访问/help.html，而不能访问/help/index.html。任何一条Disallow记录为空，说明该网站的所有部分都允许被访问，在 "/robots.txt"文件中，至少要有一条Disallow记录。如果"/robots.txt"是一个空文件，则对于所有的搜索引擎robot，该网站都是开放的。
一般屏蔽
屏蔽隐私页面，后台登陆页面，缓存页面，图片目录，css目录，模板页面，屏蔽双页面的内容，同时可以屏蔽一些质量比较差的页面，例如金网的所有会员用户空间页面，dz的动态链接也可以设置屏蔽。通过Disallow:命令来进行设置。