robotstxt怎么写好，网站栏目页的robotstxt文件的正确写法是什么啊

来源：整理时间：2024-05-04 09:00:26 编辑：网络营销手机版

本文目录一览

1，网站栏目页的robotstxt文件的正确写法是什么啊
2，robotstxt 这样写对不还有有更好的写法吗
3，新网站上线如何有效的设置robottxt文件robottxt文件怎样写更好
4，网站robotstxt文件怎么写
5，robotstxt文件是什么要怎么写
6，robotxtxt怎么写对网站优化有什么好处

1，网站栏目页的robotstxt文件的正确写法是什么啊

后台管理目录那个文件夹就不需要屏蔽了吧随便一个人看一下你的robots就暴露了地址

网站栏目页的robotstxt文件的正确写法是什么啊

2，robotstxt 这样写对不还有有更好的写法吗

不可以~第一行代表不允许蜘蛛抓取网站任何东西~赶紧改哦~

写错了呢 Disallow:/admin/ 后面要有斜杠呢

robotstxt 这样写对不还有有更好的写法吗

3，新网站上线如何有效的设置robottxt文件robottxt文件怎样写更好

robots.txt写作语法首先，我们来看一个robots.txt范例： #robots.txtfilestart#Robots.txtfilefrom http://www.361ku.com#AllrobotswillspiderthedomainUser-agent:*Disallow:/security/Disallow:/admin/Disallow:/admin.htm#Endrobots.txtfile 有#号的都是注释，方便阅读。User-agent就是搜索引擎的蜘蛛，后面用了*号，表示对所有的蜘蛛有效。Disallow就是表示不允许抓取，后面的目录或者文件，表示禁止抓取的范围。下面，我将列举一些robots.txt的具体用法：允许所有的robot访问User-agent:*Disallow:或者也可以建一个空文件"/robots.txt" 禁止所有搜索引擎访问网站的任何部分User-agent:*Disallow:/ 禁止所有搜索引擎访问网站的几个部分（下例中的01、02、03目录）User-agent:*Disallow:/01/Disallow:/02/Disallow:/03/ 禁止某个搜索引擎的访问（下例中的BadBot）User-agent:BadBotDisallow:/ 只允许某个搜索引擎的访问（下例中的Crawler）User-agent:CrawlerDisallow:

新网站上线如何有效的设置robottxt文件robottxt文件怎样写更好

4，网站robotstxt文件怎么写

我们可以建立一个空白的文本文档，命名为robots.txt放在网站的根目录下即可。robots.txt写法如下：User-agent: *Disallow:（这个是指不允许指定的搜索引擎抓去页面）或者User-agent: *Allow: /（这个是指允许指定的搜索引擎抓去页面）

搜索引擎机器人通过链接抵达互联网上的每个网页，并抓取网页信息。搜索引擎机器人在访问一个网站时，会首先检查该网站的根目录下是否有一个叫做 robots.txt的纯文本文件。当我们的网站有一些内容不想被搜索引擎收录，我们可以通过设置robots.txt文件告知搜索引擎机器人。如果网站上没有禁止搜索引擎收录的内容，则不用设置robots.txt文件，或设置为空。从seo的角度，robots.txt文件是一定要设置的，原因：网站上经常存在这种情况：不同的链接指向相似的网页内容。这不符合seo上讲的“网页内容互异性原则”。采用robots.txt文件可以屏蔽掉次要的链接。网站改版或时原来不符合搜索引擎友好的链接需要全部屏蔽掉。采用robots.txt文件删除旧的链接符合搜索引擎友好。一些没有关键词的页面，比如本站的这个页面，屏蔽掉更好。一般情况下，站内的搜索结果页面屏蔽掉更好。文章地址 http://www.jx0791-seo.com/index.php/archives/278转载请保留链接地址

5，robotstxt文件是什么要怎么写

举一个简单的例子：当一个搜索蜘蛛访问一个站点时，它会首先检查该站点根目录下是否存robots.txt，如果存在，搜索机器人就会按照该文件中的内容来确定访问的范围；如果该文件不存在，所有的搜索蜘蛛将能够访问网站上所有没有被口令保护的页面。常见的蜘蛛识别：google蜘蛛（Googlebot）、baidu蜘蛛（Baiduspider）、bing蜘蛛（MSNbot）、sousou蜘蛛（sosospider）robots.txt文件的写法User-agent: * 这里的*代表的所有的搜索引擎种类，*是一个通配符Disallow: /admin/ 这里定义是禁止爬寻admin目录下面的目录Disallow: /require/ 这里定义是禁止爬寻require目录下面的目录Disallow: /ABC/ 这里定义是禁止爬寻ABC目录下面的目录Disallow: /cgi-bin/*.htm 禁止访问/cgi-bin/目录下的所有以”.htm”为后缀的URL(包含子目录)。

搜索引擎机器人通过链接抵达互联网上的每个网页，并抓取网页信息。搜索引擎机器人在访问一个网站时，会首先检查该网站的根目录下是否有一个叫做 robots.txt的纯文本文件。当我们的网站有一些内容不想被搜索引擎收录，我们可以通过设置robots.txt文件告知搜索引擎机器人。如果网站上没有禁止搜索引擎收录的内容，则不用设置robots.txt文件，或设置为空。从seo的角度，robots.txt文件是一定要设置的，原因：网站上经常存在这种情况：不同的链接指向相似的网页内容。这不符合seo上讲的“网页内容互异性原则”。采用robots.txt文件可以屏蔽掉次要的链接。网站改版或时原来不符合搜索引擎友好的链接需要全部屏蔽掉。采用robots.txt文件删除旧的链接符合搜索引擎友好。一些没有关键词的页面，比如本站的这个页面，屏蔽掉更好。一般情况下，站内的搜索结果页面屏蔽掉更好。文章地址 <a href="http://wenwen.soso.com/z/urlalertpage.e?sp=shttp%3a%2f%2fwww.jx0791-seo.com%2findex.php%2farchives%2f278" target="_blank">http://www.jx0791-seo.com/index.php/archives/278</a>转载请保留链接地址

6，robotxtxt怎么写对网站优化有什么好处

下面把robots.txt正确写法分享给大家！我们先来了解一下什么是robots.txt？搜索引擎使用spider程序自动访问互联网上的网页并获取网页信息。spider在访问一个网站时，会首先会检查该网站的根域下是否有一个叫做robots.txt的纯文本文件。您可以在您的网站中创建一个纯文本文件robots.txt，在文件中声明该网站中不想被robot访问的部分或者指定搜索引擎只收录特定的部分。请注意，仅当您的网站包含不希望被搜索引擎收录的内容时，才需要使用robots.txt文件。如果您希望搜索引擎收录网站上所有内容，请勿建立robots.txt文件或者创建一个内容为空的robots.txt文件。robots.txt 放置位置robots.txt文件应该放置在网站根目录下。举例来说，当spider访问一个网站(比如http://www.ubangmang.com)时，首先会检查该网站中是否存在http://www.ubangmang.com/robots.txt这个文件，如果 Spider找到这个文件，它就会根据这个文件的内容，来确定它访问权限的范围。robots.txt 格式文件包含一条或更多的记录，这些记录通过空行分开(以CR,CR/NL, or NL作为结束符)，每一条记录的格式如下所示：”:”。在该文件中可以使用#进行注解。该文件中的记录通常以一行或多行User-agent开始，后面加上若干Disallow和Allow行,详细情况如下。User-agent:该项的值用于描述搜索引擎robot的名字。在”robots.txt”文件中，如果有多条User-agent记录说明有多个robot会受到”robots.txt”的限制，对该文件来说，至少要有一条User-agent记录。如果该项的值设为*，则对任何robot均有效，在”robots.txt”文件中，”User-agent:*”这样的记录只能有一条。如果在”robots.txt”文件中，加入”User-agent:SomeBot”和若干Disallow、Allow行，那么名为”SomeBot”只受到”User-agent:SomeBot”后面的 Disallow和Allow行的限制。 Disallow: 该项的值用于描述不希望被访问的一组URL，这个值可以是一条完整的路径，也可以是路径的非空前缀，以Disallow项的值开头的URL不会被robot访问。例如”Disallow: /help”禁止robot访问/help*.html、/help/index.html，而”Disallow: /help/”则允许robot访问/help*.html，不能访问/help/index.html。"Disallow:"说明允许robot访问该网站的所有url，在”/robots.txt”文件中，至少要有一条Disallow记录。如果”/robots.txt”不存在或者为空文件，则对于所有的搜索引擎robot，该网站都是开放的。Allow:该项的值用于描述希望被访问的一组URL，与Disallow项相似，这个值可以是一条完整的路径，也可以是路径的前缀，以Allow项的值开头的URL是允许robot访问的。例如”Allow:/hibaidu”允许robot访问/hibaidu.htm、/hibaiducom.html、/hibaidu/com.html。一个网站的所有URL默认是Allow的，所以Allow通常与Disallow搭配使用，实现允许访问一部分网页同时禁止访问其它所有URL的功能。需要特别注意的是Disallow与Allow行的顺序是有意义的，robot会根据第一个匹配成功的 Allow或Disallow行确定是否访问某个URL。使用”*”和”$”： Baiduspider 支持使用通配符”*”和”$”来模糊匹配url。 “$” 匹配行结束符。 “*” 匹配0或多个任意字符。robots.txt文件用法举例：1. 允许所有的robot访问User-agent: * Allow: / 或者 User-agent: * Disallow:2. 禁止所有搜索引擎访问网站的任何部分User-agent: *Disallow: /3. 仅禁止Baiduspider访问您的网站User-agent: BaiduspiderDisallow: /4. 仅允许Baiduspider访问您的网站User-agent: BaiduspiderDisallow:5. 禁止spider访问特定目录User-agent: *Disallow: /cgi-bin/Disallow: /tmp/Disallow: /~joe/6. 允许访问特定目录中的部分urlUser-agent: *Allow: /cgi-bin/seeAllow: /tmp/hiAllow: /~joe/lookDisallow: /cgi-bin/Disallow: /tmp/Disallow: /~joe/7. 使用”*”限制访问url禁止访问/cgi-bin/目录下的所有以”.htm”为后缀的URL(包含子目录)。User-agent: *Disallow: /cgi-bin/*.htm8. 使用”$”限制访问url仅允许访问以”.htm”为后缀的URL。User-agent: *Allow: .htm$Disallow: /例9. 禁止访问网站中所有的动态页面User-agent: *Disallow: /*?*10. 禁止Baiduspider抓取网站上所有图片仅允许抓取网页，禁止抓取任何图片。User-agent: BaiduspiderDisallow: .jpg$Disallow: .jpeg$Disallow: .gif$Disallow: .png$Disallow: .bmp$11. 仅允许Baiduspider抓取网页和.gif格式图片允许抓取网页和gif格式图片，不允许抓取其他格式图片User-agent: BaiduspiderAllow: .gif$Disallow: .jpg$Disallow: .jpeg$Disallow: .png$Disallow: .bmp$12. 仅禁止Baiduspider抓取.jpg格式图片User-agent: BaiduspiderDisallow: .jpg$一般这个在网站未上线前使用，等网站做好之后就把这个协议去掉了，便于搜索引擎的抓取。

搜索引擎通过一种程序robot（又称spider），自动访问互联网上的网页并获取网页信息。您可以在您的网站中创建一个纯文本文件robots.txt，在这个文件中声明该网站中不想被robot 访问的部分，这样，该网站的部分或全部内容就可以不被搜索引擎收录了，或者指定搜索引擎只收录指定的内容。

robots.txt文件的格式robots文件往往放置于根目录下，包含一条或更多的记录，这些记录通过空行分开（以CR,CR/NL, or NL作为结束符），每一条记录的格式如下所示：":" 在该文件中可以使用#进行注解，具体使用方法和UNIX中的惯例一样。该文件中的记录通常以一行或多行User-agent开始，后面加上若干Disallow和Allow行,详细情况如下： User-agent:该项的值用于描述搜索引擎robot的名字。在"robots.txt"文件中，如果有多条User-agent记录说明有多个robot会受到"robots.txt"的限制，对该文件来说，至少要有一条User-agent记录。如果该项的值设为*，则对任何robot均有效，在"robots.txt"文件中，"User-agent:*"这样的记录只能有一条。如果在"robots.txt"文件中，加入"User-agent:SomeBot"和若干Disallow、Allow行，那么名为"SomeBot"只受到"User-agent:SomeBot"后面的 Disallow和Allow行的限制。 Disallow:该项的值用于描述不希望被访问的一组URL，这个值可以是一条完整的路径，也可以是路径的非空前缀，以Disallow项的值开头的URL不会被 robot访问。例如"Disallow:/help"禁止robot访问/help.html、/helpabc.html、/help/index.html，而"Disallow:/help/"则允许robot访问/help.html、/helpabc.html，不能访问/help/index.html。"Disallow:"说明允许robot访问该网站的所有url，在"/robots.txt"文件中，至少要有一条Disallow记录。如果"/robots.txt"不存在或者为空文件，则对于所有的搜索引擎robot，该网站都是开放的。 Allow:该项的值用于描述希望被访问的一组URL，与Disallow项相似，这个值可以是一条完整的路径，也可以是路径的前缀，以Allow项的值开头的URL 是允许robot访问的。例如"Allow:/hibaidu"允许robot访问/hibaidu.htm、/hibaiducom.html、/hibaidu/com.html。一个网站的所有URL默认是Allow的，所以Allow通常与Disallow搭配使用，实现允许访问一部分网页同时禁止访问其它所有URL的功能。具体的百度给出的官方的要求http://zhanzhang.baidu.com/college/courseinfo?id=267&page=12