搜外网>搜外问答>问答页面

Robots文件应该屏蔽网站的哪些文件?

你们Robots文件都是怎么写的,都会屏蔽哪些文件?

追加问题
    12 人参与回答
台臣阀门15900660770 等 1 人赞同该回答

网站的后台登录地址,有些隐私的系统等等,这些都是要屏蔽的,主要涉及到安全和不想给用户看到的内容

naiyanwu
naiya · C形臂_动态平板DR_动态平板胃肠机_宠物DR_口腔CBCT。 www. puai999. com

自己选择不想要让蜘蛛抓取的地方,一般会选择图片。

我都没有屏蔽,

<p>一、什么是Robots.txt</p><p>查找引擎运用spider程序主动拜访<a href=" target="_blank" data-url=" class="show-5118-data" rel="Nofollow">互联网</a>上的页面并获取页面信息。spider在拜访一个网站时,会首先会查看该网站的根域下是不是有一个叫做 robots.txt的纯文本文件,这个文件用于指定spider在您网站上的抓取规划。您能够在您的网站中创立一个robots.txt,在文件中声明 该网站中不想被查找引擎录入的有些或许指定查找引擎只录入特定的有些。</p><p>二、robots.txt文件对网站有啥优点</p><p>1、疾速增加网站权重和拜访量;</p><p>2、制止某些文件被查找引擎索引,能够节约服务器带宽和网站拜访速度;</p><p>3、为查找引擎供给一个简洁明了的索引环境</p><p>三、哪些网站的目录需求运用robots.txt文件制止抓取</p><p>1)、图像目录</p><p>图像是构成网站的首要组成元素。跟着现在建站越来越便利,许多CMS的呈现,真实做到了会打字就会建网站,而正是由于如此便利,网上呈现了许多的同质化模板网站,被重复运用,这样的网站查找引擎是必定不喜爱的,就算是你的网站被录入了,那你的作用也是很差的。若是你非要用这种网站的话,主张你大概在robots.txt文件中进行屏蔽,一般的网站图像目录是:imags 或许 img;</p><p>2)、网站模板目录</p><p>如上面 图像目录 中所说,cms的强大和灵敏,也致使了许多同质化的网站模板的呈现和乱用,高度的重复性模板在查找引擎中形成了一种冗余,且模板文件常常与生成文件高度类似,相同易形成相同内容的呈现。对查找引擎很不友爱,严峻的直接被查找引擎打入冷宫,不得翻身,许多cms有具有独立的模板寄存目录,因而,大概进行模板目录的屏蔽。一般模板目录的文件目录是:templets</p><p>3)、css、JS目录的屏蔽</p><p>css目录文件在查找引擎的抓取中没有用途,也无法供给有价值的信息。所以强烈主张在robots.txt文件中将其进行屏蔽,以进步查找引擎的索引质量。为查找引擎供给一个简洁明了的索引环境更易晋升网站友爱性。css款式的目录一般情况下是:css 或许 style</p><p>js文件在查找引擎中无法进行辨认,这里仅仅主张,能够对其进行屏蔽,这样做也有一个优点:为查找引擎供给一个简洁明了的索引环境;</p><p>4)、屏蔽双页面的内容</p><p>这里拿dedecms来举例吧。我们都晓得dedecms能够运用静态和动态url进行同一篇内容的拜访,若是你生成全站静态了,那你有必要屏蔽动态地址的url连接。这里有两个优点:1、查找引擎对静态的url比动态的url更友爱、更简单录入;2、避免静态、动态url能拜访同一篇文章而被查找引擎判为重复内容。这样做对查找引擎友爱性来说是有益无害的。</p><p>5)、模板缓存目录</p><p>许多cms程序都有缓存目录,这种缓存目录的优点我想不用说我们也明白了吧,能够十分有用的晋升网站的拜访速度,削减网站带宽,对用户体会也是极好的。不过,这样的缓存目录也有必定的缺陷,那就是会让查找引擎进行重复的抓取,一个网站中内容重复也是大祭,对网站百害而无一利。许多运用cms建站的兄弟都没有注意到,有必要要导致注重。</p><p>6)被删去的目录</p><p>死链过多,对查找引擎<a href=" target="_blank" data-url=" class="show-5118-data" rel="nofollow">优化</a>来说,是丧命的。不能不导致<a href=" target="_blank" data-url=" class="show-5118-data" rel="nofollow">站长</a>的高度注重,。在网站的开展过程中,目录的删去和调整是不可避免的,若是你的网站当时目录不存在了,那有必要对此目录进行robots屏蔽,并回来正确的404过错页面(注意:在IIS中,有的兄弟在设置404过错的时分,设置存在疑问,在自定义过错页面一项中,404过错的正确设置大概是挑选:默认值 或许 文件,而不大概是:url,以避免查找引擎回来200的状况码。至于怎样设置,网上教程许多,我们要吧查找一下)</p><p>这里有一个争议性的疑问,关于网站后台办理目录是不是需求进行屏蔽,其实这个可有可无。在能确保网站安全的情况下,若是你的网站运营规划较小,就算网站目录呈现在robots.txt文件中,也没有多大疑问,这个我也见过许多网站这样设置的;但若是你的网站运营规划较大,对手过多,强烈主张千万别呈现网站后台管理目录的信息,以防被心怀叵测的人使用,危害你的利益;引擎越来越智能,关于网站的管理目录仍是能极好的辨认,并抛弃索引的。别的,我们在做网站后台的时分,也能够在页面元标签中增加:进行查找引擎的屏蔽抓取。</p><p>四、robots.txt的基本语法</p><p>内容项的基本格式:键: 值对。</p><p>1) User-Agent键</p><p>后面的内容对应的是各个具体的搜索引擎爬行器的名称。如百度是Baiduspider,谷歌是Googlebot。</p><p>一般我们这样写:</p><p>User-Agent: </p><p>表示允许所有搜索引擎蜘蛛来爬行抓取。如果只想让某一个搜索引擎蜘蛛来爬行,在后面列出名字即可。如果是多个,则重复写。</p><p>注意:User-Agent:后面要有一个空格。</p><p>在robots.txt中,键后面加:号,后面必有一个空格,和值相区分开。</p><p>2)Disallow键</p><p>该键用来说明不允许搜索引擎蜘蛛抓取的URL路径。</p><p>例如:Disallow: / 禁止网站文件</p><p>Allow键</p><p>该键说明允许搜索引擎蜘蛛爬行的URL路径</p><p>例如:Allow: / 允许网站的><p>通配符</p><p>代表任意多个字符</p><p>例如:Disallow: /.jpg 网站所有的jpg文件被禁止了。</p><p>结束符$</p><p>表示以前面字符结束的url。</p><p>例如:Disallow: /?$ 网站所有以?结尾的文件被禁止。</p><p>五、robots.txt实例分析</p><p>例1. 禁止所有搜索引擎访问网站的任何部分</p><p>User-agent: *</p><p>Disallow: /</p><p>例2. 允许所有的搜索引擎访问网站的任何部分</p><p>User-agent: *</p><p>Disallow:</p><p>例3. 仅禁止Baiduspider访问您的网站</p><p>User-agent: Baiduspider</p><p>Disallow: /</p><p>例4. 仅允许Baiduspider访问您的网站</p><p>User-agent: Baiduspider</p><p>Disallow:</p><p>例5. 禁止spider访问特定目录</p><p>User-agent: *</p><p>Disallow: /cgi-bin/</p><p>Disallow: /tmp/</p><p>Disallow: /data/</p><p>注意事项:1)三个目录要分别写。2)请注意最后要带斜杠。3)带斜杠与不带斜杠的区别。</p><p>例6. 允许访问特定目录中的部分url</p><p>我希望a目录下只有允许访问,怎么写?</p><p>User-agent: *</p><p>Allow: /a/><p>Disallow: /a/</p><p>注:允许收录优先级要高于禁止收录。</p><p>从例7开始说明通配符的使用。通配符包括(“$” 结束符;</p><p>“”任意符)</p><p>例7. 禁止访问网站中所有的动态页面</p><p>User-agent: </p><p>Disallow: /?</p><p>例8. 禁止搜索引擎抓取网站上所有图片</p><p>User-agent: *</p><p>Disallow: /.jpg$</p><p>Disallow: /.jpeg$</p><p>Disallow: /.gif$</p><p>Disallow: /.png$</p><p>Disallow: /.bmp$</p><p></p><p>其他很多情况呢,需要具体情况具体分析。只要你了解了这些语法规则以及通配符的使用,相信很多情况是可以解决的。</p>

满堂红空间印象
满堂红空间 · 山西满堂红

把系统的后台屏蔽,此外自己不想展示的内容也可以屏蔽。

后台

武荣网络
武荣网络 · 网站建设/仿站、美团点评运营、云服务器、DIY小程序、网站优化(SEO)、竞价托管(SEM)、网络推广。☛☞

一般屏蔽:网站后台、系统文件等不要搜索引擎抓取的目录就可以了

基本上没用

其实没什么可屏蔽的,大概都是网站的各种目录,如模板目录,缓存目录,JS css目录等,最重要的是把网站地图放进去,基本就可以了,网上搜出来的答案千篇一律,也许把你看晕了,最好的方式,找个优秀同行站,调成他的Robots文件,看人家怎么写的就行

钱路子
钱路子 · 网赚站长,网站:钱路子博客 免费手赚项目☞☞☞

我也没有

无限网赚
无限网赚 · 只是一个草根站长,啥也不是!空余时间回答一下问题。

百度搜!

八点半
八点半 · 阿鹏博客

好像我都没有用

SEO培训招生中
189