Categories


Tags


robots.txt:如何让搜索引擎不要抓取没用的页面

| 什么是robots文件?

Robots是站点与spider沟通的重要渠道,是网站与搜索引擎爬虫之间的协议,告知哪些可抓取哪些不允许。

| 为什么要做robots文件?

网站上总有一些页面是禁止蜘蛛抓取的。例如:搜索页面、筛选页面、后台登录地址等。

| 如何制作 robots文件?

编写robots.txt文件并上传到网站根目录。

| 制作 robots.txt注意事项

● 所有搜索引擎则用星号表示

● Allow(允许)和Disallow(不允许)优先级

● 至少屏蔽一个,可以屏蔽:搜索结果页面/404页面

● 记得将sitemap放到Robots文件中

● 可以陆续放入更多,而不是一次性决定所有

● 网站后台地址/图片地址/下载文件地址/错误链接(搜外网)


Public @ 2019-03-13 16:09:27

从基础到精通:认识网站301重定向的那些事

301重定向是一种常见的网站管理技术,它允许网站管理员将一个页面的URL重定向到另一个页面的URL上。这种技术的主要目的是帮助网站维护者将旧的、无用的或已删除的网页指向新的、有用的或更新的网页上,从而保证网站上的链接和搜索结果都能得到正确的指引。 以下是关于301重定向的一些基础知识: 1. 301重定向与302重定向的区别 301重定向是一种永久重定向,它会告诉搜索引擎和其他网站,被重定向

Public @ 2023-06-06 03:50:30

什么是死链接?

死链接是指指向不存在或已经被删除的页面或资源的超链接。在网页中,通常用超链接将不同页面或资源相互连接起来,但如果这些链接指向的页面或资源已经不存在,点击这些链接后将无法访问到相关的信息,这就是死链接。死链接不仅会影响用户体验,还会降低网站的搜索引擎排名。

Public @ 2023-04-27 16:50:10

巧用Robots避免蜘蛛黑洞

对于百度搜索引擎来说,蜘蛛黑洞特指网站通过极低的成本制造出大量参数过多,及内容雷同但具体参数不同的动态URL ,就像一个无限循环的“黑洞”将spider困住,Baiduspider浪费了大量资源抓取的却是无效网页。比如很多网站都有筛选功能,通过筛选功能产生的网页经常会被搜索引擎大量抓取,而这其中很大一部分检索价值不高,如“500-1000之间价格的租房”,首先网站(包括现实中)上基本没有相关资源,

Public @ 2020-05-11 16:08:55

关于robots.txt的二三事

1. Robots.txt是一个协议,用于控制搜索引擎爬虫的访问范围。 2. Robots.txt文件位于网站的根目录下,包含了一些指令告诉爬虫哪些页面可以访问,哪些页面需要限制访问。 3. Robots.txt文件并不会阻止所有爬虫的访问,只有支持Robots.txt协议的爬虫才会遵守文件中的指令。 4. Robots.txt文件中的指令可以根据不同的爬虫进行个性化设置,可以控制不同爬虫访

Public @ 2023-04-11 13:00:34

更多您感兴趣的搜索

0.729427s