搜索引擎爬虫初次访问网站时,第一件事通常是寻找根目录下的 robots.txt 文件。这份纯文本文件扮演着"访客守则"的角色,明确告诉爬虫哪些路径可以收录、哪些区域需要回避。配置得当的 robots 文件,既能防止后台数据被检索,又能让爬虫的抓取配额用在刀刃上,提升重要页面的收录效率。
robots 文件必须放在网站根目录,例如 https://example.com/robots.txt。文件使用纯文本格式,一行一条指令,路径区分大小写,否则可能造成规则失效。
最常用的指令有四项:
参考一份常见配置:
User-agent: *
Disallow: /admin/
Allow: /admin/public/
Sitemap: https://example.com/sitemap.xml
这段配置的含义是:允许所有爬虫抓取网站主体,但屏蔽 /admin/ 目录,其中 /admin/public/ 子目录例外开放。需要留意的是,Allow 指令有兼容性限制,部分搜索引擎不识别,这种情况下 Disallow 规则依然约束爬虫,容易导致预期之外的屏蔽。
不同站点的运营目标不同,robots 配置思路也随之变化。下文列举三种典型情形及对应写法。
内容型站点或新上线网站,通常希望所有页面都被搜索引擎收录。此时配置最简:
User-agent: *
Disallow:
也可以直接省略 Disallow 行,爬虫默认放行全部内容。常见的错误是误写为 Disallow: /,这等于宣告全站禁止抓取,新站收录将长期停滞。
若不想让某个搜索引擎收录内容,可以为该爬虫单独建段:
User-agent: Bingbot
Disallow: /
这样其他搜索引擎的抓取不受影响。爬虫对应的名字需要查阅官方文档确认,例如 Googlebot、Baiduspider 等,写错名称会导致规则落空。
企业官网常常需隐藏后台入口、脚本目录和临时文件夹,同时让产品页正常被抓取。可以参考:
User-agent: *
Disallow: /admin/
Disallow: /includes/
Disallow: /temp/
这种写法简单直接,只要待保护的路径没有公共访问需求,就可以放心屏蔽。
robots 配置失败大多源于细节疏忽,这里列出最常见的五个坑:
建议每季度检查一次 robots 文件,尤其当网站改版、目录结构调整时,对照线上实际路径复核规则。
配置完成不等于万事大吉,需要借助工具验证规则是否符合预期。操作步骤如下:
这类工具还能发现语法错误和冗余规则,是上线前的最后一道闸门。
不影响。robots 文件只控制爬虫抓取与否,不参与权重计算。若页面被 Disallow 屏蔽,只能阻止爬虫抓取该页,不能阻止外部链接的权重传递。
有可能。robots 屏蔽只阻止全新抓取,已收录页面的缓存快照可能继续存活。若想彻底移除,还需结合 noindex 标签或搜索引擎的删除工具处理。
不是必须,但强烈建议。写入 Sitemap 声明后,爬虫能更快定位并抓取新页面,尤其适合内容更新频繁的站点。
robots.txt 配置虽然只有几行代码,却直接影响网站的收录效率和资源保护。建议先明确运营目标,再动手编写规则;上线前务必用官方工具验证,并定期复查。从最小化的 Disallow 规则开始,逐步增加屏蔽项,避免因过度限制而误伤正常页面的收录。