Robots.txt 是网站与搜索引擎爬虫之间的一纸协议,通过它你可以明确告知爬虫哪些区域欢迎访问,哪些区域请止步。一份配置得当的 robots.txt 不仅能保护后台、用户隐私等敏感信息不被收录,还能大幅减少无效抓取对服务器资源的消耗,让爬虫集中精力索引你真正想推广的核心内容。下面我们就从最基础的语法开始,一步步掌握它的配置技巧。
robots.txt 文件必须存放在域名根目录下,通常直接命名为 robots.txt。文件内容由多条指令记录组成,每条记录以 User-agent 行开始,后跟若干规则行。
核心字段的含义如下:
一个最简单的「全开放」配置示例如下:
User-agent: * Disallow: Sitemap: https://www.example.com/sitemap.xml这段代码意思是:所有爬虫可抓取全站内容,并向它们提供了地图入口。
根据网站不同模块的开放策略,采用的配置写法也有所差异。以下列举几个高频场景供参考。
当网站处于维护模式或开发测试阶段,需要屏蔽所有搜索引擎时,只需配置一条规则:
User-agent: * Disallow: /设置完成后,可通过浏览器访问 robots.txt 文件检查是否返回正确内容。需要注意的是,此操作会使已收录的页面暂时从搜索结果中减少展示,恢复后需及时撤销。
若只想阻止爬虫访问后台管理、用户中心或临时文件夹,可精准定义禁止的路径,例如:
User-agent: * Disallow: /admin/ Disallow: /user/ Allow: /news/这里需要特别提醒:如果爬虫不支持 Allow 指令,它可能会忽略你的例外规则。最稳妥的办法是只在 Disallow 中写出要屏蔽的路径,其余路径默认可抓,而不是先禁用全部再去例外。
有些爬虫抓取频率高,有些则比较克制。我们可以为它们制定不同策略,例如给 Googlebot 开放全部权限,却禁止 Bing 抓取图片资源:
User-agent: Googlebot Allow: / User-agent: Bingbot Disallow: /images/ Disallow: /assets/书写顺序极其重要:必须先写特定爬虫的专属规则,最后再写通用规则。爬虫在读取文件时会寻找与自己名称匹配的段落并忽略之后的通用段,因此顺序颠倒会造成规则失效。
很多站点因 robots.txt 书写不顺或理解偏差,导致 SEO 效果打折。以下几个细节值得你在发布前逐一核对。
文件上线前,强烈建议先进行验证。可以通过搜索引擎官方的抓取诊断工具(如 Google Search Console 的 robots.txt 测试器)来模拟指定爬虫的抓取结果,确认封禁路径符合预期。同时,也不要忘记在站点发生结构性改版(如目录迁移、页面删除)时同步更新该文件,防止过期规则影响新页面的收录效率。
在同一 User-agent 段内,规则遵循「最具体匹配优先级最高」的原则。当具体路径出现冲突时,Allow 或 Disallow 按字符长度决定胜负,更长的路径优先。若长度相同,则 Allow 指令优先于 Disallow。
只需将 Disallow: / 这行删除,或者改为 Disallow:(留空),保存后将更新后的文件上传覆盖即可。恢复通常在数小时到一天内生效,建议之后在 Search Console 提交对应页面的索引请求以加速。
路径写法应遵循实际访问 URL 的相对地址。例如需要屏蔽「https://example.com/forum/user/profile/」,则写 Disallow: /forum/user/profile/。不需要带上域名或协议,且结尾最好保留斜杠来明确表示目录。
写好 robots.txt 的关键在于明确你的开放边界:优先采用「默认放行、精准屏蔽」的思路,严格遵循先特殊后通用的段落顺序,并在上线后通过工具验证效果。建议将这份文件视为站内 SEO 巡检清单的一项固定内容,每季度检查一次,确保它始终服务于当下的运营策略。如果本身是小型站点,路径结构简单,维护成本其实很低,但带来的收录效益却相当明显。