robots.txt配置全解——2026年哪些爬虫该放行,哪些该拦

王尘宇 网站优化 7

robots.txt配置全解——2026年哪些爬虫该放行,哪些该拦-第1张图片-王尘宇

上个月有个客户的站三个月没收录,我登录服务器一查,robots.txt里躺着一行Disallow: /,等于把全世界的爬虫都关在门外了。问是谁加的,说是一个「优化师」教他加的,防止别人采集。防采集成防到连百度都不让进,这就是robots.txt用错的典型。

先讲清楚robots.txt是干嘛的。它放在网站根目录,是一份给爬虫看的「允许、禁止清单」,本身不是安全机制,拦不住真正的恶意访问,只对守规矩的搜索引擎爬虫有效。写法也简单:User-agent指定谁,Disallow指定不能爬什么。

几个最常见的坑。第一是路径写错,比如该写Disallow: /admin/却写成了Disallow: admin,规则就不生效或者误伤。第二是把自己人拦了,有人把整站Disallow了还奇怪为什么不收录。第三是图片目录被一刀切,很多站Disallow了/uploads,结果图片搜索一个都不收录,白丢流量。

2026年最值得琢磨的是AI爬虫。GPTBot、Bytespider(字节)、ClaudeBot这些AI公司的大模型爬虫,会来抓你网站喂给大模型。想保护原创内容的,可以单独把它们Disallow掉;但你要是靠AI搜索引流的,建议放行,甚至要确保它们能顺畅抓到你——被ChatGPT、豆包引用,本身就是免费的流量。两难,看你要哪头。

我自己的做法是:给普通搜索引擎全部放行,给AI爬虫里的GPTBot和ClaudeBot也放行(我的内容欢迎被引用),只把广告类的UA拦掉。改了robots.txt以后,一定去百度站长平台的抓取诊断、Google的robots测试工具里验证一遍,别改完就以为万事大吉。

最后强调一句:robots.txt是白名单式的合作文件,别指望它防盗、防采集。真要防,靠的是服务器层面的访问控制,而不是这个文本文件。

标签: robots.txt SEO AI爬虫

发布评论 0条评论)

  • Refresh code

还木有评论哦,快来抢沙发吧~