让价值共享,记录我们发展脚步,也让您获取知识
在GEO时代,技术SEO的第一道关卡不是速度,而是权限。很多网站流量莫名其妙下滑,不是因为内容变差了,而是因为在不知情的情况下,在robots.txt里把AI的“信使”挡在了门外。

Robots协议早在2022年就已由IETF标准化为RFC 9309。不同的AI服务商拥有不同的爬虫User-Agent,它们的用途也各不相同,主要体现在三个层面:训练模型、实时搜索、用户直接访问。
以下是需要重点关注的“AI访客”名单:
OpenAI系(ChatGPT):GPTBot(训练)、OAI-SearchBot(搜索)、ChatGPT-User(用户实时访问)。
Google系:Google-Extended(专用于AI训练,与普通收录分开控制)、Googlebot(传统搜索)。
Perplexity:PerplexityBot。
Anthropic(Claude):ClaudeBot。
国内大厂:字节跳动的Bytespider(豆包)、百度的Baiduspider(文心)。
风险点: 很多网站为了节省服务器资源,会统一禁止所有不明爬虫。但如果在User-agent: * Disallow: /的规则下没有显式放行上述AI爬虫,这些AI引擎就无法联网读取你的最新内容。
建议策略: 在robots.txt中针对性放行这些AI爬虫(尤其是搜索类和用户访问类的),除非你的服务器实在扛不住流量压力。对于工具类、资讯类网站,“被爬取”意味着“被看见”的机会,整体上是利大于弊的。
独家观点: 检查你的robots.txt。如果你把AI爬虫都拒绝了,相当于在AI搜索时代挂出了“暂停营业”的牌子,却还在抱怨没有AI客户上门。