学院 · 审计

如何在 AmICited 中检查 Robots.txt 和 Sitemap 覆盖范围

使用 AmICited 的 Agent Accessibility 审计中的 Robots.txt 和 Sitemap 检查,确认 AI 和搜索引擎爬虫可以读取您的网站,以及您的 sitemap 已被声明且完整。

2 min read · Medium priority

如何在 AmICited 中检查 Robots.txt 和 Sitemap 覆盖范围 — video walkthrough

如果 AI 爬虫无法读取您的网站,那么其他所有优化都无关紧要。

什么是 robots.txt,为什么它决定了 AI 能否"看见"您?

Robots.txt 是一个位于您域名根目录(yoursite.com/robots.txt)的纯文本文件,用于告诉爬虫可以请求网站的哪些部分。它的历史比 AI 浪潮早了数十年——最初是为了让 Googlebot 这类搜索引擎爬虫不会浪费时间抓取后台页面、预发布环境或重复内容。但如今,同样的机制决定着一件风险高得多的事情:GPTBot、ClaudeBot、PerplexityBot、Google-Extended 等驱动当今问答引擎的 AI 爬虫,是否被允许抓取您的页面。

每一个"守规矩"的爬虫在请求任何其他内容之前都会先检查 robots.txt。该文件由若干区块组成,每个区块以指明特定 bot(或用 * 表示所有 bot)的 User-agent 行开头,随后是 AllowDisallow 规则,规定该 bot 可以或不可以抓取哪些路径。在 User-agent: GPTBot 下面写一条笼统的 Disallow: / 规则,就足以将该爬虫彻底挡在您整个网站之外——无论您的内容多么优秀,它都不会出现在 ChatGPT 的引用中。这正是为什么可爬取性 (即网站在技术层面能否被 bot 触达的整体属性)被视为 AI 搜索可见性的基础层,而非可有可无的附加项。

Robots.txt 还有第二项职责:爬虫通常会在这里通过 Sitemap: 指令寻找您 sitemap 的指引。XML sitemap 是您网站上希望爬虫知晓的 URL 的结构化列表,通常还包含最后修改日期等元数据。如果说 robots.txt 控制的是权限,那么 sitemap 控制的就是发现——它是一张地图,告诉爬虫有哪些内容存在,这样它们就不必仅靠追踪链接来找到每一个页面。一个网站的 robots.txt 规则可能完全放行,却仍然因为 sitemap 缺失、未被引用或不完整,而被 AI 系统收录不足。

对 AI 可见性而言,这两个文件的重要性甚至超过了它们在传统 SEO 中的地位。搜索引擎已经抓取网络 25 年以上,建立了庞大的链接图谱,即便没有 sitemap,Googlebot 也能发现页面。而 AI 爬虫出现得更晚,通常在抓取网站内容的深度上更保守,也更容易被那些原本只针对 Googlebot 编写的 robots.txt 规则直接拦截。一条悄悄排除"未知"或看起来"具有侵略性"的 bot 的规则,很可能把 GPTBot 或 ClaudeBot 也一并误伤。这正是 Robots.txt 和 Sitemap 检查要捕捉的具体失败模式——也是为什么这应当是任何AI 可访问性审计 最先要验证的事项之一,早于您在内容、结构化数据或其他任何方面投入精力之前。

Agent Accessibility 审计中的 Robots.txt 和 Sitemap 部分

Important
robots.txt 中一条过于严格的规则就可能阻止 AI 爬虫访问您的整个网站。这项检查正是您在问题悄然影响引用之前发现它的机会。

在哪里找到它

它位于审计 → Agent Accessibility 中的 Robots.txt 和 Sitemap 部分。Agent Accessibility 是 AmICited 审计中专门关注 AI 系统能否在技术层面触达并解析您内容的部分,有别于产品中关于内容质量和引用追踪的部分。Robots.txt 和 Sitemap 通常是该部分中的第一项检查,因为审计所衡量的其他一切都建立在"爬虫首先能够进门"这一前提之上。

它检查什么

正如该部分所述,它检查*“重要的 AI 和搜索引擎爬虫是否被允许读取网站,sitemap 是否已在 robots.txt 中声明,以及这些 sitemap 总共列出了多少条 URL。”* 简而言之:

  • 爬虫访问权限 — 主要的 AI 和搜索引擎爬虫是否被允许(而非禁止)访问 robots.txtAmICited 会将您实际的 robots.txt 规则与那些对 AI 搜索可见性至关重要的爬虫的用户代理(user-agent)字符串逐一比对,因此您可以逐个 bot 地看到它是被允许、被阻止,还是根本没有任何规则涉及(这种情况通常会回退为在通配符区块下默认允许)。
  • Sitemap 声明robots.txt 中是否引用了 sitemap,以便爬虫能够找到它?一个存在但未从 robots.txt 中链接(也没有在其他地方提交过)的 sitemap,被自动发现的可能性会低得多。
  • Sitemap 覆盖范围 — 您的 sitemap 总共列出了多少条 URL,让您能快速判断自己已发布的页面是否真的被告知给了爬虫。

这三项检查共同回答了决定 AI 系统能否开始评估您内容的两个关键问题:这个爬虫是否被放行,以及它一旦进来是否知道该抓取什么。一个品牌可能在内容层面做得无可挑剔——清晰的答案、强有力的实体信号、结构良好的页面——却仍然在 AI 回答中"隐形",仅仅因为这两个条件中的一个在后台悄然失效。

如何使用

  1. 确认爬虫已被允许。 如果某个重要的 AI 爬虫被阻止,请修复 robots.txt 中的规则——这是该页面上的最高优先级问题。请对照您的真实意图逐一检查每个被阻止的爬虫:如果您不希望自己的内容被用于 OpenAI 的模型训练,那么一条阻止 GPTBot 的规则很可能是有意为之;但如果它同时也悄悄阻止了 OAI-SearchBotPerplexityBot——这些真正驱动实时引用(而非模型训练)的爬虫——那您就是在毫无战略理由的情况下白白损失可见性。与其沿用一个不分青红皂白全部阻止的默认设置,不如认真决定您希望允许哪些 AI bot 抓取您的网站
  2. 声明您的 sitemap。 确保 robots.txt 指向您的 sitemap,以便代理能够发现您所有的页面。这只是一行代码——Sitemap: https://yoursite.com/sitemap.xml——但它是那些其他方面都做得很好的网站上最常见的遗漏细节之一,尤其是在 sitemap 由 CMS 自动生成、却从未被接回 robots.txt 的网站上。
  3. 检查 URL 数量。 如果 sitemap 列出的 URL 数量远少于您已发布的页面数量,则说明页面未被告知给爬虫。这通常说明 sitemap 已经过时(生成一次后再未更新)、sitemap 索引未链接其所有子 sitemap,或者某个 CMS 插件正在悄悄排除某种内容类型——最近发布的博客文章和动态生成的页面往往是常见的"受害者"。
  4. 修改后重新检查,并确认就绪摘要中的爬虫访问权限Sitemap URL 模块已变为健康状态。

爬虫访问权限是一切的基础:请优先确保它正确无误,因为其他所有检查都依赖于爬虫确实能够访问到您的内容。一旦访问权限和可发现性都确认健康,Agent Accessibility 审计中的其余部分——渲染、结构化数据、响应时间——才开始变得重要,因为这些检查只有在爬虫本就被允许触达页面的前提下才有意义。

同样值得记住的是,robots.txt 和 sitemap 覆盖范围的检查并非一次性工作。新版块上线、CMS 迁移会以不同的默认设置重新生成 sitemap,CDN 或 WAF 规则也会在最初的 robots.txt 写好很久之后被追加——这些都可能在不知不觉中让某个爬虫重新被阻止,或让 sitemap 变得不完整。有些团队会将这项检查与服务器日志分析配合使用,以确认爬虫确实在访问它们被允许访问的页面,并搭配一个专门的 llms.txt 文件,为 AI 系统提供一份关于您最重要内容的精选摘要,作为原始 sitemap 的补充。如果您不确定 robots.txt 和 sitemap 覆盖范围在您整体技术工作中处于什么位置,更全面的AI 可见性审计 会按顺序讲解完整的一套可访问性检查,而 AmICited 自身的 AI 可见性 工具则会追踪修复这些问题是否真正转化为了更多的引用——将技术修复与它本应带来的结果联系起来,而不是把"爬虫已放行"当作终点。对于需要在数十个客户网站上管理这项工作的团队来说,同样的访问权限与 sitemap 检查是面向代理机构的 AmICited 所涵盖的常见工作项之一,因为单个配置错误的 robots.txt 规则往往会在多个模板中重复出现,需要在客户接入的早期阶段就被发现,而不是等到客户质问为什么自己的品牌从未出现在 ChatGPT 中。

← 所有学院教程

准备好付诸实践了吗?

免费检查 · 7天试用 · 无需信用卡