SEO Playbook · Process

AI 可访问性审计与智能体就绪度

执行 AI 可访问性审计,涵盖爬虫访问、内容提取、结构化数据、llms.txt、速度、WebMCP 和智能体商务就绪度,覆盖关键页面。

3 min read

AI 系统无法引用、推荐或处理它们无法可靠检索的内容。本阶段在团队衡量可见性或委托制作面向答案引擎的内容之前,测试这一基础。

阶段: P4,阶段 A — 理解。时间盒: 典型营销网站 3–5 个工作日;大型电商、市场平台或重度客户端渲染应用 5–10 个工作日。负责人: 技术 SEO 负责人负主要责任,工程团队执行抓取和渲染测试,内容负责人审查可提取性,业务或法务负责人决定爬虫策略。

为什么本阶段在此处

传统技术审计询问的是搜索引擎能否爬取、渲染、索引和排名网站。本阶段询问的是 AI 爬虫、检索系统和面向任务的智能体能否访问和解释相同的有用信息。它们可能使用不同的用户代理、抓取路径、渲染能力、超时时间和提取方法。一个可索引的页面仍然可能向 AI 客户端返回空壳、同意墙、机器人验证页面或脱节的片段。

因此,AI 可访问性审计 应当与技术基线审计 并列,而非放在内容生产环节的末尾。客户端渲染意味着 JavaScript 在初始 HTML 到达之后才构建重要内容。检索系统可能不执行这些代码,可能在代码完成前停止,或者只提取初始响应。如果产品名称、答案、价格、可用性或证据仅在 JavaScript 执行后存在,后续的内容优化无法修复访问失败问题。

本阶段使用来自访问、追踪与数据源阶段 的已验证账户、分析工具、爬虫日志、站点地图来源、关键 URL 集和所有权映射。如果更早执行,团队将无法区分真正的缺失和访问问题。如果在基线测量之后执行,则会污染基线:零引用可能反映的是网站不可访问,而非内容薄弱或需求不足。

爬虫策略是商业决策
允许 AI 爬虫可能提升发现率、检索率和被引用的机会。屏蔽它可能保护授权内容、减少未经批准的复用、控制基础架构成本,或满足客户和监管义务。审计不会为企业做出选择。它揭示权衡关系,指明决策负责人,并验证实际配置与记录的决策是否一致。

跳过此阶段会浪费工作:写作者优化了爬虫从未接收到的段落,开发人员在验证页面后添加了模式标记,或者团队将有效的 llms.txt 误认为是网站范围的就绪状态。访问、提取、理解和行动是各自独立的能力。

输入与输出

输入使测试具有可重复性。输出与 P5 形成契约:只有在已知的访问失败被修复或明确接受后,测量才能开始。

方向项目验收条件
输入P2 访问与所有权包包含生产环境访问权限、分析和日志来源、机器人和 CDN 所有者、法律/业务策略负责人以及上报路径。
输入代表性 URL 集包含首页以及每种重要模板至少一个高价值 URL:产品、分类、服务、文章、文档、地点和适用的事务性页面。
输入爬虫策略矩阵列出相关爬虫系列、当前规则、目标规则、决策负责人、理由和审查日期;意图未知应记录为"未知",而非"被策略屏蔽"。
输入P3 技术发现结果提供规范 URL、状态、渲染、站点地图、性能和有结构化数据的证据,以便本阶段隔离 AI 特定行为。
输入实体与产品事实列出规范组织名称、产品或服务、别名、官方 URL 以及提取器必须正确识别的其他事实。
输出测试证据包为每次测试存储时间戳、URL、用户代理、响应状态、响应头、初始 HTML 或树状证据及截图。
输出策略决策记录显示每个爬虫系列的允许、屏蔽或有条件访问状态,附有责任审批人和实施检查结果。
输出智能体就绪度发现登记表为每个失败条件提供严重程度、影响范围、证据、建议、负责人、工作量和重新测试日期。
输出P2 优先级列表更新将智能体发现结果合并到现有跨职能待办事项列表中,而非创建单独的"AI SEO"队列。
输出P5 就绪备注说明哪些限制会扭曲基线测量,以及 P5 是否可以继续、需附注说明继续,或需等待。

检查清单

测试代表性 URL 集,而不仅仅是首页,并保留可重复的证据。

1. 审慎决定爬虫访问权限

做什么: 清点 robots.txt 中的 AI 爬虫规则、CDN 机器人控制、Web 应用防火墙、同意层和源站配置。为什么重要: robots.txt 中的允许只是偏好;边缘服务仍然可以阻止请求,而无意的通配符屏蔽并非策略。如何做: 将实际规则与策略矩阵进行比较,使用适用的用户代理抓取代表性 URL,并记录权衡关系。工具: AmICited Robots.txt 和站点地图、经过批准的请求客户端以及 CDN/源站日志。完成条件: 每个爬虫系列都有经过批准的允许、屏蔽或有条件决策,并且实际行为与之匹配。

2. 比较非 JavaScript 响应与有用页面

做什么: 比较初始 HTML 与正常浏览器页面。为什么重要: 检索客户端可能不执行插入答案、报价、链接或产品数据的脚本。如何做: 在注水(将应用行为附加到服务器 HTML 的过程)之前测试每种重要模板。工具: 无脚本浏览器或 HTTP 客户端,加上渲染后的页面。完成条件: 初始响应包含标题、H1、主要内容、核心事实和可发现的链接;任何例外情况都有证据和负责人。

3. 测试渲染 DOM 的可提取性

做什么: 从渲染后的文档对象模型(DOM,浏览器结构化的页面表示)中提取主要内容,不含导航文字、同意文本或隐藏变体。为什么重要: 接收到文本与识别正确的文本不是一回事;模板噪音可能污染检索结果。如何做: 在长页面、稀疏页面和商业页面中,比较提取的标题、答案、发布者、日期、事实和链接与可视来源。工具: 浏览器检查、文本提取和页面源代码。完成条件: 记录在保留主要意义和事实的同时,不依赖视觉位置或未文档化的选择器。

4. 检查无障碍树

做什么: 审查无障碍树:角色、名称、状态、标题、地标和控件。为什么重要: 语义区分标题与装饰、按钮与图标、主要内容与导航。如何做: 测试关键模板是否包含一个 H1、有序的标题层级、有名称的控件、地标、描述性链接和有意义的图片替代文字。工具: AmICited 无障碍树检查器和浏览器检查。完成条件: 评分达到阈值,没有关键控件缺少名称,主要区域和下一步操作可识别。

5. 验证结构化数据的覆盖范围和真实性

做什么: 将可见事实与结构化数据 (如 Schema.org JSON-LD 等标准化标记)进行比较。为什么重要: 标记澄清了实体、产品、作者身份和日期,但不准确的标记传达了错误的信息。如何做: 验证适用的模式,并将名称、URL、价格、货币、库存状况、日期、评分和标识符与源系统进行核对。工具: 验证器、渲染后的 HTML 和源记录。完成条件: 关键模板具有有效的适用标记,值与可见事实匹配,每个重要的警告都已解决或已解释。

6. 将 llms.txt 视为指南而非关卡

做什么: 检查 /llms.txt 是否准确总结了组织信息并链接到规范的公共资源。它是一个建议性的纯文本文档,而非访问控制或保证的排名信号。为什么重要: 简洁的地图减少歧义;过时的地图会误导智能体。如何做: 验证状态、Markdown 结构、描述、目标链接、规范 URL 和负责人。工具: AmICited llms.txt 审查和直接获取。完成条件: 如果使用该文件,则不应有损坏/私有链接,且应有维护负责人;文件缺失是一个改进项,而非不可见的证据。

7. 抽样独立段落

做什么: 审查独立检索的定义、答案、事实、比较、步骤和限制。为什么重要: 检索可能将一个段落与其标题分离;“对它来说效果更好"随后就失去了主语和比较对象。如何做: 至少阅读 20 个段落的文本,不包含其标题或上一段落。工具: 提取输出和编辑审查。完成条件: 每个段落都指明了其主语,回答了可识别的问题,保留了条件或单位,并避免了未解决的指代问题。

8. 确认规范实体的清晰度

做什么: 验证网站是否说明了组织是谁、提供什么,以及其品牌、产品、人员、地点和资料如何关联。规范实体是指名称所指的主要真实事物。为什么重要: 名称不一致、旧标识、相互矛盾的描述以及断开的资料 URL 很容易合并两个实体或将一个实体拆分为多个。如何做: 比较首页、关于页面、联系信息、结构化数据、社交媒体资料、作者页面、法律名称和重要的第三方资料。工具: 实体事实表、渲染页面和结构化数据输出。完成条件: 一份经批准的事实表解决了官方名称、别名、规范 URL、标识、描述、所有权、主要产品和同一实体资料等问题,冲突已记录待修正。

9. 测试响应时间和抓取可靠性

做什么: 测量状态、首字节时间(TTFB,从请求开始到第一个响应字节到达的时间间隔)、重定向、超时以及在正常和相关爬虫用户代理下的响应一致性。为什么重要: 间歇性的 403、429、5xx 响应、长重定向链或缓慢的源站使内容变得不可靠,即使单次浏览器访问成功。如何做: 在阈值表中定义的条件下,从多个网络位置(如果地理位置重要)运行可重复样本,然后将失败与日志和核心网页指标进行核对。工具: 请求监控器、CDN/源站日志和 AmICited 网页指标。完成条件: 关键 URL 满足可靠性和延迟阈值,或者具有严重程度、原因、负责人和重新测试日期。

10. 在创造价值的情况下评估 WebMCP 和商务协议

做什么: 仅当商业模式支持智能体操作时,才测试 WebMCP 和商务就绪度。WebMCP 是一种新兴的方式,网站可通过它公开可调用工具,例如搜索、预订或添加商品到购物车。智能体商务 涵盖智能体辅助的产品发现和交易,包括诸如 ACP 或 UCP 等协议。为什么重要: 可读的内容支持答案;显式工具和商务数据支持可靠操作,无需屏幕抓取。如何做: 映射有价值的用户任务,检查已声明的工具或协议,验证输入和输出描述,并确认确认流程、身份验证、权限、价格、库存和错误处理行为。工具: AmICited WebMCP 和智能体商务检查,外加受控测试环境。完成条件: 适用能力已被检测到且可安全测试,或者此项检查已被标记为"不适用”,附有经批准的商业模式理由和审查触发条件。

AmICited 中的工具

打开 https://app.amicited.com/accessibility 查看整合审计页面以及AI 可访问性与智能体就绪度 功能说明。该产品报告独立的读数,而非将不同类型的失败隐藏在一个混合评分中。

  1. 使用摘要查看智能体可访问性评分 ,并记录每个组成部分,而非仅看总体状态。
  2. 使用 Robots.txt 和站点地图检查 robots.txt 和站点地图覆盖范围 ,然后将声明规则与实际爬虫式抓取进行比较。
  3. 使用文件审查功能审查 llms.txt ,并打开列出的每个目标链接。
  4. 使用页面检查器为每种关键模板检查页面的无障碍树
  5. 在适用时,使用就绪度检查检查 WebMCP 就绪度检查智能体商务就绪度
  6. 打开 https://app.amicited.com/audit/web-vitals 检查核心网页指标 ,并将现场性能与爬虫条件下的请求测试关联起来。

决策规则

以下为操作层面的验收阈值,并非关于排名算法的声明。对收入关键流程或受监管内容,请收紧阈值,并在测试前记录任何替代方案,以便结果不会在事后进行调整。

检查项通过或可接受发现问题阈值默认操作
策略所有权每个相关爬虫都有允许、屏蔽或有条件状态、理由、审批人和审查日期任何实际规则没有负责人或记录在案的意图重大;在 2 个工作日内上报业务决策
声明与实际访问实际行为与每个关键 URL 上的已批准策略匹配允许的爬虫收到 401、403、429、5xx、验证页面或实质不同的内容关键 URL 上为严重;其他地方为重大
非 JavaScript 响应标题、H1、主要内容、核心事实和可爬取发现链接均存在任何必需元素仅在 JavaScript 之后存在,或初始 HTML 为空应用外壳主要内容为严重;支持内容为重大
渲染后提取提取的标题、答案或报价、事实、日期和主要链接与可见页面匹配错误变体、隐藏文本、导航噪音或缺少限定性上下文改变含义如果事实改变则为严重;如果提取不完整则为重大
无障碍树AmICited 评分 80–100,且没有未命名的关键控件或中断的主要内容大纲50–79 为重大;50 以下为严重;任何不可用的购买、预订、登录或潜在客户控件均为严重,无论评分如何修复语义并重新测试受影响的模板
结构化数据零语法错误;实质性属性与可见内容和源记录匹配任何无效的必需属性或冲突的价格、库存状态、日期、身份、评分或规范 URL欺骗性/冲突事实为严重;缺少适用覆盖为重大
llms.txt如存在:HTTP 200、可读的 Markdown、准确的摘要、零损坏/私有链接、有命名的负责人缺失文件为建议项;无效、过期、重定向或误导性文件为重大在解决访问和提取阻塞后创建或修正
段落质量至少 20 个抽样段落;全部标明主语并保留条件、单位和答案一个模糊段落对该页面为重大;模板级反复模糊对内容模式为严重修正模式,然后重新抽取 20 个段落
实体清晰度已批准的事实表与关键页面和机器可读身份匹配官方名称、规范 URL、所有权、产品关系或同一实体引用冲突重大;当冲突改变了谁提供报价或建议时为严重
抓取可靠性每个关键模板至少 2 个测试周期、25 次请求:预期重定向后 100% 有效 2xx,无验证页面,且更广泛样本中至少 98% 有效响应任何关键 URL 失败,或更广泛样本低于 98% 有效响应关键 URL 为严重;更广泛可靠性为重大
TTFB测试环境中位数不高于 800 毫秒,95 百分位不高于 1,800 毫秒中位数高于 800 毫秒为重大;任何重复超时或 95 百分位高于 1,800 毫秒对受影响的关键 URL 为严重诊断 CDN、源站、缓存、重定向或区域路由
重定向零意外跳转;在 200 响应之前不超过一次有意的同站跳转循环、跨域意外、爬虫特定重定向或两次及以上可避免的跳转循环或错误目的地为严重;多余跳转为重大
WebMCP适用工具声明式公开、准确描述、授权和测试仅 JavaScript 检测未验证;缺少适用工具或不安全操作为发现问题缺少适用能力为重大;不安全执行为严重
智能体商务适用协议已声明,测试流程保持价格、库存、同意、确认和错误处理不支持的能力如实显示未提供,或已声明的流程更改条款或在未确认的情况下操作不适用可接受;不安全或误导性流程为严重

评分永远不能凌驾于具体证据之上。85 分的可访问性评分不能为未标记的结算按钮开脱,robots.txt 允许也不能抵消实际请求收到的验证页面。“未检查"是未知状态,既不是通过也不是零分。

交付物:智能体就绪度发现登记表

交付一份发现登记表,而非一个演示文稿加单独的 AI 待办事项列表。将每个发现结果添加到 P2 优先级列表中,包含以下字段:

ID 和标题:
受影响的 URL/模板:
检查项与观察到的状况:
预期状况/阈值:
证据:时间戳、用户代理、状态、抓取或日志引用
业务影响:
严重程度:严重 | 重大 | 建议
建议操作:
负责人与审批人:
工作量与依赖关系:
截止日期与重新测试日期:
策略决策(如相关):
P5 测量影响:
状态:待处理 | 已接受风险 | 已修复 | 已验证

“严重"意味着失败阻止了可靠访问、实质上改变了提取的含义,或允许了不安全操作。“重大"意味着访问或理解受到削弱,但代表性客户端仍能恢复主要内容。“建议"意味着有用的改进缺乏当前失败的证据。“已接受风险"需要指定的业务负责人、理由、影响范围、到期或审查日期,以及检测条件变化的方法。

按根本原因去重:一个影响传统爬虫和 AI 爬虫的 CDN 验证问题是一个项目,附带多条证据记录。

常见问题

将该阶段视为可选。 提示词追踪和内容重写无法弥补检索失败。将 P4 作为可解释基线的准入条件。

默认屏蔽并在事后称之为策略。 没有决策负责人、理由或审查日期的规则是配置,而非策略。展示发现与控制的权衡关系,并获得明确的决策。

添加 llms.txt 并宣布完成。 该文件无法覆盖 robots.txt 规则、CDN 屏蔽、空初始 HTML、误导性标记、薄弱段落或超时。将其视为更广泛证据集中的一份指南。

仅测试友好用户代理或首页。 边缘控制因路径、地理位置、速率和身份而异。测试策略矩阵中的每个高价值模板和用户代理。

混淆外观与可提取性。 精美的页面可能隐藏重复内容、无意义的控件名称或空白的无脚本响应。分别保存源代码、DOM、无障碍树和提取文本的证据。

将未知视为成功或失败。 重新测试超时和未检查的爬虫;切勿将缺失的证据转换为方便的评分。

在没有用例的情况下安装实验性智能体能力。 WebMCP 或商务协议应公开有价值的、经过授权的操作。发布不安全或不准确的操作比将该能力标记为不适用更糟糕。

交接至基线测量

基线测量阶段 接收合并后的优先级列表、测试证据包、爬虫策略记录、代表性 URL 集和就绪备注。P4 负责人必须识别任何会改变解释的限制:被屏蔽的爬虫系列、不可访问的模板、间歇性区域、缺失段落或尚未传播的近期修复。

当以下条件满足时,P5 可以继续进行:关键 URL 对测量中包含的爬虫系列有意图地可访问,有效的主要内容可提取,且没有未解决的严重发现结果会使零分或低分无法解释。当故意屏蔽排除了某个已知爬虫,或某个重大问题影响有限的模板时,P5 可以附注说明继续进行。当访问意图未知、关键页面抓取失败或提取内容与可见来源实质矛盾时,P5 应等待。

当 P5 负责人能够在不重新进行审计的情况下回答三个问题时,交接即告完成:哪些智能体被意图赋予访问权限,它们能够可靠检索哪些页面和事实,以及哪些已知限制必须与基线一同呈现。

常见问题

常见问题

我们是否应该允许所有 AI 爬虫?
并非自动如此。企业所有者必须权衡可发现性和被引用机会与内容授权、竞争性复用、服务器成本、隐私和合同义务之间的关系。为每个爬虫系列记录明确的决策,并测试实际配置是否与之匹配。
通过审计是否需要 llms.txt 文件?
不需要。llms.txt 是一个有用的发现辅助工具,但不能证明爬虫能够获取或提取网站内容。文件缺失是一个改进项;页面被屏蔽、获取失败或主要内容不可用则是更严重的问题。
网站能否通过技术 SEO 检查但仍未通过智能体就绪度?
可以。搜索引擎爬虫可能接收到服务端渲染的 HTML,而 AI 用户代理却收到验证页面;或者页面依赖于检索系统无法可靠解释的 JavaScript、模糊实体和交互。
WebMCP 和智能体商务是否适用于所有企业?
不适用。当智能体可以执行搜索、预订、报价或账户任务等有用操作时,才测试 WebMCP。当产品可以被发现和购买时,才测试商务协议。如果某一项不适用,请附上商业模式理由进行标记。
智能体就绪度的发现结果应归入何处?
将其合并到 P2 阶段建立的优先级列表中。使用相同的严重程度、负责人、截止日期、证据和依赖关系字段,以便技术、测量和 AI 可访问性工作在同一待办事项列表中竞争优先级。
了解 AI 智能体能否使用您的网站
运行可访问性审计,保留证据,并将每个失败条件转化为有负责人的优先事项。

← All SEO Playbook guides

准备好付诸实践了吗?

免费检查 · 7天试用 · 无需信用卡