GEO 和 AEO 就绪检查清单
使用这份 GEO 和 AEO 就绪检查清单,测试 AI 爬虫访问、可提取答案、架构模式、llms.txt、提示可见性以及今日的引用证据。
本检查清单用于判断网站是否在技术上可达、易于提取、实体信息无歧义,以及在 AI 答案中可被量化地检测到。生成式引擎优化 (GEO)可提高生成式系统检索、使用和引用来源的可能性。答案引擎优化 (AEO)则使页面能够提供直接答案。两者都不能保证被收录:就绪状态只是消除可避免的障碍,而提示和引用数据才显示实际发生的情况。
检查清单: GEO 和 AEO 就绪。时间盒: 代表性审计和修复计划 3-5 个工作日,随后至少 28 天的测量窗口。负责人: SEO 负责人,工程团队负责访问和渲染,编辑团队负责段落质量,分析师负责提示和引用测量。
测试首页、每个关键收入模板中的一个页面、映射到优先提示的十个页面,以及已经获得引用或意外缺失引用的页面。记录每个 URL 以供重新测试。
为何需要这份检查清单,为何在此处
此关口整合了 AI 可访问性与代理就绪 审计(识别爬虫和提取限制)、基线测量 (冻结变更前的状态),以及关键词与提示研究 (定义要测试的真实问题和引擎)。同时还需要已批准的页面清单、实体事实、模式所有权、服务器或 CDN 访问权限,以及发布日志。
顺序很重要,因为可达性、答案质量和可见性属于不同层面。在爬虫检查之前进行提示跟踪,可能会报告品牌缺失,却无法解释原因是访问限制、相关性、权威性还是简单的检索延迟。在确认业务政策之前重写段落,可能会暴露组织意图隐藏的内容。在可见事实和实体模型稳定之前添加模式,可能会使矛盾机器可读,而非纠正它。
如果跳过此检查清单,团队往往倾向于声称页面已“针对 AI 优化”,因为它有短段落、FAQ 模式或 llms.txt 文件。这些是实施事实,而非结果。这里的约定更为严格:明确爬虫可以访问哪些内容,证明代表性页面能够被抓取和理解,然后将完成的提示运行和来源引用与带日期的基线进行比较。
输入与输出
输出是与发布、工程和测量团队之间的约定。没有 URL 集、证据、阈值和观察日期的“就绪”状态是无法复现的。
| 方向 | 项目 | 接受条件 |
|---|---|---|
| 输入 | 代表性 URL 清单 | 包含每个关键模板、十个优先提示目标页面、当前被引用的页面以及策略上重要的缺失页面;每个 URL 都有负责人。 |
| 输入 | 爬虫策略 | 列出相关爬虫族类、允许或阻止状态、业务理由、审批人、审查日期以及任何路径级别的例外。 |
| 输入 | 提示基线 | 存储精确的提示措辞、国家、语言、提供商、频率、品牌集,以及至少一次完成的变更前运行。 |
| 输入 | 实体与证据记录 | 指明组织、产品、人员、地点、标识符、规范 URL、已批准的声明以及每个事实的来源。 |
| 输入 | 技术访问 | 提供对 robots 规则、CDN 或防火墙行为、渲染后的 HTML、站点地图、响应头以及已部署结构化数据的读取权限。 |
| 输出 | 就绪测试矩阵 | 每个 URL 和检查项一行,包含观察结果、证据、严重程度、负责人、截止日期、重新测试日期以及通过或失败。 |
| 输出 | 爬虫决策登记表 | 将策略与技术可达性分开记录,以便有意的阻止不会错误报告为实施缺陷。 |
| 输出 | 段落与模式修复队列 | 确定具体的页面、章节、目标提示、实体、所需变更、验收测试以及负责的负责人。 |
| 输出 | 测量计划 | 冻结提示、提供商、基线日期、部署注释、28 天观察窗口以及比较规则。 |
| 输出 | 签字的交接单 | 列出剩余风险、已批准的例外、失败的检查、发布决策以及授权重新打开关口的人员。 |
检查清单
每个项目末尾都有完成条件。附上响应结果、渲染提取内容、验证器结果、截图或报告行,而不是记录一个无依据的绿色勾选。
1. 做出明确的爬虫访问决策
- 内容: 决定哪些 AI 用户代理可以爬取哪些公开路径。用户代理是爬虫在请求中呈现的标识符;它只是一个信号,而非强身份认证。
- 原因: 允许爬虫可以提升被发现的可能性,但也可能导致内容被复用、增加服务器负载、与授权冲突,或暴露仅因疏忽而公开的材料。阻止可能是合理的商业决策,但不能被误认为是 SEO 缺陷。
- 方式: 列出相关爬虫族类,并按目的分组:搜索或答案检索、模型训练和通用网络存档。对每个族类,记录允许、阻止或路径限制访问、商业理由、审批人和审查日期。将该决策与 robots.txt 、CDN 规则、Web 应用防火墙规则、身份验证和源站行为进行比较。
- 工具: 策略登记表、robots 解析器、CDN 和防火墙配置、服务器日志,以及法务或内容所有者审查。
- 完成条件: 100% 范围内的爬虫族类都有经所有者批准的决策;每个有意的阻止都被标记为策略;在代表性 URL 集上,零条实时规则与记录的决策相矛盾。
2. 以爬虫身份而非浏览器会话测试可达性
- 内容: 验证允许的爬虫是否能够收到规范的页面内容,并获得成功的响应,且没有遇到验证码、登录、同意墙或空白的客户端渲染外壳。
- 原因: 允许性的 robots 规则并不保证实际交付。CDN 可能对非浏览器请求返回
403、429、CAPTCHA 或不同的 HTML,而登录员工看到的却是正常页面。 - 方式: 使用相关的用户代理字符串从干净的请求中抓取每个代表性 URL。记录状态码、重定向、响应时间、内容类型、规范链接、索引指令、最终响应体大小,以及主要答案是否出现在返回或渲染的 HTML 中。比较爬虫和正常浏览器响应之间是否存在实质性差异。
- 工具: AmICited 中的 AI 可访问性与代理就绪 、响应和头部检查、服务器日志以及渲染 HTML 比较。
- 完成条件: 每个有意允许的测试页面都返回预期的规范页面且状态码为
200;重定向链不超过一跳;没有允许的请求收到401、403、429、验证码 HTML 或空白的主要内容区域;差异有记录在案且非欺骗性的原因。
3. 将 llms.txt 作为地图而非魔法开关进行审计
- 内容: 审查
/llms.txt,这是一个新兴的自愿性文本文件,旨在为语言模型工具指向有用的网站资源。将其视为指引,而非访问控制或保证的排名信号。 - 原因: 简洁的地图可以帮助代理找到规范的文档,但过时的文件可能会导致其访问重定向、重复页面或已过时的声明。它的存在不能弥补爬虫被屏蔽或内容薄弱的问题。
- 方式: 如果业务方决定采用该文件,保持标题和描述清晰,仅链接到规范的公开 URL,按真实用户目的分组资源,优先使用持久的页面而非整个站点地图的转储。测试每个列出的 URL。如果业务方选择不发布该文件,记录该决定,而不因此判定整个就绪关口失败。
- 工具: AmICited 的 llms.txt 检查、链接检查器、URL 清单和内容所有者审查。
- 完成条件: 发布或不发布的决定已记录;如果文件存在,则以纯文本格式返回
200状态码,包含零个损坏、重定向、被屏蔽、重复或非规范的链接,并有指定的所有者和审查日期。
4. 使优先段落自包含且前置答案
- 内容: 为每个优先问题提供一个自包含的段落:一个在开头就陈述答案的章节,包含足够的名词、范围、条件和证据,以便从周围内容中提取时仍保持准确。
- 原因: 检索系统通常选择段落而非整个页面。当脱离标题时,“这取决于"或"此方法"会失去意义;延迟的答案迫使系统跨多个章节拼凑事实,增加了遗漏或扭曲的可能性。
- 方式: 在对应标题下的第一或第二句中给出直接答案。直接命名实体和主题,而非依赖代词。随后附上限定条件、证据、示例和例外情况。将必要的上下文与声明保持在一起;不要将复杂的法律、医疗、财务或安全建议简化为无条件的片段。
- 工具: 提示到章节的映射图、编辑提取测试、纯文本阅读器和主题专家审查。
- 完成条件: 十个优先提示中的每一个都映射到一个规范页面和一个答案章节;答案出现在该章节的前 80 个字以内;审阅者可以单独复制该段落而不丢失主题、范围、条件或证据来源。
5. 使用可提取的格式完成任务
- 内容: 将序列表示为编号步骤,将备选项表示为比较表格,将规格说明表示为带标签的值,将短集合表示为列表。确保相同的事实以有意义的 HTML 形式提供,而不仅仅存在于图片、视频、画布或仅交互的标签页中。
- 原因: 格式编码了关系。散文段落可能隐藏哪个值属于哪个产品,而表格则暴露了比较。仅在点击后或图片中存在的内容可能被遗漏或与其标签分离。
- 方式: 检查文档大纲和原始 HTML。为表格提供表头,为列表提供每个项目一个想法,为图片提供图注,为图片提供有用的替代文本,为交互式内容提供服务器渲染的摘要。确保隐藏的标签页不包含关键答案的唯一副本。
- 工具: 可访问性树、HTML 源码检查、纯键盘审查以及禁用 JavaScript 或纯文本渲染。
- 完成条件: 100% 的关键事实在没有交互的情况下仍然可用且正确标记;每个比较都有明确的行和列表头;每个序列都有有序的步骤;没有优先答案仅存在于媒体或客户端渲染的组件中。
6. 对齐可见事实、实体和结构化数据
- 内容: 明确页面中的人员、组织、产品、地点和关系,然后通过有效的结构化数据 表达经过验证的事实。实体是一个可命名且可与类似事物区分开来的独特现实世界事物。
- 原因: 模糊的名称和矛盾的标识符会使归因不可靠。模式标记可以减少歧义,但比可见页面更宽泛、更新或更具促销性的标记会制造冲突而非信任。
- 方式: 为组织使用一个规范名称、URL、标识和稳定的标识符集。将作者和审稿人连接到真实的个人资料页面。选择最具体的适用模式类型,仅包含可见且经过验证的事实,并使用一致的标识符连接相关节点。验证语法并比较每个重要属性与渲染页面的内容。
- 工具: 实体记录、JSON-LD 检查、Schema.org 验证器、适用的富结果测试以及模板级质量审核。
- 完成条件: 每个代表性页面都有一个明确的主实体;零条重要的模式属性与可见声明矛盾或超出其范围;零语法错误;每个关键收入模板都有已批准的模式所有者和测试用例。
7. 通过来源和新颖性保护引用质量
- 内容: 为需要证据支持的声明提供可识别的主要或权威来源,并标明页面何时经过了实质性审查。
- 原因: 没有证据的可提取性可能使未经支持的声明更容易被重复。过时的价格、政策、基准和产品能力尤其危险,因为流畅的段落可能看起来仍然是当前的。
- 方式: 将决策相关声明追溯至来源,将引用放在声明附近,使用描述性锚文本,并说明相关的测量或生效日期。移除失效的引用或重写声明。仅在实际审查更改或重新验证内容后,才更改"更新"日期。
- 工具: 声明-来源分类账、链接检查器、内容清单和主题专家批准。
- 完成条件: 100% 的高风险和决策相关声明都有当前来源或指定的负责所有者;零条引用指向失效或不相关的页面;显示的审查日期与记录的审查相符。
8. 在发布前冻结代表性提示集
- 内容: 建立一套可重复的买家问题,用于衡量变更前后的提及率、引用排名、被引用 URL 和提供商差异。
- 原因: 部署后更改提示可能制造人为的改进。一个精心挑选的答案只是偶然事件,因为生成式响应和来源选择在不同运行和提供商之间可能不同。
- 方式: 在选择至少 20 个提示,涵盖发现、比较、评估和品牌特定意图。包括当前品牌被引用、被提及但无引用以及缺失的提示。固定措辞、国家、语言、提供商、标签和排期;记录映射的目标页面和业务优先级。
- 工具: AmICited 中的提示跟踪与管理 和已批准的提示到页面映射。
- 完成条件: 至少 20 个提示已完成一次或多次基线运行;100% 在观察窗口期间保持固定的措辞和设置;每个提示都有预期的页面和意图;失败或待处理的运行不计入结果率,而非算作缺失。
9. 在域名、URL、提示和提供商层面测量引用
- 内容: 跟踪品牌是否被提及、其域名是否被引用、具体哪个 URL 被引用、其位置,以及同一提示下哪些其他来源胜出。
- 原因: 域名总数可能隐藏错误页面获得了引用的事实。品牌提及可能上升而自有来源引用可能下降,这意味着引擎知道该品牌但信任其他来源提供答案。
- 方式: 保留变更前的导出数据,标注发布,并在约定的 28 天窗口内比较等效的已完成运行。按提供商和提示意图进行细分。审查完整的答案以了解重要变化,并将自有引用与提及品牌的第三方引用区分开来。
- 工具: AmICited 中的来源与引用情报 、提示历史和发布注释。
- 完成条件: 每个优先提示都有完成的变更前基线和变更后观察记录;被引用的域名和确切 URL 已存储;提供商差异可见;每个声称的改进都可以从相同的提示集和日期窗口中复现。
10. 重新测试失败项并签署就绪决策
- 内容: 将技术、编辑、模式和测量结果整合为通过、有条件通过、有意阻止或失败。
- 原因: 平均分数可能隐藏关键访问失败。就绪状态属于特定 URL 和已记录策略下的模板,而非网站作为一个无依据的标签。
- 方式: 从干净的请求重新测试每个已修复的项目。将有意的策略阻止与缺陷分开。有条件通过必须注明例外情况、受影响的 URL、风险、审批人、修复负责人和截止日期。保留原始证据以及模板或部署版本。
- 工具: 就绪测试矩阵、问题跟踪系统、发布记录和负责人签署。
- 完成条件: 有意允许的优先 URL 上没有关键性失败;每个其他失败都有负责人和截止日期;每个例外都有到期日;负责的 SEO、工程和内容负责人签署相同的带日期记录。
AmICited 中的工具
将产品检查作为矩阵内的证据使用,而非替代业务策略或编辑判断。
- 打开代理可访问性审计 来检查 llms.txt、可访问性结构、站点地图覆盖以及爬虫访问背后的独立事实。独立记录 robots 允许、实时的 CCBot 风格请求和确认的 Common Crawl 存在;未知结果既不是通过也不是失败。
- 打开提示跟踪 来导入或创建冻结的提示集,选择提供商、国家、标签和排期,并保留完成的基线运行。排队中、处理中和失败的运行是操作状态,而非"缺失引用"的结果。
- 打开来源 从域名总数深入到确切的被引用页面以及每个页面胜出的提示。将自有页面与第三方来源进行比较,而不是假设品牌提及来自品牌自己的网站。
决策规则:不合格的标准
这些是操作关口,而非关于引擎如何排名页面的声明。对于受监管、安全关键或高价值内容,可收紧标准。
| 信号 | 通过 | 警告 | 失败或停止 |
|---|---|---|---|
| 爬虫策略覆盖 | 100% 范围内的爬虫族类有记录决策 | 决策已超过审查日期 | 任何实时的允许或阻止与策略相矛盾 |
| 允许的 URL 抓取 | 100% 返回预期的规范内容 | 超过一次重定向跳或爬虫响应明显更慢 | 任何 401、403、429、验证码、空白主要内容或意外的 noindex |
| llms.txt(如已采用) | 200 纯文本;所有列出的 URL 规范且可达 | 所有权或审查日期缺失 | 任何损坏、重定向、被屏蔽、重复或非规范的列出的 URL |
| 优先答案覆盖 | 10/10 映射提示有自包含答案段落 | 答案在 80 字之后开始或依赖模糊代词 | 无规范目标页面、矛盾的答案或缺少必要上下文 |
| 可提取性 | 所有关键事实在纯文本和无交互审查中保留 | 标签仅能通过附近的视觉上下文理解 | 关键事实仅存在于图片、视频、画布或交互状态中 |
| 模式质量 | 零语法错误和零可见数据冲突 | 适用模板缺少所有者或测试用例 | 标记编造、夸大或与重要事实矛盾 |
| 提示基线 | 至少 20 个固定提示已完成运行 | 提供商、国家或意图覆盖不均衡 | 比较期间措辞或设置发生变化但未重启基线 |
| 结果证据 | 等效的已完成运行比较了 28 天 | 按计划频率,完成的运行太少 | 改进仅来自一个答案、不同的提示集,或者仅有域名总数而无 URL 证据 |
不要将所有行合并为一个分数。一个被阻塞的关键收入模板不能由九篇结构良好的文章来抵消。反之,如果所选策略所需的检索爬虫仍然可以访问已批准的内容,那么一个有意的、经批准的训练爬虫阻止也不是技术缺陷。
交付物
提交一个带版本号的表格加上一个证据文件夹。必填字段包括:审计 ID、URL、模板、目标提示、提供商、爬虫族类、策略决策、抓取结果、可提取性结果、模式结果、llms.txt 包含情况、基线提及和引用、部署日期、变更后结果、严重程度、负责人、截止日期、重新测试日期、证据链接、例外情况、到期日和最终决策。
包括爬虫登记表、冻结的提示导出、实体和声明来源记录以及发布注释。将原始响应或渲染提取内容与截图一起存储,以便审阅者验证机器收到的内容。
负责的所有者签署以下四种结果之一:
- 通过: 所有有意允许的优先 URL 通过了关键访问、提取、实体和证据关口。
- 有条件通过: 无关键失败,但有时限的非关键例外已由指定负责人接受。
- 有意阻止: 爬虫或路径因已批准的策略不可用,且预期的可见性权衡已记录。
- 失败: 关键模板不可达、具有误导性、矛盾或无法测量;发布或推广停止,直至重新测试。
常见问题
将 robots 策略视为访问的证明。 文件说"允许”,但 CDN 却挑战请求。通过同时存储策略和真实的抓取结果来解决此问题。
允许所有爬虫而没有业务负责人。 SEO 团队优化发现,而法务或内容所有者意图限制训练复用。区分爬虫目的并获得明确的决策,而非制定一条笼统的规则。
llms.txt 变成了第二个站点地图。 数百个未排序的 URL 产生噪音、过时链接和竞争性的规范选择。保持其精选和有用,或者有意省略。
内容被缩短到错误的地步。 前置答案为了追求片段而丢失了限定条件、日期或受众限制。保持直接答案在开头,然后包括使其独立准确所需的条件。
FAQ 模式被添加到不可见或未经支持的答案上。 有效的语法并不能使捏造或隐藏的声明变得可信。使标记与可见内容一致,并移除页面无法证明的属性。
将首页测试推广到整个网站。 文档、产品、分类和重度 JavaScript 模板在同一域名下可能表现不同。审计代表性模板和优先目标页面。
一个有利的 AI 答案成了成功故事。 团队反复运行或改述直到品牌出现,然后报告截图。首先冻结提示,并在观察窗口内比较等效的已完成运行。
将提及份额与引用份额混淆。 引擎提到品牌但引用评论网站或竞争对手。分别报告品牌存在和自有来源引用,然后检查确切的被引用 URL。
下一阶段
接下来是持续刷新与迭代 。它需要就绪矩阵、爬虫登记表、冻结的提示、被引用的 URL、部署注释、例外情况和审查日期。
不要仅仅因为引用尚未出现就反复重写页面。首先重新检查访问、提示有效性、被引用来源变化和完成的运行量。然后选择最小的有证据支持的干预措施:技术修复、更清晰的段落、更强的实体支持、更新的证据,或不做任何更改。
准备好验证 GEO 和 AEO 就绪了吗?
从 SEO 流程 开始,然后运行代理可访问性审计 并将其证据附加到检查清单中。只有当访问决策明确、代表性页面通过提取和实体检查、并且提示和引用报告能够验证结果时,就绪才算完成。
准备好付诸实践了吗?
免费检查 · 7天试用 · 无需信用卡