我们如何衡量SEO和AI可见性结果
使用这套SEO结果衡量方法论来定义基线、比较窗口、归因、AI可见性指标、四舍五入规则和发布规范。
结果是对比有日期记录的起点所衡量的变化,使用工作开始前选定的定义进行计算,并在所有其他变化的背景下进行解读。它不是交付后发现的有利数字。这套方法论是我们发布的每一个结果背后的契约:读者应该能够获取相同的源数据,应用所述公式,得出相同的数字。
这一标准至关重要,因为搜索表现是一个观察性系统。页面会变化,竞争对手会反应,需求会波动,搜索引擎会更新,营销活动会重叠。我们可以证明我们发布了什么以及何时发布。我们可以衡量之后发生了什么。只有当研究设计支持时,我们才能声称我们的工作导致了全部变化。
每个结果必须包含的衡量记录
每个发布的结果都必须提供足够的信息以供审计。其记录至少包含:
- 实施前选定的业务目标和指标;
- 指标公式、来源、时区、相关货币及归因模型;
- 网站、目录、模板、页面群组、市场、设备、搜索引擎和提示范围;
- 基线和比较日期,包括每个窗口的完整天数;
- 绝对起始值、绝对最终值和计算出的变化;
- 实施日期及声明中涵盖的确切工作内容;
- 重要标注和已知的竞争性解释;
- 缺失数据、追踪变更、排除项及样本或分母规模;
- 我们有资格使用的归因语言的强度;以及
- 批准面向客户数据的审核人。
如果上述任一字段不可用,我们要么在结果旁披露该限制,要么不予发布。包含免责声明的私人电子表格不能修复未经限定的公开声明。
1. 什么算作结果
衡量的目的是展示工作是否改变了有价值的东西。我们将指标组织为链条,因为每个阶段回答不同的问题:
- 交付: 预期的变更是否被正确发布?示例包括页面上线、模板更新、重定向解析和爬虫访问恢复。
- 发现与可见性: 搜索或AI系统是否发现并展示了该工作?示例包括有效索引页面、展示量、排名分布、AI可见性评分、提及和引用。
- 选择与参与: 用户或答案引擎是否选择了它?示例包括自然点击、合格会话、被引用的URL、参与访问和进入下一步页面的访问。
- 业务成果: 该行为是否创造了价值?示例包括合格线索、试用、购买、订阅收入、预约,或在工作开始前与客户约定的其他成果。
交付是工作已发生的证据。可见性是领先指标:预期在业务成果之前变动的衡量指标。参与度展示响应。业务成果是大多数组织最终为之付费的结果。
因此,对于大多数商业模式而言,仅流量本身不算结果。SaaS公司不会仅仅因为2万名额外访问者阅读了一篇不相关的文章而受益;只有当合适的潜在客户开始或影响试用、演示和订阅时,它才受益。电商企业需要的是盈利的订单,而非与收入和利润脱钩的会话。对于发布商而言,当合格页面浏览量能够产生广告或订阅价值时,可以合理地将其视为业务成果,但即便如此,机器人流量、偶然访问和受众地域分布都可能改变相同访问量的价值。
当流量在指标链条中处于适当位置时,我们会报告流量,并在商业模式允许的情况下,配合质量或下游证据。我们拒绝将展示量、单一排名、页面数量、原始流量、参与率或专有评分作为最终业务影响来呈现——如果没有经过验证的关联。
成果是预先选定的。如果约定的主要成果是合格的演示请求,我们不会在交付后仅仅因为展示量上升而演示请求未上升,就用展示量来替代。
2. 基线:冻结起始点
基线是在首个范围内变更上线之前,对相关范围进行的有日期记录的、不可变的衡量。P5基线衡量阶段 解释了如何捕获基线。基线必须使用与后续检查点相同的公式、来源、筛选条件、分群、时区、货币、归因模型、提示集、竞争对手集和排除条件。
对于比率指标,我们保存分子和分母,而不仅仅是比率。对于全站总量,我们也保存受影响的群组。如果正在优化40个产品页面,它们的基线应与其他8000个URL保持分离;否则,无关的网站整体增长可能掩盖工作的实际效果。
事后重建的基线不是基线。一旦团队知道了结果,关于日期、筛选条件、分群和排除条件的选择就容易受到事后偏见的影响。实时工具也可能改变了它们的处理方式、数据保留、归因或竞争对手数据。将重建称为基线意味着存在实际并不存在的控制。
当客户没有干净的历史数据时,我们使用三种诚实的选择之一:
- 前瞻性基线: 连接并验证衡量,在规定的观察期内不做任何范围内的变更,然后在实施前冻结该时期。
- 重建参考: 导出可用的最佳历史数据,记录来源和追踪变更,标注为"重建",并将声明限制在幸存数据所支持的范围内。
- 不做前后对比声明: 从现在开始衡量,报告绝对检查点表现,直到存在有效的前瞻性比较为止。
缺失数据是未知,而不是零。我们不会仅仅为了制作一张干净的图表而插值填补。如果缺失区间与重大变更重叠,或使比较不再对等,则结果不得作为前后对比声明发布。
3. 比较窗口和报告时钟
两个窗口必须包含相同数量的完整天数,使用相同的星期组合,并排除不完整的当天。我们在结果中同时说明两个范围,而不是使用"上个月"等随时间改变含义的标签。
同比比较是将一个窗口与一年前的同一日历窗口进行比较。当需求有季节性模式且较早数据干净时,这是我们的默认选择。固定假日和移动假日会予以标注;当假日在不同窗口之间移动并实质性影响需求时,我们会调整交易周或披露不匹配情况。
环比比较是比较相邻等长窗口,例如实施后的28个完整天与前28个完整天。当网站缺乏干净的往年数据、业务没有实质性季节性,或者我们需要近期运营信号时,我们使用环比。它更容易受到广告活动、产品发布、假日和市场变化的影响,因此我们从不将其描述为经过季节性调整。
在有足够历史数据的情况下,我们同时展示两者。同比回答"我们是否领先于同期?“环比回答"近期方向是否发生了变化?“如果两者不一致,这种不一致是需要解释的信息,而非隐藏其中一项的理由。
在相关变更之后满28个完整天之前,任何效果变动均不得作为结果报告。更早的观察可以验证页面是否已上线、可抓取、已索引或被引用,但它们属于实施检查而非结果。28天是最低要求,而非自动批准。我们在以下情况下会延长窗口:
- 正常的购买或线索周期超过28天;
- 变更需要时间才能覆盖所有页面或被搜索和AI系统处理;
- 每周体量太小,少数事件就可能主导比率;
- 业务存在强烈的月度、季度或年度季节性;或
- 宕机、广告活动、迁移、追踪变更或重大外部事件污染了窗口的大部分时间。
我们预先注册第一个检查点和预期的报告窗口。我们不会不断移动开始或结束日期,直到曲线看起来有利。
4. 归因的诚实性
归因是将观察到的效果分配给某个原因。时间先后本身不能建立因果:“之后"不一定意味着"因为”。我们使用四个级别的声明。
已验证的交付意味着我们可以将实施变更本身归因于工作:例如,120个指定页面在记录的上线日期收到了有效的规范标签。这不建立效果因果关系。
实验支持的效果需要能够估计增量效应的设计,例如随机化或可信匹配的保留组,具有预先指定的假设、指标、样本和结束日期。我们描述设计和不确定性;我们不会将不完善的内容实验转化为实验室级别的确定性。
贡献性证据适用于受影响群组在记录的变更后发生移动、方向与预先指定的假设一致、且未变更的参考群组或竞争基准未显示相同移动的情况。我们可能会说结果"与"该工作"一致”、“相关"或"支持其贡献”。
仅相关性适用于指标在变更后发生了移动,但不存在有效的反事实情况。我们报告时间顺序和竞争性解释。我们不会说出"产生”、“导致"或"交付"对于该结果。
在日常客户工作中,我们通常无法分离以下因素的影响:
- 搜索引擎或AI供应商算法更新;
- 季节性、假日、天气及潜在需求变化;
- 付费搜索、付费社交媒体、重定向和联盟营销活动;
- 公关报道、创作者活动、品牌活动和线下推广;
- 产品发布、定价、库存、商品销售和转化率变化;
- 迁移、重新设计、追踪变更、同意变更和宕机;
- 竞争对手的发布、损失、促销和媒体支出变化;或
- 经济、监管、文化和品类级别的市场变化。
我们列举实际发生的因素,说明每个因素是否可能影响被衡量的群组,并相应降低声明的强度。如果在上线期间付费和自然流量落在同一页面,我们不会将所有转化归因于自然内容。如果算法更新与检查点重叠,我们可以报告相对于未受影响的分群或竞争对手的变动,但这种比较是证据,而非完美的隔离。
5. 标注使解读成为可能
标注是放置在指标同一时间线上的变更或外部事件的有日期记录。没有标注,归因就变成了数月后的记忆练习。
我们在事件发生时记录,而不是在报告开始时。每个标注记录日期和时区、所有者、受影响的URL或分群、类别、描述、部署或广告活动参考、预期指标和方向、预期延迟、检查点日期以及已知的重叠活动。多日发布有开始和完成日期。撤销和回滚有各自的条目,而不是覆盖原始条目。
我们标注内容发布、技术部署、迁移、重定向、模板变更、分析和同意变更、宕机、付费广告活动、公关、产品和定价变更、重大竞争对手事件以及已确认的平台更新。标注结果 将这些变更、预期、检查点和观察到的结果保持在一起,同时明确将关联视为证据而非因果证明。
6. 我们如何衡量AI可见性
AI可见性指标是分开计算的,因为它们回答不同的问题。我们从不将可见性、声量、引用、情感和排名混合成一个估算的"AI影响"数字。
在比较时期之前,我们冻结提示文本、主题、地区、引擎、运行频率、监控品牌集和监控域名集。一次提示观察是一个定义的提示、引擎、地区和时间表运行所产生的一个存储答案。答案及其引用的URL会被保留,以便汇总数据可以被审计。
AI可见性评分
可见性评分回答:“在追踪的提示集中,该域名在多大比例中获得了至少一次引用?”
AI可见性评分 = 至少引用该域名一次的提示观察数 ÷ 冻结群组中所有有效提示观察数 × 100
一个答案中的多次引用不会使该观察更具可见性;它在分子中只计一次。采集失败不是零引用答案。它是缺失数据,通过覆盖率报告并重新运行,或从两个窗口中一致地排除。AI可见性 视图展示了检查评分所需的基础答案。
声量份额
声量份额回答:“在这些答案中被提及的监控品牌中,该品牌的占比是多少?”
声量份额 = 该品牌的提及次数 ÷ 固定竞争集中所有监控品牌的提及次数 × 100
我们说明计数单位是每个答案一次提及还是每次提及事件,并保持该规则不变。当添加竞争对手时,我们不会重新归一化历史数据;竞争对手集变更加启动新的可比较系列,或导致早期窗口根据存储答案重新计算。
引用份额
引用份额回答:“在分配给监控域名集的引用中,指向该域名的比例是多少?”
引用份额 = 指向该域名的引用数 ÷ 固定集中所有监控域名的引用数 × 100
分子统计引用次数,而非品牌提及次数。一个答案可以引用同一域名的多个URL,每个引用在既定规则下统计。域名级报告不得呈现为页面级表现。来源与引用智能 保留了汇总数据背后的域名、URL、提示和引擎细节。
这些指标存在已知限制。AI答案在不同运行之间可能不同;供应商会更改模型、检索系统、界面和引用行为;位置、语言、个性化和新鲜度可能改变答案;所选提示和竞争对手集定义了被衡量的范围。被追踪的集合是我们选择的问题的可重复样本,而非潜在客户所问问题的普查。引用存在也不证明某人看到、信任或访问了该来源。因此,我们在每次实质性AI可见性声明中都报告引擎、地区、群组、运行频率、覆盖率和绝对计数。
7. 四舍五入、范围和绝对值
百分比从不单独发布。每个百分比都附带用于计算它的绝对值。
对于计数变化,我们报告基线、最终值、绝对差值和相对变化:“合格的自然线索从40增加到52,增加了12条线索,即30%。“对于比率,我们以百分点报告两个比率,并包含它们的分子和分母:“转化率从2.0%(40/2,000)变为2.4%(52/2,167),上升了0.4个百分点。“将其称为0.4%的增长将是错误的;相对增长是20%。
计数为整数。百分比通常四舍五入到一位小数,除非这样会把非零值变成0.0%,在这种情况下我们增加第二位小数。我们从未四舍五入的输入计算变化,仅对显示结果进行四舍五入。低于1,000的值不予缩写。较大的缩写可能出现在标题中,但确切的数字仍保留在正文或可访问的表格中。
我们只在来源或方法确实产生不确定性时使用范围。范围必须注明其方法,例如置信区间、归因模型范围或数据覆盖范围边界。我们不会为了使点估计看起来科学而编造范围,也不会用夸大变动的小百分比取代精确的小计数。
8. 客户匿名化而不失意义
匿名结果必须保持可验证性。我们可以替换客户名称、域名、产品名称和商业敏感数据,但发布的说明必须保留:
- 商业模式、大类目、市场和实质性约束;
- 网站或页面群组范围及变更的页面类型;
- 确切的基线和比较日期及窗口长度;
- 指标定义、来源、归因模型和分母;
- 绝对基线和最终值,或者在合同保密禁止绝对值时的明确索引序列;
- 干预措施、上线日期及衡量前经过的时间;
- 已知的并发活动及由此产生的归因限制;以及
- 足够的操作方法细节,供其他团队应用该计算。
如果无法展示确切的商业值,索引可以将基线设为100,并对每个后续点应用相同比例。我们将其标记为已索引,并在披露允许的情况下仍展示基础事件或样本计数。我们从不将多个客户合并为一个虚构的"典型客户”、更改日期以美化曲线、或隐瞒结果来自某个目录而非整个网站的事实。
如果保留这些背景信息会暴露客户身份,我们就不发布该结果。保密性是保留案例的理由,而非授权发布一个令人印象深刻但无法验证的百分比。
9. 我们不会发布的内容
发布是一种选择决策,因此其规则必须与计算同样严格。我们不会发布:
- 经过挑选的开始日期、结束日期、搜索引擎、国家、设备、提示、关键词或分群;
- 描述为全站增长的单个页面成果;
- 事后因其有利变动而选定的指标;
- 没有基线、最终绝对值和分母(如适用)的百分比;
- 混合不同公式、范围、来源、归因模型、货币或提示群的比较;
- 不完整月份与完整月份的比较,或不等长窗口被呈现为等效比较;
- 缺失观察被视为零,或追踪中断隐藏于连续图表中;
- 在最小窗口之前或正常转化周期完成之前报告的结果;
- 没有提示、引擎、地区、竞争对手和覆盖率定义的AI评分;
- 将相关性结果写成仅由我们的工作导致结果的确凿证据;
- 在完整声明的群组可用时,仅展示最佳页面、查询、引擎或检查点;或
- 未经授权审核人批准准确性、背景和披露的客户结果。
我们也不会从系列中删除不利的检查点。一个未中的假设仍然可以教会团队该改变什么。隐藏它只会使后来的成功可信度降低,而非提高。
发布签审
在发布之前,负责面向客户数据的人员必须从冻结的导出数据重现计算、确认比较范围和日期、检查标注账本、验证每个绝对值和百分比、批准归因措辞,并确认匿名化符合客户协议。第二道编辑审查必须确保标题不超过证据所支持的范围。
最后一个问题很简单:一个持怀疑态度的读者能否识别出什么变了、什么没变、还有什么可能解释这种变动、以及每个数字是如何计算的?如果不能,该结果就不具备发布条件。
准备好付诸实践了吗?
免费检查 · 7天试用 · 无需信用卡