NoAI 元标签:通过 Header 控制 AI 访问

理解网络爬虫与元标签

网络爬虫是自动化的程序,系统性地浏览互联网并从网站收集信息。历史上,这些机器人主要由 Google 等搜索引擎运营,其 Googlebot 会爬取页面、索引内容,并通过搜索结果将用户引导回网站——形成一种互惠互利的关系。然而,AI 爬虫的出现从根本上改变了这一动态。与传统搜索引擎机器人通过提供引荐流量换取内容访问权不同,AI 训练爬虫会消耗大量网络内容来构建大型语言模型的数据集,往往给发布者带来极少甚至为零的流量。这种转变使得元标签——向爬虫传达指令的小型 HTML 指令——对于希望维护自身作品被人工智能系统使用方式控制权的内容创作者来说日益重要。本指南严格聚焦于这一访问控制问题;有关仍然影响索引、点击率和 AI 概览可见性的更广泛元标签集,请参阅 AI 元标签:什么仍然重要

什么是 NoAI 和 NoImageAI 元标签?

noainoimageai 元标签是 DeviantArt 于 2022 年创建的指令,旨在帮助内容创作者防止其作品被用于训练 AI 图像生成器。这些标签的工作原理类似于早已建立的 noindex 指令,后者告知搜索引擎不要索引某个页面。noai 指令表示页面上的任何内容都不应用于 AI 训练,而 noimageai 则特别防止图像被用于 AI 模型训练。你可以使用以下语法在 HTML head 部分实现这些标签:

<!-- 阻止所有内容用于 AI 训练 -->
<meta name="robots" content="noai">

<!-- 仅阻止图像用于 AI 训练 -->
<meta name="robots" content="noimageai">

<!-- 同时阻止内容和图像 -->
<meta name="robots" content="noai, noimageai">

以下是不同元标签指令及其用途的对比表:

指令用途语法范围
noai阻止所有内容用于 AI 训练content="noai"整个页面内容
noimageai阻止图像用于 AI 训练content="noimageai"仅图像
noindex阻止搜索引擎索引content="noindex"搜索结果
nofollow阻止链接跟踪content="nofollow"出站链接
Logo

Ready to Monitor Your AI Visibility?

Track how AI chatbots mention your brand across ChatGPT, Perplexity, and other platforms.

元标签与 HTTP Header 的区别

元标签直接放置在你的 HTML 中,而 HTTP Header 提供了一种在服务器级别传达爬虫指令的替代方法。X-Robots-Tag header 可以包含与元标签相同的指令,但运作方式不同——它在页面内容传送之前就在 HTTP 响应中发送。这种方法对于控制对非 HTML 文件(如 PDF、图像和视频)的访问尤为有价值,因为你无法在其中嵌入 HTML 元标签。

对于 Apache 服务器,你可以在 .htaccess 文件中设置 X-Robots-Tag header:

<IfModule mod_headers.c>
    Header set X-Robots-Tag "noai, noimageai"
</IfModule>

对于 NGINX 服务器,在服务器配置中添加 header:

location / {
    add_header X-Robots-Tag "noai, noimageai";
}

Header 能够为整个网站或特定目录提供全局保护,使其成为全面 AI 访问控制策略的理想选择。

AI 爬虫如何遵守(或忽略)这些指令

noai 和 noimageai 标签的有效性完全取决于爬虫是否选择遵守它们。来自主要 AI 公司的行为规范的爬虫通常会遵循这些指令:

  • GPTBot(OpenAI)——遵守 noai 指令
  • ClaudeBot(Anthropic)——遵守 noai 指令
  • PerplexityBot(Perplexity)——遵守 noai 指令
  • Amazonbot(亚马逊)——遵守 noai 指令
  • CCBot(Common Crawl)——遵守 noai 指令
  • 较小/未知的爬虫——可能不遵守指令

然而,行为不规范的机器人和恶意爬虫可以故意忽略这些指令,因为没有强制执行机制。与搜索引擎已同意作为行业标准遵守的 robots.txt 不同,noai 并非官方网络标准,这意味着爬虫没有义务遵守。这就是安全专家推荐采用分层方法结合多种保护方法,而非仅依赖元标签的原因。

不同平台上的实现方法

实现 noai 和 noimageai 标签的方法因你的网站平台而异。以下是最常见平台的分步说明:

1. WordPress(通过 functions.php) 将此代码添加到子主题的 functions.php 文件中:

function add_noai_meta_tag() {
    echo '<meta name="robots" content="noai, noimageai">' . "\n";
}
add_action('wp_head', 'add_noai_meta_tag');

2. 静态 HTML 网站 直接添加到 HTML 的 <head> 部分:

<head>
    <meta name="robots" content="noai, noimageai">
</head>

3. Squarespace 导航至 设置 > 高级 > 代码注入,然后添加到 Header 部分:

<meta name="robots" content="noai, noimageai">

4. Wix 前往 设置 > 自定义代码,点击"添加自定义代码",粘贴元标签,选择"Head",并应用于所有页面。

每个平台提供不同级别的控制——WordPress 可通过插件实现页面级别的特定实现,而 Squarespace 和 Wix 则提供全局网站范围的选项。选择最适合你技术熟练程度和特定需求的方法。

NoAI 标签的局限性和有效性

虽然 noai 和 noimageai 标签代表了向保护内容创作者迈出的重要一步,但它们具有显著的局限性。首先,这些并非官方网络标准——DeviantArt 创建它们作为社区倡议,意味着没有正式的规范或强制执行机制。其次,合规完全是自愿的。来自主要公司的行为规范的爬虫遵守这些指令,但行为不规范的机器人和抓取工具可以毫无后果地忽略它们。第三,缺乏标准化意味着采纳程度不一。一些较小的 AI 公司和研究机构可能甚至不知道这些指令,更不用说实现支持了。最后,仅靠元标签无法阻止有决心的恶意行为者抓取你的内容。恶意爬虫可以完全忽略你的指令,这使得额外的保护层对于全面的内容安全至关重要。

将元标签与 robots.txt 及其他方法结合使用

最有效的 AI 访问控制策略使用多层保护,而非依赖任何单一方法。以下是不同保护方法的对比:

方法范围有效性难度
元标签 (noai)页面级别中等(自愿遵守)简单
robots.txt全站范围中等(仅建议性)简单
X-Robots-Tag Header服务器级别中高(覆盖所有文件类型)中等
防火墙规则网络级别高(在基础设施层面阻止)困难
IP 白名单网络级别非常高(仅限已验证来源)困难

一个全面的策略可能包括:(1) 在所有页面上实现 noai 元标签,(2) 添加 robots.txt 规则阻止已知的 AI 训练爬虫,(3) 在服务器级别为非 HTML 文件设置 X-Robots-Tag header,以及 (4) 监控服务器日志以识别忽略你指令的爬虫。这种分层方法显著增加了恶意行为者的难度,同时保持与遵守你偏好的行为规范爬虫的兼容性。

监控和验证爬虫合规性

实现 noai 标签和其他指令后,你应该验证爬虫是否实际遵守了你的规则。最直接的方法是检查服务器访问日志中的爬虫活动。在 Apache 服务器上,你可以搜索特定爬虫:

grep "GPTBot\|ClaudeBot\|PerplexityBot" /var/log/apache2/access.log

如果你看到来自已阻止爬虫的请求,说明它们正在忽略你的指令。对于 NGINX 服务器,使用相同的 grep 命令检查 /var/log/nginx/access.log。此外,Cloudflare Radar 等工具可提供你网站上 AI 爬虫流量模式的可视化,显示哪些机器人最为活跃以及它们的行为如何随时间变化。定期日志监控——至少每月一次——有助于你识别新的爬虫并验证你的保护措施是否按预期工作。

AI 访问控制标准的未来

目前,noai 和 noimageai 存在于一个灰色地带:它们被主要 AI 公司广泛认可和遵守,但仍然是非官方且非标准化的。然而,正式标准化的势头正在增长。W3C(万维网联盟)和各行业团体正在讨论如何创建 AI 访问控制的官方标准,使这些指令获得与 robots.txt 等既定标准同等的权重。如果 noai 成为官方网络标准,合规将成为预期的行业实践而非自愿行为,从而显著提高其有效性。这一标准化工作反映了科技行业对内容创作者权利以及 AI 开发与发布者保护之间平衡的更广泛观念转变。随着越来越多的发布者采纳这些标签并要求更强有力的保护,官方标准化的可能性也在增加,可能使 AI 访问控制像搜索引擎索引规则一样成为网络治理的基本组成部分。

带有元标签控制的网络爬虫和 AI 机器人访问网站
显示 HTML 元标签和 HTTP Header 实现的代码编辑器

常见问题

Yasha 是一位才华横溢的软件开发者,专注于 Python、Java 和机器学习。Yasha 撰写有关人工智能、提示工程和聊天机器人开发的技术文章。

Yasha Boroumand
Yasha Boroumand
CTO, FlowHunt

监控 AI 如何引用你的品牌

使用 AmICited 追踪 ChatGPT、Perplexity 和 Google AI Overviews 等 AI 系统在不同 AI 平台上如何引用你的内容。

了解更多

NoAI 元标签
NoAI 元标签:保护内容免受 AI 训练

NoAI 元标签

了解 NoAI 元标签是什么、它如何防止 AI 抓取、实现方法,以及其在保护您的内容免受未经授权的 AI 训练方面的有效性。

2 分钟阅读