クロール予算管理チェックリスト
このクロール予算チェックリストを使用して、無駄なボットリクエストを見つけ、ファセットやパラメータを制御し、サイトマップをクリーンアップし、優先URLの発見をより迅速に向上させましょう。
クロール予算 とは、検索エンジンがサイトに対して一定期間内に実行する意思と能力のあるクロール量の実質的な制限です。これを管理するということは、発見やインデックスを改善できないリクエストを減らし、重要なURLを見つけやすく、フェッチしやすくすることを意味します。
チェックリスト: クロール予算管理。タイムボックス: 診断に1〜2営業日、その後承認された修正に1〜3エンジニアリングスプリント。責任者: テクニカルSEOリーダー。貢献者: プラットフォームエンジニア、CDNまたはインフラストラクチャ責任者、アナリティクスエンジニア、影響を受けるURLスペースのマーチャンダイジングまたはコンテンツ責任者。リリース権限: テクニカルSEOリーダーとエンジニアリング責任者の共同判断。
範囲について率直になりましょう:2,000または8,000の正規ページを持つ健全なサイトには、ほとんどクロール予算プロジェクトは発生しません。それは優先順位付け、リンク、品質、またはインデックス可能性の問題です。このチェックリストを開始するのは、大規模または急速に変化するサイトで、クローラーの無駄、発見の遅延、低価値URLの繰り返しクロール、またはホストへの負荷の証拠がある場合です。クローラーレポートに大きな数字が表示されているからではありません。
このフェーズの目的とその理由
これは番号付きフェーズではなくスタンドアロンのチェックリストですが、技術ベースライン監査 を前提としています:正規ルール、ステータスコードの所見、レンダリング動作、サイトアーキテクチャ、サイトマップインベントリ、インデックスカバレッジ。また、承認されたコンテンツインベントリも必要です。「無駄」は、ビジネスがどのURLを見つけ、更新し、インデックスすべきかを決定するまでは定義できないからです。
価値のある正規ページをフィルター、重複、期限切れ在庫、内部検索、管理ルートから区別できるようになった後に実行してください。それより早く実行すると、包括的なブロックにつながる可能性があります。大規模なプログラムによる展開、移行、またはファセットナビゲーションのリリース後に実行するのは遅すぎます。クローラーが事実上無制限のURLスペースに閉じ込められている可能性があります。
真に大規模なサイトでこれをスキップすると、新しく変更された優先URLが無限のパラメータの組み合わせ、エラーページ、リダイレクトチェーン、重複の後ろで待機することになります。小規模で健全なサイトで実行すると、実際の制約に対処することなくエンジニアリング時間を消費します。依存関係の議論はシンプルです:分類は制御に先立ち、証拠はルールに先立ちます。
インプットとアウトプット
アウトプットはエンジニアリングとの契約であり、次の測定サイクルです。「クロール効率の改善」は成果物ではありません。
| 方向 | 項目 | 受理条件 |
|---|---|---|
| インプット | 正規URLインベントリ | 対象範囲内のすべてのURLまたはパターンに意図されたステータスがある:インデックス可能な正規、重複、リダイレクト、期限切れ、ブロック、またはエラー。 |
| インプット | 検証済みサーバーログ | 少なくとも14の代表的な日について、タイムスタンプ、リクエストURL、ステータス、応答バイト数または時間、ユーザーエージェント、利用可能な場合はリファラー、および検証済みの検索ボット識別情報を含む。 |
| インプット | カバレッジとサイトマップのエクスポート | エクスポート日、プロパティ、送信URL、インデックス判定、最終クロールの証拠、警告、エラーを記録。 |
| インプット | リンクグラフ | クロール元、宛先、深度、インバウンドリンク数、正規ターゲット、ステータス、テンプレートが、発見可能なすべての内部URLについて利用可能。 |
| インプット | リリースと需要のコンテキスト | 移行、テンプレート変更、在庫変動、公開頻度、優先ディレクトリ、季節的な期限を日付付きで記録。 |
| アウトプット | クロール予算の診断 | ボット、テンプレート、ディレクトリ、ステータス、パラメータパターン、正規状態、ビジネス優先度ごとのリクエストを定量化。 |
| アウトプット | URLパターンポリシー | すべての無駄なパターンに1つの処理、責任者、リスク、テストケース、ロールアウト範囲、ロールバック条件を割り当て。 |
| アウトプット | サイトマップとリンクの改善 | 追加または削除するURL、深度目標、ナビゲーション変更、孤立ページの修正、リリース後に必要な証拠を明示。 |
| アウトプット | モニタリングベースライン | 変更前の比率、再クロール待ち時間、エラー率、優先URLカバレッジ、チェックポイント、アラートしきい値を保存。 |
チェックリスト
各項目についてPASS、FAIL、またはN/Aを記録し、証拠を添付してください。各項目は、「完了条件」が観測可能になった時点で完了とみなされます。
1. クロール予算が制約であることを証明する
内容: この作業がプロジェクトに値するかどうかを判断する。理由: クロール予算は、ページが実際には低品質、孤立、非正規、ブロック、または意図的に除外されている場合にしばしば非難される。方法: 正規URL数、日次URL作成数、サーバーヘルス、最終クロール日、発見遅延、カバレッジ理由、および正当なボットリクエストのうち正規インベントリ外に費やされた割合を比較する。ディレクトリとテンプレートでセグメント化する;サイト全体の平均は、1つの問題セクションを隠してしまう。ツール: ログパイプライン、クローラー、検索エンジンのカバレッジレポート、サイトマップエクスポート、リリースカレンダー。完了条件: 署名入りの診断が、少なくとも1つの測定された制約を特定するか、「重要ではない」として証拠とより適切な次のアクションとともにチェックリストを終了する。
2. 信頼性のあるボットリクエストデータセットを構築する
内容: 分析ウィンドウに対して1つの正規化されたリクエストテーブルを作成する。理由: ユーザーエージェント文字列は偽装される可能性があり、サンプリングされたアナリティクスはボットを除外し、CDNログはオリジンログと異なる場合がある。ログファイル分析 とは、サーバーのアクセス記録を調査してクローラーが実際に何をリクエストしたかを確認することを意味する。方法: 必要に応じてCDNとオリジンデータを組み合わせ、ホストとURLエンコーディングを正規化し、レンダリングが対象範囲内でない限り静的アセットを削除し、公開されている検証方法で主要な検索ボットを確認し、ステータス、バイト数、応答時間、キャッシュ結果を保持する。ツール: CDNまたはウェブサーバーログ、DNS検証、SQLまたはログアナライザー。完了条件: 日付範囲と保持期間が文書化され、既知のボットが未確認のエージェントから分離され、合計が生レコードと一致し、同じクエリで診断のすべてのグラフを再現できる。
3. リクエストがどこで無駄になっているかを測定する
内容: すべてのクローラーのリクエストを、有用な正規、重複、リダイレクト、エラー、ブロック、パラメータ、ファセット、内部検索、ソフト404、アセット、または不明に分類する。ソフト404とは、200 OKを返すが、存在しないか空の結果のように動作するページのこと。理由: 総クロールボリュームだけでは、クローラーが在庫をリフレッシュしているのか、無価値な状態をループしているのかがわからない。方法: リクエストをクロールと正規インベントリに結合し、正規化されたパスとパラメータシグネチャでグループ化し、リクエスト数とサーバーコストでパターンをランク付けする。これらのパターンを、発見されたがインデックスされていない、クロールされたがインデックスされていない、重複、ブロック、ソフト404などのカバレッジ理由と照合する;カバレッジは検索エンジンの報告された結果を説明し、ログはリクエストを証明する。不明なグループは便利なラベルに押し込むのではなく、手動で検査する。ツール: 検証済みログ、カバレッジエクスポート、サイトクローラー、正規エクスポート、応答プロファイラー。完了条件: 対象範囲内のボットリクエストの少なくとも95%がレビュー済みの分類を持ち、残りの不明分がリストアップされ、上位の無駄パターンにサンプルURL、カバレッジ結果、責任者が割り当てられている。
4. ファセットとパラメータを発生源で抑制する
内容: フィルター、並び替え、ページネーション、トラッキング、セッション、検索パラメータを管理する。ファセットナビゲーション により、ユーザーはブランド、色、サイズなどのフィルターを組み合わせることができ、制御されていない組み合わせは事実上無限のクロールスペースを生み出す可能性がある。理由: テンプレートが数百万のリンクを生成した後にクローラーをブロックしても、症状を治療するだけで、発見、ユーザー行動、アナリティクス、その他のボットは露出したままになる。方法: 各パラメータに機能と1つのポリシーを割り当てる:インデックス可能なランディングページ、正規重複、noindexページ、リダイレクト、リンク解除状態、またはブロックパターン。安定したパラメータ順序を使用し、空の組み合わせや矛盾する組み合わせを防止し、トラッキングやセッションパラメータを内部リンクから削除する。実質的に異なるコンテンツを持つページを抑制目的だけで正規化しない。ツール: パラメータレジストリ、テンプレートソース、URLパターンレポート付きクローラー、ログ、自動URLテスト。完了条件: 観測されたすべてのパラメータに1つの承認済みポリシーがあり、クロール可能なテンプレートは許可された組み合わせのみを出力し、禁止された組み合わせにはテストカバレッジがあり、対象パターンのログボリュームが合意されたチェックポイントで低下している。
5. 無限スペースとクロールトラップを排除する
内容: 無制限の日付、カレンダー、ページネーション、ID、大文字小文字のバリエーション、パスセグメント、再帰的フィルターを生成できるルートを閉じる。理由: すべてのページが同じ空または重複した結果を含んでいても、クローラーは構文的に新しいURLを発見し続けることができる。方法: 有限の境界を設定し、不可能な状態には404または410を返し、有効な範囲のみにリンクし、大文字小文字と末尾スラッシュのルールを正規化し、正確な重複は一度だけリダイレクトし、最終結果セットを超える次ページリンクの生成を停止する。正常系だけでなく、不正な形式や極端な値もテストする。ツール: 合成URLジェネレーター、クローラー、ログ、ルーターテスト、エッジルールテスト。完了条件: 各ジェネレーターに文書化された最大値があり、範囲外の状態は意図された応答を返し、テストされたルートが新しい無制限シーケンスを作成せず、影響を受けるリクエストパターンが価値のあるページをブロックせずに減少している。
6. ソフト404、エラー、リダイレクトの無駄を修正する
内容: 応答コードが実際の結果を説明するようにする。理由: 200の空ページはクローラーに存在しないと宣言すべきコンテンツを解析・評価させ、繰り返される5xx応答は容量を消費しホストを信頼性の低いものに見せ、チェーンは1つの宛先に到達するために複数のリクエストを費やす。方法: 存在しないURLには404を、適切な場合は意図的に削除されたリソースには410を、実質的なコンテンツがあるページにのみ200を返し、移動したURLには最終的な正規宛先への単一リダイレクトを返す。リダイレクトやエラーを指している内部リンクを修正する。ツール: ログ、クローラー、HTTPテストスイート、モニタリング、ルートインベントリ。完了条件: サンプリングされた空の結果が200を返さなくなり、優先ルートにリダイレクトチェーンがなく、内部リンクが直接解決され、判断ルールのエラー率しきい値が2回連続の測定ウィンドウで合格する。
7. 正規化とインデックス制御を一貫させる
内容: 応答、正規URL
、meta robots、HTTP robotsヘッダー、内部リンク、サイトマップメンバーシップを整合させる。理由: 矛盾したシグナルは繰り返しの再訪問を引き起こす:URLがサイトマップで送信され、別の場所で正規化され、ナビゲーション全体でリンクされ、そのステータスを説明するディレクティブからブロックされる可能性がある。方法: URLクラスごとにルールマトリックスを作成し、レンダリングされた本番応答をテストする。robots.txt
をクローラーアクセスの管理に使用し、信頼性のある削除メカニズムとしては使用しない;ブロックされたURLは、それをフェッチしないクローラーに対してページレベルのnoindexディレクティブを明らかにできない。ツール: クローラー、生およびレンダリングされたHTML、ヘッダーインスペクター、ロボットテスター、URLインスペクション。完了条件: 優先サンプルの100%とすべてのテンプレートテストケースが1つの一貫したルールに一致し、インデックス可能な正規URLがブロックされておらず、除外されたパターンがサイトマップや主要ナビゲーションを通じて促進されていない。
8. XMLサイトマップを優先フィードにクリーンアップする
内容: 各XMLサイトマップ
には、正規で、インデックス可能で、200のURLと真実の更新日のみを公開する。理由: サイトマップは発見シグナルであって、CMSが生成したすべてのURLのアーカイブではない。リダイレクト、重複、エラー、変更されていないlastmodタイムスタンプはそのシグナルを希釈し、カバレッジの比較を不明瞭にする。方法: サイトマップURLを正規インベントリと照合し、コンテンツタイプやディレクトリなどの安定した診断単位でファイルを分割し、除外されたURLを削除し、実質的なページ変更があった場合のみlastmodを更新する。変更されたサイトマップを送信し、ダウンロード、警告、エラーを記録する。ツール: サイトマップパーサー、CMSエクスポート、ログ、検索エンジンのサイトマップレポート。完了条件: 送信されたすべてのURLが200を返し、自己正規かつインデックス可能であり、除外数がゼロで、lastmodがサンプリングされたコンテンツ変更チェックに合格し、送信数が承認されたインベントリと一致する。
9. 内部リンクを使用して優先ページを引き寄せる
内容: 孤立ページを修復し、有用な内部リンク を通じて高価値URLへのクリック距離を短縮する。クロール深度 とは、クローラーが選択した開始ページからあるページに到達するために必要なリンクステップの数です。理由: 無駄をブロックしてもクローラーに次に訪問する場所は伝わらない。強く頻繁に訪問されるページからの安定したHTMLリンクがそれを伝える。方法: ホームページおよび関連ハブからの深度とインバウンドリンクを計算し、ユーザーが恩恵を受ける場所にコンテキストリンクまたはナビゲーションリンクを追加し、リダイレクトされたURLへのリンクを置き換え、ページネーションがより深い在庫を公開するようにする。すべてをフッターにフラット化しない。ツール: リンクグラフクローラー、テンプレート、ログ、ディレクトリ別の検索パフォーマンス。完了条件: すべての優先URLに少なくとも1つのクロール可能なインバウンドリンクがあり、優先的な孤立ページがなく、合意された優先テンプレートが関連ハブから3リンクステップ以内にあり、ログが新しくリンクされたサンプルが発見または再訪問されていることを確認する。
10. ホスト容量とレンダリングパスを保護する
内容: 検索ボットに実質的に異なるページを提供することなく、クローラーのリクエストを高速かつ成功させる。理由: クロール需要は、タイムアウトするホスト、正当なクローラーを無差別にレート制限するホスト、または基本的なコンテンツやリンクに高コストなレンダリングを必要とするホストを補償できない。方法: ボット、ルート、キャッシュステータス、テンプレートごとに応答時間とエラーを比較する;安全な応答をキャッシュする;高コストなクエリパスを削除する;初期応答に必須のHTMLとリンクを保持する;検証済みボットでファイアウォールとCDNルールをテストする。ツール: アプリケーションパフォーマンスモニタリング、CDNアナリティクス、ログ、稼働時間テスト、レンダリングページ検査。完了条件: ホストが想定される負荷の下で合意された応答時間とエラーしきい値を満たし、検証済みクローラーが誤ってチャレンジされず、優先コンテンツとリンクがユーザー操作なしで存在する。
11. パターンごとに展開し、トレードオフを検証する
内容: 最小の一貫したルールセットをリリースし、前後を比較する。理由: グローバルなrobots、正規、ルーティング、またはナビゲーションの変更は、無駄を排除するよりも速く価値のあるロングテールページを削除する可能性がある。方法: 1つの測定可能なURLパターンまたはディレクトリから開始し、可能な場合はコントロールを保持し、リリースに注釈を付け、完全なクロールサイクル後にボットリクエスト、エラー、優先再クロール待ち時間、カバレッジ、インプレッション、サーバー負荷を比較する。ロールバック手順をルールの横に保持する。ツール: デプロイメントログ、サーバーログ、カバレッジレポート、AmICitedレポート、モニタリング。完了条件: 対象の無駄測定値が改善し、優先発見とインデックスが宣言された許容範囲を超えて悪化せず、責任者が結果に署名し、次のロールアウトまたはロールバックの決定が記録される。
AmICitedのツール
AmICitedは診断に関する検索エンジンとパフォーマンスの証拠を提供します。生のサーバーログは、ボット全体のリクエストレベル動作の真実の情報源であり続けます。
- Bingクロール をライブBingクロールレポート で開き、Bingのクロールアクティビティと報告されたURLの問題を確認します。範囲、問題タイプ、サンプルURL、エクスポート時間をキャプチャしてください。Bingの動作をすべてのクローラーに一般化しないでください。
- サイトマップとインデックス をサイトマップレポート で使用して、送信数、最終ダウンロード日、警告、エラーを比較し、クリーンアップしたサイトマップを送信するか、変更された優先URLの制限されたバッチのインデックスをリクエストします。リクエストは再検討を加速しますが、ブロックされたり低品質のページがインデックス可能になるわけではありません。
- 代表的な成功パターン、無駄パターン、修正済みページをURLインスペクション のURLインスペクションレポート で確認します。宣言および選択された正規URL、カバレッジ判定、最終クロール日、検査時間を記録します。そのカバレッジビューは増加するサンプルであり、完全なクロール予算レポートではありません。
- Googleサーチディレクトリ をディレクトリレポート で開き、ディレクトリを制限したりリンクを変更する前に、セクションごとのクリック数とインプレッション数を比較します。トラフィックの少ないセクションでも戦略的に必要な場合があります。このレポートを使用して検索影響を評価し、それだけをもってクロールの無駄を宣言しないでください。
判断ルール:数値で見る悪い状態
これらはこのチェックリストの運用トリガーであり、普遍的な検索エンジンの制限ではありません。文書化されたサイトベースラインと承認されたリスク許容度がある場合のみ置き換えてください。
| 測定項目 | 合格 | 調査 | 対応 | |
|---|---|---|---|---|
| 正規URL数と変更率 | 10,000未満で安定、遅延の証拠なし | 10,000〜100,000または頻繁な在庫変更 | 100,000超で発見遅延または無駄あり;1,000,000超はローンチ前でも定期的なガバナンスが必要 | |
| 非正規URL、パラメータ、リダイレクト、エラー、またはソフト404への検証済み検索ボットリクエスト | 10%未満 | 10〜25% | 2回の代表ウィンドウで25%超 | |
検証済み検索ボットへの5xx応答 | 0.5%未満 | 0.5〜1% | 1日で1%超、または優先テンプレートで持続的なクラスター | |
| ボットリクエスト内のリダイレクト応答 | 5%未満 | 5〜10% | 10%超、または繰り返されるマルチホップチェーン | |
| サイトマップの有効性 | 100%正規、インデックス可能な200URL | 積極的に修正中の不一致あり | リダイレクト、エラー、ブロック、noindex、または非正規サイトマップメンバーの繰り返し | |
| リリース後の優先ページ発見または再クロール(7日以内) | 90%以上観測 | 70〜89% | 70%未満、少なくとも20の優先URLで測定 | |
| 優先ページのリンク深度 | 関連ハブから3ステップ以内 | 4ステップ | 5ステップ以上、または孤立ページあり | |
| 不明なリクエスト分類 | 5%未満 | 5〜10% | 検証済みボットリクエストの10%超 |
URL数行を超えたという理由だけでクロール予算プロジェクトを開始しないでください。逆に、カレンダートラップが数百万の異なるURLを生成している20,000ページのサイトを無視しないでください。制約された発見または無駄の証拠が判断の決め手となります。
成果物
「クロール最適化済み」というスライドではなく、バージョン管理されたパッケージを引き渡してください:
crawl-budget-summary.md:範囲、判断、ボット検証方法、分析ウィンドウ、発見事項、承認済み処理、リスク、リリース順序、ロールバックトリガー。crawl-pattern-register.csv:正規化されたパターン、サンプルURL、目的、リクエスト数、シェア、応答、正規状態、サイトマップ状態、インバウンドリンク、ビジネス価値、処理、責任者、ステータス。priority-url-sample.csv:発見、最終クロール、インデックス判定、深度、インバウンドリンク、応答、選択された正規URLのベースラインとチェックポイントフィールドを持つ少なくとも20のURL。sitemap-reconciliation.csv:送信URL、在庫状態、応答、正規、インデックス可能性、lastmod検証、アクション、証拠。monitoring-spec.md:クエリ、ダッシュボード、しきい値、責任者、頻度、アラートルート、チェックポイント日付、保持期間。
テクニカルSEOリーダーがパッケージを管理します;エンジニアリングがルートとインフラストラクチャの変更に署名します;コンテンツまたはマーチャンダイジング責任者は、発見可能なユーザーパスやインデックス可能なランディングページを削除する決定に署名します。
よくある問題
チームが小規模サイトを最適化してしまう。 エンジニアがパラメータをブロックするスプリントに時間を費やす一方で、重要なページは薄いままか孤立したままになる。チェックリストを「重要ではない」として終了し、コンテンツ、リンク、またはインデックス可能性に作業を振り向けてください。
Robots.txtが削除ツールになる。 ブロックされたURLは既知のまま残る可能性があり、クローラーはそのページレベルのディレクティブを取得できなくなる。最初に意図されたライフサイクルを定義し、内部生成を削除し、それに一致する応答、リダイレクト、正規、またはnoindex動作を使用してください。
すべてのファセットが重複として扱われる。 実際の需要があるブランドとカテゴリの組み合わせは有用なランディングページになり得ますが、並び替え順序は通常そうではありません。需要とコンテンツの明確さを使用してパターンレベルで判断してください。
正規タグがクロールを停止すると期待される。 正規タグは優先バージョンを表現しますが、関係を評価するために重複が依然としてフェッチされる可能性があります。1つのヒントに依存するのではなく、無駄なリンクと生成を削除してください。
サイトマップがデータベースダンプになる。 リダイレクト、期限切れ、ブロック、非正規URLは、チームが実際にクロールしてほしいインベントリを不明瞭にする。サイトマップメンバーシップをリリースゲートとして調整してください。
アナリティクスがログと誤認される。 クライアントサイドのアナリティクスは検索ボットのリクエストをほとんど記録しない。検証済みのアクセスログがなければ、チームはリクエストの割り当てや応答コストを測定できません。
ロールアウトが収益ページをブロックする。 広範なパラメータまたはパスルールが、有効なカテゴリ、ローカライズされたページ、ページネーション、またはキャンペーン先を捕捉する。ポジティブとネガティブの例をテストし、1つのパターンから段階的に展開し、迅速なロールバックを維持してください。
成功=リクエストの減少。 価値のあるページが発見から消えることでクロールボリュームが低下する可能性がある。成功した変更は無駄を減らしつつ、優先発見、インデックス、検索需要が健全な状態を維持します。
次のフェーズ
パターンレジスタ、サイトマップ調整、優先サンプル、モニタリングしきい値を継続的なリフレッシュと反復 に引き継いでください。そのフェーズには安定した発見パスと信頼性のある変更シグナルが必要です。そうでなければ、リフレッシュされたページが正しく公開されても、クロールトラップや弱い内部リンクの背後で見えないままになる可能性があります。
移行、プラットフォームまたはルーティングの変更、ファセットナビゲーションのリリース、大規模な在庫拡張、持続的なエラーインシデント、または合意されたしきい値違反の後に、このチェックリストを再開してください。モニタリングベースラインがクリーンな状態で、カレンダー上の定期的な間隔で全体を再実行しないでください。
FAQ
以下のFAQでは、範囲、ロボットルール、パラメータ、サイトマップ、レビュー頻度をカバーしています。基本原則は一貫しています:最初にURLスペースを分類し、次にリクエスト証拠を使用し、意図されたユーザーとインデックスの成果が明確な場合にのみクローラー制御を変更します。
このセクションの他のチュートリアル
実践する準備はできましたか?
無料チェック · 7日間お試し · クレジットカード不要