Academia · Auditoría

Cómo verificar la cobertura de Robots.txt y Sitemaps en AmICited

Use la verificación de Robots.txt y Sitemaps en la auditoría de Accesibilidad para Agentes de AmICited para confirmar que los rastreadores de IA y buscadores pueden leer su sitio y que sus sitemaps están declarados y completos.

8 min read · Medium priority

Cómo verificar la cobertura de Robots.txt y Sitemaps en AmICited — video walkthrough

Si los rastreadores de IA no pueden leer su sitio, ninguna de sus demás optimizaciones importa.

Qué es robots.txt, y por qué decide si la IA puede verlo

Robots.txt es un archivo de texto plano ubicado en la raíz de su dominio (sudominio.com/robots.txt) que indica a los rastreadores qué partes de su sitio pueden solicitar. Es anterior al auge de la IA en varias décadas — originalmente se creó para que los bots de motores de búsqueda como Googlebot no perdieran tiempo rastreando páginas de administración, entornos de staging o contenido duplicado. Pero ese mismo mecanismo hoy gobierna una decisión de mucho mayor impacto: si GPTBot, ClaudeBot, PerplexityBot, Google-Extended y los demás rastreadores de IA que alimentan a los motores de respuesta actuales tienen permitido siquiera acceder a sus páginas.

Todo rastreador que se comporta correctamente revisa robots.txt antes de solicitar cualquier otra cosa. El archivo se organiza en bloques, cada uno comenzando con una línea User-agent que nombra a un bot específico (o * para todos los bots), seguida de reglas Allow y Disallow que especifican qué rutas puede o no puede obtener ese bot. Una sola regla general como Disallow: / bajo User-agent: GPTBot es suficiente para excluir a ese rastreador de todo su sitio — y no aparecerá en las citaciones de ChatGPT sin importar cuán bueno sea su contenido. Por eso la rastreabilidad — la propiedad general de que un sitio sea técnicamente accesible para los bots — se trata como la capa fundamental de la visibilidad en búsquedas de IA, y no como un detalle secundario.

Robots.txt también tiene una segunda función: es típicamente donde los rastreadores buscan una referencia a su sitemap, mediante una directiva Sitemap:. Un sitemap XML es una lista estructurada de las URL de su sitio que desea que los rastreadores conozcan, a menudo incluyendo metadatos como fechas de última modificación. Mientras que robots.txt controla el permiso, el sitemap controla el descubrimiento — es el mapa que indica a los rastreadores qué existe, para que no tengan que encontrar cada página únicamente siguiendo enlaces. Un sitio puede tener reglas de robots.txt perfectamente permisivas y aun así estar subindexado por los sistemas de IA simplemente porque su sitemap falta, no está referenciado o está incompleto.

Estos dos archivos importan más para la visibilidad en IA de lo que jamás importaron para el SEO tradicional. Los motores de búsqueda han rastreado la web durante más de 25 años y han construido enormes grafos de enlaces que permiten a Googlebot descubrir páginas incluso sin un sitemap. Los rastreadores de IA son más nuevos, a menudo más conservadores respecto a cuánto de un sitio van a obtener, y más propensos a ser bloqueados directamente por reglas de robots.txt que se escribieron pensando únicamente en Googlebot. Una regla que excluye silenciosamente a bots “desconocidos” o de apariencia agresiva puede atrapar a GPTBot o ClaudeBot como daño colateral. Ese es el modo de fallo específico que la verificación de Robots.txt y Sitemaps existe para detectar — y por eso es una de las primeras cosas que debería verificar cualquier auditoría de accesibilidad para IA , antes de invertir tiempo en contenido, esquemas o cualquier otra cosa.

La sección de Robots.txt y Sitemaps de la auditoría de Accesibilidad para Agentes

Important
Una sola regla demasiado restrictiva en robots.txt puede bloquear a un rastreador de IA de todo su sitio. Esta verificación es donde detecta eso antes de que le cueste citaciones en silencio.

Dónde encontrarlo

Es la sección Robots.txt y Sitemaps de Auditoría → Accesibilidad para Agentes. Accesibilidad para Agentes es la parte de la auditoría de AmICited enfocada específicamente en si los sistemas de IA pueden técnicamente alcanzar y analizar su contenido, a diferencia de las partes del producto centradas en la calidad del contenido y el seguimiento de citaciones. Robots.txt y Sitemaps es típicamente la primera verificación de esa sección, porque todo lo demás que mide la auditoría asume que los rastreadores pueden entrar por la puerta en primer lugar.

Qué verifica

Como explica la sección, examina “si los rastreadores importantes de IA y buscadores pueden leer el sitio, si los sitemaps están declarados en robots.txt y cuántas URL listan esos sitemaps en total.” En resumen:

  • Acceso de rastreadores — ¿los principales bots de IA y búsqueda están permitidos (no bloqueados) en robots.txt? AmICited evalúa las reglas reales de su robots.txt frente a las cadenas de user-agent de los rastreadores que importan para la visibilidad en búsquedas de IA, de modo que usted ve, bot por bot, si está permitido, bloqueado o simplemente no contemplado por ninguna regla (lo cual generalmente se traduce en permitido por defecto bajo el bloque comodín).
  • Declaración de sitemap — ¿se referencia un sitemap desde robots.txt para que los rastreadores puedan encontrarlo? Un sitemap que existe pero no está enlazado desde robots.txt (y no ha sido enviado por otro medio) tiene muchas menos probabilidades de ser detectado automáticamente.
  • Cobertura del sitemap — cuántas URL listan sus sitemaps en total, dándole una comprobación rápida de si sus páginas publicadas realmente se están anunciando a los rastreadores.

Juntas, estas tres verificaciones responden las dos preguntas que determinan si un sistema de IA puede siquiera empezar a evaluar su contenido: ¿se permite la entrada de este rastreador? y ¿sabe qué obtener una vez que está aquí?. Una marca puede estar haciendo todo bien en el aspecto del contenido — respuestas claras, señales de entidad sólidas, páginas bien estructuradas — y aun así ser invisible en las respuestas de IA simplemente porque una de estas dos condiciones falla silenciosamente en segundo plano.

Cómo usarlo

  1. Confirme que los rastreadores están permitidos. Si un bot importante de IA está bloqueado, corrija la regla de robots.txt — este es el problema de mayor prioridad en la página. Revise cada rastreador bloqueado según su intención: una regla que bloquea a GPTBot probablemente se escribió a propósito si no desea que su contenido se use para el entrenamiento del modelo de OpenAI, pero si también está bloqueando silenciosamente a OAI-SearchBot o PerplexityBot — los rastreadores que realmente alimentan las citaciones en vivo, a diferencia del entrenamiento de modelos — está perdiendo visibilidad sin ninguna razón estratégica. Vale la pena decidir deliberadamente qué rastreadores desea permitir que los bots de IA rastreen su sitio en lugar de heredar un valor predeterminado que bloquea todo indiscriminadamente.
  2. Declare su sitemap. Asegúrese de que robots.txt apunte a su sitemap para que los agentes puedan descubrir todas sus páginas. Es una sola línea — Sitemap: https://sudominio.com/sitemap.xml — pero es uno de los detalles que con más frecuencia falta en sitios por lo demás bien construidos, especialmente en sitios donde el sitemap fue generado automáticamente por un CMS pero nunca se volvió a conectar con robots.txt.
  3. Verifique el conteo de URL. Un sitemap que liste muchas menos URL de las que tiene publicadas significa que las páginas no se están anunciando a los rastreadores. Esto suele ser señal de un sitemap desactualizado (generado una vez y nunca regenerado), un índice de sitemaps que no enlaza a todos sus sitemaps hijos, o un plugin de CMS que está excluyendo silenciosamente un tipo de contenido — las entradas de blog publicadas recientemente y las páginas generadas dinámicamente son víctimas comunes.
  4. Vuelva a verificar después de las ediciones y confirme que los mosaicos de Acceso de rastreadores y URL del sitemap en el resumen de preparación se pongan en verde.

El acceso de rastreadores es la base: acierte primero en esto, porque todo lo demás asume que los bots pueden realmente alcanzar su contenido. Una vez que el acceso y el descubrimiento estén confirmados como saludables, el resto de la auditoría de Accesibilidad para Agentes — renderizado, datos estructurados, tiempos de respuesta — empieza a importar, porque esas verificaciones solo dan resultado si al rastreador se le permitió llegar a la página en primer lugar.

También vale la pena recordar que la cobertura de robots.txt y sitemaps no es una corrección de una sola vez. Se lanzan nuevas secciones, las migraciones de CMS regeneran sitemaps con valores predeterminados distintos, y se agregan reglas de CDN o WAF mucho después de que se escribió el robots.txt original — cualquiera de estos factores puede reintroducir silenciosamente un rastreador bloqueado o un sitemap incompleto. Algunos equipos combinan esta verificación con el análisis de logs del servidor para confirmar que los rastreadores realmente están visitando las páginas que tienen permitido visitar, y con un archivo llms.txt dedicado que ofrece a los sistemas de IA un resumen curado de su contenido más importante junto con el sitemap sin procesar. Si no está seguro de dónde encajan la cobertura de robots.txt y sitemaps respecto al resto de su trabajo técnico, una auditoría de visibilidad en IA más amplia recorre el conjunto completo de verificaciones de accesibilidad en secuencia, y la propia herramienta de visibilidad en IA de AmICited rastrea si corregir estos problemas realmente se traduce en más citaciones a lo largo del tiempo — combinando la corrección técnica con el resultado que busca producir, en lugar de tratar “rastreadores permitidos” como la meta final. Para los equipos que gestionan esto en decenas de sitios de clientes, las mismas verificaciones de acceso y sitemap son uno de los elementos recurrentes cubiertos en AmICited para agencias , ya que una sola regla de robots.txt mal configurada tiende a repetirse en varias plantillas y debe detectarse temprano durante la incorporación del cliente, no después de que un cliente pregunte por qué su marca nunca aparece en ChatGPT.

← Todos los tutoriales de la Academia

¿Listo para ponerlo en práctica?

Revisión gratuita · Prueba de 14 días · sin tarjeta de crédito