Mejorar la visibilidad
Auditoría de dominio y accesibilidad para IA
Comprueba si los rastreadores y agentes de IA pueden acceder a tu sitio, leerlo y actuar sobre él: robots.txt, sitemaps, llms.txt, el árbol de accesibilidad, WebMCP, comercio agéntico y Common Crawl, además de un rastreo completo de auditoría del sitio.
Un motor no puede citar una página que no puede obtener, y un agente no puede usar una página que no puede leer. La página Domain audit (Auditoría → Domain audit) reúne las comprobaciones que deciden si tu dominio puede ser encontrado, considerado fiable y leído por rastreadores y agentes de IA. La página Auditoría del sitio (Auditoría → Auditoría del sitio) va más a fondo: rastrea cada URL de tu sitemap e informa de problemas técnicos y de cómo los enlaces internos distribuyen la autoridad.
Ejecuta primero la auditoría de dominio cuando un dominio tenga visibilidad cero o cuando una página que esperas que se cite nunca lo sea. Una sola línea Disallow para GPTBot o una regla de CDN que bloquee rastreadores explica más citas ausentes que cualquier problema de contenido.
Resumen de preparación para agentes#
La parte superior de la página resume cada sección en una fila: puntuación de llms.txt, puntuación de accesibilidad, acceso de rastreadores, URL del sitemap, sitemap frente a robots, WebMCP, comercio agéntico y caducidad del dominio. Tus competidores monitorizados aparecen en tablas comparativas junto a ti, de modo que puedes ver si un rival es simplemente más fácil de leer para los agentes.
robots.txt y sitemaps#
Muestra si los principales rastreadores de búsqueda y de IA tienen permiso para leer el sitio, si los sitemaps están declarados en robots.txt y cuántas URL listan esos sitemaps. Los rastreadores comprobados son:
GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-User, Claude-SearchBot, PerplexityBot, Google-Extended, Googlebot, Bingbot, Applebot, Amazonbot, Meta-ExternalAgent y CCBot.
También señala los conflictos entre tu sitemap y robots.txt: URL del sitemap que tu propio robots.txt bloquea, rastreadores bloqueados en URL que el sitemap lista, archivos de sitemap que están a su vez bloqueados, directivas Sitemap: que apuntan a otro host y archivos de sitemap que superan el límite de 50.000 URL o 50 MB. La ausencia total de robots.txt significa que todos los rastreadores están permitidos por defecto.
Revisión de llms.txt#
/llms.txt es un archivo Markdown que ofrece a los modelos de lenguaje un resumen curado de tu sitio. AmICited obtiene el tuyo y lo valida frente a la propuesta de llmstxt.org: transporte (servido en la raíz por HTTPS con HTTP 200, un tipo de contenido de texto, no el shell HTML de tu app, UTF-8, menos de 128 KB), estructura (un H1 primero, una cita de resumen justo después, secciones H2 que son listas de enlaces, sin encabezados más profundos) y calidad de enlaces (URL absolutas con el formato - [Title](URL): description, sin HTML sin procesar, sin texto de relleno).
- Las comprobaciones Required pesan 1, las recommended pesan 0,5 y los consejos informativos pesan 0 (se muestran como orientación, nunca penalizan).
- Cada comprobación muestra si se superó, qué espera y un ejemplo.
- Re-check now vuelve a obtener el archivo (0,005 créditos). Re-check competitors vuelve a puntuar los suyos.
Ejemplo práctico#
Una revisión completa ejecuta 5 comprobaciones required y 19 recommended (más 4 consejos informativos), que valen 5 + 9,5 = 14,5 puntos. Un archivo que supera todas las comprobaciones required y 15 de las recommended puntúa (5 + 7.5) ÷ 14.5 × 100 = 86.
Árbol de accesibilidad#
Los agentes de IA navegan por una página a través de su árbol de accesibilidad (roles, nombres, estructura), no de sus píxeles. AmICited comprueba el HTML de tu página de inicio, y puedes usar Check URL para cualquier otra página (0,005 créditos por revisión). Las comprobaciones: página accesible, elementos interactivos con nombre, sin elementos interactivos ocultos, imágenes con texto alternativo, controles de formulario etiquetados, un único H1, orden de encabezados, un landmark principal, idioma de la página declarado y un título de documento.
WebMCP, comercio agéntico y Common Crawl#
- WebMCP. Detecta si tu página de inicio expone herramientas que los agentes pueden llamar directamente (buscar, añadir al carrito, reservar) en lugar de adivinar a partir de la página. Las herramientas declarativas se listan con indicadores de lectura o escritura; las herramientas registradas desde JavaScript se anotan pero no se pueden listar a partir de HTML estático.
- Comercio agéntico. Detecta si la página de inicio anuncia un protocolo que permite a los agentes navegar, comprar y pagar (ACP, UCP), con un enlace al manifiesto.
- Common Crawl. Si CCBot puede obtener el sitio (permitido, bloqueado en robots.txt o bloqueado en el borde de la CDN), si el dominio está en el índice más reciente, cuántas URL se capturaron y tu huella a lo largo del tiempo frente a los competidores. Common Crawl es el corpus con el que se construyen la mayoría de los conjuntos de datos de entrenamiento abiertos; no es lo que obtienen GPTBot, OAI-SearchBot o PerplexityBot, así que léelo por separado de la búsqueda con IA en directo.
- Registro del dominio y certificado. Días hasta que caducan el registro del dominio y el certificado TLS, y el registrador.
Auditoría del sitio#
La auditoría del sitio rastrea cada URL del sitemap del dominio, registra los datos técnicos y los enlaces de cada página, y calcula el grafo de enlaces internos.
Configura el escaneo
Ve a Auditoría → Auditoría del sitio y haz clic en Programar escaneo. Define el ritmo (solicitudes por segundo, solicitudes concurrentes, espera máxima por solicitud), cuándo parar (máximo de URL, duración máxima, tasa de errores), qué URL incluir o excluir (hasta 20 expresiones regulares cada una), si guardar los enlaces a sitios externos y si Repetir escaneo cada N días.
Obtén un precio y confirma
Haz clic en Get price. El presupuesto cuenta las URL de tu sitemap, aplica tus filtros y el tope de tu plan, y valora el escaneo a 0,002 créditos por URL (1.000 URL = 2 créditos). El presupuesto es válido durante una hora, y un escaneo no puede empezar a menos que tu saldo lo cubra por completo.
Lee el informe
Pestañas: Issues, Pages & links, Outbound domains, Runs, Respuesta del servidor y Crawl log. Se te notifica cuando termina la ejecución.
El rastreador es educado por diseño: reduce a la mitad su ritmo y se pausa cuando el sitio responde 429 o 503, y se ralentiza cuando los tiempos de respuesta se duplican. Un escaneo detenido conserva todo lo ya obtenido y cobra solo por ello. Cada página recibe un PageRank (simple y ponderado según dónde está el enlace: el contenido principal cuenta más que la navegación o el pie de página) junto a sus clics orgánicos y clics de pago; las columnas de tráfico necesitan Search Console o una plataforma de anuncios conectada.