Documentazione

Migliora la visibilità

Audit del dominio e accessibilità AI

Verifica se i crawler e gli agenti AI possono raggiungere, leggere e usare il tuo sito: robots.txt, sitemap, llms.txt, albero di accessibilità, WebMCP, agentic commerce e Common Crawl, più una scansione completa dell’audit del sito.

Un motore non può citare una pagina che non riesce a recuperare, e un agente non può usare una pagina che non riesce a leggere. La pagina Domain audit (Audit → Domain audit) raccoglie i controlli che decidono se il tuo dominio può essere trovato, considerato affidabile e letto dai crawler e dagli agenti AI. La pagina Audit del sito (Audit → Site audit) va più a fondo: scansiona ogni URL della tua sitemap e riporta i problemi tecnici e come i link interni distribuiscono l’autorevolezza.

Esegui prima l’audit del dominio quando un dominio ha visibilità zero o quando una pagina che ti aspetti venga citata non lo è mai. Una singola riga Disallow per GPTBot o una regola della CDN che blocca i crawler spiega più citazioni mancanti di qualsiasi problema di contenuto.

Riepilogo della predisposizione per gli agenti#

La parte alta della pagina riassume ogni sezione in una riga: punteggio llms.txt, punteggio di accessibilità, accesso dei crawler, URL della sitemap, sitemap rispetto a robots, WebMCP, agentic commerce e scadenza del dominio. I tuoi concorrenti monitorati compaiono nelle tabelle di confronto accanto a te, così puoi vedere se un rivale è semplicemente più facile da leggere per gli agenti.

robots.txt e sitemap#

Mostra se i principali crawler di ricerca e AI sono autorizzati a leggere il sito, se le sitemap sono dichiarate in robots.txt e quanti URL elencano. I crawler controllati sono:

GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-User, Claude-SearchBot, PerplexityBot, Google-Extended, Googlebot, Bingbot, Applebot, Amazonbot, Meta-ExternalAgent e CCBot.

Segnala anche i conflitti tra la tua sitemap e robots.txt: URL della sitemap che il tuo stesso robots.txt blocca, crawler bloccati su URL che la sitemap elenca, file sitemap a loro volta vietati, direttive Sitemap: che puntano a un altro host e file sitemap oltre il limite di 50,000 URL o 50 MB. L’assenza totale di robots.txt significa che ogni crawler è consentito per impostazione predefinita.

Revisione di llms.txt#

/llms.txt è un file Markdown che offre ai modelli linguistici una panoramica curata del tuo sito. AmICited recupera il tuo e lo convalida rispetto alla proposta di llmstxt.org: trasporto (servito alla radice su HTTPS con HTTP 200, un tipo di contenuto testuale, non la shell HTML della tua app, UTF-8, sotto i 128 KB), struttura (un solo H1 all’inizio, una citazione di riepilogo subito dopo, sezioni H2 che sono elenchi di link, nessuna intestazione più profonda) e qualità dei link (URL assoluti nella forma - [Title](URL): description, nessun HTML grezzo, nessun testo segnaposto).

Punteggio llms.txt
controlli ponderati superati ÷ controlli ponderati totali × 100
  • I controlli obbligatori pesano 1, quelli consigliati pesano 0.5 e i suggerimenti indicativi pesano 0 (mostrati come indicazioni, mai penalizzati).
  • Ogni controllo mostra se è stato superato, cosa si aspetta e un esempio.
  • Re-check now recupera di nuovo il file (0.005 crediti). Re-check competitors rivaluta quelli dei concorrenti.

Esempio pratico#

Una revisione completa esegue 5 controlli obbligatori e 19 consigliati (più 4 suggerimenti indicativi), per un valore di 5 + 9.5 = 14.5 punti. Un file che supera tutti i controlli obbligatori e 15 di quelli consigliati ottiene (5 + 7.5) ÷ 14.5 × 100 = 86.

Albero di accessibilità#

Gli agenti AI navigano una pagina attraverso il suo albero di accessibilità (ruoli, nomi, struttura), non i suoi pixel. AmICited controlla l’HTML della tua homepage e puoi usare Check URL per qualsiasi altra pagina (0.005 crediti per revisione). I controlli: pagina raggiungibile, elementi interattivi con un nome, nessun elemento interattivo nascosto, immagini con testo alternativo, controlli dei moduli etichettati, un solo H1, ordine delle intestazioni, un landmark main, lingua della pagina dichiarata e titolo del documento.

WebMCP, agentic commerce e Common Crawl#

  • WebMCP. Rileva se la tua homepage espone strumenti che gli agenti possono chiamare direttamente (cerca, aggiungi al carrello, prenota) invece di tirare a indovinare dalla pagina. Gli strumenti dichiarativi vengono elencati con indicatori di lettura o scrittura; gli strumenti registrati da JavaScript vengono segnalati ma non possono essere elencati dall’HTML statico.
  • Agentic commerce. Rileva se la homepage pubblicizza un protocollo che permette agli agenti di navigare, completare l’acquisto e pagare (ACP, UCP), con un link al manifest.
  • Common Crawl. Se CCBot può recuperare il sito (consentito, vietato in robots.txt o bloccato sul bordo della CDN), se il dominio è nell’ultimo indice, quanti URL sono stati acquisiti e la tua presenza nel tempo rispetto ai concorrenti. Common Crawl è il corpus da cui è costruita la maggior parte dei dataset di addestramento aperti; non è ciò che recuperano GPTBot, OAI-SearchBot o PerplexityBot, quindi leggilo separatamente dalla ricerca AI in tempo reale.
  • Registrazione del dominio e certificato. Giorni alla scadenza della registrazione del dominio e del certificato TLS, e il registrar.

Audit del sito#

L’audit del sito scansiona ogni URL della sitemap del dominio, registra i dati tecnici e i link di ogni pagina e calcola il grafo dei link interni.

  1. Configura la scansione

    Vai su Audit → Site audit e fai clic su Schedule scan. Imposta il ritmo (richieste al secondo, richieste simultanee, attesa massima per richiesta), quando fermarsi (URL massimi, durata massima, tasso di errore), quali URL includere o escludere (fino a 20 espressioni regolari ciascuno), se salvare i link verso siti esterni e se Repeat scan ogni N giorni.

  2. Ottieni un prezzo e conferma

    Fai clic su Get price. Il preventivo conta gli URL della tua sitemap, applica i tuoi filtri e il limite del piano e quota la scansione a 0.002 crediti per URL (1,000 URL = 2 crediti). Il preventivo è valido per un’ora e una scansione non può partire se il tuo saldo non ne copre l’intero importo.

  3. Leggi il report

    Schede: Issues, Pages & links, Outbound domains, Runs, Server response e Crawl log. Vieni avvisato quando l’esecuzione termina.

Il crawler è educato per progetto: dimezza la sua frequenza e si ferma quando il sito risponde 429 o 503, e rallenta quando i tempi di risposta raddoppiano. Una scansione interrotta conserva tutto ciò che è già stato recuperato e addebita solo quello. Ogni pagina ottiene un PageRank (semplice e ponderato in base a dove si trova il link: il contenuto principale conta più della navigazione o del footer) accanto ai suoi clic organici e a pagamento; le colonne del traffico richiedono Search Console o una piattaforma pubblicitaria collegata.

Correlati#