Academia · Audit

Cum să verifici acoperirea Robots.txt și Sitemap în AmICited

Folosește verificarea Robots.txt & Sitemap din auditul Agent Accessibility al AmICited pentru a confirma că crawler-ele AI și de căutare pot citi site-ul tău și că sitemapurile tale sunt declarate și complete.

7 min read · Medium priority

Cum să verifici acoperirea Robots.txt și Sitemap în AmICited — video walkthrough

Dacă crawler-ele AI nu pot citi site-ul tău, niciuna dintre celelalte optimizări nu contează.

Ce este robots.txt și de ce decide dacă AI-ul te poate vedea?

Robots.txt este un fișier text simplu, plasat la rădăcina domeniului tău (siteultau.com/robots.txt), care le spune crawler-elor ce părți din site au voie să acceseze. Există de zeci de ani dinaintea exploziei AI — a fost creat inițial pentru ca bot-ii motoarelor de căutare, precum Googlebot, să nu piardă timp accesând pagini de administrare, medii de staging sau conținut duplicat. Însă același mecanism guvernează acum o decizie cu mize mult mai mari: dacă GPTBot, ClaudeBot, PerplexityBot, Google-Extended și celelalte crawler-e AI care alimentează motoarele de răspuns de astăzi au voie să îți preia paginile.

Orice crawler bine-crescut verifică robots.txt înainte de a solicita orice altceva. Fișierul este organizat în blocuri, fiecare începând cu o linie User-agent care numește un anumit bot (sau * pentru toate bot-urile), urmată de reguli Allow și Disallow care specifică ce căi are voie sau nu are voie să acceseze acel bot. O singură regulă generală precum Disallow: / sub User-agent: GPTBot este suficientă pentru a bloca acel crawler de pe întreg site-ul tău — și nu va apărea în citările din ChatGPT, indiferent cât de bun este conținutul tău. De aceea crawlabilitatea — proprietatea generală a unui site de a fi accesibil din punct de vedere tehnic pentru bot-i — este tratată ca fiind stratul fundamental al vizibilității în căutarea AI, și nu un detaliu secundar.

Robots.txt are și o a doua funcție: este de obicei locul unde crawler-ele caută un indicator către sitemapul tău, prin intermediul unei directive Sitemap:. Un sitemap XML este o listă structurată a URL-urilor de pe site-ul tău pe care vrei ca crawler-ele să le cunoască, incluzând adesea metadate precum datele ultimei modificări. Acolo unde robots.txt controlează permisiunea, sitemapul controlează descoperirea — este harta care le spune crawler-elor ce există, astfel încât să nu fie nevoite să găsească fiecare pagină doar urmărind linkuri. Un site poate avea reguli robots.txt perfect permisive și totuși să fie indexat insuficient de sistemele AI, pur și simplu pentru că sitemapul lipsește, nu este referențiat sau este incomplet.

Aceste două fișiere contează mai mult pentru vizibilitatea AI decât au contat vreodată pentru SEO-ul tradițional. Motoarele de căutare au accesat web-ul de peste 25 de ani și au construit grafuri de linkuri uriașe care le permit lui Googlebot să descopere pagini chiar și fără un sitemap. Crawler-ele AI sunt mai noi, adesea mai precaute în privința cât de mult dintr-un site vor accesa și mai predispuse să fie blocate complet de reguli robots.txt scrise cu gândul doar la Googlebot. O regulă care exclude silențios bot-ii „necunoscuți" sau cei care par agresivi poate prinde GPTBot sau ClaudeBot ca daună colaterală. Acesta este exact tipul de eșec pe care verificarea Robots.txt & Sitemap există să îl depisteze — și de aceea este unul dintre primele lucruri pe care ar trebui să le confirme orice audit de accesibilitate AI , înainte să investești timp în conținut, schema sau altceva.

Secțiunea Robots.txt & Sitemap a auditului Agent Accessibility

Important
O singură regulă prea strictă în robots.txt poate bloca un crawler AI de pe întreg site-ul tău. Această verificare este locul unde poți depista acest lucru înainte ca el să te coste citări în tăcere.

Unde o găsești

Este secțiunea Robots.txt & Sitemap din Audit → Agent Accessibility. Agent Accessibility este partea din auditul AmICited care se concentrează în mod specific pe dacă sistemele AI pot ajunge la și interpreta tehnic conținutul tău, spre deosebire de părțile legate de calitatea conținutului și de urmărirea citărilor din produs. Robots.txt & Sitemap este de obicei prima verificare din această secțiune, pentru că tot ce măsoară restul auditului presupune că crawler-ele pot intra pe ușă, în primul rând.

Ce verifică

Așa cum explică secțiunea, se uită la „dacă crawler-ele AI și de căutare importante au permisiunea de a citi site-ul, dacă sitemapurile sunt declarate în robots.txt și câte URL-uri listează aceste sitemapuri în total." Pe scurt:

  • Accesul crawler-elor — au permisiunea (nu sunt interzise) principalele bot-uri AI și de căutare în robots.txt? AmICited evaluează regulile tale reale din robots.txt în raport cu șirurile user-agent ale crawler-elor care contează pentru vizibilitatea în căutarea AI, astfel încât să vezi, bot cu bot, dacă este permis, blocat sau pur și simplu neadresat de nicio regulă (ceea ce de obicei se traduce implicit prin permis, sub blocul wildcard).
  • Declararea sitemapului — este un sitemap menționat în robots.txt pentru ca crawler-ele să îl poată găsi? Un sitemap care există, dar nu este legat din robots.txt (și nu a fost trimis nicăieri altundeva), este mult mai puțin probabil să fie preluat automat.
  • Acoperirea sitemapului — câte URL-uri listează sitemapurile tale în total, oferindu-ți o verificare rapidă de bun-simț asupra faptului dacă paginile tale publicate sunt de fapt promovate către crawler-e.

Împreună, aceste trei verificări răspund la cele două întrebări care determină dacă un sistem AI poate măcar începe să îți evalueze conținutul: este acest crawler lăsat să intre și știe ce să acceseze odată ajuns aici. Un brand poate face totul corect din perspectiva conținutului — răspunsuri clare, semnale puternice de entitate, pagini bine structurate — și totuși să fie invizibil în răspunsurile AI pur și simplu pentru că una dintre aceste două condiții eșuează silențios în fundal.

Cum să o folosești

  1. Confirmă că crawler-ele au permisiunea. Dacă un bot AI important este blocat, corectează regula din robots.txt — aceasta este problema cu cea mai mare prioritate de pe pagină. Verifică fiecare crawler blocat în raport cu intenția ta: o regulă care blochează GPTBot a fost probabil scrisă intenționat, dacă nu vrei ca site-ul tău să fie folosit pentru antrenarea modelului OpenAI, dar dacă blochează silențios și OAI-SearchBot sau PerplexityBot — crawler-ele care alimentează de fapt citările live, spre deosebire de antrenarea modelelor — pierzi vizibilitate fără niciun motiv strategic. Merită să decizi în mod deliberat ce crawler-e vrei să permiți bot-urilor AI să îți acceseze site-ul , în loc să moștenești o setare implicită care blochează totul fără discernământ.
  2. Declară-ți sitemapul. Asigură-te că robots.txt indică spre sitemapul tău, astfel încât agenții să poată descoperi toate paginile tale. Este o singură linie — Sitemap: https://siteultau.com/sitemap.xml — dar este unul dintre cele mai frecvent lipsă detalii pe site-uri construite altfel bine, în special pe site-urile unde sitemapul a fost generat automat de un CMS, dar nu a fost legat niciodată înapoi în robots.txt.
  3. Verifică numărul de URL-uri. Un sitemap care listează mult mai puține URL-uri decât ai publicat înseamnă că paginile nu sunt promovate către crawler-e. Aceasta este de obicei un semn al unui sitemap învechit (generat o singură dată și niciodată regenerat), al unui index de sitemap care nu leagă toate sitemapurile sale copil sau al unui plugin CMS care exclude silențios un anumit tip de conținut — articolele de blog publicate recent și paginile generate dinamic sunt victime frecvente.
  4. Re-verifică după modificări și confirmă că tile-urile Accesul crawler-elor și URL-urile sitemapului din sumarul de pregătire devin sănătoase.

Accesul crawler-elor este fundația: rezolvă-l mai întâi, pentru că totul presupune că bot-urile pot ajunge efectiv la conținutul tău. Odată ce accesul și descoperirea sunt ambele confirmate ca fiind sănătoase, restul auditului Agent Accessibility — randare, date structurate, timpi de răspuns — începe să conteze, pentru că aceste verificări dau roade doar dacă crawler-ul a avut voie să ajungă la pagină, în primul rând.

Merită de asemenea reținut că robots.txt și acoperirea sitemapului nu sunt o rezolvare unică, definitivă. Apar secțiuni noi, migrările de CMS regenerează sitemapuri cu setări implicite diferite, iar regulile CDN sau WAF sunt adăugate mult după ce robots.txt original a fost scris — oricare dintre acestea poate reintroduce silențios un crawler blocat sau un sitemap incomplet. Unele echipe combină această verificare cu analiza jurnalelor de server, pentru a confirma că crawler-ele chiar vizitează paginile la care au permisiunea de acces, și cu un fișier llms.txt dedicat, care oferă sistemelor AI un rezumat curatoriat al celui mai important conținut al tău, pe lângă sitemapul brut. Dacă nu ești sigur unde se încadrează robots.txt și acoperirea sitemapului în raport cu restul muncii tale tehnice, un audit de vizibilitate AI mai amplu parcurge întregul set de verificări de accesibilitate în ordine, iar instrumentul propriu de vizibilitate AI al AmICited urmărește dacă rezolvarea acestor probleme se traduce efectiv, în timp, în mai multe citări — asociind remedierea tehnică cu rezultatul pe care este menită să îl producă, în loc să trateze „crawler-e permise" ca linie de sosire. Pentru echipele care gestionează acest aspect pe zeci de site-uri de clienți, aceleași verificări de acces și sitemap sunt unul dintre elementele recurente acoperite în cadrul AmICited pentru agenții , întrucât o singură regulă robots.txt configurată greșit tinde să se repete pe mai multe șabloane și trebuie depistată devreme, în etapa de onboarding, nu după ce un client întreabă de ce brandul lui nu apare niciodată în ChatGPT.

← Toate tutorialele Academiei

Gata să pui în practică?

Verificare gratuită · Perioadă de încercare de 7 zile · fără card de credit