Jak zkontrolovat Robots.txt a pokrytí Sitemap v AmICited
Pomocí kontroly Robots.txt a Sitemap v auditu Agent Accessibility v AmICited ověřte, že AI a vyhledávací crawlery mohou číst váš web a že vaše sitemapy jsou deklarované a kompletní.
Pokud AI crawlery nemohou číst váš web, na ničem dalším, co pro optimalizaci uděláte, už nezáleží.
Co je robots.txt a proč rozhoduje o tom, jestli vás AI vůbec „vidí"
Robots.txt
je textový soubor umístěný v kořenovém adresáři vaší domény (vasweb.cz/robots.txt), který crawlerům říká, které části webu smí požadovat. Existuje o desítky let déle než současný AI boom – původně vznikl proto, aby vyhledávací roboti jako Googlebot neztráceli čas procházením administračních stránek, testovacích prostředí nebo duplicitního obsahu. Dnes ale stejný mechanismus rozhoduje o mnohem důležitější věci: zda GPTBot, ClaudeBot, PerplexityBot, Google-Extended a další AI crawlery, které živí dnešní odpovídací enginy, smí vaše stránky vůbec načíst.
Každý slušně se chovající crawler zkontroluje robots.txt dřív, než si vyžádá cokoliv jiného. Soubor je rozdělený do bloků, z nichž každý začíná řádkem User-agent s názvem konkrétního bota (nebo * pro všechny boty), po němž následují pravidla Allow a Disallow určující, které cesty daný bot smí, nebo nesmí, načítat. Jediné plošné pravidlo typu Disallow: / pod User-agent: GPTBot stačí k tomu, aby tento crawler zůstal zavřený z celého vašeho webu – a v citacích ChatGPT se pak neobjevíte bez ohledu na to, jak kvalitní je váš obsah. Právě proto se crawlability
– obecná vlastnost webu být technicky dosažitelný pro boty – považuje za základní vrstvu viditelnosti v AI vyhledávání, nikoli za druhořadý detail.
Robots.txt má i druhou úlohu: bývá to místo, kde crawlery hledají odkaz na vaši sitemapu, prostřednictvím direktivy Sitemap:. XML sitemapa
je strukturovaný seznam URL adres na vašem webu, o kterých chcete, aby crawlery věděly, často včetně metadat jako datum poslední úpravy. Zatímco robots.txt řídí povolení, sitemapa řídí objevování – je to mapa, která crawlerům řekne, co existuje, aby nemusely každou stránku hledat čistě proklikáváním odkazů. Web může mít naprosto vstřícná pravidla v robots.txt, a přesto být AI systémy nedostatečně indexovaný jen proto, že jeho sitemapa chybí, na nic neodkazuje nebo je neúplná.
Tyto dva soubory jsou pro viditelnost v AI důležitější, než kdy byly pro tradiční SEO. Vyhledávače procházejí web už přes 25 let a vybudovaly obrovské grafy odkazů, díky nimž Googlebot dokáže objevit stránky i bez sitemapy. AI crawlery jsou novější, často opatrnější v tom, kolik z webu si vezmou, a snáze je úplně zablokuje pravidlo v robots.txt napsané s ohledem jen na Googlebota. Pravidlo, které potichu vylučuje „neznámé" nebo agresivně vypadající boty, může jako vedlejší škodu zasáhnout i GPTBot nebo ClaudeBot. Přesně tento typ selhání má kontrola Robots.txt & Sitemaps odhalit – a proto je to jedna z prvních věcí, kterou by měl ověřit jakýkoliv audit dostupnosti pro AI , ještě předtím, než začnete řešit obsah, strukturovaná data nebo cokoliv jiného.

robots.txt může zablokovat AI crawleru přístup na celý váš web. Tato kontrola je místem, kde to odhalíte dříve, než vás to bude tiše stát citace.Kde to najdete
Je to sekce Robots.txt & Sitemaps v rámci Audit → Agent Accessibility. Agent Accessibility je ta část auditu AmICited, která se zaměřuje konkrétně na to, zda se AI systémy technicky dostanou k vašemu obsahu a dokážou ho zpracovat, na rozdíl od částí produktu zaměřených na kvalitu obsahu a sledování citací. Robots.txt & Sitemaps bývá v této sekci první kontrolou, protože vše ostatní, co audit měří, předpokládá, že se crawlery vůbec dostanou dovnitř.
Co to kontroluje
Jak sekce vysvětluje, prověřuje „zda mají důležité AI a vyhledávací crawlery povolen přístup na web, zda jsou sitemapy deklarované v robots.txt a kolik URL těchto sitemap celkem obsahuje." Ve zkratce:
- Přístup crawlerů – mají hlavní AI a vyhledávací roboti povolen (nikoli zakázán) přístup v
robots.txt? AmICited porovná vaše skutečná pravidla vrobots.txts user-agent řetězci crawlerů, na kterých záleží pro viditelnost v AI vyhledávání, takže u každého bota vidíte, zda má povolen přístup, je zablokovaný, nebo jím žádné pravidlo vůbec neřeší (což se obvykle vyhodnotí jako povolený v rámci wildcard bloku). - Deklarace sitemap – je v
robots.txtuveden odkaz na sitemapu, aby ji crawlery našly? Sitemapa, která existuje, ale není z robots.txt odkázaná (a nebyla odeslaná nikde jinde), má mnohem menší šanci, že ji crawlery automaticky najdou. - Pokrytí sitemap – kolik URL vaše sitemapy celkem uvádějí, což vám dá rychlou kontrolu, zda jsou vaše publikované stránky crawlerům skutečně nabízené.
Společně tyto tři kontroly odpovídají na dvě otázky, které rozhodují o tom, zda AI systém vůbec může začít hodnotit váš obsah: je tento crawler vpuštěn dovnitř a ví, co si má načíst, jakmile tam je. Značka může mít po obsahové stránce vše v pořádku – jasné odpovědi, silné entitní signály, dobře strukturované stránky – a přesto zůstat v AI odpovědích neviditelná jen proto, že jedna z těchto dvou podmínek v pozadí tiše selhává.
Jak to použít
- Potvrďte, že crawlery mají povolen přístup. Pokud je důležitý AI bot zablokován, opravte pravidlo v
robots.txt– toto je nejvyšší priorita na stránce. U každého zablokovaného crawleru zkontrolujte, zda to odpovídá vašemu záměru: pravidlo blokujícíGPTBotbylo pravděpodobně napsáno záměrně, pokud nechcete, aby se váš obsah používal k trénování modelů OpenAI, ale pokud potichu blokuje iOAI-SearchBotneboPerplexityBot– crawlery, které reálně pohánějí živé citace, na rozdíl od trénování modelů – přicházíte o viditelnost bez jakéhokoliv strategického důvodu. Vyplatí se vědomě rozhodnout, kterým crawlerům chcete povolit AI botům procházet váš web , místo abyste zdědili výchozí nastavení, které plošně blokuje všechno. - Deklarujte svou sitemapu. Ujistěte se, že
robots.txtodkazuje na vaši sitemapu, aby agenti mohli objevit všechny vaše stránky. Jde o jediný řádek –Sitemap: https://vasweb.cz/sitemap.xml– ale je to jeden z nejčastěji chybějících detailů i na jinak dobře postavených webech, zejména tam, kde sitemapu automaticky vygeneroval CMS, ale nikdy nebyla propojená zpět s robots.txt. - Zkontrolujte počet URL. Pokud sitemapa uvádí výrazně méně URL, než kolik máte publikovaných stránek, znamená to, že stránky nejsou crawlerům inzerovány. Obvykle to signalizuje zastaralou sitemapu (vygenerovanou jednou a nikdy znovu), sitemap index, který neodkazuje na všechny své dílčí sitemapy, nebo CMS plugin, který potichu vylučuje určitý typ obsahu – běžnými oběťmi bývají nedávno publikované blogové příspěvky a dynamicky generované stránky.
- Po úpravách proveďte novou kontrolu a ověřte, že se dlaždice Přístup crawlerů a URL sitemap v souhrnu připravenosti změní na zdravý stav.
Přístup crawlerů je základ: nastavte ho správně jako první, protože vše ostatní předpokládá, že se roboti k vašemu obsahu skutečně mohou dostat. Jakmile jsou přístup i objevování potvrzeně v pořádku, začíná záležet i na zbytku auditu Agent Accessibility – vykreslování, strukturovaná data, doby odezvy – protože tyto kontroly se vyplatí jen tehdy, pokud se crawler na stránku vůbec dostal.
Stojí za připomenutí, že pokrytí robots.txt a sitemap není jednorázová oprava. Spouštějí se nové sekce webu, migrace CMS znovu generují sitemapy s jinými výchozími nastaveními a pravidla CDN nebo WAF se přidávají dlouho poté, co byl původní robots.txt napsán – kterékoliv z toho může potichu znovu zablokovat crawler nebo způsobit neúplnou sitemapu. Některé týmy tuto kontrolu párují s analýzou serverových logů, aby ověřily, že crawlery skutečně navštěvují stránky, na které mají povolení, a s vyhrazeným souborem llms.txt , který AI systémům poskytuje kurátorský přehled vašeho nejdůležitějšího obsahu vedle syrové sitemapy. Pokud si nejste jistí, kam pokrytí robots.txt a sitemap zapadá vzhledem k ostatní technické práci, širší audit viditelnosti v AI provede celou sadu kontrol dostupnosti popořadě a vlastní nástroj AmICited pro viditelnost v AI sleduje, zda oprava těchto problémů skutečně vede k více citacím v čase – propojuje tak technickou opravu s výsledkem, kterého má dosáhnout, místo aby „povolení crawlerům" bralo jako cílovou pásku. Pro týmy, které to spravují napříč desítkami klientských webů, jsou stejné kontroly přístupu a sitemap jednou z opakujících se položek pokrytých v rámci AmICited pro agentury , protože jediné špatně nastavené pravidlo v robots.txt se má tendenci opakovat napříč šablonami a je potřeba ho odhalit brzy při onboardingu, ne až poté, co se klient zeptá, proč se jeho značka nikdy neobjevuje v ChatGPT.
Další návody v této sekci
Jak zkontrolovat své Core Web Vitals v AmICited
Použijte audit Web Vitals v AmICited a zjistěte Core Web Vitals vaší domovské stránky — LCP, INP, CLS, FCP a …
Číst návod →
Jak zkontrolovat skóre přístupnosti pro agenty v AmICited
Přečtěte si souhrn připravenosti pro agenty v auditu přístupnosti pro agenty v AmICited — llms.txt, …
Číst návod →
Jak zkontrolovat soubor llms.txt v nástroji AmICited
Pomocí kontroly llms.txt v auditu Agent Accessibility v nástroji AmICited načtěte a ověřte svůj /llms.txt — …
Číst návod →Připraveni uvést to do praxe?
Bezplatná kontrola · 7denní zkušební verze · bez platební karty