Controleren van Robots.txt & Sitemap-dekking in AmICited
Gebruik de Robots.txt & Sitemaps-controle in AmICited's Agent Accessibility-audit om te bevestigen dat AI- en zoekmachines je site kunnen lezen en dat je sitemaps zijn gedeclareerd en volledig zijn.
Als AI-crawlers je site niet kunnen lezen, heeft al je andere optimalisatie geen zin.
Wat is robots.txt, en waarom bepaalt het of AI je kan zien?
Robots.txt
is een platte-tekstbestand dat zich in de root van je domein bevindt (jouwsite.com/robots.txt) en crawlers vertelt welke delen van je site ze mogen opvragen. Het bestaat al tientallen jaren langer dan de AI-hausse — het werd oorspronkelijk gebouwd zodat zoekmachinebots zoals Googlebot geen tijd zouden verspillen aan het crawlen van beheerpagina’s, staging-omgevingen of dubbele content. Maar hetzelfde mechanisme regelt nu een beslissing met veel hogere inzet: of GPTBot, ClaudeBot, PerplexityBot, Google-Extended en de andere AI-crawlers die de antwoordmachines van vandaag voeden, überhaupt toestemming hebben om je pagina’s op te halen.
Elke goed functionerende crawler controleert robots.txt voordat hij iets anders opvraagt. Het bestand is opgebouwd uit blokken, elk beginnend met een User-agent-regel die een specifieke bot benoemt (of * voor alle bots), gevolgd door Allow- en Disallow-regels die aangeven welke paden die bot wel of niet mag ophalen. Eén enkele algemene regel zoals Disallow: / onder User-agent: GPTBot is genoeg om die crawler volledig van je site te weren — en hij zal niet verschijnen in de citaties van ChatGPT, hoe goed je content ook is. Dit is waarom crawlability
— de algemene eigenschap dat een site technisch bereikbaar is voor bots — wordt behandeld als de fundering van AI-zoekzichtbaarheid in plaats van een bijzaak.
Robots.txt heeft ook een tweede taak: het is meestal de plek waar crawlers een verwijzing naar je sitemap zoeken, via een Sitemap:-richtlijn. Een XML-sitemap
is een gestructureerde lijst van de URL’s op je site die je onder de aandacht van crawlers wilt brengen, vaak met metadata zoals de datum van laatste wijziging. Waar robots.txt de toestemming regelt, regelt de sitemap de vindbaarheid — het is de plattegrond die crawlers vertelt wat er bestaat, zodat ze niet elke pagina puur via links hoeven te ontdekken. Een site kan volledig toegankelijke robots.txt-regels hebben en toch onvoldoende geïndexeerd worden door AI-systemen, simpelweg omdat de sitemap ontbreekt, niet wordt gerefereerd of onvolledig is.
Deze twee bestanden zijn belangrijker voor AI-zichtbaarheid dan ze ooit waren voor traditionele SEO. Zoekmachines crawlen het web al meer dan 25 jaar en hebben enorme linkgrafen opgebouwd waardoor Googlebot pagina’s kan ontdekken, zelfs zonder sitemap. AI-crawlers zijn nieuwer, vaak voorzichtiger over hoeveel van een site ze ophalen, en worden eerder volledig geblokkeerd door robots.txt-regels die alleen met Googlebot in gedachten zijn geschreven. Een regel die stilzwijgend “onbekende” of agressief ogende bots uitsluit, kan GPTBot of ClaudeBot als collateral damage raken. Dat is precies het faalscenario dat de Robots.txt & Sitemaps-controle moet opsporen — en daarom is dit een van de eerste dingen die elke AI-toegankelijkheidsaudit zou moeten verifiëren, voordat je tijd besteedt aan content, schema, of iets anders.

robots.txt kan een AI-crawler van je hele site blokkeren. Deze controle is waar je dat opmerkt voordat het je stilletzaken citaten kost.Waar vind je het
Het is het Robots.txt & Sitemaps-gedeelte van Audit → Agent Accessibility. Agent Accessibility is het onderdeel van AmICited’s audit dat zich specifiek richt op of AI-systemen je content technisch kunnen bereiken en verwerken, in tegenstelling tot de onderdelen die contentkwaliteit en citatietracking meten. Robots.txt & Sitemaps is doorgaans de eerste controle in die sectie, omdat alles wat de rest van de audit meet, ervan uitgaat dat de crawlers überhaupt binnen kunnen komen.
Wat het controleert
Zoals de sectie uitlegt, kijkt het naar “of de belangrijke AI- en zoekmachines de site mogen lezen, of sitemaps zijn gedeclareerd in robots.txt, en hoeveel URL’s die sitemaps in totaal vermelden.” Kortom:
- Crawler-toegang — zijn de belangrijkste AI- en zoekbots toegestaan (niet geweigerd) in
robots.txt? AmICited toetst je daadwerkelijkerobots.txt-regels aan de user-agent-strings van de crawlers die er toe doen voor AI-zoekzichtbaarheid, zodat je per bot ziet of deze is toegestaan, geblokkeerd, of eenvoudigweg niet wordt geadresseerd door een regel (wat meestal standaard toegestaan is onder het wildcard-blok). - Sitemap-declaratie — wordt er vanuit
robots.txtnaar een sitemap verwezen, zodat crawlers deze kunnen vinden? Een sitemap die wel bestaat maar niet vanuit robots.txt is gelinkt (en ook niet elders is ingediend), wordt veel minder waarschijnlijk automatisch opgepikt. - Sitemap-dekking — hoeveel URL’s je sitemaps in totaal vermelden, wat je een snelle sanity check geeft of je gepubliceerde pagina’s daadwerkelijk onder de aandacht van crawlers worden gebracht.
Samen beantwoorden deze drie controles de twee vragen die bepalen of een AI-systeem je content überhaupt kan gaan evalueren: wordt deze crawler binnengelaten, en weet hij wat hij moet ophalen zodra hij er is. Een merk kan alles goed doen op het gebied van content — duidelijke antwoorden, sterke entiteitssignalen, goed gestructureerde pagina’s — en toch onzichtbaar zijn in AI-antwoorden, simpelweg omdat een van deze twee voorwaarden op de achtergrond stilzwijgend faalt.
Hoe gebruik je het
- Bevestig dat crawlers zijn toegestaan. Als een belangrijke AI-bot wordt geblokkeerd, los dan de
robots.txt-regel op — dit is het hoogste prioriteitsprobleem op de pagina. Toets elke geblokkeerde crawler aan je eigen intentie: een regel dieGPTBotblokkeert, is waarschijnlijk bewust geschreven als je niet wilt dat je content wordt gebruikt voor het trainen van OpenAI’s model, maar als daarmee ook stilzwijgendOAI-SearchBotofPerplexityBotwordt geblokkeerd — de crawlers die daadwerkelijk live citaties aandrijven, in tegenstelling tot modeltraining — verlies je zichtbaarheid zonder strategische reden. Het loont om bewust te bepalen welke crawlers je AI-bots toestemming wilt geven om je site te crawlen , in plaats van een standaardinstelling over te nemen die alles klakkeloos blokkeert. - Declareer je sitemap. Zorg ervoor dat
robots.txtnaar je sitemap verwijst, zodat agents al je pagina’s kunnen ontdekken. Dit is één enkele regel —Sitemap: https://jouwsite.com/sitemap.xml— maar het is een van de vaakst ontbrekende details op verder goed gebouwde sites, vooral op sites waar de sitemap automatisch is gegenereerd door een CMS maar nooit is teruggekoppeld naar robots.txt. - Controleer het aantal URL’s. Een sitemap die aanzienlijk minder URL’s vermeldt dan je hebt gepubliceerd, betekent dat pagina’s niet aan crawlers worden getoond. Dit is meestal een teken van een verouderde sitemap (eenmalig gegenereerd en nooit opnieuw gegenereerd), een sitemap-index die niet naar al zijn onderliggende sitemaps linkt, of een CMS-plugin die stilzwijgend een contenttype uitsluit — recent gepubliceerde blogposts en dynamisch gegenereerde pagina’s zijn hier veelvoorkomende slachtoffers van.
- Controleer opnieuw na aanpassingen en bevestig dat de tegels Crawler-toegang en Sitemap-URL’s in de gereedheidssamenvatting gezond worden.
Crawler-toegang is de basis: zorg dat dit eerst goed is, want al het andere gaat ervan uit dat de bots daadwerkelijk bij je content kunnen komen. Zodra toegang en vindbaarheid allebei gezond zijn bevestigd, begint de rest van de Agent Accessibility-audit — rendering, gestructureerde data, responstijden — pas echt van belang te worden, omdat die controles alleen renderen als de crawler in de eerste plaats toestemming had om de pagina te bereiken.
Het is ook goed om te onthouden dat robots.txt en sitemap-dekking geen eenmalige fix zijn. Nieuwe secties gaan live, CMS-migraties genereren sitemaps opnieuw met andere standaardinstellingen, en CDN- of WAF-regels worden lang nadat de oorspronkelijke robots.txt is geschreven toegevoegd — elk van deze kan stilzwijgend een geblokkeerde crawler of een onvolledige sitemap opnieuw introduceren. Sommige teams combineren deze controle met serverlog-analyse om te bevestigen dat crawlers daadwerkelijk de pagina’s bezoeken waarvoor ze toestemming hebben, en met een speciaal llms.txt -bestand dat AI-systemen een samengestelde samenvatting geeft van je belangrijkste content naast de ruwe sitemap. Als je niet zeker weet waar robots.txt en sitemap-dekking passen ten opzichte van je andere technische werk, doorloopt een bredere AI-zichtbaarheidsaudit de volledige set toegankelijkheidscontroles in volgorde, en AmICited’s eigen AI-zichtbaarheid -tooling houdt bij of het oplossen van deze problemen zich in de loop van de tijd daadwerkelijk vertaalt naar meer citaties — waarmee de technische fix wordt gekoppeld aan het resultaat dat hij moet opleveren, in plaats van “crawlers toegestaan” als eindpunt te beschouwen. Voor teams die dit over tientallen klantsites beheren, zijn dezelfde toegangs- en sitemapcontroles een van de terugkerende aandachtspunten binnen AmICited voor bureaus , aangezien één verkeerd geconfigureerde robots.txt-regel de neiging heeft zich over templates te herhalen en vroeg in het onboardingproces moet worden opgemerkt — niet nadat een klant vraagt waarom zijn merk nooit verschijnt in ChatGPT.
Meer tutorials in deze sectie
Hoe u uw Core Web Vitals in AmICited controleert
Gebruik de Web Vitals-audit in AmICited om de Core Web Vitals van uw homepage te zien — LCP, INP, CLS, FCP …
Lees de gids →
Hoe controleer je je Agent Toegankelijkheidsscore in AmICited
Lees de Agent Gereedheidssamenvatting in AmICited's Agent Toegankelijkheidsaudit — llms.txt, …
Lees de gids →
Hoe u uw llms.txt-bestand in AmICited kunt beoordelen
Gebruik de llms.txt-beoordeling in AmICited's Agent Accessibility-audit om uw /llms.txt op te halen en te …
Lees de gids →Klaar om het in de praktijk te brengen?
Gratis check · 7 dagen proefperiode · geen creditcard nodig