Akademi · Revision

Sådan tjekker du Robots.txt & Sitemap-dækning i AmICited

Brug Robots.txt & Sitemaps-tjekket i AmICited's Agent Accessibility-audit til at bekræfte, at AI- og søgemaskinecrawlere kan læse dit site, og at dine sitemaps er deklareret og komplette.

7 min read · Medium priority

Sådan tjekker du Robots.txt & Sitemap-dækning i AmICited — video walkthrough

Hvis AI-crawlere ikke kan læse dit site, er intet af din øvrige optimering noget værd.

Hvad er robots.txt, og hvorfor afgør det, om AI kan se dig?

Robots.txt er en almindelig tekstfil, der ligger i roden af dit domæne (dinside.dk/robots.txt), og som fortæller crawlere, hvilke dele af dit site de må hente. Filen er årtier ældre end AI-boomet — den blev oprindeligt indført, så søgemaskine-bots som Googlebot ikke spildte tid på at crawle admin-sider, staging-miljøer eller duplikeret indhold. Men den samme mekanisme styrer nu en langt vigtigere beslutning: om GPTBot, ClaudeBot, PerplexityBot, Google-Extended og de øvrige AI-crawlere, der fodrer nutidens svarmaskiner, overhovedet har lov til at hente dine sider.

Enhver veldrevet crawler tjekker robots.txt, før den anmoder om noget som helst andet. Filen er opbygget i blokke, der hver starter med en User-agent-linje, som navngiver en bestemt bot (eller * for alle bots), efterfulgt af Allow- og Disallow-regler, der angiver, hvilke stier den pågældende bot må eller ikke må hente. En enkelt bred regel som Disallow: / under User-agent: GPTBot er nok til at lukke den crawler ude fra hele dit site — og den vil ikke optræde i ChatGPTs kilder, uanset hvor godt dit indhold er. Det er derfor crawlability — den generelle egenskab, at et site er teknisk tilgængeligt for bots — betragtes som fundamentlaget for AI-søgesynlighed frem for en efterrationalisering.

Robots.txt har også en anden opgave: det er typisk her, crawlere leder efter en henvisning til dit sitemap, via en Sitemap:-direktiv. Et XML-sitemap er en struktureret liste over de URL’er på dit site, som du ønsker, crawlere skal kende til, ofte inklusive metadata som senest-ændret-datoer. Hvor robots.txt styrer tilladelse, styrer sitemappet opdagelse — det er det kort, der fortæller crawlere, hvad der findes, så de ikke skal finde hver eneste side udelukkende ved at følge links. Et site kan have fuldstændig imødekommende robots.txt-regler og stadig være underindekseret af AI-systemer, simpelthen fordi dets sitemap mangler, ikke er refereret, eller er ufuldstændigt.

Disse to filer betyder mere for AI-synlighed, end de nogensinde har gjort for traditionel SEO. Søgemaskiner har crawlet nettet i over 25 år og bygget enorme link-grafer, der lader Googlebot opdage sider selv uden et sitemap. AI-crawlere er nyere, ofte mere forsigtige med, hvor meget af et site de vil hente, og mere tilbøjelige til at blive blokeret helt af robots.txt-regler, der kun blev skrevet med Googlebot i tankerne. En regel, der stiltiende udelukker “ukendte” eller aggressivt udseende bots, kan ramme GPTBot eller ClaudeBot som utilsigtet skade. Det er præcis den fejltype, som tjekket Robots.txt & Sitemaps findes for at fange — og det er derfor, dette er en af de første ting enhver AI-tilgængelighedsaudit bør verificere, før du bruger tid på indhold, schema eller noget andet.

Robots.txt & Sitemaps-sektionen i Agent Accessibility-audit’en

Important
En enkelt alt for streng regel i robots.txt kan blokere en AI-crawler fra hele dit site. Dette tjek er, hvor du fanger det, før det stille og roligt koster dig citationer.

Hvor du finder det

Det er sektionen Robots.txt & Sitemaps under Audit → Agent Accessibility. Agent Accessibility er den del af AmICiteds audit, der specifikt fokuserer på, om AI-systemer teknisk kan nå og fortolke dit indhold, i modsætning til de dele af produktet, der handler om indholdskvalitet og citationssporing. Robots.txt & Sitemaps er typisk det første tjek i den sektion, fordi alt andet, audit’en måler, forudsætter, at crawlerne overhovedet kan komme ind ad døren.

Hvad det tjekker

Som sektionen forklarer, undersøger den “om de vigtige AI- og søgemaskinecrawlere har tilladelse til at læse sitet, om sitemaps er deklareret i robots.txt, og hvor mange URL’er disse sitemaps i alt oplister.” Kort sagt:

  • Crawler-adgang — har de større AI- og søgemaskinebots tilladelse (ikke afvist) i robots.txt? AmICited evaluerer dine faktiske robots.txt-regler op mod user-agent-strengene for de crawlere, der betyder noget for AI-søgesynlighed, så du kan se, bot for bot, om den er tilladt, blokeret eller simpelthen ikke adresseret af nogen regel (hvilket normalt falder tilbage til tilladt under wildcard-blokken).
  • Sitemap-deklaration — er der refereret til et sitemap fra robots.txt, så crawlere kan finde det? Et sitemap, der findes, men ikke er linket fra robots.txt (og ikke er indsendt andre steder), er langt mindre tilbøjeligt til at blive fundet automatisk.
  • Sitemap-dækning — hvor mange URL’er dine sitemaps i alt oplister, hvilket giver dig et hurtigt sanity-tjek på, om dine publicerede sider rent faktisk bliver annonceret til crawlere.

Tilsammen besvarer disse tre tjek de to spørgsmål, der afgør, om et AI-system overhovedet kan begynde at evaluere dit indhold: får denne crawler lov til at komme ind, og ved den, hvad den skal hente, når den er her. Et brand kan gøre alt rigtigt på indholdssiden — klare svar, stærke entitetssignaler, velstrukturerede sider — og stadig være usynligt i AI-svar, simpelthen fordi en af disse to betingelser fejler stille i baggrunden.

Sådan bruger du det

  1. Bekræft, at crawlere har adgang. Hvis en vigtig AI-bot er blokeret, skal du rette robots.txt-reglen — dette er den højeste prioritet på siden. Tjek hver blokeret crawler op mod din hensigt: en regel, der blokerer GPTBot, er sandsynligvis skrevet med vilje, hvis du ikke vil have dit indhold brugt til OpenAIs modeltræning, men hvis den også stille blokerer OAI-SearchBot eller PerplexityBot — de crawlere, der rent faktisk driver live-citationer, i modsætning til modeltræning — mister du synlighed uden strategisk grund. Det er værd bevidst at beslutte, hvilke crawlere du vil give AI-bots lov til at crawle dit site , frem for at arve en standard, der blokerer alt uden forskel.
  2. Deklarér dit sitemap. Sørg for, at robots.txt peger på dit sitemap, så agenter kan opdage alle dine sider. Det er en enkelt linje — Sitemap: https://dinside.dk/sitemap.xml — men det er en af de mest almindeligt manglende detaljer på ellers velbyggede sites, især på sites, hvor sitemappet blev genereret automatisk af et CMS, men aldrig blev koblet tilbage til robots.txt.
  3. Tjek URL-antallet. Et sitemap, der oplister langt færre URL’er, end du har offentliggjort, betyder, at sider ikke bliver annonceret til crawlere. Det er normalt tegn på et forældet sitemap (genereret én gang og aldrig regenereret), et sitemap-indeks, der ikke linker alle sine underliggende sitemaps, eller et CMS-plugin, der stiltiende udelukker en indholdstype — nyligt publicerede blogindlæg og dynamisk genererede sider er ofte ofre.
  4. Tjek igen efter ændringer og bekræft, at felterne Crawler-adgang og Sitemap-URL’er i beredskabsoversigten viser grøn status.

Crawler-adgang er fundamentet: få det rigtigt først, for alt andet forudsætter, at bots rent faktisk kan nå dit indhold. Når adgang og opdagelse begge er bekræftet sunde, begynder resten af Agent Accessibility-audit’en — rendering, strukturerede data, svartider — at betyde noget, fordi de tjek kun betaler sig, hvis crawleren fik lov til at nå siden i første omgang.

Det er også værd at huske, at robots.txt og sitemap-dækning ikke er en engangsfiks. Nye sektioner lanceres, CMS-migreringer regenererer sitemaps med andre standardindstillinger, og CDN- eller WAF-regler bliver tilføjet længe efter, at det oprindelige robots.txt blev skrevet — alt sammen noget, der stille kan genindføre en blokeret crawler eller et ufuldstændigt sitemap. Nogle teams kombinerer dette tjek med serverlog-analyse for at bekræfte, at crawlere rent faktisk besøger de sider, de har lov til, og med en dedikeret llms.txt -fil, der giver AI-systemer et kurateret resumé af dit vigtigste indhold ved siden af det rå sitemap. Hvis du er i tvivl om, hvor robots.txt og sitemap-dækning passer ind i forhold til dit øvrige tekniske arbejde, gennemgår en bredere AI-synlighedsaudit hele sættet af tilgængelighedstjek i rækkefølge, og AmICiteds eget AI-synligheds -værktøj sporer, om det at rette disse problemer rent faktisk omsætter sig til flere citationer over tid — og parrer dermed den tekniske løsning med det resultat, den skal skabe, i stedet for at behandle “crawlere tilladt” som målstregen. For teams, der administrerer dette på tværs af snesevis af kundesites, er de samme adgangs- og sitemap-tjek et af de tilbagevendende punkter, der dækkes under AmICited til bureauer , da en enkelt fejlkonfigureret robots.txt-regel har tendens til at gentage sig på tværs af skabeloner og skal fanges tidligt i onboardingen — ikke efter en kunde spørger, hvorfor deres brand aldrig dukker op i ChatGPT.

← Alle Akademi-tutorials

Klar til at føre det ud i livet?

Gratis tjek · 14-dages prøveperiode · intet kreditkort