Como Verificar a Cobertura de Robots.txt e Sitemaps no AmICited
Use a verificação de Robots.txt e Sitemaps na auditoria de Acessibilidade de Agentes do AmICited para confirmar que os crawlers de IA e busca podem ler seu site e que seus sitemaps estão declarados e completos.
Se os crawlers de IA não conseguem ler seu site, nada mais do que você otimize importa.
O que é o robots.txt e por que ele decide se a IA consegue ver você?
O Robots.txt
é um arquivo de texto simples que fica na raiz do seu domínio (seusite.com/robots.txt) e informa aos crawlers quais partes do seu site eles têm permissão para acessar. Ele existe desde muito antes do boom da IA — foi originalmente criado para que bots de mecanismos de busca como o Googlebot não perdessem tempo rastreando páginas administrativas, ambientes de staging ou conteúdo duplicado. Mas o mesmo mecanismo hoje governa uma decisão de risco muito maior: se o GPTBot, o ClaudeBot, o PerplexityBot, o Google-Extended e os demais crawlers de IA que alimentam os mecanismos de resposta atuais têm permissão para buscar suas páginas.
Todo crawler bem-comportado verifica o robots.txt antes de solicitar qualquer outra coisa. O arquivo é organizado em blocos, cada um começando com uma linha User-agent que nomeia um bot específico (ou * para todos os bots), seguida por regras Allow e Disallow que especificam quais caminhos aquele bot pode ou não buscar. Uma única regra genérica como Disallow: / sob User-agent: GPTBot já é suficiente para excluir aquele crawler de todo o seu site — e ele não aparecerá nas citações do ChatGPT, por melhor que seja o seu conteúdo. É por isso que a rastreabilidade
— a propriedade geral de um site ser tecnicamente alcançável por bots — é tratada como a camada fundamental da visibilidade em buscas de IA, e não como um detalhe secundário.
O robots.txt também tem uma segunda função: normalmente é ali que os crawlers procuram um indicador do seu sitemap, por meio de uma diretiva Sitemap:. Um sitemap XML
é uma lista estruturada das URLs do seu site que você quer que os crawlers conheçam, geralmente incluindo metadados como datas de última modificação. Enquanto o robots.txt controla a permissão, o sitemap controla a descoberta — é o mapa que informa aos crawlers o que existe, para que eles não precisem encontrar cada página apenas seguindo links. Um site pode ter regras de robots.txt perfeitamente permissivas e ainda assim ser subindexado por sistemas de IA simplesmente porque seu sitemap está ausente, não referenciado ou incompleto.
Esses dois arquivos importam mais para a visibilidade em IA do que jamais importaram para o SEO tradicional. Os mecanismos de busca rastreiam a web há mais de 25 anos e construíram enormes grafos de links que permitem ao Googlebot descobrir páginas mesmo sem um sitemap. Os crawlers de IA são mais recentes, costumam ser mais conservadores quanto à quantidade de um site que vão buscar, e têm mais chance de ser bloqueados diretamente por regras de robots.txt escritas pensando apenas no Googlebot. Uma regra que exclui silenciosamente bots “desconhecidos” ou de aparência agressiva pode acabar bloqueando o GPTBot ou o ClaudeBot como dano colateral. Esse é o modo de falha específico que a verificação de Robots.txt e Sitemaps existe para detectar — e é por isso que essa é uma das primeiras coisas que qualquer auditoria de acessibilidade para IA deveria verificar, antes de você investir tempo em conteúdo, schema ou qualquer outra coisa.

robots.txt pode bloquear um crawler de IA de todo o seu site. É nesta verificação que você detecta isso antes que lhe custe citações silenciosamente.Onde encontrar
É a seção Robots.txt e Sitemaps de Auditoria → Acessibilidade de Agentes. Acessibilidade de Agentes é a parte da auditoria do AmICited focada especificamente em saber se os sistemas de IA conseguem tecnicamente alcançar e interpretar o seu conteúdo, diferenciando-se das partes do produto voltadas à qualidade do conteúdo e ao rastreamento de citações. Robots.txt e Sitemaps costuma ser a primeira verificação dessa seção, porque tudo o mais que a auditoria mede pressupõe que os crawlers conseguem, antes de tudo, entrar.
O que verifica
Como a seção explica, ela analisa “se os crawlers importantes de IA e busca têm permissão para ler o site, se os sitemaps estão declarados no robots.txt e quantas URLs esses sitemaps listam no total.” Em resumo:
- Acesso de crawlers — os principais bots de IA e busca têm permissão (não estão bloqueados) no
robots.txt? O AmICited avalia as regras reais do seurobots.txtem relação às strings de user-agent dos crawlers que importam para a visibilidade em buscas de IA, para que você veja, bot a bot, se ele está permitido, bloqueado ou simplesmente não abordado por nenhuma regra (o que geralmente resulta em permissão pelo bloco curinga). - Declaração de sitemap — um sitemap é referenciado a partir do
robots.txtpara que os crawlers possam encontrá-lo? Um sitemap que existe mas não está vinculado no robots.txt (e não foi enviado por nenhum outro meio) tem muito menos chance de ser detectado automaticamente. - Cobertura de sitemap — quantas URLs seus sitemaps listam no total, dando a você uma checagem rápida de sanidade sobre se suas páginas publicadas estão de fato sendo anunciadas aos crawlers.
Juntas, essas três verificações respondem às duas perguntas que determinam se um sistema de IA sequer consegue começar a avaliar seu conteúdo: esse crawler tem permissão de entrada e ele sabe o que buscar uma vez que chega lá. Uma marca pode estar fazendo tudo certo do lado do conteúdo — respostas claras, sinais de entidade fortes, páginas bem estruturadas — e ainda assim ser invisível nas respostas de IA simplesmente porque uma dessas duas condições falha silenciosamente nos bastidores.
Como usar
- Confirme se os crawlers têm permissão. Se um bot de IA importante estiver bloqueado, corrija a regra no
robots.txt— esta é a questão de maior prioridade na página. Verifique cada crawler bloqueado em relação à sua intenção: uma regra que bloqueia oGPTBotprovavelmente foi escrita de propósito, caso você não queira que seu conteúdo seja usado no treinamento de modelos da OpenAI; mas se ela também estiver bloqueando silenciosamente oOAI-SearchBotou oPerplexityBot— os crawlers que de fato alimentam citações ao vivo, em contraste com o treinamento de modelos — você está perdendo visibilidade sem nenhum motivo estratégico. Vale a pena decidir deliberadamente quais crawlers você quer permitir que bots de IA rastreiem seu site , em vez de herdar um padrão que bloqueia tudo indiscriminadamente. - Declare seu sitemap. Certifique-se de que o
robots.txtaponte para seu sitemap para que os agentes possam descobrir todas as suas páginas. É apenas uma linha —Sitemap: https://seusite.com/sitemap.xml— mas é um dos detalhes mais comumente ausentes em sites por outro lado bem construídos, especialmente naqueles em que o sitemap foi gerado automaticamente por um CMS mas nunca foi conectado de volta ao robots.txt. - Verifique a contagem de URLs. Um sitemap listando muito menos URLs do que você publicou significa que páginas não estão sendo anunciadas aos crawlers. Isso geralmente é sinal de um sitemap desatualizado (gerado uma vez e nunca mais regenerado), de um índice de sitemap que não está vinculando todos os seus sitemaps filhos, ou de um plugin de CMS que está excluindo silenciosamente um tipo de conteúdo — posts de blog recém-publicados e páginas geradas dinamicamente costumam ser vítimas comuns.
- Reavalie após edições e confirme se os blocos Acesso de crawlers e URLs do sitemap no resumo de prontidão ficam verdes.
O acesso de crawlers é a base: acerte isso primeiro, porque todo o resto presume que os bots conseguem de fato alcançar seu conteúdo. Depois que acesso e descoberta estiverem confirmados como saudáveis, o restante da auditoria de Acessibilidade de Agentes — renderização, dados estruturados, tempos de resposta — passa a importar, porque essas verificações só compensam se o crawler teve permissão para alcançar a página em primeiro lugar.
Também vale lembrar que o robots.txt e a cobertura de sitemap não são uma correção pontual. Novas seções são lançadas, migrações de CMS regeneram sitemaps com padrões diferentes, e regras de CDN ou WAF são adicionadas muito depois de o robots.txt original ter sido escrito — qualquer uma dessas mudanças pode reintroduzir silenciosamente um crawler bloqueado ou um sitemap incompleto. Algumas equipes combinam essa verificação com a análise de logs de servidor para confirmar que os crawlers estão de fato visitando as páginas às quais têm permissão de acesso, e com um arquivo llms.txt dedicado, que oferece aos sistemas de IA um resumo selecionado do seu conteúdo mais importante ao lado do sitemap bruto. Se você não tem certeza de como o robots.txt e a cobertura de sitemap se encaixam em relação ao restante do seu trabalho técnico, uma auditoria de visibilidade em IA mais ampla percorre todo o conjunto de verificações de acessibilidade em sequência, e a própria ferramenta de visibilidade em IA do AmICited rastreia se corrigir esses problemas realmente se traduz em mais citações ao longo do tempo — combinando a correção técnica com o resultado que ela deveria gerar, em vez de tratar “crawlers permitidos” como a linha de chegada. Para equipes que gerenciam isso em dezenas de sites de clientes, as mesmas verificações de acesso e sitemap são um dos itens recorrentes cobertos em AmICited para agências , já que uma única regra de robots.txt malconfigurada tende a se repetir entre templates e precisa ser detectada cedo no onboarding, não depois que um cliente perguntar por que sua marca nunca aparece no ChatGPT.
Mais tutoriais nesta seção
Como Verificar Seus Core Web Vitals no AmICited
Use a auditoria de Web Vitals no AmICited para ver os Core Web Vitals da sua página inicial — LCP, INP, CLS, …
Ler o guia →
Como Verificar a Pontuação de Acessibilidade do Agente no AmICited
Leia o Resumo de Prontidão do Agente na auditoria de Acessibilidade do Agente do AmICited — llms.txt, …
Ler o guia →
Como Revisar Seu Arquivo llms.txt no AmICited
Use a revisão llms.txt na auditoria de Acessibilidade de Agentes do AmICited para buscar e validar seu …
Ler o guia →Pronto para colocar em prática?
Verificação gratuita · Teste de 7 dias · sem cartão de crédito