Nos cinco mecanismos de IA, apenas 0,4% das respostas citam documentos PDF — a grande maioria das citações aponta para páginas web escritas comuns.
Apenas 80 de 19.279 respostas (0,4%) nos cinco mecanismos de IA monitorados citam documentos PDF. Páginas web HTML escritas respondem por praticamente todo o restante — portanto, a resposta para saber se os modelos de IA preferem conteúdo em PDF a artigos é um claro não, pelo menos para este conjunto de prompts.
Taxa de citação de documentos PDF por mecanismo de IA
O Google AI Mode cita documentos PDF com mais frequência (0,8%) e o Perplexity com menor frequência (0,1%) — uma diferença de 12×, mas mesmo o líder permanece em dígitos únicos baixos. Conteúdo em PDF é uma fonte de citação de nicho, não mainstream, em todos os mecanismos monitorados. O mecanismo que mais depende dele (Google AI Mode) é digno de nota se o PDF é central para o seu conteúdo, mas nenhum mecanismo o trata como formato primário.
Os números subjacentes
| Mecanismo de IA | Respostas | Citando documentos PDF | Taxa |
|---|---|---|---|
| Google AI Mode | 3.975 | 31 | 0,8% |
| ChatGPT | 5.119 | 35 | 0,7% |
| Gemini | 5.123 | 10 | 0,2% |
| Google AI Overviews | 2.010 | 2 | 0,1% |
| Perplexity | 3.052 | 2 | 0,1% |
O que é citado em vez disso
Os PDFs que são citados tendem a ser documentos oficiais e institucionais (órgãos governamentais, organizações de normalização, grandes consultorias) que existem principalmente em formato PDF — não material de marketing. Se o conteúdo pode existir como uma página HTML, essa versão tem muito mais probabilidade de ser encontrada e citada do que um PDF do mesmo material.
Citações de documentos PDF ao longo do tempo
Monitorada diariamente no Google AI Mode (seu mecanismo mais forte), a taxa de citação de PDF permanece baixa e estável ao longo do período — esta é uma preferência estrutural estável por páginas escritas, não uma queda temporária.
O que isso significa para a estratégia de conteúdo
Se o seu objetivo são citações em buscas com IA, páginas HTML escritas continuam sendo o formato principal — documentos PDF são citados com frequência baixa demais para construir uma estratégia em torno deles. Publique em HTML primeiro. Reserve PDFs para documentos formais onde o próprio formato adiciona credibilidade (relatórios, especificações, arquivos); para todo o resto, uma página HTML é o ativo citável. Se precisar disponibilizar um PDF, publique também uma página complementar em HTML.
Por que os PDFs são quase invisíveis para a busca com IA
A taxa de citação de PDF de 0,4% é ainda menor que a taxa de citação de vídeo (2,6%). Isso é impressionante porque os PDFs são, em princípio, mais fáceis de processar pelos mecanismos de IA do que vídeos — eles contêm texto extraível, são documentos estáticos e são amplamente utilizados para conteúdo autoritativo, como artigos de pesquisa, relatórios governamentais e especificações técnicas.
Então, por que os PDFs são citados com tão pouca frequência? Existem várias explicações prováveis:
PDFs são frequentemente bloqueados ou difíceis de encontrar. Muitos PDFs estão atrás de formulários, paywalls ou em estruturas de diretórios profundas que os crawlers de busca podem não explorar completamente. Uma página HTML normalmente está linkada a partir da navegação do site; um PDF é frequentemente um arquivo isolado.
PDFs são mais difíceis de interpretar de forma consistente. Embora os PDFs contenham texto, o processo de extração pode ser pouco confiável — layouts multicoluna, imagens incorporadas e formatação complexa podem produzir texto confuso ou incompleto. O HTML é um formato estruturado projetado para extração de texto.
PDFs carecem de metadados e contexto. Uma página HTML normalmente possui uma tag de título, meta descrição, cabeçalhos e marcação schema. Um PDF não possui nada disso — ou possui em formato menos padronizado. Os mecanismos de IA dependem desses metadados para entender sobre o que é uma página.
PDFs não são o formato primário da web. A web é predominantemente HTML. Os mecanismos de IA são otimizados para HTML. PDFs são um formato secundário que requer tratamento especial.
A taxa de citação de 0,4% não significa que PDFs são inúteis. Significa que são um formato de nicho para citações de IA. Se o seu conteúdo pode existir como uma página HTML, essa é a versão que obterá citações.
Quando os PDFs são citados
Os PDFs que conseguem entrar no conjunto de citações seguem um padrão claro: são documentos oficiais e autoritativos que existem principalmente ou exclusivamente em formato PDF. Exemplos dos nossos dados incluem:
- Documentos técnicos governamentais e arquivos regulatórios
- Artigos de pesquisa acadêmica (especialmente de domínios .edu)
- Documentos de normas técnicas (ISO, W3C, IETF)
- Relatórios de grandes consultorias (McKinsey, Deloitte, BCG)
Esses documentos compartilham duas características: são autoritativos por natureza de sua fonte e não estão disponíveis em uma versão HTML equivalente. O mecanismo de IA cita o PDF porque é a melhor fonte disponível para aquela informação — não porque o PDF é um formato preferido.
Para a maioria das organizações, o conteúdo que você produz (posts de blog, guias, documentação de produtos, estudos de caso) não possui essas características. Ele pode — e deve — existir como HTML.
A estratégia de complemento HTML
Se você tem conteúdo que precisa ser publicado como PDF (um relatório formal, um documento técnico, uma especificação), a abordagem mais eficaz é publicar uma página complementar em HTML. Esta é uma página web que:
- Resume as principais descobertas ou especificações do PDF
- Fornece contexto e informações de base que o PDF pode não ter
- Linka para o PDF para leitores que desejam o documento completo
- Inclui estrutura adequada de cabeçalhos, metadados e marcação schema
A página complementar em HTML se torna o ativo citável. O PDF permanece disponível para download, mas o mecanismo de IA cita a página HTML — que pode então direcionar leitores humanos para o PDF. Esta abordagem preserva a autoridade e formalidade do formato PDF enquanto garante a descoberta pela IA.
Recomendações práticas
Priorize HTML. A menos que haja um motivo específico para usar PDF, publique conteúdo como páginas HTML. Este é o formato que os mecanismos de IA citam.
Crie complementos HTML para PDFs existentes. Se você tem PDFs que representam conteúdo valioso e citável, crie páginas de resumo em HTML que capturem os pontos principais e linkem para o PDF completo.
Não restrinja seus PDFs desnecessariamente. Se um PDF exigir preenchimento de formulário ou login para acesso, os crawlers de IA não o verão. Torne o PDF diretamente acessível se quiser que ele seja citado.
Trate PDFs como um formato suplementar. Para documentos formais (relatórios, documentos técnicos, especificações), ofereça tanto um download em PDF quanto uma versão em HTML. A versão em HTML é a que conquista a citação.
Metodologia
Calculado a partir dos 1.905 prompts monitorados do AmICited (24 de junho de 2026 – 23 de julho de 2026). Uma resposta é contabilizada como citando um PDF quando o caminho da URL da fonte citada termina em .pdf; todo o resto é tratado como página HTML/escrita. As taxas são respostas-citando sobre total de respostas por mecanismo; o rótulo do formato é derivado inteiramente das URLs citadas nos dados — sem busca de páginas. O Copilot é monitorado, mas não retornou dados de citação. Nenhum link externo aparece neste relatório.
