Napříč pěti AI enginy cituje jen 0,4 % odpovědí PDF dokumenty — naprostá většina citací směřuje na běžné psané webové stránky.
Pouze 80 z 19 279 odpovědí (0,4 %) napříč pěti sledovanými AI enginy cituje PDF dokumenty. Zbývající citace připadají prakticky výhradně na psané HTML stránky — odpověď na otázku, zda AI modely preferují PDF obsah před články, je tedy jednoznačné ne, alespoň pro tuto sadu dotazů.
Míra citování PDF dokumentů podle AI enginu
Google AI Mode cituje PDF dokumenty nejčastěji (0,8 %) a Perplexity nejméně (0,1 %) — dvanáctinásobný rozdíl, ale i lídr se pohybuje v nízkých jednotkách procent. PDF obsah je okrajovým zdrojem citací, nikoli mainstreamovým, u všech sledovaných enginů. Engine, který se na něj spoléhá nejvíce (Google AI Mode), stojí za zmínku, pokud je PDF pro váš obsah klíčový, ale žádný engine s ním nepracuje jako s primárním formátem.
Konkrétní čísla
| AI engine | Odpovědí | Citujících PDF dokumenty | Míra |
|---|---|---|---|
| Google AI Mode | 3 975 | 31 | 0,8 % |
| ChatGPT | 5 119 | 35 | 0,7 % |
| Gemini | 5 123 | 10 | 0,2 % |
| Google AI Overviews | 2 010 | 2 | 0,1 % |
| Perplexity | 3 052 | 2 | 0,1 % |
Co se místo toho skutečně cituje
PDF, která jsou citována, tíhnou k oficiálním a institucionálním dokumentům (vládní orgány, normalizační organizace, velké poradenské firmy), které existují primárně ve formátu PDF — nikoli k marketingovým materiálům. Pokud obsah může existovat jako HTML stránka, je tato verze mnohem pravděpodobněji objevena a citována než PDF stejného materiálu.
Citace PDF dokumentů v čase
Při každodenním sledování v Google AI Mode (nejsilnějším enginu pro PDF) zůstává míra citování PDF nízká a plochá v celém sledovaném období — jde o stabilní strukturální preferenci psaných stránek, nikoli o dočasný výkyv.
Co to znamená pro obsahovou strategii
Pokud je vaším cílem získávat citace v AI vyhledávání, psané HTML stránky zůstávají základním formátem — PDF dokumenty jsou citovány příliš vzácně na to, aby se na nich dala postavit strategie. Publikujte primárně v HTML. PDF si vyhraďte pro formální dokumenty, kde formát sám o sobě přidává na důvěryhodnosti (zprávy, specifikace, podání); u všeho ostatního je HTML stránka tím citačně hodnotným aktivem. Pokud už musíte PDF vydat, vytvořte k němu i doprovodnou HTML stránku.
Proč jsou PDF pro AI vyhledávání téměř neviditelná
Míra citování PDF 0,4 % je ještě nižší než míra citování videa (2,6 %). To je pozoruhodné, protože PDF jsou pro AI enginy v zásadě snadněji zpracovatelné než video — obsahují extrahovatelný text, jsou to statické dokumenty a jsou široce používány pro autoritativní obsah, jako jsou výzkumné práce, vládní zprávy a technické specifikace.
Proč jsou tedy PDF citována tak zřídka? Existuje několik pravděpodobných vysvětlení:
PDF jsou často za branou nebo těžko objevitelná. Mnoho PDF je skryto za formuláři, paywally nebo v hlubokých adresářových strukturách, které vyhledávací crawleři nemusí plně prozkoumat. HTML stránka je obvykle propojena z navigace webu; PDF je často izolovaný soubor.
PDF se hůře konzistentně parsují. Přestože PDF obsahují text, proces extrakce může být nespolehlivý — více Sloupcové rozložení, vložené obrázky a složité formátování mohou produkovat zkomolený nebo neúplný text. HTML je strukturovaný formát navržený pro extrakci textu.
PDF postrádají metadata a kontext. HTML stránka má obvykle titulek, meta popis, nadpisy a schema markup. PDF nic z toho nemá — nebo to má v méně standardizované podobě. AI enginy se na tato metadata spoléhají při porozumění obsahu stránky.
PDF nejsou primárním formátem webu. Web je z drtivé většiny tvořen HTML. AI enginy jsou optimalizovány pro HTML. PDF je sekundární formát, který vyžaduje speciální zpracování.
Míra citování 0,4 % neznamená, že jsou PDF bezcenná. Znamená to, že jde o okrajový formát pro AI citace. Pokud váš obsah může existovat jako HTML stránka, pak právě tato verze bude získávat citace.
Kdy jsou PDF přesto citována
PDF, která se do citačního vzorku dostanou, vykazují jasný vzorec: jsou to oficiální, autoritativní dokumenty, které existují primárně nebo výhradně ve formátu PDF. Příklady z našich dat zahrnují:
- Vládní bílé knihy a regulatorní podání
- Akademické výzkumné práce (zejména z domén .edu)
- Dokumenty technických norem (ISO, W3C, IETF)
- Zprávy velkých poradenských firem (McKinsey, Deloitte, BCG)
Tyto dokumenty sdílejí dvě vlastnosti: jsou autoritativní svým zdrojem a nejsou dostupné v ekvivalentní HTML verzi. AI engine cituje PDF, protože je to nejlepší dostupný zdroj dané informace — nikoli proto, že by PDF byl preferovaným formátem.
Pro většinu organizací obsah, který vytváříte (blogové příspěvky, průvodce, produktová dokumentace, případové studie), tyto vlastnosti nemá. Může — a měl by — existovat jako HTML.
Strategie doprovodné HTML stránky
Pokud máte obsah, který musí být publikován jako PDF (formální zpráva, bílá kniha, specifikace), nejúčinnějším přístupem je publikovat doprovodnou HTML stránku. Je to webová stránka, která:
- Shrnuje klíčová zjištění nebo specifikace z PDF
- Poskytuje kontext a pozadí, které PDF může postrádat
- Odkazuje na PDF pro čtenáře, kteří chtějí celý dokument
- Obsahuje správnou strukturu nadpisů, metadata a schema markup
