Wśród pięciu silników AI zaledwie 0,4% odpowiedzi cytuje dokumenty PDF — zdecydowana większość cytowań wskazuje na zwykłe, tekstowe strony internetowe.
Tylko 80 z 19 279 odpowiedzi (0,4%) w pięciu monitorowanych silnikach AI cytuje dokumenty PDF. Strony HTML stanowią praktycznie wszystkie pozostałe — odpowiedź na pytanie, czy modele AI wolą treści PDF od artykułów, brzmi zdecydowanie nie, przynajmniej w przypadku tego zestawu zapytań.
Wskaźnik cytowania dokumentów PDF według silnika AI
Google AI Mode najczęściej cytuje dokumenty PDF (0,8%), a Perplexity najrzadziej (0,1%) — różnica 12-krotna, ale nawet lider utrzymuje się w niskich jednocyfrowych wartościach. Treści PDF są niszowym źródłem cytowań, a nie mainstreamowym, we wszystkich monitorowanych silnikach. Silnik, który polega na nich najbardziej (Google AI Mode), jest wart odnotowania, jeśli PDF jest kluczowy dla Twoich treści, ale żaden silnik nie traktuje go jako podstawowego formatu.
Podstawowe dane liczbowe
| Silnik AI | Odpowiedzi | Cytujące dokumenty PDF | Wskaźnik |
|---|---|---|---|
| Google AI Mode | 3 975 | 31 | 0,8% |
| ChatGPT | 5 119 | 35 | 0,7% |
| Gemini | 5 123 | 10 | 0,2% |
| Google AI Overviews | 2 010 | 2 | 0,1% |
| Perplexity | 3 052 | 2 | 0,1% |
Co zamiast tego jest cytowane
Pliki PDF, które faktycznie są cytowane, to głównie oficjalne i instytucjonalne dokumenty (organy rządowe, organizacje normalizacyjne, duże firmy konsultingowe), które istnieją przede wszystkim w formie PDF — a nie materiały marketingowe. Jeśli treść może istnieć jako strona HTML, ta wersja ma znacznie większe szanse zostać wyświetlona i zacytowana niż PDF z tym samym materiałem.
Cytowania dokumentów PDF w czasie
Monitorowany codziennie w Google AI Mode (najsilniejszym silniku dla tego formatu), wskaźnik cytowania PDF pozostaje niski i stabilny w całym okresie — jest to stała, strukturalna preferencja dla stron tekstowych, a nie tymczasowy spadek.
Co to oznacza dla strategii treści
Jeśli Twoim celem są cytowania w wyszukiwarkach AI, strony HTML pozostają podstawowym formatem — dokumenty PDF są cytowane zbyt rzadko, by budować na nich strategię. Publikuj najpierw w HTML. Pliki PDF zachowaj na formalne dokumenty, w których sam format dodaje wiarygodności (raporty, specyfikacje, zgłoszenia); w przypadku wszystkiego innego strona HTML jest aktywem, który może być cytowany. Jeśli musisz udostępnić PDF, opublikuj również towarzyszącą stronę HTML.
Dlaczego PDF są prawie niewidoczne dla wyszukiwarki AI
Wskaźnik cytowania PDF na poziomie 0,4% jest nawet niższy niż wskaźnik cytowania wideo (2,6%). Jest to uderzające, ponieważ pliki PDF są w zasadzie łatwiejsze do przetworzenia przez silniki AI niż wideo — zawierają tekst, który można wyodrębnić, są statycznymi dokumentami i są szeroko stosowane w przypadku autorytatywnych treści, takich jak prace badawcze, raporty rządowe i specyfikacje techniczne.
Dlaczego więc PDF są cytowane tak rzadko? Istnieje kilka prawdopodobnych wyjaśnień:
Pliki PDF są często za bramkami lub trudne do odkrycia. Wiele plików PDF znajduje się za formularzami, paywallami lub w głębokich strukturach katalogów, których roboty wyszukiwarek mogą w pełni nie eksplorować. Strona HTML jest zazwyczaj linkowana z nawigacji witryny; PDF jest często pojedynczym, odizolowanym plikiem.
Pliki PDF są trudniejsze do spójnego przetworzenia. Choć pliki PDF zawierają tekst, proces ekstrakcji może być zawodny — układy wielokolumnowe, osadzone obrazy i złożone formatowanie mogą powodować zniekształcony lub niekompletny tekst. HTML to ustrukturyzowany format zaprojektowany do ekstrakcji tekstu.
Plikom PDF brakuje metadanych i kontekstu. Strona HTML zazwyczaj ma tag tytułu, meta opis, nagłówki i znaczniki schematu. Plik PDF nie ma żadnego z nich — lub ma je w mniej ustandaryzowanej formie. Silniki AI polegają na tych metadanych, aby zrozumieć, o czym jest strona.
Pliki PDF nie są podstawowym formatem sieci. Sieć to w przeważającej mierze HTML. Silniki AI są zoptymalizowane pod kątem HTML. Pliki PDF to format drugorzędny, który wymaga specjalnego traktowania.
Wskaźnik cytowania na poziomie 0,4% nie oznacza, że PDF są bezwartościowe. Oznacza, że są one niszowym formatem dla cytowań AI. Jeśli Twoje treści mogą istnieć jako strona HTML, to właśnie ta wersja zdobędzie cytowania.
Kiedy PDF faktycznie są cytowane
Pliki PDF, które trafiają do zestawu cytowanych, mają wyraźny wzorzec: są to oficjalne, autorytatywne dokumenty, które istnieją głównie lub wyłącznie w formie PDF. Przykłady z naszych danych obejmują:
- Rządowe białe księgi i zgłoszenia regulacyjne
- Akademickie prace badawcze (zwłaszcza z domen .edu)
- Dokumenty norm technicznych (ISO, W3C, IETF)
- Raporty dużych firm konsultingowych (McKinsey, Deloitte, BCG)
Dokumenty te mają dwie wspólne cechy: są autorytatywne ze względu na swoje źródło i nie są dostępne w równoważnej wersji HTML. Silnik AI cytuje PDF, ponieważ jest to najlepsze dostępne źródło tych informacji — a nie dlatego, że PDF jest preferowanym formatem.
W przypadku większości organizacji treści, które produkujesz (wpisy na blogu, poradniki, dokumentacja produktów, studia przypadków) nie mają tych cech. Mogą — i powinny — istnieć jako HTML.
Strategia strony towarzyszącej HTML
Jeśli masz treści, które muszą być opublikowane jako PDF (formalny raport, biała księga, specyfikacja), najskuteczniejszym podejściem jest opublikowanie towarzyszącej strony HTML. Jest to strona internetowa, która:
- Podsumowuje kluczowe wnioski lub specyfikacje z pliku PDF
- Zapewnia kontekst i tło, których może brakować w PDF
- Linkuje do pliku PDF dla czytelników, którzy chcą pełny dokument
- Zawiera odpowiednią strukturę nagłówków, metadane i znaczniki schematu
Towarzysząca strona HTML staje się aktywem, który może być cytowany. Plik PDF pozostaje dostępny do pobrania, ale silnik AI cytuje stronę HTML — która może następnie kierować czytelników do PDF. Takie podejście zachowuje autorytet i formalność formatu PDF, zapewniając jednocześnie wykrywalność w AI.
Praktyczne zalecenia
Domyślnie wybieraj HTML. O ile nie ma konkretnego powodu, by użyć PDF, publikuj treści jako strony HTML. To jest format, który cytują silniki AI.
Twórz strony towarzyszące HTML dla istniejących PDF. Jeśli masz pliki PDF, które stanowią wartościowe, cytowalne treści, utwórz strony HTML z podsumowaniem, które ujmują kluczowe punkty i linkują do pełnego pliku PDF.
Nie umieszczaj niepotrzebnie plików PDF za bramkami. Jeśli plik PDF wymaga wypełnienia formularza lub logowania, roboty AI go nie zobaczą. Udostępnij plik PDF bezpośrednio, jeśli chcesz, aby był cytowany.
Traktuj PDF jako format uzupełniający. W przypadku formalnych dokumentów (raporty, białe księgi, specyfikacje) oferuj zarówno plik PDF do pobrania, jak i wersję HTML. Wersja HTML zdobywa cytowanie.
Metodologia
Dane obliczone na podstawie 1 905 monitorowanych zapytań AmICited (24 czerwca 2026 – 23 lipca 2026). Odpowiedź jest liczona jako cytująca PDF, gdy ścieżka URL cytowanego źródła kończy się na .pdf; wszystko inne jest traktowane jako strona HTML/tekstowa. Wskaźniki to odpowiedzi cytujące na całkowitą liczbę odpowiedzi dla danego silnika; etykieta formatu jest wyprowadzona wyłącznie z cytowanych URLi w danych — bez pobierania stron. Copilot jest monitorowany, ale nie zwrócił danych o cytowaniach. W niniejszym raporcie nie pojawiają się żadne linki zewnętrzne.
