Zablokowanie robotów AI jedną regułą w robots.txt może ograniczyć pobieranie treści przez dostawców, którzy ten standard respektują, a przy okazji odciąć firmę od kanału, w którym klient zadaje pytanie i dostaje odpowiedź z odnośnikiem. Te dwie rzeczy da się rozdzielić u OpenAI, Anthropic i Perplexity, a u Google nie: jeden token Google-Extended steruje zarówno trenowaniem modeli Gemini, jak i przywoływaniem treści strony w chwili zadania pytania (dokumentacja Google, stan na 27 lipca 2026). Do tego dochodzi termin łatwy do przeoczenia w dotychczasowych poradnikach o blokowaniu robotów: 15 września 2026 Cloudflare zmienia ustawienia domyślne dla nowych domen, blokując roboty kategorii Training i Agent na stronach wyświetlających reklamy, a osobno zaczyna traktować roboty wielofunkcyjne według wszystkich ich zastosowań naraz. Ten tekst rozdziela trzy kategorie robotów, podaje zweryfikowaną tabelę dwunastu agentów i pokazuje, gdzie kończy się deklaracja, a zaczyna egzekucja.
Kluczowe wnioski
✓ Roboty AI dzielą się na trzy kategorie o różnych skutkach dla firmy: trenujące, wyszukujące i działające na żądanie użytkownika. Blokada każdej z nich kosztuje co innego.
✓ Google jest przypadkiem szczególnym. Google-Extended steruje trenowaniem Gemini i przywoływaniem treści przy zapytaniu jednocześnie. Firma, która wpisała go do robots.txt po lekturze poradnika „zablokuj trenowanie”, mogła obniżyć swoją widoczność w odpowiedziach Gemini, nie wiedząc o tym (dokumentacja Google, 2026).
✓ 15 września 2026 Cloudflare zmienia wartości domyślne dla nowych domen: kategorie Agent i Training będą blokowane na stronach wyświetlających reklamy. Osobno, u każdego klienta, który zaznaczył blokowanie trenowania albo używa starszego przełącznika „Block AI bots”, roboty wielofunkcyjne (Googlebot, Applebot, Bingbot) zostaną objęte najbardziej restrykcyjną z pasujących reguł (Cloudflare, 1 lipca 2026).
✓ 52 procent zapytań robotów służyło w czerwcu 2026 trenowaniu modeli, wobec 22 procent wiosną 2025. Roboty wielofunkcyjne odpowiadały za ponad 36 procent aktywności (pomiar Cloudflare we własnej sieci, 2026; dane dostawcy, nie pomiar niezależny).
✓ Wpis w robots.txt jest deklaracją preferencji, a nie mechanizmem kontroli. OpenAI i Perplexity wprost zaznaczają, że wobec agentów uruchamianych przez użytkownika reguły z tego pliku mogą nie mieć zastosowania. Egzekucja zaczyna się na poziomie sieci dostarczania treści.
Czym różnią się trzy rodzaje robotów AI
Robot AI to zautomatyzowany program pobierający treść strony, a jego kategoria wynika z tego, co dzieje się z pobraną treścią później. Rozróżnienie ma trzy pozycje i każda oznacza inny interes właściciela strony.
Robot trenujący pobiera treść, żeby wbudować ją w model. Firma nie dostaje w zamian ani odwiedzin, ani wzmianki. Przykład: GPTBot (OpenAI), ClaudeBot (Anthropic).
Robot wyszukujący buduje bazę treści, z której model korzysta, odpowiadając na pytania, i zwykle podaje odnośnik do źródła. Razem z robotami działającymi na żądanie użytkownika to kategorie, które mogą przynieść firmie cytowanie z odnośnikiem. Przykład: OAI-SearchBot, PerplexityBot, Claude-SearchBot.
Robot działający na żądanie użytkownika wchodzi na stronę, bo konkretna osoba właśnie zadała pytanie i czeka na odpowiedź po drugiej stronie. Przykład: ChatGPT-User, Claude-User, Perplexity-User.
Ten podział nie jest formalnym standardem technicznym, lecz zbieżną praktyką czterech dostawców: OpenAI, Anthropic i Perplexity niezależnie od siebie dokumentują te same trzy role i nadają im osobne nazwy agentów. Cloudflare nazwał kategorie 1 lipca 2026 (Search, Agent, Training) i uczynił z nich osobne przełączniki dostępne wszystkim klientom, także w planie bezpłatnym.
Granica jest nieostra w jednym miejscu i nie jest to przypadek marginalny: roboty wielofunkcyjne pełnią więcej niż jedną rolę naraz i nie mieszczą się w żadnej z trzech kategorii osobno. Dotyczy to Googlebota.
Który mechanizm za co odpowiada: stan na 27 lipca 2026
Mechanizmów, którymi warto sterować, jest dziś dwanaście i różnią się nie tylko nazwą, lecz rodzajem: osiem to roboty pobierające strony automatycznie, trzy to pobrania uruchamiane przez człowieka, jeden nie wysyła żadnego żądania. Tabela zestawia te trzy byty, co widać w kolumnie „Typ” i co bywa mylone: robot pobierający strony automatycznie, mechanizm pobrania uruchamiany przez człowieka oraz token konfiguracyjny, który nie wysyła żadnego żądania i którego nie da się wykryć w logach serwera. Wszystkie pozycje potwierdzone w dokumentacji producentów 27 lipca 2026. Nazwy agentów zmieniają się szybciej niż cokolwiek innego w tym temacie, więc data sprawdzenia jest częścią danych, a nie przypisem.
| Nazwa | Właściciel | Typ | Przeznaczenie | Może dać cytowanie z odnośnikiem | Rekomendacja domyślna | Gdzie ustawić |
|---|---|---|---|---|---|---|
GPTBot |
OpenAI | robot automatyczny | trenowanie modeli podstawowych | nie | zablokować, jeśli treść jest wartością firmy | robots.txt |
OAI-SearchBot |
OpenAI | robot automatyczny | wyszukiwanie w ChatGPT | tak | wpuścić | robots.txt |
ChatGPT-User |
OpenAI | pobranie na żądanie użytkownika | wejście na stronę po pytaniu człowieka | tak | wpuścić | sieć lub zapora aplikacyjna |
OAI-AdsBot |
OpenAI | robot automatyczny | sprawdzenie strony docelowej reklamy | nie | wpuścić, jeśli reklamujesz się w ChatGPT | robots.txt |
ClaudeBot |
Anthropic | robot automatyczny | trenowanie modeli | nie | zablokować, jeśli treść jest wartością firmy | robots.txt |
Claude-SearchBot |
Anthropic | robot automatyczny | jakość wyników wyszukiwania | tak | wpuścić | robots.txt |
Claude-User |
Anthropic | pobranie na żądanie użytkownika | wejście na stronę po pytaniu człowieka | tak | wpuścić | robots.txt |
PerplexityBot |
Perplexity | robot automatyczny | wyszukiwanie i linkowanie stron | tak | wpuścić | robots.txt |
Perplexity-User |
Perplexity | pobranie na żądanie użytkownika | wejście na stronę po pytaniu człowieka | tak | wpuścić | sieć lub zapora aplikacyjna |
Google-Extended |
token sterujący, bez własnego ciągu user-agent | trenowanie Gemini oraz przywoływanie treści przy zapytaniu | tak, przez przywoływanie | nie blokować bez świadomej decyzji | robots.txt |
|
Googlebot |
robot wyszukiwarki, wielofunkcyjny według klasyfikacji Cloudflare | wyszukiwanie, Discover, funkcje wyszukiwarki | tak | wpuścić | robots.txt |
|
Google-CloudVertexBot |
robot automatyczny | pobieranie na zlecenie właściciela strony pod agentów Vertex AI | nie dotyczy | zależy od własnych wdrożeń | robots.txt |
Źródła pozycji: dokumentacja robotów OpenAI, centrum pomocy Anthropic, dokumentacja Perplexity, dokumentacja robotów Google. Wszystkie sprawdzone 27 lipca 2026.
Dwie rzeczy warto z tej tabeli wyjąć osobno. ChatGPT-User i Perplexity-User to jedyne pozycje, przy których producent zastrzega, że reguły z robots.txt mogą nie mieć zastosowania, ponieważ pobranie inicjuje człowiek. U OpenAI i Perplexity zmiana w robots.txt propaguje się do systemu wyszukiwania w około 24 godziny, więc test wykonany zaraz po edycji pliku pokaże stan sprzed zmiany.
Google: jedna dźwignia na dwie różne rzeczy
Google-Extended nie jest osobnym robotem, tylko tokenem sterującym w robots.txt, a jego zablokowanie wyłącza jednocześnie dwie rzeczy: wykorzystanie treści do trenowania przyszłych modeli Gemini oraz przywoływanie treści z indeksu wyszukiwarki do modelu w chwili zadania pytania. Google podaje to wprost we własnej dokumentacji i dodaje, że token nie wpływa na obecność strony w wyszukiwarce ani na pozycję w wynikach.
Konsekwencja jest praktyczna i nieoczywista. U OpenAI, Anthropic i Perplexity układ „nie trenuj na mnie, ale możesz mnie cytować” jest wykonalny, bo trenowanie i wyszukiwanie mają osobne nazwy agentów. U Google takiego układu nie ma. Firma, która przeczytała poradnik zaczynający się od zdania „zablokuj roboty trenujące” i dopisała Google-Extended do robots.txt, zablokowała także mechanizm, dzięki któremu jej treść mogłaby zostać przywołana w odpowiedzi Gemini.
Drugi wątek dokłada Cloudflare z pozycji operatora sieci: Google używa robota wielofunkcyjnego, więc właściciel strony nie odróżni, czy dane pobranie służyło wyszukiwarce, czy funkcjom AI. Cloudflare szacuje, że daje to Google około dwukrotnie szerszy dostęp do informacji niż wiodącym firmom AI (pomiar dostawcy we własnej sieci, 2026, nie badanie niezależne).
15 września 2026: Cloudflare zmienia ustawienia domyślne
Od 15 września 2026 dla nowych domen dołączających do Cloudflare kategorie Training i Agent będą domyślnie blokowane na stronach wyświetlających reklamy, a kategoria Search pozostanie domyślnie dozwolona. Tak brzmi komunikat Cloudflare z 1 lipca 2026.
Relacje prasowe z tego samego dnia podają zakres szerszy, obejmujący także nowe witryny klientów istniejących oraz dotychczasowych klientów planu bezpłatnego (TechCrunch, 2026). Rozbieżności nie da się rozstrzygnąć z dostępnych materiałów, więc bezpieczne założenie brzmi: sprawdź własne ustawienia niezależnie od planu, bo koszt sprawdzenia jest kilkuminutowy.
Drugi element tej zmiany jest ważniejszy dla polskiej firmy B2B niż pierwszy. Roboty wielofunkcyjne, czyli takie, które łączą wyszukiwanie z trenowaniem, będą od tej daty oceniane według wszystkich swoich zastosowań, a obowiązywać ma reguła najbardziej restrykcyjna z pasujących. Cloudflare wymienia z nazwy Googlebota, Applebota i Bingbota. Oznacza to, że klient, który zaznaczy „blokuj trenowanie”, zablokuje przy okazji Googlebota, czyli robota odpowiadającego za widoczność w klasycznej wyszukiwarce.
Dotyczy to również starszego, jednoprzyciskowego ustawienia „Block AI bots” z 2025 roku, a ci klienci są narażeni najbardziej, bo włączyli je dawno i zwykle o nim nie pamiętają. To ryzyko odcięcia się od wyszukiwarki bez podjęcia takiej decyzji. Cloudflare zapowiada powiadomienia i możliwość wypisania się z nowych ustawień przed 15 września.
Kontekst liczbowy tej zmiany, wszystko z pomiarów Cloudflare we własnej sieci opublikowanych 1 lipca 2026:
- 52 procent zapytań robotów służyło w czerwcu 2026 trenowaniu modeli, wobec 22 procent wiosną 2025
- roboty wielofunkcyjne odpowiadały za ponad 36 procent aktywności robotów
- ponad połowa ruchu w sieci przestała pochodzić od ludzi
- w najintensywniej odwiedzanych przez roboty kategoriach ruch ludzi spadł nawet o 40 procent w niecały rok
Źródłem jest Cloudflare Radar i prezentacja dla inwestorów z czerwca 2026. Kierunek potwierdzają inne obserwacje rynkowe, ale poziom procentowy pochodzi z jednego źródła, które ma interes w pokazaniu skali problemu.

Czego robots.txt nie egzekwuje
robots.txt jest deklaracją preferencji właściciela strony, którą dostawca robota może uszanować albo nie, i nie ma w nim żadnego mechanizmu wymuszającego. Wszyscy czterej producenci z tabeli deklarują przestrzeganie tego pliku przez roboty automatyczne, ale dwaj wprost wyłączają spod tej deklaracji agentów uruchamianych przez człowieka.
Plik zawiera przy tym dwa rodzaje wpisów: reguły dostępu dla konkretnych robotów oraz tokeny deklarujące dopuszczalne zastosowanie treści, jak Google-Extended, który nie zatrzymuje pobrania, tylko zmienia to, co wolno z pobraną treścią zrobić.
Deklaracja mówi, jak ma być. Blokada sieciowa sprawia, że tak jest. To ta sama różnica co między polityką a mechanizmem kontrolnym w każdej dojrzałej organizacji. Firma, która ma w dokumentacji zapis „nie zgadzamy się na wykorzystanie naszych treści do trenowania modeli” i nie ma nic poza wpisem w robots.txt, ma politykę bez kontroli.
Praktyczny wniosek: jeśli blokada ma znaczenie umowne, na przykład dotyczy treści objętych licencją klienta, sam wpis w robots.txt prawdopodobnie nie wystarczy jako środek techniczny, a o spełnieniu obowiązku decyduje treść umowy, nie plik. To pytanie do prawnika, nie do administratora. Do wyrażenia samej preferencji robots.txt wystarcza i jest tańszy.
Cloudflare testuje od 1 lipca 2026 czwarte pole w standardzie Content Signals (use=immediate, use=reference, use=full), opisujące, co robotowi wolno zachować i udostępnić dalej. To nadal sygnał preferencji, a nie blokada, co Cloudflare zaznacza wprost.
Trzy strategie i ich konsekwencje
Nie istnieje ustawienie dobre dla każdej firmy, bo wybór zależy od tego, czy treść jest produktem, czy narzędziem pozyskania klienta. Trzy typowe sytuacje z rynku polskiego pokazują, jak bardzo się to rozjeżdża.
Bank albo ubezpieczyciel. Publiczne komentarze eksperckie i materiały edukacyjne mają być cytowane, bo budują autorytet instytucji. Analizy objęte licencją i raporty dla klientów nie mają opuszczać strefy płatnej. To argument za konfiguracją rozdzielną według katalogu adresów, a nie jedną regułą dla całej domeny.
Firma doradcza albo szkoleniowa. Treść jest kosztem pozyskania klienta, nie produktem. Blokowanie robotów wyszukujących odcina kanał, w którym decydent zadaje pytanie branżowe i dostaje trzy nazwiska z odnośnikami. Roboty trenujące pozostają kwestią otwartą, bo korzyść z ich wpuszczenia jest niemierzalna.
Wydawca treści specjalistycznych albo dostawca danych. Treść jest towarem, a jej powielenie w odpowiedzi modelu zastępuje wizytę na stronie. Tutaj robots.txt nie wystarcza, bo znaczenie ma egzekucja i warunki licencyjne, a nie deklaracja.
Poniższa macierz zestawia trzy strategie, które z tych sytuacji wynikają.
| Strategia | Szansa na cytowanie w odpowiedziach AI | Ochrona treści przed trenowaniem | Koszt wdrożenia | Koszt obsługi ruchu robotów | Dla kogo ma sens |
|---|---|---|---|---|---|
| Wpuszczam wszystko | najwyższa | żadna | zerowy | najwyższy, rośnie z wielkością katalogu | firmy, dla których treść jest kosztem pozyskania klienta, a nie produktem |
| Blokuję trenowanie, wpuszczam wyszukiwanie i agentów | wysoka, z wyjątkiem Gemini, jeśli zablokujesz Google-Extended |
częściowa, oparta na deklaracji dostawcy | niski, kilka reguł w robots.txt |
średni | większość firm usługowych i doradczych, których widoczność opiera się na artykułach eksperckich |
| Blokuję wszystko na poziomie sieci | bliska zeru w kanale AI | wysoka wobec poprawnie zidentyfikowanych klientów, bez pełnej ochrony treści publicznej | średni, wymaga konfiguracji sieci | najniższy | wydawcy treści płatnych, firmy z treściami objętymi licencją albo umową z klientem |
Uwaga do wiersza środkowego, bo to najczęściej wybierany wariant: rozdzielenie jest wykonalne u OpenAI, Anthropic i Perplexity, a u Google wymaga świadomego wyboru między trenowaniem Gemini a przywoływaniem treści w odpowiedziach Gemini. Trzeciej opcji tam nie ma.
Żadna z trzech strategii nie chroni treści publicznej przed skopiowaniem, zarchiwizowaniem ani pobraniem przez klienta, który podszywa się pod przeglądarkę. Blokada sieciowa podnosi koszt takiego pobrania, lecz go nie wyklucza.
Czy warto publikować llms.txt
llms.txt to plik w formacie Markdown w katalogu głównym domeny, opisujący modelom strukturę i najważniejsze podstrony serwisu. Na dziś żaden duży dostawca nie zadeklarował publicznie, że czyta go jako sygnał wpływający na cytowanie.
Stan potwierdzony: Google w czerwcu 2026 uzupełnił własną dokumentację o zapis, że llms.txt nie jest wymagany dla wyszukiwarki Google. Dokumentacja robotów OpenAI i centrum pomocy Anthropic odsyłają do robots.txt jako narzędzia zarządzania dostępem i nie wskazują llms.txt w tej roli. Jednocześnie Anthropic, Cloudflare, Stripe i Vercel publikują takie pliki dla własnej dokumentacji technicznej.
Dane o skali, wszystkie do traktowania jako Tier 3: liczba wystąpień pliku wzrosła w rok około 8,8-krotnie, z 4088 do 36 120 (pomiar Originality.ai); 97 procent plików nie doczekało się ani jednego żądania, roboty AI odpowiadały za 1,1 procent zapytań o te pliki, a narzędzia analityki wyszukiwarkowej za 21,7 procent (analiza logów 137 000 domen, Ahrefs, maj 2026). Obie liczby za relacją ppc.land z 2 lipca 2026, bez dostępu do surowych danych.
Rekomendacja warunkowa. Publikuj llms.txt, jeśli generuje go automatycznie twój system zarządzania treścią albo jeśli twoją grupą odbiorców są agenci programistyczne czytające dokumentację techniczną. Nie inwestuj w niego czasu programisty, jeśli celem jest widoczność w odpowiedziach modeli, bo na dziś brakuje dowodu, że którykolwiek dostawca używa go w tej roli.
Jak wykonać wstępny test konfiguracji strony
Test sprawdza, czy strona nie odrzuca ruchu na podstawie samej nazwy agenta, i zajmuje kwadrans. Nie symuluje prawdziwego robota, o czym niżej. Cztery kroki, z których trzy pierwsze dotyczą konfiguracji, a czwarty skutku.
Krok 1. Sprawdź kod odpowiedzi dla wybranego agenta.
curl -L -s -o /dev/null -w "%{http_code} %{url_effective}\n" \
-A "OAI-SearchBot/1.4" https://twojafirma.pl/
curl -L -s -o /dev/null -w "%{http_code} %{url_effective}\n" \
-A "PerplexityBot/1.0" https://twojafirma.pl/
curl -L -s -o /dev/null -w "%{http_code} %{url_effective}\n" \
-A "Claude-SearchBot" https://twojafirma.pl/
Przełącznik -L podąża za przekierowaniami, a -w pokazuje końcowy kod i adres docelowy. Nie używaj curl -I, bo wysyła metodę HEAD, którą część serwerów i zapór obsługuje inaczej niż zwykłe pobranie.
Oczekiwany wynik to kod z rodziny 2xx pod adresem kanonicznym. Wersja protokołu nie ma znaczenia, a przekierowanie 301 na adres kanoniczny jest poprawne, o ile łańcuch kończy się kodem 200. Kod 403 oznacza, że coś odrzuca żądanie na poziomie sieci lub zapory, niezależnie od tego, co jest w robots.txt.
Czego ten test nie dowodzi. Nagłówek user-agent można dowolnie podrobić, a zapora aplikacyjna weryfikuje zwykle również adres IP, sygnaturę zweryfikowanego robota i zachowanie klienta. Dlatego wynik zawodzi w obie strony: kod 200 nie dowodzi, że prawdziwy robot pobiera stronę, a kod 403 bywa fałszywym alarmem, bo podrobiony agent bez poprawnego adresu IP bywa traktowany surowiej niż robot prawdziwy. Właściwa weryfikacja opiera się na publikowanych zakresach adresów IP: OpenAI, Anthropic i Perplexity udostępniają je w plikach JSON, Google podaje metodę odwrotnego DNS. Ten test jest orientacyjnym sprawdzeniem prostej blokady po nazwie, nie dowodem dostępu.
Krok 2. Sprawdź, czy w robots.txt nie ma reguł odziedziczonych po wcześniejszych ustawieniach.
curl -s https://twojafirma.pl/robots.txt | grep -iE "gptbot|oai-|chatgpt|claude|perplexity|google-extended"
Szczególnie warto poszukać wpisu Google-Extended, bo trafia do plików przez poradniki i wtyczki, zwykle bez świadomej decyzji.
Krok 3. Sprawdź panel dostawcy sieci. W Cloudflare ustawienia trzech kategorii są w sekcji bezpieczeństwa i od 15 września 2026 podlegają nowym wartościom domyślnym dla nowych witryn. Rozbieżność między robots.txt a ustawieniem sieciowym rozstrzyga się zawsze na korzyść sieci.
Krok 4. Sprawdź, czy ktokolwiek Cię cytuje. Raport AI Performance w Bing Webmaster Tools, w publicznej wersji zapoznawczej od lutego 2026, pokazuje, które podstrony były przywołane w odpowiedziach AI i przy jakich zapytaniach. Microsoft zastrzega, że dane są zagregowane i nie wyjaśniają, dlaczego konkretna strona została użyta. Mimo to jest to jedno z nielicznych narzędzi, w których właściciel witryny widzi własne cytowania; Google, OpenAI ani Anthropic nie dają odpowiednika.
Trzy pierwsze kroki opisują konfigurację, czwarty opisuje skutek. Dopiero razem dają obraz, którego nie zastąpi lektura dokumentacji, przy czym żaden z nich nie dowodzi, że konkretny robot skutecznie pobiera Twoją stronę.
Kluczowe pytania i decyzje
Cztery pytania, które w praktyce rozstrzygają konfigurację. Przy każdym odpowiedź jest warunkowa i zależy od tego, czy treść jest u Ciebie produktem, czy kosztem pozyskania klienta.
Czy blokować roboty trenujące, jeśli firma żyje z pozyskiwania klientów przez treść?
Tak, w wariancie domyślnym: zablokować dedykowane roboty trenujące, wpuścić wyszukujące i te działające na żądanie użytkownika. Korzyść z wpuszczenia robota trenującego jest dla firmy usługowej niemierzalna, a koszt blokady bliski zeru, skoro u OpenAI, Anthropic i Perplexity role mają osobne nazwy.
Nie, jeśli blokada odcięłaby przy okazji ważny kanał, czyli u Google i w ustawieniach sieciowych obejmujących roboty wielofunkcyjne. Gdy powodem są zobowiązania umowne, sam wpis w robots.txt i tak nie wystarczy, bo jest deklaracją, a nie zabezpieczeniem.
Czy zablokowanie Google-Extended obniża pozycję w wyszukiwarce Google?
Nie. Google podaje we własnej dokumentacji, że token nie wpływa na obecność strony w wyszukiwarce ani nie jest sygnałem rankingowym.
Tak, jeśli chodzi o widoczność w odpowiedziach Gemini, bo ten sam token steruje przywoływaniem treści przy zadaniu pytania.
Czy firma na 50 do 500 osób musi coś zrobić przed 15 września 2026?
Tak, jeśli dodaje nową domenę do Cloudflare albo korzysta z blokowania robotów trenujących, w tym ze starszego przełącznika „Block AI bots”. Wtedy warto wejść w ustawienia bezpieczeństwa i sprawdzić trzy kategorie, zanim zrobią to za nią wartości domyślne.
Nie, jeśli korzysta z innego dostawcy i ma świadomie ustawiony robots.txt. Wtedy wystarczy przegląd pliku pod kątem wpisów odziedziczonych. Sama obecność w planie bezpłatnym Cloudflare oznacza dostęp do nowych przełączników, ale nie przesądza, że konfiguracja istniejącej domeny zmieni się automatycznie.
Czy wpuszczenie robotów wyszukujących gwarantuje cytowanie w odpowiedziach AI?
Nie. Dostępność dla robota jest warunkiem koniecznym, nie wystarczającym. Zwiększa szansę na przywołanie treści, ale o samym cytowaniu decydują mechanizmy doboru źródeł, których żaden dostawca nie ujawnia.
Brak dostępu działa natomiast konkretnie i wąsko: OpenAI podaje, że strony wypisane z OAI-SearchBot nie pojawiają się w odpowiedziach wyszukiwania ChatGPT, choć nadal mogą występować jako odnośniki nawigacyjne. To zamyka jeden kanał, a nie wszystkie. Informacja o firmie może dotrzeć do modelu również przez indeks klasycznej wyszukiwarki, przez strony cytujące materiał albo przez wcześniejsze pobranie.
Kiedy ta analiza się nie sprawdzi
Podział na kategorie jest deklaracją producenta, nie faktem sprawdzalnym z zewnątrz. Firma przyjmuje na wiarę, że robot opisany jako wyszukujący nie zasila zbioru treningowego. Perplexity deklaruje, że żaden z jego dwóch robotów nie służy zbieraniu treści do trenowania modeli podstawowych, i nie istnieje sposób, żeby właściciel strony to zweryfikował. Cała konstrukcja opiera się na zaufaniu do dostawcy i na tym, że utrata statusu zweryfikowanego robota u dużego operatora sieci jest dla niego kosztowna.
Nazwy i przeznaczenie agentów zmieniają się w miesiącach, nie w latach. OpenAI ma dziś czterech agentów, w tym OAI-AdsBot związanego z reklamami w ChatGPT. Każdy tekst tego typu, łącznie z tym, wymaga przeglądu mniej więcej co pół roku i sprawdzenia każdej pozycji tabeli u producenta osobno.
Nie ma publicznych danych łączących wpuszczenie robotów z przychodem. Wymiana wygląda na oddanie czegoś pewnego, czyli kontroli nad treścią, za coś niepewnego, czyli szansę na przywołanie w odpowiedzi. Ktokolwiek twierdzi, że zna zwrot z tej inwestycji, sprzedaje wiarę, a nie pomiar. Uczciwa teza brzmi węziej: dostępność zwiększa szansę na cytowanie, a jej brak zamyka konkretny kanał, choć nie wszystkie naraz.
Dane o skali ruchu robotów pochodzą od dostawcy infrastruktury, który mierzy własną sieć i ma interes w pokazaniu skali zjawiska obsługiwanego własnymi produktami. Kierunek zmiany jest wiarygodny, konkretne wartości procentowe wymagają ostrożności.
Podsumowanie
Decyzja o robotach AI przestała być kwestią jednej linijki w robots.txt i stała się wyborem między trzema kategoriami dostępu, z których każda kosztuje co innego. Roboty trenujące nie dają odesłania ani cytowania, wyszukujące mogą przynieść jedno i drugie, a działające na żądanie użytkownika obsługują człowieka czekającego po drugiej stronie. Blokowanie wszystkich jedną regułą jest wygodne i najczęściej nietrafne: chroni przed czymś, co dla większości firm B2B nie jest ryzykiem, kosztem tego, co dla nich jest szansą.
Dwa punkty wymagają decyzji w najbliższych tygodniach: Google-Extended, który wymaga świadomego wyboru zamiast skopiowania z poradnika, oraz 15 września 2026, po którym zaznaczenie blokady trenowania w Cloudflare obejmie także roboty wielofunkcyjne, z Googlebotem włącznie.
Minimalny zakres działania jest krótki: przejrzeć robots.txt pod kątem wpisów odziedziczonych po wtyczkach i poradnikach, zobaczyć, co jest zaznaczone u dostawcy sieci, i sprawdzić w Bing Webmaster Tools, czy cokolwiek z Twojej strony jest w ogóle przywoływane w odpowiedziach AI. Kwadrans na trzy pierwsze rzeczy; czwarta, czyli dowód, że prawdziwy robot pobiera stronę, wymaga już weryfikacji po adresach IP.
Powiązane analizy
- Oznaczanie treści generowanych przez AI: kiedy informowanie odbiorcy jest obowiązkowe.
- Agenci AI w firmie: produktywność, uprawnienia i nadzór.
- Koszt używania AI i paradoks Jevonsa: dlaczego tańsze użycie może zwiększać łączny koszt.
O autorze
Remigiusz Pruszczak: ekspert GenAI i trener AI, makler papierów wartościowych z uprawnieniami do wykonywania czynności doradztwa inwestycyjnego (licencja nr 2343). Ponad 30 lat w finansach. Od 17 lat prowadzi szkolenia, a od 2025 roku również z generatywnej AI, między innymi dla banków, instytucji finansowych, kancelarii oraz firm z sektorów regulowanych i produkcji. Szkolenia realizuje we współpracy z EY Academy of Business Polska, Warszawskim Instytutem Bankowości, Bankowym Ośrodkiem Doradztwa i Edukacji oraz CFA Society Poland. Więcej na stronie „O mnie".
Źródła
- OpenAI, „Overview of OpenAI Crawlers”, dokumentacja dla deweloperów, stan na 27 lipca 2026. https://developers.openai.com/api/docs/bots
- Anthropic, „Does Anthropic crawl data from the web, and how can site owners block the crawler?”, centrum pomocy, aktualizacja 7 kwietnia 2026. https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler
- Perplexity, „Perplexity Crawlers”, dokumentacja, stan na 27 lipca 2026. https://docs.perplexity.ai/guides/bots
- Google, „List of Google’s common crawlers”, dokumentacja infrastruktury indeksowania, aktualizacja 14 lipca 2026. https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers
- Cloudflare, Jin-Hee Lee i Bryan Becker, „Your site, your rules: new AI traffic options for all customers”, 1 lipca 2026. https://blog.cloudflare.com/content-independence-day-ai-options/
- Cloudflare, Arielle Weiss, Zach Albertson i Emily Lanfear, „Content Independence Day, one year on: building the business model for the agentic Internet”, 1 lipca 2026. Metodyka: Cloudflare Radar oraz prezentacja inwestorska z czerwca 2026. https://blog.cloudflare.com/agentic-internet-bot-report/
- Cloudflare, „Introducing pay per crawl”, 1 lipca 2025, opis mechanizmu odpowiedzi HTTP 402. https://blog.cloudflare.com/introducing-pay-per-crawl/
- ppc.land, „llms.txt adoption rises 8.8x but 97% of files get zero AI requests”, 2 lipca 2026, relacja z danych Originality.ai i Ahrefs. https://ppc.land/llms-txt-adoption-rises-8-8x-but-97-of-files-get-zero-ai-requests/
- Bing Webmaster Blog, „Introducing AI Performance in Bing Webmaster Tools Public Preview”, luty 2026, oraz dokumentacja raportu AI Performance z zastrzeżeniami o kompletności danych. https://blogs.bing.com/webmaster/February-2026/Introducing-AI-Performance-in-Bing-Webmaster-Tools-Public-Preview
- TechCrunch, „Cloudflare’s new policy pushes AI companies to pay for publishers’ content”, 1 lipca 2026, relacja podająca szerszy zakres zmiany ustawień domyślnych niż komunikat producenta. https://techcrunch.com/2026/07/01/cloudflares-new-policy-pushes-ai-companies-to-pay-for-publishers-content/

