Jeżeli zależy Ci na widoczności publicznych stron w ChatGPT Search, najważniejszy crawler to OAI-SearchBot. GPTBot pełni inną rolę i decyzja o jego blokowaniu nie jest tym samym co blokowanie wyszukiwania. W praktyce oznacza to, że jedna ogólna reguła „zablokuj wszystkie boty AI” może przypadkowo odciąć kanał, z którego chcesz pozyskiwać widoczność.
robots.txt trzeba więc konfigurować według funkcji crawlera, a nie według emocjonalnej etykiety „AI bot”.
OAI-SearchBot i GPTBot to nie to samo
| User-agent | Rola w uproszczeniu | Znaczenie dla właściciela strony |
|---|---|---|
| OAI-SearchBot | odkrywanie i pobieranie stron na potrzeby funkcji wyszukiwania | blokada może ograniczyć możliwość użycia strony w odpowiedziach wyszukiwawczych |
| GPTBot | crawler związany z gromadzeniem treści na potrzeby ulepszania modeli | można podejmować odrębną decyzję od Search |
To rozdzielenie jest ważne strategicznie. Firma może chcieć, aby jej publiczne poradniki były znajdowane i cytowane w wyszukiwaniu, a jednocześnie mieć inną politykę wobec wykorzystania treści do trenowania modeli.
Jeżeli nie wiesz, od czego zacząć z GEO, zobacz jak budować widoczność firmy w ChatGPT.
Co tak naprawdę robi robots.txt?
robots.txt to publiczny plik w katalogu głównym domeny, który przekazuje crawlerom reguły dostępu. Może dopuścić jednego user-agenta i zablokować innego.
Problem zaczyna się, gdy administrator ma regułę w rodzaju:
User-agent: *
Disallow: /
Taka konfiguracja mówi wszystkim zgodnym crawlerom, że nie powinny pobierać żadnej strony. Jeśli serwis ma działać w wyszukiwarkach, jest to zwykle rozwiązanie sprzeczne z celem.
Drugi częsty przypadek to automatyczna lista „AI crawlers” dodana przez wtyczkę bezpieczeństwa lub CDN. Właściciel strony włącza ją jednym przełącznikiem, nie sprawdzając, które boty odpowiadają za wyszukiwanie, a które za inne funkcje.
Trzy sensowne scenariusze
Chcesz widoczności w ChatGPT Search
Nie blokuj OAI-SearchBot na publicznych stronach, które mają być dostępne w wyszukiwaniu. Sprawdź także, czy serwer, CDN i WAF faktycznie przepuszczają żądania, bo sam robots.txt nie gwarantuje technicznego dostępu.
Chcesz wyszukiwania, ale nie chcesz GPTBot
Skonfiguruj reguły osobno dla user-agentów. Nie używaj ogólnej blokady wszystkich botów AI, jeżeli zależy Ci na Search.
Nie chcesz, żeby dana strona pojawiała się publicznie
Nie polegaj wyłącznie na robots.txt. Dla treści, które nie powinny być indeksowane, stosuje się odpowiednie mechanizmy indeksowania, autoryzację lub usunięcie publicznego dostępu. Sposób zależy od rodzaju treści.
Pułapka: blokada crawlera może utrudnić odczytanie noindex
Jeżeli crawler nie może pobrać strony z powodu robots.txt, nie zobaczy meta robots umieszczonego w HTML tej strony. Dlatego „Disallow” i „noindex” nie są wymiennymi narzędziami.
W praktyce trzeba najpierw ustalić cel:
- nie crawlować — reguła dostępu;
- nie indeksować — sygnał indeksowania lub brak publicznego dostępu;
- być dostępnym w Search — crawler musi móc odczytać stronę;
- kontrolować inny typ użycia — osobna polityka dla właściwego user-agenta.
robots.txt to tylko pierwsza warstwa. CDN może blokować wszystko dalej
Strona może formalnie zezwalać na OAI-SearchBot, a mimo to zwracać 403 lub challenge JavaScript. Przyczyną bywa:
- WAF blokujący nietypowe user-agenty;
- ochrona przed botami w CDN;
- rate limiting;
- reguły geograficzne;
- blokada ruchu bez cookies;
- plugin WordPress „AI blocker”;
- serwer wymagający wykonania JavaScript przed pokazaniem treści.
Dla GEO liczy się realny dostęp do HTML, nie tylko poprawnie wyglądający plik robots.txt.
Co powinno być dostępne crawlerowi?
Nie musisz otwierać całego zaplecza. Publiczna widoczność powinna obejmować przede wszystkim:
- stronę główną;
- strony usług i produktów;
- stronę o firmie;
- ważne poradniki i artykuły;
- kontakt i dane identyfikujące podmiot;
- treści, które chcesz mieć cytowane.
Panel administracyjny, koszyk techniczny, wyszukiwarka wewnętrzna czy prywatne zasoby nadal mogą mieć własne ograniczenia.
Jak sprawdzić, czy przypadkiem nie blokujesz Search?
- Otwórz publiczny plik /robots.txt.
- Znajdź reguły dotyczące OAI-SearchBot, GPTBot i ogólnego User-agent: *.
- Sprawdź, czy ważne katalogi nie są zablokowane przez szerszą regułę.
- Przejrzyj ustawienia CDN/WAF dotyczące botów AI.
- Sprawdź logi serwera: czy żądania kończą się kodem 200, 403, 429 lub przekierowaniami.
- Po zmianie daj crawlerom czas na ponowne odwiedziny.
Nie oceniaj efektu po jednym pytaniu w ChatGPT. Widoczność może zależeć również od indeksów, innych źródeł i dopasowania treści do zapytania. Artykuł jak sprawdzić widoczność firmy w systemach AI pokazuje szerszy sposób pomiaru.
Nie blokuj crawl’owania, a potem nie kupuj „GEO naprawiającego niewidoczność”
To częstszy problem, niż wygląda. Firma inwestuje w treści, digital PR i dane strukturalne, ale warstwa bezpieczeństwa odcina boty, które miały te informacje przeczytać. Techniczny audyt dostępności powinien być jednym z pierwszych kroków strategii GEO.
FAQ
Czy GPTBot odpowiada za ChatGPT Search?
Nie należy traktować go jako odpowiednika OAI-SearchBot. OpenAI rozdziela crawlery według funkcji.
Czy blokada GPTBot automatycznie blokuje Search?
Nie, jeśli OAI-SearchBot ma osobny dostęp i pozostała infrastruktura go nie blokuje.
Czy wystarczy dodać Allow dla OAI-SearchBot?
Nie zawsze. Serwer, CDN, WAF, logowanie lub skrypty mogą nadal uniemożliwiać pobranie treści.
Czy robots.txt ukrywa stronę przed internetem?
Nie. To mechanizm sterowania crawlerami, a nie zabezpieczenie dostępu. Treści prywatne powinny być chronione prawdziwą autoryzacją.