Dostęp dla wyszukiwania i dostęp dla treningu to dwie decyzje
OpenAI opisuje OAI-SearchBot jako crawler związany z odkrywaniem i prezentowaniem publicznych treści w ChatGPT Search. GPTBot odpowiada za możliwość użycia treści do ulepszania modeli. Właściciel serwisu może zezwolić na pierwszy cel i zablokować drugi.
To dokładnie polityka Crafted SEO: publiczne materiały mogą być odkrywane w wyszukiwaniu i używane jako wejście do odpowiedzi, ale nie udzielamy zgody na trening. Prywatny portal pozostaje poza zakresem obu zastosowań.
robots.txt powinien nazywać konkretnego crawlera
Dla OAI-SearchBot dodajemy regułę Allow dla publicznej części serwisu. Dla GPTBot ustawiamy Disallow. Niezależnie blokujemy /clients/, /ops, /api/ i logowanie dla wszystkich botów.
Reguła crawlera nie zastępuje kontroli dostępu. Prywatne dane muszą być chronione uwierzytelnieniem i autoryzacją nawet wtedy, gdy robots.txt zawiera zakaz.
- OAI-SearchBot — publiczne wyszukiwanie i cytowanie
- GPTBot — potencjalny trening modeli
- Cloudflare Content Signals — dodatkowa deklaracja search, ai-input i ai-train
- Access oraz autoryzacja aplikacyjna — faktyczna ochrona danych klienta
Noindex i blokada crawl rozwiązują inne problemy
Jeżeli strona nie powinna pojawiać się w wynikach, używamy noindex. Crawler musi jednak móc odczytać ten znacznik. Całkowita blokada może uniemożliwić jego zobaczenie.
Dla chronionych zasobów odpowiedź nie powinna ujawniać treści bez logowania. Nagłówek noindex jest warstwą dodatkową, a nie mechanizmem bezpieczeństwa.
Dostępność sprawdzamy technicznie, widoczność — w danych
Test crawlera potwierdza status, robots i możliwość pobrania publicznej strony. Nie dowodzi, że ChatGPT ją zacytuje. OpenAI wyraźnie zaznacza, że nie ma gwarancji najwyższej pozycji.
Ruch z ChatGPT Search można rozpoznawać w analityce po parametrze utm_source=chatgpt.com. Cytowania w kontrolowanej próbce odpowiedzi mierzymy osobno, wraz z datą, modelem i liczbą ważnych odpowiedzi.
Polityka botów wymaga okresowego przeglądu
Nazwy crawlerów, dokumentacja i zachowanie platform mogą się zmieniać. Rejestrujemy źródło decyzji i datę przeglądu, a zmiany wdrażamy jak konfigurację bezpieczeństwa: z kontrolą wersji, testem i możliwością cofnięcia.
Nie traktujemy llms.txt jako wymogu Google. Google podaje, że ten plik nie pomaga ani nie szkodzi widoczności w jego wyszukiwarce. Jeśli go utrzymujemy, ma pełnić funkcję informacyjną dla innych systemów, a nie udawać czynnik rankingu.
Źródła i dalsza lektura
Źródła wspierają konkretne fakty i zasady opisane w materiale. Wnioski oraz sposób pracy Crafted SEO pozostają naszą interpretacją i są oznaczone kontekstem.