Dostęp dla wyszukiwania i dostęp dla treningu to dwie decyzje

OpenAI opisuje OAI-SearchBot jako crawler związany z odkrywaniem i prezentowaniem publicznych treści w ChatGPT Search. GPTBot odpowiada za możliwość użycia treści do ulepszania modeli. Właściciel serwisu może zezwolić na pierwszy cel i zablokować drugi.

To dokładnie polityka Crafted SEO: publiczne materiały mogą być odkrywane w wyszukiwaniu i używane jako wejście do odpowiedzi, ale nie udzielamy zgody na trening. Prywatny portal pozostaje poza zakresem obu zastosowań.

robots.txt powinien nazywać konkretnego crawlera

Dla OAI-SearchBot dodajemy regułę Allow dla publicznej części serwisu. Dla GPTBot ustawiamy Disallow. Niezależnie blokujemy /clients/, /ops, /api/ i logowanie dla wszystkich botów.

Reguła crawlera nie zastępuje kontroli dostępu. Prywatne dane muszą być chronione uwierzytelnieniem i autoryzacją nawet wtedy, gdy robots.txt zawiera zakaz.

  • OAI-SearchBot — publiczne wyszukiwanie i cytowanie
  • GPTBot — potencjalny trening modeli
  • Cloudflare Content Signals — dodatkowa deklaracja search, ai-input i ai-train
  • Access oraz autoryzacja aplikacyjna — faktyczna ochrona danych klienta

Noindex i blokada crawl rozwiązują inne problemy

Jeżeli strona nie powinna pojawiać się w wynikach, używamy noindex. Crawler musi jednak móc odczytać ten znacznik. Całkowita blokada może uniemożliwić jego zobaczenie.

Dla chronionych zasobów odpowiedź nie powinna ujawniać treści bez logowania. Nagłówek noindex jest warstwą dodatkową, a nie mechanizmem bezpieczeństwa.

Dostępność sprawdzamy technicznie, widoczność — w danych

Test crawlera potwierdza status, robots i możliwość pobrania publicznej strony. Nie dowodzi, że ChatGPT ją zacytuje. OpenAI wyraźnie zaznacza, że nie ma gwarancji najwyższej pozycji.

Ruch z ChatGPT Search można rozpoznawać w analityce po parametrze utm_source=chatgpt.com. Cytowania w kontrolowanej próbce odpowiedzi mierzymy osobno, wraz z datą, modelem i liczbą ważnych odpowiedzi.

Polityka botów wymaga okresowego przeglądu

Nazwy crawlerów, dokumentacja i zachowanie platform mogą się zmieniać. Rejestrujemy źródło decyzji i datę przeglądu, a zmiany wdrażamy jak konfigurację bezpieczeństwa: z kontrolą wersji, testem i możliwością cofnięcia.

Nie traktujemy llms.txt jako wymogu Google. Google podaje, że ten plik nie pomaga ani nie szkodzi widoczności w jego wyszukiwarce. Jeśli go utrzymujemy, ma pełnić funkcję informacyjną dla innych systemów, a nie udawać czynnik rankingu.

Źródła i dalsza lektura

Źródła wspierają konkretne fakty i zasady opisane w materiale. Wnioski oraz sposób pracy Crafted SEO pozostają naszą interpretacją i są oznaczone kontekstem.

Czytaj dalej w tym obszarze

Widoczność w AI bez magicznego wyniku 0–100