Definitie
GPTBot is de webcrawler van OpenAI die publiek toegankelijke webpagina's ophaalt om trainingsdata te verzamelen voor toekomstige modellen zoals die achter ChatGPT. De bot meldt zich met de user-agent 'GPTBot' en is sinds augustus 2023 actief. OpenAI publiceert de IP-reeksen waarvandaan GPTBot crawlt, zodat je echte bezoeken kunt onderscheiden van bots die zich als GPTBot voordoen.
GPTBot is niet de enige bot van OpenAI, en dat onderscheid is cruciaal voor je zichtbaarheid. OAI-SearchBot bouwt de zoekindex die ChatGPT gebruikt om bronnen op te halen en te citeren als het web raadpleegt. ChatGPT-User haalt een specifieke pagina op wanneer een gebruiker in een gesprek een link deelt of om actuele informatie vraagt. GPTBot zelf dient alleen voor training. Wie GPTBot blokkeert, blijft dus gewoon citeerbaar in ChatGPT-search, zolang OAI-SearchBot wordt toegelaten.
Je stuurt GPTBot via robots.txt. 'User-agent: GPTBot' gevolgd door 'Disallow: /' blokkeert de hele site; met 'Disallow: /prive/' en 'Allow: /blog/' sluit je delen uit. OpenAI stelt dat GPTBot robots.txt respecteert en pagina's overslaat die een paywall hebben, persoonsgegevens verzamelen of tegen zijn beleid ingaan. Wijzigingen in robots.txt worden bij het volgende crawlbezoek opgepikt; al verzamelde data wordt niet met terugwerkende kracht verwijderd.
Of je GPTBot moet toelaten is een strategische keuze. Voorstanders van blokkeren wijzen op auteursrecht en het ontbreken van vergoeding voor trainingsdata; veel uitgevers en mediabedrijven blokkeren daarom. Voorstanders van toelaten stellen dat modellen die je merk, producten en expertise uit training kennen, je vaker en correcter noemen bij vragen zonder webtoegang, en dat de invloed van training op merkkennis pas bij een volgende modelversie zichtbaar wordt. Voor de meeste bedrijven die gevonden willen worden, weegt zichtbaarheid zwaarder dan bescherming.
Controleer in elk geval wat er nu gebeurt: veel CDN's en beveiligingsplugins blokkeren GPTBot en soms ook OAI-SearchBot standaard, zonder dat de site-eigenaar dat weet. Traze controleert in de technische scan de robots.txt en de daadwerkelijke reactie van je server op OpenAI's crawlers en meldt het als de zoekcrawler onbedoeld wordt geweerd.