Definitie
Een AI-crawler is een bot die webpagina's ophaalt ten behoeve van een AI-systeem: om trainingsdata te verzamelen, om een zoekindex voor een answer engine op te bouwen, of om live een pagina te lezen als een gebruiker daarom vraagt. Bekende voorbeelden zijn GPTBot, OAI-SearchBot en ChatGPT-User (OpenAI), ClaudeBot (Anthropic), PerplexityBot, Google-Extended (Google's opt-out voor AI-training), Applebot-Extended, Meta-ExternalAgent, Amazonbot, Bytespider (ByteDance) en CCBot (Common Crawl).
Het onderscheid tussen die drie doelen is belangrijk. Trainingscrawlers (GPTBot, ClaudeBot, CCBot) verzamelen tekst waarmee toekomstige modellen worden getraind; blokkeren heeft pas effect bij een volgende modelversie. Zoekindex-crawlers (OAI-SearchBot, PerplexityBot) vullen de index die answer engines gebruiken om bronnen te citeren; blokkeren betekent dat je niet meer als bron verschijnt. Gebruikers-agents (ChatGPT-User, Perplexity-User) halen een pagina op zodra een gebruiker er in een gesprek om vraagt en respecteren robots.txt niet altijd, omdat het verzoek van een mens komt.
AI-crawlers gedragen zich anders dan Googlebot. Ze voeren vrijwel nooit JavaScript uit, dus client-side gerenderde inhoud is voor hen leeg. Ze hanteren kortere time-outs en halen minder pagina's per bezoek op, waardoor een trage server of diepe navigatie tot gemiste pagina's leidt. En ze zijn talrijk: op veel sites vormen AI-crawlers inmiddels een groot deel van het botverkeer, wat serverbelasting en soms kosten oplevert.
Je stuurt AI-crawlers via robots.txt, per user-agent. Veel sites blokkeren trainingscrawlers uit principe of om hun content te beschermen, maar blokkeren per ongeluk ook de zoekcrawlers, waardoor ze uit AI-antwoorden verdwijnen. Wie zichtbaar wil zijn in ChatGPT-search en Perplexity moet minimaal OAI-SearchBot en PerplexityBot toelaten; wie niet wil bijdragen aan training, blokkeert GPTBot, ClaudeBot en Google-Extended apart. Sommige CDN's en firewalls (zoals Cloudflare) blokkeren AI-crawlers standaard, dus controleer die instelling.
Het effect meet je in serverlogs: welke AI-user-agents komen langs, hoe vaak, welke pagina's halen ze op en welke statuscodes krijgen ze. Traze controleert in de technische scan of AI-crawlers zijn toegelaten, of gepubliceerde pagina's daadwerkelijk door de zoekcrawlers zijn opgehaald en of de inhoud zonder JavaScript leesbaar is.