Direct naar inhoud
traze

Kennisbank · A

AI-crawler

Een AI-crawler is een bot waarmee een AI-bedrijf webpagina's ophaalt om modellen te trainen of om live antwoorden van bronnen te voorzien, zoals GPTBot van OpenAI, ClaudeBot van Anthropic en PerplexityBot.

Definitie

Een AI-crawler is een bot die webpagina's ophaalt ten behoeve van een AI-systeem: om trainingsdata te verzamelen, om een zoekindex voor een answer engine op te bouwen, of om live een pagina te lezen als een gebruiker daarom vraagt. Bekende voorbeelden zijn GPTBot, OAI-SearchBot en ChatGPT-User (OpenAI), ClaudeBot (Anthropic), PerplexityBot, Google-Extended (Google's opt-out voor AI-training), Applebot-Extended, Meta-ExternalAgent, Amazonbot, Bytespider (ByteDance) en CCBot (Common Crawl).

Het onderscheid tussen die drie doelen is belangrijk. Trainingscrawlers (GPTBot, ClaudeBot, CCBot) verzamelen tekst waarmee toekomstige modellen worden getraind; blokkeren heeft pas effect bij een volgende modelversie. Zoekindex-crawlers (OAI-SearchBot, PerplexityBot) vullen de index die answer engines gebruiken om bronnen te citeren; blokkeren betekent dat je niet meer als bron verschijnt. Gebruikers-agents (ChatGPT-User, Perplexity-User) halen een pagina op zodra een gebruiker er in een gesprek om vraagt en respecteren robots.txt niet altijd, omdat het verzoek van een mens komt.

AI-crawlers gedragen zich anders dan Googlebot. Ze voeren vrijwel nooit JavaScript uit, dus client-side gerenderde inhoud is voor hen leeg. Ze hanteren kortere time-outs en halen minder pagina's per bezoek op, waardoor een trage server of diepe navigatie tot gemiste pagina's leidt. En ze zijn talrijk: op veel sites vormen AI-crawlers inmiddels een groot deel van het botverkeer, wat serverbelasting en soms kosten oplevert.

Je stuurt AI-crawlers via robots.txt, per user-agent. Veel sites blokkeren trainingscrawlers uit principe of om hun content te beschermen, maar blokkeren per ongeluk ook de zoekcrawlers, waardoor ze uit AI-antwoorden verdwijnen. Wie zichtbaar wil zijn in ChatGPT-search en Perplexity moet minimaal OAI-SearchBot en PerplexityBot toelaten; wie niet wil bijdragen aan training, blokkeert GPTBot, ClaudeBot en Google-Extended apart. Sommige CDN's en firewalls (zoals Cloudflare) blokkeren AI-crawlers standaard, dus controleer die instelling.

Het effect meet je in serverlogs: welke AI-user-agents komen langs, hoe vaak, welke pagina's halen ze op en welke statuscodes krijgen ze. Traze controleert in de technische scan of AI-crawlers zijn toegelaten, of gepubliceerde pagina's daadwerkelijk door de zoekcrawlers zijn opgehaald en of de inhoud zonder JavaScript leesbaar is.

Alle begrippen

FAQ · AI-crawler

Veelgestelde vragen

Dat hangt af van je doel. Wil je in ChatGPT, Perplexity en andere answer engines als bron verschijnen, laat dan de zoekcrawlers (OAI-SearchBot, PerplexityBot) toe. Wil je niet bijdragen aan modeltraining, blokkeer dan alleen de trainingscrawlers (GPTBot, ClaudeBot, Google-Extended, CCBot). Blokkeer niet alles in één regel.

Van begrip naar resultaat

Zie waar je nu staat in Google en AI-antwoorden.

Start met de gratis AI-zichtbaarheid check, of plan een demo en zie hoe Traze dit begrip in de praktijk voor je site toepast.