Kennisbank / artikel
techniek · 3 min leestijd

Kan de robot van ChatGPT uw site lezen?

Vijftien robots, één leesregel die de meeste checkers verkeerd toepassen, en het slot dat wij bij onszelf vonden.

geschreven door Marius Kerkvliet, oprichterbijgewerkt op 9 september 2026

Alles begint bij toegang. Een antwoordmachine kan uw bedrijf alleen noemen als haar robot uw pagina's heeft kunnen ophalen. Dat is geen kwestie van beter of slechter: het is open of dicht. En het is het enige onderdeel van dit vak waarvan u vandaag met zekerheid kunt vaststellen hoe het staat.

Welke robots ertoe doen

Elke aanbieder heeft meerdere robots, en niet elke robot doet hetzelfde. OpenAI stuurt OAI-SearchBot om pagina's te vinden voor ChatGPT-antwoorden, en GPTBot om tekst te verzamelen voor het trainen van modellen. Wie GPTBot blokkeert en denkt daarmee uit ChatGPT te verdwijnen, heeft het mis; wie OAI-SearchBot blokkeert, verdwijnt echt. Hetzelfde onderscheid bestaat bij Anthropic (Claude-SearchBot tegenover ClaudeBot) en Google (Googlebot tegenover Google-Extended).1

Wij controleren vijftien robots. Vijf daarvan bepalen of u in antwoorden voorkomt: OAI-SearchBot, PerplexityBot, Claude-SearchBot, Googlebot en Bingbot. De andere tien raken training, Alexa, Meta AI of Common Crawl. Die mag u gerust buiten houden, als u dat bewust doet.

De leesregel die bijna iedereen verkeerd toepast

Het robotbestand van uw site, robots.txt, heeft een standaard: RFC 9309.2 Die zegt drie dingen. Alle regels voor dezelfde robot worden samengevoegd, ook als ze verspreid in het bestand staan. Bij tegenstrijdige regels wint de langste padregel. En bij gelijke lengte wint toestemming van verbod.

Dat is geen muggenzifterij. Een hostingpartij of een plug-in zet vaak een eigen blok bovenaan het bestand, vóór uw regels. Een checker die het bestand van boven naar beneden leest en bij de eerste treffer stopt, ziet dan precies het tegenovergestelde van wat de robot zelf ziet. Wij hebben tien van zulke gevallen als test vastgelegd, en onze controle leest het bestand zoals de standaard het voorschrijft.

Het slot dat u niet ziet

Een open robots.txt is niet genoeg. De server zelf kan een robot weigeren terwijl een bezoeker de pagina gewoon krijgt. Dan staat de deur op papier open en in de praktijk dicht. Wij vonden dat bij onszelf: een instelling van onze hostingpartij, Cloudflare's "AI Crawl Control", hield vier robots buiten zonder dat wij er iets voor hadden gedaan. Het staat gewoon in ons eigen rapport.

Daarom halen wij uw voorpagina niet één keer op maar zes keer: één keer als gewone browser en vijf keer met de namen die OpenAI, Perplexity, Anthropic en Google zelf documenteren. Krijgt de browser de pagina en een robot niet, dan is dat een slot.

Twee dingen die de tekst zelf onzichtbaar maken

  • Een noindex-regel. Eén regel in de verborgen kop van de pagina kan zoekmachines vragen hem niet op te nemen. Dan helpt niets anders.
  • Tekst die pas met een script komt. Sommige sites sturen een lege pagina en laten de tekst pas verschijnen nadat JavaScript heeft gedraaid. Een robot wacht daar niet op. Hij ziet een lege pagina en neemt niets over.

Zo controleert u het zelf

Typ uw adres op answerground.nl/audit. U ziet in één seconde welke van de vijftien robots mogen, of de server ze dezelfde pagina geeft, en of de tekst er zonder scripts staat. Staat een robot dicht die uw antwoorden bepaalt, dan krijgt u het blok van twee regels dat de deur opent, in een mail voor uw webbouwer. Het oude verbod hoeft niet weg: toestemming met naam wint.

bronnen
  • 1. Botdocumentatie van OpenAI (OAI-SearchBot, GPTBot, ChatGPT-User), Anthropic (Claude-SearchBot, ClaudeBot, Claude-User), Google (Googlebot, Google-Extended), Perplexity, Microsoft, Apple, Amazon, ByteDance, Meta en Common Crawl.
  • 2. RFC 9309, Robots Exclusion Protocol, IETF, september 2022: samenvoegen van groepen, langste pad wint, toestemming wint bij gelijke lengte.
  • 3. Eigen audit van answerground.nl, 9 september 2026: vier robots geweigerd door de serverinstelling van de hostingpartij, zichtbaar in het rapport.