Vijftien robots, één leesregel die de meeste checkers verkeerd toepassen, en het slot dat wij bij onszelf vonden.
Alles begint bij toegang. Een antwoordmachine kan uw bedrijf alleen noemen als haar robot uw pagina's heeft kunnen ophalen. Dat is geen kwestie van beter of slechter: het is open of dicht. En het is het enige onderdeel van dit vak waarvan u vandaag met zekerheid kunt vaststellen hoe het staat.
Elke aanbieder heeft meerdere robots, en niet elke robot doet hetzelfde. OpenAI stuurt OAI-SearchBot om pagina's te vinden voor ChatGPT-antwoorden, en GPTBot om tekst te verzamelen voor het trainen van modellen. Wie GPTBot blokkeert en denkt daarmee uit ChatGPT te verdwijnen, heeft het mis; wie OAI-SearchBot blokkeert, verdwijnt echt. Hetzelfde onderscheid bestaat bij Anthropic (Claude-SearchBot tegenover ClaudeBot) en Google (Googlebot tegenover Google-Extended).1
Wij controleren vijftien robots. Vijf daarvan bepalen of u in antwoorden voorkomt: OAI-SearchBot, PerplexityBot, Claude-SearchBot, Googlebot en Bingbot. De andere tien raken training, Alexa, Meta AI of Common Crawl. Die mag u gerust buiten houden, als u dat bewust doet.
Het robotbestand van uw site, robots.txt, heeft een standaard: RFC 9309.2 Die zegt drie dingen. Alle regels voor dezelfde robot worden samengevoegd, ook als ze verspreid in het bestand staan. Bij tegenstrijdige regels wint de langste padregel. En bij gelijke lengte wint toestemming van verbod.
Dat is geen muggenzifterij. Een hostingpartij of een plug-in zet vaak een eigen blok bovenaan het bestand, vóór uw regels. Een checker die het bestand van boven naar beneden leest en bij de eerste treffer stopt, ziet dan precies het tegenovergestelde van wat de robot zelf ziet. Wij hebben tien van zulke gevallen als test vastgelegd, en onze controle leest het bestand zoals de standaard het voorschrijft.
Een open robots.txt is niet genoeg. De server zelf kan een robot weigeren terwijl een bezoeker de pagina gewoon krijgt. Dan staat de deur op papier open en in de praktijk dicht. Wij vonden dat bij onszelf: een instelling van onze hostingpartij, Cloudflare's "AI Crawl Control", hield vier robots buiten zonder dat wij er iets voor hadden gedaan. Het staat gewoon in ons eigen rapport.
Daarom halen wij uw voorpagina niet één keer op maar zes keer: één keer als gewone browser en vijf keer met de namen die OpenAI, Perplexity, Anthropic en Google zelf documenteren. Krijgt de browser de pagina en een robot niet, dan is dat een slot.
Typ uw adres op answerground.nl/audit. U ziet in één seconde welke van de vijftien robots mogen, of de server ze dezelfde pagina geeft, en of de tekst er zonder scripts staat. Staat een robot dicht die uw antwoorden bepaalt, dan krijgt u het blok van twee regels dat de deur opent, in een mail voor uw webbouwer. Het oude verbod hoeft niet weg: toestemming met naam wint.