gratis tool · geen inlog · geen score

Welke AI-crawlers mag uw site?

Vijftien crawlers, gelezen uit uw robots.txt zoals de standaard het voorschrijft: groepen samengevoegd, langste pad wint, toestemming wint van verbod. Met per crawler wat hij doet en waarom hij wel of niet binnenmag.

01 - waarom de meeste checkers hier de mist in gaan

Een robots.txt lees je niet van boven naar beneden

RFC 9309 zegt dat alle groepen voor dezelfde crawler worden samengevoegd, dat de langste padregel wint, en dat bij gelijke lengte toestemming wint van verbod. Een CDN of plug-in die zijn eigen blok bovenaan zet, wordt door een parser die de eerste treffer pakt precies verkeerd gelezen.

Zoeken of trainen

OAI-SearchBot bepaalt of u in ChatGPT-antwoorden staat; GPTBot alleen of uw tekst in training komt. Wie GPTBot blokkeert en denkt daarmee uit ChatGPT te blijven, heeft de verkeerde geblokkeerd.

Google-Extended

Raakt Gemini-training en -grounding, niet Google Search en niet AI Overviews. Google zegt dat zelf.

De reparatie

Staat een crawler dicht die uw zoekresultaten bepaalt, dan krijgt u een blok dat u onderaan plakt. Door de samenvoegregel hoeft u het oude verbod niet eens te vinden.

02 - meer gereedschap

Dit is één van zes controles

De volledige audit doet ze allemaal in één keer. Los: krijgt een crawler dezelfde pagina als u, llms.txt, citeerbaarheid, structured data en JavaScript-afhankelijkheid.