Kennisbank / artikel
meten · 3 min leestijd

Waarom één antwoord van ChatGPT geen meting is.

Vraag het acht keer en u krijgt acht antwoorden. Hoeveel vragen u nodig heeft om iets te kunnen zeggen, en waarom herhalen weinig helpt.

geschreven door Marius Kerkvliet, oprichterbijgewerkt op 9 september 2026

Iedereen heeft het een keer gedaan: uw bedrijfsnaam of uw vak in ChatGPT typen en kijken wat eruit komt. Staat u erin, dan is dat prettig. Staat u er niet in, dan schrikt u. Allebei zegt het bijna niets, en dit stuk legt uit waarom, en wat u dan wél kunt meten.

Hetzelfde antwoord komt bijna nooit terug

SparkToro stelde 2.961 keer dezelfde vraag aan antwoordmachines. In minder dan één op de honderd gevallen kwam dezelfde lijst met merken terug.1 Onderzoekers van de Universität St. Gallen deden het binnen 24 uur opnieuw met dezelfde prompt en vonden lijsten die elkaar maar voor 33 tot 48% overlapten.2 Eén antwoord is dus een steekproef van één uit een wolk van mogelijke antwoorden. Wie u op basis van één antwoord vertelt dat u "in ChatGPT staat" of "eruit bent gevallen", heeft een muntje opgegooid.

Waarom herhalen weinig helpt, en meer vragen veel

De voor de hand liggende oplossing is dezelfde vraag vaker stellen. Dat helpt minder dan u denkt. In onze eigen meting van een afhaalrestaurant, 62 vragen aan vier antwoordmachines, elk twee keer gesteld, waren de twee runs van dezelfde vraag het in 94 tot 100% van de gevallen met elkaar eens.3 De antwoordmachine is dus vrij consequent over één vraag; het verschil zit tussen de vragen. "Waar kan ik Thais afhalen in Barneveld" en "welk Thais restaurant in Barneveld is goed" geven andere namen.

Daarom tellen wij vragen als waarnemingen, niet aanroepen. Twee runs van dezelfde vraag zijn geen twee metingen. En daarom bestaat een goede meting uit veel verschillende vragen zoals klanten ze stellen, elk twee keer gesteld, en niet uit tien vragen elk acht keer.

Hoeveel vragen u nodig heeft

Elk percentage krijgt bij ons een bandbreedte, het 95%-betrouwbaarheidsinterval.4 Bij 10 vragen is die bandbreedte ruim 50 procentpunt breed: een uitslag van "40%" betekent dan "ergens tussen 15 en 70". Bij 60 vragen wordt een sprong van 40% naar 60% net aantoonbaar. Bij 200 vragen ligt de bandbreedte rond de 12 procentpunt, en dat is wat wij per sector meten. Minder vragen levert een cijfer op dat niets uitsluit.

Zestig procent van wat?

Een vermelding op 12 van 20 onderzochte vragen is 60% binnen die set van 20 vragen. Het betekent niet dat 60% van alle mensen die ChatGPT gebruiken uw bedrijf te zien krijgt. Welke vragen in de set zitten, welk model antwoordde, in welke taal en op welke dag: dat bepaalt wat het cijfer waard is. Bij ons staan die vier dingen bij elk getal, en de lijst met vragen is openbaar.

Ook telt niet elke vermelding even zwaar. Genoemd worden in een rijtje van acht is iets anders dan "een goede keuze is …", en een link naar uw pagina is weer iets anders dan uw naam in de lopende tekst. Wij tellen vermelding, bronverwijzing en aanbeveling apart en tellen ze niet op. Hoe dat precies gaat, staat op Wat we meten.

Wat u er dan wel mee kunt

Een goede meting zegt niet "u staat op plek drie". Ze zegt: bij deze 200 vragen uit uw vak werd u in 16% van de antwoorden genoemd, met een bandbreedte van 9 tot 27%, en kantoor X in 31% met een bandbreedte van 22 tot 41%. Overlappen die bandbreedtes, dan is het verschil niet aangetoond, en dat staat er dan ook. Het is minder spannend dan een score van honderd, en het is het enige cijfer dat u kunt narekenen.

Het deel dat u vandaag zelf kunt vaststellen, is of de robots überhaupt bij uw site kunnen: answerground.nl/audit, gratis, in één seconde.

bronnen
  • 1. SparkToro, 2026, AIs are highly inconsistent when recommending brands or products: 2.961 identieke prompts, minder dan 1% identieke merkenlijsten.
  • 2. Universität St. Gallen, 2026, arXiv 2604.07585: overlap van 33 tot 48% tussen merkenlijsten bij dezelfde prompt binnen 24 uur.
  • 3. Eigen meting, 8 september 2026: 62 vragen, 4 engines, 2 runs, 496 aanroepen; overeenstemming tussen runs 94 tot 100% per engine. Ruwe antwoorden bewaard.
  • 4. Wilson-scoreinterval voor een binomiale proportie; noemer is het aantal vragen, niet het aantal aanroepen.