Vraag het acht keer en u krijgt acht antwoorden. Hoeveel vragen u nodig heeft om iets te kunnen zeggen, en waarom herhalen weinig helpt.
Iedereen heeft het een keer gedaan: uw bedrijfsnaam of uw vak in ChatGPT typen en kijken wat eruit komt. Staat u erin, dan is dat prettig. Staat u er niet in, dan schrikt u. Allebei zegt het bijna niets, en dit stuk legt uit waarom, en wat u dan wél kunt meten.
SparkToro stelde 2.961 keer dezelfde vraag aan antwoordmachines. In minder dan één op de honderd gevallen kwam dezelfde lijst met merken terug.1 Onderzoekers van de Universität St. Gallen deden het binnen 24 uur opnieuw met dezelfde prompt en vonden lijsten die elkaar maar voor 33 tot 48% overlapten.2 Eén antwoord is dus een steekproef van één uit een wolk van mogelijke antwoorden. Wie u op basis van één antwoord vertelt dat u "in ChatGPT staat" of "eruit bent gevallen", heeft een muntje opgegooid.
De voor de hand liggende oplossing is dezelfde vraag vaker stellen. Dat helpt minder dan u denkt. In onze eigen meting van een afhaalrestaurant, 62 vragen aan vier antwoordmachines, elk twee keer gesteld, waren de twee runs van dezelfde vraag het in 94 tot 100% van de gevallen met elkaar eens.3 De antwoordmachine is dus vrij consequent over één vraag; het verschil zit tussen de vragen. "Waar kan ik Thais afhalen in Barneveld" en "welk Thais restaurant in Barneveld is goed" geven andere namen.
Daarom tellen wij vragen als waarnemingen, niet aanroepen. Twee runs van dezelfde vraag zijn geen twee metingen. En daarom bestaat een goede meting uit veel verschillende vragen zoals klanten ze stellen, elk twee keer gesteld, en niet uit tien vragen elk acht keer.
Elk percentage krijgt bij ons een bandbreedte, het 95%-betrouwbaarheidsinterval.4 Bij 10 vragen is die bandbreedte ruim 50 procentpunt breed: een uitslag van "40%" betekent dan "ergens tussen 15 en 70". Bij 60 vragen wordt een sprong van 40% naar 60% net aantoonbaar. Bij 200 vragen ligt de bandbreedte rond de 12 procentpunt, en dat is wat wij per sector meten. Minder vragen levert een cijfer op dat niets uitsluit.
Een vermelding op 12 van 20 onderzochte vragen is 60% binnen die set van 20 vragen. Het betekent niet dat 60% van alle mensen die ChatGPT gebruiken uw bedrijf te zien krijgt. Welke vragen in de set zitten, welk model antwoordde, in welke taal en op welke dag: dat bepaalt wat het cijfer waard is. Bij ons staan die vier dingen bij elk getal, en de lijst met vragen is openbaar.
Ook telt niet elke vermelding even zwaar. Genoemd worden in een rijtje van acht is iets anders dan "een goede keuze is …", en een link naar uw pagina is weer iets anders dan uw naam in de lopende tekst. Wij tellen vermelding, bronverwijzing en aanbeveling apart en tellen ze niet op. Hoe dat precies gaat, staat op Wat we meten.
Een goede meting zegt niet "u staat op plek drie". Ze zegt: bij deze 200 vragen uit uw vak werd u in 16% van de antwoorden genoemd, met een bandbreedte van 9 tot 27%, en kantoor X in 31% met een bandbreedte van 22 tot 41%. Overlappen die bandbreedtes, dan is het verschil niet aangetoond, en dat staat er dan ook. Het is minder spannend dan een score van honderd, en het is het enige cijfer dat u kunt narekenen.
Het deel dat u vandaag zelf kunt vaststellen, is of de robots überhaupt bij uw site kunnen: answerground.nl/audit, gratis, in één seconde.