Er is een nieuwe categorie marketingtools op de markt die belooft te meten hoe zichtbaar jouw merk is in de antwoorden van ChatGPT, Perplexity en Google AI Overviews. Ze presenteren dashboards, zichtbaarheidsscores en zogeheten "share of voice" in AI-zoekmachines. De markt groeit snel: er wordt al meer dan 100 miljoen dollar per jaar aan dit soort tracking uitgegeven. De redenering achter die investeringen klinkt intuïtief. Traditionele zoekmachines hebben rankings, dus AI-zoekmachines moeten toch ook iets meetbaars hebben? Dat is waar het misgaat.
De werkwijze is bij vrijwel alle aanbieders gelijk. Een tool bouwt een bibliotheek van synthetische prompts, stuurt die geautomatiseerd naar AI-systemen als ChatGPT of Perplexity, vangt de antwoorden op en berekent op basis daarvan een zichtbaarheidsscore. Sommige tools gaan verder en spreken ronduit van een "ranking", alsof er een vaste positie te claimen valt in de output van een taalmodel. Dat klinkt vertrouwd. Het probleem is dat het een verkeerd model op een fundamenteel andere technologie plakt.
Begin 2026 publiceerde Rand Fishkin van SparkToro onafhankelijk onderzoek dat de problemen hard onderbouwt. 600 vrijwilligers lieten dezelfde prompts 2.961 keer door ChatGPT, Claude en Google AI lopen. De uitkomst is veelzeggend: de kans dat een AI twee keer dezelfde lijst merken teruggeeft, is kleiner dan 1 op 100. De kans dat die lijst ook nog eens in dezelfde volgorde staat? Kleiner dan 1 op 1.000.
Dat is geen fout, maar precies hoe ze werken: er zit bewust wat toeval in, zodat de antwoorden gevarieerder en natuurlijker aanvoelen. Daardoor kan er ook geen vaste "ranking" bestaan. Een vaste positie vraagt om steeds hetzelfde antwoord, en dat geeft een AI nou eenmaal niet.
Daar komt nog een tweede probleem bij: de prompts zelf. Uit hetzelfde onderzoek bleek dat 142 mensen die allemaal naar hetzelfde zochten, 142 vrijwel unieke prompts schreven. AI-zoekopdrachten zijn geen zoekwoorden. Mensen stellen volledige vragen met context, nuance en persoonlijke situaties. Een tool die werkt met een synthetische promptbibliotheek meet daarmee per definitie niet wat echte gebruikers doen. Die kloof is structureel en lost zich niet op met een betere tool of een groter budget.
Er is één meetbenadering die enige houdbaarheid heeft: het bijhouden van een zichtbaarheidspercentage over een groot aantal runs. Hoe vaak verschijnt jouw merk in antwoorden op een specifieke vraagstelling, gemeten over tientallen tot honderden iteraties? Dat geeft een indicatie, mits de tool transparant is over de steekproefgrootte en de methodologie voor promptselectie. Die transparantie ontbreekt bij de meeste commerciële aanbieders.
Een uitzondering is Bing Webmaster Tools. Microsoft koos voor een andere aanpak met AI Performance: platformeigen citatiemeting, zonder rankings, zonder opgeblazen claims. Je ziet hoeveel keer je domein geciteerd wordt in Copilot-antwoorden. Beperkt in dekking, maar eerlijk in wat het toont. Dat is precies de nuchtere benadering die deze markt nodig heeft.
Het advies is niet om niets te doen. Het is om slim te wachten en ondertussen een bruikbare baseline op te bouwen met data die je kunt vertrouwen.
Zet GA4 custom channel groups in voor LLM-verkeer: Door verkeer vanuit AI-tools apart te segmenteren in GA4, bouw je een echte gedragsbaseline op. Hoeveel bezoekers komen al via ChatGPT of Perplexity binnen? Wat doen ze op je site? Dat is meetbare realiteit, geen schatting.
Test prompts handmatig en periodiek: Kies een handvol vragen die jouw doelgroep écht stelt en leg ze wekelijks voor aan ChatGPT en Perplexity. Noteer of jouw merk verschijnt en in welke context. Het is eenvoudig, gratis en eerlijker dan welke betaalde tool ook, omdat jij de prompts kiest die aansluiten bij echte gebruikersvragen.
Gebruik Bing Webmaster Tools als anker: Beperkt in scope, maar het is platformeigen data zonder marketingopblazing. Een goede startpositie terwijl de rest van de markt zich verder ontwikkelt.
Vraag door als een tool "posities in ChatGPT" belooft: Welke steekproefgrootte hanteren ze per prompt? Hoe selecteren ze hun prompts? Wat is de statistische onderbouwing van de scores? Als een aanbieder daar geen helder antwoord op geeft, weet je genoeg.
Wacht op platformeigen data van Google: Google zal vroeg of laat een equivalent van Bing's AI Performance lanceren voor Google AI Overviews en AI Mode. Dat is het moment waarop AI-zichtbaarheid een discipline wordt met betrouwbare data. Tot die tijd ben je als marketeer structureel aan het gissen, ongeacht welke tool je gebruikt.
De kans op twee identieke AI-lijsten in dezelfde volgorde is kleiner dan 1 op 1.000. Wat je vandaag meet, is morgen alweer anders. Wie nu substantieel investeert in tools die "posities in AI" beloven, betaalt voor zelfverzekerd verpakte onzekerheid.
Dat betekent niet dat AI-zichtbaarheid irrelevant is, integendeel. En het betekent ook niet dat je dit soort tools helemaal links moet laten liggen. Ze kunnen prima een indicatie geven van trends en van hoe je merk ongeveer terugkomt in AI-antwoorden. Zolang je maar beseft wat je in handen hebt: schattingen op basis van beperkte data, geen harde waarheid. Gebruik ze als richtingaanwijzer, niet als kompas en koppel er geen strategische budgetten of keiharde KPI's aan.
Wil je wél op betrouwbare data sturen, dan zijn GA4 en Bing Webmaster Tools op dit moment je sterkste fundament. Die laten echt gedrag en platformeigen citaties zien, geen schattingen. Bouw daar nu een baseline op, dan sta je straks in een veel sterkere positie wanneer de bredere markt volwassen wordt en betrouwbare platformdata breed beschikbaar komt.
Envoker
Albert Plesmanweg 1H
4462 GC
Goes
+31 113405700
[email protected]