Wat zijn de tokens die AI-modellen gebruiken? De onzichtbare bouwstenen achter elk gesprek

Het gebeurt bijna ongemerkt. Iemand stelt een vraag aan een chatbot, laat een tekst samenvatten of vraagt hulp bij het schrijven van een e-mail. Enkele seconden later verschijnt een antwoord dat verrassend natuurlijk leest, alsof er aan de andere kant iemand heeft zitten nadenken. Voor de gebruiker lijkt het één vloeiend gesprek, opgebouwd uit zinnen, alinea's en ideeën. Achter de schermen ziet een taalmodel echter helemaal geen woorden, zinnen of betekenissen zoals wij die ervaren. Het ziet vooral een lange reeks kleine bouwstenen: tokens.

Dat ene technische begrip duikt steeds vaker op. AI-bedrijven vermelden hoeveel tokens een model aankan. Softwareontwikkelaars betalen vaak per miljoen tokens. Gebruikers lezen dat een chatbot een contextvenster van honderdduizenden of zelfs een miljoen tokens heeft. Toch weten maar weinig mensen wat zo'n token eigenlijk is. Is het een woord? Een letter? Een zin? En waarom is juist dat begrip zo belangrijk geworden voor de manier waarop kunstmatige intelligentie werkt?

Wie begrijpt wat tokens zijn, krijgt plots een heel andere kijk op AI. Niet alleen op de technologie zelf, maar ook op de beperkingen, de kosten en zelfs de manier waarop een chatbot soms fouten maakt. Achter elk ogenschijnlijk eenvoudig gesprek schuilt namelijk een ingewikkeld proces waarin taal wordt opgebroken, geanalyseerd en opnieuw opgebouwd.


Taal zoals een computer die ziet

Voor mensen is taal een vanzelfsprekend geheel. We herkennen woorden, begrijpen context en vullen ontbrekende informatie intuïtief aan. Een computer beschikt niet over dat natuurlijke taalgevoel. Hij moet tekst eerst omzetten in iets waarmee hij wiskundige berekeningen kan uitvoeren.

Dat begint al bij de eenvoudigste vraag.

Wanneer iemand schrijft: 'Hoe werkt een warmtepomp?', ziet een AI-model die zin niet als zes herkenbare woorden. Eerst wordt de volledige tekst opgesplitst in tokens. Afhankelijk van het gebruikte taalmodel kunnen dat volledige woorden zijn, delen van woorden, leestekens of zelfs afzonderlijke tekens.

Het woord 'warmtepomp' kan bijvoorbeeld als één token worden opgeslagen wanneer het vaak voorkomt in de trainingsgegevens. Een zeldzamer woord kan daarentegen worden opgesplitst in meerdere delen. Ook spaties, komma's en punten spelen een rol in de manier waarop tekst wordt opgedeeld.

Dat lijkt omslachtig, maar er schuilt een belangrijke reden achter. De wereld telt miljoenen woorden. Daar komen voortdurend nieuwe woorden, merknamen, afkortingen en samenstellingen bij. Als een AI-model elk mogelijk woord afzonderlijk zou moeten kennen, zou het woordenboek vrijwel onbeheersbaar worden.

Door woorden op te splitsen in kleinere herkenbare onderdelen kan een model ook onbekende woorden begrijpen. Zelfs een nieuw samengesteld woord bestaat meestal uit bekende stukjes.


Waarom woorden niet voldoende zijn

Dat lijkt misschien vreemd. Waarom gebruikt een AI-model niet gewoon woorden als basiseenheid?

Het antwoord ligt in de enorme rijkdom van menselijke taal.

Neem het Nederlands. Eén werkwoord kan tientallen vervoegingen hebben. Zelfstandige naamwoorden verschijnen in enkelvoud, meervoud en samenstellingen. Nieuwe woorden ontstaan voortdurend doordat mensen bestaande woorden combineren.

Woorden als 'elektriciteitsnetbeheerder', 'klimaatadaptatiemaatregelen' of 'waterstofproductieketen' komen misschien nauwelijks voor in de trainingsdata. Toch begrijpt een modern taalmodel ze vaak verrassend goed, juist omdat het ze kan opsplitsen in herkenbare delen.

Dat principe lijkt op hoe mensen onbekende woorden ontleden. Wie voor het eerst 'zonnepaneleninstallateur' leest, begrijpt meestal meteen waar het over gaat. Niet omdat het volledige woord ooit is geleerd, maar omdat de afzonderlijke onderdelen bekend zijn.

AI-modellen doen iets vergelijkbaars, al gebeurt dat volledig via statistiek en waarschijnlijkheidsberekeningen.


Van letters naar betekenis

Voordat een model überhaupt kan voorspellen welk woord volgt, moet iedere token worden omgezet in een reeks cijfers. Computers rekenen immers niet met taal, maar met getallen.

Elke token krijgt daarom een unieke numerieke code. Vervolgens wordt die code omgezet in een complexe verzameling getallen die de relatie met andere tokens beschrijft. Dat proces staat bekend als een embedding.

Hier begint het interessante deel.

Woorden die vaak in vergelijkbare context voorkomen, krijgen uiteindelijk een vergelijkbare positie in een enorme wiskundige ruimte. Daardoor liggen woorden als 'arts', 'ziekenhuis' en 'verpleegkundige' relatief dicht bij elkaar, terwijl woorden als 'satelliet' of 'vulkaan' zich in een heel ander gebied bevinden.

Een AI-model begrijpt betekenis dus niet zoals mensen dat doen. Het kent geen ervaringen, herinneringen of gevoelens. Het ontdekt patronen doordat miljarden tokens voortdurend samen voorkomen.

Dat maakt moderne taalmodellen tegelijkertijd indrukwekkend en kwetsbaar. Ze herkennen statistische verbanden op een schaal die voor mensen onmogelijk is, maar beschikken niet over gezond verstand in menselijke betekenis.


Waarom één woord meerdere tokens kan zijn

Veel gebruikers denken dat één token gelijkstaat aan één woord. In werkelijkheid is dat lang niet altijd zo.

Korte, veelgebruikte woorden vormen vaak één token. Langere of zeldzamere woorden worden meestal opgesplitst.

Ook de taal speelt een belangrijke rol.

Het Engels bestaat relatief vaak uit korte woorden. Daardoor ligt de verhouding tussen woorden en tokens anders dan in het Nederlands of Duits, waar samengestelde woorden veel langer kunnen worden.

Een Nederlandse zin bevat gemiddeld iets meer tokens dan een vergelijkbare Engelse zin met dezelfde inhoud. Dat verklaart waarom Nederlandstalige teksten soms sneller tegen de maximale contextlimiet van een AI-model aanlopen.

Een ruwe vuistregel luidt dat één token gemiddeld overeenkomt met ongeveer driekwart van een Engels woord. Voor het Nederlands varieert die verhouding sterker doordat samengestelde woorden veel vaker voorkomen.

Daarom kan een tekst van duizend woorden aanzienlijk meer dan duizend tokens bevatten.


Waarom tokens de geheugencapaciteit bepalen

Iedereen die regelmatig met AI werkt, heeft het waarschijnlijk al eens meegemaakt. Na een lang gesprek lijkt de chatbot eerdere informatie te vergeten. Niet omdat het systeem werkelijk vergeetachtig is, maar omdat het maximale aantal tokens is bereikt.

Een taalmodel werkt met een zogenoemd contextvenster. Dat is de totale hoeveelheid tekst die het model tegelijkertijd kan verwerken.

Daarin zitten niet alleen de woorden van de gebruiker.

Ook eerdere vragen, eerdere antwoorden, systeeminstructies en soms zelfs verborgen technische instructies nemen allemaal tokens in beslag.

Wanneer dat venster vol raakt, verdwijnen de oudste tokens geleidelijk uit het actieve geheugen. Voor het model bestaan ze dan eenvoudigweg niet meer.

De grootte van dat contextvenster is de afgelopen jaren spectaculair gegroeid. Waar vroege taalmodellen enkele duizenden tokens konden verwerken, beschikken moderne systemen over contextvensters van honderdduizenden tokens of meer. Daardoor kunnen complete boeken, uitgebreide contracten of omvangrijke programmeerprojecten in één gesprek worden geanalyseerd.

Toch blijft ook die capaciteit eindig.


Waarom bedrijven in tokens rekenen

Wie een AI-dienst gebruikt via een programmeerinterface, merkt al snel dat de kosten meestal niet per vraag worden berekend.

De prijs wordt vrijwel altijd uitgedrukt in tokens.

Dat is logisch.

De hoeveelheid rekenwerk hangt niet af van het aantal vragen, maar van de totale hoeveelheid tekst die verwerkt moet worden.

Een korte vraag van tien woorden kost nauwelijks rekenkracht. Een juridische analyse van driehonderd pagina's vraagt daarentegen miljoenen berekeningen.

Ook het antwoord telt mee.

Een gebruiker die vraagt om een samenvatting van honderd woorden gebruikt minder tokens dan iemand die om een uitgebreid rapport van drieduizend woorden vraagt.

Tokens vormen daarom een veel eerlijkere maat voor de werkelijke belasting van de computers achter een AI-model.


Hoe voorspelt een taalmodel het volgende token?

Hier schuilt misschien wel de grootste verrassing.

Een taalmodel schrijft geen volledige zinnen tegelijk.

Het voorspelt telkens slechts één volgend token.

Wanneer een gebruiker schrijft: 'De zon gaat iedere ochtend...', berekent het model welke token statistisch gezien de grootste kans heeft om daarna te verschijnen.

Dat zou 'op' kunnen zijn.

Na dat nieuwe token volgt opnieuw dezelfde berekening.

Daarna misschien 'in'.

Vervolgens 'het'.

Daarna 'oosten'.

Op die manier ontstaat stap voor stap een volledige zin.

Dat proces verloopt razendsnel. Moderne grafische processors voeren miljarden berekeningen per seconde uit, waardoor een antwoord vrijwel direct lijkt te ontstaan.

In werkelijkheid bestaat iedere zin uit honderden of duizenden afzonderlijke voorspellingen.


Waarom AI soms verrassend overtuigend klinkt

Juist doordat een model steeds de meest waarschijnlijke volgende tokens voorspelt, ontstaat vaak een opvallend vloeiende tekst.

Dat verklaart ook waarom AI soms overtuigend fout kan zitten.

Wanneer onvoldoende betrouwbare informatie beschikbaar is, blijft het model toch het statistisch meest waarschijnlijke vervolg genereren. Het vult als het ware de lege plekken op met patronen die eerder vaak voorkwamen.

Voor een mens klinkt dat soms geloofwaardig, terwijl de inhoud feitelijk onjuist is.

Onderzoekers besteden daarom veel aandacht aan technieken die modellen beter laten omgaan met onzekerheid. Ook het combineren van taalmodellen met actuele databanken of zoekmachines helpt om feitelijke fouten te verminderen.


Tokens bepalen ook de snelheid

Niet alleen de kosten hangen af van tokens.

Ook de snelheid waarmee een model antwoord geeft, wordt er sterk door beïnvloed.

Een korte vraag van enkele tientallen tokens kan vrijwel onmiddellijk worden verwerkt.

Een volledig wetenschappelijk rapport van honderd pagina's vraagt veel meer tijd. Niet alleen omdat er meer gelezen moet worden, maar ook omdat elk token voortdurend verbanden legt met alle andere relevante tokens in het contextvenster.

Dat maakt moderne AI bijzonder krachtig, maar ook bijzonder rekenintensief.

Achter één eenvoudig gesprek draait vaak een wereldwijd netwerk van gespecialiseerde computers die enorme hoeveelheden parallelle berekeningen uitvoeren.


De toekomst van tokens

Hoewel tokens vandaag de standaard vormen, zoeken onderzoekers voortdurend naar efficiëntere manieren om taal te verwerken.

Nieuwe technieken proberen langere tekstfragmenten slimmer samen te vatten, zodat minder tokens nodig zijn zonder belangrijke informatie te verliezen.

Andere modellen experimenteren met hiërarchische representaties waarbij volledige zinnen of paragrafen gedeeltelijk als één betekenisvolle eenheid worden verwerkt.

Daarnaast ontstaan multimodale AI-systemen die niet alleen tekst verwerken, maar ook beelden, geluid, video's en programmeercode. Ook daarvoor worden uiteindelijk vergelijkbare digitale bouwstenen gebruikt. Een afbeelding bestaat voor een AI-model niet uit pixels alleen, maar wordt eveneens omgezet in een reeks interne representaties die vergelijkbaar functioneren met teksttokens.

Dat laat zien dat het tokenbegrip waarschijnlijk nog jarenlang een centrale rol zal spelen, ook wanneer AI steeds veelzijdiger wordt.


Kleine bouwstenen met grote gevolgen

De volgende keer dat een chatbot binnen enkele seconden een ingewikkelde vraag beantwoordt, lijkt het opnieuw alsof er ergens een digitale gesprekspartner zit na te denken. In werkelijkheid gebeurt er iets veel fundamentelers. Achter iedere zin schuilt een gigantische keten van wiskundige voorspellingen waarin taal wordt opgebroken tot duizenden kleine bouwstenen.

Die tokens zijn onzichtbaar voor de gebruiker, maar vormen het fundament waarop moderne kunstmatige intelligentie rust. Ze bepalen hoeveel informatie een model tegelijk kan onthouden, hoe snel het werkt, hoeveel het kost om te gebruiken en zelfs hoe nauwkeurig de antwoorden kunnen zijn.

Misschien is dat wel de grootste paradox van de huidige AI-revolutie. Terwijl gebruikers steeds natuurlijker met machines praten, worden die gesprekken achter de schermen juist teruggebracht tot een eindeloze stroom van kleine stukjes tekst en cijfers. Uit die eenvoudige bouwstenen ontstaat uiteindelijk iets dat verrassend menselijk aanvoelt. Wie eenmaal weet hoe dat proces werkt, kijkt nooit meer op dezelfde manier naar een antwoord dat uit een chatbot verschijnt.