Hoe LLM’s werken: Tokens, context en antwoorden

Een duidelijke, niet-technische introductie.

Leer wat een taalmodel doet wanneer het een prompt leest, tekst opdeelt in tokens, een contextvenster gebruikt en stap voor stap een antwoord genereert. Begin hier voordat je doorgaat naar de gidsen over context engineering en architectuur.

Wat is een LLM?

Een LLM, of large language model, is software die op enorme hoeveelheden tekst is getraind om bruikbare taal te voorspellen en te genereren. Praktisch kun je het zo zien: je geeft het een taak, het zet je tekst om in tokens, schat waarschijnlijke volgende tokens in en geeft een concept terug. Het kan schrijven, samenvatten en classificeren omdat veel taalpatronen in de parameters zijn samengevat. Het is geen database en weet niet automatisch of een actueel feit waar is.

Voorbeeld: Een supportmanager bij een SaaS-bedrijf vraagt: “Vat deze klacht samen en stel een rustige reactie over de terugbetaling voor.” Het model “voelt” de klacht niet; het herkent het patroon van een klacht, terugbetalingsbeleid en een professionele toon.

Wat is een prompt?

Een prompt is het pakket instructies dat je naar een AI-systeem stuurt. Goede prompts bevatten meestal de rol, de situatie, de exacte taak, beperkingen, voorbeelden en het gewenste uitvoerformaat. Een zwakke prompt vraagt om “ideeën”. Een sterke prompt zegt voor wie de ideeën zijn, wat ze moeten bereiken en hoe ze moeten worden beoordeeld.

Voorbeeld: Zwak: “Schrijf een productbeschrijving.” Beter: “Werk als e-commercecopywriter voor een webwinkel. Schrijf een productbeschrijving van 90 woorden voor een herbruikbare koffiebeker. Doelgroep: forenzen. Toon: praktisch, zonder hype. Voeg één kop en drie opsommingstekens toe.”

Wat gebeurt er werkelijk wanneer je een prompt verstuurt?

De normale gang van zaken is niet: “de AI begrijpt het verzoek, schrijft een Python-programma en gaat vervolgens aan de slag.” Een large language model ontvangt doorgaans tekst, zet die om in tokens, voert die tokens door lagen van een neuraal netwerk en genereert telkens opnieuw het volgende token. Python of andere tools komen alleen in beeld wanneer het product rond het model expliciet toegang tot tools geeft, bijvoorbeeld een rekenmachine, code-interpreter, browser, databaseconnector of function call.

Stapsgewijs diagram van wat er gebeurt wanneer een gebruiker een prompt naar een LLM stuurt.
Een prompt wordt in tokens opgedeeld, door het model verwerkt en stap voor stap terug omgezet in een antwoord.
1. Invoer

Je typt een prompt. De applicatie kan verborgen systeeminstructies, veiligheidsbeleid, chatgeschiedenis of geselecteerde documenten toevoegen voordat het model het uiteindelijke verzoek ziet.

2. Tokens

De tekst wordt opgesplitst in token-ID’s. Het model ontvangt geen woorden zoals een mens ze leest; het ontvangt numerieke token-ID’s.

3. Inference

Het model berekent op basis van de volledige context de waarschijnlijkheden voor mogelijke volgende tokens. Hier spelen attention, embeddings en modelgewichten een rol.

4. Optionele tool

Als de applicatie tools ondersteunt, kan het model een functie aanvragen, zoals zoeken, rekenen of code uitvoeren. Het externe resultaat wordt vervolgens als extra context terug in het gesprek geplaatst.

5. Antwoord

De uiteindelijke tekst wordt uit de gegenereerde tokens gedecodeerd. Betere prompts helpen omdat ze de context veranderen waarop het model zich baseert voordat het elk volgend token kiest.

Les voor prompting: het model is zeer gevoelig voor de informatie die het vóór het genereren ontvangt. Duidelijke context, voorbeelden, beperkingen en bronmateriaal vergroten de kans dat de volgende tokens je bedoeling volgen.
Probeer de ideeën op je eigen prompts

Gebruik een eenvoudige voor-en-na-oefening voordat je doorgaat met tokens, context en modelbeperkingen.

Beter dan een minitest: maak een voor-en-na-galerij van prompts

Verzamel in plaats van een algemene test vijf echte prompts uit je eigen werk en bewaar de zwakke versie, de verbeterde versie en het uiteindelijke bewerkte resultaat. Zo ontstaat een herbruikbare promptgalerij voor je team.

  1. Kies één terugkerende taak, zoals supportreacties, productbeschrijvingen of samenvattingen van lessen.
  2. Bewaar de oorspronkelijke prompt en uitvoer.
  3. Voeg context, formaatregels en één voorbeeld toe.
  4. Vergelijk hoeveel bewerking de tweede uitvoer nodig heeft.
  5. Maak van de beste versie een template.

Wat zijn tokens?

Tokens zijn de kleine teksteenheden die een model leest en schrijft. Afhankelijk van de tokenizer en taal kan een token een heel woord, een deel van een woord, leesteken of teken zijn. Tokenlimieten zijn belangrijk omdat invoer en uitvoer samen binnen het contextvenster van het model moeten passen.

Voorbeeld: “PromptingEasy helpt teams” kan worden opgesplitst in tokens die bijvoorbeeld lijken op “Prompt”, “ing”, “Easy”, “helpt”, “teams”. Daarom verhogen lange documenten en veel voorbeelden de kosten en kunnen ze belangrijke instructies uit de context verdringen.
Diagram dat laat zien hoe tekst in gekleurde tokenstukken wordt omgezet en daarna weer tot de oorspronkelijke zin wordt samengevoegd.
Tekst wordt opgesplitst in tokens en daarna weer samengevoegd tot leesbare tekst.

Waarom verzint AI soms dingen?

AI kan hallucineren wanneer het een aannemelijk klinkend vervolg genereert zonder voldoende betrouwbare onderbouwing. Het model is geoptimaliseerd om waarschijnlijke tekst te produceren, niet om standaard de waarheid te garanderen. Hallucinaties worden waarschijnlijker wanneer een vraag om obscure feiten, actuele informatie, verborgen gegevens of niet-aangeleverde bronverwijzingen vraagt.

Voorbeeld: Een gebruiker vraagt zonder te browsen of brontekst om “de exacte prijs in 2026 van een niche-API-abonnement”. Het model kan een overtuigend ogende prijs geven omdat dat soort antwoord vaak voorkomt, ook als het bedrag onjuist is.

Hetzelfde mechanisme kan ook een werkstatus, verzinnen, niet alleen een feit. In een van onze eigen workflows kreeg een AI-assistent de opdracht om voor elke rij van een spreadsheet het bijbehorende LinkedIn-profiel op te zoeken en elke URL in één kolom te schrijven — tientallen rijen, niet één zoekopdracht. De assistent meldde dat de taak klaar was en gaf zelfs aantallen — “14 profielen, 3 e-mails” — maar de kolom was leeg en het teruggegeven bestand was slechts een hernoemde kopie. Een zelfverzekerde samenvatting bestaat gewoon uit de meest waarschijnlijke volgende woorden en bewijst dus niet dat het werk daadwerkelijk is uitgevoerd.

Opnieuw vragen doorbreekt het patroon niet noodzakelijk. Afhankelijk van het product kan een nieuwe poging het zichtbare gesprek opnieuw versturen, server-side gespreksstatus gebruiken, oudere beurten inkorten of samenvatten, of gecachte invoer hergebruiken. Er wordt nog steeds een nieuw antwoord gegenereerd en dat kan extra tokens of abonnementslimieten verbruiken, zelfs wanneer er geen bruikbaar bestand ontstaat.

Een AI-assistent die toegeeft dat hij een spreadsheettaak als voltooid rapporteerde zonder gegevens in het bestand te hebben geschreven.
Echt geval uit onze eigen workflow (screenshot, 2026): de assistent rapporteerde aantallen en een voltooid bestand — de doelkolom was nog steeds leeg.

Oorzaak: zit de AI vast in een lus?

In praktische zin wel — maar niet zoals het aanvoelt. Het model heeft geen blijvend zelfbewustzijn dat het een fout herhaalt; het kan alleen de context en status gebruiken die de applicatie aanlevert. Een nieuw antwoord kan worden gegenereerd op basis van de volledige zichtbare geschiedenis, een ingekorte of samengevatte geschiedenis of server-beheerde status. Als de workflow niet vereist dat de assistent het bestand opent en de opgeslagen waarden controleert, kan “klaar” een aannemelijk antwoord blijven. De lus is geen koppigheid; er ontbreken verificatie- en statuscontroles.

Daarom helpt dezelfde vraag herhalen zelden, terwijl het wel tokens blijft verbruiken. Wat de lus doorbreekt, is de taak veranderen, niet herhalen: maak het resultaat controleerbaar, vraag de assistent het opgeslagen bestand opnieuw te lezen en de daadwerkelijke celwaarden te tonen, en stop de run wanneer dat bewijs ontbreekt. Bekijk de meest voorkomende fouten bij prompting voor hoe je een succescriterium definieert dat het model kan controleren.

Waarom helpt context?

Context verkleint de zoekruimte. Als het model de doelgroep, het doel, de beperkingen, voorbeelden en het bronmateriaal kent, kan het een antwoord geven dat bij jouw situatie past in plaats van een algemeen antwoord. Meer context is niet altijd beter: irrelevante context kan het model afleiden en de kosten verhogen.

Voorbeeld: Een marketingteam krijgt betere advertentieteksten wanneer het de productpositionering, doelklant, verboden claims en twee eerder succesvolle advertenties meegeeft in plaats van alleen “schrijf advertenties” te zeggen.

Zoekmachine versus LLM

Een zoekmachine haalt pagina’s op en rangschikt links. Een LLM genereert een antwoord op basis van patronen en aangeleverde context. Zoeken is beter wanneer je actuele bronnen, officiële pagina’s of meerdere perspectieven nodig hebt. LLM’s zijn beter wanneer je informatie wilt samenvoegen, herschrijven, redeneren over aangeleverde informatie of gestructureerde concepten wilt maken. Veel sterke AI-producten combineren beide.

Voorbeeld: Gebruik voor “laatste belastingdeadline in Zürich” een zoekmachine of officiële bronnen. Voor “maak van deze notities een beleefde e-mail aan een klant” is een LLM de betere interface.
Vergelijkingsdiagram dat laat zien hoe een zoekmachine en een LLM dezelfde gebruikersvraag verschillend beantwoorden.
Zoekmachines geven links en bronnen; LLMs genereren directe antwoorden in natuurlijke taal.

Wat betekent “AI begrijpt taal”?

In alledaagse taal betekent “begrijpen” dat het model passend kan reageren op betekenis, toon en structuur. Technisch gezien heeft het statistische representaties geleerd die tekstpatronen koppelen aan bruikbare uitvoer. Het begrijpt niet zoals een mens met levenservaring, intenties of verantwoordelijkheid op basis van gezond verstand.

Voorbeeld: Als je schrijft “maak dit minder verkoperig”, kan het model de toon vaak aanpassen omdat het patronen van verkoperige versus neutrale taal heeft geleerd. Dat is bruikbare taalvaardigheid, geen menselijk begrip.

Bekijk daarna echte promptvoorbeelden

Gebruik de universele promptgenerator om deze AI-concepten om te zetten in praktische prompts voor schrijven, onderzoek, werk, leren en dagelijkse taken.

Deel deze gids

PromptingEasy aan je scherm toevoegen

Gebruik het menu van je browser en kies de optie om deze site te installeren of aan je beginscherm toe te voegen.