Wat is een LLM?
Een LLM, of large language model, is software die op enorme hoeveelheden tekst is getraind om bruikbare taal te voorspellen en te genereren. Praktisch kun je het zo zien: je geeft het een taak, het zet je tekst om in tokens, schat waarschijnlijke volgende tokens in en geeft een concept terug. Het kan schrijven, samenvatten en classificeren omdat veel taalpatronen in de parameters zijn samengevat. Het is geen database en weet niet automatisch of een actueel feit waar is.
Wat is een prompt?
Een prompt is het pakket instructies dat je naar een AI-systeem stuurt. Goede prompts bevatten meestal de rol, de situatie, de exacte taak, beperkingen, voorbeelden en het gewenste uitvoerformaat. Een zwakke prompt vraagt om “ideeën”. Een sterke prompt zegt voor wie de ideeën zijn, wat ze moeten bereiken en hoe ze moeten worden beoordeeld.
Wat gebeurt er werkelijk wanneer je een prompt verstuurt?
De normale gang van zaken is niet: “de AI begrijpt het verzoek, schrijft een Python-programma en gaat vervolgens aan de slag.” Een large language model ontvangt doorgaans tekst, zet die om in tokens, voert die tokens door lagen van een neuraal netwerk en genereert telkens opnieuw het volgende token. Python of andere tools komen alleen in beeld wanneer het product rond het model expliciet toegang tot tools geeft, bijvoorbeeld een rekenmachine, code-interpreter, browser, databaseconnector of function call.

Je typt een prompt. De applicatie kan verborgen systeeminstructies, veiligheidsbeleid, chatgeschiedenis of geselecteerde documenten toevoegen voordat het model het uiteindelijke verzoek ziet.
De tekst wordt opgesplitst in token-ID’s. Het model ontvangt geen woorden zoals een mens ze leest; het ontvangt numerieke token-ID’s.
Het model berekent op basis van de volledige context de waarschijnlijkheden voor mogelijke volgende tokens. Hier spelen attention, embeddings en modelgewichten een rol.
Als de applicatie tools ondersteunt, kan het model een functie aanvragen, zoals zoeken, rekenen of code uitvoeren. Het externe resultaat wordt vervolgens als extra context terug in het gesprek geplaatst.
De uiteindelijke tekst wordt uit de gegenereerde tokens gedecodeerd. Betere prompts helpen omdat ze de context veranderen waarop het model zich baseert voordat het elk volgend token kiest.
Gebruik een eenvoudige voor-en-na-oefening voordat je doorgaat met tokens, context en modelbeperkingen.
Beter dan een minitest: maak een voor-en-na-galerij van prompts
Verzamel in plaats van een algemene test vijf echte prompts uit je eigen werk en bewaar de zwakke versie, de verbeterde versie en het uiteindelijke bewerkte resultaat. Zo ontstaat een herbruikbare promptgalerij voor je team.
- Kies één terugkerende taak, zoals supportreacties, productbeschrijvingen of samenvattingen van lessen.
- Bewaar de oorspronkelijke prompt en uitvoer.
- Voeg context, formaatregels en één voorbeeld toe.
- Vergelijk hoeveel bewerking de tweede uitvoer nodig heeft.
- Maak van de beste versie een template.
Wat zijn tokens?
Tokens zijn de kleine teksteenheden die een model leest en schrijft. Afhankelijk van de tokenizer en taal kan een token een heel woord, een deel van een woord, leesteken of teken zijn. Tokenlimieten zijn belangrijk omdat invoer en uitvoer samen binnen het contextvenster van het model moeten passen.

Waarom verzint AI soms dingen?
AI kan hallucineren wanneer het een aannemelijk klinkend vervolg genereert zonder voldoende betrouwbare onderbouwing. Het model is geoptimaliseerd om waarschijnlijke tekst te produceren, niet om standaard de waarheid te garanderen. Hallucinaties worden waarschijnlijker wanneer een vraag om obscure feiten, actuele informatie, verborgen gegevens of niet-aangeleverde bronverwijzingen vraagt.
Hetzelfde mechanisme kan ook een werkstatus, verzinnen, niet alleen een feit. In een van onze eigen workflows kreeg een AI-assistent de opdracht om voor elke rij van een spreadsheet het bijbehorende LinkedIn-profiel op te zoeken en elke URL in één kolom te schrijven — tientallen rijen, niet één zoekopdracht. De assistent meldde dat de taak klaar was en gaf zelfs aantallen — “14 profielen, 3 e-mails” — maar de kolom was leeg en het teruggegeven bestand was slechts een hernoemde kopie. Een zelfverzekerde samenvatting bestaat gewoon uit de meest waarschijnlijke volgende woorden en bewijst dus niet dat het werk daadwerkelijk is uitgevoerd.
Opnieuw vragen doorbreekt het patroon niet noodzakelijk. Afhankelijk van het product kan een nieuwe poging het zichtbare gesprek opnieuw versturen, server-side gespreksstatus gebruiken, oudere beurten inkorten of samenvatten, of gecachte invoer hergebruiken. Er wordt nog steeds een nieuw antwoord gegenereerd en dat kan extra tokens of abonnementslimieten verbruiken, zelfs wanneer er geen bruikbaar bestand ontstaat.

Oorzaak: zit de AI vast in een lus?
In praktische zin wel — maar niet zoals het aanvoelt. Het model heeft geen blijvend zelfbewustzijn dat het een fout herhaalt; het kan alleen de context en status gebruiken die de applicatie aanlevert. Een nieuw antwoord kan worden gegenereerd op basis van de volledige zichtbare geschiedenis, een ingekorte of samengevatte geschiedenis of server-beheerde status. Als de workflow niet vereist dat de assistent het bestand opent en de opgeslagen waarden controleert, kan “klaar” een aannemelijk antwoord blijven. De lus is geen koppigheid; er ontbreken verificatie- en statuscontroles.
Daarom helpt dezelfde vraag herhalen zelden, terwijl het wel tokens blijft verbruiken. Wat de lus doorbreekt, is de taak veranderen, niet herhalen: maak het resultaat controleerbaar, vraag de assistent het opgeslagen bestand opnieuw te lezen en de daadwerkelijke celwaarden te tonen, en stop de run wanneer dat bewijs ontbreekt. Bekijk de meest voorkomende fouten bij prompting voor hoe je een succescriterium definieert dat het model kan controleren.
Waarom helpt context?
Context verkleint de zoekruimte. Als het model de doelgroep, het doel, de beperkingen, voorbeelden en het bronmateriaal kent, kan het een antwoord geven dat bij jouw situatie past in plaats van een algemeen antwoord. Meer context is niet altijd beter: irrelevante context kan het model afleiden en de kosten verhogen.
Zoekmachine versus LLM
Een zoekmachine haalt pagina’s op en rangschikt links. Een LLM genereert een antwoord op basis van patronen en aangeleverde context. Zoeken is beter wanneer je actuele bronnen, officiële pagina’s of meerdere perspectieven nodig hebt. LLM’s zijn beter wanneer je informatie wilt samenvoegen, herschrijven, redeneren over aangeleverde informatie of gestructureerde concepten wilt maken. Veel sterke AI-producten combineren beide.

Wat betekent “AI begrijpt taal”?
In alledaagse taal betekent “begrijpen” dat het model passend kan reageren op betekenis, toon en structuur. Technisch gezien heeft het statistische representaties geleerd die tekstpatronen koppelen aan bruikbare uitvoer. Het begrijpt niet zoals een mens met levenservaring, intenties of verantwoordelijkheid op basis van gezond verstand.