Hoe LLM's Daadwerkelijk Werken
Veeg om het menu te tonen
Je hebt met Claude gesproken. Laten we nu onder de motorkap kijken — zonder wiskunde.
Stap 1: Tekst wordt cijfers
Computers kunnen geen woorden lezen — ze kunnen alleen rekenen. Dus voordat er iets gebeurt, wordt je bericht opgedeeld in stukjes die tokens worden genoemd, en elke token wordt omgezet in een getal.
Een token is ongeveer 4 tekens Engelse tekst. Het kan een volledig woord zijn, een deel van een woord, of leestekens. Spaties en hoofdletters zijn belangrijk — ze veranderen de token.
Wat Claude daadwerkelijk ziet
Wanneer je schrijft:
Hello, marketing manager!
Claude ontvangt:
["Hello", ",", " marketing", " manager", "!"]
Wat wordt omgezet in:
[9906, 11, 8661, 6783, 0]
Vijf tokens. Vijf cijfers. Dat is de input.
Vuistregel: 750 woorden is ongeveer 1.000 tokens. Meer tokens betekent hogere kosten en een tragere reactie.
Stap 2: Voorspel het volgende token
Zodra alles cijfers zijn, doet het model één ding: voorspellen wat er daarna komt. Steeds opnieuw.
Je schrijft:
The capital of France is
Het model bekijkt welk token het meest waarschijnlijk volgt:
- "Paris" — 92%;
- " Paris" — 5%;
- "Lyon" — 1%;
- "the" — 0,5%.
Het kiest de meest waarschijnlijke. Daarna herhaalt het dit. Totdat het besluit te stoppen.
Belangrijk: het model kiest niet voor Paris omdat het het antwoord weet. Het kiest dit omdat in de trainingsdata deze zin bijna altijd werd gevolgd door "Paris."
AI = patroonvoorspelling, geen kennis.
Stap 3: Waar patronen vandaan komen
Het model is getraind op openbare internetteksten, boeken en code — tot een bepaalde cutoffdatum.
Trainingsproces betekent het aanpassen van waarschijnlijkheden: welke tokens volgen op welke, en in welke context.
Twee gevolgen:
- Het model heeft geen kennis van recente gebeurtenissen, jouw bedrijfsdata of iets na de cutoffdatum;
- Het heeft het internet geleerd — inclusief de fouten. Als een deel van de trainingsdata onjuist was, kan het model die fouten zelfverzekerd herhalen.
Waarom AI hallucineert
Een hallucinatie is wanneer het model iets genereert dat overtuigend klinkt en realistisch oogt — maar eigenlijk onjuist is.
Veelvoorkomende voorbeelden: nep-citaties, verzonnen URL's, foutieve statistieken.
Dit gebeurt omdat het doel van het model is om de meest waarschijnlijke reeks tokens te produceren — niet de meest ware. Als iets juist klinkt, kan het dat genereren, zelfs als het onjuist is.
De oplossing
De oplossing is niet alleen het model slimmer maken. Het is het geven van tools — webzoekopdrachten, echte data, documenten — zodat het kan vertrouwen op feiten in plaats van alleen patronen.
Dat is precies wat je in het vorige hoofdstuk hebt gezien, en wat je blijft gebruiken in de volgende hoofdstukken.
Bedankt voor je feedback!
Vraag AI
Vraag AI
Vraag wat u wilt of probeer een van de voorgestelde vragen om onze chat te starten.