Hvordan LLM'er Faktisk Fungerer
Stryg for at vise menuen
Du har talt med Claude. Lad os nu kigge under motorhjelmen — uden matematik.
Trin 1: Tekst bliver til tal
Computere kan ikke læse ord — de kan kun regne. Før noget sker, bliver din besked delt op i stykker kaldet tokens, og hver token bliver omdannet til et tal.
En token svarer cirka til 4 engelske tegn. Det kan være et helt ord, en del af et ord eller tegnsætning. Mellemrum og store bogstaver har betydning — de ændrer tokenen.
Hvad Claude faktisk ser
Når du skriver:
Hello, marketing manager!
Modtager Claude:
["Hello", ",", " marketing", " manager", "!"]
Som bliver til:
[9906, 11, 8661, 6783, 0]
Fem tokens. Fem tal. Det er inputtet.
Tommerfingerregel: 750 ord svarer cirka til 1.000 tokens. Flere tokens betyder højere omkostning og langsommere svar.
Trin 2: Forudsig det næste token
Når alt er tal, gør modellen én ting: forudsiger hvad der kommer næste. Igen og igen.
Du skriver:
Hovedstaden i Frankrig er
Modellen vurderer, hvilket token der sandsynligvis følger:
- "Paris" — 92%;
- " Paris" — 5%;
- "Lyon" — 1%;
- "the" — 0,5%.
Den vælger det mest sandsynlige. Gentager derefter processen. Indtil den beslutter at stoppe.
Vigtigt: Modellen valgte ikke Paris, fordi den kender svaret. Den valgte det, fordi denne sætning i træningsdata næsten altid blev efterfulgt af "Paris."
AI = mønstergenkendelse, ikke viden.
Trin 3: Hvor mønstre kommer fra
Modellen blev trænet på offentlige internettekster, bøger og kode — op til en bestemt skæringsdato.
Træning betyder justering af sandsynligheder: hvilke tokens følger efter hvilke, og i hvilken kontekst.
To konsekvenser:
- Modellen har ingen viden om nylige begivenheder, din virksomhedsdata eller noget efter skæringsdatoen;
- Den har lært internettet — inklusive dets fejl. Hvis en del af træningsdataene var forkerte, kan modellen gentage disse fejl med stor selvtillid.
Hvorfor AI hallucinerer
En hallucination opstår, når modellen genererer noget, der lyder overbevisende og ser realistisk ud — men faktisk er forkert.
Almindelige eksempler: falske referencer, opdigtede URL'er, forkerte statistikker.
Dette sker, fordi modellens mål er at producere den mest sandsynlige sekvens af tokens — ikke den mest sande. Hvis noget lyder rigtigt, kan den generere det, selvom det er forkert.
Løsningen
Løsningen er ikke blot at gøre modellen klogere. Det handler om at give den værktøjer — websøgning, faktiske data, dokumenter — så den kan basere sig på fakta i stedet for udelukkende mønstre.
Det var præcis det, du så i det forrige kapitel, og som du fortsat vil bruge fremadrettet.
Tak for dine kommentarer!
Spørg AI
Spørg AI
Spørg om hvad som helst eller prøv et af de foreslåede spørgsmål for at starte vores chat