Hur LLM:er Faktiskt Fungerar
Svep för att visa menyn
Du har pratat med Claude. Nu ska vi lyfta på huven — utan någon matematik.
Steg 1: Text blir siffror
Datorer kan inte läsa ord — de kan bara räkna. Så innan något händer delas ditt meddelande upp i delar som kallas token, och varje token omvandlas till en siffra.
En token är ungefär 4 tecken av engelsk text. Det kan vara ett helt ord, en del av ett ord eller skiljetecken. Mellanslag och versaler spelar roll — de ändrar token.
Vad Claude faktiskt ser
När du skriver:
Hello, marketing manager!
Claude tar emot:
["Hello", ",", " marketing", " manager", "!"]
Vilket blir:
[9906, 11, 8661, 6783, 0]
Fem token. Fem siffror. Det är indata.
Tumregel: 750 ord är ungefär 1 000 token. Fler token innebär högre kostnad och långsammare svar.
Steg 2: Förutsäga nästa token
När allt är siffror gör modellen en sak: förutsäga vad som kommer härnäst. Om och om igen.
Du skriver:
Huvudstaden i Frankrike är
Modellen överväger vilken token som troligast följer:
- "Paris" — 92 %;
- " Paris" — 5 %;
- "Lyon" — 1 %;
- "the" — 0,5 %.
Den väljer det mest sannolika alternativet. Sedan upprepar den processen. Tills den bestämmer sig för att sluta.
Viktigt: Modellen valde inte Paris för att den vet svaret. Den valde det eftersom denna fras i träningsdatan nästan alltid följdes av "Paris".
AI = mönsterförutsägelse, inte kunskap.
Steg 3: Var mönster kommer ifrån
Modellen tränades på offentliga texter från internet, böcker och kod — fram till ett visst stoppdatum.
Träning innebär att justera sannolikheter: vilka tokens som följer efter vilka, och i vilket sammanhang.
Två konsekvenser:
- Modellen har ingen kunskap om senaste händelser, ditt företagsdata eller något efter stoppdatumet;
- Den lärde sig internet — inklusive dess misstag. Om en del av träningsdatan var felaktig kan modellen upprepa dessa misstag med stor säkerhet.
Varför AI hallucinerar
En hallucination är när modellen genererar något som låter övertygande och ser realistiskt ut — men faktiskt är fel.
Vanliga exempel: falska källhänvisningar, påhittade webbadresser, felaktig statistik.
Detta händer eftersom modellens mål är att producera den mest sannolika sekvensen av tokens — inte den mest sanna. Om något låter rätt kan den generera det även om det är felaktigt.
Lösningen
Lösningen är inte bara att göra modellen smartare. Det handlar om att ge den verktyg — webbsökning, verklig data, dokument — så att den kan förlita sig på fakta istället för enbart mönster.
Det var precis det du såg i föregående kapitel, och som du kommer att fortsätta använda framöver.
Tack för dina kommentarer!
Fråga AI
Fråga AI
Fråga vad du vill eller prova någon av de föreslagna frågorna för att starta vårt samtal