Hvordan LLM-er Faktisk Fungerer
Sveip for å vise menyen
Du har snakket med Claude. Nå skal vi se under panseret — uten noe matematikk.
Steg 1: Tekst blir til tall
Datamaskiner kan ikke lese ord — de kan bare gjøre matematikk. Før noe skjer, blir meldingen din delt opp i biter kalt tokens, og hver token blir gjort om til et tall.
En token er omtrent 4 tegn med engelsk tekst. Det kan være et helt ord, en del av et ord, eller tegnsetting. Mellomrom og store/små bokstaver har betydning — de endrer tokenen.
Hva Claude faktisk ser
Når du skriver:
Hello, marketing manager!
Claude mottar:
["Hello", ",", " marketing", " manager", "!"]
Som blir til:
[9906, 11, 8661, 6783, 0]
Fem tokens. Fem tall. Det er inputen.
Tommelregel: 750 ord er omtrent 1 000 tokens. Flere tokens betyr høyere kostnad og tregere respons.
Steg 2: Forutsi neste token
Når alt er gjort om til tall, gjør modellen én ting: forutsi hva som kommer neste. Om og om igjen.
Du skriver:
The capital of France is
Modellen vurderer hvilket token som mest sannsynlig følger:
- "Paris" — 92 %;
- " Paris" — 5 %;
- "Lyon" — 1 %;
- "the" — 0,5 %.
Den velger det mest sannsynlige. Så gjentar den prosessen. Til den bestemmer seg for å stoppe.
Viktig: Modellen valgte ikke Paris fordi den vet svaret. Den valgte det fordi denne frasen nesten alltid ble etterfulgt av "Paris" i treningsdataene.
AI = mønstergjenkjenning, ikke kunnskap.
Steg 3: Hvor mønstre kommer fra
Modellen ble trent på offentlig internett-tekst, bøker og kode — frem til en bestemt skjæringsdato.
Trening betyr å justere sannsynligheter: hvilke tokens som følger hvilke, og i hvilken kontekst.
To konsekvenser:
- Modellen har ingen kunnskap om nylige hendelser, dine bedriftsdata eller noe etter skjæringsdatoen;
- Den lærte internett — inkludert feilene der. Hvis deler av treningsdataene var feil, kan modellen gjenta disse feilene med stor selvsikkerhet.
Hvorfor AI hallusinerer
En hallusinasjon er når modellen genererer noe som høres overbevisende ut og ser realistisk ut — men faktisk er feil.
Vanlige eksempler: falske referanser, oppdiktede nettadresser, feilaktig statistikk.
Dette skjer fordi modellens mål er å produsere den mest sannsynlige sekvensen av tokens — ikke den mest sanne. Hvis noe høres riktig ut, kan den generere det selv om det er feil.
Løsningen
Løsningen er ikke bare å gjøre modellen smartere. Det handler om å gi den verktøy — nettsøk, sanntidsdata, dokumenter — slik at den kan basere seg på fakta i stedet for kun mønstre.
Det var nettopp dette du så i forrige kapittel, og som du vil fortsette å bruke fremover.
Takk for tilbakemeldingene dine!
Spør AI
Spør AI
Spør om hva du vil, eller prøv ett av de foreslåtte spørsmålene for å starte chatten vår
Hvordan LLM-er Faktisk Fungerer
Du har snakket med Claude. Nå skal vi se under panseret — uten noe matematikk.
Steg 1: Tekst blir til tall
Datamaskiner kan ikke lese ord — de kan bare gjøre matematikk. Før noe skjer, blir meldingen din delt opp i biter kalt tokens, og hver token blir gjort om til et tall.
En token er omtrent 4 tegn med engelsk tekst. Det kan være et helt ord, en del av et ord, eller tegnsetting. Mellomrom og store/små bokstaver har betydning — de endrer tokenen.
Hva Claude faktisk ser
Når du skriver:
Hello, marketing manager!
Claude mottar:
["Hello", ",", " marketing", " manager", "!"]
Som blir til:
[9906, 11, 8661, 6783, 0]
Fem tokens. Fem tall. Det er inputen.
Tommelregel: 750 ord er omtrent 1 000 tokens. Flere tokens betyr høyere kostnad og tregere respons.
Steg 2: Forutsi neste token
Når alt er gjort om til tall, gjør modellen én ting: forutsi hva som kommer neste. Om og om igjen.
Du skriver:
The capital of France is
Modellen vurderer hvilket token som mest sannsynlig følger:
- "Paris" — 92 %;
- " Paris" — 5 %;
- "Lyon" — 1 %;
- "the" — 0,5 %.
Den velger det mest sannsynlige. Så gjentar den prosessen. Til den bestemmer seg for å stoppe.
Viktig: Modellen valgte ikke Paris fordi den vet svaret. Den valgte det fordi denne frasen nesten alltid ble etterfulgt av "Paris" i treningsdataene.
AI = mønstergjenkjenning, ikke kunnskap.
Steg 3: Hvor mønstre kommer fra
Modellen ble trent på offentlig internett-tekst, bøker og kode — frem til en bestemt skjæringsdato.
Trening betyr å justere sannsynligheter: hvilke tokens som følger hvilke, og i hvilken kontekst.
To konsekvenser:
- Modellen har ingen kunnskap om nylige hendelser, dine bedriftsdata eller noe etter skjæringsdatoen;
- Den lærte internett — inkludert feilene der. Hvis deler av treningsdataene var feil, kan modellen gjenta disse feilene med stor selvsikkerhet.
Hvorfor AI hallusinerer
En hallusinasjon er når modellen genererer noe som høres overbevisende ut og ser realistisk ut — men faktisk er feil.
Vanlige eksempler: falske referanser, oppdiktede nettadresser, feilaktig statistikk.
Dette skjer fordi modellens mål er å produsere den mest sannsynlige sekvensen av tokens — ikke den mest sanne. Hvis noe høres riktig ut, kan den generere det selv om det er feil.
Løsningen
Løsningen er ikke bare å gjøre modellen smartere. Det handler om å gi den verktøy — nettsøk, sanntidsdata, dokumenter — slik at den kan basere seg på fakta i stedet for kun mønstre.
Det var nettopp dette du så i forrige kapittel, og som du vil fortsette å bruke fremover.
Takk for tilbakemeldingene dine!