Notice: This page requires JavaScript to function properly.
Please enable JavaScript in your browser settings or update your browser.
Lære Vektorrommodeller | Grunnleggende Tekstmodeller
Introduksjon til NLP med Python

Vektorrommodeller

Sveip for å vise menyen

Behovet for numerisk representasjon

Datamaskiner kan ikke tolke tekst slik mennesker gjør. Mens vi utleder mening fra språk gjennom kontekst, kultur og erfaring, ser datamaskiner ikke annet enn sekvenser av tegn.

For å gjøre tekst tilgjengelig for maskiner, må vi oversette den til deres morsmål: tall. Å representere tekst med vektorer og matriser gjør det mulig for matematiske og statistiske modeller å avdekke mønstre, relasjoner og innsikter som ellers ville forblitt skjult i rå tekst.

bilde

Forståelse av vektorrommodeller

Heldigvis finnes det allerede effektive løsninger for å konvertere tekst til numerisk form. En av de mest utbredte tilnærmingene er bruk av vektorrommodeller.

Note
Definisjon

Vektorrommodell (VSM) er en matematisk modell som representerer tekst-dokumenter, ord eller andre elementer som vektorer i et flerdimensjonalt rom.

Det finnes mange måter å konstruere slike vektorrom for tekst-dokumenter. En enkel tilnærming er å bruke hele korpusvokabularet, der hver dimensjon i rommet tilordnes et unikt begrep.

Note
Definisjon

Vokabular er det komplette settet av unike begreper som forekommer i et gitt korpus.

La korpusvokabularet betegnes som VV og dokumentmengden som DD. Hvert dokument diDd_i \in D kan da representeres som en vektor i RN\R^N:

di=(w1,i,w2,i,...,wN,i)d_i = (w_{1,i}, w_{2,i}, ..., w_{N,i})

hvor:

  • N=VN = |V| er det totale antallet unike termer i vokabularet;
  • wj,iw_{j,i} angir vekten eller viktigheten til termen WjVW_j \in V i dokumentet did_i.

Her er et enkelt eksempel med kun 2 dokumenter og 2 unike termer, visualisert i et todimensjonalt vektorrom:

bilde

Ved å bruke disse vektorrepresentasjonene kan man beregne en likhetsscore mellom dokumenter ved å måle vinkelen mellom vektorene, vanligvis ved hjelp av cosinuslikhet.

Ord som vektorer

Ideen bak VSM-er kan utvides til individuelle ordrepresentasjoner gjennom teknikken kjent som word embeddings. Word embeddings bygger på et lignende matematisk prinsipp, men fokuserer på å representere enkeltord som vektorer i stedet for hele dokumenter. Dimensjonene i disse vektorene fanger opp latente semantiske egenskaper som ikke er direkte tolkbare.

Her er et eksempel med todimensjonale embeddinger for tre ord:

bilde

Som illustrert i bildet, er vektorene for "woman" og "queen", samt for "queen" og "king", plassert nær hverandre, noe som indikerer sterk semantisk likhet. I kontrast antyder den større vinkelen mellom "woman" og "king" en større semantisk forskjell.

Note
Merk

Ikke bekymre deg for word embeddings nå, vi kommer tilbake til dette senere.

Bruksområder for vektorrommodeller

Vektorrommodeller brukes i et bredt spekter av NLP-oppgaver:

  • Semantisk likhet: beregning av likhet mellom tekst-dokumenter eller ord basert på deres vektorrepresentasjoner;

  • Informasjonshenting: forbedring av søkemotorer og anbefalingssystemer for å finne innhold som er relevant for en brukers forespørsel;

  • Tekstklassifisering og klynging: automatisk kategorisering av dokumenter i forhåndsdefinerte klasser eller gruppering av lignende dokumenter;

  • Forståelse av naturlig språk: muliggjør dypere språklig analyse som legger til rette for applikasjoner som sentimentanalyse, emnemodellering og mer.

question mark

Hva brukes vektorrommodeller til?

Velg det helt riktige svaret

Alt var klart?

Hvordan kan vi forbedre det?

Takk for tilbakemeldingene dine!

Seksjon 3. Kapittel 1

Spør AI

expand

Spør AI

ChatGPT

Spør om hva du vil, eller prøv ett av de foreslåtte spørsmålene for å starte chatten vår

Seksjon 3. Kapittel 1
some-alt