Notice: This page requires JavaScript to function properly.
Please enable JavaScript in your browser settings or update your browser.
Lernen Grundlagen der Wort-Embeddings | Wort-Einbettungen
Einführung in NLP mit Python

Grundlagen der Wort-Embeddings

Swipe um das Menü anzuzeigen

Verständnis von Wort-Embeddings

Traditionelle Methoden zur Textdarstellung wie Bag-of-Words und TF-IDF weisen erhebliche Einschränkungen auf. Sie behandeln Wörter isoliert, ignorieren semantische Beziehungen und erzeugen hochdimensionale, spärliche Vektoren, die bei großen Korpora rechnerisch ineffizient werden.

Nachteile

Wort-Embeddings beheben diese Probleme, indem sie den Kontext berücksichtigen, in dem Wörter auftreten, und so ein differenzierteres Verständnis der Sprache ermöglichen.

Note
Definition

Wort-Embeddings sind dichte Vektorrepräsentationen von Wörtern in einem kontinuierlichen Vektorraum, in dem semantisch ähnliche Wörter auf nahe beieinanderliegende Punkte abgebildet werden.

Mehrere Modelle und Techniken wurden entwickelt, um aussagekräftige Wort-Embeddings zu erzeugen:

  • Word2Vec: von Google entwickelt, stellt Word2Vec Wörter als dichte Vektoren mithilfe von zwei Architekturen dar: Continuous Bag of Words (CBoW), das ein Wort aus seinem Kontext vorhersagt, und Skip-gram, das aus einem gegebenen Wort die umgebenden Wörter vorhersagt;

  • GloVe: an der Stanford University entwickelt, erzeugt GloVe (Global Vectors) Wort-Embeddings durch die Analyse globaler Wort-Kookkurrenzstatistiken über das gesamte Korpus hinweg und erfasst semantische Beziehungen basierend auf der Häufigkeit, mit der Wortpaare gemeinsam auftreten;

  • FastText: von Facebook AI Research eingeführt, baut FastText auf Word2Vec auf, indem es Wörter als eine Sammlung von Zeichen-n-Grammen darstellt. Dadurch kann es Subwort-Informationen modellieren und verbessert die Fähigkeit, seltene und unbekannte Wörter sowie morphologisch komplexe Sprachen zu verarbeiten.

Modelle

Word2Vec und FastText sind die am häufigsten verwendeten Modelle zur Erstellung von Wort-Embeddings. Da FastText jedoch lediglich eine erweiterte Version von Word2Vec ist, überspringen wir dieses Modell und konzentrieren uns ausschließlich auf Word2Vec.

Funktionsweise von Word2Vec

Word2Vec wandelt Wörter in Vektoren um, indem es mit dem One-Hot-Encoding beginnt. Dabei wird jedes Wort im Vokabular durch einen eindeutigen Vektor dargestellt, der durch eine einzelne 1 unter lauter Nullen gekennzeichnet ist. Im Folgenden ein Beispiel:

One-Hot-Encoding

Dieser Vektor dient als Eingabe für ein neuronales Netzwerk, das darauf ausgelegt ist, die Wort-Embeddings zu "erlernen". Die Architektur des Netzwerks kann einem von zwei Modellen folgen:

  • CBoW (Continuous Bag of Words): Sagt ein Zielwort basierend auf dem Kontext der umgebenden Wörter voraus;
  • Skip-gram: Sagt die umgebenden Kontextwörter basierend auf dem Zielwort voraus.

In beiden Word2Vec-Architekturen erhält das Modell in jeder Trainingsiteration ein Zielwort und die es umgebenden Wörter als Kontext, dargestellt als One-Hot-codierte Vektoren. Der Trainingsdatensatz besteht somit effektiv aus diesen Paaren oder Gruppen, wobei jedem Zielwort seine umgebenden Kontextwörter zugeordnet sind.

Jedes Wort im Vokabular wird einmal als Zielwort verwendet, während das Modell den Text mit einer gleitenden Kontextfenster-Technik durchläuft. Diese Technik bewegt sich systematisch über jedes Wort und stellt sicher, dass aus allen möglichen Kontexten im Korpus umfassend gelernt wird.

Note
Definition

Ein Kontextfenster ist eine feste Anzahl von Wörtern, die ein Zielwort umgeben und die das Modell verwendet, um dessen Kontext zu erlernen. Es definiert, wie viele Wörter vor und nach dem Zielwort während des Trainings berücksichtigt werden.

Ein Beispiel mit einer Fenstergröße von 2 zur Veranschaulichung:

Gleitendes Fenster

Eine Kontextfenstergröße von 2 bedeutet, dass das Modell bis zu 2 Wörter sowohl links als auch rechts vom Zielwort einbezieht, sofern diese Wörter innerhalb der Textgrenzen verfügbar sind. Wie zu sehen ist, werden, wenn auf einer Seite weniger als 2 Wörter vorhanden sind, so viele Wörter wie möglich einbezogen.

question mark

Was bedeutet ein Kontextfenster der Größe 5?

Wählen Sie die richtige Antwort aus

War alles klar?

Wie können wir es verbessern?

Danke für Ihr Feedback!

Abschnitt 4. Kapitel 1

Fragen Sie AI

expand

Fragen Sie AI

ChatGPT

Fragen Sie alles oder probieren Sie eine der vorgeschlagenen Fragen, um unser Gespräch zu beginnen

Abschnitt 4. Kapitel 1
some-alt