Notice: This page requires JavaScript to function properly.
Please enable JavaScript in your browser settings or update your browser.
Lernen Arten von Vektorraum-Modellen | Grundlegende Textmodelle
Einführung in NLP mit Python

Arten von Vektorraum-Modellen

Swipe um das Menü anzuzeigen

Vektorraummodelle können nach der Art ihrer Textrepräsentation kategorisiert werden, von einfachen, frequenzbasierten Methoden bis hin zu fortgeschrittenen, kontextsensitiven Einbettungen. Jede Herangehensweise bietet spezifische Vorteile und eignet sich für unterschiedliche Arten von NLP-Aufgaben.

Bag of Words

Bag of Words (BoW) ist ein Vektorraummodell, das Dokumente als Vektoren darstellt, wobei jede Dimension einem einzigartigen Wort entspricht. Es kann binär sein (zeigt das Vorkommen eines Wortes an) oder frequenzbasiert (zeigt die Anzahl der Vorkommen eines Wortes an).

Hier ein Beispiel für ein frequenzbasiertes BoW:

Bild

Wie Sie sehen können, wird jedes Dokument durch einen Vektor dargestellt, wobei jede Dimension der Häufigkeit eines bestimmten Wortes in diesem Dokument entspricht. Im Fall eines binären Bag-of-Words-Modells enthält jeder Vektor nur 0 oder 1 für jedes Wort, was auf dessen Abwesenheit bzw. Vorhandensein hinweist.

Note
Hinweis

Textvorverarbeitung ist ein notwendiger Schritt, bevor BoW oder ähnliche Modelle angewendet werden.

TF-IDF

Das TF-IDF (Termfrequenz-inverse Dokumentfrequenz)-Modell erweitert den Bag-of-Words (BoW)-Ansatz, indem es die Worthäufigkeiten basierend auf deren Vorkommen in allen Dokumenten anpasst. Es hebt Wörter hervor, die für ein Dokument einzigartig sind, und liefert dadurch spezifischere Einblicke in den Dokumenteninhalt.

Dies wird erreicht, indem die Termfrequenz (die Anzahl der Vorkommen eines Wortes in einem Dokument) mit der inversen Dokumentfrequenz (ein Maß dafür, wie häufig oder selten ein Wort im gesamten Datensatz ist) kombiniert wird.

Hier ist das Ergebnis der Anwendung von TF-IDF auf die Dokumente aus dem vorherigen Beispiel:

Bild

Die durch TF-IDF angereicherten Vektoren zeigen eine größere Vielfalt und bieten tiefere Einblicke in den Dokumenteninhalt.

Wort-Embeddings und Dokumenten-Embeddings

Wort-Embeddings ordnen einzelne Wörter dichten Vektoren in einem niedrigdimensionalen, kontinuierlichen Raum zu und erfassen semantische Ähnlichkeiten, die nicht direkt interpretierbar sind.

Dokumenten-Embeddings hingegen erzeugen dichte Vektoren, die ganze Dokumente repräsentieren und deren gesamthafte semantische Bedeutung erfassen.

Note
Hinweis

Die Dimensionalität (Größe) von Einbettungen wird in der Regel basierend auf den Projektanforderungen und den verfügbaren Rechenressourcen gewählt. Die richtige Wahl der Größe ist entscheidend, um ein Gleichgewicht zwischen der Erfassung reichhaltiger semantischer Informationen und der Modelleffizienz zu erreichen.

Hier ist ein Beispiel dafür, wie Wort-Einbettungen für die Wörter "cat", "kitten", "dog" und "house" aussehen könnten:

Bild

Obwohl die numerischen Werte in dieser Tabelle willkürlich sind, veranschaulichen sie, wie Einbettungen sinnvolle Beziehungen zwischen Wörtern darstellen können.

In realen Anwendungen werden solche Einbettungen durch das Trainieren eines Modells auf einem großen Textkorpus erlernt, wodurch das Modell subtile Muster und semantische Beziehungen innerhalb der natürlichen Sprache erkennen kann.

Note
Mehr erfahren

Eine weitere Entwicklung bei dichten Repräsentationen, kontextuelle Einbettungen (generiert von Modellen wie BERT und GPT), berücksichtigt den Kontext, in dem ein Wort erscheint, um dessen Vektor zu erzeugen. Das bedeutet, dass dasselbe Wort unterschiedliche Einbettungen haben kann, abhängig von seiner Verwendung in verschiedenen Sätzen, was ein nuanciertes Sprachverständnis ermöglicht.

question-icon

Ordne die Modelle nach ihrer Komplexität, vom einfachsten bis zum komplexesten.




Klicken oder ziehen Sie Elemente und füllen Sie die Lücken aus

War alles klar?

Wie können wir es verbessern?

Danke für Ihr Feedback!

Abschnitt 3. Kapitel 2

Fragen Sie AI

expand

Fragen Sie AI

ChatGPT

Fragen Sie alles oder probieren Sie eine der vorgeschlagenen Fragen, um unser Gespräch zu beginnen

Abschnitt 3. Kapitel 2
some-alt