Notice: This page requires JavaScript to function properly.
Please enable JavaScript in your browser settings or update your browser.
Apprendre Principes de Base des Word Embeddings | Représentations Vectorielles de Mots
Introduction au TALN avec Python

Principes de Base des Word Embeddings

Glissez pour afficher le menu

Comprendre les word embeddings

Les méthodes traditionnelles de représentation du texte, telles que le sac de mots et le TF-IDF, présentent des limitations notables. Elles traitent les mots isolément, ignorant les relations sémantiques, et produisent des vecteurs de grande dimension, clairsemés, qui deviennent inefficaces sur le plan computationnel avec de grands corpus.

Inconvénients

Les word embeddings répondent à ces problèmes en tenant compte du contexte dans lequel les mots apparaissent, offrant une compréhension plus nuancée du langage.

Note
Définition

Les word embeddings sont des représentations vectorielles denses des mots dans un espace vectoriel continu, où les mots sémantiquement similaires sont placés à des points proches.

Plusieurs modèles et techniques ont été développés pour générer des word embeddings pertinents :

  • Word2Vec : développé par Google, Word2Vec représente les mots sous forme de vecteurs denses en utilisant deux architectures : continuous bag of words (CBoW), qui prédit un mot à partir de son contexte, et Skip-gram, qui prédit les mots du contexte à partir d'un mot donné ;

  • GloVe : créé à Stanford, GloVe (global vectors) génère des word embeddings en analysant les statistiques globales de cooccurrence des mots sur l'ensemble du corpus, capturant les relations sémantiques en fonction de la fréquence d'apparition des paires de mots ;

  • FastText : introduit par Facebook AI Research, FastText s'appuie sur Word2Vec en représentant les mots comme une collection de n-grammes de caractères. Cela lui permet de modéliser l'information sous-mot, améliorant sa capacité à gérer les mots rares, hors vocabulaire, ainsi que les langues morphologiquement riches.

Modèles

Word2Vec et FastText sont les modèles les plus couramment utilisés pour générer des embeddings de mots. Cependant, puisque FastText n'est qu'une version améliorée de Word2Vec, nous allons l'ignorer et nous concentrer uniquement sur Word2Vec.

Comment fonctionne Word2Vec ?

Word2Vec transforme les mots en vecteurs à l'aide d'un processus qui commence par le one-hot encoding, où chaque mot d'un vocabulaire est représenté par un vecteur unique marqué par un seul 1 parmi des zéros. Examinons un exemple :

One-hot encoding

Ce vecteur sert d'entrée à un réseau de neurones, conçu pour « apprendre » les embeddings de mots. L'architecture du réseau peut suivre l'un des deux modèles :

  • CBoW (continuous bag of words) : prédit un mot cible à partir du contexte fourni par les mots environnants ;
  • Skip-gram : prédit les mots du contexte environnant à partir du mot cible.

Dans les deux architectures Word2Vec, à chaque itération d'entraînement, le modèle reçoit un mot cible et les mots qui l'entourent comme contexte, représentés sous forme de vecteurs one-hot encodés. L'ensemble d'entraînement est donc effectivement composé de ces paires ou groupes, où chaque mot cible est associé à ses mots de contexte environnants.

Chaque mot du vocabulaire prend tour à tour la place du mot cible, le modèle parcourant le texte à l'aide d'une fenêtre de contexte glissante. Cette technique se déplace systématiquement sur chaque mot, garantissant un apprentissage exhaustif à partir de tous les contextes possibles dans le corpus.

Note
Définition

Une fenêtre de contexte est un nombre fixe de mots entourant un mot cible que le modèle utilise pour apprendre son contexte. Elle définit combien de mots avant et après le mot cible sont pris en compte lors de l'entraînement.

Prenons un exemple avec une taille de fenêtre égale à 2 pour clarifier les choses :

Fenêtre glissante

Une taille de fenêtre de contexte de 2 signifie que le modèle inclura jusqu'à 2 mots à gauche et à droite du mot cible, tant que ces mots sont disponibles dans les limites du texte. Comme vous pouvez le voir, s'il y a moins de 2 mots de chaque côté, le modèle inclura autant de mots que possible.

question mark

Que signifie une fenêtre de contexte de taille 5 ?

Sélectionnez la réponse correcte

Tout était clair ?

Comment pouvons-nous l'améliorer ?

Merci pour vos commentaires !

Section 4. Chapitre 1

Demandez à l'IA

expand

Demandez à l'IA

ChatGPT

Posez n'importe quelle question ou essayez l'une des questions suggérées pour commencer notre discussion

Principes de Base des Word Embeddings

Comprendre les word embeddings

Les méthodes traditionnelles de représentation du texte, telles que le sac de mots et le TF-IDF, présentent des limitations notables. Elles traitent les mots isolément, ignorant les relations sémantiques, et produisent des vecteurs de grande dimension, clairsemés, qui deviennent inefficaces sur le plan computationnel avec de grands corpus.

Inconvénients

Les word embeddings répondent à ces problèmes en tenant compte du contexte dans lequel les mots apparaissent, offrant une compréhension plus nuancée du langage.

Note
Définition

Les word embeddings sont des représentations vectorielles denses des mots dans un espace vectoriel continu, où les mots sémantiquement similaires sont placés à des points proches.

Plusieurs modèles et techniques ont été développés pour générer des word embeddings pertinents :

  • Word2Vec : développé par Google, Word2Vec représente les mots sous forme de vecteurs denses en utilisant deux architectures : continuous bag of words (CBoW), qui prédit un mot à partir de son contexte, et Skip-gram, qui prédit les mots du contexte à partir d'un mot donné ;

  • GloVe : créé à Stanford, GloVe (global vectors) génère des word embeddings en analysant les statistiques globales de cooccurrence des mots sur l'ensemble du corpus, capturant les relations sémantiques en fonction de la fréquence d'apparition des paires de mots ;

  • FastText : introduit par Facebook AI Research, FastText s'appuie sur Word2Vec en représentant les mots comme une collection de n-grammes de caractères. Cela lui permet de modéliser l'information sous-mot, améliorant sa capacité à gérer les mots rares, hors vocabulaire, ainsi que les langues morphologiquement riches.

Modèles

Word2Vec et FastText sont les modèles les plus couramment utilisés pour générer des embeddings de mots. Cependant, puisque FastText n'est qu'une version améliorée de Word2Vec, nous allons l'ignorer et nous concentrer uniquement sur Word2Vec.

Comment fonctionne Word2Vec ?

Word2Vec transforme les mots en vecteurs à l'aide d'un processus qui commence par le one-hot encoding, où chaque mot d'un vocabulaire est représenté par un vecteur unique marqué par un seul 1 parmi des zéros. Examinons un exemple :

One-hot encoding

Ce vecteur sert d'entrée à un réseau de neurones, conçu pour « apprendre » les embeddings de mots. L'architecture du réseau peut suivre l'un des deux modèles :

  • CBoW (continuous bag of words) : prédit un mot cible à partir du contexte fourni par les mots environnants ;
  • Skip-gram : prédit les mots du contexte environnant à partir du mot cible.

Dans les deux architectures Word2Vec, à chaque itération d'entraînement, le modèle reçoit un mot cible et les mots qui l'entourent comme contexte, représentés sous forme de vecteurs one-hot encodés. L'ensemble d'entraînement est donc effectivement composé de ces paires ou groupes, où chaque mot cible est associé à ses mots de contexte environnants.

Chaque mot du vocabulaire prend tour à tour la place du mot cible, le modèle parcourant le texte à l'aide d'une fenêtre de contexte glissante. Cette technique se déplace systématiquement sur chaque mot, garantissant un apprentissage exhaustif à partir de tous les contextes possibles dans le corpus.

Note
Définition

Une fenêtre de contexte est un nombre fixe de mots entourant un mot cible que le modèle utilise pour apprendre son contexte. Elle définit combien de mots avant et après le mot cible sont pris en compte lors de l'entraînement.

Prenons un exemple avec une taille de fenêtre égale à 2 pour clarifier les choses :

Fenêtre glissante

Une taille de fenêtre de contexte de 2 signifie que le modèle inclura jusqu'à 2 mots à gauche et à droite du mot cible, tant que ces mots sont disponibles dans les limites du texte. Comme vous pouvez le voir, s'il y a moins de 2 mots de chaque côté, le modèle inclura autant de mots que possible.

Tout était clair ?

Comment pouvons-nous l'améliorer ?

Merci pour vos commentaires !

Section 4. Chapitre 1
some-alt