Типи Моделей Векторного Простору
Свайпніть щоб показати меню
Векторні просторові моделі можна класифікувати за способом представлення тексту, від простих методів на основі частоти до більш складних, контекстно-залежних ембеддінгів. Кожен підхід має свої переваги та підходить для різних типів NLP-завдань.
Bag of Words
Bag of words (BoW) — це векторна модель простору, яка представляє документи у вигляді векторів, де кожен вимір відповідає унікальному слову. Модель може бути бінарною (відображає наявність слова) або на основі частоти (відображає кількість входжень слова).
Ось приклад BoW на основі частоти:
Як видно, кожен документ представлений у вигляді вектора, де кожен вимір відповідає частоті певного слова в цьому документі. У випадку бінарної моделі «мішок слів» кожен вектор міститиме лише 0 або 1 для кожного слова, що вказує на його відсутність або наявність відповідно.
Попередня обробка тексту — необхідний етап перед застосуванням BoW або подібних моделей.
TF-IDF
Модель TF-IDF (term frequency-inverse document frequency) розширює підхід «мішок слів» (BoW), коригуючи частоти слів залежно від їхньої появи у всіх документах. Вона підкреслює слова, які є унікальними для документа, надаючи більш специфічну інформацію про його зміст.
Це досягається шляхом поєднання частоти терміну (кількість разів, коли слово зустрічається в документі) з оберненою частотою документа (міра того, наскільки слово є поширеним або рідкісним у всьому наборі даних).
Нижче наведено результат застосування TF-IDF до документів із попереднього прикладу:
Отримані вектори, збагачені TF-IDF, демонструють більшу різноманітність, забезпечуючи глибше розуміння змісту документа.
Векторні представлення слів і документів
Векторні представлення слів відображають окремі слова у щільні вектори в просторах низької розмірності, фіксуючи семантичні подібності, які безпосередньо не інтерпретуються.
Векторні представлення документів, навпаки, створюють щільні вектори, що представляють цілі документи, відображаючи їх загальне семантичне значення.
Розмірність (розмір) векторних представлень зазвичай обирається відповідно до вимог проєкту та доступних обчислювальних ресурсів. Вибір правильної розмірності є важливим для досягнення балансу між збереженням багатої семантичної інформації та забезпеченням ефективності моделі.
Ось приклад того, як можуть виглядати векторні представлення слів "cat", "kitten", "dog" та "house":
Хоча числові значення в цій таблиці є довільними, вони ілюструють, як ембедінги можуть відображати змістовні зв'язки між словами.
У реальних застосуваннях такі ембедінги отримують шляхом навчання моделі на великому текстовому корпусі, що дозволяє їй знаходити тонкі закономірності та семантичні зв'язки в природній мові.
Подальший розвиток щільних представлень — контекстуальні ембедінги (згенеровані моделями на кшталт BERT і GPT), які враховують контекст появи слова для створення його вектора. Це означає, що одне й те саме слово може мати різні ембедінги залежно від його використання в різних реченнях, забезпечуючи більш тонке розуміння мови.
Дякуємо за ваш відгук!
Запитати АІ
Запитати АІ
Запитайте про що завгодно або спробуйте одне із запропонованих запитань, щоб почати наш чат