Як Насправді Працюють LLM
Свайпніть щоб показати меню
Ви вже спілкувалися з Claude. Тепер зазирнемо під капот — без жодної математики.
Крок 1: Текст перетворюється на числа
Комп'ютери не розуміють слова — вони працюють лише з числами. Тому перед початком обробки ваше повідомлення розбивається на частини, які називаються токенами, і кожен токен перетворюється на число.
Токен — це приблизно 4 символи англійського тексту. Це може бути ціле слово, частина слова або розділовий знак. Пробіли та регістр мають значення — вони впливають на токен.
Що насправді бачить Claude
Коли ви пишете:
Hello, marketing manager!
Claude отримує:
["Hello", ",", " marketing", " manager", "!"]
Що перетворюється на:
[9906, 11, 8661, 6783, 0]
П'ять токенів. П'ять чисел. Це вхідні дані.
Орієнтовно: 750 слів — це приблизно 1 000 токенів. Більше токенів означає вищу вартість і повільнішу відповідь.
Крок 2: Прогнозування наступного токена
Коли все перетворено на числа, модель виконує одну дію: прогнозує, що буде далі. Знову і знову.
Ви пишете:
The capital of France is
Модель визначає, який токен найімовірніше буде наступним:
- "Paris" — 92%;
- " Paris" — 5%;
- "Lyon" — 1%;
- "the" — 0,5%.
Вона обирає найбільш ймовірний варіант. Потім повторює процес. Поки не вирішить зупинитися.
Важливо: модель не обрала Paris, тому що знає відповідь. Вона обрала його, тому що у тренувальних даних ця фраза майже завжди продовжувалася словом "Paris".
AI = прогнозування шаблонів, а не знання.
Крок 3: Звідки беруться шаблони
Модель навчалася на текстах з публічного інтернету, книгах і коді — до певної дати відсічення.
Навчання означає коригування ймовірностей: які токени слідують за якими, і в якому контексті.
Два наслідки:
- Модель не має знань про останні події, дані вашої компанії чи будь-що після дати відсічення;
- Вона вивчила інтернет — разом із його помилками. Якщо частина тренувальних даних була неправильною, модель може впевнено повторювати ці помилки.
Чому AI "галюцинує"
Галюцинація — це коли модель генерує щось, що звучить впевнено й виглядає правдоподібно, але насправді є неправильним.
Поширені приклади: вигадані цитати, неіснуючі URL, некоректна статистика.
Це відбувається тому, що мета моделі — створити найбільш ймовірну послідовність токенів, а не найбільш правдиву. Якщо щось звучить переконливо, вона може згенерувати це, навіть якщо це неправда.
Вирішення проблеми
Рішення полягає не лише в тому, щоб зробити модель розумнішою. Йдеться про надання їй інструментів — веб-пошуку, реальних даних, документів — щоб вона могла спиратися на факти, а не лише на шаблони.
Саме це ви бачили в попередньому розділі і будете використовувати надалі.
Дякуємо за ваш відгук!
Запитати АІ
Запитати АІ
Запитайте про що завгодно або спробуйте одне із запропонованих запитань, щоб почати наш чат