Prog Academy
RU UA
ШІ та машинне навчання

Що таке токен в AI та мовних моделях?

Токен — це мінімальний шматочок тексту, яким оперує мовна модель: слово, частина слова або розділовий знак. Модель не бачить літери та слова напряму — вона читає й генерує саме послідовність токенів.

Розбиття на токени виконує токенізатор. Коротке англійське слово зазвичай займає один токен, а довге чи рідкісне слово розбивається на кілька частин. Для української та російської мов токенів, як правило, потрібно більше, ніж для англійської того самого змісту.

Токени — це ще й одиниця тарифікації. Вартість звернення до API мовної моделі рахують за тисячу токенів, окремо за вхідні та вихідні. Тому довгі промпти й великі додані документи напряму впливають на ціну та швидкість відповіді.

Приклад

Орієнтир для оцінки: близько 1000 токенів — це приблизно 700–750 англійських слів або трохи більше за сторінку звичайного тексту.

Повʼязані терміни

LLM

LLM (Large Language Model, велика мовна модель) — це нейромережа, навчена на величезних обсягах тексту, яка прогнозує наступний фрагмент тексту. Саме на LLM працюють ChatGPT, Claude, Gemini та інші AI-асистенти.

Context Window

Контекстне вікно — це максимальний обсяг тексту в токенах, який мовна модель може тримати «перед очима» за один раз: системний промпт, історія діалогу, додані файли та її власна відповідь. Усе, що не вмістилося, для моделі просто не існує.

Prompt

Промпт — це текстовий запит, який ви надсилаєте мовній моделі: завдання, питання, інструкція разом з усіма даними, потрібними для відповіді. Промпт повністю визначає, що модель побачить і, відповідно, що вона відповість.

Embedding

Ембединг — це представлення тексту, зображення чи іншого обʼєкта у вигляді вектора чисел, у якому близькі за змістом обʼєкти опиняються поруч. Саме ембединги дозволяють компʼютеру порівнювати документи за змістом, а не за збігом слів.