Prog Academy
RU UA
ИИ и машинное обучение

Что такое токен в AI и языковых моделях?

Токен — это минимальный кусочек текста, которым оперирует языковая модель: слово, часть слова или знак препинания. Модель не видит буквы и слова напрямую — она читает и генерирует именно последовательность токенов.

Разбиение на токены выполняет токенизатор. Короткое английское слово обычно занимает один токен, а длинное или редкое слово разбивается на несколько частей. Для украинского и русского текста токенов, как правило, требуется больше, чем для английского того же смысла.

Токены — это ещё и единица тарификации. Стоимость обращения к API языковой модели считают за тысячу токенов, отдельно за входные и выходные. Поэтому длинные промпты и большие приложенные документы напрямую влияют на цену и скорость ответа.

Пример

Ориентир для оценки: около 1000 токенов — это примерно 700–750 английских слов или чуть больше страницы обычного текста.

Связанные термины

LLM

LLM (Large Language Model, большая языковая модель) — это нейросеть, обученная на огромных объёмах текста и предсказывающая следующий фрагмент текста. Именно на LLM работают ChatGPT, Claude, Gemini и другие AI-ассистенты.

Context Window

Контекстное окно — это максимальный объём текста в токенах, который языковая модель может держать «перед глазами» за один раз: системный промпт, история диалога, приложенные файлы и её собственный ответ. Всё, что не поместилось, для модели просто не существует.

Prompt

Промпт — это текстовый запрос, который вы отправляете языковой модели: задание, вопрос, инструкция вместе со всеми данными, нужными для ответа. Промпт полностью определяет, что модель увидит и, соответственно, что она ответит.

Embedding

Эмбеддинг — это представление текста, изображения или другого объекта в виде вектора чисел, в котором близкие по смыслу объекты оказываются близко друг к другу. Именно эмбеддинги позволяют компьютеру сравнивать документы по смыслу, а не по совпадению слов.