Что такое токен в AI и языковых моделях?
Токен — это минимальный кусочек текста, которым оперирует языковая модель: слово, часть слова или знак препинания. Модель не видит буквы и слова напрямую — она читает и генерирует именно последовательность токенов.
Разбиение на токены выполняет токенизатор. Короткое английское слово обычно занимает один токен, а длинное или редкое слово разбивается на несколько частей. Для украинского и русского текста токенов, как правило, требуется больше, чем для английского того же смысла.
Токены — это ещё и единица тарификации. Стоимость обращения к API языковой модели считают за тысячу токенов, отдельно за входные и выходные. Поэтому длинные промпты и большие приложенные документы напрямую влияют на цену и скорость ответа.
Пример
Ориентир для оценки: около 1000 токенов — это примерно 700–750 английских слов или чуть больше страницы обычного текста.
Связанные термины
LLM (Large Language Model, большая языковая модель) — это нейросеть, обученная на огромных объёмах текста и предсказывающая следующий фрагмент текста. Именно на LLM работают ChatGPT, Claude, Gemini и другие AI-ассистенты.
Context WindowКонтекстное окно — это максимальный объём текста в токенах, который языковая модель может держать «перед глазами» за один раз: системный промпт, история диалога, приложенные файлы и её собственный ответ. Всё, что не поместилось, для модели просто не существует.
PromptПромпт — это текстовый запрос, который вы отправляете языковой модели: задание, вопрос, инструкция вместе со всеми данными, нужными для ответа. Промпт полностью определяет, что модель увидит и, соответственно, что она ответит.
EmbeddingЭмбеддинг — это представление текста, изображения или другого объекта в виде вектора чисел, в котором близкие по смыслу объекты оказываются близко друг к другу. Именно эмбеддинги позволяют компьютеру сравнивать документы по смыслу, а не по совпадению слов.