Prog Academy
RU UA
ИИ и машинное обучение

Что такое трансформер (Transformer) в AI?

Трансформер — это архитектура нейросети, на которой построены все современные языковые модели. Её ключевая идея — механизм внимания (attention): обрабатывая каждое слово, модель одновременно смотрит на все остальные слова текста и решает, какие из них важны для понимания.

До трансформеров текст обрабатывали последовательно, слово за словом, из-за чего связи между далёкими частями предложения терялись, а обучение плохо распараллеливалось. Трансформер обрабатывает всю последовательность сразу — это и повысило качество, и позволило обучать модели на действительно больших объёмах данных.

Именно поэтому буква «T» в названии GPT означает Transformer. Архитектура оказалась универсальной: сегодня на ней работают не только текстовые модели, но и системы для изображений, звука и кода.

Связанные термины

LLM

LLM (Large Language Model, большая языковая модель) — это нейросеть, обученная на огромных объёмах текста и предсказывающая следующий фрагмент текста. Именно на LLM работают ChatGPT, Claude, Gemini и другие AI-ассистенты.

Neural Network

Нейросеть — это математическая модель из слоёв связанных между собой «нейронов», каждый из которых умножает входные числа на веса и передаёт результат дальше. Обучение нейросети — это подбор миллионов таких весов, чтобы выход модели совпадал с правильным ответом.

Token

Токен — это минимальный кусочек текста, которым оперирует языковая модель: слово, часть слова или знак препинания. Модель не видит буквы и слова напрямую — она читает и генерирует именно последовательность токенов.

Context Window

Контекстное окно — это максимальный объём текста в токенах, который языковая модель может держать «перед глазами» за один раз: системный промпт, история диалога, приложенные файлы и её собственный ответ. Всё, что не поместилось, для модели просто не существует.

Embedding

Эмбеддинг — это представление текста, изображения или другого объекта в виде вектора чисел, в котором близкие по смыслу объекты оказываются близко друг к другу. Именно эмбеддинги позволяют компьютеру сравнивать документы по смыслу, а не по совпадению слов.