Prog Academy
RU UA
ШІ та машинне навчання

Що таке трансформер (Transformer) в AI?

Трансформер — це архітектура нейромережі, на якій побудовані всі сучасні мовні моделі. Її ключова ідея — механізм уваги (attention): обробляючи кожне слово, модель одночасно дивиться на всі інші слова тексту й вирішує, які з них важливі для розуміння.

До трансформерів текст обробляли послідовно, слово за словом, через що звʼязки між віддаленими частинами речення губилися, а навчання погано розпаралелювалося. Трансформер обробляє всю послідовність одразу — це і підвищило якість, і дозволило навчати моделі на справді великих обсягах даних.

Саме тому літера «T» у назві GPT означає Transformer. Архітектура виявилася універсальною: сьогодні на ній працюють не лише текстові моделі, а й системи для зображень, звуку та коду.

Повʼязані терміни

LLM

LLM (Large Language Model, велика мовна модель) — це нейромережа, навчена на величезних обсягах тексту, яка прогнозує наступний фрагмент тексту. Саме на LLM працюють ChatGPT, Claude, Gemini та інші AI-асистенти.

Neural Network

Нейромережа — це математична модель із шарів повʼязаних між собою «нейронів», кожен з яких множить вхідні числа на ваги й передає результат далі. Навчання нейромережі — це підбір мільйонів таких ваг, щоб вихід моделі збігався з правильною відповіддю.

Token

Токен — це мінімальний шматочок тексту, яким оперує мовна модель: слово, частина слова або розділовий знак. Модель не бачить літери та слова напряму — вона читає й генерує саме послідовність токенів.

Context Window

Контекстне вікно — це максимальний обсяг тексту в токенах, який мовна модель може тримати «перед очима» за один раз: системний промпт, історія діалогу, додані файли та її власна відповідь. Усе, що не вмістилося, для моделі просто не існує.

Embedding

Ембединг — це представлення тексту, зображення чи іншого обʼєкта у вигляді вектора чисел, у якому близькі за змістом обʼєкти опиняються поруч. Саме ембединги дозволяють компʼютеру порівнювати документи за змістом, а не за збігом слів.