Що таке трансформер (Transformer) в AI?
Трансформер — це архітектура нейромережі, на якій побудовані всі сучасні мовні моделі. Її ключова ідея — механізм уваги (attention): обробляючи кожне слово, модель одночасно дивиться на всі інші слова тексту й вирішує, які з них важливі для розуміння.
До трансформерів текст обробляли послідовно, слово за словом, через що звʼязки між віддаленими частинами речення губилися, а навчання погано розпаралелювалося. Трансформер обробляє всю послідовність одразу — це і підвищило якість, і дозволило навчати моделі на справді великих обсягах даних.
Саме тому літера «T» у назві GPT означає Transformer. Архітектура виявилася універсальною: сьогодні на ній працюють не лише текстові моделі, а й системи для зображень, звуку та коду.
Повʼязані терміни
LLM (Large Language Model, велика мовна модель) — це нейромережа, навчена на величезних обсягах тексту, яка прогнозує наступний фрагмент тексту. Саме на LLM працюють ChatGPT, Claude, Gemini та інші AI-асистенти.
Neural NetworkНейромережа — це математична модель із шарів повʼязаних між собою «нейронів», кожен з яких множить вхідні числа на ваги й передає результат далі. Навчання нейромережі — це підбір мільйонів таких ваг, щоб вихід моделі збігався з правильною відповіддю.
TokenТокен — це мінімальний шматочок тексту, яким оперує мовна модель: слово, частина слова або розділовий знак. Модель не бачить літери та слова напряму — вона читає й генерує саме послідовність токенів.
Context WindowКонтекстне вікно — це максимальний обсяг тексту в токенах, який мовна модель може тримати «перед очима» за один раз: системний промпт, історія діалогу, додані файли та її власна відповідь. Усе, що не вмістилося, для моделі просто не існує.
EmbeddingЕмбединг — це представлення тексту, зображення чи іншого обʼєкта у вигляді вектора чисел, у якому близькі за змістом обʼєкти опиняються поруч. Саме ембединги дозволяють компʼютеру порівнювати документи за змістом, а не за збігом слів.