Prog Academy
RU UA
ИИ и машинное обучение

Что такое мультимодальный AI?

Мультимодальный AI — это модель, которая работает с несколькими типами данных одновременно: текстом, изображениями, аудио и видео. Ей можно отправить скриншот и вопрос о нём в одном запросе и получить связный ответ.

Раньше для каждого типа данных нужна была отдельная система: одна распознавала речь, вторая описывала картинку, третья писала текст. Мультимодальная модель переводит разные типы данных в общее внутреннее представление и рассуждает о них вместе.

На практике это открывает сценарии, недоступные текстовым моделям: разобрать фото документа, объяснить ошибку по скриншоту интерфейса, описать график из отчёта или подсказать, что не так в макете.

Связанные термины

LLM

LLM (Large Language Model, большая языковая модель) — это нейросеть, обученная на огромных объёмах текста и предсказывающая следующий фрагмент текста. Именно на LLM работают ChatGPT, Claude, Gemini и другие AI-ассистенты.

Generative AI

Генеративный AI (GenAI) — это класс моделей искусственного интеллекта, которые создают новый контент: текст, изображения, аудио, видео или код. В отличие от классических моделей, которые выбирают ответ из готовых вариантов, генеративные модели порождают результат с нуля.

AI

Искусственный интеллект (AI, ИИ) — это область компьютерных наук и набор технологий, которые позволяют программам решать задачи, обычно требующие человеческого мышления: распознавать образы, понимать текст, делать прогнозы и принимать решения.

Reasoning Model

Рассуждающая модель — это языковая модель, которая перед ответом строит развёрнутую внутреннюю цепочку рассуждений: разбивает задачу на шаги, проверяет промежуточные выводы и только потом выдаёт результат.