Что такое мультимодальный AI?
Мультимодальный AI — это модель, которая работает с несколькими типами данных одновременно: текстом, изображениями, аудио и видео. Ей можно отправить скриншот и вопрос о нём в одном запросе и получить связный ответ.
Раньше для каждого типа данных нужна была отдельная система: одна распознавала речь, вторая описывала картинку, третья писала текст. Мультимодальная модель переводит разные типы данных в общее внутреннее представление и рассуждает о них вместе.
На практике это открывает сценарии, недоступные текстовым моделям: разобрать фото документа, объяснить ошибку по скриншоту интерфейса, описать график из отчёта или подсказать, что не так в макете.
Связанные термины
LLM (Large Language Model, большая языковая модель) — это нейросеть, обученная на огромных объёмах текста и предсказывающая следующий фрагмент текста. Именно на LLM работают ChatGPT, Claude, Gemini и другие AI-ассистенты.
Generative AIГенеративный AI (GenAI) — это класс моделей искусственного интеллекта, которые создают новый контент: текст, изображения, аудио, видео или код. В отличие от классических моделей, которые выбирают ответ из готовых вариантов, генеративные модели порождают результат с нуля.
AIИскусственный интеллект (AI, ИИ) — это область компьютерных наук и набор технологий, которые позволяют программам решать задачи, обычно требующие человеческого мышления: распознавать образы, понимать текст, делать прогнозы и принимать решения.
Reasoning ModelРассуждающая модель — это языковая модель, которая перед ответом строит развёрнутую внутреннюю цепочку рассуждений: разбивает задачу на шаги, проверяет промежуточные выводы и только потом выдаёт результат.