Открыть сервисСервис

Мультимодальная модель

Мультимодальная — модель искусственного интеллекта, способная обрабатывать и генерировать данные нескольких модальностей одновременно: текст, изображения, аудио, видео и код. В отличие от одно модальных систем, работающих только с одним типом данных, мультимодальные модели строят общее представление о мире, объединяя сигналы из разных источников, что приближает их к человеческому восприятию.

История развития

Ранние системы ИИ были узкоспециализированными: распознавание речи, классификация изображений, машинный перевод существовали как отдельные задачи. Переломным стал 2021 год, когда OpenAI выпустила модель CLIP, обученную сопоставлять изображения и текстовые описания в общем векторном пространстве. В 2022–2023 годах появились генеративные мультимодальные системы: DALL-E 2, Stable Diffusion, а затем и GPT-4 (2023), способный принимать на вход и текст, и изображения.

В России разработкой мультимодальных моделей занимаются Сбер (семейство Kandinsky для генерации изображений, GigaChat), Яндекс (YandexGPT, YandexART), а также МФТИ и лаборатории при ведущих вузах. Государственная программа «Искусственный интеллект» предусматривает создание отечественных больших языковых и мультимодальных моделей.

Принцип работы

Архитектура мультимодальной модели обычно включает три компонента:

  1. Энкодеры модальностей — отдельные сети для каждого типа данных (текстовый трансформер, свёрточная сеть или ViT для изображений, аудиоэнкодер).
  2. Слой объединения (fuser) — механизм, сопоставляющий представления разных модальностей в общем пространстве. Часто используется механизм внимания (cross-attention).
  3. Декодер — генерирует ответ в требуемой модальности.

Ключевая идея — приводить разнородные данные к единому векторному представлению, где близкие по смыслу текст и изображение оказываются рядом. Обучение идёт на парных датасетах (описание — картинка, субтитры — видео) и через RLHF.

Классификация

ТипВходВыходПримеры
Понимающиетекст + изображениетекстGPT-4V, GigaChat Vision
ГенеративныетекстизображениеKandinsky, DALL-E, YandexART
Речевыеаудио + текстаудио/текстWhisper, голосовые ассистенты
Видеомоделивидео + тексттекст/видеоGemini, Sora

Применение

Ограничения

Мультимодальные модели подвержены «галлюцинациям» — генерации правдоподобных, но ложных утверждений, в том числе о содержании изображений. Точность сильно зависит от качества обучающих пар. Вычислительная стоимость обучения на порядок выше, чем у текстовых моделей. Существуют этические вопросы: обучение на изображениях без согласия авторов, генерация дипфейков.

Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru