Открыть сервисСервис

Мультимодальность

Мультимодальность — это свойство системы, модели или технологии обрабатывать и объединять несколько мод входа или вывода одновременно: текст, изображение, звук, видео, графику, сенсорные сигналы. В информатике и искусственном интеллекте термин описывает модели, способные понимать и генерировать данные разных типов в рамках единой архитектуры, а не обрабатывать каждый тип отдельной специализированной системой.

Модальностью называют тип сенсорного канала или формата данных, через который система получает или выдаёт информацию. Основные модальности, с которыми работают мультимодальные системы:

МодальностьПримеры данных
Текстестественный язык, код, разметка
Изображениефотографии, скриншоты, схемы
Видеопоследовательности кадров, аудиодорожка
Звукречь, музыка, шум, ультразвук
Графикавекторные схемы, графики, диаграммы
Сенсорные данныеданные акселерометров, GPS, LiDAR
Числовые данныетаблицы, временные ряды

Мультимодальность не сводится к простому набору независимых входов: ключевое свойство — возможность учитывать связи между модальностями, например, сопоставлять описание объекта с его изображением или синхронизировать речь с видео.

История

Идея объединения нескольких типов сигналов возникла раньше появления современных нейросетей. В 1960-х годах в кибернетике исследовались системы распознавания речи, использующие акустические и лингвистические модели одновременно. В 1980-е годы в компьютерном зрении появились работы по сопоставлению изображений и текстовых описаний.

Термин «мультимодальный» в контексте человеко-компьютерного взаимодействия закрепился в 1990-е годы, когда исследователи из MIT и других лабораторий начали изучать системы, сочетающие голосовой ввод, жесты и графический интерфейс. В 2015—2017 годах появились первые крупные датасеты для обучения мультимодальных моделей: COCO (2014) для пар «изображение — описание», VQA (2015) для визуальных вопросов, AudioSet (2017) для звуковых данных.

Переломным стал 2021 год, когда Google представил модель CLIP, обученную сопоставлять изображения и тексты в едином векторном пространстве. В 2023—2024 годах мультимодальные архитектуры стали массовыми: GPT-4V, Gemini, LLaVA, Qwen-VL и другие модели научились принимать на вход изображения и возвращать текстовые ответы.

Архитектуры и принципы работы

Современные мультимодальные модели строятся по нескольким схемам:

  • Раннее слияние (early fusion) — данные разных модальностей объединяются до основного этапа обработки, например, конкатенацией признаков.
  • Позднее слияние (late fusion) — каждая модальность обрабатывается отдельной подсетью, результаты объединяются на финальном уровне.
  • Кросс-модальное внимание (cross-modal attention) — механизмы внимания позволяют модели сопоставлять элементы одной модальности с элементами другой, например, слова в подписи с областями изображения.

Большинство современных мультимодальных LLM используют трансформерную архитектуру с кросс-модальным вниманием. Изображения преобразуются в последовательности векторов (patch embeddings), звук — в спектрограммы или аудио-токены, после чего все модальности попадают в единую модель.

Применение

Мультимодальные системы используются в широком спектре задач:

  • Визуальный вопрос-ответ — ответы на вопросы об изображениях.
  • Автоматические подписи к изображениям — генерация текстовых описаний.
  • Распознавание речи и перевод — обработка аудио с выводом текста на другом языке.
  • Автономные транспортные системы — объединение данных камер, LiDAR и радаров.
  • Медицинская диагностика — сопоставление снимков МРТ, КТ и врачебных заключений.
  • Поиск по мультимодальным данным — поиск изображений по текстовому описанию и наоборот.
  • Виртуальные ассистенты — системы, понимающие голос, изображения и текст одновременно.

Мультимодальность в России

Российские исследовательские группы и компании разрабатывают мультимодальные модели и инструменты. Среди известных российских проектов — мультимодальные версии языковых моделей, системы автоматического перевода с распознаванием речи, а также инструменты компьютерного зрения для промышленности и медицины. Развитие мультимодальности в России поддерживается в рамках программ цифровизации и развития искусственного интеллекта.

Ограничения

Несмотря на прогресс, у мультимодальных моделей остаются проблемы: галлюцинации (модель выдаёт несуществующие факты об изображении), сложность обработки длинных видео, высокая вычислительная стоимость обучения и инференса, а также трудности с оценкой качества ответов, требующих понимания нескольких модальностей сразу.

Источники:

  • Goodfellow I., Bengio Y., Courville A. Deep Learning. MIT Press, 2016.
  • Radford A. et al. Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML, 2021.
  • Liu H. et al. Visual Instruction Tuning (LLaVA). NeurIPS, 2023.
  • Vaswani A. et al. Attention Is All You Need. NeurIPS, 2017.
  • Baltrušaitis T., Ahuja C., Morency L.-P. Multimodal Machine Learning: A Survey and Taxonomy. IEEE TPAMI, 2019.
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru