Мультимодальность¶
Мультимодальность — это свойство системы, модели или технологии обрабатывать и объединять несколько мод входа или вывода одновременно: текст, изображение, звук, видео, графику, сенсорные сигналы. В информатике и искусственном интеллекте термин описывает модели, способные понимать и генерировать данные разных типов в рамках единой архитектуры, а не обрабатывать каждый тип отдельной специализированной системой.
¶Модальности
Модальностью называют тип сенсорного канала или формата данных, через который система получает или выдаёт информацию. Основные модальности, с которыми работают мультимодальные системы:
| Модальность | Примеры данных |
|---|---|
| Текст | естественный язык, код, разметка |
| Изображение | фотографии, скриншоты, схемы |
| Видео | последовательности кадров, аудиодорожка |
| Звук | речь, музыка, шум, ультразвук |
| Графика | векторные схемы, графики, диаграммы |
| Сенсорные данные | данные акселерометров, GPS, LiDAR |
| Числовые данные | таблицы, временные ряды |
Мультимодальность не сводится к простому набору независимых входов: ключевое свойство — возможность учитывать связи между модальностями, например, сопоставлять описание объекта с его изображением или синхронизировать речь с видео.
¶История
Идея объединения нескольких типов сигналов возникла раньше появления современных нейросетей. В 1960-х годах в кибернетике исследовались системы распознавания речи, использующие акустические и лингвистические модели одновременно. В 1980-е годы в компьютерном зрении появились работы по сопоставлению изображений и текстовых описаний.
Термин «мультимодальный» в контексте человеко-компьютерного взаимодействия закрепился в 1990-е годы, когда исследователи из MIT и других лабораторий начали изучать системы, сочетающие голосовой ввод, жесты и графический интерфейс. В 2015—2017 годах появились первые крупные датасеты для обучения мультимодальных моделей: COCO (2014) для пар «изображение — описание», VQA (2015) для визуальных вопросов, AudioSet (2017) для звуковых данных.
Переломным стал 2021 год, когда Google представил модель CLIP, обученную сопоставлять изображения и тексты в едином векторном пространстве. В 2023—2024 годах мультимодальные архитектуры стали массовыми: GPT-4V, Gemini, LLaVA, Qwen-VL и другие модели научились принимать на вход изображения и возвращать текстовые ответы.
¶Архитектуры и принципы работы
Современные мультимодальные модели строятся по нескольким схемам:
- Раннее слияние (early fusion) — данные разных модальностей объединяются до основного этапа обработки, например, конкатенацией признаков.
- Позднее слияние (late fusion) — каждая модальность обрабатывается отдельной подсетью, результаты объединяются на финальном уровне.
- Кросс-модальное внимание (cross-modal attention) — механизмы внимания позволяют модели сопоставлять элементы одной модальности с элементами другой, например, слова в подписи с областями изображения.
Большинство современных мультимодальных LLM используют трансформерную архитектуру с кросс-модальным вниманием. Изображения преобразуются в последовательности векторов (patch embeddings), звук — в спектрограммы или аудио-токены, после чего все модальности попадают в единую модель.
¶Применение
Мультимодальные системы используются в широком спектре задач:
- Визуальный вопрос-ответ — ответы на вопросы об изображениях.
- Автоматические подписи к изображениям — генерация текстовых описаний.
- Распознавание речи и перевод — обработка аудио с выводом текста на другом языке.
- Автономные транспортные системы — объединение данных камер, LiDAR и радаров.
- Медицинская диагностика — сопоставление снимков МРТ, КТ и врачебных заключений.
- Поиск по мультимодальным данным — поиск изображений по текстовому описанию и наоборот.
- Виртуальные ассистенты — системы, понимающие голос, изображения и текст одновременно.
¶Мультимодальность в России
Российские исследовательские группы и компании разрабатывают мультимодальные модели и инструменты. Среди известных российских проектов — мультимодальные версии языковых моделей, системы автоматического перевода с распознаванием речи, а также инструменты компьютерного зрения для промышленности и медицины. Развитие мультимодальности в России поддерживается в рамках программ цифровизации и развития искусственного интеллекта.
¶Ограничения
Несмотря на прогресс, у мультимодальных моделей остаются проблемы: галлюцинации (модель выдаёт несуществующие факты об изображении), сложность обработки длинных видео, высокая вычислительная стоимость обучения и инференса, а также трудности с оценкой качества ответов, требующих понимания нескольких модальностей сразу.
Источники:
- Goodfellow I., Bengio Y., Courville A. Deep Learning. MIT Press, 2016.
- Radford A. et al. Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML, 2021.
- Liu H. et al. Visual Instruction Tuning (LLaVA). NeurIPS, 2023.
- Vaswani A. et al. Attention Is All You Need. NeurIPS, 2017.
- Baltrušaitis T., Ahuja C., Morency L.-P. Multimodal Machine Learning: A Survey and Taxonomy. IEEE TPAMI, 2019.
