Открыть сервис

WebImageText

WebImageText (WIT) — это крупномасштабный мультимодальный набор данных, созданный компанией Google Research, содержащий пары «изображение — текст» (подписи), извлечённые из веб-страниц. WIT используется для обучения и оценки моделей искусственного интеллекта, способных понимать взаимосвязь между визуальной и текстовой информацией, в частности, для задач визуально-языкового понимания, таких как генерация подписей к изображениям, визуальный вопрос-ответ и поиск изображений по текстовому запросу.

История и создание

Набор данных WIT был впервые представлен в 2021 году в исследовательской статье «WIT: Wikipedia-based Image Text Dataset for Multimodal Machine Learning» (WIT: набор данных изображений и текстов на основе Википедии для мультимодального машинного обучения), опубликованной сотрудниками Google Research. Основной целью создания WIT было преодоление ограничений существовавших на тот момент мультимодальных датасетов, таких как MS COCO (Common Objects in Context) и Flickr30k, которые содержали относительно небольшое количество пар «изображение — текст» и были ограничены узким кругом сюжетов (например, только фотографии повседневных сцен).

В отличие от них, WIT был построен на основе контента Википедии — крупнейшей в мире онлайн-энциклопедии. Разработчики извлекли из статей Википедии не только основные подписи к изображениям (alt-тексты, заголовки), но и окружающий текст, включая заголовки разделов, абзацы, в которых упоминается изображение, и метаданные. Это позволило получить не просто короткие описания, а контекстуально богатые текстовые фрагменты, связанные с каждым изображением. В результате WIT стал одним из крупнейших открытых мультимодальных наборов данных на момент публикации.

Характеристики и объём

WIT отличается от других датасетов по нескольким ключевым параметрам:

  • Объём: Набор данных содержит более 37,5 миллионов пар «изображение — текст», полученных из более чем 11,5 миллионов уникальных изображений. Это значительно превосходит по размеру большинство существовавших ранее датасетов.
  • Многоязычность: WIT охватывает 108 языков, что делает его уникальным ресурсом для мультиязычных исследований в области мультимодального обучения. В частности, значительная часть данных представлена на английском, немецком, французском, русском и других языках.
  • Разнообразие контекстов: В отличие от датасетов, где подпись к изображению является единственным текстовым описанием, WIT предоставляет несколько типов текстов для каждого изображения: alt-текст (атрибут alt в HTML), заголовок изображения (caption), заголовок раздела статьи, в котором оно находится, и окружающий абзац. Это позволяет моделям учиться различать разные уровни детализации описания.
  • Источник данных: Все данные взяты из статей Википедии, что обеспечивает высокое качество, структурированность и релевантность информации, хотя и накладывает ограничения, связанные с тематикой энциклопедии (преобладание исторических, научных, культурных и биографических тем).

Структура и формат

WIT предоставляется в виде набора файлов в формате JSON (JavaScript Object Notation) и TFRecord (TensorFlow Record). Каждая запись в наборе данных содержит следующие основные поля:

  • image_url: URL-адрес изображения.
  • caption_reference_description: Основная подпись к изображению (обычно из атрибута alt или title).
  • caption_attribution_description: Подпись, указанная в атрибуте figcaption или caption в HTML.
  • caption_title_and_reference_description: Комбинация заголовка изображения и его описания.
  • context_page_description: Текст абзаца, в котором упоминается изображение.
  • context_section_description: Заголовок раздела, в котором находится изображение.
  • language: Код языка (например, en, ru, de).
  • page_title: Заголовок статьи Википедии.
  • page_url: URL-адрес статьи.
  • original_height и original_width: Размеры изображения.

Применение

WIT широко используется в исследованиях и разработках в области компьютерного зрения и обработки естественного языка. Основные области применения включают:

  • Обучение мультимодальных моделей: WIT послужил основой для обучения многих современных моделей, таких как CLIP (Contrastive Language-Image Pre-training) от OpenAI (организация признана нежелательной в РФ) и ALIGN (A Large-scale ImaGe and Noisy-text embedding) от Google. Эти модели способны выравнивать векторные представления изображений и текстов в едином пространстве, что позволяет выполнять поиск по сходству, классификацию и генерацию.
  • Генерация подписей к изображениям: Модели, обученные на WIT, могут генерировать текстовые описания для новых изображений, учитывая контекст, в котором изображение может быть использовано.
  • Визуальный вопрос-ответ (VQA): WIT позволяет обучать модели, которые отвечают на вопросы о содержании изображения, используя как визуальную, так и текстовую информацию.
  • Поиск изображений по текстовому запросу: Системы, обученные на WIT, могут находить изображения, соответствующие сложным текстовым описаниям, даже если эти описания не являются точными подписями к изображениям.
  • Мультиязычные исследования: WIT является ключевым ресурсом для изучения того, как модели могут переносить знания между языками в мультимодальных задачах.

Критика и ограничения

Несмотря на свои преимущества, WIT имеет ряд ограничений:

  • Шум в данных: Поскольку тексты извлекаются из веб-страниц, они могут содержать нерелевантные, неточные или грамматически некорректные подписи. Alt-текст, например, часто опускается или заполняется автоматически, что снижает качество обучения.
  • Тематический перекос: WIT основан на Википедии, поэтому в нём преобладают темы, характерные для энциклопедии: исторические события, биографии, научные концепции, география. Изображения повседневных сцен, бытовых предметов или абстрактных понятий представлены в меньшей степени.
  • Отсутствие точных аннотаций: В отличие от датасетов, где каждое изображение размечено по категориям (например, «кошка», «собака») или имеет точные ограничивающие рамки (bounding boxes), WIT предоставляет только текстовые описания, что может быть недостаточно для некоторых задач, таких как обнаружение объектов.
  • Проблемы с авторскими правами: Хотя WIT использует контент из Википедии, которая распространяется по лицензии Creative Commons, некоторые изображения могут иметь собственные лицензии, что ограничивает их коммерческое использование.

Источники

  1. Srinivasan, K., Raman, K., Chen, J., Bendersky, M., & Najork, M. (2021). WIT: Wikipedia-based Image Text Dataset for Multimodal Machine Learning. arXiv preprint arXiv:2103.01913.
  2. Официальный репозиторий WIT на GitHub (Google Research).
  3. Документация TensorFlow Datasets (раздел WIT).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →