Открыть сервис

LAION-5B

LAION-5B — это открытый набор данных (датасет), состоящий из 5,85 миллиарда пар «изображение — текст», собранных из открытых источников в интернете. Набор был создан некоммерческой организацией Large-scale Artificial Intelligence Open Network (LAION) и опубликован в 2022 году. LAION-5B предназначен для обучения моделей машинного обучения, в первую очередь — систем, работающих по принципу «текст-в-изображение» (text-to-image), таких как Stable Diffusion, а также для других задач компьютерного зрения и обработки естественного языка. Датасет является одним из крупнейших и наиболее широко используемых открытых наборов данных для обучения генеративных нейросетей.

История создания

Проект LAION был основан в 2021 году группой исследователей и энтузиастов искусственного интеллекта, включая Кристофа Шуна (Christoph Schuhmann), Романа Боша (Romain Beaumont) и других. Первоначально организация выпустила датасет LAION-400M, содержащий 400 миллионов пар «изображение — текст». Успех этого набора данных, использованного для обучения модели Stable Diffusion, привёл к созданию более масштабного LAION-5B.

Работа над LAION-5B велась в 2021–2022 годах. Для сбора данных использовался краулер CommonCrawl, который индексирует содержимое веб-страниц. Из дампа CommonCrawl за 2021 год были извлечены URL-адреса изображений и соответствующие им текстовые подписи (alt-тексты, заголовки, описания). После фильтрации и дедупликации было отобрано около 5,85 миллиарда уникальных пар. Датасет был опубликован в открытом доступе в марте 2022 года.

Структура и состав

LAION-5B не содержит самих изображений, а представляет собой набор метаданных: URL-адреса изображений, текстовые подписи, а также вычисленные признаки, такие как эмбеддинги (векторные представления) изображений и текстов, полученные с помощью модели CLIP (Contrastive Language-Image Pre-training). Это позволяет пользователям загружать только необходимые изображения или работать с эмбеддингами без скачивания гигабайтов данных.

Ключевые характеристики

  • Объём: 5,85 миллиарда пар (изображение — текст).
  • Размер метаданных: около 500 ГБ в сжатом виде (файлы формата Parquet).
  • Источник: дамп CommonCrawl за 2021 год.
  • Формат: метаданные в виде таблиц, включающих URL, текст подписи, ширину и высоту изображения, оценку качества (NSFW-фильтр, оценка «красивости»), эмбеддинги CLIP.
  • Языки: преимущественно английский, но присутствуют подписи на многих других языках, включая русский, китайский, испанский, французский и другие.

Фильтрация и безопасность

При создании LAION-5B применялись автоматические фильтры для удаления нежелательного контента:

  • NSFW-фильтр: удаление изображений, содержащих наготу, порнографию, насилие и другой контент для взрослых. Фильтр работал на основе анализа текстовых подписей и эмбеддингов.
  • Фильтр по «красивости» (aesthetic score): оценка эстетической привлекательности изображения на основе модели, обученной на человеческих оценках. Изображения с низкой оценкой (менее 5 по шкале от 1 до 10) отбрасывались, чтобы повысить качество визуального контента.
  • Дедупликация: удаление дублирующихся пар (по URL и хешу изображения).

Несмотря на фильтрацию, в датасете остаётся значительное количество нежелательного контента, включая изображения, содержащие насилие, оскорбительные символы, а также изображения несовершеннолетних. В 2023 году в LAION-5B были обнаружены изображения сексуального насилия над детьми (CSAM), что вызвало широкий общественный резонанс и привело к временному удалению датасета из открытого доступа.

Применение

LAION-5B стал основой для обучения многих популярных моделей генерации изображений и мультимодальных систем:

  • Stable Diffusion: модель, обученная на подмножестве LAION-5B (LAION-2B-en), стала одной из самых известных и широко используемых открытых моделей text-to-image.
  • DALL-E 2 и Midjourney: хотя эти модели не используют LAION-5B напрямую, они обучались на аналогичных по масштабу наборах данных, что подчёркивает важность больших датасетов для генеративного ИИ.
  • CLIP и другие мультимодальные модели: LAION-5B используется для обучения и дообучения моделей, которые связывают изображения и текст.
  • Исследования: датасет применяется для изучения свойств больших языковых моделей, анализа визуальных данных, а также для разработки методов фильтрации и обеспечения безопасности.

Критика и этические проблемы

LAION-5B, как и другие крупные датасеты, собранные из интернета, подвергается критике по нескольким направлениям:

  • Нарушение авторских прав: датасет содержит изображения, защищённые авторским правом, без разрешения правообладателей. Это привело к судебным искам против компаний, использующих LAION-5B для обучения коммерческих моделей (например, иск Getty Images против Stability AI).
  • Нежелательный контент: несмотря на фильтрацию, в датасете присутствуют изображения насилия, порнографии, а также CSAM, что ставит под вопрос безопасность использования таких данных.
  • Предвзятость и стереотипы: датасет отражает предвзятости, присутствующие в интернете, включая расовые, гендерные и культурные стереотипы. Модели, обученные на LAION-5B, могут воспроизводить и усиливать эти предвзятости.
  • Конфиденциальность: в датасете могут присутствовать изображения людей, которые не давали согласия на их использование, что нарушает принципы конфиденциальности.

В ответ на критику, LAION в 2023 году объявила о временном удалении датасета из открытого доступа для проведения дополнительной фильтрации и аудита. В 2024 году была выпущена обновлённая версия LAION-5B с улучшенной фильтрацией, но полное удаление CSAM-контента не гарантировано.

Правовой статус в России

На момент написания статьи, LAION-5B не признан в Российской Федерации нежелательной организацией или экстремистским материалом. Однако использование датасета для обучения моделей, которые могут нарушать законодательство РФ (например, в части защиты авторских прав или распространения запрещённой информации), может быть ограничено.

См. также

Источники

  • Schuhmann, C., et al. (2022). LAION-5B: An open large-scale dataset for training next generation image-text models. Advances in Neural Information Processing Systems.
  • LAION. (2022). LAION-5B dataset. GitHub repository.
  • Блог LAION. (2023). Statement on CSAM in LAION-5B.
  • Getty Images vs. Stability AI. (2023). Судебный иск.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →