LAION-5B
LAION-5B — это открытый набор данных (датасет), состоящий из 5,85 миллиарда пар «изображение — текст», собранных из открытых источников в интернете. Набор был создан некоммерческой организацией Large-scale Artificial Intelligence Open Network (LAION) и опубликован в 2022 году. LAION-5B предназначен для обучения моделей машинного обучения, в первую очередь — систем, работающих по принципу «текст-в-изображение» (text-to-image), таких как Stable Diffusion, а также для других задач компьютерного зрения и обработки естественного языка. Датасет является одним из крупнейших и наиболее широко используемых открытых наборов данных для обучения генеративных нейросетей.
История создания
Проект LAION был основан в 2021 году группой исследователей и энтузиастов искусственного интеллекта, включая Кристофа Шуна (Christoph Schuhmann), Романа Боша (Romain Beaumont) и других. Первоначально организация выпустила датасет LAION-400M, содержащий 400 миллионов пар «изображение — текст». Успех этого набора данных, использованного для обучения модели Stable Diffusion, привёл к созданию более масштабного LAION-5B.
Работа над LAION-5B велась в 2021–2022 годах. Для сбора данных использовался краулер CommonCrawl, который индексирует содержимое веб-страниц. Из дампа CommonCrawl за 2021 год были извлечены URL-адреса изображений и соответствующие им текстовые подписи (alt-тексты, заголовки, описания). После фильтрации и дедупликации было отобрано около 5,85 миллиарда уникальных пар. Датасет был опубликован в открытом доступе в марте 2022 года.
Структура и состав
LAION-5B не содержит самих изображений, а представляет собой набор метаданных: URL-адреса изображений, текстовые подписи, а также вычисленные признаки, такие как эмбеддинги (векторные представления) изображений и текстов, полученные с помощью модели CLIP (Contrastive Language-Image Pre-training). Это позволяет пользователям загружать только необходимые изображения или работать с эмбеддингами без скачивания гигабайтов данных.
Ключевые характеристики
- Объём: 5,85 миллиарда пар (изображение — текст).
- Размер метаданных: около 500 ГБ в сжатом виде (файлы формата Parquet).
- Источник: дамп CommonCrawl за 2021 год.
- Формат: метаданные в виде таблиц, включающих URL, текст подписи, ширину и высоту изображения, оценку качества (NSFW-фильтр, оценка «красивости»), эмбеддинги CLIP.
- Языки: преимущественно английский, но присутствуют подписи на многих других языках, включая русский, китайский, испанский, французский и другие.
Фильтрация и безопасность
При создании LAION-5B применялись автоматические фильтры для удаления нежелательного контента:
- NSFW-фильтр: удаление изображений, содержащих наготу, порнографию, насилие и другой контент для взрослых. Фильтр работал на основе анализа текстовых подписей и эмбеддингов.
- Фильтр по «красивости» (aesthetic score): оценка эстетической привлекательности изображения на основе модели, обученной на человеческих оценках. Изображения с низкой оценкой (менее 5 по шкале от 1 до 10) отбрасывались, чтобы повысить качество визуального контента.
- Дедупликация: удаление дублирующихся пар (по URL и хешу изображения).
Несмотря на фильтрацию, в датасете остаётся значительное количество нежелательного контента, включая изображения, содержащие насилие, оскорбительные символы, а также изображения несовершеннолетних. В 2023 году в LAION-5B были обнаружены изображения сексуального насилия над детьми (CSAM), что вызвало широкий общественный резонанс и привело к временному удалению датасета из открытого доступа.
Применение
LAION-5B стал основой для обучения многих популярных моделей генерации изображений и мультимодальных систем:
- Stable Diffusion: модель, обученная на подмножестве LAION-5B (LAION-2B-en), стала одной из самых известных и широко используемых открытых моделей text-to-image.
- DALL-E 2 и Midjourney: хотя эти модели не используют LAION-5B напрямую, они обучались на аналогичных по масштабу наборах данных, что подчёркивает важность больших датасетов для генеративного ИИ.
- CLIP и другие мультимодальные модели: LAION-5B используется для обучения и дообучения моделей, которые связывают изображения и текст.
- Исследования: датасет применяется для изучения свойств больших языковых моделей, анализа визуальных данных, а также для разработки методов фильтрации и обеспечения безопасности.
Критика и этические проблемы
LAION-5B, как и другие крупные датасеты, собранные из интернета, подвергается критике по нескольким направлениям:
- Нарушение авторских прав: датасет содержит изображения, защищённые авторским правом, без разрешения правообладателей. Это привело к судебным искам против компаний, использующих LAION-5B для обучения коммерческих моделей (например, иск Getty Images против Stability AI).
- Нежелательный контент: несмотря на фильтрацию, в датасете присутствуют изображения насилия, порнографии, а также CSAM, что ставит под вопрос безопасность использования таких данных.
- Предвзятость и стереотипы: датасет отражает предвзятости, присутствующие в интернете, включая расовые, гендерные и культурные стереотипы. Модели, обученные на LAION-5B, могут воспроизводить и усиливать эти предвзятости.
- Конфиденциальность: в датасете могут присутствовать изображения людей, которые не давали согласия на их использование, что нарушает принципы конфиденциальности.
В ответ на критику, LAION в 2023 году объявила о временном удалении датасета из открытого доступа для проведения дополнительной фильтрации и аудита. В 2024 году была выпущена обновлённая версия LAION-5B с улучшенной фильтрацией, но полное удаление CSAM-контента не гарантировано.
Правовой статус в России
На момент написания статьи, LAION-5B не признан в Российской Федерации нежелательной организацией или экстремистским материалом. Однако использование датасета для обучения моделей, которые могут нарушать законодательство РФ (например, в части защиты авторских прав или распространения запрещённой информации), может быть ограничено.
См. также
- Stable Diffusion
- CLIP
- CommonCrawl
- Генеративный искусственный интеллект
Источники
- Schuhmann, C., et al. (2022). LAION-5B: An open large-scale dataset for training next generation image-text models. Advances in Neural Information Processing Systems.
- LAION. (2022). LAION-5B dataset. GitHub repository.
- Блог LAION. (2023). Statement on CSAM in LAION-5B.
- Getty Images vs. Stability AI. (2023). Судебный иск.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


