Открыть сервис

YouTube-8M

YouTube-8M — это крупномасштабный набор данных (датасет) для задач машинного обучения, в частности, для классификации и распознавания видео, опубликованный компанией Google в 2016 году. Название расшифровывается как «YouTube-8 Million» (8 миллионов), что указывает на количество видеороликов, входящих в его состав. Датасет предназначен для обучения и оценки моделей, способных анализировать видеоконтент на уровне семантических меток (тегов), без необходимости обработки полного видеоряда в реальном времени.

История создания

В середине 2010-х годов развитие методов глубокого обучения (глубинных нейронных сетей) привело к значительному прогрессу в области компьютерного зрения и обработки естественного языка. Однако для задач анализа видео существовала проблема нехватки больших, размеченных и разнообразных наборов данных. Существовавшие датасеты, такие как UCF-101 (13 000 видео, 101 класс) или ActivityNet (около 20 000 видео, 200 классов), были относительно небольшими и охватывали ограниченный набор действий или сцен.

В 2016 году исследователи из Google Research (организация признана иноагентом в РФ) представили YouTube-8M как ответ на эту проблему. Целью проекта было создание ресурса, который бы позволил исследователям разрабатывать и тестировать алгоритмы, способные обрабатывать видео в масштабах, сопоставимых с реальными видеоплатформами. Датасет был впервые анонсирован в сентябре 2016 года на конференции ECCV (European Conference on Computer Vision). В 2017 году была выпущена вторая версия — YouTube-8M Segments, которая включала временные сегменты с более точной разметкой.

Структура и состав

Объём и источники

YouTube-8M содержит 8 миллионов видеороликов, отобранных из общего массива видео на платформе YouTube (принадлежит компании Google, которая признана иноагентом в РФ). Общая длительность видео составляет более 500 000 часов. Каждое видео имеет длину от 120 до 500 секунд и снабжено метками (тегами), которые были автоматически извлечены из метаданных, названий, описаний и комментариев, а затем проверены и отфильтрованы.

Классы (метки)

Датасет охватывает 4800 классов (категорий), которые организованы в иерархическую структуру. Классы включают широкий спектр тем: от конкретных объектов («автомобиль», «кошка») и действий («игра на гитаре», «бег») до абстрактных понятий («мультфильм», «новости»). Каждое видео может быть отнесено к нескольким классам одновременно (мульти-лейбл классификация). Наиболее распространённые классы включают «музыка», «спорт», «игры», «еда», «животные».

Предобработка и признаки

Вместо предоставления сырых видеоданных (файлов .mp4), YouTube-8M содержит предварительно извлечённые признаки (features) из видео и аудио. Это сделано для уменьшения размера датасета и ускорения обучения моделей. Признаки извлекаются с помощью предобученных нейронных сетей:

  • Визуальные признаки: Каждое видео разбивается на кадры (1 кадр в секунду). Для каждого кадра вычисляется вектор признаков размерностью 1024 с помощью сети Inception-v3 (натренированной на ImageNet). Затем эти векторы усредняются или агрегируются по времени.
  • Аудиопризнаки: Из аудиодорожки извлекаются признаки с помощью модели VGGish (на основе VGG-подобной архитектуры), также размерностью 128. Они обрабатываются аналогично.

Итоговый набор данных представляет собой набор файлов в формате TFRecord (TensorFlow Record), где для каждого видео хранится список идентификаторов классов и соответствующие векторы признаков.

YouTube-8M Segments (2017)

Вторая версия датасета, YouTube-8M Segments, была создана для задач временной локализации (поиска момента в видео, когда происходит определённое событие). Она включает 237 000 сегментов (отрезков) из 1000 видео, каждый из которых размечен одним из 1000 классов. Сегменты имеют длительность от 5 до 60 секунд и снабжены точными временными метками начала и конца.

Применение в машинном обучении

YouTube-8M стал стандартным бенчмарком (эталонным тестом) для нескольких задач в области компьютерного зрения и анализа видео:

Классификация видео

Основная задача — по набору признаков видео определить, к каким из 4800 классов оно относится. Это задача мульти-лейбл классификации, где модель должна предсказать набор меток для каждого видео. Архитектуры, которые хорошо работают с YouTube-8M, часто используют агрегацию признаков по времени, например, с помощью LSTM (Long Short-Term Memory), CNN (свёрточных нейронных сетей) или методов, основанных на внимании (attention mechanisms).

Временная локализация (Segments)

С использованием YouTube-8M Segments решается задача поиска и локализации действий или событий в видео. Модель должна не только определить, что происходит, но и указать, в какой момент времени это происходит.

Мультимодальное обучение

Датасет позволяет исследовать комбинирование визуальной и аудиоинформации. Модели могут учиться использовать оба модальности для повышения точности классификации, особенно в случаях, когда один из каналов (например, видео) зашумлён или неинформативен.

Соревнования и конкурсы

Google организовала несколько соревнований на платформе Kaggle, посвящённых YouTube-8M:

  • YouTube-8M Video Understanding Challenge (2016–2017): Участники соревновались в точности классификации видео. Победители использовали ансамбли моделей, включая LSTM и методы усреднения признаков.
  • YouTube-8M Segments Challenge (2018): Задача временной локализации. Лучшие решения применяли трёхмерные свёртки (3D-CNN) и механизмы внимания.

Эти соревнования способствовали разработке новых архитектур, таких как NetVLAD, Mixture of Experts (MoE) и других методов агрегации признаков.

Критика и ограничения

Несмотря на масштаб, YouTube-8M имеет ряд недостатков, которые отмечаются исследователями:

  1. Автоматическая разметка: Метки получены автоматически из метаданных, что приводит к шуму и неточностям. Например, видео с тегом «кошка» может содержать только изображение кошки на заднем плане, а не быть посвящённым ей. Это снижает качество обучения.
  2. Предобработка признаков: Использование предварительно извлечённых признаков (Inception-v3, VGGish) ограничивает возможности моделей, так как они не могут обучаться на сырых пикселях и звуковых волнах. Это делает датасет менее пригодным для задач, где важна тонкая пространственная или временная структура.
  3. Неравномерность классов: Распределение классов сильно несбалансировано. Некоторые классы (например, «музыка») представлены миллионами видео, в то время как другие — лишь несколькими сотнями. Это затрудняет обучение моделей для редких категорий.
  4. Отсутствие временной разметки в основной версии: Основной датасет не содержит информации о том, в какой момент видео происходит событие, соответствующее метке. Это ограничивает его применение для задач, требующих временной точности.
  5. Зависимость от платформы: Видео отобраны из YouTube, что накладывает ограничения, связанные с культурными, языковыми и тематическими предпочтениями пользователей этой платформы. Датасет может быть нерепрезентативен для других видеоисточников.

Значение и влияние

YouTube-8M стал важным этапом в развитии анализа видео. Он предоставил сообществу исследователей ресурс, достаточный для обучения глубоких нейронных сетей, которые ранее были недоступны из-за нехватки данных. Датасет стимулировал разработку методов эффективного представления видео (video embeddings), агрегации признаков и мультимодального обучения. Многие архитектуры, созданные для работы с YouTube-8M, впоследствии были адаптированы для других задач, таких как поиск видео по содержанию, автоматическое аннотирование и анализ видеотрансляций.

Источники

  • Abu-El-Haija, S., Kothari, N., Lee, J., Natsev, P., Toderici, G., Varadarajan, B., & Vijayanarasimhan, S. (2016). YouTube-8M: A Large-Scale Video Classification Benchmark. arXiv:1609.08675.
  • Lee, J., Natsev, P., & Abu-El-Haija, S. (2017). YouTube-8M Segments: A Large-Scale Video Dataset for Temporal Localization. arXiv:1706.00979.
  • Документация и описание датасета на официальном сайте проекта (research.google.com/youtube8m).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →