Открыть сервисСервис

Датасет — набор данных для обучения и тестирования моделей

Датасет (от англ. dataset, «набор данных») — структурированная коллекция данных, используемая для обучения, валидации и тестирования алгоритмов машинного обучения, а также для статистического анализа и научных исследований. Датасеты представляют собой упорядоченные наборы наблюдений, каждое из которых описывается набором признаков (фичей) и, как правило, целевой переменной (меткой). Ключевые характеристики датасета — объём, качество, разнообразие, формат хранения и лицензия использования.

Структура и форматы

Типичный датасет состоит из строк (наблюдений, примеров) и столбцов (признаков). Каждая строка описывает один объект: изображение, текст, звукозапись, строку таблицы или вектор измерений. Столбцы фиксируют атрибуты объекта и целевую метку.

Основные форматы хранения:

ФорматТипичное применение
CSV, TSVтабличные данные, классические задачи
JSON, JSONLвеб-данные, структурированные записи
Parquet, Avroбольшие массивы, аналитика в Hadoop/Spark
TFRecord, WebDatasetпакетная загрузка в нейросетевые фреймворки
HDF5, NumPy (.npy)научные массивы, тензоры
COCO, VOC, YOLO-форматыаннотированные изображения
LibriSpeech-форматраспознавание речи

Классификация датасетов

По назначению:

  • Обучающие (training) — формируют параметры модели.
  • Валидационные (validation) — подбирают гиперпараметры и предотвращают переобучение.
  • Тестовые (test) — оценивают итоговое качество модели на данных, не участвовавших в обучении.

По типу задач:

  • Для классификации — изображения с метками классов (ImageNet, CIFAR-10).
  • Для регрессии — числовые целевые переменные (Boston Housing).
  • Для сегментации — пиксельные маски (Cityscapes).
  • Для распознавания речи — аудио с транскрипциями (LibriSpeech).
  • Для обработки естественного языка — тексты с разметкой (SQuAD, Russian SuperGLUE).
  • Для генеративных моделей — большие корпуса текста и изображений (LAION, Common Crawl).

По доступу:

  • Открытые — публично доступные (MNIST, ImageNet, Wikipedia-дампы).
  • Внутренние (проприетарные) — доступны только владельцу (данные банков, медицинских учреждений).
  • Синтетические — сгенерированные алгоритмически для расширения реальных данных или тестирования.

Качество данных

Качество датасета напрямую определяет качество модели (принцип «мусор на входе — мусор на выходе»). Основные проблемы:

  • Пропуски — отсутствующие значения признаков.
  • Выбросы — аномальные наблюдения, искажающие статистики.
  • Дисбаланс классов — редкие классы представлены значительно слабее.
  • Помехи и ошибки разметки — неверные метки, введённые аннотаторами.
  • Утечка данных (data leakage) — информация из тестовой выборки, попавшая в обучающую.
  • Смещение выборки (bias) — датасет не отражает реальное распределение данных.

Для оценки качества проводят аудит: проверяют полноту, согласованность, актуальность и репрезентативность данных.

Разметка

Создание датасетов для supervised learning требует разметки — присвоения меток. Основные подходы:

  • Ручная разметка — специалисты или краудсорсинговые платформы (например, «Яндекс.Толока») вручную проставляют метки.
  • Активное обучение (active learning) — модель сама выбирает наиболее неоднозначные примеры для разметки.
  • Полуавтоматическая разметка — предварительная разметка моделью с последующей корректировкой человеком.
  • Weak supervision — использование эвристик, правил и слабых сигналов вместо точных меток.

Известные датасеты

  • MNIST (1998) — 70 000 рукописных цифр 28×28, базовый эталон для распознавания.
  • ImageNet (2009) — более 14 миллионов размеченных изображений; конкурс ILSVRC стимулировал прорыв в глубоком обучении в 2012 году.
  • CIFAR-10/100 — небольшие наборы изображений 32×32 для быстрых экспериментов.
  • SQuAD — вопросы и ответы к текстам для оценки понимания языка.
  • Common Crawl — многотерабайтный веб-архив, лежащий в основе многих языковых моделей.

Российские датасеты

В России создан ряд значимых ресурсов: датасеты для русского языка («Тайга», «НКРЯ», «Лингвистика»), наборы медицинских изображений, а также открытые данные государственных порталов (data.gov.ru). Разработкой инструментов для работы с датасетами занимаются компании «Сбер», «Яндекс», «МТС», «Т-Банк» и исследовательские центры вроде Сколтеха и ИПМ им. Марченко.

Применение

Датасеты используются в компьютерном зрении, обработке естественного языка, звуковых задачах, прогнозировании, медицинской диагностике, автономном транспорте и научных вычислениях. От качества и полноты датасета зависит воспроизводимость исследований и надёжность промышленных систем.

Источники:

  • Goodfellow I., Bengio Y., Courville A. Deep Learning. MIT Press, 2016.
  • Russell S., Norvig P. Artificial Intelligence: A Modern Approach. Pearson, 2020.
  • Документации TensorFlow, PyTorch и Hugging Face Datasets.
  • Статьи о датасетах ImageNet, MNIST, SQuAD и Common Crawl.
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru