Датасет — набор данных для обучения и тестирования моделей¶
Датасет (от англ. dataset, «набор данных») — структурированная коллекция данных, используемая для обучения, валидации и тестирования алгоритмов машинного обучения, а также для статистического анализа и научных исследований. Датасеты представляют собой упорядоченные наборы наблюдений, каждое из которых описывается набором признаков (фичей) и, как правило, целевой переменной (меткой). Ключевые характеристики датасета — объём, качество, разнообразие, формат хранения и лицензия использования.
¶Структура и форматы
Типичный датасет состоит из строк (наблюдений, примеров) и столбцов (признаков). Каждая строка описывает один объект: изображение, текст, звукозапись, строку таблицы или вектор измерений. Столбцы фиксируют атрибуты объекта и целевую метку.
Основные форматы хранения:
| Формат | Типичное применение |
|---|---|
| CSV, TSV | табличные данные, классические задачи |
| JSON, JSONL | веб-данные, структурированные записи |
| Parquet, Avro | большие массивы, аналитика в Hadoop/Spark |
| TFRecord, WebDataset | пакетная загрузка в нейросетевые фреймворки |
| HDF5, NumPy (.npy) | научные массивы, тензоры |
| COCO, VOC, YOLO-форматы | аннотированные изображения |
| LibriSpeech-формат | распознавание речи |
¶Классификация датасетов
По назначению:
- Обучающие (training) — формируют параметры модели.
- Валидационные (validation) — подбирают гиперпараметры и предотвращают переобучение.
- Тестовые (test) — оценивают итоговое качество модели на данных, не участвовавших в обучении.
По типу задач:
- Для классификации — изображения с метками классов (ImageNet, CIFAR-10).
- Для регрессии — числовые целевые переменные (Boston Housing).
- Для сегментации — пиксельные маски (Cityscapes).
- Для распознавания речи — аудио с транскрипциями (LibriSpeech).
- Для обработки естественного языка — тексты с разметкой (SQuAD, Russian SuperGLUE).
- Для генеративных моделей — большие корпуса текста и изображений (LAION, Common Crawl).
По доступу:
- Открытые — публично доступные (MNIST, ImageNet, Wikipedia-дампы).
- Внутренние (проприетарные) — доступны только владельцу (данные банков, медицинских учреждений).
- Синтетические — сгенерированные алгоритмически для расширения реальных данных или тестирования.
¶Качество данных
Качество датасета напрямую определяет качество модели (принцип «мусор на входе — мусор на выходе»). Основные проблемы:
- Пропуски — отсутствующие значения признаков.
- Выбросы — аномальные наблюдения, искажающие статистики.
- Дисбаланс классов — редкие классы представлены значительно слабее.
- Помехи и ошибки разметки — неверные метки, введённые аннотаторами.
- Утечка данных (data leakage) — информация из тестовой выборки, попавшая в обучающую.
- Смещение выборки (bias) — датасет не отражает реальное распределение данных.
Для оценки качества проводят аудит: проверяют полноту, согласованность, актуальность и репрезентативность данных.
¶Разметка
Создание датасетов для supervised learning требует разметки — присвоения меток. Основные подходы:
- Ручная разметка — специалисты или краудсорсинговые платформы (например, «Яндекс.Толока») вручную проставляют метки.
- Активное обучение (active learning) — модель сама выбирает наиболее неоднозначные примеры для разметки.
- Полуавтоматическая разметка — предварительная разметка моделью с последующей корректировкой человеком.
- Weak supervision — использование эвристик, правил и слабых сигналов вместо точных меток.
¶Известные датасеты
- MNIST (1998) — 70 000 рукописных цифр 28×28, базовый эталон для распознавания.
- ImageNet (2009) — более 14 миллионов размеченных изображений; конкурс ILSVRC стимулировал прорыв в глубоком обучении в 2012 году.
- CIFAR-10/100 — небольшие наборы изображений 32×32 для быстрых экспериментов.
- SQuAD — вопросы и ответы к текстам для оценки понимания языка.
- Common Crawl — многотерабайтный веб-архив, лежащий в основе многих языковых моделей.
¶Российские датасеты
В России создан ряд значимых ресурсов: датасеты для русского языка («Тайга», «НКРЯ», «Лингвистика»), наборы медицинских изображений, а также открытые данные государственных порталов (data.gov.ru). Разработкой инструментов для работы с датасетами занимаются компании «Сбер», «Яндекс», «МТС», «Т-Банк» и исследовательские центры вроде Сколтеха и ИПМ им. Марченко.
¶Применение
Датасеты используются в компьютерном зрении, обработке естественного языка, звуковых задачах, прогнозировании, медицинской диагностике, автономном транспорте и научных вычислениях. От качества и полноты датасета зависит воспроизводимость исследований и надёжность промышленных систем.
Источники:
- Goodfellow I., Bengio Y., Courville A. Deep Learning. MIT Press, 2016.
- Russell S., Norvig P. Artificial Intelligence: A Modern Approach. Pearson, 2020.
- Документации TensorFlow, PyTorch и Hugging Face Datasets.
- Статьи о датасетах ImageNet, MNIST, SQuAD и Common Crawl.