Открыть сервисСервис

Датасеты — структурированные наборы данных

Датасет (от англ. dataset, «набор данных») — упорядоченная совокупность данных, представляемая в виде таблицы, файла или коллекции записей, используемая для обучения, тестирования и валидации информационных систем, машинных моделей и статистических методов. Каждая запись датасета описывается набором признаков (фичей), а сам набор сопровождается метаданными: форматом, схемой, источником, лицензией и условиями использования. В русскоязычной среде также распространены кальки «набор данных» и «корпус данных» (для текстовых датасетов).

Структура и форматы

Типичный датасет состоит из строк (наблюдений, примеров) и столбцов (признаков, переменных). Отдельно выделяют целевую переменную (метку, label) и признаки, по которым она предсказывается. Основные форматы хранения:

ФорматОписание
CSV / TSVТекстовые таблицы с разделителями, универсальны и легковесны
JSON / JSONLСтруктурированные записи, удобны для вложенных объектов
Parquet, AvroКолоночные бинарные форматы для больших объёмов
HDF5Иерархическое хранение массивов, часто для научных данных
TFRecord, WebDatasetФорматы, оптимизированные для обучения нейросетей
SQLiteЛокальные реляционные базы в виде одного файла

Классификация

По назначению датасеты делятся на обучающие (train), валидационные (validation) и тестовые (test) — это стандартное разделение в машинном обучении, позволяющее оценить обобщающую способность модели. По типу данных различают:

  • Табличные — строки и столбцы, классический случай для градиентного бустинга и линейных моделей.
  • Изображения — коллекции растров с метаданными (например, ImageNet, CIFAR).
  • Текстовые — корпуса документов (Wikipedia-дампы, Common Crawl, русскоязычный корпус «Национальный корпус русского языка»).
  • Звуковые — записи речи и музыки (LibriSpeech, Common Voice).
  • Видео — последовательности кадров (Kinetics, AVA).
  • Таблично-мультимодальные — связанные данные разных типов (описания к изображениям).

По доступу датасеты бывают открытыми (с публичной лицензией), закрытыми (внутренние данные компаний) и с ограниченным доступом (по договору или для исследователей).

Известные датасеты

  • MNIST — 70 000 рукописных цифр 28×28 пикселей, базовый бенчмарк для классификации изображений.
  • ImageNet — более 14 миллионов размеченных изображений, послужил толчком к «глубокому обучению» после 2012 года.
  • CIFAR-10/100 — небольшие наборы изображений 32×32 для быстрых экспериментов.
  • Common Crawl — многотерабайтный архив веб-страниц, используется для предобучения языковых моделей.
  • SQuAD — вопросы и ответы к абзацам из Википедии для оценки понимания текста.
  • COCO — изображения с аннотациями объектов и подписями, стандарт для детекции и описания изображений.
  • GLUE, SuperGLUE — наборы задач естественного языка для сравнения моделей.
  • Open Images — масштабная коллекция с разметкой объектов и отношений.

В России и СНГ значительный вклад внесли корпуса «Национальный корпус русского языка» (НКРЯ), датасеты для распознавания речи (например, на основе аудиозаписей парламентских слушаний и новостных выпусков) и датасеты для оценки качества машинного перевода русского языка.

Создание и разметка

Создание датасета включает сбор данных (веб-скрапинг, сенсоры, анкеты, архивы), очистку (удаление дубликатов, обработка пропусков, нормализацию) и разметку. Разметка выполняется вручную (crowdsourcing через платформы типа Amazon Mechanical Turk или локальные аналоги), автоматически (правилами, эвристиками, другими моделями) или гибридно. Качество разметки критически важно: ошибки в метках переносятся в модель и снижают её надёжность.

Проблемы и ограничения

  • Смещение данных (bias) — нерепрезентативность выборки приводит к систематическим ошибкам модели на смежных подгруппах.
  • Утечка данных (data leakage) — попадание тестовой информации в обучающую выборку завышает метрики.
  • Авторские права и приватность — сбор данных может затрагивать персональные данные; в России сбор и обработка персональных данных регулируется Федеральным законом № 152-ФЗ «О персональных данных».
  • Размер и стоимость — масштабные датасеты требуют значительных вычислительных и финансовых ресурсов для хранения и обработки.
  • Дрейф данных (data drift) — распределение данных во времени меняется, и датасет перестаёт быть актуальным.

Роль в развитии технологий

Датасеты являются фундаментом современного машинного обучения: именно доступ к большим размеченным наборам данных определяет пределы достижимой точности моделей. Появление открытых датасетов и бенчмарков в 2010-х годах — ImageNet, GLUE, SQuAD — ускорило развитие компьютерного зрения и обработки естественного языка. В России формируются собственные открытые датасеты и бенчмарки для русского языка, включая задачи классификации текстов, извлечения фактов и машинного перевода, что снижает зависимость от зарубежных ресурсов.

Источники:

  • Добровольский Д. А., Луценко Е. Б. «Машинное обучение: вводный курс»
  • Goodfellow I., Bengio Y., Courville A. «Deep Learning» (MIT Press, 2016)
  • Журнал «Программная инженерия» (Информатика и системы управления)
  • Материалы конференций NeurIPS, ICML (описания датасетов и бенчмарков)
  • Федеральный закон РФ № 152-ФЗ «О персональных данных»
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru