Датасеты — структурированные наборы данных¶
Датасет (от англ. dataset, «набор данных») — упорядоченная совокупность данных, представляемая в виде таблицы, файла или коллекции записей, используемая для обучения, тестирования и валидации информационных систем, машинных моделей и статистических методов. Каждая запись датасета описывается набором признаков (фичей), а сам набор сопровождается метаданными: форматом, схемой, источником, лицензией и условиями использования. В русскоязычной среде также распространены кальки «набор данных» и «корпус данных» (для текстовых датасетов).
¶Структура и форматы
Типичный датасет состоит из строк (наблюдений, примеров) и столбцов (признаков, переменных). Отдельно выделяют целевую переменную (метку, label) и признаки, по которым она предсказывается. Основные форматы хранения:
| Формат | Описание |
|---|---|
| CSV / TSV | Текстовые таблицы с разделителями, универсальны и легковесны |
| JSON / JSONL | Структурированные записи, удобны для вложенных объектов |
| Parquet, Avro | Колоночные бинарные форматы для больших объёмов |
| HDF5 | Иерархическое хранение массивов, часто для научных данных |
| TFRecord, WebDataset | Форматы, оптимизированные для обучения нейросетей |
| SQLite | Локальные реляционные базы в виде одного файла |
¶Классификация
По назначению датасеты делятся на обучающие (train), валидационные (validation) и тестовые (test) — это стандартное разделение в машинном обучении, позволяющее оценить обобщающую способность модели. По типу данных различают:
- Табличные — строки и столбцы, классический случай для градиентного бустинга и линейных моделей.
- Изображения — коллекции растров с метаданными (например, ImageNet, CIFAR).
- Текстовые — корпуса документов (Wikipedia-дампы, Common Crawl, русскоязычный корпус «Национальный корпус русского языка»).
- Звуковые — записи речи и музыки (LibriSpeech, Common Voice).
- Видео — последовательности кадров (Kinetics, AVA).
- Таблично-мультимодальные — связанные данные разных типов (описания к изображениям).
По доступу датасеты бывают открытыми (с публичной лицензией), закрытыми (внутренние данные компаний) и с ограниченным доступом (по договору или для исследователей).
¶Известные датасеты
- MNIST — 70 000 рукописных цифр 28×28 пикселей, базовый бенчмарк для классификации изображений.
- ImageNet — более 14 миллионов размеченных изображений, послужил толчком к «глубокому обучению» после 2012 года.
- CIFAR-10/100 — небольшие наборы изображений 32×32 для быстрых экспериментов.
- Common Crawl — многотерабайтный архив веб-страниц, используется для предобучения языковых моделей.
- SQuAD — вопросы и ответы к абзацам из Википедии для оценки понимания текста.
- COCO — изображения с аннотациями объектов и подписями, стандарт для детекции и описания изображений.
- GLUE, SuperGLUE — наборы задач естественного языка для сравнения моделей.
- Open Images — масштабная коллекция с разметкой объектов и отношений.
В России и СНГ значительный вклад внесли корпуса «Национальный корпус русского языка» (НКРЯ), датасеты для распознавания речи (например, на основе аудиозаписей парламентских слушаний и новостных выпусков) и датасеты для оценки качества машинного перевода русского языка.
¶Создание и разметка
Создание датасета включает сбор данных (веб-скрапинг, сенсоры, анкеты, архивы), очистку (удаление дубликатов, обработка пропусков, нормализацию) и разметку. Разметка выполняется вручную (crowdsourcing через платформы типа Amazon Mechanical Turk или локальные аналоги), автоматически (правилами, эвристиками, другими моделями) или гибридно. Качество разметки критически важно: ошибки в метках переносятся в модель и снижают её надёжность.
¶Проблемы и ограничения
- Смещение данных (bias) — нерепрезентативность выборки приводит к систематическим ошибкам модели на смежных подгруппах.
- Утечка данных (data leakage) — попадание тестовой информации в обучающую выборку завышает метрики.
- Авторские права и приватность — сбор данных может затрагивать персональные данные; в России сбор и обработка персональных данных регулируется Федеральным законом № 152-ФЗ «О персональных данных».
- Размер и стоимость — масштабные датасеты требуют значительных вычислительных и финансовых ресурсов для хранения и обработки.
- Дрейф данных (data drift) — распределение данных во времени меняется, и датасет перестаёт быть актуальным.
¶Роль в развитии технологий
Датасеты являются фундаментом современного машинного обучения: именно доступ к большим размеченным наборам данных определяет пределы достижимой точности моделей. Появление открытых датасетов и бенчмарков в 2010-х годах — ImageNet, GLUE, SQuAD — ускорило развитие компьютерного зрения и обработки естественного языка. В России формируются собственные открытые датасеты и бенчмарки для русского языка, включая задачи классификации текстов, извлечения фактов и машинного перевода, что снижает зависимость от зарубежных ресурсов.
Источники:
- Добровольский Д. А., Луценко Е. Б. «Машинное обучение: вводный курс»
- Goodfellow I., Bengio Y., Courville A. «Deep Learning» (MIT Press, 2016)
- Журнал «Программная инженерия» (Информатика и системы управления)
- Материалы конференций NeurIPS, ICML (описания датасетов и бенчмарков)
- Федеральный закон РФ № 152-ФЗ «О персональных данных»
