Dataset¶
Dataset (набор данных, англ. dataset) — это совокупность структурированных или неструктурированных данных, объединённых по определённому признаку и организованных для обработки, анализа, обучения моделей машинного обучения или проведения научных исследований. Наборы данных являются основным сырьём для статистики, анализа данных, искусственного интеллекта и многих других областей, где требуется работа с большими объёмами информации.
¶Определение и ключевые характеристики
Dataset представляет собой коллекцию записей (наблюдений, примеров, объектов), каждая из которых описывается набором признаков (атрибутов, переменных). В наиболее распространённом табличном представлении (например, в формате CSV) строки соответствуют отдельным наблюдениям, а столбцы — признакам. Ключевые характеристики набора данных включают:
- Размерность: количество записей (строк) и количество признаков (столбцов).
- Тип данных: числовые (целые, вещественные), категориальные (номинальные, порядковые), текстовые, временные ряды, изображения, аудио, видео.
- Структурированность: структурированные (таблицы, базы данных), полуструктурированные (JSON, XML), неструктурированные (тексты, изображения, аудиозаписи).
- Разметка (labeling): наличие или отсутствие целевой переменной (метки), которую необходимо предсказать или классифицировать. Различают размеченные (labeled) и неразмеченные (unlabeled) наборы данных.
- Объём: малые (до нескольких тысяч записей), средние (десятки-сотни тысяч), большие (миллионы записей) и сверхбольшие (Big Data, терабайты и петабайты).
¶История
Понятие набора данных начало формироваться с развитием статистики и вычислительной техники. В XIX веке первые статистические таблицы, например, переписи населения, можно считать прототипами современных наборов данных. С появлением электронно-вычислительных машин в середине XX века возникла необходимость в систематизации данных для машинной обработки.
В 1960-х годах появились первые базы данных, а в 1970-х — реляционные базы данных, которые формализовали структуру хранения. Однако термин «dataset» получил широкое распространение в 1980-1990-х годах с развитием машинного обучения и статистического анализа. Одним из классических примеров стал набор данных Iris (Fisher, 1936), содержащий измерения длины и ширины чашелистиков и лепестков трёх видов ирисов. Этот набор до сих пор используется для демонстрации алгоритмов классификации.
С началом эры больших данных (Big Data) в 2000-х годах количество и объём наборов данных резко возросли. Появились публичные репозитории, такие как UCI Machine Learning Repository (1987), Kaggle Datasets (2010), Google Dataset Search (2018), а также государственные порталы открытых данных (data.gov, data.gov.ru). Сегодня наборы данных создаются и используются в науке, бизнесе, государственном управлении, медицине, транспорте и других сферах.
¶Классификация наборов данных
Наборы данных можно классифицировать по нескольким основаниям:
¶По структуре
- Структурированные: данные организованы в таблицы с фиксированными полями (например, базы данных SQL, таблицы Excel).
- Полуструктурированные: данные имеют некоторую структуру, но не строгую табличную форму (например, JSON, XML, HTML).
- Неструктурированные: данные не имеют заранее определённой структуры (тексты, изображения, аудио, видео, PDF-файлы).
¶По типу данных
- Числовые: целые (количество жителей), вещественные (температура, цена).
- Категориальные: номинальные (цвет, страна), порядковые (оценка от 1 до 5, уровень образования).
- Текстовые: статьи, комментарии, документы.
- Временные ряды: данные, собранные через равные промежутки времени (котировки акций, погодные наблюдения).
- Мультимедийные: изображения, аудиозаписи, видеофайлы.
¶По наличию разметки
- Размеченные (labeled): каждый пример имеет целевую переменную (метку), которая используется для обучения моделей с учителем (классификация, регрессия).
- Неразмеченные (unlabeled): примеры не имеют меток; используются для обучения без учителя (кластеризация, снижение размерности).
- Частично размеченные (semi-labeled): небольшая часть данных размечена, остальные — нет; применяется в полуавтоматическом обучении.
¶По происхождению
- Первичные: собраны непосредственно из источника (опросы, эксперименты, датчики).
- Вторичные: получены из уже существующих наборов данных (агрегированные, обработанные, сгенерированные).
- Синтетические: искусственно созданные (например, для тестирования алгоритмов или дополнения реальных данных).
¶Применение
Наборы данных используются в самых разных областях:
¶Машинное обучение и искусственный интеллект
Dataset является основой для обучения, валидации и тестирования моделей машинного обучения. Без качественного набора данных невозможно построить эффективную модель. Примеры:
- Классификация изображений: ImageNet (более 14 млн изображений), CIFAR-10, MNIST (рукописные цифры).
- Обработка естественного языка (NLP): GLUE, SuperGLUE, SQuAD (вопросно-ответные системы), Wikipedia Corpus.
- Рекомендательные системы: MovieLens, Netflix Prize Dataset, Amazon Reviews.
- Компьютерное зрение: COCO (Common Objects in Context), Open Images, YOLO.
¶Научные исследования
В науке наборы данных используются для проверки гипотез, статистического анализа, моделирования. Примеры:
- Геномика и биоинформатика: GenBank, 1000 Genomes Project, Protein Data Bank.
- Астрономия: Sloan Digital Sky Survey, Kepler Space Telescope Data.
- Климатология и экология: NOAA Climate Data, WorldClim, Global Forest Watch.
- Социология и экономика: World Bank Open Data, OECD Statistics, Российский мониторинг экономического положения и здоровья населения (РМЭЗ).
¶Бизнес и аналитика
Компании используют наборы данных для анализа рынка, прогнозирования спроса, оптимизации процессов, персонализации предложений. Примеры:
- Финансы: исторические данные о котировках, транзакциях, кредитных историях.
- Маркетинг: данные о поведении пользователей, кликах, покупках.
- Логистика: данные о маршрутах, времени доставки, загрузке складов.
- HR: данные о сотрудниках, зарплатах, текучести кадров.
¶Государственное управление
Открытые государственные данные используются для повышения прозрачности, анализа эффективности политик, создания общественных сервисов. В России действует портал data.gov.ru, где публикуются наборы данных от федеральных и региональных органов власти.
¶Качество наборов данных
Качество набора данных напрямую влияет на результаты анализа и обучения моделей. Основные проблемы:
- Пропуски (missing values): отсутствие значений в некоторых записях.
- Выбросы (outliers): аномальные значения, искажающие статистику.
- Дубликаты (duplicates): повторяющиеся записи.
- Шум (noise): случайные ошибки или искажения.
- Несбалансированность (imbalance): неравномерное распределение классов (например, 99% здоровых и 1% больных).
- Смещение (bias): систематические ошибки, связанные с выборкой или сбором данных (например, данные только по одному региону).
Для улучшения качества применяются методы предобработки: очистка, нормализация, масштабирование, аугментация (искусственное увеличение объёма), заполнение пропусков.
¶Репозитории и источники
Существует множество открытых репозиториев, где можно найти готовые наборы данных:
- UCI Machine Learning Repository — один из старейших (с 1987 г.), содержит сотни наборов для задач машинного обучения.
- Kaggle Datasets — платформа для соревнований по анализу данных, содержит тысячи наборов.
- Google Dataset Search — поисковая система по наборам данных в интернете.
- Hugging Face Datasets — библиотека с тысячами наборов для NLP, компьютерного зрения и аудио.
- Zenodo — репозиторий для научных данных, поддерживаемый CERN.
- Data.gov — портал открытых данных правительства США.
- Data.gov.ru — портал открытых данных Российской Федерации.
¶Правовые и этические аспекты
Использование наборов данных сопряжено с рядом правовых и этических вопросов:
- Авторские права и лицензии: многие наборы данных распространяются под открытыми лицензиями (Creative Commons, Open Data Commons, MIT). Необходимо соблюдать условия лицензии.
- Конфиденциальность и персональные данные: наборы данных, содержащие информацию о людях, должны соответствовать законодательству о защите персональных данных (в России — Федеральный закон № 152-ФЗ «О персональных данных»). Анонимизация и деидентификация обязательны.
- Этические проблемы: смещение (bias) в данных может приводить к дискриминации (например, алгоритмы найма, кредитного скоринга). Необходимо проверять наборы данных на наличие предвзятости.
- Нежелательные организации: использование наборов данных, созданных или распространяемых организациями, признанными в РФ экстремистскими, террористическими или нежелательными, не допускается. Например, Meta (организация признана экстремистской и запрещена в РФ) или движение ЛГБТ (признано экстремистским и запрещено в РФ).
¶Интересные факты
- Самый известный набор данных для обучения нейросетей — ImageNet, содержащий более 14 миллионов изображений, разделённых на 20 000 категорий. Ежегодный конкурс ImageNet Large Scale Visual Recognition Challenge (ILSVRC) стимулировал развитие глубокого обучения.
- Набор данных MNIST (рукописные цифры от 0 до 9) стал «Hello, World!» для машинного обучения. Он содержит 70 000 изображений размером 28×28 пикселей.
- В 2018 году Google запустил Dataset Search — поисковую систему, индексирующую более 25 миллионов наборов данных из различных источников.
- В России существует проект «Открытые данные», в рамках которого публикуются наборы данных от государственных органов, включая данные о бюджете, образовании, здравоохранении, транспорте.
¶Источники
- Fisher, R. A. (1936). The Use of Multiple Measurements in Taxonomic Problems. Annals of Eugenics, 7(2), 179–188.
- UCI Machine Learning Repository. (2024). About the Repository. University of California, Irvine.
- Kaggle. (2024). Kaggle Datasets. Kaggle Inc.
- Google. (2024). Google Dataset Search. Google LLC.
- Open Data Handbook. (2024). What is Open Data? Open Knowledge Foundation.
- Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных».
- Портал открытых данных Российской Федерации. (2024). data.gov.ru.
- Russell, S., & Norvig, P. (2020). Artificial Intelligence: A Modern Approach (4th ed.). Pearson.
- Goodfellow, I., Bengio, Y., & Courville, A. (2016). Deep Learning. MIT Press.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


