Открыть сервис

Dataset

Dataset (набор данных, англ. dataset) — это совокупность структурированных или неструктурированных данных, объединённых по определённому признаку и организованных для обработки, анализа, обучения моделей машинного обучения или проведения научных исследований. Наборы данных являются основным сырьём для статистики, анализа данных, искусственного интеллекта и многих других областей, где требуется работа с большими объёмами информации.

Определение и ключевые характеристики

Dataset представляет собой коллекцию записей (наблюдений, примеров, объектов), каждая из которых описывается набором признаков (атрибутов, переменных). В наиболее распространённом табличном представлении (например, в формате CSV) строки соответствуют отдельным наблюдениям, а столбцы — признакам. Ключевые характеристики набора данных включают:

  • Размерность: количество записей (строк) и количество признаков (столбцов).
  • Тип данных: числовые (целые, вещественные), категориальные (номинальные, порядковые), текстовые, временные ряды, изображения, аудио, видео.
  • Структурированность: структурированные (таблицы, базы данных), полуструктурированные (JSON, XML), неструктурированные (тексты, изображения, аудиозаписи).
  • Разметка (labeling): наличие или отсутствие целевой переменной (метки), которую необходимо предсказать или классифицировать. Различают размеченные (labeled) и неразмеченные (unlabeled) наборы данных.
  • Объём: малые (до нескольких тысяч записей), средние (десятки-сотни тысяч), большие (миллионы записей) и сверхбольшие (Big Data, терабайты и петабайты).

История

Понятие набора данных начало формироваться с развитием статистики и вычислительной техники. В XIX веке первые статистические таблицы, например, переписи населения, можно считать прототипами современных наборов данных. С появлением электронно-вычислительных машин в середине XX века возникла необходимость в систематизации данных для машинной обработки.

В 1960-х годах появились первые базы данных, а в 1970-х — реляционные базы данных, которые формализовали структуру хранения. Однако термин «dataset» получил широкое распространение в 1980-1990-х годах с развитием машинного обучения и статистического анализа. Одним из классических примеров стал набор данных Iris (Fisher, 1936), содержащий измерения длины и ширины чашелистиков и лепестков трёх видов ирисов. Этот набор до сих пор используется для демонстрации алгоритмов классификации.

С началом эры больших данных (Big Data) в 2000-х годах количество и объём наборов данных резко возросли. Появились публичные репозитории, такие как UCI Machine Learning Repository (1987), Kaggle Datasets (2010), Google Dataset Search (2018), а также государственные порталы открытых данных (data.gov, data.gov.ru). Сегодня наборы данных создаются и используются в науке, бизнесе, государственном управлении, медицине, транспорте и других сферах.

Классификация наборов данных

Наборы данных можно классифицировать по нескольким основаниям:

По структуре

  • Структурированные: данные организованы в таблицы с фиксированными полями (например, базы данных SQL, таблицы Excel).
  • Полуструктурированные: данные имеют некоторую структуру, но не строгую табличную форму (например, JSON, XML, HTML).
  • Неструктурированные: данные не имеют заранее определённой структуры (тексты, изображения, аудио, видео, PDF-файлы).

По типу данных

  • Числовые: целые (количество жителей), вещественные (температура, цена).
  • Категориальные: номинальные (цвет, страна), порядковые (оценка от 1 до 5, уровень образования).
  • Текстовые: статьи, комментарии, документы.
  • Временные ряды: данные, собранные через равные промежутки времени (котировки акций, погодные наблюдения).
  • Мультимедийные: изображения, аудиозаписи, видеофайлы.

По наличию разметки

  • Размеченные (labeled): каждый пример имеет целевую переменную (метку), которая используется для обучения моделей с учителем (классификация, регрессия).
  • Неразмеченные (unlabeled): примеры не имеют меток; используются для обучения без учителя (кластеризация, снижение размерности).
  • Частично размеченные (semi-labeled): небольшая часть данных размечена, остальные — нет; применяется в полуавтоматическом обучении.

По происхождению

  • Первичные: собраны непосредственно из источника (опросы, эксперименты, датчики).
  • Вторичные: получены из уже существующих наборов данных (агрегированные, обработанные, сгенерированные).
  • Синтетические: искусственно созданные (например, для тестирования алгоритмов или дополнения реальных данных).

Применение

Наборы данных используются в самых разных областях:

Машинное обучение и искусственный интеллект

Dataset является основой для обучения, валидации и тестирования моделей машинного обучения. Без качественного набора данных невозможно построить эффективную модель. Примеры:

  • Классификация изображений: ImageNet (более 14 млн изображений), CIFAR-10, MNIST (рукописные цифры).
  • Обработка естественного языка (NLP): GLUE, SuperGLUE, SQuAD (вопросно-ответные системы), Wikipedia Corpus.
  • Рекомендательные системы: MovieLens, Netflix Prize Dataset, Amazon Reviews.
  • Компьютерное зрение: COCO (Common Objects in Context), Open Images, YOLO.

Научные исследования

В науке наборы данных используются для проверки гипотез, статистического анализа, моделирования. Примеры:

  • Геномика и биоинформатика: GenBank, 1000 Genomes Project, Protein Data Bank.
  • Астрономия: Sloan Digital Sky Survey, Kepler Space Telescope Data.
  • Климатология и экология: NOAA Climate Data, WorldClim, Global Forest Watch.
  • Социология и экономика: World Bank Open Data, OECD Statistics, Российский мониторинг экономического положения и здоровья населения (РМЭЗ).

Бизнес и аналитика

Компании используют наборы данных для анализа рынка, прогнозирования спроса, оптимизации процессов, персонализации предложений. Примеры:

  • Финансы: исторические данные о котировках, транзакциях, кредитных историях.
  • Маркетинг: данные о поведении пользователей, кликах, покупках.
  • Логистика: данные о маршрутах, времени доставки, загрузке складов.
  • HR: данные о сотрудниках, зарплатах, текучести кадров.

Государственное управление

Открытые государственные данные используются для повышения прозрачности, анализа эффективности политик, создания общественных сервисов. В России действует портал data.gov.ru, где публикуются наборы данных от федеральных и региональных органов власти.

Качество наборов данных

Качество набора данных напрямую влияет на результаты анализа и обучения моделей. Основные проблемы:

  • Пропуски (missing values): отсутствие значений в некоторых записях.
  • Выбросы (outliers): аномальные значения, искажающие статистику.
  • Дубликаты (duplicates): повторяющиеся записи.
  • Шум (noise): случайные ошибки или искажения.
  • Несбалансированность (imbalance): неравномерное распределение классов (например, 99% здоровых и 1% больных).
  • Смещение (bias): систематические ошибки, связанные с выборкой или сбором данных (например, данные только по одному региону).

Для улучшения качества применяются методы предобработки: очистка, нормализация, масштабирование, аугментация (искусственное увеличение объёма), заполнение пропусков.

Репозитории и источники

Существует множество открытых репозиториев, где можно найти готовые наборы данных:

  • UCI Machine Learning Repository — один из старейших (с 1987 г.), содержит сотни наборов для задач машинного обучения.
  • Kaggle Datasets — платформа для соревнований по анализу данных, содержит тысячи наборов.
  • Google Dataset Search — поисковая система по наборам данных в интернете.
  • Hugging Face Datasets — библиотека с тысячами наборов для NLP, компьютерного зрения и аудио.
  • Zenodo — репозиторий для научных данных, поддерживаемый CERN.
  • Data.gov — портал открытых данных правительства США.
  • Data.gov.ru — портал открытых данных Российской Федерации.

Правовые и этические аспекты

Использование наборов данных сопряжено с рядом правовых и этических вопросов:

  • Авторские права и лицензии: многие наборы данных распространяются под открытыми лицензиями (Creative Commons, Open Data Commons, MIT). Необходимо соблюдать условия лицензии.
  • Конфиденциальность и персональные данные: наборы данных, содержащие информацию о людях, должны соответствовать законодательству о защите персональных данных (в России — Федеральный закон № 152-ФЗ «О персональных данных»). Анонимизация и деидентификация обязательны.
  • Этические проблемы: смещение (bias) в данных может приводить к дискриминации (например, алгоритмы найма, кредитного скоринга). Необходимо проверять наборы данных на наличие предвзятости.
  • Нежелательные организации: использование наборов данных, созданных или распространяемых организациями, признанными в РФ экстремистскими, террористическими или нежелательными, не допускается. Например, Meta (организация признана экстремистской и запрещена в РФ) или движение ЛГБТ (признано экстремистским и запрещено в РФ).

Интересные факты

  • Самый известный набор данных для обучения нейросетей — ImageNet, содержащий более 14 миллионов изображений, разделённых на 20 000 категорий. Ежегодный конкурс ImageNet Large Scale Visual Recognition Challenge (ILSVRC) стимулировал развитие глубокого обучения.
  • Набор данных MNIST (рукописные цифры от 0 до 9) стал «Hello, World!» для машинного обучения. Он содержит 70 000 изображений размером 28×28 пикселей.
  • В 2018 году Google запустил Dataset Search — поисковую систему, индексирующую более 25 миллионов наборов данных из различных источников.
  • В России существует проект «Открытые данные», в рамках которого публикуются наборы данных от государственных органов, включая данные о бюджете, образовании, здравоохранении, транспорте.

Источники

  1. Fisher, R. A. (1936). The Use of Multiple Measurements in Taxonomic Problems. Annals of Eugenics, 7(2), 179–188.
  2. UCI Machine Learning Repository. (2024). About the Repository. University of California, Irvine.
  3. Kaggle. (2024). Kaggle Datasets. Kaggle Inc.
  4. Google. (2024). Google Dataset Search. Google LLC.
  5. Open Data Handbook. (2024). What is Open Data? Open Knowledge Foundation.
  6. Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных».
  7. Портал открытых данных Российской Федерации. (2024). data.gov.ru.
  8. Russell, S., & Norvig, P. (2020). Artificial Intelligence: A Modern Approach (4th ed.). Pearson.
  9. Goodfellow, I., Bengio, Y., & Courville, A. (2016). Deep Learning. MIT Press.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →