Открыть сервис

Качество данных

Качество данных — это совокупность свойств и характеристик данных, которые определяют их способность удовлетворять установленные или предполагаемые потребности пользователя при решении конкретных задач в заданном контексте. Качество данных является ключевым понятием в управлении данными, информационных системах, аналитике и машинном обучении, поскольку низкое качество исходных данных ведёт к ошибочным выводам, неэффективным бизнес-процессам и финансовым потерям.

История и развитие понятия

Понятие качества данных начало формироваться в 1960–1970-х годах с развитием компьютерных баз данных. Первоначально акцент делался на технической точности и непротиворечивости данных в рамках реляционной модели (нормализация, целостность ссылок). В 1980–1990-х годах, с распространением корпоративных информационных систем, возникла потребность в более широком взгляде, включающем полноту, своевременность и актуальность. В 1990-е годы были разработаны первые методики оценки и улучшения качества данных, такие как Total Data Quality Management (TDQM) и методология Data Quality Assessment (DQA). В 2000-х годах, с ростом объёмов данных (Big Data) и развитием систем бизнес-аналитики, качество данных стало рассматриваться как стратегический актив организации, а его управление выделилось в отдельную дисциплину — Data Governance.

Ключевые характеристики (измерения) качества данных

Существует несколько общепринятых моделей, описывающих атрибуты качества данных. Наиболее распространённая включает следующие измерения:

Точность (Accuracy)

Степень соответствия данных реальному объекту, явлению или процессу, который они описывают. Например, правильный адрес клиента или корректная сумма транзакции. Ошибки могут возникать из-за опечаток, сбоев датчиков, некорректного ввода.

Полнота (Completeness)

Доля имеющихся (непустых) значений в наборе данных относительно всех ожидаемых значений. Пропуски могут быть как допустимыми (например, необязательное поле «отчество»), так и критическими (отсутствие ключевого идентификатора).

Согласованность (Consistency)

Отсутствие противоречий между данными в рамках одного источника или между разными источниками. Включает логическую согласованность (дата рождения не может быть позже даты смерти) и форматную (одинаковое представление дат, валют).

Актуальность (Timeliness / Currency)

Степень соответствия данных текущему состоянию реального мира. Устаревшие данные (например, номер телефона, который сменился год назад) снижают качество.

Уникальность (Uniqueness)

Отсутствие дубликатов записей об одном и том же объекте. Например, один клиент не должен быть заведён в CRM дважды с разными идентификаторами.

Целостность (Integrity)

Соблюдение правил и ограничений, наложенных на структуру данных (например, внешние ключи, ссылочная целостность в реляционных базах данных).

Достоверность (Validity)

Соответствие данных заданным форматам, диапазонам и бизнес-правилам. Например, поле «возраст» не может содержать отрицательное число.

Доступность (Accessibility)

Возможность получить данные в нужное время и в нужном месте. Включает как техническую доступность (работа сервера, скорость запроса), так и организационную (наличие прав доступа).

Классификация проблем качества данных

Проблемы качества данных можно разделить на несколько категорий:

По источнику возникновения

  • Ошибки вводачеловеческий фактор при ручном заполнении форм.
  • Ошибки интеграции — возникают при объединении данных из разных систем с разными форматами и справочниками.
  • Ошибки передачи — потери или искажения при передаче по каналам связи.
  • Ошибки устаревания — данные перестают быть актуальными с течением времени.

По типу дефекта

  • Синтаксические — нарушение формата (например, дата «32.13.2023»).
  • Семантические — несоответствие смыслу (например, пол «мужской» для беременной пациентки).
  • Ссылочные — нарушение связей между записями (например, заказ, ссылающийся на несуществующий товар).

Методы оценки и управления качеством данных

Управление качеством данных (Data Quality Management, DQM) включает в себя несколько этапов:

Профилирование данных (Data Profiling)

Анализ существующих данных для выявления аномалий, дубликатов, пустых значений, нестандартных форматов. Проводится с помощью специализированных инструментов (например, Talend, Informatica, Apache Griffin).

Очистка данных (Data Cleansing)

Процесс исправления или удаления некорректных, неполных, дублирующихся или устаревших данных. Включает:

  • стандартизацию форматов (приведение к единому виду);
  • дедупликацию (удаление дубликатов);
  • заполнение пропусков (имитация или поиск по справочникам);
  • коррекцию ошибок (автоматическую или ручную).

Мониторинг и метрики

Регулярное измерение показателей качества по выбранным измерениям. Для каждого показателя устанавливаются пороговые значения (целевые уровни качества). Например, «доля записей с корректным адресом должна быть не менее 95%».

Управление мастер-данными (Master Data Management, MDM)

Создание единого, согласованного и авторитетного набора основных данных (клиенты, продукты, сотрудники) для всей организации. MDM помогает устранить дублирование и противоречия между системами.

Ролевая модель и ответственность

В организациях часто вводятся роли:

  • Владелец данных (Data Owner) — отвечает за качество и использование данных в своей области.
  • Стюард данных (Data Steward) — занимается оперативным контролем и улучшением качества.
  • Инженер данных (Data Engineer) — отвечает за техническую инфраструктуру и процессы обработки.

Применение и значение

Качество данных критически важно во многих областях:

  • Бизнес-аналитика и отчётность — неверные данные приводят к ошибочным управленческим решениям.
  • Машинное обучение и искусственный интеллект — модели, обученные на грязных данных, дают неверные прогнозы (принцип «мусор на входе — мусор на выходе»).
  • Финансовый сектор — ошибки в данных о транзакциях или клиентах ведут к штрафам регуляторов и репутационным потерям.
  • Здравоохранение — некорректные данные о пациенте могут привести к неверному диагнозу или лечению.
  • Государственное управление — неточные статистические данные искажают картину социально-экономического развития.

Инструменты и технологии

Для автоматизации процессов управления качеством данных используются специализированные программные продукты:

  • Open-source: Apache Griffin, Great Expectations, Deequ.
  • Коммерческие: Informatica Data Quality, IBM InfoSphere Information Server, SAP Data Services, Talend Data Quality.
  • Встроенные в СУБД: функции проверки ограничений (CHECK, UNIQUE, FOREIGN KEY) в PostgreSQL, SQL Server, Oracle.

Интересные факты

  • Согласно исследованиям, низкое качество данных обходится компаниям в среднем в 15–20% их годового дохода (по данным Gartner).
  • Понятие «качество данных» не является абсолютным — одни и те же данные могут быть приемлемыми для одной задачи (например, статистического анализа) и неприемлемыми для другой (например, точного выставления счёта).
  • В России вопросы качества данных регулируются в рамках стандартов серии ГОСТ Р ИСО 8000 «Качество данных», а также отраслевыми нормативными актами (например, в банковской сфере — требованиями ЦБ РФ).

Источники

  • ГОСТ Р ИСО 8000-1-2014 «Качество данных. Часть 1. Общие положения».
  • Batini C., Scannapieco M. Data Quality: Concepts, Methodologies and Techniques. — Springer, 2006.
  • Redman T. C. Data Quality: The Field Guide. — Digital Press, 2001.
  • Материалы Gartner, Inc. (исследования по управлению данными).
  • Документация по Apache Griffin и Great Expectations (открытые проекты).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →