Открыть сервис

Маскирование данных

Маскирование данных (также обезличивание данных, деперсонализация данных) — это процесс целенаправленного изменения, замены или сокрытия конфиденциальной информации в наборе данных с целью сохранения её функциональной пригодности для анализа, разработки и тестирования, но при этом предотвращения несанкционированного доступа к реальным персональным данным, коммерческим тайнам или иным защищаемым сведениям. Маскирование применяется для соблюдения законодательства о защите данных (например, Федерального закона № 152-ФЗ «О персональных данных» в РФ), а также для снижения рисков утечек при передаче данных между средами, внутри компании или сторонним подрядчикам.

История и предпосылки

Потребность в маскировании данных возникла с ростом объёмов цифровой информации и внедрением систем управления базами данных. В 1970-х годах, с появлением реляционных баз данных, компании начали использовать копии реальных данных для тестирования программного обеспечения. Однако это создавало угрозу утечки конфиденциальной информации. В 1990-х годах, с ужесточением законодательства о защите данных (например, Директива ЕС 95/46/EC), возникла необходимость в формальных методах обезличивания.

В 2000-х годах, после серии громких утечек (например, утечка данных клиентов AOL в 2006 году), маскирование стало стандартной практикой в финансовом, медицинском и телекоммуникационном секторах. В России с принятием Федерального закона № 152-ФЗ в 2006 году и последующими поправками (в частности, требования к локализации данных) маскирование стало обязательным для операторов персональных данных при передаче данных в тестовые или аналитические среды.

Классификация методов маскирования

Методы маскирования данных делятся на несколько основных категорий, различающихся по степени обратимости, способу изменения и области применения.

По обратимости

  • Необратимое маскирование — данные изменяются таким образом, что восстановить исходные значения невозможно. Например, хеширование с солью или замена на случайные значения. Используется для сред, где не требуется возврат к исходным данным (например, в аналитических отчётах).
  • Обратимое маскирование — позволяет восстановить исходные данные при наличии ключа или алгоритма. Примеры: шифрование с сохранением формата (Format-Preserving Encryption, FPE) или токенизация. Применяется в случаях, когда данные могут понадобиться в исходном виде, но только уполномоченным лицам (например, в медицинских исследованиях).

По способу изменения

  • Замена (Substitution) — значения заменяются на случайные или псевдослучайные из заранее заданного словаря. Например, замена реальных имён на вымышленные из списка.
  • Перестановка (Shuffling) — значения внутри столбца перемешиваются между записями. Сохраняет статистическое распределение, но разрывает связи между полями в одной записи.
  • Добавление шума (Noise Addition) — к числовым данным добавляется случайная величина (например, ±5% к зарплате). Сохраняет общую статистику, но снижает точность отдельных значений.
  • Маскирование символов (Masking) — часть символов заменяется на фиксированные символы (например, «*»). Часто используется для номеров кредитных карт: 1234 ** ** 5678.
  • Анонимизация (Anonymization)удаление или обобщение идентифицирующих данных. Например, замена точного возраста на возрастную группу (25–34 года) или удаление полей с именами.
  • Токенизация (Tokenization) — замена конфиденциальных данных на уникальные идентификаторы (токены), которые хранятся в защищённом хранилище. Токены не содержат информации о реальных данных, но позволяют ссылаться на них.
  • Шифрование с сохранением формата (FPE)шифрование данных с сохранением их исходного формата (например, 16-значный номер карты остаётся 16-значным числом). Позволяет использовать зашифрованные данные в системах, ожидающих определённый формат.

Области применения

Разработка и тестирование программного обеспечения

Одна из основных областей — создание тестовых баз данных. Разработчики и тестировщики часто нуждаются в данных, которые по структуре и статистике близки к реальным, но не содержат конфиденциальной информации. Маскирование позволяет избежать утечек при передаче данных между отделами или внешним подрядчикам.

Аналитика и бизнес-отчётность

При построении аналитических отчётов и дашбордов часто используются реальные данные, но для публикации или передачи в сторонние организации их необходимо обезличить. Маскирование позволяет сохранить тренды и корреляции без раскрытия личных данных.

Обучение моделей машинного обучения

Для обучения моделей ИИ требуются большие объёмы данных, которые могут содержать персональные данные. Маскирование (например, добавление шума или обобщение) позволяет использовать такие данные, соблюдая законодательство, хотя может снизить точность модели.

Медицина и здравоохранение

В медицинских исследованиях и клинических испытаниях маскирование данных пациентов (например, замена ФИО на идентификаторы, обобщение диагнозов) обязательно для соблюдения врачебной тайны и законодательства (в РФ — ст. 13 Федерального закона № 323-ФЗ).

Финансовый сектор

Банки и страховые компании маскируют данные клиентов (номера счетов, кредитных карт, паспортные данные) при передаче данных в процессинговые центры, коллекторские агентства или для внутреннего аудита.

Технологии и инструменты

Для маскирования данных используются как встроенные функции СУБД, так и специализированные программные продукты.

  • Встроенные средства СУБД: Oracle Data Masking, Microsoft SQL Server Data Masking, PostgreSQL с расширениями (например, pg_mask).
  • Специализированные платформы: IBM InfoSphere Optim, Informatica Persistent Data Masking, Delphix, IRI FieldShield.
  • Библиотеки и фреймворки: Python-библиотеки (Faker, mimesis), Apache Spark с модулями маскирования.
  • Облачные сервисы: AWS Glue DataBrew, Google Cloud DLP (Data Loss Prevention), Azure Data Factory.

Правовые аспекты в Российской Федерации

В России маскирование данных регулируется прежде всего Федеральным законом № 152-ФЗ «О персональных данных». Согласно этому закону, операторы персональных данных обязаны обеспечивать конфиденциальность данных, а при передаче их третьим лицам (например, для тестирования) — применять обезличивание. Роскомнадзор выпустил методические рекомендации по обезличиванию данных (Приказ № 18 от 05.02.2013), которые описывают допустимые методы: замену, обобщение, удаление, перемешивание.

Важно, что маскирование не должно быть обратимым без специального ключа, если данные передаются за пределы организации. При нарушении требований возможны административные штрафы (ст. 13.11 КоАП РФ) и блокировка сайтов.

Критика и ограничения

Маскирование данных не является панацеей. Основные проблемы:

  • Потеря функциональности: при агрессивном маскировании (например, полное удаление полей) данные могут стать непригодными для анализа или тестирования.
  • Риск реидентификации: даже обезличенные данные могут быть восстановлены при сопоставлении с другими источниками (например, атака на анонимизированные данные Netflix в 2008 году).
  • Сложность масштабирования: для больших данных (Big Data) маскирование в реальном времени может быть ресурсоёмким.
  • Человеческий фактор: ошибки в настройке правил маскирования могут привести к утечке.

См. также

  • Анонимизация
  • Персональные данные
  • Шифрование
  • Токенизация
  • Закон о персональных данных (Россия)

Источники

  1. Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных».
  2. Приказ Роскомнадзора от 05.02.2013 № 18 «Об утверждении требований к обезличиванию персональных данных».
  3. Кодекс Российской Федерации об административных правонарушениях, ст. 13.11.
  4. OWASP Data Masking Cheat Sheet.
  5. NIST Special Publication 800-122: Guide to Protecting the Confidentiality of Personally Identifiable Information.
  6. IBM InfoSphere Optim: Data Masking Best Practices.
  7. Статья «Анонимизация и маскирование данных: обзор методов» (журнал «Информационная безопасность», 2021).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →