Открыть сервис

l-разнообразие

l-разнообразие (от англ. l‑diversity) — это модель защиты данных, используемая в области анонимизации баз данных, которая расширяет понятие k‑анонимности. Она направлена на предотвращение атак на конфиденциальность, связанных с однородностью или фоновыми знаниями, когда в рамках k‑анонимного набора записей все значения чувствительного атрибута могут быть одинаковыми или легко угадываемыми. l‑разнообразие требует, чтобы в каждом кластере записей, объединённых общим набором квазиидентификаторов (например, возраст, почтовый индекс, пол), присутствовало не менее l «хорошо представленных» различных значений чувствительного атрибута (например, диагноз, зарплата, религия). Термин был введён в 2006 году исследователями Ашвином Махвараном, Йоханнесом Герке, Адамом Мейерсом и Йехуда Линделлом.

История и предпосылки

Проблема защиты конфиденциальности при публикации таблиц с персональными данными стала активно изучаться с конца 1990-х годов. Первой широко принятой моделью стала k‑анонимность (Латания Суини, 2002). Она гарантирует, что каждый набор записей с одинаковыми квазиидентификаторами содержит не менее k записей, что затрудняет идентификацию конкретного человека. Однако k‑анонимность не защищает от раскрытия чувствительных атрибутов, если все записи в группе имеют одинаковое значение (например, все пациенты в группе имеют один и тот же диагноз). В этом случае, даже если злоумышленник не может точно определить, кто есть кто, он узнаёт, что все в группе имеют данный диагноз. Это явление получило название атака однородности.

Кроме того, k‑анонимность уязвима для атаки на основе фоновых знаний: если злоумышленник знает, что конкретный человек не может иметь определённое значение чувствительного атрибута (например, из-за возраста или пола), он может исключить часть записей и с высокой вероятностью угадать реальное значение. Для устранения этих недостатков и была предложена модель l‑разнообразия.

Определение и формальная модель

Пусть имеется таблица данных, в которой выделены:

  • Квазиидентификаторы (QID) — набор атрибутов, которые в совокупности могут однозначно или почти однозначно идентифицировать человека (например, дата рождения, пол, почтовый индекс).
  • Чувствительный атрибут (S) — конфиденциальная информация, которую необходимо защитить (например, диагноз, уровень дохода, политические взгляды).

Таблица считается удовлетворяющей l‑разнообразию, если для каждого класса эквивалентности (группы записей с одинаковыми значениями QID) выполняется следующее условие: в этом классе присутствует не менее l различных значений чувствительного атрибута, и каждое из этих значений встречается не более чем в определённой пропорции (обычно не более 1/l от общего числа записей в классе). Формально, если обозначить через \( p_i \) долю записей в классе, имеющих i‑е значение чувствительного атрибута, то для всех i должно выполняться \( p_i \le 1/l \). Это гарантирует, что злоумышленник, зная QID, не сможет с вероятностью выше 1/l угадать истинное значение чувствительного атрибута.

Разновидности l‑разнообразия

Существует несколько интерпретаций «хорошей представленности» значений:

  • Простое l‑разнообразие — в классе должно быть не менее l различных значений, без учёта их распределения.
  • Энтропийное l‑разнообразиеэнтропия распределения значений чувствительного атрибута в классе должна быть не менее log(l). Это более строгое условие, учитывающее не только количество, но и равномерность распределения.
  • Рекурсивное (c, l)-разнообразие — требует, чтобы наиболее частое значение встречалось не более чем в c раз чаще, чем наименее частое, при условии, что общее количество различных значений не менее l.

Пример

Рассмотрим таблицу пациентов, анонимизированную с k=3 (каждая группа содержит 3 записи). В одной из групп квазиидентификаторы (возраст, пол, почтовый индекс) одинаковы, а чувствительный атрибут — диагноз. Если все три записи имеют диагноз «Рак», то злоумышленник, зная QID, узнаёт, что любой человек из этой группы болен раком. Это нарушает l‑разнообразие при l>1. Если же в группе есть три разных диагноза — «Рак», «Грипп», «Диабет» — и каждый встречается ровно один раз, то условие l=3 выполняется, и вероятность угадать диагноз для конкретного человека составляет 1/3.

Преимущества и недостатки

Преимущества

  • Устраняет атаку однородности, характерную для k‑анонимности.
  • Снижает риск атаки на основе фоновых знаний, так как злоумышленник не может с высокой вероятностью определить чувствительное значение.
  • Относительно проста для понимания и реализации по сравнению с более сложными моделями, такими как t-близость.

Недостатки

  • Проблема с распределением: l‑разнообразие не учитывает семантическую близость значений. Например, если в группе есть три диагноза: «Рак лёгких», «Рак желудка» и «Рак кожи», все они формально различны, но все относятся к онкологическим заболеваниям, что может раскрыть конфиденциальную информацию.
  • Чувствительность к выбросам: если в данных есть редкие значения, для достижения l‑разнообразия может потребоваться сильное обобщение квазиидентификаторов, что снижает полезность данных.
  • Не защищает от атак, основанных на распределении: если распределение чувствительного атрибута в популяции сильно отличается от распределения в классе, злоумышленник может извлечь информацию. Для решения этой проблемы была предложена модель t-близости (t‑closeness), которая требует, чтобы распределение чувствительного атрибута в каждом классе было близко к его распределению во всей таблице.

Применение

l‑разнообразие используется в ситуациях, когда требуется публикация статистических данных или открытых наборов данных (open data) с сохранением конфиденциальности отдельных записей. Оно применяется в медицине (публикация историй болезни для исследований), социологии (опросы, переписи населения), финансовом секторе (анализ кредитных историй) и других областях, где данные содержат квазиидентификаторы и чувствительные атрибуты. На практике l‑разнообразие часто комбинируется с k‑анонимностью и другими методами, такими как дифференциальная приватность, для достижения более высокого уровня защиты.

Критика и развитие

Модель l‑разнообразия подвергалась критике за недостаточную защиту в случаях, когда чувствительные атрибуты имеют неравномерное распределение или семантически близки. В ответ на это были разработаны более совершенные модели: t-близость (2007), δ-присутствие (δ‑presence) и дифференциальная приватность (differential privacy, 2006), которая стала стандартом де-факто в области анонимизации данных. Тем не менее, l‑разнообразие остаётся важным концептуальным шагом в понимании ограничений k‑анонимности и широко используется в учебных курсах и исследовательских работах по информационной безопасности и защите персональных данных.

Источники

  • Machanavajjhala, A., Gehrke, J., Kifer, D., & Venkitasubramaniam, M. (2006). l-Diversity: Privacy Beyond k-Anonymity. Proceedings of the 22nd International Conference on Data Engineering (ICDE).
  • Sweeney, L. (2002). k-Anonymity: A Model for Protecting Privacy. International Journal of Uncertainty, Fuzziness and Knowledge-Based Systems.
  • Li, N., Li, T., & Venkatasubramanian, S. (2007). t-Closeness: Privacy Beyond k-Anonymity and l-Diversity. Proceedings of the 23rd International Conference on Data Engineering (ICDE).
  • Dwork, C. (2006). Differential Privacy. Proceedings of the 33rd International Colloquium on Automata, Languages and Programming (ICALP).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →