Не метрические признаки
Не метрические признаки — это характеристики объектов, явлений или процессов, которые не могут быть выражены числовыми значениями и не поддаются измерению в единицах физических величин. В отличие от метрических (количественных) признаков, они описывают качественные, атрибутивные или порядковые свойства, такие как цвет, форма, принадлежность к категории, степень выраженности или тип. Не метрические признаки широко используются в статистике, машинном обучении, социологии, психологии, биологии и других науках для классификации, ранжирования и анализа данных, где численные измерения невозможны или неинформативны.
Классификация не метрических признаков
Не метрические признаки делятся на два основных типа: номинальные и порядковые (ординальные). Каждый из них имеет свои особенности и методы обработки.
Номинальные признаки
Номинальные признаки (от лат. nomen — имя) представляют собой категории или метки, которые не имеют естественного порядка или иерархии. Примеры: пол (мужской, женский), цвет волос (русый, брюнет, рыжий), тип почвы (чернозём, песок, глина), вид животного (кошка, собака, лошадь). Для номинальных признаков допустимы только операции сравнения на равенство или неравенство (например, «красный» ≠ «синий»). Среднее арифметическое или медиана для таких данных не имеют смысла; для анализа используются мода, частоты распределения, а также тесты, такие как критерий хи-квадрат.
Порядковые (ординальные) признаки
Порядковые признаки (от лат. ordo — порядок) имеют упорядоченные категории, но расстояния между ними не определены или не равны. Примеры: уровень образования (начальное, среднее, высшее), оценка боли (1–10 по шкале), социальный статус (низкий, средний, высокий), степень удовлетворённости (очень недоволен, недоволен, нейтрально, доволен, очень доволен). Для порядковых признаков допустимы сравнения «больше — меньше», но нельзя утверждать, что разница между «средним» и «высоким» равна разнице между «низким» и «средним». Для анализа применяются медиана, квартили, ранговые корреляции (например, коэффициент Спирмена) и непараметрические тесты (критерий Манна — Уитни, критерий Крускала — Уоллиса).
Отличие от метрических признаков
Метрические признаки (количественные) делятся на интервальные (например, температура в градусах Цельсия) и относительные (например, рост в сантиметрах, вес в килограммах). Для них возможны арифметические операции: сложение, вычитание, вычисление среднего. Не метрические признаки, напротив, не допускают таких операций. Например, среднее арифметическое от «красного» и «синего» не имеет смысла, а сложение «высокого» и «низкого» статуса не даёт «среднего». Это различие критически важно при выборе методов статистического анализа и алгоритмов машинного обучения.
Применение в статистике и анализе данных
В статистике не метрические признаки обрабатываются с помощью непараметрических методов, которые не требуют предположений о распределении данных. Для номинальных признаков используются таблицы сопряжённости, точный критерий Фишера, коэффициент φ (фи) для бинарных признаков. Для порядковых — коэффициент корреляции Кендалла, медианный тест, анализ ранговых сумм. В регрессионном анализе не метрические признаки кодируются с помощью фиктивных переменных (dummy-кодирование) или порядковых шкал.
Применение в машинном обучении
В задачах машинного обучения не метрические признаки требуют специальной предобработки, так как большинство алгоритмов (линейная регрессия, метод опорных векторов, нейронные сети) работают с числовыми данными. Основные методы преобразования:
- One-hot encoding — создание бинарных столбцов для каждой категории номинального признака (например, для цвета «красный», «синий», «зелёный» создаются три столбца со значениями 0 или 1). Недостаток — рост размерности при большом числе категорий.
- Label encoding — присвоение целочисленных меток (например, «красный» = 1, «синий» = 2). Этот метод подходит для порядковых признаков, но может вносить ложные порядковые отношения для номинальных.
- Target encoding — замена категории на среднее значение целевой переменной. Используется в задачах регрессии и классификации, но требует регуляризации для избежания переобучения.
- Embedding — представление категорий в виде векторов низкой размерности, часто применяется в нейронных сетях для работы с текстовыми или категориальными данными.
Примеры в различных областях
Социология и психология
В опросах и анкетах не метрические признаки доминируют: пол, образование, профессия, политические предпочтения, уровень стресса. Для анализа используются шкалы Лайкерта (порядковые) и категориальные вопросы. Методы: факторный анализ для порядковых данных, логистическая регрессия для бинарных признаков.
Биология и медицина
В биологии не метрические признаки включают тип окраски, форму листьев, группу крови, стадию заболевания (I, II, III, IV). В клинических исследованиях часто применяются порядковые шкалы (например, шкала боли ВАШ, шкала Глазго для комы). Анализ проводится с помощью непараметрических тестов, таких как критерий Уилкоксона.
Маркетинг и бизнес
В маркетинге не метрические признаки — это сегменты клиентов (по доходу, возрасту, интересам), брендовые предпочтения, тип покупки. Для прогнозирования используются деревья решений, случайный лес, градиентный бустинг, которые естественно работают с категориальными данными.
География и экология
В географии не метрические признаки: тип ландшафта (лес, степь, пустыня), почвенный покров, климатическая зона. В экологии — видовая принадлежность, тип питания (хищник, травоядный). Анализ проводится с помощью кластерного анализа (например, метод k-медоидов, устойчивый к категориальным данным) и анализа соответствий.
Проблемы и ограничения
Основные сложности при работе с не метрическими признаками:
- Потеря информации при кодировании (например, one-hot encoding увеличивает разреженность данных).
- Проблема «проклятия размерности» при большом числе категорий.
- Невозможность прямого использования в некоторых алгоритмах (например, в методе главных компонент).
- Субъективность при построении порядковых шкал (например, разные люди могут по-разному интерпретировать «высокий» или «средний» уровень).
- Ограниченная мощность непараметрических тестов по сравнению с параметрическими при малых выборках.
Для преодоления этих ограничений используются методы регуляризации, снижения размерности (например, t-SNE для категориальных данных), а также гибридные подходы, сочетающие метрические и не метрические признаки.
Интересные факты
- В психометрии не метрические признаки часто преобразуются в метрические с помощью шкалирования (например, метод парных сравнений Тёрстоуна).
- В биоинформатике для анализа последовательностей ДНК (номинальные признаки: A, T, G, C) используются специальные методы, такие как кодирование с помощью частотных профилей.
- В машинном обучении существуют алгоритмы, специально разработанные для категориальных данных, например, CatBoost, который использует target encoding с учётом порядка признаков.
- В российской статистике не метрические признаки активно применяются в переписях населения и социально-экономических обследованиях, где большинство вопросов имеют категориальный характер.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →