Набор данных Фишера¶
Набор данных Фишера (также известный как набор данных ирисов Фишера, Iris flower data set) — это многомерный набор данных, введённый в научный оборот британским статистиком и биологом Рональдом Фишером в 1936 году. Набор содержит 150 образцов (экземпляров) трёх видов ирисов (Iris setosa, Iris virginica и Iris versicolor), по 50 образцов каждого вида. Для каждого образца измерены четыре признака: длина чашелистика (sepal length), ширина чашелистика (sepal width), длина лепестка (petal length) и ширина лепестка (petal width). Набор данных Фишера является классическим примером для задач классификации и машинного обучения, а также одним из наиболее часто используемых учебных наборов в статистике и анализе данных.
¶История
Рональд Фишер опубликовал набор данных в 1936 году в статье «The Use of Multiple Measurements in Taxonomic Problems» (журнал Annals of Eugenics). Целью работы была демонстрация применения линейного дискриминантного анализа (LDA) для решения задачи классификации биологических видов по морфологическим признакам. Фишер собрал данные на полуострове Гаспе (Канада) в 1935 году; измерения проводились Эдгаром Андерсоном, американским ботаником, который изучал изменчивость ирисов. Первоначально набор включал 50 образцов каждого вида, собранных в естественных условиях. Впоследствии набор стал широко использоваться в учебных курсах по статистике, а с развитием вычислительной техники — в машинном обучении и распознавании образов.
¶Структура данных
¶Признаки
Каждый образец описывается четырьмя числовыми признаками, измеренными в сантиметрах:
- Длина чашелистика (sepal length) — от 4,3 до 7,9 см.
- Ширина чашелистика (sepal width) — от 2,0 до 4,4 см.
- Длина лепестка (petal length) — от 1,0 до 6,9 см.
- Ширина лепестка (petal width) — от 0,1 до 2,5 см.
¶Целевая переменная
Целевая переменная — вид ириса (Iris setosa, Iris versicolor, Iris virginica). Все три вида являются линейно разделимыми по признакам лепестков, причём Iris setosa легко отделяется от двух других видов, тогда как Iris versicolor и Iris virginica частично перекрываются.
¶Примеры значений
| Длина чашелистика | Ширина чашелистика | Длина лепестка | Ширина лепестка | Вид |
|---|---|---|---|---|
| 5.1 | 3.5 | 1.4 | 0.2 | Iris setosa |
| 5.7 | 2.8 | 4.1 | 1.3 | Iris versicolor |
| 6.3 | 3.3 | 6.0 | 2.5 | Iris virginica |
¶Применение в машинном обучении
Набор данных Фишера является стандартным тестовым набором для алгоритмов классификации. Его популярность обусловлена малым размером (150 образцов, 4 признака), отсутствием пропущенных значений и чёткой структурой, позволяющей наглядно демонстрировать принципы работы методов. Набор используется для:
- Линейного дискриминантного анализа — исходная задача Фишера.
- Метода k-ближайших соседей (k-NN) — классификация по расстоянию до ближайших точек.
- Деревьев решений и случайных лесов — построение решающих правил.
- Метода опорных векторов (SVM) — поиск разделяющей гиперплоскости.
- Нейронных сетей — простейшие задачи многоклассовой классификации.
- Кластеризации — например, метод k-средних, где набор демонстрирует ограничения алгоритма при нелинейно разделимых данных.
Набор также часто используется для визуализации данных, например, с помощью диаграмм рассеяния (scatter plots) или параллельных координат.
¶Критика и ограничения
Несмотря на широкую распространённость, набор данных Фишера имеет ряд недостатков:
- Малый объём — 150 образцов недостаточно для глубокого анализа или обучения сложных моделей без риска переобучения.
- Отсутствие пропусков и выбросов — набор «чистый», что не отражает реальных условий работы с данными.
- Линейная разделимость — задача классификации для Iris setosa тривиальна, что может вводить в заблуждение относительно сложности реальных задач.
- Недостаток разнообразия — все образцы собраны в одном регионе (полуостров Гаспе), что ограничивает обобщаемость.
- Ошибки в данных — некоторые исследователи отмечали возможные неточности в измерениях (например, образец 35 имеет длину чашелистика 4,9 см, что может быть опечаткой).
¶Варианты и расширения
Существуют модификации набора, включающие дополнительные признаки (например, цвет, запах, географические координаты) или увеличенные выборки. В некоторых учебных курсах используется «набор данных ирисов» с добавлением шума или искусственных выбросов для демонстрации устойчивости алгоритмов. Также известен «набор данных ирисов Андерсона» (Anderson’s Iris data set), который иногда путают с набором Фишера, хотя фактически данные были собраны Андерсоном, а Фишер лишь опубликовал их.
¶Интересные факты
- Набор данных Фишера является одним из самых цитируемых в статистической литературе.
- В 2019 году набор был включён в репозиторий UCI Machine Learning Repository как один из «классических» наборов.
- Набор часто используется для демонстрации различий между параметрическими и непараметрическими методами классификации.
- Визуализация данных ирисов (например, диаграмма рассеяния по длине и ширине лепестков) стала хрестоматийным примером в учебниках по анализу данных.
¶Источники
- Fisher, R. A. (1936). «The Use of Multiple Measurements in Taxonomic Problems». Annals of Eugenics, 7(2): 179–188.
- Anderson, E. (1935). «The Irises of the Gaspe Peninsula». Bulletin of the American Iris Society, 59: 2–5.
- UCI Machine Learning Repository — Iris Data Set (https://archive.ics.uci.edu/ml/datasets/iris).
- Hastie, T., Tibshirani, R., Friedman, J. (2009). «The Elements of Statistical Learning». Springer.