Открыть сервис

Большие данные: понятие и применение

Большие данные (англ. big data) — совокупность подходов, инструментов и методов обработки структурированных и неструктурированных данных огромных объёмов и значительного многообразия, которые не могут быть обработаны традиционными системами управления базами данных. Термин также обозначает сами массивы данных, характеризующиеся высокой скоростью накопления, большим объёмом и разнообразием форматов.

Определение и критерии

Единого общепринятого определения термина не существует. Наиболее распространённым является описание через «три V» — характеристики, сформулированные аналитиком Дугом Лэни в 2001 году:

  • Volume (объём) — физический размер накапливаемых данных, измеряемый в терабайтах и петабайтах.
  • Velocity (скорость) — высокая скорость поступления и обработки информации, часто в режиме реального времени.
  • Variety (многообразие) — одновременная работа с текстами, изображениями, видео, данными датчиков, логами и другими форматами.

Позднее к этим характеристикам добавляли другие «V»: достоверность (veracity), изменчивость (variability), ценность (value). Однако базовым остаётся набор из трёх признаков. Критически важным является то, что данные не помещаются в оперативной памяти одного компьютера и требуют распределённой обработки на кластерах.

История развития

Концепция больших данных сформировалась в середине 2000-х годов, когда объёмы информации, генерируемой интернет-сервисами, превысили возможности традиционных реляционных баз данных. Ключевым событием стало появление в 2004 году технологии MapReduce, разработанной в компании Google для параллельной обработки больших массивов данных на множестве машин.

В 2006 году вышел Apache Hadoop — открытая реализация MapReduce, созданная Дугом Каттингом. Hadoop позволил хранить и обрабатывать данные на недорогих серверных кластерах, что сделало технологию доступной для широкого круга организаций. Дальнейшее развитие связано с появлением систем распределённых вычислений Apache Spark (2010), потоковой обработки Apache Kafka, а также NoSQL-баз данных (Cassandra, MongoDB, HBase).

Технологическая архитектура

Обработка больших данных строится на принципах горизонтального масштабирования — увеличения числа серверов, а не их мощности. Основные компоненты экосистемы:

Методы анализа

Для извлечения знаний из больших данных применяются методы машинного обучения, статистического анализа и интеллектуального анализа данных (data mining). Среди типовых задач:

  • Классификация и кластеризация — отнесение объектов к категориям и группировка схожих записей.
  • Прогнозирование — предсказание показателей на основе исторических данных.
  • Обнаружение аномалий — выявление отклонений от нормы (например, мошеннических транзакций).
  • Анализ графов — изучение связей между объектами, включая социальные сети.

Применение

Большие данные используются в коммерческом и государственном секторах:

Проблемы и ограничения

Внедрение технологий больших данных сопряжено с рядом сложностей. Высокие затраты на инфраструктуру и квалифицированный персонал делают проекты дорогостоящими. Существует проблема «мусор на входе — мусор на выходе»: результаты анализа напрямую зависят от качества исходных данных. Также актуальны вопросы безопасности и конфиденциальности: сбор и обработка персональных данных регулируются законодательством, в том числе Федеральным законом «О персональных данных» в России.

Критики отмечают, что корреляционные зависимости, выявляемые в больших данных, не всегда отражают причинно-следственные связи, что может приводить к ошибочным выводам. Кроме того, значительная часть накопленных данных никогда не анализируется, что ставит вопрос об эффективности их хранения.

Перспективы

Развитие больших данных связано с интеграцией с искусственным интеллектом, особенно генеративными моделями, которые требуют огромных обучающих выборок. Распространение облачных вычислений снижает порог входа для малого бизнеса. Ожидается рост роли потоковой обработки данных и развития граничных вычислений, приближающих анализ к источникам информации.

Источники

  • Лэни Д. «3D Data Management: Controlling Data Volume, Velocity and Variety» (2001).
  • Документация Apache Hadoop и Apache Spark.
  • Майер-Шенбергер В., Кукьер К. «Большие данные. Революция, которая изменит то, как мы живём, работаем и мыслим» (2013).
  • Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных».

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →