Открыть сервисСервис

Oracle Big Data Service

Oracle Big Data Service — это облачный сервис на платформе Oracle Cloud Infrastructure (OCI), предназначенный для развёртывания, управления и масштабирования кластеров обработки больших данных. Сервис предоставляет предварительно настроенные среды для работы с Apache Hadoop, Apache Spark, Apache Hive и другими компонентами экосистемы Hadoop, автоматизируя задачи администрирования инфраструктуры, такие как установка, обновление, мониторинг и обеспечение безопасности.

История и развитие

Сервис был анонсирован корпорацией Oracle в 2017 году как часть стратегии по предоставлению решений для больших данных в облачной среде. Первоначально Oracle Big Data Service был ориентирован на интеграцию с собственными продуктами Oracle, включая Oracle Database и Oracle Big Data Appliance (физическое устройство для обработки больших данных). В 2019 году, с выходом новой версии на базе Oracle Cloud Infrastructure, сервис получил поддержку кластеров с высокой доступностью, автоматическое масштабирование и улучшенную интеграцию с объектным хранилищем OCI Object Storage.

В 2020–2021 годах Oracle расширила функциональность сервиса, добавив поддержку Apache Spark 3.0, Apache Hive 3.0 и Apache HBase 2.0. В 2023 году была представлена возможность развёртывания кластеров с использованием контейнеров на базе Kubernetes, что позволило упростить управление ресурсами и повысить гибкость конфигураций.

Архитектура и компоненты

Oracle Big Data Service построен на основе распределённой архитектуры, включающей следующие ключевые компоненты:

  • Кластеры — наборы виртуальных машин (узлов), объединённых в единую вычислительную среду. Каждый кластер состоит из главных узлов (master nodes), на которых размещаются управляющие службы (NameNode, ResourceManager), и рабочих узлов (worker nodes), выполняющих обработку данных.
  • Хранилище — данные могут храниться как на локальных дисках узлов кластера (HDFS), так и в объектном хранилище OCI Object Storage, которое обеспечивает неограниченный объём и высокую надёжность.
  • Сетевые компоненты — кластеры развёртываются в виртуальных облачных сетях (VCN) OCI, что позволяет настраивать изоляцию, межсетевые экраны и VPN-подключения.
  • Управляющий слой — включает консоль OCI, API и интерфейс командной строки (CLI) для создания, мониторинга и управления кластерами.

Основные компоненты экосистемы Hadoop

  • Apache Hadoop — базовая платформа для распределённой обработки данных, включающая HDFS (Hadoop Distributed File System) и MapReduce.
  • Apache Spark — движок для обработки данных в памяти, поддерживающий пакетную и потоковую обработку, машинное обучение и анализ графов.
  • Apache Hiveсистема управления базами данных на основе Hadoop, предоставляющая SQL-подобный язык запросов (HiveQL) для анализа данных.
  • Apache HBase — распределённая, отказоустойчивая NoSQL-база данных, работающая поверх HDFS.
  • Apache Oozie — система управления рабочими процессами (workflow) для задач Hadoop.
  • Apache ZooKeeper — сервис координации, используемый для управления конфигурациями и синхронизации узлов кластера.

Классификация и типы кластеров

Oracle Big Data Service поддерживает несколько типов кластеров, различающихся по конфигурации и назначению:

  • Кластеры с фиксированным размером — имеют заранее заданное количество узлов (например, 3, 5, 10 узлов) и подходят для тестовых и небольших рабочих нагрузок.
  • Кластеры с автоматическим масштабированием — могут динамически увеличивать или уменьшать количество рабочих узлов в зависимости от загрузки, что позволяет оптимизировать затраты.
  • Кластеры с высокой доступностью — включают резервные главные узлы, которые автоматически перехватывают управление при отказе основного узла, обеспечивая минимальное время простоя.

Применение

Oracle Big Data Service используется в различных сценариях обработки больших данных:

  • Анализ данных — выполнение сложных запросов и отчётов на больших объёмах структурированных и неструктурированных данных с помощью Apache Hive и Apache Spark.
  • Машинное обучение — обучение моделей и выполнение прогнозной аналитики с использованием библиотек машинного обучения Spark MLlib.
  • Потоковая обработка — обработка данных в реальном времени из источников, таких как Apache Kafka, с помощью Spark Streaming.
  • Интеграция с базами данных Oracle — загрузка данных из Oracle Database в кластеры Hadoop для последующего анализа, а также выгрузка результатов обратно.
  • Хранение и архивирование — использование объектного хранилища OCI для долгосрочного хранения больших объёмов данных с возможностью быстрого доступа.

Преимущества и ограничения

Преимущества

  • Автоматизация управления — Oracle Big Data Service автоматизирует установку, обновление и настройку компонентов Hadoop, что снижает нагрузку на системных администраторов.
  • Масштабируемость — возможность быстрого увеличения или уменьшения вычислительных ресурсов без перерыва в работе.
  • Безопасность — встроенные механизмы аутентификации, авторизации и шифрования данных, включая интеграцию с Oracle Identity and Access Management (IAM).
  • Интеграция с экосистемой Oracle — сервис тесно связан с другими продуктами Oracle, такими как Oracle Autonomous Database, Oracle Data Integration и Oracle Analytics Cloud.
  • Гибкость хранения — поддержка как локального хранилища HDFS, так и объектного хранилища OCI, что позволяет выбирать оптимальный вариант для конкретной задачи.

Ограничения

  • Зависимость от платформы OCI — сервис доступен только в облачной инфраструктуре Oracle, что может ограничивать его использование в мультиоблачных средах.
  • Стоимость — при больших объёмах данных и длительных рабочих нагрузках затраты могут быть выше по сравнению с некоторыми альтернативными решениями, такими как Amazon EMR или Google Cloud Dataproc.
  • Сложность миграции — перенос существующих Hadoop-кластеров из других облачных платформ или локальных сред может потребовать значительных усилий по настройке и адаптации.

Интеграция с другими сервисами Oracle

Oracle Big Data Service интегрируется с рядом других сервисов Oracle Cloud Infrastructure:

  • OCI Object Storage — используется как основное хранилище данных для кластеров, обеспечивая неограниченный объём и высокую надёжность.
  • OCI Data Flow — сервис для выполнения Spark-задач без управления кластером, который может дополнять Big Data Service.
  • OCI Data Catalog — каталог данных, позволяющий управлять метаданными и облегчать поиск и анализ данных.
  • Oracle Autonomous Database — база данных, которая может напрямую запрашивать данные, хранящиеся в кластерах Hadoop, с помощью технологии Oracle Big Data SQL.
  • Oracle Analytics Cloud — платформа для бизнес-аналитики, которая может подключаться к кластерам Big Data Service для визуализации и отчётов.

Примеры использования

  • Ритейл — анализ покупательских корзин и прогнозирование спроса на основе исторических данных о продажах.
  • Финансы — выявление мошеннических транзакций в реальном времени с использованием потоковой обработки Spark.
  • Телекоммуникации — обработка логов сетевых устройств для оптимизации работы сети и предотвращения сбоев.
  • Здравоохранение — анализ медицинских записей и данных клинических исследований для выявления закономерностей и улучшения диагностики.

Источники

  1. Oracle Cloud Infrastructure Documentation. «Oracle Big Data Service Overview». Oracle Corporation, 2024.
  2. Oracle Corporation. «Oracle Big Data Service: A Technical Overview». White Paper, 2023.
  3. Oracle Corporation. «Oracle Big Data Service: Release Notes». Oracle Cloud Infrastructure, 2024.
  4. Oracle Corporation. «Oracle Big Data Service: Pricing and Features». Oracle Cloud Infrastructure, 2024.
  5. Oracle Corporation. «Oracle Big Data Service: Integration with Oracle Autonomous Database». Oracle Cloud Infrastructure, 2023.
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru