Открыть сервис

Databricks

Databricks — это американская компания-разработчик одноимённой облачной платформы для обработки больших данных, машинного обучения и искусственного интеллекта. Платформа Databricks построена на основе технологии Apache Spark и предоставляет инструменты для инженеров данных, аналитиков и специалистов по машинному обучению. Компания основана в 2013 году создателями Apache Spark, Apache Delta Lake и MLflow.

История

Компания Databricks была основана в 2013 году в Беркли, Калифорния, группой исследователей из Калифорнийского университета в Беркли, которые ранее разработали Apache Spark — распределённую вычислительную систему для обработки больших данных. Основателями стали Али Годси, Матеи Захария, Патрик Венделл, Ион Стюарт, Рейнольд Синь, Энди Конвински и Арслан Ташбирек. Изначально проект назывался Spark Notebook и был ориентирован на упрощение работы с Apache Spark.

В 2014 году компания привлекла первый раунд инвестиций в размере 13,9 миллиона долларов от венчурных фондов Andreessen Horowitz и Data Collective. В 2015 году вышла первая публичная версия платформы Databricks. В 2016 году компания представила технологию Delta Lake — открытый формат хранения данных, обеспечивающий ACID-транзакции и версионирование данных.

В 2020 году Databricks выпустила MLflow — платформу с открытым исходным кодом для управления жизненным циклом моделей машинного обучения. В 2021 году компания привлекла 1,6 миллиарда долларов в раунде финансирования, достигнув оценки в 38 миллиардов долларов. В 2023 году Databricks запустила собственную языковую модель Dolly и инструменты для работы с генеративным искусственным интеллектом.

Архитектура платформы

Платформа Databricks представляет собой облачную среду, работающую на базе Apache Spark, и включает несколько ключевых компонентов:

Databricks Runtime

Databricks Runtime — это оптимизированная версия Apache Spark, которая включает улучшения производительности, безопасности и надёжности. В состав Runtime входят предустановленные библиотеки для машинного обучения, такие как TensorFlow, PyTorch, scikit-learn, а также инструменты для работы с данными, включая Pandas и NumPy.

Databricks Lakehouse

Архитектура Lakehouse, предложенная Databricks, объединяет возможности озёр данных (data lakes) и хранилищ данных (data warehouses). Она позволяет хранить неструктурированные, полуструктурированные и структурированные данные в едином репозитории, обеспечивая при этом ACID-транзакции, поддержку SQL-запросов и возможность прямого доступа к данным для машинного обучения.

Delta Lake

Delta Lake — это открытый формат хранения данных, который обеспечивает:

  • ACID-транзакции (атомарность, согласованность, изоляция, долговечность)
  • Версионирование данных и возможность отката изменений
  • Эффективную обработку потоковых и пакетных данных
  • Поддержку схем данных и их эволюцию

MLflow

MLflow — это платформа с открытым исходным кодом для управления жизненным циклом моделей машинного обучения, включающая:

  • Отслеживание экспериментов (MLflow Tracking)
  • Упаковку моделей в воспроизводимые форматы (MLflow Projects)
  • Управление моделями и их развёртывание (MLflow Models)
  • Регистрацию и версионирование моделей (MLflow Model Registry)

Основные компоненты платформы

Databricks Workspace

Рабочее пространство (workspace) — это веб-интерфейс для управления проектами, ноутбуками, кластерами и данными. Пользователи могут создавать и редактировать ноутбуки на языках Python, R, Scala и SQL, а также визуализировать результаты анализа.

Databricks Clusters

Кластеры — это группы вычислительных узлов, которые выполняют обработку данных. Databricks поддерживает:

Databricks SQL

Databricks SQL — это сервис для выполнения SQL-запросов к данным, хранящимся в Lakehouse. Он включает:

  • SQL-редактор с автодополнением
  • Визуализацию результатов запросов
  • Поддержку стандартных SQL-функций и оконных выражений
  • Интеграцию с BI-инструментами (Tableau, Power BI, Looker)

Databricks Machine Learning

Databricks Machine Learning — это набор инструментов для построения, обучения и развёртывания моделей машинного обучения, включающий:

Применение

Платформа Databricks используется в различных отраслях и сценариях:

Обработка больших данных

Databricks применяется для ETL-процессов (извлечение, преобразование, загрузка), агрегации и анализа больших объёмов данных, включая потоковую обработку в реальном времени.

Машинное обучение и искусственный интеллект

Платформа используется для построения моделей машинного обучения, включая нейронные сети, градиентный бустинг, регрессионные модели и модели временных рядов. Databricks также поддерживает обучение больших языковых моделей (LLM) и генеративного ИИ.

Аналитика и бизнес-отчётность

Databricks SQL позволяет выполнять аналитические запросы к данным, создавать дашборды и интегрироваться с BI-инструментами.

Научные исследования

Платформа используется в академических и исследовательских проектах для обработки данных, моделирования и симуляции.

Критика и ограничения

Несмотря на широкое распространение, платформа Databricks подвергается критике по нескольким направлениям:

  • Стоимость: использование Databricks может быть дорогим, особенно при работе с большими объёмами данных и интенсивных вычислениях.
  • Зависимость от облачных провайдеров: платформа тесно интегрирована с облачными сервисами AWS, Azure и GCP, что может создавать зависимость от конкретного поставщика.
  • Сложность настройки: для эффективного использования Databricks требуется глубокое понимание архитектуры Apache Spark и распределённых вычислений.
  • Проблемы с безопасностью: в прошлом были выявлены уязвимости, связанные с управлением доступом и шифрованием данных.

Конкуренты

Основными конкурентами Databricks на рынке платформ для обработки данных и машинного обучения являются:

  • Snowflake — облачная платформа для хранения и анализа данных
  • Google BigQuery — серверная аналитическая база данных от Google
  • Amazon Redshift — облачное хранилище данных от Amazon Web Services
  • Microsoft Azure Synapse Analytics — аналитическая платформа от Microsoft
  • Cloudera — платформа для обработки больших данных на основе Hadoop

Интересные факты

  • Название компании происходит от объединения слов «data» (данные) и «bricks» (кирпичи), что символизирует построение аналитических решений из отдельных компонентов данных.
  • Databricks является одним из крупнейших спонсоров проектов Apache Spark, Delta Lake и MLflow.
  • В 2021 году компания приобрела стартап Redash, специализирующийся на визуализации данных, для расширения функциональности Databricks SQL.
  • В 2023 году Databricks запустила собственную языковую модель Dolly, основанную на архитектуре GPT-J, которая доступна с открытым исходным кодом.

Источники

  • Официальный сайт Databricks: документация и блоги компании
  • Книга «Learning Spark» (2-е издание) — Jules Damji, Brooke Wenig, Tathagata Das, Denny Lee
  • Книга «Delta Lake: The Definitive Guide» — Denny Lee, Tristen Wentling, Scott Haines
  • Статья «Lakehouse: A New Generation of Open Platforms that Unify Data Warehousing and Advanced Analytics» — Michael Armbrust, Ali Ghodsi, Reynold Xin, Matei Zaharia (2019)
  • Отчёты аналитических компаний Gartner, Forrester, IDC за 2020–2024 годы
  • Публикации в журналах IEEE Spectrum, TechCrunch, VentureBeat
  • Материалы конференций Spark Summit, Data + AI Summit

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →