Открыть сервис

Yandex DataSphere

Yandex DataSphere — это облачный сервис для машинного обучения и анализа данных, предоставляемый компанией «Яндекс» в составе платформы Yandex Cloud. Сервис предназначен для полного цикла работы с данными: от их загрузки и разведочного анализа до обучения, валидации и развёртывания моделей машинного обучения в продуктивную среду. DataSphere ориентирован на data scientist’ов, аналитиков и разработчиков, позволяя выполнять вычисления на GPU и CPU без необходимости управления инфраструктурой.

История

Разработка Yandex DataSphere началась в 2019 году как внутреннего инструмента команды «Яндекса» для ускорения работы с моделями машинного обучения. В 2020 году сервис был представлен широкой аудитории в рамках платформы Yandex Cloud. Первоначально DataSphere позиционировался как альтернатива популярным средам разработки вроде Jupyter Notebook, но с интеграцией в облачную экосистему «Яндекса». В 2021 году была добавлена поддержка работы с GPU (графическими процессорами), что позволило обучать нейросетевые модели непосредственно в облаке. В 2022 году сервис получил функционал автоматического масштабирования вычислительных ресурсов и интеграцию с системами управления версиями моделей (MLflow). В 2023 году в DataSphere появилась возможность использования серверных вычислений (Serverless) для инференса моделей, а также поддержка фреймворков PyTorch и TensorFlow. На 2024 год сервис продолжает развиваться, добавляя инструменты для MLOps и автоматизации пайплайнов.

Основные возможности

Среда разработки

DataSphere предоставляет веб-интерфейс на основе JupyterLab, где пользователи могут создавать и редактировать ноутбуки (notebooks) на языках Python, R и SQL. Среда поддерживает автодополнение кода, встроенный терминал и визуализацию данных. Все ноутбуки хранятся в облачном хранилище Yandex Object Storage, что обеспечивает их доступность с любого устройства.

Вычислительные ресурсы

Пользователь может выбирать конфигурации виртуальных машин (VM) для выполнения вычислений:

  • CPU-конфигурации: от 1 vCPU до 16 vCPU с объёмом RAM от 2 ГБ до 64 ГБ.
  • GPU-конфигурации: одна или несколько видеокарт NVIDIA Tesla V100, T4 или A100 (в зависимости от региона и тарифа).
  • Serverless-режим: для инференса моделей ресурсы выделяются автоматически и оплачиваются только за время выполнения запроса.

Управление проектами

Проекты в DataSphere объединяют ноутбуки, данные, модели и настройки окружения. Для каждого проекта можно задать:

  • Окружение (Docker-образ): предустановленные библиотеки (scikit-learn, TensorFlow, PyTorch, XGBoost и др.) или пользовательский образ.
  • Переменные окружения: для хранения ключей доступа к сервисам.
  • Секреты: для безопасного хранения паролей и токенов.

Интеграция с сервисами Yandex Cloud

DataSphere тесно интегрирован с другими сервисами облачной платформы:

  • Yandex Object Storage: для хранения наборов данных и результатов.
  • Yandex Managed Service for PostgreSQL и Yandex Managed Service for ClickHouse: для работы с базами данных.
  • Yandex Data Proc: для запуска распределённых вычислений на Spark.
  • Yandex SpeechKit и Yandex Vision: для использования предобученных моделей.

Развёртывание моделей

После обучения модели можно развернуть в продуктивную среду через:

  • Node (сервис инференса): создание API-эндпоинта для получения предсказаний в реальном времени.
  • Batch-инференс: обработка больших объёмов данных по расписанию.
  • Serverless-инференс: автоматическое масштабирование под нагрузку.

Классификация

Yandex DataSphere можно классифицировать по нескольким признакам:

ПризнакТипОписание
По модели предоставленияSaaS (Software as a Service)Полностью управляемый облачный сервис
По функционалуIDE + MLOps-платформаОбъединяет среду разработки и инструменты для жизненного цикла ML
По целевой аудиторииData Scientist, ML-инженер, аналитикДля специалистов, работающих с данными
По типу вычисленийCPU/GPU/ServerlessПоддержка различных вычислительных мощностей

Применение

Обучение моделей машинного обучения

DataSphere используется для обучения моделей классификации, регрессии, кластеризации, а также нейросетей. Благодаря GPU-конфигурациям возможно обучение глубоких нейронных сетей (CNN, RNN, Transformer) на наборах данных объёмом до нескольких терабайт.

Разведочный анализ данных (EDA)

Среда позволяет выполнять визуализацию данных с помощью библиотек Matplotlib, Seaborn, Plotly, а также проводить статистические тесты. Интеграция с Yandex DataLens (сервис бизнес-аналитики) упрощает создание дашбордов.

Прототипирование и эксперименты

DataSphere подходит для быстрого прототипирования моделей: пользователь может запускать ячейки ноутбука, экспериментировать с гиперпараметрами и сразу видеть результаты. Встроенная система версионирования ноутбуков позволяет отслеживать изменения.

Промышленное развёртывание

Сервис поддерживает CI/CD-пайплайны для моделей: после обучения модель можно упаковать в Docker-образ, протестировать и развернуть на Node. Это позволяет использовать DataSphere в production-средах.

Примеры использования

Пример 1: Классификация текстов

Компания, занимающаяся модерацией контента, использует DataSphere для обучения модели на основе BERT. Данные загружаются из Yandex Object Storage, модель обучается на GPU T4, затем развёртывается как Node. API-эндпоинт интегрируется с системой модерации.

Пример 2: Прогнозирование спроса

Ритейлер использует DataSphere для построения модели временных рядов (Prophet, ARIMA). Данные о продажах хранятся в Yandex Managed Service for PostgreSQL. Модель обучается на CPU, затем результаты визуализируются в Yandex DataLens.

Пример 3: Обработка изображений

Медицинская лаборатория применяет DataSphere для обучения нейросети сегментации снимков МРТ. Используются GPU V100, данные хранятся в Object Storage. После обучения модель развёртывается как Serverless-функция для обработки новых снимков.

Ограничения и критика

Зависимость от экосистемы «Яндекса»

DataSphere тесно связан с Yandex Cloud, что может создавать vendor lock-in (зависимость от одного поставщика). Перенос проектов на другие платформы (AWS, Google Cloud) требует адаптации.

Стоимость

Хотя сервис предлагает бесплатный тариф с ограниченными ресурсами, активное использование GPU-конфигураций может быть дорогим для малых компаний. Стоимость вычислений на GPU в 3–5 раз выше, чем на CPU.

Ограниченная поддержка фреймворков

На 2024 год DataSphere поддерживает только Python, R и SQL. Для пользователей, работающих на Julia или Scala, сервис не подходит. Также отсутствует встроенная поддержка Apache Spark (требуется интеграция с Yandex Data Proc).

Производительность

При работе с большими наборами данных (сотни гигабайт) скорость загрузки из Object Storage может быть ниже, чем у локальных SSD. Это замедляет EDA и обучение.

Интересные факты

  • DataSphere изначально разрабатывался как внутренний инструмент для команды «Яндекс.Маркета» для построения рекомендательных систем.
  • В 2022 году сервис получил награду «Лучший облачный продукт для ML» на конференции DataFest.
  • DataSphere поддерживает работу с моделями из Hugging Face Hub — пользователи могут загружать предобученные модели напрямую.
  • Сервис имеет встроенный мониторинг использования ресурсов и затрат, что позволяет контролировать бюджет.

Источники

  • Документация Yandex Cloud: «Yandex DataSphere — обзор сервиса» (2024)
  • Официальный блог Yandex Cloud: «Запуск DataSphere: облачные ноутбуки для ML» (2020)
  • Статья на Habr: «Yandex DataSphere: как мы строили облачную IDE для data science» (2021)
  • Презентация на конференции YaC: «ML в облаке: опыт использования DataSphere» (2023)
  • Отчёт Gartner: «Cloud AI Developer Services Market Guide» (2023)

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →