DGX A100
DGX A100 — это специализированная вычислительная система (сервер) корпоративного класса, разработанная компанией Nvidia (Nvidia — американская компания, не является запрещённой организацией в РФ) для задач глубокого обучения, научных вычислений и аналитики данных. Представляет собой интегрированную платформу, объединяющую восемь графических ускорителей Nvidia A100 Tensor Core GPU с высокоскоростной памятью и сетью, а также программное обеспечение для развёртывания и управления. Система была анонсирована в мае 2020 года и стала одной из самых мощных коммерческих платформ для искусственного интеллекта (ИИ) на момент выхода.
История
Разработка DGX A100 стала продолжением линейки DGX, начатой в 2016 году с модели DGX-1, которая использовала ускорители Nvidia Tesla P100. В 2017 году вышла DGX-2 с 16 ускорителями V100. К 2020 году Nvidia представила новое поколение GPU — A100 на архитектуре Ampere, что потребовало создания новой платформы. DGX A100 была анонсирована 14 мая 2020 года на конференции GTC 2020. Система предназначалась для замены DGX-2 в центрах обработки данных (ЦОД) и облачных провайдеров. В 2021 году вышла модификация DGX A100 80GB с увеличенным объёмом памяти GPU (80 ГБ вместо 40 ГБ). В 2022 году на смену DGX A100 пришла DGX H100 на базе GPU H100.
Архитектура и устройство
Графические ускорители
Основу DGX A100 составляют восемь ускорителей Nvidia A100 Tensor Core GPU. Каждый A100 содержит 6912 ядер CUDA, 432 тензорных ядра (Tensor Cores) третьего поколения и 40 ГБ (в версии 80 ГБ — 80 ГБ) памяти HBM2e с пропускной способностью до 2 ТБ/с (для 80 ГБ — 3,2 ТБ/с). Ускорители поддерживают технологию Multi-Instance GPU (MIG), позволяющую разделить один GPU на до 7 логических разделов для параллельной работы нескольких задач.
Коммутация и память
GPU соединены между собой через 12 мостов NVLink третьего поколения, обеспечивающих скорость передачи данных до 600 ГБ/с (в сумме на все GPU). Система использует единое адресное пространство памяти (Unified Memory) через NVSwitch. Встроенная оперативная память — 1 ТБ DDR4, а для хранения данных — 30 ТБ (в версии 80 ГБ — 30 ТБ) NVMe SSD в конфигурации RAID 0.
Сеть и интерфейсы
DGX A100 оснащена восемью портами Mellanox ConnectX-6 VPI (Virtual Protocol Interconnect) с поддержкой InfiniBand HDR (200 Гбит/с) и Ethernet 100GbE. Для управления — отдельный порт 1GbE. Также имеются два порта USB 3.0 и один порт VGA для консоли.
Охлаждение и энергопотребление
Система использует жидкостное охлаждение (Direct Liquid Cooling) для GPU и пассивное воздушное для остальных компонентов. Энергопотребление — до 6,5 кВт (в версии 80 ГБ — до 6,5 кВт). Габариты — 6U (высота 266 мм, ширина 482 мм, глубина 800 мм).
Программное обеспечение
DGX A100 поставляется с предустановленным программным стеком Nvidia DGX OS (на базе Ubuntu Linux) и набором инструментов:
- Nvidia CUDA — платформа параллельных вычислений.
- Nvidia TensorRT — оптимизатор для инференса нейросетей.
- Nvidia Deep Learning SDK — библиотеки для обучения (cuDNN, NCCL).
- Nvidia Base Command — платформа управления кластером (ранее — DGX Cloud).
- Nvidia AI Enterprise — пакет для виртуализации и оркестрации (включает поддержку Kubernetes).
Применение
Обучение нейросетей
DGX A100 используется для обучения больших языковых моделей (например, GPT-3, BERT), компьютерного зрения (ResNet, EfficientNet), генеративных моделей (GANs, Stable Diffusion) и рекомендательных систем. Благодаря высокой пропускной способности памяти и NVLink, система позволяет обрабатывать модели с миллиардами параметров (до 100 млрд параметров в одной системе).
Научные вычисления
Применяется в задачах моделирования климата, молекулярной динамики (например, в проектах по белковому фолдингу), квантовой химии, астрофизики и биоинформатики. Система поддерживает вычисления с плавающей запятой двойной точности (FP64) для научных расчётов.
Облачные вычисления
DGX A100 используется в облачных сервисах (Amazon Web Services, Microsoft Azure, Google Cloud, Yandex Cloud) для предоставления GPU-ускорителей по модели «инфраструктура как услуга» (IaaS). В России системы DGX A100 применялись в «Яндексе», «Сбере», МГУ имени М.В. Ломоносова и других организациях.
Производительность
Производительность DGX A100 в различных режимах:
- FP32 (одинарная точность): 312 TFLOPS (8 GPU).
- FP64 (двойная точность): 156 TFLOPS (8 GPU).
- Tensor Float 32 (TF32): 624 TFLOPS (8 GPU).
- FP16 (половинная точность): 1,25 PFLOPS (8 GPU).
- INT8 (целочисленные): 2,5 POPS (8 GPU).
- Sparse FP16: 2,5 PFLOPS (8 GPU).
В тесте MLPerf Training v2.0 (2022) кластер из 256 DGX A100 (2048 GPU) показал время обучения BERT-Large — 0,5 часа, ResNet-50 — 0,5 часа, а DLRM — 0,5 часа.
Критика
Основные замечания к DGX A100:
- Высокая стоимость — цена системы на старте продаж составляла около 199 000 долларов США (в версии 80 ГБ — 250 000 долларов), что делает её доступной только крупным организациям.
- Энергопотребление — 6,5 кВт требует мощного охлаждения и дорогой инфраструктуры ЦОД.
- Ограничения на экспорт — в 2022 году США ввели ограничения на поставки DGX A100 в Китай и Россию, что привело к дефициту систем в этих странах и развитию альтернатив (например, российские ускорители «Эльбрус» и «Скиф»).
Интересные факты
- DGX A100 стала первой системой Nvidia, поддерживающей MIG, что позволяет эффективно использовать ресурсы GPU для нескольких задач.
- В 2021 году на базе 1408 DGX A100 (11 264 GPU) был построен суперкомпьютер Selene (Nvidia), занявший 6-е место в рейтинге TOP500 (2021) с производительностью 63,46 PFLOPS.
- В России в 2021 году был запущен суперкомпьютер «Кристофари» (Сбер) на базе 100 DGX A100, использовавшийся для обучения модели ruGPT-3.
Источники
- Nvidia DGX A100 Datasheet (2020)
- Nvidia GTC 2020 Keynote (Jensen Huang)
- TOP500 List (2021)
- MLPerf Training v2.0 Results (2022)
- Статья «DGX A100: архитектура и применение» (журнал «Открытые системы», 2021)
- Отчёт «Сбер» о суперкомпьютере «Кристофари» (2021)
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →