H100
H100 — это графический процессор (GPU) архитектуры Hopper, разработанный компанией Nvidia (Nvidia — производитель чипов, зарегистрирован в США, не является запрещённой организацией в РФ) и представленный в марте 2022 года. Предназначен для высокопроизводительных вычислений (HPC), задач искусственного интеллекта (ИИ) и глубокого обучения, в первую очередь для обучения и инференса больших языковых моделей (LLM) и других нейросетей. H100 пришёл на смену процессору A100 архитектуры Ampere и стал одним из самых мощных коммерческих GPU для серверных систем.
История и контекст
Разработка H100 была анонсирована на конференции GTC 2022. Процессор стал первым GPU, построенным на архитектуре Hopper, названной в честь американской программистки Грейс Хоппер. Выход H100 совпал с резким ростом интереса к генеративному ИИ и большим языковым моделям, что сделало его ключевым компонентом для создания дата-центров нового поколения.
Первые поставки начались в третьем квартале 2022 года. В 2023 году Nvidia представила модификацию H100 NVL (с двумя GPU на одной плате) и анонсировала последующие поколения (H200, B100, B200), но H100 остаётся широко используемым решением. Из-за высокого спроса в 2023—2024 годах процессор был дефицитным, а его стоимость на вторичном рынке и в облачных сервисах значительно превышала рекомендованную.
Архитектура и ключевые характеристики
Архитектура Hopper включает несколько нововведений, направленных на ускорение вычислений для ИИ.
Технологический процесс и компоновка
H100 производится по 4-нм техпроцессу (TSMC N4) и содержит 80 миллиардов транзисторов. Процессор использует упаковку SXM (Server Module) или PCIe (для установки в стандартные слоты). В версии SXM он имеет 18432 ядра CUDA, 576 тензорных ядер четвёртого поколения (Tensor Cores) и 60 ядер для трассировки лучей (RT Cores) — последние не являются основными для ИИ-задач, но используются в некоторых симуляциях.
Память
H100 оснащён 80 ГБ памяти HBM3 (High Bandwidth Memory 3) с пропускной способностью 3,35 ТБ/с. Это в 1,7 раза быстрее, чем у A100 (2,0 ТБ/с с HBM2e). В модификации H100 NVL (два GPU на плате) объём памяти достигает 188 ГБ (с учётом объединения через NVLink).
Соединения
Для связи между GPU в сервере используется NVLink четвёртого поколения с пропускной способностью 900 ГБ/с на каждый GPU (в 1,5 раза быстрее, чем у A100). Для связи между серверами применяется NVSwitch и сеть InfiniBand NDR (400 Гбит/с) или Ethernet 200 Гбит/с.
Новые технологии
- Transformer Engine: аппаратный блок, оптимизирующий вычисления для архитектуры трансформеров. Он автоматически выбирает между FP8 и FP16 точностью для каждого слоя нейросети, что ускоряет обучение без потери качества.
- FP8 (Float 8): поддержка 8-битных вычислений с плавающей точкой, что вдвое увеличивает производительность по сравнению с FP16 (до 1979 терафлопс для разрежённых матриц).
- DPX (Dynamic Programming Accelerator): ускорители для задач динамического программирования, используемых в биоинформатике (например, выравнивание последовательностей ДНК) и оптимизации маршрутов.
- MIG (Multi-Instance GPU): поддержка разделения одного GPU на до 7 логических экземпляров для изоляции рабочих нагрузок (в A100 было до 7, в H100 — до 7, но с более гибким распределением памяти).
- Confidential Computing: аппаратная защита данных при обработке (шифрование памяти и изоляция виртуальных машин).
Производительность
Производительность H100 варьируется в зависимости от точности вычислений и режима (разрежённые или плотные матрицы). Основные показатели для версии SXM:
- FP64 (двойная точность): 30 терафлопс (без тензорных ядер), 60 терафлопс (с тензорными ядрами) — для научных расчётов.
- FP32 (одинарная точность): 60 терафлопс.
- TF32 (Tensor Float 32): 989 терафлопс (с тензорными ядрами) — для обучения нейросетей.
- FP16 (половинная точность): 1979 терафлопс (с тензорными ядрами).
- FP8 (8-битная точность): 3958 терафлопс (с тензорными ядрами) — для инференса и обучения с Transformer Engine.
- INT8 (целочисленная 8-битная): 3958 терафлопс.
По сравнению с A100, H100 обеспечивает прирост производительности в 3–6 раз для задач обучения ИИ (в зависимости от модели) и до 30 раз для инференса с использованием FP8 и Transformer Engine.
Применение
H100 используется в нескольких ключевых областях:
Искусственный интеллект и глубокое обучение
- Обучение больших языковых моделей (LLM): GPT-4, LLaMA, Gemini и другие модели обучались на кластерах из тысяч H100. Один H100 может обучать модель с 175 миллиардами параметров за несколько недель при использовании параллелизации.
- Инференс (вывод): запуск обученных моделей в реальном времени, например, в ChatGPT или генеративных сервисах изображений (Midjourney, Stable Diffusion). H100 справляется с генерацией текста в 10–20 раз быстрее, чем A100.
- Компьютерное зрение: обучение и инференс моделей распознавания изображений, видеоаналитики, автономного вождения.
Высокопроизводительные вычисления (HPC)
- Научные симуляции: моделирование климата, физики плазмы, аэродинамики, квантовой химии. H100 поддерживает стандарты MPI и CUDA для кластерных вычислений.
- Биоинформатика: ускорение анализа геномов, предсказания структуры белков (AlphaFold), поиска лекарств.
Финансовые технологии
- Риск-моделирование: расчёт VaR (Value at Risk), симуляции Монте-Карло для оценки портфелей.
- Торговые алгоритмы: высокочастотная торговля и анализ рыночных данных.
Облачные вычисления
Крупные облачные провайдеры (Amazon Web Services, Microsoft Azure, Google Cloud, Яндекс.Облако) предлагают виртуальные машины с H100 для аренды. Стоимость аренды одного H100 в облаке в 2024 году составляла от $3 до $5 в час (в зависимости от региона и конфигурации).
Модификации и варианты
- H100 SXM: стандартная версия для установки в серверы с разъёмом SXM (например, Nvidia DGX H100, HGX H100). Требует жидкостного или активного воздушного охлаждения.
- H100 PCIe: версия для установки в стандартный слот PCIe 5.0 x16. Имеет меньшую производительность (из-за ограничений по питанию и охлаждению) и более низкую пропускную способность памяти (2,0 ТБ/с против 3,35 ТБ/с). Потребляет до 350 Вт.
- H100 NVL: вариант с двумя GPU на одной плате, соединённых через NVLink. Общая память — 188 ГБ, производительность — до 3958 терафлопс (FP8) на каждый GPU. Предназначен для серверов с ограниченным пространством.
- H200: обновлённая версия с памятью HBM3e (141 ГБ, 4,8 ТБ/с), представленная в 2023 году. Совместима с H100 по разъёму.
Ограничения и критика
- Энергопотребление и охлаждение: H100 SXM потребляет до 700 Вт (в пике), что требует мощных систем охлаждения (жидкостное охлаждение в дата-центрах). Это увеличивает эксплуатационные расходы.
- Стоимость: рекомендованная цена H100 SXM составляет около $30 000–40 000, но из-за дефицита в 2023 году она достигала $50 000–70 000 на вторичном рынке. Кластер из 1000 H100 стоит десятки миллионов долларов.
- Зависимость от экосистемы Nvidia: H100 требует использования фирменного программного обеспечения (CUDA, cuDNN, TensorRT) и аппаратных соединений (NVLink, NVSwitch), что создаёт vendor lock-in (привязку к поставщику).
- Экспортные ограничения: США ввели ограничения на экспорт H100 в Китай и некоторые другие страны (из-за потенциального использования в военных ИИ-системах). Nvidia выпустила урезанные версии (H800, H20) для китайского рынка с пониженной производительностью.
Конкуренты
Основные конкуренты H100:
- AMD Instinct MI300X: GPU с 192 ГБ памяти HBM3 и 5,2 ТБ/с пропускной способности. Обеспечивает близкую производительность в задачах ИИ, но уступает в экосистеме ПО.
- Intel Gaudi 3: ускоритель на базе архитектуры Habana, ориентированный на обучение LLM. Менее мощный, но дешевле.
- Google TPU v5: собственный тензорный процессор Google, используемый только в облаке Google Cloud. Не продаётся отдельно.
- Apple M2 Ultra: интегрированный GPU в рабочих станциях Mac Studio, но не предназначен для серверных кластеров.
Интересные факты
- H100 стал первым GPU, поддерживающим стандарт PCIe 5.0, что обеспечивает вдвое большую пропускную способность по сравнению с PCIe 4.0.
- В 2023 году Nvidia продала более 500 000 H100, а общая выручка от них превысила $20 миллиардов.
- Для обучения модели GPT-4 (предположительно 1,8 триллиона параметров) потребовалось около 25 000 H100, работавших несколько месяцев.
- В 2024 году Nvidia представила систему DGX GH200, объединяющую 256 H100 с 144 ТБ памяти через NVLink, что позволяет обрабатывать модели с триллионами параметров.
Источники
- Nvidia Corporation. «NVIDIA H100 Tensor Core GPU Architecture». Whitepaper, 2022.
- Nvidia Corporation. «NVIDIA H100 GPU Datasheet». 2023.
- Tom’s Hardware. «Nvidia H100 vs A100: Deep Dive». 2023.
- AnandTech. «Nvidia Hopper Architecture Deep Dive». 2022.
- Reuters. «Nvidia’s H100 GPU: The Engine Behind the AI Boom». 2023.
- The Verge. «How Nvidia’s H100 Became the Most Important Chip of the AI Era». 2024.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →