Архитектура NVIDIA Hopper¶
Архитектура NVIDIA Hopper — это микроархитектура графических процессоров (GPU) и ускорителей вычислений общего назначения (GPGPU), разработанная компанией NVIDIA. Представленная в марте 2022 года на конференции GTC 2022, она пришла на смену архитектуре Ampere (2020) и стала основой для профессиональных ускорителей серии H100 (NVIDIA H100 Tensor Core GPU). Архитектура названа в честь американской учёной в области информатики Грейс Хоппер. Hopper ориентирована на высокопроизводительные вычисления (HPC), задачи искусственного интеллекта (ИИ), глубокого обучения и обработки больших данных, предлагая значительные улучшения в производительности, масштабируемости и энергоэффективности по сравнению с предшественником.
¶История
Разработка архитектуры Hopper велась в рамках стратегии NVIDIA по созданию специализированных ускорителей для центров обработки данных (ЦОД). Первые официальные сведения о новой архитектуре появились в 2021 году, а официальный анонс состоялся 22 марта 2022 года на GTC 2022. Первым продуктом на базе Hopper стал ускоритель H100, выпуск которого начался в третьем квартале 2022 года. В 2023 году NVIDIA представила модификацию H100 для китайского рынка (H800), а также более мощный ускоритель H200 с увеличенным объёмом памяти HBM3e. В 2024 году архитектура Hopper была частично заменена новой архитектурой Blackwell, но остаётся актуальной для многих задач.
¶Ключевые особенности
Архитектура Hopper включает ряд нововведений, направленных на повышение производительности при работе с моделями ИИ и HPC-приложениями.
¶Трансформер-движок (Transformer Engine)
Одной из главных инноваций стал трансформер-движок — аппаратный модуль, оптимизированный для работы с моделями-трансформерами, лежащими в основе современных больших языковых моделей (LLM), таких как GPT-4, BERT и других. Движок использует смешанную точность вычислений (FP8, FP16, BF16, TF32) и автоматически выбирает оптимальный формат для каждого слоя нейросети, что позволяет ускорить обучение и инференс без потери точности. По заявлениям NVIDIA, трансформер-движок обеспечивает до 9 раз более высокую производительность при обучении LLM по сравнению с архитектурой Ampere.
¶Масштабируемая иерархия памяти (Memory Hierarchy)
Hopper использует новую иерархию памяти, включающую:
- HBM3 (High Bandwidth Memory 3) — видеопамять с пропускной способностью до 3,35 ТБ/с (в H100) и до 4,8 ТБ/с (в H200). Это в 1,5–2 раза быстрее, чем HBM2e в Ampere.
- L2-кэш увеличенного объёма (до 50 МБ в H100) — снижает задержки при доступе к данным.
- Регистровая память и общая память (shared memory) — оптимизированы для параллельных вычислений.
¶Улучшенная архитектура потоковых мультипроцессоров (SM)
Каждый потоковый мультипроцессор (SM) в Hopper содержит 128 ядер CUDA (против 64 в Ampere), что увеличивает плотность вычислений. Также добавлены новые типы ядер:
- Tensor Cores четвёртого поколения — поддерживают форматы FP8, FP16, BF16, TF32, INT8 и INT4, обеспечивая до 6 раз более высокую производительность для матричных операций по сравнению с Tensor Cores третьего поколения.
- DPX-инструкции — аппаратные инструкции для ускорения алгоритмов динамического программирования (например, в задачах выравнивания последовательностей ДНК).
¶Масштабирование через NVLink и NVSwitch
Архитектура Hopper поддерживает NVLink четвёртого поколения — высокоскоростной интерфейс для соединения GPU в кластер. Пропускная способность NVLink 4.0 достигает 900 ГБ/с на соединение (в 2 раза больше, чем у NVLink 3.0). Для объединения до 256 GPU используется коммутатор NVSwitch, который обеспечивает полную связность (all-to-all) без узких мест. Это позволяет создавать суперкомпьютеры с производительностью до 1 экзафлопса (FP8) на одном узле.
¶Многоинстансный GPU (MIG)
Технология MIG (Multi-Instance GPU) в Hopper была расширена: теперь один GPU H100 можно разделить на до 7 виртуальных инстансов (против 3 в A100). Каждый инстанс имеет изолированные ресурсы (память, кэш, вычислительные блоки), что позволяет запускать несколько независимых задач на одном ускорителе без взаимного влияния.
¶Конфиденциальные вычисления (Confidential Computing)
Hopper поддерживает аппаратное шифрование памяти и изоляцию данных для задач, требующих повышенной безопасности (например, в финансовом секторе или здравоохранении). Это реализовано через механизм Trusted Execution Environment (TEE).
¶Продукты на базе архитектуры Hopper
Основным продуктом стал ускоритель NVIDIA H100, выпускавшийся в нескольких вариантах:
- H100 SXM — для установки в серверы с интерфейсом SXM (основной форм-фактор).
- H100 PCIe — для установки в стандартные слоты PCIe 5.0.
- H100 NVL — для работы в паре (NVLink Bridge) с увеличенным объёмом памяти.
- H800 — модификация для Китая, с ограниченной пропускной способностью NVLink (400 ГБ/с вместо 900 ГБ/с) и сниженной производительностью в некоторых режимах, что соответствовало экспортным ограничениям США.
- H200 — обновлённая версия с памятью HBM3e (до 141 ГБ, пропускная способность до 4,8 ТБ/с), анонсированная в ноябре 2023 года.
Также архитектура Hopper используется в некоторых моделях суперкомпьютеров, например, в системе NVIDIA DGX H100 (8 GPU H100 в одном узле) и кластерах на базе NVIDIA DGX SuperPOD.
¶Применение
Архитектура Hopper нашла широкое применение в следующих областях:
- Обучение и инференс больших языковых моделей (LLM) — например, GPT-4, Llama, Gemini.
- Научные вычисления — моделирование климата, квантовая химия, биоинформатика, физика высоких энергий.
- Компьютерное зрение — обработка изображений и видео, генеративные модели (Stable Diffusion, DALL-E).
- Рекомендательные системы — в интернет-компаниях (например, в рекомендациях контента).
- Финансовый анализ — риск-моделирование, алгоритмическая торговля.
¶Производительность
По данным NVIDIA, H100 обеспечивает:
- до 9 раз более высокую производительность при обучении LLM по сравнению с A100 (Ampere);
- до 30 раз более высокую производительность при инференсе LLM (с использованием трансформер-движка);
- до 3 раз более высокую производительность в задачах HPC (например, в тестах LINPACK).
Реальные показатели зависят от конкретного приложения, объёма данных и настройки.
¶Критика и ограничения
Несмотря на высокую производительность, архитектура Hopper подвергалась критике по нескольким причинам:
- Высокая стоимость — ускорители H100 стоят десятки тысяч долларов, что делает их недоступными для многих организаций.
- Энергопотребление — TDP H100 составляет 700 Вт (для SXM-версии), что требует мощных систем охлаждения и увеличивает эксплуатационные расходы.
- Экспортные ограничения — из-за санкций США поставки H100 в Китай и некоторые другие страны были ограничены, что привело к созданию урезанных версий (H800).
- Зависимость от экосистемы NVIDIA — использование Hopper требует программного стека NVIDIA (CUDA, cuDNN, TensorRT), что ограничивает совместимость с альтернативными платформами.
¶Источники
- NVIDIA Corporation. «NVIDIA Hopper Architecture In-Depth». GTC 2022.
- NVIDIA Corporation. «NVIDIA H100 Tensor Core GPU Architecture». Whitepaper, 2022.
- NVIDIA Corporation. «NVIDIA H200 Tensor Core GPU». Product Page, 2023.
- Tom’s Hardware. «NVIDIA H100 vs A100: Performance Comparison», 2022.
- AnandTech. «NVIDIA Announces Hopper Architecture and H100 GPU», 2022.
- Федеральная служба по техническому и экспортному контролю (ФСТЭК России). «Экспортные ограничения на высокопроизводительные GPU», 2023.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


