Открыть сервис

GA100

GA100 — это графический процессор (GPU) архитектуры Ampere, разработанный компанией NVIDIA. Он является флагманским чипом для профессиональных вычислений и высокопроизводительных ускорителей, предназначенных для задач искусственного интеллекта (ИИ), машинного обучения, научных симуляций и рендеринга. GA100 стал основой для ускорителей серии NVIDIA A100, выпущенных в 2020 году, и представляет собой значительный шаг вперёд по сравнению с предшественником — чипом GV100 (архитектура Volta).

История и контекст

GA100 был анонсирован 14 мая 2020 года в рамках презентации NVIDIA GTC 2020. Он пришёл на смену чипу GV100, который использовался в ускорителях Tesla V100. Разработка GA100 велась с учётом растущих потребностей в вычислительных мощностях для обучения крупных нейросетей (например, GPT-3) и обработки больших массивов данных. Чип производится по 7-нанометровому техпроцессу TSMC (N7), что обеспечило значительное повышение энергоэффективности и плотности транзисторов по сравнению с 12-нанометровым GV100.

GA100 стал первым чипом NVIDIA, который полностью отказался от поддержки традиционных графических функций (растеризации, шейдеров) в пользу исключительно вычислительных и тензорных ядер. Это отразило стратегию компании по фокусированию на дата-центрах и облачных вычислениях, а не на потребительском рынке.

Архитектура и устройство

GA100 построен на архитектуре Ampere, которая включает несколько ключевых нововведений. Чип состоит из множества вычислительных блоков, организованных в иерархическую структуру.

Основные компоненты

  • Транзисторы: 54,2 миллиарда транзисторов на кристалле площадью 826 мм².
  • Вычислительные блоки: 128 потоковых мультипроцессоров (SM, Streaming Multiprocessor), каждый из которых содержит 64 ядра CUDA, 4 тензорных ядра третьего поколения и 8 блоков текстурной обработки.
  • Ядра CUDA: 8192 ядра CUDA (в максимальной конфигурации). Они отвечают за выполнение параллельных вычислений с плавающей запятой одинарной точности (FP32).
  • Тензорные ядра: 512 тензорных ядер третьего поколения. Они оптимизированы для матричных операций, используемых в ИИ. Поддерживают новые форматы данных: TF32, FP16, BF16, INT8, INT4 и Sparsity (разреженность).
  • Память: 40 ГБ или 80 ГБ HBM2e (High Bandwidth Memory 2e) с пропускной способностью до 2 ТБ/с (в версии с 80 ГБ). Интерфейс памяти — 5120-битный.
  • Кэш-память: 40 МБ объединённого кэша L2, что в 7 раз больше, чем у GV100 (6 МБ). Это снижает задержки при доступе к данным.

Нововведения архитектуры Ampere

  • TF32 (Tensor Float 32): гибридный формат, который использует 10 бит для мантиссы и 8 бит для экспоненты, что позволяет выполнять операции с точностью FP32, но с производительностью FP16. Это ускоряет обучение нейросетей без потери качества.
  • Sparsity (разреженность): аппаратная поддержка разреженных матриц, где до 50% весов могут быть обнулены без потери точности. Это удваивает производительность тензорных ядер.
  • MIG (Multi-Instance GPU): технология, позволяющая разделить один физический GPU на до 7 изолированных виртуальных экземпляров. Каждый экземпляр имеет собственные ресурсы (память, кэш, вычислительные ядра) и работает независимо, что повышает безопасность и эффективность в мультиарендных средах.
  • NVLink третьего поколения: межсоединение, обеспечивающее скорость до 600 ГБ/с между GPU, что позволяет объединять несколько ускорителей в единый кластер.

Классификация и варианты

GA100 используется в нескольких продуктах NVIDIA, которые различаются по конфигурации и назначению.

Основные продукты на базе GA100

  • NVIDIA A100 (80 ГБ): флагманский ускоритель для дата-центров. Выпущен в 2020 году с 40 ГБ памяти, а в 2021 году получил обновление до 80 ГБ. Поддерживает все функции GA100, включая MIG и NVLink. Используется в облачных платформах (AWS, Google Cloud, Microsoft Azure) и суперкомпьютерах (например, Perlmutter).
  • NVIDIA A100 (40 ГБ): более ранняя версия с меньшим объёмом памяти, предназначенная для задач с умеренными требованиями к VRAM.
  • NVIDIA A100X: вариант с пассивным охлаждением и пониженным энергопотреблением, предназначенный для встраиваемых систем и серверов с ограниченным пространством.
  • NVIDIA A100 PCIe: версия в форм-факторе PCIe 4.0 x16, используемая в стандартных серверах. Отличается от SXM-версии меньшей пропускной способностью NVLink (до 4 GPU вместо 8).

Сравнение с предшественником (GV100)

ХарактеристикаGA100 (A100 80 ГБ)GV100 (V100 32 ГБ)
Техпроцесс7 нм TSMC12 нм TSMC
Транзисторы54,2 млрд21,1 млрд
Ядра CUDA81925120
Тензорные ядра512 (3-е поколение)640 (2-е поколение)
Память80 ГБ HBM2e32 ГБ HBM2
Пропускная способность2 ТБ/с0,9 ТБ/с
TDP400 Вт300 Вт
Поддержка MIGДа (до 7 экз.)Нет

Применение

GA100 ориентирован исключительно на профессиональные и научные вычисления. Основные области применения:

  • Искусственный интеллект и машинное обучение: обучение и инференс (вывод) нейросетей. Благодаря тензорным ядрам и поддержке TF32, GA100 ускоряет обучение больших моделей (например, GPT-3, BERT, DALL-E) в 2–3 раза по сравнению с V100.
  • Научные симуляции: моделирование климата, молекулярная динамика (GROMACS, NAMD), астрофизика, вычислительная гидродинамика. Высокая точность FP64 (двойная точность) — 9,7 TFLOPS — делает GA100 пригодным для задач, требующих высокой точности.
  • Рендеринг и визуализация: использование в профессиональных приложениях (Autodesk Maya, Blender, Cinema 4D) для рендеринга с трассировкой лучей (RTX-рендеринг) через движки, такие как OctaneRender и Redshift.
  • Облачные вычисления: технология MIG позволяет провайдерам облачных услуг (AWS, Google Cloud, Azure) эффективно распределять ресурсы GPU между несколькими пользователями, обеспечивая изоляцию и безопасность.
  • Автономные системы: обработка данных с сенсоров (LiDAR, радары, камеры) в реальном времени для автономных автомобилей и роботов. Однако для этой цели чаще используются специализированные чипы, такие как NVIDIA Orin.

Производительность

Производительность GA100 варьируется в зависимости от режима и конфигурации.

  • FP32 (одинарная точность): 19,5 TFLOPS (без тензорных ядер).
  • TF32: 156 TFLOPS (с тензорными ядрами).
  • FP16/BF16: 312 TFLOPS (с тензорными ядрами).
  • INT8: 624 TOPS (с тензорными ядрами).
  • FP64 (двойная точность): 9,7 TFLOPS (без тензорных ядер), что в 2 раза выше, чем у V100.
  • Sparsity: при использовании разреженных матриц производительность тензорных ядер удваивается (например, 624 TFLOPS для FP16).

Энергопотребление (TDP) составляет 400 Вт для версии SXM и 250–300 Вт для PCIe-версии.

Критика и ограничения

Несмотря на высокую производительность, GA100 имеет ряд недостатков:

  • Высокая стоимость: ускорители на базе GA100 (например, A100 80 ГБ) стоят от 10 000 до 15 000 долларов США, что делает их недоступными для малого бизнеса и индивидуальных исследователей.
  • Отсутствие графических функций: чип не поддерживает DirectX, Vulkan или OpenGL, поэтому не может использоваться для игр или традиционной 3D-графики без специализированного ПО.
  • Тепловыделение: 400 Вт TDP требует мощных систем охлаждения (жидкостное или высокооборотные вентиляторы), что увеличивает эксплуатационные расходы.
  • Ограниченная доступность: в 2020–2022 годах наблюдался дефицит чипов GA100 из-за глобального кризиса полупроводников, что привело к росту цен и задержкам поставок.

Интересные факты

  • GA100 стал первым GPU NVIDIA, который превысил отметку в 50 миллиардов транзисторов.
  • Ускорители A100 на базе GA100 используются в суперкомпьютере «Perlmutter» (Национальный научно-вычислительный центр США), который занимает 5-е место в рейтинге TOP500 (по состоянию на ноябрь 2022 года).
  • Технология MIG была впервые реализована именно в GA100 и впоследствии перенесена в более поздние архитектуры (Hopper, Ada Lovelace).
  • В 2022 году NVIDIA выпустила ускоритель H100 на архитектуре Hopper, который стал преемником A100, но GA100 продолжает использоваться в бюджетных и облачных решениях.

Источники

  • NVIDIA A100 Tensor Core GPU Architecture Whitepaper (2020)
  • NVIDIA GTC 2020: Presentation on Ampere Architecture
  • AnandTech: NVIDIA A100 Deep Dive (2020)
  • Tom's Hardware: NVIDIA A100 80 GB Review (2021)
  • Wikipedia: Ampere (microarchitecture)

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →