GA100¶
GA100 — это графический процессор (GPU) архитектуры Ampere, разработанный компанией NVIDIA. Он является флагманским чипом для профессиональных вычислений и высокопроизводительных ускорителей, предназначенных для задач искусственного интеллекта (ИИ), машинного обучения, научных симуляций и рендеринга. GA100 стал основой для ускорителей серии NVIDIA A100, выпущенных в 2020 году, и представляет собой значительный шаг вперёд по сравнению с предшественником — чипом GV100 (архитектура Volta).
¶История и контекст
GA100 был анонсирован 14 мая 2020 года в рамках презентации NVIDIA GTC 2020. Он пришёл на смену чипу GV100, который использовался в ускорителях Tesla V100. Разработка GA100 велась с учётом растущих потребностей в вычислительных мощностях для обучения крупных нейросетей (например, GPT-3) и обработки больших массивов данных. Чип производится по 7-нанометровому техпроцессу TSMC (N7), что обеспечило значительное повышение энергоэффективности и плотности транзисторов по сравнению с 12-нанометровым GV100.
GA100 стал первым чипом NVIDIA, который полностью отказался от поддержки традиционных графических функций (растеризации, шейдеров) в пользу исключительно вычислительных и тензорных ядер. Это отразило стратегию компании по фокусированию на дата-центрах и облачных вычислениях, а не на потребительском рынке.
¶Архитектура и устройство
GA100 построен на архитектуре Ampere, которая включает несколько ключевых нововведений. Чип состоит из множества вычислительных блоков, организованных в иерархическую структуру.
¶Основные компоненты
- Транзисторы: 54,2 миллиарда транзисторов на кристалле площадью 826 мм².
- Вычислительные блоки: 128 потоковых мультипроцессоров (SM, Streaming Multiprocessor), каждый из которых содержит 64 ядра CUDA, 4 тензорных ядра третьего поколения и 8 блоков текстурной обработки.
- Ядра CUDA: 8192 ядра CUDA (в максимальной конфигурации). Они отвечают за выполнение параллельных вычислений с плавающей запятой одинарной точности (FP32).
- Тензорные ядра: 512 тензорных ядер третьего поколения. Они оптимизированы для матричных операций, используемых в ИИ. Поддерживают новые форматы данных: TF32, FP16, BF16, INT8, INT4 и Sparsity (разреженность).
- Память: 40 ГБ или 80 ГБ HBM2e (High Bandwidth Memory 2e) с пропускной способностью до 2 ТБ/с (в версии с 80 ГБ). Интерфейс памяти — 5120-битный.
- Кэш-память: 40 МБ объединённого кэша L2, что в 7 раз больше, чем у GV100 (6 МБ). Это снижает задержки при доступе к данным.
¶Нововведения архитектуры Ampere
- TF32 (Tensor Float 32): гибридный формат, который использует 10 бит для мантиссы и 8 бит для экспоненты, что позволяет выполнять операции с точностью FP32, но с производительностью FP16. Это ускоряет обучение нейросетей без потери качества.
- Sparsity (разреженность): аппаратная поддержка разреженных матриц, где до 50% весов могут быть обнулены без потери точности. Это удваивает производительность тензорных ядер.
- MIG (Multi-Instance GPU): технология, позволяющая разделить один физический GPU на до 7 изолированных виртуальных экземпляров. Каждый экземпляр имеет собственные ресурсы (память, кэш, вычислительные ядра) и работает независимо, что повышает безопасность и эффективность в мультиарендных средах.
- NVLink третьего поколения: межсоединение, обеспечивающее скорость до 600 ГБ/с между GPU, что позволяет объединять несколько ускорителей в единый кластер.
¶Классификация и варианты
GA100 используется в нескольких продуктах NVIDIA, которые различаются по конфигурации и назначению.
¶Основные продукты на базе GA100
- NVIDIA A100 (80 ГБ): флагманский ускоритель для дата-центров. Выпущен в 2020 году с 40 ГБ памяти, а в 2021 году получил обновление до 80 ГБ. Поддерживает все функции GA100, включая MIG и NVLink. Используется в облачных платформах (AWS, Google Cloud, Microsoft Azure) и суперкомпьютерах (например, Perlmutter).
- NVIDIA A100 (40 ГБ): более ранняя версия с меньшим объёмом памяти, предназначенная для задач с умеренными требованиями к VRAM.
- NVIDIA A100X: вариант с пассивным охлаждением и пониженным энергопотреблением, предназначенный для встраиваемых систем и серверов с ограниченным пространством.
- NVIDIA A100 PCIe: версия в форм-факторе PCIe 4.0 x16, используемая в стандартных серверах. Отличается от SXM-версии меньшей пропускной способностью NVLink (до 4 GPU вместо 8).
¶Сравнение с предшественником (GV100)
| Характеристика | GA100 (A100 80 ГБ) | GV100 (V100 32 ГБ) |
|---|---|---|
| Техпроцесс | 7 нм TSMC | 12 нм TSMC |
| Транзисторы | 54,2 млрд | 21,1 млрд |
| Ядра CUDA | 8192 | 5120 |
| Тензорные ядра | 512 (3-е поколение) | 640 (2-е поколение) |
| Память | 80 ГБ HBM2e | 32 ГБ HBM2 |
| Пропускная способность | 2 ТБ/с | 0,9 ТБ/с |
| TDP | 400 Вт | 300 Вт |
| Поддержка MIG | Да (до 7 экз.) | Нет |
¶Применение
GA100 ориентирован исключительно на профессиональные и научные вычисления. Основные области применения:
- Искусственный интеллект и машинное обучение: обучение и инференс (вывод) нейросетей. Благодаря тензорным ядрам и поддержке TF32, GA100 ускоряет обучение больших моделей (например, GPT-3, BERT, DALL-E) в 2–3 раза по сравнению с V100.
- Научные симуляции: моделирование климата, молекулярная динамика (GROMACS, NAMD), астрофизика, вычислительная гидродинамика. Высокая точность FP64 (двойная точность) — 9,7 TFLOPS — делает GA100 пригодным для задач, требующих высокой точности.
- Рендеринг и визуализация: использование в профессиональных приложениях (Autodesk Maya, Blender, Cinema 4D) для рендеринга с трассировкой лучей (RTX-рендеринг) через движки, такие как OctaneRender и Redshift.
- Облачные вычисления: технология MIG позволяет провайдерам облачных услуг (AWS, Google Cloud, Azure) эффективно распределять ресурсы GPU между несколькими пользователями, обеспечивая изоляцию и безопасность.
- Автономные системы: обработка данных с сенсоров (LiDAR, радары, камеры) в реальном времени для автономных автомобилей и роботов. Однако для этой цели чаще используются специализированные чипы, такие как NVIDIA Orin.
¶Производительность
Производительность GA100 варьируется в зависимости от режима и конфигурации.
- FP32 (одинарная точность): 19,5 TFLOPS (без тензорных ядер).
- TF32: 156 TFLOPS (с тензорными ядрами).
- FP16/BF16: 312 TFLOPS (с тензорными ядрами).
- INT8: 624 TOPS (с тензорными ядрами).
- FP64 (двойная точность): 9,7 TFLOPS (без тензорных ядер), что в 2 раза выше, чем у V100.
- Sparsity: при использовании разреженных матриц производительность тензорных ядер удваивается (например, 624 TFLOPS для FP16).
Энергопотребление (TDP) составляет 400 Вт для версии SXM и 250–300 Вт для PCIe-версии.
¶Критика и ограничения
Несмотря на высокую производительность, GA100 имеет ряд недостатков:
- Высокая стоимость: ускорители на базе GA100 (например, A100 80 ГБ) стоят от 10 000 до 15 000 долларов США, что делает их недоступными для малого бизнеса и индивидуальных исследователей.
- Отсутствие графических функций: чип не поддерживает DirectX, Vulkan или OpenGL, поэтому не может использоваться для игр или традиционной 3D-графики без специализированного ПО.
- Тепловыделение: 400 Вт TDP требует мощных систем охлаждения (жидкостное или высокооборотные вентиляторы), что увеличивает эксплуатационные расходы.
- Ограниченная доступность: в 2020–2022 годах наблюдался дефицит чипов GA100 из-за глобального кризиса полупроводников, что привело к росту цен и задержкам поставок.
¶Интересные факты
- GA100 стал первым GPU NVIDIA, который превысил отметку в 50 миллиардов транзисторов.
- Ускорители A100 на базе GA100 используются в суперкомпьютере «Perlmutter» (Национальный научно-вычислительный центр США), который занимает 5-е место в рейтинге TOP500 (по состоянию на ноябрь 2022 года).
- Технология MIG была впервые реализована именно в GA100 и впоследствии перенесена в более поздние архитектуры (Hopper, Ada Lovelace).
- В 2022 году NVIDIA выпустила ускоритель H100 на архитектуре Hopper, который стал преемником A100, но GA100 продолжает использоваться в бюджетных и облачных решениях.
¶Источники
- NVIDIA A100 Tensor Core GPU Architecture Whitepaper (2020)
- NVIDIA GTC 2020: Presentation on Ampere Architecture
- AnandTech: NVIDIA A100 Deep Dive (2020)
- Tom's Hardware: NVIDIA A100 80 GB Review (2021)
- Wikipedia: Ampere (microarchitecture)
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


