Открыть сервис

Суперкомпьютер Aurora

Aurora — американский суперкомпьютер экзафлопсного класса, разработанный компанией Intel совместно с Cray (подразделение Hewlett Packard Enterprise) для Аргоннской национальной лаборатории Министерства энергетики США. Введённый в эксплуатацию в 2023 году, Aurora стал одним из первых в мире суперкомпьютеров, достигших производительности свыше одного экзафлопса (10¹⁸ операций с плавающей запятой в секунду, или 1 ЭФлопс), и на момент запуска занимал второе место в рейтинге TOP500 (после Frontier). Система предназначена для научных вычислений в области моделирования климата, материаловедения, биоинформатики, физики высоких энергий и искусственного интеллекта.

История

Проект Aurora был анонсирован в 2015 году в рамках программы Министерства энергетики США по созданию экзафлопсных суперкомпьютеров. Первоначально планировалось, что система будет развёрнута в 2018 году, но из-за задержек в разработке процессоров Intel Xeon Phi (серия Knight’s Hill) и последующего отказа от этой архитектуры сроки были сдвинуты. В 2019 году Intel объявила о замене процессоров на новую гибридную архитектуру, сочетающую центральные процессоры (CPU) Xeon Sapphire Rapids и графические ускорители (GPU) Ponte Vecchio (Xe-HPC). Сборка системы началась в 2021 году, а финальные тесты производительности были проведены в 2023 году.

В ноябре 2023 года Aurora вошла в список TOP500 с результатом 1,012 ЭФлопс на тесте LINPACK, что сделало её вторым экзафлопсным суперкомпьютером в мире после Frontier (1,206 ЭФлопс). К июню 2024 года производительность Aurora была повышена до 1,35 ЭФлопс, однако Frontier сохранил лидерство с показателем 1,353 ЭФлопс. По состоянию на 2024 год Aurora остаётся одной из самых мощных вычислительных систем в мире, используемой для задач, требующих высокой параллельной производительности.

Архитектура и характеристики

Аппаратная платформа

Aurora построена на базе архитектуры Shasta от Cray (ныне HPE Cray EX) и использует гибридную вычислительную модель, где каждый вычислительный узел содержит как CPU, так и GPU. Система состоит из 10 624 узлов, каждый из которых включает:

  • Два 52-ядерных процессора Intel Xeon Max (серия Sapphire Rapids) с поддержкой HBM (High Bandwidth Memory) — память с высокой пропускной способностью, интегрированная в корпус процессора.
  • Шесть графических ускорителей Intel Data Center GPU Max (Ponte Vecchio) — каждый ускоритель содержит 128 вычислительных блоков (Xe-cores) и оснащён 64 ГБ HBM2e.

Общая конфигурация:

  • Количество ядер CPU: 1 105 664 (включая все ядра процессоров Xeon Max).
  • Количество ядер GPU: 9 216 000 (128 ядер на каждый из 71 680 ускорителей).
  • Оперативная память: 1,36 ПБ (петабайт) DDR5 + 1,36 ПБ HBM (встроенная в процессоры и ускорители).
  • Система хранения данных: 230 ПБ на базе параллельной файловой системы Lustre, обеспечивающая пропускную способность до 31 ТБ/с.

Система охлаждения

Aurora использует прямое жидкостное охлаждение (direct-to-chip) с помощью системы Cray EX, где тепло отводится через холодные пластины, контактирующие с процессорами и ускорителями. Температура охлаждающей жидкости поддерживается на уровне 20–25 °C. Общая потребляемая мощность системы составляет около 60 МВт (мегаватт), что делает её одной из самых энергоёмких вычислительных установок в мире.

Программное обеспечение

Система работает под управлением операционной системы Cray Linux Environment (CLE), основанной на SUSE Linux Enterprise Server. Для управления заданиями используется планировщик PBS Pro. Поддерживаются стандартные библиотеки для параллельных вычислений: MPI (Message Passing Interface), OpenMP, CUDA (через эмуляцию на Intel GPU) и собственные фреймворки Intel oneAPI, обеспечивающие переносимость кода между CPU и GPU.

Производительность

Пиковая и реальная производительность

Теоретическая пиковая производительность Aurora составляет 2,0 ЭФлопс (FP64), но на практике из-за ограничений памяти и пропускной способности сети система достигает около 1,35 ЭФлопс на тесте LINPACK (решение плотных систем линейных уравнений). В тесте HPL-AI, измеряющем производительность в задачах искусственного интеллекта (смешанная точность FP16/FP32), Aurora показала результат 5,0 ЭФлопс, что позволяет использовать её для обучения крупных нейросетей.

Сравнение с другими системами

По состоянию на июнь 2024 года Aurora занимает второе место в TOP500, уступая Frontier (1,353 ЭФлопс) и опережая Eagle (Microsoft Azure, 0,561 ЭФлопс) и Fugaku (Япония, 0,442 ЭФлопс). В рейтинге Green500 (энергоэффективность) Aurora не входит в топ-10 из-за высокого энергопотребления (60 МВт), что даёт показатель 22,5 ГФлопс/Вт (против 52,2 ГФлопс/Вт у лидера — Henri, США).

Применение

Aurora используется для решения широкого круга научных задач, требующих экзафлопсной производительности. Основные направления:

Моделирование климата и погоды

Система применяется для расчёта климатических моделей с высоким разрешением (до 1 км на глобальной сетке), что позволяет прогнозировать экстремальные погодные явления, изменения уровня моря и динамику ледников. В частности, на Aurora выполняются симуляции в рамках проекта Energy Exascale Earth System Model (E3SM) Министерства энергетики США.

Материаловедение и химия

С помощью Aurora моделируются свойства новых материалов, включая сверхпроводники, катализаторы и полимеры. Используются методы квантовой химии (DFT, метод функционала плотности) и молекулярной динамики. Например, исследователи из Аргоннской лаборатории проводят симуляции поведения материалов при экстремальных давлениях и температурах.

Биоинформатика и медицина

Aurora задействована в проектах по анализу геномов, моделированию белковых структур (включая свёртывание белков) и поиску лекарственных препаратов. В 2023–2024 годах на системе выполнялись расчёты по моделированию взаимодействия вирусных белков с потенциальными ингибиторами для разработки противовирусных средств.

Физика высоких энергий

Система используется для обработки данных с Большого адронного коллайдера (ЦЕРН) и моделирования процессов в ядерной физике. В частности, на Aurora проводятся симуляции столкновений тяжёлых ионов для изучения кварк-глюонной плазмы.

Искусственный интеллект

Благодаря высокой производительности в смешанной точности (FP16/FP32), Aurora применяется для обучения больших языковых моделей (LLM), систем компьютерного зрения и генеративных нейросетей. В 2023 году на системе была обучена модель AuroraGPT, предназначенная для научных приложений (генерация химических формул, прогнозирование свойств материалов).

Критика и ограничения

Несмотря на высокую производительность, Aurora подвергается критике по нескольким причинам:

  • Энергопотребление: 60 МВт — один из самых высоких показателей среди суперкомпьютеров, что вызывает вопросы об экологической устойчивости. Для сравнения, Frontier потребляет 22,7 МВт, а Fugaku — 28,3 МВт.
  • Задержки ввода в эксплуатацию: проект был анонсирован в 2015 году, но система заработала на полную мощность только в 2023 году, что на пять лет позже первоначального срока. Это привело к дополнительным затратам (бюджет вырос с 200 млн до 500 млн долларов США).
  • Зависимость от архитектуры Intel: использование проприетарных процессоров и ускорителей Intel ограничивает переносимость кода, написанного для других платформ (например, NVIDIA CUDA). Хотя Intel oneAPI позиционируется как открытый стандарт, на практике многие научные приложения требуют адаптации.

Перспективы

В 2024 году Министерство энергетики США объявило о планах модернизации Aurora с заменой графических ускорителей на новое поколение Intel Xe2 (Battlemage), что может повысить производительность до 2,0 ЭФлопс. Кроме того, система будет интегрирована в национальную сеть суперкомпьютеров Exascale Computing Project (ECP), что позволит исследователям из разных лабораторий удалённо использовать её ресурсы. Ожидается, что Aurora останется в числе лидеров TOP500 как минимум до 2026 года, когда планируется ввод в эксплуатацию систем El Capitan (США) и JUPITER (Европа).

Источники

  • TOP500 List — November 2023, June 2024.
  • Argonne National Laboratory: Aurora Supercomputer Overview, 2023.
  • Intel Corporation: Aurora Exascale System Architecture, 2022.
  • HPE Cray EX: Technical Specifications, 2023.
  • Министерство энергетики США: Exascale Computing Project Annual Report, 2024.
  • Green500 List — November 2023, June 2024.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →