Открыть сервис

Data Center Bridging

Data Center Bridging (DCB) — это набор стандартов и протоколов Института инженеров электротехники и электроники (IEEE), предназначенных для создания единой, конвергентной сети передачи данных в центрах обработки данных (ЦОД). Основная цель DCB — обеспечить работу трафика различных типов (хранение данных, межпроцессорное взаимодействие, управляющий трафик) по одному физическому каналу Ethernet без потери пакетов, гарантируя при этом необходимую пропускную способность и низкую задержку для каждого типа трафика.

История и предпосылки создания

С развитием технологий виртуализации и облачных вычислений в ЦОД возникла необходимость в унификации сетевой инфраструктуры. Традиционно в дата-центрах использовались отдельные сети для разных типов трафика: Ethernet для локальной сети (LAN), Fibre Channel для хранения данных (SAN) и InfiniBand для высокопроизводительных вычислений (HPC). Это приводило к росту стоимости оборудования, сложности управления и неэффективному использованию ресурсов.

В середине 2000-х годов началась работа над стандартами, которые позволили бы использовать Ethernet как единую транспортную среду, способную обеспечить качество обслуживания (QoS) и надежность, сравнимые с Fibre Channel. Инициатива получила название Data Center Bridging. Первый набор стандартов DCB был ратифицирован IEEE в 2010 году (серия 802.1Qau/Qbb/Qaz). Впоследствии стандарты развивались, и в 2018 году был принят стандарт IEEE 802.1Qcr, который дополнил и уточнил предыдущие спецификации. Основными драйверами развития DCB стали компании-производители сетевого оборудования (Cisco, Brocade, Juniper) и разработчики протоколов хранения данных (Fibre Channel over Ethernet — FCoE).

Основные компоненты и стандарты DCB

DCB включает несколько ключевых протоколов и механизмов, каждый из которых решает определенную задачу:

Приоритетное управление потоком (Priority Flow Control, PFC) — IEEE 802.1Qbb

PFC — это механизм управления перегрузками на уровне канального уровня. В отличие от стандартного Ethernet, который при переполнении буфера коммутатора просто отбрасывает пакеты, PFC позволяет приостанавливать передачу трафика определенного приоритета на время, необходимое для освобождения буфера. Это предотвращает потери пакетов для критически важного трафика (например, для FCoE). PFC работает на основе 8 классов приоритета (CoS), определенных в стандарте IEEE 802.1p. Каждому классу назначается свой виртуальный канал, и при перегрузке коммутатор отправляет управляющий кадр (PAUSE) на источник, указывая, какой класс приоритета нужно приостановить.

Расширенные механизмы передачи (Enhanced Transmission Selection, ETS) — IEEE 802.1Qaz

ETS — это алгоритм планирования трафика, который гарантирует каждому классу приоритета минимальную долю пропускной способности канала. В отличие от простого приоритетного планирования (strict priority), где трафик высшего приоритета может полностью блокировать низкоприоритетный, ETS распределяет полосу пропорционально заранее заданным весам. Это позволяет, например, выделить 50% пропускной способности для трафика хранения данных, 30% — для межпроцессорного обмена и 20% — для обычного IP-трафика. Если какой-то класс не использует свою полосу, она может быть временно распределена между другими классами.

Обнаружение и конфигурация DCB (Data Center Bridging Exchange, DCBX) — IEEE 802.1Qaz

DCBX — это протокол обнаружения и обмена конфигурацией DCB между соседними устройствами (коммутаторами и сетевыми адаптерами). Он основан на протоколе Link Layer Discovery Protocol (LLDP) и позволяет автоматически согласовывать параметры PFC, ETS и других функций DCB. DCBX упрощает развертывание и администрирование сети, так как администратору достаточно настроить параметры на одном конце канала, а остальные устройства автоматически подстроятся.

Контроль перегрузок на основе квантования (Quantized Congestion Notification, QCN) — IEEE 802.1Qau

QCN — это механизм управления перегрузками на уровне сети, который позволяет источникам трафика динамически снижать скорость передачи при обнаружении перегрузки в промежуточных коммутаторах. QCN использует обратную связь от коммутаторов к отправителям, что позволяет более эффективно использовать пропускную способность и избежать потерь пакетов. Этот стандарт менее распространен, чем PFC и ETS, и часто реализуется в специализированных решениях для высокопроизводительных вычислений.

Применение DCB

DCB нашел широкое применение в нескольких ключевых областях:

Конвергентные сети (FCoE и iSCSI)

Основное применение DCB — поддержка протокола Fibre Channel over Ethernet (FCoE). FCoE инкапсулирует кадры Fibre Channel в Ethernet-кадры, позволяя использовать одну сетевую инфраструктуру для трафика хранения данных и локальной сети. DCB обеспечивает для FCoE необходимые гарантии: отсутствие потерь (PFC), гарантированную полосу (ETS) и автоматическое согласование параметров (DCBX). В меньшей степени DCB используется для протоколов iSCSI и NVMe over Fabrics (NVMe-oF), которые также требуют низких задержек и надежности.

Высокопроизводительные вычисления (HPC) и межпроцессорное взаимодействие

В кластерах HPC и системах искусственного интеллекта для обмена данными между узлами часто используется протокол RDMA over Converged Ethernet (RoCE). RoCE работает поверх Ethernet и требует от сети отсутствия потерь пакетов и низкой задержки. DCB, особенно PFC, является критически важным для стабильной работы RoCE, так как потеря даже одного пакета может привести к значительному снижению производительности.

Виртуализированные среды

В гипервизорах (VMware vSphere, Microsoft Hyper-V) DCB используется для управления трафиком виртуальных машин. Администратор может назначать различные классы обслуживания для разных типов трафика (например, для трафика управления, миграции виртуальных машин, хранения данных), гарантируя, что критически важные приложения не будут страдать от перегрузок, создаваемых менее важным трафиком.

Преимущества и недостатки

Преимущества

  • Снижение стоимости: Уменьшение количества сетевых адаптеров, кабелей и коммутаторов за счет консолидации трафика.
  • Упрощение управления: Единая точка управления для всех типов трафика.
  • Гарантированное качество обслуживания: Возможность выделять полосу и приоритеты для разных приложений.
  • Отсутствие потерь: PFC предотвращает потери пакетов для критически важного трафика.

Недостатки

  • Сложность настройки: DCB требует точной настройки параметров PFC и ETS на всех устройствах сети. Ошибки конфигурации могут привести к деградации производительности или полной неработоспособности.
  • Чувствительность к ошибкам: Неправильная работа PFC может вызвать эффект «головной блокировки» (head-of-line blocking), когда один класс трафика блокирует передачу других.
  • Ограниченная совместимость: Не все сетевые устройства поддерживают DCB, а реализация стандартов может различаться у разных производителей, что требует тщательного тестирования.
  • Необходимость в специализированном оборудовании: Для поддержки DCB требуются коммутаторы и сетевые адаптеры с поддержкой соответствующих стандартов, что может быть дороже стандартного оборудования.

Критика и альтернативы

Несмотря на широкое распространение, DCB подвергается критике за сложность и высокую стоимость внедрения. В последние годы набирают популярность альтернативные подходы, такие как:

  • RDMA over Converged Ethernet (RoCEv2): Упрощенная версия RoCE, которая может работать без PFC в некоторых сценариях, используя механизмы управления перегрузками на транспортном уровне (например, DCQCN).
  • TCP с улучшенным управлением перегрузками: Современные реализации TCP (например, BBR) могут обеспечивать хорошую производительность даже в сетях с потерями, снижая потребность в DCB.
  • Сети на основе технологии InfiniBand: Для высокопроизводительных вычислений InfiniBand остается предпочтительным выбором, так как он изначально спроектирован для работы без потерь и с минимальными задержками.

Интересные факты

  • Стандарт IEEE 802.1Qbb (PFC) был разработан на основе более раннего протокола PAUSE (IEEE 802.3x), но с возможностью приостановки только определенного класса трафика, а не всего канала.
  • DCB является основой для технологии Fibre Channel over Ethernet (FCoE), которая в 2010-х годах активно продвигалась как замена традиционным SAN-сетям на Fibre Channel. Однако впоследствии FCoE не получил массового распространения из-за сложности и высокой стоимости.
  • В современных ЦОД крупных компаний (например, Google, Microsoft) DCB используется в сочетании с программно-определяемыми сетями (SDN) для динамического управления качеством обслуживания.

Источники

  1. IEEE 802.1Qbb-2011 — Standard for Local and Metropolitan Area Networks — Priority-based Flow Control.
  2. IEEE 802.1Qaz-2011 — Standard for Local and Metropolitan Area Networks — Enhanced Transmission Selection.
  3. IEEE 802.1Qau-2010 — Standard for Local and Metropolitan Area Networks — Congestion Notification.
  4. IEEE 802.1Qcr-2018 — Standard for Local and Metropolitan Area Networks — Bridges and Bridged Networks — Amendment: Asynchronous Traffic Shaping.
  5. Cisco Systems. «Data Center Bridging: A Technical Overview». White Paper, 2010.
  6. Brocade Communications Systems. «Understanding Data Center Bridging». Technical Brief, 2012.
  7. Mellanox Technologies. «RoCE vs. iWARP: Comparative Analysis». Application Note, 2016.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →