Mellanox (NVIDIA Mellanox) 920-9B110-00FH-0D0 Техническое решение для коммутатора InfiniBand

July 14, 2026

Mellanox (NVIDIA Mellanox) 920-9B110-00FH-0D0 Техническое решение для коммутатора InfiniBand

Mellanox (NVIDIA Mellanox) 920-9B110-00FH-0D0 Техническое решение коммутатора InfiniBand — оптимизация межсоединения с малой задержкой для кластеров RDMA/HPC/AI

В этом техническом документе представлена ​​комплексная архитектура решения, построенная на основеМелланокс (NVIDIA Mellanox) 920-9B110-00FH-0D0Переключатель InfiniBand. Этот документ, предназначенный для сетевых архитекторов, инженеров по предпродажной подготовке и руководителей операций, подробно описывает, как920-9Б110-00ФХ-0Д0обеспечивает детерминированный RDMA с низкой задержкой и без потерь, а также масштабируемую полосу пропускания HDR 200 Гбит/с для средних и крупных кластеров HPC и искусственного интеллекта. Мы рассматриваем архитектурное проектирование, ключевые технологии, топологии развертывания, передовые методы эксплуатации и оценку стоимости.

1. Предыстория проекта и анализ требований

Современное обучение искусственному интеллекту, научное моделирование и аналитика с интенсивным использованием данных требуют сетевых структур, которые обеспечивают постоянную задержку в доли микросекунды, нулевую потерю пакетов и высокую пропускную способность пополам. Традиционные решения на базе Ethernet, даже с усовершенствованиями RoCEv2, часто терпят неудачу из-за сложного управления перегрузкой, накладных расходов на настройку PFC и непредсказуемой задержки под нагрузкой. Для организаций, развертывающих кластеры с числом от 64 до 512 узлов графического процессора, существует явная потребность в специально созданном межсетевом соединении, которое сочетает в себе производительность, стоимость и простоту эксплуатации.

Ключевые требования к проекту, определенные для типичных развертываний HPC/AI, включают:

  • Задержка сквозного переключения < 1 мкс (порт-порт) при полной нагрузке
  • Структура без потерь и нулевая потеря пакетов из-за перегрузки
  • Масштабируемая топология, поддерживающая 64–512 узлов с полной полосой пропускания пополам.
  • Упрощенные операции благодаря встроенной телеметрии и автоматическому восстановлению после сбоев.
  • Экономичная цена за порт для среднего бюджета

NVIDIA Мелланокс 920-9B110-00FH-0D0напрямую удовлетворяет эти потребности, объединяя технологию HDR (высокая скорость передачи данных) 200 Гбит/с, адаптивную маршрутизацию и коллективную разгрузку SHARP в энергоэффективную платформу высотой 1U.920-9B110-00FH-0D0 Переключатель InfiniBand OPNупрощает закупки благодаря четкому номеру детали для заказа, обеспечивая единообразную конфигурацию при развертывании.

2. Общий проект архитектуры сети/системы.

Рекомендуемая архитектура соответствует двухуровневой топологии «листового дерева» (толстого дерева), обеспечивающей полную полосу пропускания пополам и высокую отказоустойчивость. Каждый листовой блок состоит из нескольких стоек, по два в каждой стойке.920-9Б110-00ФХ-0Д0переключатели для резервирования. Уровень позвоночника объединяет трафик от всех конечных коммутаторов, обеспечивая неблокирующую связь между любыми двумя конечными точками. Для типичного кластера с 256 графическими процессорами в конструкции используются восемь конечных коммутаторов (каждый из которых соединяет 32 узла графических процессоров через каналы 200G) и четыре магистральных коммутатора, соединенных между собой оптическими кабелями 200G HDR или кабелями ЦАП.

Плотность порта коммутатора 200 Гбит/с обеспечивает гибкую топологию, в том числе:

  • 3‑ступенчатый Кло (жирное дерево):Идеально подходит для сбалансированных рабочих нагрузок с предсказуемой структурой трафика.
  • Стрекоза+:Для сверхбольших кластеров, требующих высокого радиуса и эффективной глобальной связи.

920-9B110-00FH-0D0 MQM8790-HS2F 200 Гбит/с HDRПлатформа лежит в основе коммутатора, обеспечивая совместимость с экосистемой NVIDIA HDR, включая адаптеры ConnectX‑6 и ConnectX‑7.Совместимость с 920-9B110-00FH-0D0design также поддерживает оптику сторонних производителей, проверенную в рамках партнерской программы NVIDIA, что обеспечивает гибкость развертывания.

3. Роль и ключевые особенностиМелланокс (NVIDIA Mellanox) 920-9B110-00FH-0D0в решении

NVIDIA Мелланокс 920-9B110-00FH-0D0является краеугольным камнем этого решения, предоставляя надежный набор расширенных сетевых возможностей:

  • HDR 200 Гбит/с на порт– со сквозной коммутацией, обеспечивающей задержку между портами менее 900 нс, что идеально подходит для чувствительных к задержке рабочих нагрузок RDMA и MPI.
  • Адаптивная маршрутизация– динамически выбирает наименее перегруженный путь для каждого пакета, избегая соединений с «горячими точками» и поддерживая стабильную производительность даже при асимметричных структурах трафика.
  • SHARPv2 (Протокол масштабируемого иерархического агрегирования и сокращения)– разгружает коллективную связь (полное сокращение, широковещательную рассылку) с центральных процессоров, уменьшая помехи в сети и повышая эффективность обучения ИИ до 25%.
  • Внутрисетевые вычисления– поддерживает сокращение и сегментацию данных, освобождая ценные ресурсы графического процессора для вычислений.
  • Расширенная телеметрия– счетчики для каждого порта, гистограммы занятости буфера и показатели задержки на уровне пути, которые можно экспортировать через API UFM или REST для упреждающего мониторинга.

Технические характеристики 920-9Б110-00ФХ-0Д0также включает поддержку как пассивных медных ЦАП, так и активных оптических модулей, обеспечивая гибкость расстояния от внутри стойки (≤5 м) до между стойками (до 100 м с оптикой 200G SR4). Для организаций, которым требуется высокая плотность развертывания, форм-фактор коммутатора 1U и низкое энергопотребление (≈1,5 Вт на порт) минимизируют эксплуатационные расходы.

4. Рекомендации по развертыванию и масштабированию (типичная топология)

Для поэтапного развертывания мы рекомендуем следующий подход:

  • Этап 1 – Пилотный проект (64 узла графического процессора):Разверните 2 листовых коммутатора и 2 магистральных коммутатора. Проверьте производительность на соответствиеТехнический паспорт 920-9B110-00FH-0D0параметры, уделяя особое внимание задержке, пропускной способности и эффективности разгрузки SHARP.
  • Этап 2. Масштабирование (128–256 узлов):Добавляйте листовые коммутаторы с шагом 2 на стойку и магистральные коммутаторы по мере необходимости, чтобы поддерживать переподписку в соотношении ≤ 1:1. Плотность портов 200G позволяет одному конечному коммутатору поддерживать 32–64 узла (в зависимости от скорости восходящего канала узла).
  • Этап 3 – Многоплоскостность (более 512 узлов):Реализуйте несколько независимых фабрик (например, 2× или 4× плоскости) с балансировкой нагрузки на основе маршрутов, используя поддержку коммутатором виртуальных полос и ключей разделов.

В типичной кабельной системе используются ЦАП OSFP-OSFP для соединений внутри стойки (≤3 м) и оптические модули OSFP-200G SR4 для расстояний до 100 м.920-9B110-00FH-0D0 Коммутатор InfiniBand Решение OPNупрощает логистику — OPN обеспечивает единообразие версий аппаратного и встроенного ПО для всех устройств, сокращая количество ошибок при развертывании.

5. Эксплуатация, мониторинг, диагностика неисправностей и оптимизация.

Эффективные операции имеют решающее значение для поддержания низкой задержки в производстве. Решение интегрируется сNVIDIA UFM (унифицированный менеджер фабрики), который обеспечивает:

  • Панель управления в режиме реального времени– Пропускная способность каждого порта, счетчики ошибок и тепловые карты перегрузки.
  • Автоматическая повторная оптимизация пути– когда канал ухудшается или выходит из строя, UFM пересчитывает маршруты и перенастраивает таблицы адаптивной маршрутизации без вмешательства оператора.
  • Историческая телеметрия– сохраняет данные о задержке и потоке для последующего анализа и планирования мощности.

Рекомендуемый рабочий процесс устранения неполадок и оптимизации:

  1. Мониторинг кадров паузы и сброса на каждом порту– ожидается нулевой сброс; любой брак указывает на неправильную конфигурацию или неисправную оптику. Используйте оповещения UFM для превентивного выявления проблем.
  2. Проверка работы SHARPv2– проверить коллективную статистику UFM, чтобы убедиться, что операции по сокращению разгружены; если нет, проверьте конфигурацию прошивки и адаптера.
  3. Оптимизация порогов адаптивной маршрутизации– корректируйте интервалы измерения нагрузки в зависимости от структуры рабочей нагрузки.920-9Б110-00ФХ-0Д0обеспечивает точную настройку через интерфейсы управления.
  4. Регулярные обновления прошивки– доступно через портал поддержки NVIDIA, включая улучшения производительности и исправления безопасности.

Для организаций, оценивающих920-9Б110-00ФХ-0Д0 ценаПростота эксплуатации и снижение затрат на проектирование напрямую способствуют снижению совокупной стоимости владения по сравнению с альтернативами Ethernet, требующими постоянной настройки.

6. Резюме и оценка стоимости

Мелланокс (NVIDIA Mellanox) 920-9B110-00FH-0D0предлагает проверенную и экономичную основу для кластерных сетей RDMA/HPC/AI. Сочетая скорость HDR 200 Гбит/с, передовые сетевые вычисления и надежную телеметрию, он устраняет традиционные узкие места производительности и обеспечивает четкий путь обновления от проблемных фабрик Ethernet. Ключевые ценностные предложения включают в себя:

  • Производительность:Задержка менее 900 нс, нулевая потеря пакетов и ускорение коллективных операций до 25 % благодаря SHARPv2.
  • Масштабируемость:Поддерживает кластеры из 64–512+ узлов с полной пропускной способностью пополам, адаптируемые как к топологиям «толстого дерева», так и к топологиям Dragonfly+.
  • Операционная эффективность:Интеграция UFM и автоматическое устранение неисправностей сокращают ручное вмешательство более чем на 80%.
  • Экономическая эффективность:Конкурентные цены за порт (920-9Б110-00ФХ-0Д0 цена) и низкое энергопотребление обеспечивают привлекательную совокупную стоимость владения.

Технический паспорт 920-9B110-00FH-0D0иТехнические характеристики 920-9Б110-00ФХ-0Д0предоставить исчерпывающую техническую информацию, и устройства будут легко доступны (920-9B110-00FH-0D0 в продажечерез глобальную сеть каналов NVIDIA). Совместимость коммутатора с существующими адаптерами NVIDIA обеспечивает плавный путь миграции для организаций, уже инвестировавших в экосистему Mellanox.

Таким образом, это техническое решение, основанное на920-9B110-00FH-0D0 Коммутатор InfiniBand Решение OPNобеспечивает надежную и эффективную в эксплуатации структуру, отвечающую самым строгим требованиям к межсетевым соединениям с малой задержкой, что является краеугольным камнем для следующего поколения вычислений искусственного интеллекта и высокопроизводительных вычислений.