Mellanox (NVIDIA Mellanox) 920-9B110-00FH-0D0 Техническое решение для коммутатора InfiniBand
July 14, 2026
Mellanox (NVIDIA Mellanox) 920-9B110-00FH-0D0 Техническое решение коммутатора InfiniBand — оптимизация межсоединения с малой задержкой для кластеров RDMA/HPC/AI
В этом техническом документе представлена комплексная архитектура решения, построенная на основеМелланокс (NVIDIA Mellanox) 920-9B110-00FH-0D0Переключатель InfiniBand. Этот документ, предназначенный для сетевых архитекторов, инженеров по предпродажной подготовке и руководителей операций, подробно описывает, как920-9Б110-00ФХ-0Д0обеспечивает детерминированный RDMA с низкой задержкой и без потерь, а также масштабируемую полосу пропускания HDR 200 Гбит/с для средних и крупных кластеров HPC и искусственного интеллекта. Мы рассматриваем архитектурное проектирование, ключевые технологии, топологии развертывания, передовые методы эксплуатации и оценку стоимости.
1. Предыстория проекта и анализ требований
Современное обучение искусственному интеллекту, научное моделирование и аналитика с интенсивным использованием данных требуют сетевых структур, которые обеспечивают постоянную задержку в доли микросекунды, нулевую потерю пакетов и высокую пропускную способность пополам. Традиционные решения на базе Ethernet, даже с усовершенствованиями RoCEv2, часто терпят неудачу из-за сложного управления перегрузкой, накладных расходов на настройку PFC и непредсказуемой задержки под нагрузкой. Для организаций, развертывающих кластеры с числом от 64 до 512 узлов графического процессора, существует явная потребность в специально созданном межсетевом соединении, которое сочетает в себе производительность, стоимость и простоту эксплуатации.
Ключевые требования к проекту, определенные для типичных развертываний HPC/AI, включают:
- Задержка сквозного переключения < 1 мкс (порт-порт) при полной нагрузке
- Структура без потерь и нулевая потеря пакетов из-за перегрузки
- Масштабируемая топология, поддерживающая 64–512 узлов с полной полосой пропускания пополам.
- Упрощенные операции благодаря встроенной телеметрии и автоматическому восстановлению после сбоев.
- Экономичная цена за порт для среднего бюджета
NVIDIA Мелланокс 920-9B110-00FH-0D0напрямую удовлетворяет эти потребности, объединяя технологию HDR (высокая скорость передачи данных) 200 Гбит/с, адаптивную маршрутизацию и коллективную разгрузку SHARP в энергоэффективную платформу высотой 1U.920-9B110-00FH-0D0 Переключатель InfiniBand OPNупрощает закупки благодаря четкому номеру детали для заказа, обеспечивая единообразную конфигурацию при развертывании.
2. Общий проект архитектуры сети/системы.
Рекомендуемая архитектура соответствует двухуровневой топологии «листового дерева» (толстого дерева), обеспечивающей полную полосу пропускания пополам и высокую отказоустойчивость. Каждый листовой блок состоит из нескольких стоек, по два в каждой стойке.920-9Б110-00ФХ-0Д0переключатели для резервирования. Уровень позвоночника объединяет трафик от всех конечных коммутаторов, обеспечивая неблокирующую связь между любыми двумя конечными точками. Для типичного кластера с 256 графическими процессорами в конструкции используются восемь конечных коммутаторов (каждый из которых соединяет 32 узла графических процессоров через каналы 200G) и четыре магистральных коммутатора, соединенных между собой оптическими кабелями 200G HDR или кабелями ЦАП.
Плотность порта коммутатора 200 Гбит/с обеспечивает гибкую топологию, в том числе:
- 3‑ступенчатый Кло (жирное дерево):Идеально подходит для сбалансированных рабочих нагрузок с предсказуемой структурой трафика.
- Стрекоза+:Для сверхбольших кластеров, требующих высокого радиуса и эффективной глобальной связи.
920-9B110-00FH-0D0 MQM8790-HS2F 200 Гбит/с HDRПлатформа лежит в основе коммутатора, обеспечивая совместимость с экосистемой NVIDIA HDR, включая адаптеры ConnectX‑6 и ConnectX‑7.Совместимость с 920-9B110-00FH-0D0design также поддерживает оптику сторонних производителей, проверенную в рамках партнерской программы NVIDIA, что обеспечивает гибкость развертывания.
3. Роль и ключевые особенностиМелланокс (NVIDIA Mellanox) 920-9B110-00FH-0D0в решении
NVIDIA Мелланокс 920-9B110-00FH-0D0является краеугольным камнем этого решения, предоставляя надежный набор расширенных сетевых возможностей:
- HDR 200 Гбит/с на порт– со сквозной коммутацией, обеспечивающей задержку между портами менее 900 нс, что идеально подходит для чувствительных к задержке рабочих нагрузок RDMA и MPI.
- Адаптивная маршрутизация– динамически выбирает наименее перегруженный путь для каждого пакета, избегая соединений с «горячими точками» и поддерживая стабильную производительность даже при асимметричных структурах трафика.
- SHARPv2 (Протокол масштабируемого иерархического агрегирования и сокращения)– разгружает коллективную связь (полное сокращение, широковещательную рассылку) с центральных процессоров, уменьшая помехи в сети и повышая эффективность обучения ИИ до 25%.
- Внутрисетевые вычисления– поддерживает сокращение и сегментацию данных, освобождая ценные ресурсы графического процессора для вычислений.
- Расширенная телеметрия– счетчики для каждого порта, гистограммы занятости буфера и показатели задержки на уровне пути, которые можно экспортировать через API UFM или REST для упреждающего мониторинга.
Технические характеристики 920-9Б110-00ФХ-0Д0также включает поддержку как пассивных медных ЦАП, так и активных оптических модулей, обеспечивая гибкость расстояния от внутри стойки (≤5 м) до между стойками (до 100 м с оптикой 200G SR4). Для организаций, которым требуется высокая плотность развертывания, форм-фактор коммутатора 1U и низкое энергопотребление (≈1,5 Вт на порт) минимизируют эксплуатационные расходы.
4. Рекомендации по развертыванию и масштабированию (типичная топология)
Для поэтапного развертывания мы рекомендуем следующий подход:
- Этап 1 – Пилотный проект (64 узла графического процессора):Разверните 2 листовых коммутатора и 2 магистральных коммутатора. Проверьте производительность на соответствиеТехнический паспорт 920-9B110-00FH-0D0параметры, уделяя особое внимание задержке, пропускной способности и эффективности разгрузки SHARP.
- Этап 2. Масштабирование (128–256 узлов):Добавляйте листовые коммутаторы с шагом 2 на стойку и магистральные коммутаторы по мере необходимости, чтобы поддерживать переподписку в соотношении ≤ 1:1. Плотность портов 200G позволяет одному конечному коммутатору поддерживать 32–64 узла (в зависимости от скорости восходящего канала узла).
- Этап 3 – Многоплоскостность (более 512 узлов):Реализуйте несколько независимых фабрик (например, 2× или 4× плоскости) с балансировкой нагрузки на основе маршрутов, используя поддержку коммутатором виртуальных полос и ключей разделов.
В типичной кабельной системе используются ЦАП OSFP-OSFP для соединений внутри стойки (≤3 м) и оптические модули OSFP-200G SR4 для расстояний до 100 м.920-9B110-00FH-0D0 Коммутатор InfiniBand Решение OPNупрощает логистику — OPN обеспечивает единообразие версий аппаратного и встроенного ПО для всех устройств, сокращая количество ошибок при развертывании.
5. Эксплуатация, мониторинг, диагностика неисправностей и оптимизация.
Эффективные операции имеют решающее значение для поддержания низкой задержки в производстве. Решение интегрируется сNVIDIA UFM (унифицированный менеджер фабрики), который обеспечивает:
- Панель управления в режиме реального времени– Пропускная способность каждого порта, счетчики ошибок и тепловые карты перегрузки.
- Автоматическая повторная оптимизация пути– когда канал ухудшается или выходит из строя, UFM пересчитывает маршруты и перенастраивает таблицы адаптивной маршрутизации без вмешательства оператора.
- Историческая телеметрия– сохраняет данные о задержке и потоке для последующего анализа и планирования мощности.
Рекомендуемый рабочий процесс устранения неполадок и оптимизации:
- Мониторинг кадров паузы и сброса на каждом порту– ожидается нулевой сброс; любой брак указывает на неправильную конфигурацию или неисправную оптику. Используйте оповещения UFM для превентивного выявления проблем.
- Проверка работы SHARPv2– проверить коллективную статистику UFM, чтобы убедиться, что операции по сокращению разгружены; если нет, проверьте конфигурацию прошивки и адаптера.
- Оптимизация порогов адаптивной маршрутизации– корректируйте интервалы измерения нагрузки в зависимости от структуры рабочей нагрузки.920-9Б110-00ФХ-0Д0обеспечивает точную настройку через интерфейсы управления.
- Регулярные обновления прошивки– доступно через портал поддержки NVIDIA, включая улучшения производительности и исправления безопасности.
Для организаций, оценивающих920-9Б110-00ФХ-0Д0 ценаПростота эксплуатации и снижение затрат на проектирование напрямую способствуют снижению совокупной стоимости владения по сравнению с альтернативами Ethernet, требующими постоянной настройки.
6. Резюме и оценка стоимости
Мелланокс (NVIDIA Mellanox) 920-9B110-00FH-0D0предлагает проверенную и экономичную основу для кластерных сетей RDMA/HPC/AI. Сочетая скорость HDR 200 Гбит/с, передовые сетевые вычисления и надежную телеметрию, он устраняет традиционные узкие места производительности и обеспечивает четкий путь обновления от проблемных фабрик Ethernet. Ключевые ценностные предложения включают в себя:
- Производительность:Задержка менее 900 нс, нулевая потеря пакетов и ускорение коллективных операций до 25 % благодаря SHARPv2.
- Масштабируемость:Поддерживает кластеры из 64–512+ узлов с полной пропускной способностью пополам, адаптируемые как к топологиям «толстого дерева», так и к топологиям Dragonfly+.
- Операционная эффективность:Интеграция UFM и автоматическое устранение неисправностей сокращают ручное вмешательство более чем на 80%.
- Экономическая эффективность:Конкурентные цены за порт (920-9Б110-00ФХ-0Д0 цена) и низкое энергопотребление обеспечивают привлекательную совокупную стоимость владения.
Технический паспорт 920-9B110-00FH-0D0иТехнические характеристики 920-9Б110-00ФХ-0Д0предоставить исчерпывающую техническую информацию, и устройства будут легко доступны (920-9B110-00FH-0D0 в продажечерез глобальную сеть каналов NVIDIA). Совместимость коммутатора с существующими адаптерами NVIDIA обеспечивает плавный путь миграции для организаций, уже инвестировавших в экосистему Mellanox.
Таким образом, это техническое решение, основанное на920-9B110-00FH-0D0 Коммутатор InfiniBand Решение OPNобеспечивает надежную и эффективную в эксплуатации структуру, отвечающую самым строгим требованиям к межсетевым соединениям с малой задержкой, что является краеугольным камнем для следующего поколения вычислений искусственного интеллекта и высокопроизводительных вычислений.

