Mellanox (NVIDIA Mellanox) MQM9790-NS2F Техническое решение для коммутатора InfiniBand

July 13, 2026

Mellanox (NVIDIA Mellanox) MQM9790-NS2F Техническое решение для коммутатора InfiniBand

Mellanox (NVIDIA Mellanox) MQM9790-NS2F InfiniBand Switch Техническое решение Оптимизация межсоединений с низкой задержкой для кластеров RDMA / HPC / AI

Эта техническая белая книга представляет комплексную архитектуру решений, ориентированную наMellanox (NVIDIA Mellanox) MQM9790-NS2FВ документе, предназначенном для сетевых архитекторов, инженеров по предпродаже и операционных руководителей, подробно описывается, какMQM9790-NS2Fобеспечивает детерминированную сверхнизкую задержку, без потерь RDMA и масштабируемую пропускную способность для инфраструктур HPC и ИИ следующего поколения.наилучшие оперативные практики, и проверки эффективности.

1. Анализ контекста и требований проекта

Современные обучения ИИ и научные симуляционные нагрузки требуют сетевых тканей, которые могут поддерживать массивные модели связи all-reduce, all-gather и point-to-point с подмикросекундным джиттером.Традиционные решения на основе Ethernet, даже с RoCEv2, вводят сложность в управлении перегрузкой, настройке PFC и контроле задержки задержки, часто приводит к неэффективному использованию GPU и непредсказуемым срокам завершения работы.

Ключевые требования, выявленные в типичных проектах HPC/AI, включают:

  • Продолжительность задержки от конца до конца < 1 мкс (переход от порта к порту) при полной нагрузке
  • Ткань без потерь с нулевым количеством упаковок из-за перегрузки
  • Масштабируемость от 64 до более 2000 узлов GPU без изменений архитектуры
  • Упрощенные операции с помощью богатой телеметрии и автоматизированного восстановления неисправностей

ВNVIDIA Mellanox MQM9790-NS2Fнапрямую отвечает этим требованиям, интегрируя технологию NDR 400 Гбит/с, адаптивное маршрутизация и вычисления в сети в 1U, 64-портную платформу OSFP.

2. Общий дизайн сетевой / системной архитектуры

Рекомендуемая архитектура использует двухуровневую топологию спинки листьев (или жирное дерево), чтобы обеспечить полную пропускную способность и высокую устойчивость.с двумя корпусами для каждого стеллажаКоммутаторы MQM9790-NS2F InfiniBandпозвоночный слой объединяет трафик со всех переключателей листов, обеспечивая не блокирующую связь между любыми двумя конечными точками.

ВMQM9790-NS2F 400Gb/s NDR 64-портный OSFPдля кластера с 1024-GPU,Типичный дизайн использует 16 листьев переключателей (каждый соединяет 64 GPU) и 8 спинных переключателейТкань поддерживает как топологии fat-tree, так и Dragonfly+, с адаптивным маршрутизацией, динамически балансирующей трафик по нескольким путям.

3Роль и ключевые особенностиMellanox (NVIDIA Mellanox) MQM9790-NS2Fв растворе

ВNVIDIA Mellanox MQM9790-NS2Fявляется краеугольным камнем этого решения, обеспечивая:

  • 64 порта OSFPКаждый из них работает со скоростью 400 Гбит/с (NDR) ≈ совокупная коммутационная мощность 25,6 Тб/с, с задержкой пропускания менее 600 нс.
  • Адаптивный маршрутизатор- динамически выбирает наименее перегруженный путь по пакету, избегая горячих точек связи и поддерживая постоянную задержку даже при асимметричных моделях трафика.
  • SHARPv3 (протокол масштабируемой иерархической агрегации и редукции) снижает нагрузку на коллективную коммуникацию (all-reduce, broadcast) от хост-CPU, уменьшая сетевые разговоры и ускоряя обучение ИИ до 20-30%.
  • Вычислительные системы в сетиПоддерживает уменьшение данных, сегментацию и даже небольшие операции MPI непосредственно на коммутаторе, освобождая ценные ресурсы GPU для вычислений.
  • Телеметрия и управление перегрузкамиВстроенный передовой мониторинг, включающий счетчики по потоку, гистограммы занятости буфера и показатели задержки на уровне пути, все экспортируемые через UFM или REST API.

Эти возможности позволяютMQM9790-NS2F Раствор коммутатора InfiniBandДля того чтобы обеспечить детерминированную производительность в масштабе, подтвержденную внутренними показателями и развертыванием клиентов.Спецификации MQM9790-NS2Fтакже включают поддержку как пассивных медных DAC, так и активных оптических модулей, обеспечивая гибкость для расстояний до 100 м (с оптикой 400G SR4) и выше.

4. Рекомендации по развертыванию и масштабированию (типичная топология)

Для развертывания в зеленой зоне мы рекомендуем следующий поэтапный подход:

  • Фаза 1 пилотный проект:Разверните 2 переключателя листьев (каждыйMQM9790-NS2FДля проверки производительности в сравненииЛист данных MQM9790-NS2Fпараметры.
  • Фаза 2 Скала-аут:Добавление листовных переключателей по 2 на стойку и спинных переключателей по мере необходимости для поддержания переподписки ≤ 1:1Плотность 64 портов позволяет одному коммутатору размещать полный ракет из 64 узлов GPU (если каждый узел имеет одну 400G-упочную связь).
  • Фаза 3 ¢ Многоуровневые:Для кластеров, превышающих 2000 узлов, внедрять несколько независимых тканей (например, 2× или 4× плоскостей) с балансировкой нагрузки на основе маршрута,использование поддержки коммутатора для виртуальных линий и ключей раздела.

Типичные кабели используют OSFP-to-OSFP DAC для внутрираковых соединений (≤3 м) и OSFP-to-400G SR4 оптические модули для расстояний до 100 м.Совместимая с MQM9790-NS2Fпередатчики проверяются экосистемой оптических поставщиков NVIDIA, обеспечивая бесперебойную совместимость.

5Операции, мониторинг, диагностика и оптимизация ошибок

Эффективные операции имеют решающее значение для поддержания низкой задержки производства.NVIDIA UFM (Унифицированный менеджер тканей), который предусматривает:

  • Приборная панель в реальном времени- пропускная способность на порт, счетчики ошибок и тепловые карты перегрузки.
  • Автоматизированная реоптимизация маршрутаКогда связь ухудшается или выходит из строя, UFM пересчитывает маршруты и переконфигурирует адаптивные таблицы маршрутизации без вмешательства оператора.
  • Историческая телеметрия- хранит данные о задержке и потоке для послемортм-анализа и планирования мощности.

Рекомендуемый процесс устранения неполадок:

  1. Монитор по портам паузовых рамок и отбрасывает ∙ ожидается нулевое отбрасывание; любые отбрасывания указывают на неправильную конфигурацию или неисправную оптику.
  2. Подтвердить работу SHARPv3 с помощью коллективной статистики UFM ∙ обеспечить выполнение операций по сокращению.
  3. Использование встроенных диагностических инструментов (например,Ибдиагноз,ибстатус) для проверки целостности связи и целостности сигнала.

Для оптимизации регулируйте порог адаптивного алгоритма маршрутизации (например, интервал измерения нагрузки) на основе моделей нагрузки MQM9790-NS2F InfiniBand переключательРегулярные обновления прошивки (доступны через портал поддержки NVIDIA) включают улучшения производительности и исправления безопасности.

6. Резюме и оценка стоимости

ВMellanox (NVIDIA Mellanox) MQM9790-NS2Fпредлагает будущую надежную, высокопроизводительную основу для кластеров RDMA/HPC/AI. Объединяя скорость NDR 400 Гбит/с, плотность 64 порта и интеллектуальные вычисления в сети,Он устраняет традиционные узкие места и обеспечивает линейную масштабируемость до класса эксаскала.Решение снижает общую стоимость владения за счет более низкой мощности на порт (≈1,5 Вт), упрощенной кабельной связи и снижения накладных CPU от SHARP.

Для организаций, оценивающихЦена MQM9790-NS2F, инвестиции оправдываются измеримыми увеличениями в использовании GPU (часто превышающими 90% в производстве) и сокращением сроков завершения работ до 40% по сравнению с тканями RoCEv2.Лист данных MQM9790-NS2FиСпецификации MQM9790-NS2Fпредоставляют исчерпывающую информацию, а единицы легко доступны (MQM9790-NS2F для продажиКроме того, совместимость коммутатора с существующими адаптерами NVIDIA обеспечивает плавный путь миграции для пользователей, уже инвестировавших в экосистему Mellanox.

В целом, это техническое решение, основанное наMQM9790-NS2F InfiniBand переключательобеспечивает надежную, оперативно эффективную структуру, которая отвечает самым требовательным требованиям к низкозадержному взаимосвязи, что является краеугольным камнем для следующего поколения суперкомпьютеров ИИ.