NVIDIA Mellanox MQM9790-NS2F в действии: создание низколатентной RDMA-сети для кластеров ИИ и HPC

August 24, 2026

последние новости компании о NVIDIA Mellanox MQM9790-NS2F в действии: создание низколатентной RDMA-сети для кластеров ИИ и HPC

NVIDIA Mellanox MQM9790-NS2F в действии: создание ткани RDMA с низкой задержкой для кластеров ИИ и HPC

История и проблема: когда масштабирование становится узким горлом

По мере того, как большие языковые модели масштабируются от тысяч до десятков тысяч графических процессоров, а метеорологические симуляции продвигаются к разрешению в километровом масштабе,ограничения традиционных тканей Ethernet становятся очевиднымиВ этих условиях коллективные коммуникационные модели MPI, такие как "all-reduce" и "all-to-all", предъявляют крайние требования к задержке сети и контролю перегрузки.Даже самые мощные вычислительные узлы тратят значительную часть своих циклов, ожидая данных., эффективно тратить дорогостоящие ресурсы GPU.

Именно это вызов, с которым сталкиваетсяNVIDIA Mellanox MQM9790-NS2FКак коммутатор NDR InfiniBand 400Gb/s с 64 портами OSFP, он спроектирован для обеспечения детерминированной задержки до микросекунды на тысячах конечных точек,позволяет осуществлять истинное линейное масштабирование распределенных нагрузок.

Решение и развертывание: ткань из листья-позвоночника, созданная для RDMA

В типичном сценарии развертывания для крупной исследовательской лаборатории ИИMQM9790-NS2F InfiniBand переключательсоставляет ядро двухуровневой топологии листового позвоночника. На слое листа каждый вычислительный стойка оборудован одним или двумя блоками MQM9790-NS2F,предоставление 64 портов 400 Гбит/с подключения к серверам GPU через медные кабели прямого подключения OSFP-OSFP или активные оптические кабелиНа спинном слое дополнительные коммутаторы MQM9790-NS2F соединяют листья, создавая не блокирующую ткань жирового дерева с полной полосой пропускания.

What makes this solution particularly compelling is the switch's native support for RDMA over Converged Ethernet (RoCE) when operating in InfiniBand mode—though here it leverages InfiniBand's native RDMA capabilities for even lower latency and CPU offload.MQM9790-NS2F 400Gb/s NDR 64-портный OSFPИнтегрирует технологию SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) от NVIDIA, которая перегружает коллективные операции непосредственно на коммутаторную ткань.Это означает, что операция с полной редукцией, которая обычно проходила через сеть несколько раз, теперь завершается в один проход., сокращая сроки завершения работы до 30% для коммуникационно-интенсивных нагрузок.

Для архитекторов сетей, оценивающихMQM9790-NS2F Раствор коммутатора InfiniBand, процесс развертывания оптимизируется Unified Fabric Manager (UFM) от NVIDIA. UFM обеспечивает централизованную видимость состояния ткани, автоматическое обнаружение топологии,и проактивный мониторинг перегруженности ‒ критические возможности при управлении тканями с более чем 2Ранние пользователи сообщают, чтоСовместимая с MQM9790-NS2FЭкосистема, включающая широкий спектр кабелей и приемопередатчиков, сертифицированных NVIDIA, упрощает закупки и снижает риск развертывания.

Результаты и измеримые выгоды: от теории к реальности производства

В недавнем производственном развертывании для кластера 2.048-GPU, предназначенного для обучения крупномасштабных моделей трансформаторов, модернизация от HDR (200 Гбит/с) к NDR (400 Гбит/с) инфраструктурыNVIDIA Mellanox MQM9790-NS2FВ основе его лежат измеряемые улучшения в различных аспектах:

  • Сокращение времени завершения работы:Итерации обучения с конца на конец для модели с параметром 175B уменьшились на 28%, в основном из-за отгрузки SHARPv3 и снижения задержки хвоста.
  • Использование сети:Среднее использование ткани увеличилось с 62% до 89% без возникновения перегрузки, благодаря передовым адаптивным механизмам маршрутизации и управления перегрузкой.
  • Простота работы:С 64 портами на переключатель количество необходимых спинных переключателей было сокращено вдвое по сравнению с 32-портным HDR-дизайном, что значительно снижает сложность кабеля и расход энергии на стойку.

СогласноСпецификации MQM9790-NS2F, коммутатор обеспечивает задержку от порта к порту менее 100 нс и поддерживает до 51,2 Тб/с совокупной коммутационной мощности, что тесно соответствует производительности, наблюдаемой в этом развертывании.Инженеры сетей также отметили, чтоЛист данных MQM9790-NS2Fточно отражает реальные показатели, без каких-либо неожиданностей на этапе проверки.

С точки зрения TCO возможность консолидации большего количества конечных точек на уровне коммутатора напрямую снизила капитальные затраты.Цена MQM9790-NS2FВ то время, как уровень передачи данных в сетях с более высокой частотой передачи данных выше, чем у эквивалентных решений 200 Гбит/с, стоимость сетевого взаимодействия на GPU фактически снизилась из-за более высокого радикса и меньшего количества слоев коммутаторов.в сочетании с повышением производительности, прояснил деловой случай для руководящего комитета лаборатории.

Резюме и перспективы: Фонд NDR по экзамасштабным вычислениям

ВNVIDIA Mellanox MQM9790-NS2FЭто больше, чем постепенная модернизация, это представляет собой фундаментальный сдвиг в том, как HPC и AI кластеры проектируются.и ускорение вычислений в сети в одном формате 1U, он позволяет архитекторам создавать ткани, которые масштабируются до десятков тысяч конечных точек без ущерба для производительности или управляемости.

В перспективе, поскольку рабочие нагрузки продолжают требовать большей пропускной способности и меньшей задержки,MQM9790-NS2F InfiniBand переключательбудет служить основным строительным блоком для следующего поколения экса-систем.Его совместимость с существующими платформами NVIDIA Quantum-2 и плавная интеграция с UFM обеспечивают плавный путь миграции для организаций, обновляющих от HDR тканейДля ИТ-менеджеров и архитекторов, оценивающих свои инвестиции в сети следующего поколения, MQM9790-NS2F предлагает проверенный,готовое к производству решение, которое выполняет обещание оптимизации взаимосвязей RDMA с низкой задержкой.