Mellanox (NVIDIA Mellanox) Коммутатор InfiniBand MQM9790-NS2F в действии: оптимизация межсоединения с малой задержкой для RDMA/HPC

July 13, 2026

последние новости компании о Mellanox (NVIDIA Mellanox) Коммутатор InfiniBand MQM9790-NS2F в действии: оптимизация межсоединения с малой задержкой для RDMA/HPC

Mellanox (NVIDIA Mellanox) MQM9790-NS2F InfiniBand Switch в действии Оптимизация межсоединений с низкой задержкой для кластеров RDMA / HPC / AI

По мере того, как кластеры обучения ИИ масштабируются от тысяч до десятков тысяч графических процессоров, задержка сети и контроль перегрузки становятся решающими факторами эффективного использования вычислений.Ведущая международная исследовательская организация ИИ недавно развернулаMellanox (NVIDIA Mellanox) MQM9790-NS2Fперейти к поддержке своего суперкомпьютерного оборудования следующего поколения, поддерживающего крупномасштабные языковые модели, моделирование молекулярной динамики и распределенное глубокое обучение.В этой статье рассматривается развертывание реального мира, в котором подробно описывается, как этот коммутатор InfiniBand трансформирует транспорт RDMA, HPC-коммуникацию и параллельные учебные материалы для данных ИИ.

Опыт и проблемы: от компромисса Ethernet до императива беспотери взаимосвязи

Организация изначально полагалась на 100GbE Ethernet с RoCEv2. Однако, по мере того, как их узлы GPU выросли до более чем 1200 серверов (каждый с 8× NVIDIA H100 GPU),они столкнулись с постоянными тупиками PFC, сложные настройки ECN, и случайные пакеты, которые вызывали тренировочные остановки.Эти проблемы увеличили среднее время завершения работы более чем на 35% и потребовали значительных инженерных усилий в решении проблем в сетиСуществующая инфраструктура больше не может обеспечить детерминированную задержку на уровне микросекунд и пропускную способность без перегрузки, необходимую для массовых операций с сокращением и сбором всех.

Решение и развертывание:MQM9790-NS2F InfiniBand Switchкак тканевая спинка

После оценки нескольких альтернатив, команда выбралаNVIDIA Mellanox MQM9790-NS2FКаждый листный стойка оснащен двумяMQM9790-NS2F 400Gb/s NDR 64-портный OSFPкоммутаторы, обеспечивающие 64 порта OSFP на единицу и общую мощность коммутации 25,6 Тб/с. Скорость NDR 400 Гбит/с на порт, в сочетании с переключением и адаптивным маршрутизацией,обеспечивает задержку от порта к порту менее 600 нс, что является критическим требованием для их интенсивных рабочих нагрузок с графическим процессоромРазвертывание использовалоMQM9790-NS2F Раствор коммутатора InfiniBandинтегрирован с прошивкой NVIDIA Quantum‐2, обеспечивающей бесперебойную работуСовместимая с MQM9790-NS2Fработа с существующими адаптерами ConnectX-7 и DPU BlueField-3.

Ключевые варианты развертывания включают:

  • Топология:Неблокирующее жирное дерево с 64-портовыми оптическими приемопередатчиками OSFP до 400G, обеспечивающим полную бисекционную полосу пропускания для всех узлов GPU.
  • Управление:NVIDIA UFM (Unified Fabric Manager) для телеметрии в режиме реального времени, обнаружения перегрузок и проактивного перенаправления маршрута.
  • Коллективная разгрузка:SHARPv3 позволяет ускорять все-уменьшить операции, отгружая связь с хост-CPU.

Для обеспечения плавного перехода команда проконсультировалась сЛист данных MQM9790-NS2FиСпецификации MQM9790-NS2FФорм-фактор 1U и избыточные источники питания аккуратно вписываются в их существующую плотность стойки, а порты OSFP поддерживают кабели DAC и оптические модули,предлагая гибкость для будущего расширения.

Измеренные результаты и выгоды

После полного развертывания и оптимизации организация задокументировала значительные улучшения в нескольких аспектах:

Метрический До (RoCEv2) После (MQM9790-NS2F)
Средняя задержка с полным сокращением (1 ГБ) ~ 18 мс < 8 μs
Задержка задержки (99,9%) > 150 μs < 15 μs
Эффективное использование графического процессора ~ 72% ~91%
Время завершения работы (в среднем) Базовый показатель -28% (1,4 раза быстрее)

Помимо необработанных цифр, команда сообщила о почти нулевых перебоях, связанных с перегрузкой, что значительно упрощает работу сети.NVIDIA Mellanox MQM9790-NS2FЭто позволило автоматическому балансированию нагрузки на всех 64 портах OSFP, исключив ручное настройки ECN.MQM9790-NS2F InfiniBand переключательпредоставили детерминированную производительность даже при 95% использовании ссылки, что было невозможно с их предыдущей настройкой Ethernet.

Организация также отметила, чтоЦена MQM9790-NS2F, амортизировано за 5-летний жизненный цикл, было компенсировано снижением потребления энергии на порт (≈1,5 Вт на порт 400 Г) и более низкими затратами на кабелирование из-за более высокой плотности портов.С общей доступностью, теперь созревшей, они подтвердили, чтоMQM9790-NS2F для продажичерез уполномоченные каналы сделать закупки простыми, иЛист данных MQM9790-NS2Fпредоставил все необходимые детали установки и соответствия.

Резюме и перспективы Проект инфраструктуры ИИ следующего поколения

ПринятиеMellanox (NVIDIA Mellanox) MQM9790-NS2Fв этом крупномасштабном кластере HPC/AI демонстрирует, что специально построенная ткань InfiniBand больше не является роскошью, а необходимостью для организаций, расширяющих границы ИИ и научных вычислений.Предоставляя постоянную латентность до микросекунды, без потерь RDMA-транспорт и ускорение вычислений в сети,MQM9790-NS2F 400Gb/s NDR 64-портный OSFPswitch позволяет центрам обработки данных достичь почти линейной масштабируемости до десятков тысяч графических процессоров.

В будущем команда планирует расширить ткань с дополнительнымиMQM9790-NS2F InfiniBand переключательВ частности, в рамках проекта "Обеспечение экологической безопасности" разработан проект "Обеспечение экологической безопасности и экологической безопасности".Совместимая с MQM9790-NS2FДля архитекторов и ИТ-менеджеров, оценивающих подобные обновления, этот реальный случай подтверждает, чтоMQM9790-NS2F Раствор коммутатора InfiniBandпредлагает проверенный, экономически эффективный путь к высокопроизводительной кластерной сети с низкой задержкой – важный фактор для инноваций в области ИИ в следующем десятилетии.