NVIDIA Mellanox 920-9B210-00FN-0D0 на практике: построение низколатентной сети NDR для моделей MoE с триллионом параметров

August 27, 2026

последние новости компании о NVIDIA Mellanox 920-9B210-00FN-0D0 на практике: построение низколатентной сети NDR для моделей MoE с триллионом параметров

NVIDIA Mellanox 920-9B210-00FN-0D0 на практике: построение NDR низкозадержной ткани для моделей MoE с триллионами параметров

История и проблема: когда обучение становится проблемой

Ведущая исследовательская организация ИИ недавно увеличила масштабы своего большого кластера обучения языковой модели с 1024 до 4096 графических процессоров NVIDIA H100 с амбициозной целью сокращения времени обучения для 1.8-триллионная модель MoE (Mixture of Experts) от месяцев до менее двух недельОднако во время первоначальной проверки the team discovered that their existing 200Gb/s HDR network was experiencing severe congestion during the all-to-all communication phase—a characteristic pattern of MoE architectures—causing GPU utilization to plummet from an expected 85% to just 52%, значительно ниже порога, необходимого для выполнения срока обучения.

Анализ сети показал, что на коллективную коммуникацию "все-к-всем" приходится более 40% от общего объема коммуникаций модели МЭ.Движение стало все более фрагментированным и разорваннымСуществующая сеть HDR, после запуска механизмов контроля перегрузки, испытала резкое увеличение задержки, оставив значительную часть графических процессоров бездействующими и ожидающими.Организация срочно нуждалась в сетевой ткани, способной обеспечить детерминированную латентность до микросекунд., без потерь, и массивная неблокирующая масштабируемостьNVIDIA Mellanox 920-9B210-00FN-0D0был специально построен именно для этой задачи.

Решение и развертывание: оптимизированная для MoE архитектура NDR Leaf-Spine

Организация развернула двухуровневую ткань из листьев-позвоночника, построенную вокруг920-9B210-00FN-0D0 InfiniBand переключатель OPNВ каждом раке для вычислений два920-9B210-00FN-0D0 MQM9790-NS2F 400 Гбит/с NDRна листовом слое были развернуты коммутаторы, обеспечивающие 400 Гбит/с подключение к 64 серверам H100 с двумя портами через активные оптические кабели OSFP-OSFP.16 дополнительных 920-9B210-00FN-0D0 переключателей взаимосвязанных все переключатели листья, создавая полностью не блокирующую ткань из жирового дерева с общей пропускной способностью 51,2 Тб/с.

Центральным элементом этого решения является интегрированная технология SHARPv3 (протокол масштабируемой иерархической агрегации и сокращения).Связь "все-к-всем" была выгружена прямо на переключательную ткань., с коммутаторами, выполняющими сокращение и перераспределение данных в сети.резко уменьшить расходы на связь, которые были причиной предыдущего развертывания HDR.920-9B210-00FN-0D0 лист данныхподчеркивает задержку пропускания до 100 нс, которая была подтверждена на этапе доказательства концепции и оказалась критической для строгих требований к задержке рабочей нагрузки Министерства энергетики.

ВСпецификации 920-9B210-00FN-0D0¥включая двойные избыточные источники питания и переменные вентиляторы ¥давали команде уверенность в достижении их цели 99,999% доступности.920-9B210-00FN-0D0 совместимыЭкосистема включала все оптики и кабели OSFP, которые они уже квалифицировали, устраняя задержки в закупках и упрощая график развертывания.

Результаты и измеримые выгоды: от узкого горла к стимулирующему

После того, как структура NDR была полностью развернута и учебная работа Министерства энергетики была возобновлена, организация измерила преобразующие улучшения в нескольких измерениях:

  • Восстановление использования GPU:Среднее использование графического процессора выросло с 52% до 89%, а пиковое использование достигло 94% во время вычислительно-интенсивных фаз - прямой результат устранения задержек, вызванных сетью.
  • Уменьшение задержки от всех к всем:Время, необходимое для полного обмена все-на-все на 4096 графических процессорах, снизилось с 180 миль в секунду до менее 45 миль в секунду, что на 75% улучшилось, что напрямую привело к более быстрым итерациям обучения.
  • Время завершения работы:Прогнозируемый график обучения для модели 1.8T MoE был сокращен с 14 дней до всего 9 дней - ускорение на 36%, что значительно сократило как время выхода на рынок, так и затраты на облачные вычисления.
  • Эффективность эксплуатации:С 64 портами на коммутатор количество необходимых спинных коммутаторов было сокращено на 37% по сравнению с 40-портовой конструкцией HDR, упростив кабелирование и снизив расход энергии на стойку на 28%.

С точки зрения общей стоимости собственности финансовая группа организации отметила, что, хотя920-9B210-00FN-0D0 ценаВ то время как стоимость сетевой связи на GPU была выше, чем у альтернатив HDR, стоимость сетевой связи на GPU фактически снизилась из-за более высокого радикса и меньшего количества переключателей.В сочетании с драматическим увеличением производительности, сделали обновление NDR явной победой в бизнесе.920-9B210-00FN-0D0 InfiniBand Switch OPN решениетакже интегрированы с их существующим развертыванием NVIDIA UFM, обеспечивая централизованную видимость и автоматическое оповещение, что снижает операционные накладные расходы на 40%.

Резюме и перспективы: Фонд НДР для следующего поколения рабочих нагрузок МО

ВNVIDIA Mellanox 920-9B210-00FN-0D0Это оказалось преобразующим решением, которое нужно было этой исследовательской организации ИИ, чтобы раскрыть весь потенциал своего кластера H100 с 4,096-GPU.и SHARPv3 в сетевом вычислении, переключение позволило им масштабироваться с 1024 до 4096 графических процессоров без ущерба для производительности или управляемости, что было бы невозможно с их предыдущей инфраструктурой HDR.

В перспективе, организация планирует расширить до 8192 графических процессоров в течение следующих 18 месяцев, используя920-9B210-00FN-0D0 для продажиДля организаций, оценивающих инвестиции в AI и HPC сетей следующего поколения,920-9B210-00FN-0D0 предлагает проверенную, готовое к производству решение, которое выполняет обещание оптимизации взаимосвязей RDMA с низкой задержкой в экзамассе.