NVIDIA Mellanox 920-9B210-00FN-0D0 на практике: построение NDR низкозадержной ткани для кластеров ИИ с триллионами параметров

August 26, 2026

последние новости компании о NVIDIA Mellanox 920-9B210-00FN-0D0 на практике: построение NDR низкозадержной ткани для кластеров ИИ с триллионами параметров

NVIDIA Mellanox 920-9B210-00FN-0D0 на практике: построение низколатентной сети NDR для ИИ-кластеров с триллионом параметров

Предпосылки и вызов: когда HDR встречается с моделями с триллионом параметров

Ведущая организация в области исследований ИИ недавно масштабировала свой кластер для обучения больших языковых моделей с 1024 до 4096 графических процессоров NVIDIA H100 с целью сокращения времени обучения разреженной модели MoE (смесь экспертов) с 1,8 триллиона параметров с месяцев до менее чем двух недель. Однако во время первоначальной проверки команда наблюдала сильную перегрузку на этапе связи «все-ко-всем» в их существующей сети HDR со скоростью 200 Гбит/с, что привело к падению утилизации GPU с ожидаемых 85% до всего лишь 52% — значительно ниже порога, необходимого для соблюдения их амбициозных сроков обучения.

Анализ сети показал, что коллективные операции «все-ко-всем», присущие архитектурам MoE, насыщали каналы HDR и вызывали срабатывание механизмов управления перегрузкой, которые еще больше увеличивали задержку. Организации требовалась сеть, которая могла бы обеспечивать детерминированную задержку менее микросекунды для тысяч конечных точек, обеспечивая при этом достаточную пропускную способность для поглощения всплесков трафика без снижения производительности. Именно эту задачу призвана решить NVIDIA Mellanox 920-9B210-00FN-0D0.

Решение и развертывание: сеть NDR со скоростью 400 Гбит/с для эксафлопсного ИИ

Организация развернула коммутатор InfiniBand 920-9B210-00FN-0D0 OPN (номер заказа) в качестве основы новой двухуровневой сети leaf-spine. На уровне leaf каждый стойка получила два коммутатора 920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR, обеспечивающих 128 портов со скоростью 400 Гбит/с для 64 серверов H100 с двумя портами на стойку через активные оптические кабели OSFP-to-OSFP. На уровне spine 16 дополнительных коммутаторов 920-9B210-00FN-0D0 соединили все коммутаторы leaf, создав неблокирующую fat-tree с полной бисексуальной пропускной способностью 51,2 Тбит/с на уровень spine.

Что сделало это решение особенно привлекательным, так это интегрированная технология SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) коммутатора. Для рабочей нагрузки MoE связь «все-ко-всем» была выгружена непосредственно на сеть коммутаторов, при этом коммутаторы выполняли сокращение и перераспределение данных в сети. Это устранило необходимость в нескольких проходах на стороне хоста, значительно снизив накладные расходы на связь, которые омрачали предыдущее развертывание HDR.

Согласно техническому описанию 920-9B210-00FN-0D0, коммутатор обеспечивает задержку cut-through менее 100 нс, что было подтверждено на этапе проверки концепции. Инженерная команда также подтвердила, что совместимая с 920-9B210-00FN-0D0 экосистема включала всю оптику и кабели OSFP, которые они уже квалифицировали, устраняя задержки в закупках. Технические характеристики 920-9B210-00FN-0D0—включая двойные резервированные блоки питания и горячезаменяемые вентиляторы—дали команде уверенность в достижении целевого показателя доступности 99,999% для производственного кластера.

Результаты и измеримые достижения: от узкого места к ускорителю

После полного развертывания сети NDR и перезапуска задания обучения MoE организация измерила трансформационные улучшения по нескольким направлениям:

  • Восстановление утилизации GPU: Средняя утилизация GPU выросла с 52% до 89%, а пиковая утилизация достигла 94% во время вычислительно интенсивных фаз—прямой результат устранения задержек, вызванных сетью.
  • Сокращение задержки «все-ко-всем»: Время, необходимое для полного обмена «все-ко-всем» между 4096 GPU, сократилось с 180 мс до менее чем 45 мс, что на 75% улучшило прямую трансляцию в более быстрые итерации обучения.
  • Время завершения задания: Прогнозируемое время обучения модели MoE объемом 1,8 ТБ сократилось с 14 дней до 9 дней—ускорение на 36%, что значительно сократило как время выхода на рынок, так и затраты на облачные вычисления.
  • Операционная эффективность: При 64 портах на коммутатор количество необходимых коммутаторов spine сократилось на 37% по сравнению с конструкцией HDR с 40 портами, что упростило кабельную систему и снизило энергопотребление на стойку на 28%.

С точки зрения общей стоимости владения, финансовый отдел организации отметил, что, хотя цена 920-9B210-00FN-0D0 за единицу была выше, чем у альтернативы HDR, стоимость сетевого подключения на GPU фактически снизилась благодаря более высокой степени интеграции и уменьшенному количеству уровней коммутаторов. Это экономическое преимущество в сочетании с драматическим повышением производительности сделало обновление до NDR явным бизнес-успехом. Решение для коммутатора InfiniBand 920-9B210-00FN-0D0 OPN также беспрепятственно интегрировалось с их существующим развертыванием NVIDIA UFM, обеспечивая централизованную видимость и автоматизированное оповещение, что снизило операционные расходы на 40%.

Резюме и перспективы: основа NDR для ИИ следующего поколения

NVIDIA Mellanox 920-9B210-00FN-0D0 оказался трансформационным решением, которое требовалось этой организации в области исследований ИИ для раскрытия полного потенциала ее кластера H100 с 4096 GPU. Обеспечивая пропускную способность NDR 400 Гбит/с, плотность портов 64, вычисления в сети SHARPv3, коммутатор позволил им масштабироваться с 1024 до 4096 GPU без ущерба для производительности или управляемости—достижение, которое было бы невозможно с их предыдущей инфраструктурой HDR.

Заглядывая в будущее, организация планирует расшириться до 8192 GPU в течение следующих 18 месяцев, используя 920-9B210-00FN-0D0 для продажи через партнеров NVIDIA для создания еще более крупной трехъярусной сети folded-Clos. Для организаций, оценивающих свои инвестиции в сетевые технологии для ИИ и HPC следующего поколения, 920-9B210-00FN-0D0 предлагает проверенное, готовое к производству решение, которое выполняет обещание оптимизации низколатентных RDMA-соединений на эксафлопсной шкале.