NVIDIA Mellanox 920-9B110-00FH-0D0 на практике: Оптимизация RDMA-сетей с низкой задержкой для HPC и AI кластеров

August 25, 2026

последние новости компании о NVIDIA Mellanox 920-9B110-00FH-0D0 на практике: Оптимизация RDMA-сетей с низкой задержкой для HPC и AI кластеров

NVIDIA Mellanox 920-9B110-00FH-0D0 на практике: оптимизация тканей RDMA с низкой задержкой для кластеров HPC и AI

События и вызов: когда HDR-производительность соответствует реальности бюджета

Исследовательская лаборатория среднего размера недавно столкнулась с знакомой проблемой: их существующая 100Gb / s EDR InfiniBand ткань становилась узким горлом для их расширяющегося кластера GPU,которая выросла с 128 до 512 узлов NVIDIA A100Время обучения для крупномасштабных моделей трансформаторов увеличилось более чем на 40% из-за перегрузки сети во время работы на всех уровнях.и команда нуждалась в обновлении, которое могло бы обеспечить существенное повышение производительности без капитальных затрат, необходимых для полного развертывания NDR 400Gb / s.

Лаборатория оценила несколько вариантов и определила 200 Гбит/с HDR как идеальный баланс между производительностью и стоимостью.продвинутый контроль перегруженности, и беспроблемной интеграции с их существующими кабелями и приемопередатчиками, совместимыми с HDR.NVIDIA Mellanox 920-9B110-00FH-0D0В этой статье мы рассмотрим, как HDR обеспечивает большую пропускную способность без перегрузки.

Решение и развертывание: оптимальная стоимость HDR ткани

Лаборатория развернула920-9B110-00FH-0D0 InfiniBand переключатель OPNКаждый вычислительный рак получил один коммутатор на базе MQM8790-HS2F, кремниевой платформы, лежащей в основе920-9B110-00FH-0D0 MQM8790-HS2F 200 Гбит/с HDR¢обеспечение 40 портов 200 Гбит/с подключения к серверам GPU через кабели прямого подключения OSFP-OSFP.создание не блокирующей ткани из жирового дерева с полной полосой пропускания.

Что сделало это развертывание особенно эффективным, так это интегрированная в коммутатор технология SHARPv2 (Scalable Hierarchical Aggregation and Reduction Protocol),которые выгружали операции коллективной связи непосредственно на ткань переключателяНа практике это означало, что все-уменьшающие операции, которые ранее потребляли значительные циклы хост-CPU и пропускную способность сети,Теперь они выполнялись одним прохождением через всю ткань, что резко сокращает время выполнения работ..

Согласно920-9B110-00FH-0D0 лист данных, переключатель обеспечивает задержку пропускания до 200 нс, что соответствует требованиям лаборатории.920-9B110-00FH-0D0 совместимыЭкосистема включала все типы кабелей и оптики, которые они уже стандартизировали, устраняя необходимость дорогостоящих усилий по перекабелированию.

Результаты и измеримые выгоды: от узкого горла к стимулирующему

После развертывания лаборатория измерила улучшения в нескольких важных аспектах:

  • Сокращение времени завершения работы:Итерации обучения для модели с параметром 13B уменьшились на 35%, при этом задержка с полной редукцией снизилась с 12 мкм до менее 5 мкм для типичных коллективных размеров.
  • Использование сети:Среднее использование ткани увеличилось с 58% до 83% без вызова перегрузки, благодаря адаптивным механизмам маршрутизации и управления перегрузкой.
  • Эффективность питания и охлаждения:По сравнению с предыдущей платформой EDR, новая инфраструктура HDR сократила расход энергии в порту на 30%, что позволило лаборатории добавить больше вычислительных узлов, не превышая свой бюджет энергии центра обработки данных.

С точки зрения общей стоимости владения,920-9B110-00FH-0D0 ценаВ то же время, по сравнению с другими вариантами NDR, стоимость исследования в каждом порту была значительно ниже, что позволило лаборатории модернизировать всю свою структуру в рамках существующего бюджета.Спецификации 920-9B110-00FH-0D0также подчеркнул двойные избыточные источники питания переключателя и модули вентиляторов, которые могут быть заменены на горячие, что способствовало достижению лабораторией цели 99,999% доступности для их производственных учебных рабочих мест.

Инженеры сети отметили, что920-9B110-00FH-0D0 InfiniBand Switch OPN решениеинтегрирована с Unified Fabric Manager (UFM) от NVIDIA, обеспечивая централизованную видимость состояния ткани и автоматическое оповещение.Это значительно сократило время, затрачиваемое на устранение неполадок и активное техническое обслуживание, освобождая команду, чтобы сосредоточиться на оптимизации своих трубопроводов обучения, а не на управлении сетью.

Резюме и перспективы: Фонд HDR правильного размера

ВNVIDIA Mellanox 920-9B110-00FH-0D0оказался правильным выбором для этой исследовательской лаборатории, обеспечивая производительность 200 Гбит/с HDR при структуре затрат, которая имела бизнес-смысл.возможности вычислений в сети, и надежные функции управления, лаборатория превратила свою сеть из узкого горла производительности в масштабируемую основу для будущего роста.

В перспективе лаборатория планирует увеличить масштаб своего кластера до 1024 узлов в течение следующих 18 месяцев.Они уверены, что их сеть может расти вместе с их вычислительной мощностью.Для организаций, оценивающих свои варианты инфраструктуры HDR,920-9B110-00FH-0D0 для продажичерез партнеров каналов NVIDIA предлагает убедительное, проверенное на производстве решение, которое балансирует производительность, плотность и стоимость.