NVIDIA Mellanox MCX631432AN-ADAB в действии: низкозадержечный транспорт RDMA/RoCE и оптимизация пропускной способности сервера

July 28, 2026

последние новости компании о NVIDIA Mellanox MCX631432AN-ADAB в действии: низкозадержечный транспорт RDMA/RoCE и оптимизация пропускной способности сервера

NVIDIA Mellanox MCX631432AN-ADAB в действии: низкая задержка RDMA/RoCE и оптимизация пропускной способности сервера

Предпосылки и проблемы: сетевое узкое место в кластере обучения ИИ

Ведущая финтех-компания недавно развернула кластер ИИ на базе ГП из 64 узлов, предназначенный для обучения стратегий высокочастотной торговли, причем каждый сервер был оснащен высокопроизводительным хранилищем NVMe. Однако после запуска фактическая пропускная способность обучения значительно не оправдала ожиданий. Анализ после развертывания показал, что межсетевая коммуникационная сеть на базе 10GbE TCP/IP стала основным узким местом. Операции коллективного обмена All-Reduce демонстрировали задержку до 4–5 миллисекунд, в то время как загрузка ЦП для обработки сетевых протоколов превышала 40% — что серьезно ограничивало конвейеры предварительной обработки данных ГП. Команде срочно потребовалось сетевое решение, которое могло бы как значительно снизить задержку связи, так и высвободить вычислительные мощности ЦП.

Решение и развертывание: создание без потерь сети RoCE с помощью MCX631432AN-ADAB

После всесторонней технической оценки команда выбралаNVIDIA Mellanox MCX631432AN-ADABв качестве основы для модернизации своей сети. Каждый сервер был оснащенMCX631432AN-ADAB ConnectX-6 Lx двухпортовый 25GbE SFP28адаптером, причем оба порта SFP28 были подключены к резервным коммутаторам NVIDIA Spectrum-3 для создания высокодоступной архитектуры.

Развертывание было выполнено в три этапа:

  • Этап 1 — Пилотный проект (8 узлов):Команда установилаEthernet-адаптер MCX631432AN-ADABна подмножестве серверов ГП, настроив RoCEv2 с Priority Flow Control (PFC) и Explicit Congestion Notification (ECN) для создания сети Ethernet без потерь. NCCL (NVIDIA Collective Communications Library) была перекомпилирована с поддержкой RDMA.
  • Этап 2 — Настройка и проверка:Используя телеметрические данные, подробно описанные втехническом описании MCX631432AN-ADAB, команда точно настроила параметры DCB и пороговые значения буферов для устранения штормов PFC-пауз при сохранении почти нулевой потери пакетов. СпецификацииMCX631432AN-ADABпослужили руководством для оптимизации модуляции прерываний и глубины очередей для конкретного профиля рабочей нагрузки.
  • Этап 3 — Полный производственный запуск (64 узла):После успешной проверки остальные узлы были переведены на новый адаптер. Совместимые драйверыMCX631432AN-ADABбеспрепятственно интегрировались с существующей средой на базе Ubuntu и стеком Mellanox OFED.

Команда отметила, что решениерешение Ethernet-адаптер MCX631432AN-ADABобеспечило простой путь миграции, поскольку адаптеры были полностью совместимы с существующей кабельной инфраструктурой SFP28 и коммутаторами, устраняя необходимость в дорогостоящих дополнительных модернизациях.

Результаты и преимущества: измеримая трансформация задержки и пропускной способности

Увеличение производительности, достигнутое благодаря развертываниюNVIDIA Mellanox MCX631432AN-ADAB, было немедленным и существенным. Следующая таблица обобщает ключевые показатели до и после модернизации:

Метрика До модернизации (10GbE TCP/IP) После модернизации (MCX631432AN-ADAB с RoCE) Улучшение
Задержка All-Reduce (средняя) 4,7 мс 0,32 мс Сокращение в 14,7 раза
Использование ЦП сети (на узел) 42% 9% Освобождено 33 п.п.
Использование ГП (фаза загрузки данных) 61% 89% +28%
Пропускная способность обучения кластера 1,8-кратный базовый уровень 4,3-кратный базовый уровень Увеличение в 2,4 раза

Помимо этих количественных преимуществ, команда отметила операционные улучшения, которые напрямую повлияли на производительность разработчиков. Задания обучения моделей, которые ранее требовали 36 часов, теперь выполнялись всего за 15 часов, что позволило проводить более частые циклы итераций. Аппаратное ускорение NVMe-oF также снизило задержку доступа к хранилищу на 35%, что еще больше ускорило ресурсоемкие операции контрольных точек. Для организаций, оценивающих экономическую целесообразность, ценаMCX631432AN-ADABоказалась очень конкурентоспособной при измерении по сравнению с увеличением пропускной способности в 2,4 раза и возможностью отложить приобретение дополнительных серверов ГП. Команда также отметила, что пакетыMCX631432AN-ADAB для продажис коммутаторами NVIDIA Spectrum предлагали наиболее экономичный путь для будущего масштабирования.

Резюме и перспективы: основа для будущих инноваций в рабочих нагрузках

Это производственное развертывание демонстрирует, чтоNVIDIA Mellanox MCX631432AN-ADAB— это гораздо больше, чем обычное обновление сети — это преобразующий инфраструктурный элемент, который раскрывает весь потенциал современного вычисления с ускорением ГП. Сочетание совокупной пропускной способности 50 Гбит/с, задержки коллективных коммуникаций менее 0,4 мс и возможностей значительного разгрузки ЦП делает этот адаптер идеальным выбором для организаций, работающих с распределенным ИИ, HPC и аналитикой в реальном времени.

Заглядывая в будущее, финтех-команда изучает интеграцию с NVIDIA DOCA для дальнейшего ускорения программируемости пути данных и реализации нулевого развертывания для будущих расширений кластера. Они также оценивают возможности телеметрии адаптера — подробно описанные втехническом описании MCX631432AN-ADAB— для построения моделей предиктивного управления перегрузками. Посколькурешение Ethernet-адаптер MCX631432AN-ADABпродолжает доказывать свою ценность, компания планирует стандартизировать эту платформу для всех будущих инфраструктурных инвестиций, будучи уверенной в том, что она обеспечивает надежную и масштабируемую основу для следующего поколения финансовых приложений на базе ИИ.