NVIDIA Mellanox MCX653106A-HDAT в действии: RDMA/RoCE низкозадержка транспорта и оптимизация пропускной способности сервера
July 30, 2026
A major hyperscale cloud provider operating a 256-node cluster for distributed AI training and real-time analytics began experiencing severe network performance degradation as their infrastructure scaledСуществующая 25GbE TCP/IP-основанная ткань демонстрирует All-Reduce задержки, превышающие 6 миллисекунд на 128 узлов,В то время как использование ЦП для сетевой обработки потребляло более 40% вычислительной мощности каждого сервераЭто ограничило использование GPU всего на 55%, резко увеличив циклы обучения и сократив потенциал получения доходов.Команда нуждалась в решении, которое могло бы обеспечить как микросекундную задержку, так и огромную пропускную способность, обеспечивая при этом программируемость, необходимую для оптимизации трафика в зависимости от рабочей нагрузки.
После тщательной технической оценки поставщик выбралNVIDIA Mellanox MCX653106A-HDATКаждый узел сервера был оснащенMCX653106A-HDAT ConnectX адаптер PCIe сетевая карта, сконфигурированная с подключением 100 Гбит/с с двумя портами для предоставления 200 Гбит/с совокупной пропускной способности на узел.
- Фаза 1 пилотный этап (8 узлов):Команда установилаКарта адаптера MCX653106A-HDAT EthernetНа подмножестве серверов GPU, настраивая RoCEv2 с PFC и ECN для создания беспотери Ethernet ткани. адаптеры были соединены с коммутаторами NVIDIA Spectrum-4 для управления перегрузкой с конца на конец.
- Фаза 2 Проверка и настройка:Используя данные телеметрии, задокументированные вЛист данных MCX653106A-HDAT, команда проверила конфигурацию, отрегулировала параметры DCB и оптимизировала настройки коллективной связи NCCL.Расширенные возможности программирования адаптера позволили настраивать управление движением для конкретных моделей полной редукции нагрузки.
- Фаза 3 После успешной проверки весь кластер был перенесен на новый адаптер.Совместимость MCX653106A-HDATхарактер решения обеспечивал бесперебойную интеграцию с существующими серверами и дистрибутивами Linux.
- Фаза 4 Продолжающаяся оптимизация:Команда использовала встроенную телеметрию адаптера и программируемый путь передачи данных для реализации политики маршрутизации, ориентированной на нагрузку, что еще больше оптимизирует производительность для обучения ИИ.
Команда отметила, чтоРешение карты адаптера MCX653106A-HDAT Ethernetобеспечивал простой путь миграции, поскольку порты QSFP56 поддерживали как оптику 100GbE, так и 25GbE, что позволило обеспечить плавный переход без нарушения существующей подключенности.
| Метрический | Предварительное обновление (25GbE TCP/IP) | После модернизации (MCX653106A-HDAT с RoCE) | Улучшение |
|---|---|---|---|
| Всеуменьшение задержки (256 узлов) | 60,8 мс | 0.22 мс | 30.9* уменьшение |
| Использование сетевого процессора (на узел) | 43% | 5% | 38 п.п. восстановлено |
| Использование графического процессора (фаза обучения) | 55% | 93% | +38% увеличение |
| Продуктивность обучения кластеров | 2.1x исходный показатель | 6.4x исходный показатель | 3.0* увеличение |
Помимо этих количественных преимуществ, поставщик наблюдал значительные оперативные выгоды.резко ускорить время выхода на рынок новых услуг ИИПрограммируемый маршрут передачи данных адаптера позволил настроить трафик для приоритетных потоков, гарантируя, что критический трафик коллективной связи никогда не испытывает конфликта.Для организаций, оценивающих доходность инвестиций, вMCX653106A-HDAT ценаВ результате, по мнению экспертов, увеличение пропускной способности на 3* и возможность отсрочить приобретение дополнительных серверов более чем на 18 месяцев.MCX653106A-HDAT для продажиСхемы с коммутаторами NVIDIA Spectrum-4 предлагали наиболее выгодную экономику для крупномасштабного развертывания.
Поставщик также использовал всеобъемлющие возможности телеметрии, описанные вСпецификации MCX653106A-HDATсоздание прогнозных моделей эффективности и автоматизированных стратегий снижения уровня перегруженности, что еще больше повысит эффективность работы.
Это развертывание в производственном масштабе демонстрирует, чтоNVIDIA Mellanox MCX653106A-HDATявляется трансформационным компонентом для современного ИИ и облачной инфраструктуры.и всеобъемлющие аппаратные отгрузки позволяют практически линейное масштабирование для GPU-ускоренных нагрузокКак от конца к концуРешение карты адаптера MCX653106A-HDAT Ethernet, это устраняет узкое место в сети, которое исторически ограничивало эффективность распределенного обучения и предоставление облачных услуг.
Оглядываясь вперед,Поставщик облачных услуг изучает расширенную интеграцию с NVIDIA DOCA для реализации дополнительной программируемости маршрута передачи данных для оптимизации рабочей нагрузки в нескольких средах арендаторовОни также используют встроенную телеметрию адаптера, широко документированную вЛист данных MCX653106A-HDAT- разработать автоматизированные системы управления эффективностью следующего поколения.NVIDIA Mellanox MCX653106A-HDATстал основой их дорожной карты инфраструктуры ИИ, предоставляя надежную, масштабируемую платформу для следующего поколения обучения моделям фундамента и услуг аналитики в режиме реального времени.

