NVIDIA Mellanox MCX623106AN-CDAT Серверный Адаптер в Действии | Низкая Задержка RDMA/RoCE и Увеличение Пропускной Способности Сервера

July 22, 2026

последние новости компании о NVIDIA Mellanox MCX623106AN-CDAT Серверный Адаптер в Действии | Низкая Задержка RDMA/RoCE и Увеличение Пропускной Способности Сервера

NVIDIA Mellanox MCX623106AN-CDAT серверный адаптер в действии.

Опыт и вызов: когда 200GbE встречает стену масштабирования ИИ

Быстрорастущая исследовательская организация по ИИ - назовем их "DeepCore Labs" - столкнулась с критическим узким горлом масштабирования.включающий 512 графических процессоров NVIDIA H100, распределенных по 128 узламПроблема не в вычислениях или памяти, а в структуре сети.Снижение синхронизации заняло более 15 секунд на итерацию.Их существующая инфраструктура 100GbE, опирающаяся на программное обеспечение TCP/IP, просто не могла справиться с взрывом,латентно-чувствительные модели коммуникации распределенного обученияКоманде нужно было решение, которое могло бы обеспечить пропускную способность 200GbE с детерминированной задержкой на микросекундном уровне.

Их оценка привела их кNVIDIA Mellanox MCX623106AN-CDAT∆ 200GbE серверный адаптер, разработанный для самых требовательных рабочих нагрузок ИИ и HPC.MCX623106AN-CDAT ConnectX адаптер PCIe сетевая картаПредлагал расширенные возможности разгрузки и GPUDirect, необходимые для устранения узкого места в сети и максимизации использования GPU.

Решение: развертывание карты адаптера MCX623106AN-CDAT Ethernet

DeepCore Labs развернулиКарта адаптера Ethernet MCX623106AN-CDATна всех 128 учебных узлах, причем каждый сервер оснащен одним двухпортовым адаптером QSFP112, подключенным к ткани, построенной на коммутаторах NVIDIA Spectrum-4.Развертывание использовало поддержку RoCE v2 адаптера, чтобы обеспечить беспотери Ethernet-транспортКлючом к решению было возможности GPUDirect RDMA адаптера,что позволило непосредственное перемещение данных между графическими процессорами по сети без вмешательства процессора ∙ критическая особенность для сокращения синхронизации накладных расходов.

Команда настроила PFC (Priority Flow Control) и ECN (Explicit Congestion Notification) на уровне переключателя.о приоритете 3 для трафика коллективных коммуникаций и приоритете 4 для хранилищ I/OОни также внедрили технологию адаптивного маршрутизации NVIDIA для динамического распределения трафика по нескольким путям, минимизируя точки доступа.Вся тренировочная ткань работала на RDMA., причем все 512 графических процессоров беспрепятственно общаются через RoCE.Совместимость MCX623106AN-CDATЭкосистема оказалась надежной ∙ карты были безупречно интегрированы с серверами на базе H100 и NVIDIA NCCL (NVIDIA Collective Communications Library) без каких-либо изменений.

Команда ссылалась наФайл данных MCX623106AN-CDATдля уточнения параметров распределения буфера и контроля перегруженности,достижение оптимальной производительности в условиях смешанной нагрузки на работу, которая включала как синхронную подготовку (все-снижение доминирует), так и асинхронную проверку..

Измеримые результаты: эффективность масштабирования, производительность и использование GPU

Улучшение производительности было преобразующим.NVIDIA Mellanox MCX623106AN-CDATВ результате снижения задержки синхронизации снизилось с 15,2 секунд до 1,8 секунды на итерацию, что в 8,4 раза улучшилось.Общее время обучения для модели с параметром 70B сократилось с 42 до 19 дней., ускоряя их исследовательский цикл более чем на 50%.

Использование графического процессора, которое сократилось на 62% из-за задержек сети, после обновления выросло до 94% - это 52% улучшение эффективной вычислительной мощности.Усовершенствованное расположение данных в нестандартном порядке и пакетное распределение удалили микро-всплески, которые вызывали всплески задержки., обеспечивая постоянную производительность во всех узлах.

Помимо эффективности обучения, увеличение пропускной способности сервера было не менее убедительным.и ускорение RoCE ∙ снижение использования процессора для сетевой обработки с 38% до менее 4% во всех узлахЭто освободило значительную емкость процессора для предварительной обработки данных, сжатия контрольных точек и других вспомогательных задач, которые ранее были ограничены.

Метрический До (Legacy 100GbE NIC) После (MCX623106AN-CDAT) Улучшение
Всеуменьшение задержки (на итер) 15.2 с 1.8 с 8.4x быстрее
Использование графического процессора 62% 94% 52% выше
Время модели обучения (70B params) 42 дня 19 дней 55% быстрее
Расходы на сеть процессора 38% < 4% 89% ниже
NVMe-oF читает с задержкой (хранение) 185 μs 12 мс 15 раз быстрее.

Эффективность инфраструктуры

В то время как результаты были значительными, операционные и финансовые выгоды были одинаково заметными.MCX623106AN-CDAT Ethernet решение для карты адаптераснизила общую стоимость владения, устранив необходимость в отдельной InfiniBand ткани ¢ экономия более $ 500K в затратах на инфраструктуру коммутатора.Энергоэффективная конструкция адаптера (менее 20 Вт на карту) способствовала измеримой экономии энергии в кластере с 128 узлами, сокращая ежегодные расходы на охлаждение примерно на 18%.

Для ИТ-менеджеров, оценивающихMCX623106AN-CDAT ценав отношении альтернативных решений директор инфраструктуры DeepCore отметил, что период окупаемости составлял менее шести месяцев, в основном из-за сокращения времени обучения,которые напрямую ускорили разработку своих продуктовКоманда также оценила будущее адаптера:MCX623106AN-CDAT для продажиСегодня поддерживает 200GbE, но также совместим с оптикой 100GbE и 50GbE, обеспечивая гибкость для гибридных скоростных сред и постепенных обновлений.

СогласноСпецификации MCX623106AN-CDAT, адаптер включает в себя комплексные функции телеметрии, включая телеметрию внутридиапазона сети (INT) и отслеживание задержки потока.,что позволяет активно обнаруживать микрозагрузку до того, как она повлияет на тренировочную производительность.поддержание беспроблемного поведения даже во время операций по установке контрольных точек, которые привели к дополнительной нагрузке сети.

Резюме и перспективы: план для сетей в масштабах ИИ

Путешествие DeepCore LabsNVIDIA Mellanox MCX623106AN-CDATВ результате совмещения двухпортовой пропускной способности 200GbE, интерфейса хоста PCIe 5.0 и RDMA GPUDirect,Карта адаптера Ethernet MCX623106AN-CDATпреобразует сеть из узкого места масштабирования в мультипликатор производительности. результаты:и 55% быстрее циклы обучения ∙ говорят о способности адаптера обеспечивать ощутимые результаты бизнеса в самых требовательных вычислительных средах.

В перспективе, поскольку размеры моделей продолжают удваиваться каждые несколько месяцев, а распределенные учебные кластеры расширяются до тысяч графических процессоров,MCX623106AN-CDAT ConnectX адаптер PCIe сетевая картаДля архитекторов и ИТ-лидеров, планирующих свои следующие инвестиции в инфраструктуру ИИ, этот адаптер представляет собой не просто компонент,но стратегическим фактором для конкурентной дифференциацииПодробные параметры настройки, сценарии развертывания и отчеты о показателях производительности доступны на официальном веб-сайте.Файл данных MCX623106AN-CDAT∆ основной справочник для любого широкомасштабного развертывания ИИ.