NVIDIA Mellanox MCX623106AN-CDAT Серверный адаптер Техническая книга

July 24, 2026

NVIDIA Mellanox MCX623106AN-CDAT Серверный адаптер Техническая книга

Технический документ NVIDIA Mellanox MCX623106AN-CDAT для серверов | RDMA/RoCE с низкой задержкой и оптимизация пропускной способности сервера

1. Предпосылки проекта и анализ требований

Современные центры обработки данных переживают парадигмальный сдвиг, обусловленный взрывным ростом искусственного интеллекта, крупномасштабного машинного обучения и аналитики в реальном времени. Эти рабочие нагрузки требуют беспрецедентной производительности сети — не только необработанной пропускной способности, но и детерминированной задержки менее 5 мкс, эффективного перемещения данных с использованием ЦП и бесшовной масштабируемости до тысяч узлов. Традиционные сетевые адаптеры Ethernet, полагающиеся на программные стеки TCP/IP, стали критическим узким местом, потребляя до 40% ядер ЦП при скоростях 200 Гбит/с и вызывая непредсказуемые колебания задержки, которые снижают производительность приложений. Для организаций, создающих крупномасштабные кластеры ИИ (500+ ГП) или облачную инфраструктуру гипермасштаба, эта неэффективность напрямую приводит к увеличению времени обучения, росту затрат на инфраструктуру и замедлению вывода на рынок.

В этом техническом документе представлено комплексное техническое решение, ориентированное на NVIDIA Mellanox MCX623106AN-CDAT. Разработанный для предприятий, стремящихся максимизировать свои инвестиции в 200 Гбит/с, Сетевой адаптер Ethernet MCX623106AN-CDAT обеспечивает аппаратное ускорение RDMA over Converged Ethernet (RoCE), обеспечивая безошибочную передачу с ультранизкой задержкой, которая превращает сетевой ввод-вывод из узкого места масштабирования в конкурентное преимущество. Решение специально разработано для достижения трех основных целей: (1) достижение сквозной задержки приложения менее 5 мкс для коллективных коммуникаций ИИ, (2) снижение накладных расходов на сетевую обработку ЦП до менее чем 5% и (3) обеспечение масштабируемой, перспективной основы для 200 Гбит/с и выше.

2. Общая архитектура сети и системы

Рекомендуемая архитектура использует высокопроизводительную топологию leaf-spine с 200 Гбит/с в качестве уровня доступа к серверам и восходящими каналами 400 Гбит/с/800 Гбит/с к spine. В основе этой конструкции лежит Сетевая карта PCIe адаптера MCX623106AN-CDAT ConnectX, развернутая в каждом вычислительном узле и узле хранения данных в сети. Архитектура построена на шести ключевых принципах:

  • Безошибочная сеть Ethernet: Использование RoCE v2 с PFC (Priority Flow Control) и ECN (Explicit Congestion Notification) на всех коммутаторах для устранения потери пакетов и обеспечения детерминированной задержки для трафика RDMA.
  • GPUDirect RDMA: Обеспечение прямой связи GPU-GPU через сеть без участия ЦП, снижение задержки и освобождение ресурсов ЦП для вычислительных задач.
  • Аппаратное разгрузка везде: Разгрузка транспортных, защитных (IPsec/MACsec) и протоколов хранения данных на адаптер, освобождая циклы ЦП для логики приложений.
  • Активно-активное резервирование: Использование обоих портов QSFP112 в режиме агрегации каналов (LACP) для общей пропускной способности 400 Гбит/с и автоматического переключения при сбое с восстановлением менее чем за секунду.
  • Интеллектуальное управление трафиком: Адаптивная маршрутизация и доставка пакетов вне очереди для предотвращения перегрузки и максимизации использования сети.
  • Комплексная телеметрия: Внутриполосная сетевая телеметрия (INT) и мониторинг по потокам для проактивного обнаружения перегрузок и планирования мощностей.

Решение полностью совместимости MCX623106AN-CDAT с платформами NVIDIA GPU (HGX, DGX) и ведущими серверами ЦП от Dell, HPE, Supermicro и Lenovo. Для хранения данных архитектура поддерживает NVMe-oF поверх RoCE с задержкой менее 15 мкс, обеспечивая общее дисагрегированное хранилище для крупномасштабных обучающих кластеров.

3. Роль и ключевые особенности NVIDIA Mellanox MCX623106AN-CDAT

Являясь основополагающим компонентом этого решения, NVIDIA Mellanox MCX623106AN-CDAT выполняет четыре критически важные роли в архитектуре:

Функция Детали реализации Бизнес-преимущество
Движок RDMA/RoCE Аппаратная поддержка RoCE v2 с ECN/PFC, задержка менее 0,6 мкс, поддержка GPUDirect Практически нулевое участие ЦП; в 8 раз быстрее all-reduce для обучения ИИ
Двойной порт 200 Гбит/с Два независимых порта QSFP112, общая пропускная способность 400 Гбит/с Активно-активное объединение для пропускной способности; активно-резервное для резервирования
Интерфейс PCIe 5.0 PCIe 5.0 x16 (до 32 ГТ/с) с усовершенствованным движком DMA Устраняет узкое место интерфейса хоста для трафика 200 Гбит/с
Разгрузка виртуализации и оверлеев SR-IOV с до 512 VFs на порт; разгрузка VXLAN/NVGRE/IPsec/MACsec Высокоплотная многопользовательская среда с безопасностью и производительностью на скорости линии

Ключевые технические характеристики, извлеченные из техническому описанию MCX623106AN-CDAT, включают комплексные возможности разгрузки (контрольная сумма, LSO/LRO, удаление/вставка VLAN, RSS с до 128 очередей), усовершенствованные алгоритмы управления перегрузками и полную поддержку библиотек коллективных коммуникаций NVIDIA (NCCL). Технические характеристики MCX623106AN-CDAT также подчеркивают поддержку совместимости с 100 Гбит/с и 50 Гбит/с, предлагая гибкость развертывания для сред со смешанной скоростью.

4. Рекомендации по развертыванию и масштабированию

Для новых кластеров ИИ мы рекомендуем двухуровневую топологию leaf-spine с доступом 200 Гбит/с и восходящими каналами 800 Гбит/с к spine. Каждый сервер оснащен одним Сетевой адаптер Ethernet MCX623106AN-CDAT с обоими портами QSFP112, подключенными к отдельным коммутаторам leaf для резервирования. Сеть RoCE требует согласованной конфигурации QoS на всех коммутаторах — в частности, PFC на приоритете 3 (для трафика коллективных коммуникаций RDMA) и приоритете 4 (для хранения данных), с маркировкой ECN для тех же классов трафика. Мы рекомендуем выделять отдельные VLAN для RDMA, управления, хранения данных и трафика арендаторов для упрощения мониторинга и устранения неполадок.

Для существующих сред с существующей инфраструктурой 100 Гбит/с решение сетевого адаптера Ethernet MCX623106AN-CDAT предлагает плавный путь миграции. Поскольку адаптер обратно совместим с оптикой QSFP56 100 Гбит/с, существующая кабельная инфраструктура может быть повторно использована во время поэтапного обновления до 200 Гбит/с. Адаптер также поддерживает стандартную коммутацию Ethernet без обязательного включения RoCE, что позволяет командам сначала развернуть оборудование, а затем поэтапно активировать возможности RDMA по мере развития сети и оправдания перехода рабочими нагрузками.

Масштабирование решения за пределы 500 узлов требует дополнительных соображений. Мы рекомендуем внедрить выделенную стратегию управления перегрузками RoCE с использованием коммутаторов NVIDIA Spectrum-4 со встроенной телеметрией и динамической настройкой пороговых значений ECN. Для кластеров, превышающих 1000 узлов, рассмотрите возможность развертывания централизованного контроллера управления сетью (например, NVIDIA NetQ) для поддержания сквозной видимости и согласованности автоматической конфигурации. MCX623106AN-CDAT для продажи через глобальных партнеров NVIDIA включает комплексную гарантию и поддержку обновлений прошивки, обеспечивая долгосрочную надежность при масштабировании.

5. Эксплуатация, мониторинг, устранение неполадок и оптимизация

Эффективная эксплуатация сети RoCE требует многоуровневой стратегии мониторинга и устранения неполадок:

  • Телеметрия на уровне адаптера: Технические характеристики MCX623106AN-CDAT включают счетчики на порт для кадров PFC, пакетов с маркировкой ECN, потерянных кадров, ошибок связи и эпох перегрузки. Используйте mlx5cmd, ethtool или инструменты прошивки NVIDIA для экспорта этих метрик в панели мониторинга Prometheus/Grafana с соответствующими оповещениями.
  • Внутриполосная сетевая телеметрия (INT): Используйте поддержку INT адаптера для отслеживания задержек по потокам и глубины очередей в сети, что позволяет точно определять источники микроперегрузок.
  • Мониторинг на уровне коммутатора: Отслеживайте заполнение буфера, количество кадров паузы, глубину очередей и частоту маркировки ECN на коммутаторах spine и leaf. Внезапное увеличение количества кадров паузы указывает на микроперегрузку, которая может потребовать настройки пороговых значений ECN.
  • Метрики на уровне приложения: Для приложений RDMA отслеживайте задержки завершения WR (Work Request), события переполнения CQ (Completion Queue) и количество ошибок QP (Queue Pair) с помощью библиотек NVIDIA libibverbs и rdma-core.

Распространенные сценарии устранения неполадок и рекомендуемые действия:

  • Снижение производительности RoCE: Убедитесь, что PFC включен на всех портах коммутатора и что маркировка DSCP соответствует конфигурации коммутатора. Используйте техническому описанию MCX623106AN-CDAT для проверки настроек распределения буферов в соответствии с рекомендуемыми значениями для вашего профиля рабочей нагрузки.
  • Перебои в работе канала или ошибки CRC: Проверьте качество кабеля QSFP112 (убедитесь в соответствии спецификациям 200G AOC или DAC) и убедитесь, что прошивка адаптера обновлена до последней версии.
  • Проблемы с производительностью GPU Direct: Убедитесь, что GPUDirect правильно инициализирован и что топология PCIe поддерживает DMA между узлами без промежуточных коммутаторов.
  • Взаимная блокировка PFC или шторм паузы: Проверьте неправильную конфигурацию приоритетов и убедитесь, что PFC включен только для классов трафика RoCE (не для трафика управления или хранения данных).

Для оптимизации мы рекомендуем следующие параметры настройки, основанные на обширной лабораторной проверке:

  • Слияние прерываний (модерация): Установите значение 2–4 мкс для рабочих нагрузок обучения ИИ, чтобы минимизировать задержку при сохранении эффективности ЦП.
  • MTU RDMA: Увеличьте до 4096 байт для коммуникаций all-reduce, чтобы уменьшить накладные расходы протокола и повысить пропускную способность.
  • RSS (Receive Side Scaling): Настройте на нескольких ядрах ЦП для трафика, отличного от RDMA, чтобы распределить обработку и избежать насыщения одного ядра.
  • Пороги ECN: Установите минимальный порог на 40% буфера и максимальный порог на 75% для трафика приоритета 3, корректируя в зависимости от наблюдаемых шаблонов перегрузки и характеристик рабочей нагрузки.

6. Резюме и оценка ценности

Решение NVIDIA Mellanox MCX623106AN-CDAT обеспечивает трансформационную ценность для современных центров обработки данных масштаба ИИ. Заменяя программный TCP/IP аппаратным ускорением RDMA/RoCE и GPUDirect, организации могут добиться снижения задержки на уровне приложений в 8–10 раз, сократить накладные расходы ЦП на сеть более чем на 85% и увеличить утилизацию ГП с менее чем 70% до более чем 95%. Сетевой адаптер Ethernet MCX623106AN-CDAT обеспечивает экономически эффективный путь к внедрению 200 Гбит/с с защитой инвестиций благодаря обратной совместимости с 100 Гбит/с и перспективным возможностям разгрузки для новых рабочих нагрузок.

При оценке общей стоимости владения цена MCX623106AN-CDAT компенсируется значительной экономией эксплуатационных расходов: сокращение времени обучения (ускорение вывода на рынок), меньшее количество серверов (благодаря более высокой утилизации ГП), снижение затрат на охлаждение (благодаря<20W power draw), and elimination of separate InfiniBand fabrics. The solution is fully совместимости MCX623106AN-CDAT с основными программными стеками ИИ и HPC, включая NVIDIA NCCL, PyTorch, TensorFlow и библиотеки MPI, обеспечивая широкую применимость в корпоративных, облачных и исследовательских развертываниях.

Для получения подробных сценариев развертывания, шаблонов конфигурации и отчетов о тестировании производительности, пожалуйста, обратитесь к официальному техническому описанию MCX623106AN-CDAT и комплексному порталу сетевой документации NVIDIA. Этот технический документ служит основой — архитектура проверена, компоненты готовы к производству, а преимущества измеримы. Сетевая карта PCIe адаптера MCX623106AN-CDAT ConnectX — это не просто адаптер; это стратегический инструмент для создания центра обработки данных будущего, готового к ИИ и с ультранизкой задержкой.