NVIDIA Mellanox MCX623106AN-CDAT Серверный адаптер Техническая книга
July 24, 2026
Технический документ NVIDIA Mellanox MCX623106AN-CDAT для серверов | RDMA/RoCE с низкой задержкой и оптимизация пропускной способности сервера
1. Предпосылки проекта и анализ требований
Современные центры обработки данных переживают парадигмальный сдвиг, обусловленный взрывным ростом искусственного интеллекта, крупномасштабного машинного обучения и аналитики в реальном времени. Эти рабочие нагрузки требуют беспрецедентной производительности сети — не только необработанной пропускной способности, но и детерминированной задержки менее 5 мкс, эффективного перемещения данных с использованием ЦП и бесшовной масштабируемости до тысяч узлов. Традиционные сетевые адаптеры Ethernet, полагающиеся на программные стеки TCP/IP, стали критическим узким местом, потребляя до 40% ядер ЦП при скоростях 200 Гбит/с и вызывая непредсказуемые колебания задержки, которые снижают производительность приложений. Для организаций, создающих крупномасштабные кластеры ИИ (500+ ГП) или облачную инфраструктуру гипермасштаба, эта неэффективность напрямую приводит к увеличению времени обучения, росту затрат на инфраструктуру и замедлению вывода на рынок.
В этом техническом документе представлено комплексное техническое решение, ориентированное на NVIDIA Mellanox MCX623106AN-CDAT. Разработанный для предприятий, стремящихся максимизировать свои инвестиции в 200 Гбит/с, Сетевой адаптер Ethernet MCX623106AN-CDAT обеспечивает аппаратное ускорение RDMA over Converged Ethernet (RoCE), обеспечивая безошибочную передачу с ультранизкой задержкой, которая превращает сетевой ввод-вывод из узкого места масштабирования в конкурентное преимущество. Решение специально разработано для достижения трех основных целей: (1) достижение сквозной задержки приложения менее 5 мкс для коллективных коммуникаций ИИ, (2) снижение накладных расходов на сетевую обработку ЦП до менее чем 5% и (3) обеспечение масштабируемой, перспективной основы для 200 Гбит/с и выше.
2. Общая архитектура сети и системы
Рекомендуемая архитектура использует высокопроизводительную топологию leaf-spine с 200 Гбит/с в качестве уровня доступа к серверам и восходящими каналами 400 Гбит/с/800 Гбит/с к spine. В основе этой конструкции лежит Сетевая карта PCIe адаптера MCX623106AN-CDAT ConnectX, развернутая в каждом вычислительном узле и узле хранения данных в сети. Архитектура построена на шести ключевых принципах:
- Безошибочная сеть Ethernet: Использование RoCE v2 с PFC (Priority Flow Control) и ECN (Explicit Congestion Notification) на всех коммутаторах для устранения потери пакетов и обеспечения детерминированной задержки для трафика RDMA.
- GPUDirect RDMA: Обеспечение прямой связи GPU-GPU через сеть без участия ЦП, снижение задержки и освобождение ресурсов ЦП для вычислительных задач.
- Аппаратное разгрузка везде: Разгрузка транспортных, защитных (IPsec/MACsec) и протоколов хранения данных на адаптер, освобождая циклы ЦП для логики приложений.
- Активно-активное резервирование: Использование обоих портов QSFP112 в режиме агрегации каналов (LACP) для общей пропускной способности 400 Гбит/с и автоматического переключения при сбое с восстановлением менее чем за секунду.
- Интеллектуальное управление трафиком: Адаптивная маршрутизация и доставка пакетов вне очереди для предотвращения перегрузки и максимизации использования сети.
- Комплексная телеметрия: Внутриполосная сетевая телеметрия (INT) и мониторинг по потокам для проактивного обнаружения перегрузок и планирования мощностей.
Решение полностью совместимости MCX623106AN-CDAT с платформами NVIDIA GPU (HGX, DGX) и ведущими серверами ЦП от Dell, HPE, Supermicro и Lenovo. Для хранения данных архитектура поддерживает NVMe-oF поверх RoCE с задержкой менее 15 мкс, обеспечивая общее дисагрегированное хранилище для крупномасштабных обучающих кластеров.
3. Роль и ключевые особенности NVIDIA Mellanox MCX623106AN-CDAT
Являясь основополагающим компонентом этого решения, NVIDIA Mellanox MCX623106AN-CDAT выполняет четыре критически важные роли в архитектуре:
| Функция | Детали реализации | Бизнес-преимущество |
|---|---|---|
| Движок RDMA/RoCE | Аппаратная поддержка RoCE v2 с ECN/PFC, задержка менее 0,6 мкс, поддержка GPUDirect | Практически нулевое участие ЦП; в 8 раз быстрее all-reduce для обучения ИИ |
| Двойной порт 200 Гбит/с | Два независимых порта QSFP112, общая пропускная способность 400 Гбит/с | Активно-активное объединение для пропускной способности; активно-резервное для резервирования |
| Интерфейс PCIe 5.0 | PCIe 5.0 x16 (до 32 ГТ/с) с усовершенствованным движком DMA | Устраняет узкое место интерфейса хоста для трафика 200 Гбит/с |
| Разгрузка виртуализации и оверлеев | SR-IOV с до 512 VFs на порт; разгрузка VXLAN/NVGRE/IPsec/MACsec | Высокоплотная многопользовательская среда с безопасностью и производительностью на скорости линии |
Ключевые технические характеристики, извлеченные из техническому описанию MCX623106AN-CDAT, включают комплексные возможности разгрузки (контрольная сумма, LSO/LRO, удаление/вставка VLAN, RSS с до 128 очередей), усовершенствованные алгоритмы управления перегрузками и полную поддержку библиотек коллективных коммуникаций NVIDIA (NCCL). Технические характеристики MCX623106AN-CDAT также подчеркивают поддержку совместимости с 100 Гбит/с и 50 Гбит/с, предлагая гибкость развертывания для сред со смешанной скоростью.
4. Рекомендации по развертыванию и масштабированию
Для новых кластеров ИИ мы рекомендуем двухуровневую топологию leaf-spine с доступом 200 Гбит/с и восходящими каналами 800 Гбит/с к spine. Каждый сервер оснащен одним Сетевой адаптер Ethernet MCX623106AN-CDAT с обоими портами QSFP112, подключенными к отдельным коммутаторам leaf для резервирования. Сеть RoCE требует согласованной конфигурации QoS на всех коммутаторах — в частности, PFC на приоритете 3 (для трафика коллективных коммуникаций RDMA) и приоритете 4 (для хранения данных), с маркировкой ECN для тех же классов трафика. Мы рекомендуем выделять отдельные VLAN для RDMA, управления, хранения данных и трафика арендаторов для упрощения мониторинга и устранения неполадок.
Для существующих сред с существующей инфраструктурой 100 Гбит/с решение сетевого адаптера Ethernet MCX623106AN-CDAT предлагает плавный путь миграции. Поскольку адаптер обратно совместим с оптикой QSFP56 100 Гбит/с, существующая кабельная инфраструктура может быть повторно использована во время поэтапного обновления до 200 Гбит/с. Адаптер также поддерживает стандартную коммутацию Ethernet без обязательного включения RoCE, что позволяет командам сначала развернуть оборудование, а затем поэтапно активировать возможности RDMA по мере развития сети и оправдания перехода рабочими нагрузками.
Масштабирование решения за пределы 500 узлов требует дополнительных соображений. Мы рекомендуем внедрить выделенную стратегию управления перегрузками RoCE с использованием коммутаторов NVIDIA Spectrum-4 со встроенной телеметрией и динамической настройкой пороговых значений ECN. Для кластеров, превышающих 1000 узлов, рассмотрите возможность развертывания централизованного контроллера управления сетью (например, NVIDIA NetQ) для поддержания сквозной видимости и согласованности автоматической конфигурации. MCX623106AN-CDAT для продажи через глобальных партнеров NVIDIA включает комплексную гарантию и поддержку обновлений прошивки, обеспечивая долгосрочную надежность при масштабировании.
5. Эксплуатация, мониторинг, устранение неполадок и оптимизация
Эффективная эксплуатация сети RoCE требует многоуровневой стратегии мониторинга и устранения неполадок:
- Телеметрия на уровне адаптера: Технические характеристики MCX623106AN-CDAT включают счетчики на порт для кадров PFC, пакетов с маркировкой ECN, потерянных кадров, ошибок связи и эпох перегрузки. Используйте
mlx5cmd,ethtoolили инструменты прошивки NVIDIA для экспорта этих метрик в панели мониторинга Prometheus/Grafana с соответствующими оповещениями. - Внутриполосная сетевая телеметрия (INT): Используйте поддержку INT адаптера для отслеживания задержек по потокам и глубины очередей в сети, что позволяет точно определять источники микроперегрузок.
- Мониторинг на уровне коммутатора: Отслеживайте заполнение буфера, количество кадров паузы, глубину очередей и частоту маркировки ECN на коммутаторах spine и leaf. Внезапное увеличение количества кадров паузы указывает на микроперегрузку, которая может потребовать настройки пороговых значений ECN.
- Метрики на уровне приложения: Для приложений RDMA отслеживайте задержки завершения WR (Work Request), события переполнения CQ (Completion Queue) и количество ошибок QP (Queue Pair) с помощью библиотек NVIDIA libibverbs и rdma-core.
Распространенные сценарии устранения неполадок и рекомендуемые действия:
- Снижение производительности RoCE: Убедитесь, что PFC включен на всех портах коммутатора и что маркировка DSCP соответствует конфигурации коммутатора. Используйте техническому описанию MCX623106AN-CDAT для проверки настроек распределения буферов в соответствии с рекомендуемыми значениями для вашего профиля рабочей нагрузки.
- Перебои в работе канала или ошибки CRC: Проверьте качество кабеля QSFP112 (убедитесь в соответствии спецификациям 200G AOC или DAC) и убедитесь, что прошивка адаптера обновлена до последней версии.
- Проблемы с производительностью GPU Direct: Убедитесь, что GPUDirect правильно инициализирован и что топология PCIe поддерживает DMA между узлами без промежуточных коммутаторов.
- Взаимная блокировка PFC или шторм паузы: Проверьте неправильную конфигурацию приоритетов и убедитесь, что PFC включен только для классов трафика RoCE (не для трафика управления или хранения данных).
Для оптимизации мы рекомендуем следующие параметры настройки, основанные на обширной лабораторной проверке:
- Слияние прерываний (модерация): Установите значение 2–4 мкс для рабочих нагрузок обучения ИИ, чтобы минимизировать задержку при сохранении эффективности ЦП.
- MTU RDMA: Увеличьте до 4096 байт для коммуникаций all-reduce, чтобы уменьшить накладные расходы протокола и повысить пропускную способность.
- RSS (Receive Side Scaling): Настройте на нескольких ядрах ЦП для трафика, отличного от RDMA, чтобы распределить обработку и избежать насыщения одного ядра.
- Пороги ECN: Установите минимальный порог на 40% буфера и максимальный порог на 75% для трафика приоритета 3, корректируя в зависимости от наблюдаемых шаблонов перегрузки и характеристик рабочей нагрузки.
6. Резюме и оценка ценности
Решение NVIDIA Mellanox MCX623106AN-CDAT обеспечивает трансформационную ценность для современных центров обработки данных масштаба ИИ. Заменяя программный TCP/IP аппаратным ускорением RDMA/RoCE и GPUDirect, организации могут добиться снижения задержки на уровне приложений в 8–10 раз, сократить накладные расходы ЦП на сеть более чем на 85% и увеличить утилизацию ГП с менее чем 70% до более чем 95%. Сетевой адаптер Ethernet MCX623106AN-CDAT обеспечивает экономически эффективный путь к внедрению 200 Гбит/с с защитой инвестиций благодаря обратной совместимости с 100 Гбит/с и перспективным возможностям разгрузки для новых рабочих нагрузок.
При оценке общей стоимости владения цена MCX623106AN-CDAT компенсируется значительной экономией эксплуатационных расходов: сокращение времени обучения (ускорение вывода на рынок), меньшее количество серверов (благодаря более высокой утилизации ГП), снижение затрат на охлаждение (благодаря<20W power draw), and elimination of separate InfiniBand fabrics. The solution is fully совместимости MCX623106AN-CDAT с основными программными стеками ИИ и HPC, включая NVIDIA NCCL, PyTorch, TensorFlow и библиотеки MPI, обеспечивая широкую применимость в корпоративных, облачных и исследовательских развертываниях.
Для получения подробных сценариев развертывания, шаблонов конфигурации и отчетов о тестировании производительности, пожалуйста, обратитесь к официальному техническому описанию MCX623106AN-CDAT и комплексному порталу сетевой документации NVIDIA. Этот технический документ служит основой — архитектура проверена, компоненты готовы к производству, а преимущества измеримы. Сетевая карта PCIe адаптера MCX623106AN-CDAT ConnectX — это не просто адаптер; это стратегический инструмент для создания центра обработки данных будущего, готового к ИИ и с ультранизкой задержкой.

