Техническое решение серверного адаптера NVIDIA Mellanox MCX623106AN-CDAT

June 10, 2026

Техническое решение серверного адаптера NVIDIA Mellanox MCX623106AN-CDAT

Этот технический документ предоставляет сетевым архитекторам, инженерам по предпродажной подготовке и операционным группам комплексный проект решения, ориентированный наNVIDIA Mellanox MCX623106AN-CDAT. Мы рассмотрим, как добиться детерминированной низкой задержки и максимизировать пропускную способность сервера с помощью RDMA/RoCE в современных средах центров обработки данных.

1. Предыстория проекта и анализ требований

Традиционные стеки TCP/IP создают значительные накладные расходы (обработка прерываний, копирование памяти и переключение контекста), что ограничивает производительность приложений, особенно для NVMe-oF, распределенных баз данных и обучающих кластеров искусственного интеллекта. Ключевые требования к инфраструктурам следующего поколения включают в себя:

  • Сквозная задержка менее 10 мкс для хранения данных и анализа в реальном времени
  • Обход ЦП для освобождения ядер для бизнес-логики (цель: <20 % использования ЦП, связанного с сетью)
  • Фабрика Ethernet без потерь, поддерживающая PFC и ECN в топологиях 100GbE Leaf-Spine
  • Встроенное шифрование без снижения производительности (IPsec/TLS)
  • Бесшовная интеграция с существующими платформами автоматизации (Ansible, Terraform).

2. Общая архитектура сети и системы

Эталонная архитектура использует двухуровневую топологию Leaf Spine с портами 100GbE. Каждый вычислительный узел/узел хранения оснащенMCX623106AN-CDAT Адаптер ConnectX Сетевая карта PCIe. Ключевые элементы дизайна:

  • Листовые коммутаторы: настроены с общим буфером размером 4 МБ, приоритетами PFC 3 (хранилище) и 4 (трафик AI), порогом маркировки ECN при глубине очереди 200 КБ.
  • Коммутаторы Spine: неблокируемая фабрика 12,8 Тбит/с, коэффициент превышения подписки 3:1 (оптимизирован для шаблонов «восток-запад»).
  • Конфигурация хоста: PCIe 4.0 x16 (или PCIe 5.0, если доступно), 256 МБ встроенной памяти на адаптер
  • Транспорт RDMA: RoCEv2 с контролем перегрузки DCQCN, MTU 4K, встроенные данные до 256 байт.

MCX623106AN-CDAT Решение для карты адаптера Ethernetподдерживает до 1024 виртуальных функций (VF) и 256 физических функций (PF), что делает его идеальным для NFV и контейнерных рабочих нагрузок.

3. Роль NVIDIA Mellanox MCX623106AN-CDAT и основные характеристики

NVIDIA Mellanox MCX623106AN-CDATслужит механизмом плоскости данных, разгружая всю сетевую обработку с центрального процессора. СогласноТехническое описание MCX623106AN-CDATи официальныйТехнические характеристики MCX623106AN-CDAT, критические возможности включают в себя:

Особенность Преимущество для RDMA/RoCE
Аппаратное управление (ASAP²) Направляйте пакеты в определенные очереди – нулевое вмешательство процессора
Встроенное управление перегрузкой RoCE DCQCN реализован в прошивке — детализация ответа 100 нс
GPUDirect® RDMA Доступ к памяти графического процессора в обход памяти хоста — снижение задержки на 2 мкс
Ускорение VirtIO Собственная производительность для сети виртуальных машин/контейнеров

MCX623106AN-CDAT Карта адаптера Ethernetтакже включает безопасную загрузку и шифрование флэш-памяти, что соответствует строгим политикам безопасности для финансового и государственного секторов.

4. Рекомендации по развертыванию и расширению

Для развертываний на существующих объектах адаптер полностьюMCX623106AN-CDAT-совместимыйс существующими коммутаторами 100GbE (Broadcom, Mellanox, Cisco) после обновления прошивки. Рекомендуемые этапы развертывания:

  • Фаза 1 (лабораторная проверка):Два узла хранения + два вычислительных узла, включите PFC и ECN для каждого порта, проверьте с помощью ib_write_bw (целевая пропускная способность 98 Гбит/с на порт)
  • Этап 2 (пилотный):Одна полная стойка (40 узлов), развертывание DCQCN с пороговыми значениями ECN: минимум = 150 КБ, максимум = 500 КБ.
  • Этап 3 (масштабирование):Несколько стоек с уровнем позвоночника, мониторинг глобальных кадров паузы PFC (сохранение <0,1 % общего трафика)

Для расширения адаптер поддерживает агрегацию каналов (LAG) и адаптивную маршрутизацию (AR) при использовании с коммутаторами NVIDIA Spectrum. Среды со смешанной скоростью (от 100GbE до 25GbE) требуют резервирования буферов на выходных портах.

5. Эксплуатация, мониторинг и устранение неполадок

Платформа NVIDIA DOCA обеспечивает комплексную телеметрию. К основным показателям мониторинга относятся:

  • Счетчики для каждой очереди:rdma_out_of_sequence, cnp_sent, cnp_received (через ethtool -S)
  • Состояние PCIe:Исправляемые/неисправимые ошибки, согласование скорости соединения (инструмент mlxlink)
  • Обнаружение перегрузки:Сторожевые таймеры PFC, соотношение пакетов с маркировкой ECN (целевое значение <5%)

Общие способы устранения неполадок: если производительность RoCE падает ниже 80 Гбит/с, проверьте разветвление PCIe (должно быть x16), отключите TSO/GRO и подтвердите пороговые значения переключения ECN. Для тех, кто оцениваетЦена MCX623106AN-CDAT, решение обычно достигает окупаемости инвестиций в течение 9–12 месяцев за счет консолидации количества серверов.

6. Резюме и оценка стоимости

NVIDIA Mellanox MCX623106AN-CDATобеспечивает детерминированную структуру с малой задержкой и одновременно снижает нагрузку на ЦП до 75 % по сравнению с программными сетями. В этом руководстве по решению представлен подробный проект архитектуры, ключевые функции, этапы развертывания и лучшие практики эксплуатации. Организации, ищущиеMCX623106AN-CDAT на продажуможете связаться с авторизованными дистрибьюторами для получения оценочных единиц. Для полной справки официальныйТехническое описание MCX623106AN-CDATи подробныйТехнические характеристики MCX623106AN-CDATдоступны по запросу.