NVIDIA Mellanox MCX631102AN-ADAT в действии: RDMA/RoCE низкозадержка транспорта и оптимизация пропускной способности сервера

July 27, 2026

последние новости компании о NVIDIA Mellanox MCX631102AN-ADAT в действии: RDMA/RoCE низкозадержка транспорта и оптимизация пропускной способности сервера

NVIDIA Mellanox MCX631102AN-ADAT в действии: низкая задержка RDMA/RoCE и оптимизация пропускной способности сервера

Предпосылки и проблемы: узкое место по задержке и пропускной способности в распределенных хранилищах

Облачный провайдер среднего размера, эксплуатирующий распределенный кластер хранения Ceph на 120 серверах x86, начал испытывать нарастающие проблемы с производительностью. Их существующая сетевая инфраструктура 10GbE, полагающаяся на TCP/IP для межсоединений узлов, с трудом справлялась с растущими пулами хранения на базе NVMe. Основные симптомы включали высокую загрузку ЦП, превышающую 45% на узлах хранения из-за обработки сетевых протоколов, средние задержки чтения/записи, достигающие более 3 миллисекунд в часы пик, и значительный разрыв между теоретической пропускной способностью дисков и фактической производительностью, обеспечиваемой сетью. Инженерная команда признала, что достижение задержки менее миллисекунды и полное раскрытие потенциала NVMe требовали фундаментального изменения сетевого подхода — в частности, внедрения RDMA over Converged Ethernet (RoCE).

Решение и развертывание: представление решения сетевой карты Ethernet MCX631102AN-ADAT

После оценки нескольких вариантов от различных поставщиков команда выбралаNVIDIA Mellanox MCX631102AN-ADATв качестве основного средства для модернизации сети. Сетевая картаMCX631102AN-ADAT ConnectX-6 Lx с двумя портами 25GbE SFP28была выбрана благодаря встроенной поддержке RoCEv2, аппаратному управлению перегрузками и бесшовной интеграции с существующей кабельной инфраструктурой SFP28.

Стратегия развертывания была поэтапной и охватывала три кластера:

  • Этап 1 (пилотный):16 узлов хранения были оснащенысетевой картой Ethernet MCX631102AN-ADAT, заменив устаревшие сетевые карты 10GbE. Карты были настроены в режиме активный-активный с двумя портами, каждый порт был подключен к паре коммутаторов NVIDIA Spectrum для резервирования.
  • Этап 2 (оптимизация):RoCEv2 был включен с Priority Flow Control (PFC) и Explicit Congestion Notification (ECN), настроенными для предотвращения потерь в сети. Команда использовала аппаратные движки разгрузки карты для вычислений NVMe-oF и кодирования стиранием.
  • Этап 3 (полное развертывание):Все 120 узлов были мигрированы наNVIDIA Mellanox MCX631102AN-ADAT, а сетевой стек Ceph OSD (Object Storage Daemon) был перенастроен для использования транспорта RDMA.

Согласнотехническом описании MCX631102AN-ADAT, интерфейс PCIe 4.0 x8 карты обеспечивает достаточную пропускную способность для обработки суммарной пропускной способности 50 Гбит/с. Команда подтвердила, чтоспецификации MCX631102AN-ADAT— включая задержку менее 0,6 микросекунды и аппаратное управление трафиком — идеально соответствуют их строгим требованиям к производительности. Карта также оказаласьсовместимой с MCX631102AN-ADATс их существующим дистрибутивом Linux (RHEL 9.2) и драйверами Mellanox OFED, что значительно упростило процесс развертывания.

Результаты и преимущества: измеримое повышение задержки и пропускной способности

Влияние миграции было немедленно очевидно в производственных метриках. Основные улучшения, наблюдаемые после развертывания, включают:

Метрика До обновления (10GbE TCP/IP) После обновления (MCX631102AN-ADAT с RoCE) Улучшение
Средняя задержка чтения 2,8 мс 0,4 мс снижение в 7 раз
Средняя задержка записи 3,2 мс 0,5 мс снижение в 6,4 раза
Загрузка ЦП узла (сетевой стек) 42% 11% освобождено 31 п.п.
Суммарная пропускная способность кластера 18 Гбит/с 42 Гбит/с увеличение в 2,3 раза

Помимо цифр, команда отметила значительные операционные улучшения. КартаMCX631102AN-ADATобеспечила бесшовную живую миграцию ВМ, работающих с чувствительными к задержке приложениями, поскольку сетевые джиттеры снизились до незначительных уровней. Аппаратная разгрузка NVMe-oF дополнительно снизила задержку доступа к хранилищу на 30%, позволяя кластеру обрабатывать смешанные рабочие нагрузки чтения/записи с постоянным временем отклика менее миллисекунды. Для организаций, рассчитывающих рентабельность инвестиций,цена MCX631102AN-ADATоказалась оправданной увеличением пропускной способности в 2,3 раза и возможностью отложить дополнительную закупку серверов как минимум на 18 месяцев. Провайдер также отметил, чтоMCX631102AN-ADAT для продажичерез партнерских каналов предлагали гибкие скидки на объем для крупномасштабных развертываний.

Кроме того, встроенная телеметрия карты и возможности внеполосного управления — подробно описанные втехническом описании MCX631102AN-ADAT— обеспечили глубокую видимость состояния сети, позволяя проактивно управлять перегрузками и ускорять анализ первопричин при устранении инцидентов.

Резюме и перспективы: стратегическая основа для будущих рабочих нагрузок

Это реальное развертывание демонстрирует, чтоNVIDIA Mellanox MCX631102AN-ADAT— это гораздо больше, чем простое увеличение пропускной способности. Являясь специально разработаннымрешением сетевой карты Ethernet MCX631102AN-ADATдля сред с поддержкой RoCE, она эффективно устраняет сеть как узкое место производительности, раскрывая весь потенциал современных хранилищ NVMe и архитектур ЦП. Сочетание двухпортовой пропускной способности 25GbE, комплексных разгрузок RDMA и широкой совместимости с экосистемой позиционирует эту карту как стратегическую инвестицию для любой организации, планирующей масштабировать конвейеры AI/ML, распределенные базы данных или гиперконвергентную инфраструктуру.

Заглядывая в будущее, команда изучает расширенные варианты использования, включая интеграцию NVIDIA DOCA для программируемых путей данных и нулевое конфигурирование. Благодаря доказанной способности снижать задержку, повышать пропускную способность и освобождать ресурсы ЦП,MCX631102AN-ADATустанавливает новый стандарт для серверных карт 25GbE в корпоративных и облачных средах.