NVIDIA Mellanox MCX631102AN-ADAT в действии: RDMA/RoCE низкозадержка транспорта и оптимизация пропускной способности сервера
July 27, 2026
NVIDIA Mellanox MCX631102AN-ADAT в действии: низкая задержка RDMA/RoCE и оптимизация пропускной способности сервера
Предпосылки и проблемы: узкое место по задержке и пропускной способности в распределенных хранилищах
Облачный провайдер среднего размера, эксплуатирующий распределенный кластер хранения Ceph на 120 серверах x86, начал испытывать нарастающие проблемы с производительностью. Их существующая сетевая инфраструктура 10GbE, полагающаяся на TCP/IP для межсоединений узлов, с трудом справлялась с растущими пулами хранения на базе NVMe. Основные симптомы включали высокую загрузку ЦП, превышающую 45% на узлах хранения из-за обработки сетевых протоколов, средние задержки чтения/записи, достигающие более 3 миллисекунд в часы пик, и значительный разрыв между теоретической пропускной способностью дисков и фактической производительностью, обеспечиваемой сетью. Инженерная команда признала, что достижение задержки менее миллисекунды и полное раскрытие потенциала NVMe требовали фундаментального изменения сетевого подхода — в частности, внедрения RDMA over Converged Ethernet (RoCE).
Решение и развертывание: представление решения сетевой карты Ethernet MCX631102AN-ADAT
После оценки нескольких вариантов от различных поставщиков команда выбралаNVIDIA Mellanox MCX631102AN-ADATв качестве основного средства для модернизации сети. Сетевая картаMCX631102AN-ADAT ConnectX-6 Lx с двумя портами 25GbE SFP28была выбрана благодаря встроенной поддержке RoCEv2, аппаратному управлению перегрузками и бесшовной интеграции с существующей кабельной инфраструктурой SFP28.
Стратегия развертывания была поэтапной и охватывала три кластера:
- Этап 1 (пилотный):16 узлов хранения были оснащенысетевой картой Ethernet MCX631102AN-ADAT, заменив устаревшие сетевые карты 10GbE. Карты были настроены в режиме активный-активный с двумя портами, каждый порт был подключен к паре коммутаторов NVIDIA Spectrum для резервирования.
- Этап 2 (оптимизация):RoCEv2 был включен с Priority Flow Control (PFC) и Explicit Congestion Notification (ECN), настроенными для предотвращения потерь в сети. Команда использовала аппаратные движки разгрузки карты для вычислений NVMe-oF и кодирования стиранием.
- Этап 3 (полное развертывание):Все 120 узлов были мигрированы наNVIDIA Mellanox MCX631102AN-ADAT, а сетевой стек Ceph OSD (Object Storage Daemon) был перенастроен для использования транспорта RDMA.
Согласнотехническом описании MCX631102AN-ADAT, интерфейс PCIe 4.0 x8 карты обеспечивает достаточную пропускную способность для обработки суммарной пропускной способности 50 Гбит/с. Команда подтвердила, чтоспецификации MCX631102AN-ADAT— включая задержку менее 0,6 микросекунды и аппаратное управление трафиком — идеально соответствуют их строгим требованиям к производительности. Карта также оказаласьсовместимой с MCX631102AN-ADATс их существующим дистрибутивом Linux (RHEL 9.2) и драйверами Mellanox OFED, что значительно упростило процесс развертывания.
Результаты и преимущества: измеримое повышение задержки и пропускной способности
Влияние миграции было немедленно очевидно в производственных метриках. Основные улучшения, наблюдаемые после развертывания, включают:
| Метрика | До обновления (10GbE TCP/IP) | После обновления (MCX631102AN-ADAT с RoCE) | Улучшение |
|---|---|---|---|
| Средняя задержка чтения | 2,8 мс | 0,4 мс | снижение в 7 раз |
| Средняя задержка записи | 3,2 мс | 0,5 мс | снижение в 6,4 раза |
| Загрузка ЦП узла (сетевой стек) | 42% | 11% | освобождено 31 п.п. |
| Суммарная пропускная способность кластера | 18 Гбит/с | 42 Гбит/с | увеличение в 2,3 раза |
Помимо цифр, команда отметила значительные операционные улучшения. КартаMCX631102AN-ADATобеспечила бесшовную живую миграцию ВМ, работающих с чувствительными к задержке приложениями, поскольку сетевые джиттеры снизились до незначительных уровней. Аппаратная разгрузка NVMe-oF дополнительно снизила задержку доступа к хранилищу на 30%, позволяя кластеру обрабатывать смешанные рабочие нагрузки чтения/записи с постоянным временем отклика менее миллисекунды. Для организаций, рассчитывающих рентабельность инвестиций,цена MCX631102AN-ADATоказалась оправданной увеличением пропускной способности в 2,3 раза и возможностью отложить дополнительную закупку серверов как минимум на 18 месяцев. Провайдер также отметил, чтоMCX631102AN-ADAT для продажичерез партнерских каналов предлагали гибкие скидки на объем для крупномасштабных развертываний.
Кроме того, встроенная телеметрия карты и возможности внеполосного управления — подробно описанные втехническом описании MCX631102AN-ADAT— обеспечили глубокую видимость состояния сети, позволяя проактивно управлять перегрузками и ускорять анализ первопричин при устранении инцидентов.
Резюме и перспективы: стратегическая основа для будущих рабочих нагрузок
Это реальное развертывание демонстрирует, чтоNVIDIA Mellanox MCX631102AN-ADAT— это гораздо больше, чем простое увеличение пропускной способности. Являясь специально разработаннымрешением сетевой карты Ethernet MCX631102AN-ADATдля сред с поддержкой RoCE, она эффективно устраняет сеть как узкое место производительности, раскрывая весь потенциал современных хранилищ NVMe и архитектур ЦП. Сочетание двухпортовой пропускной способности 25GbE, комплексных разгрузок RDMA и широкой совместимости с экосистемой позиционирует эту карту как стратегическую инвестицию для любой организации, планирующей масштабировать конвейеры AI/ML, распределенные базы данных или гиперконвергентную инфраструктуру.
Заглядывая в будущее, команда изучает расширенные варианты использования, включая интеграцию NVIDIA DOCA для программируемых путей данных и нулевое конфигурирование. Благодаря доказанной способности снижать задержку, повышать пропускную способность и освобождать ресурсы ЦП,MCX631102AN-ADATустанавливает новый стандарт для серверных карт 25GbE в корпоративных и облачных средах.

