Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 Коммутатор InfiniBand на практике

July 15, 2026

последние новости компании о Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 Коммутатор InfiniBand на практике

Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 Коммутатор InfiniBand на практике | Оптимизация межсоединения с малой задержкой для кластеров RDMA/HPC/AI

Предыстория и проблемы: когда масштаб кластера сталкивается с узкими местами межсоединений

Подразделение исследований искусственного интеллекта ведущей интернет-компании оказалось на знакомом перепутье. Их растущий парк графических серверов, занимающий несколько стоек и все чаще используемый для обучения масштабным языковым моделям, страдал от непредсказуемых сроков выполнения работ. Существующая структура на основе Ethernet, хотя и адекватная для рабочих нагрузок общего назначения, не могла справиться с синхронизированными, пульсирующими шаблонами трафика распределенного обучения. Операции полного сокращения регулярно останавливались из-за потери пакетов и перегрузки, в результате чего циклы обучения увеличивались с дней до недель. Инфраструктурной группе требовался фундаментальный сдвиг в том, как их внутренняя сеть обрабатывает трафик RDMA, и им это было нужно без капитального ремонта всей архитектуры центра обработки данных.

Разработка решения: развертывание коммутатора InfiniBand 920-9B210-00FN-0D0 OPN

После оценки нескольких вариантов межсоединения команда выбралаМелланокс (NVIDIA Mellanox) 920-9B210-00FN-0D0как краеугольный камень их новой серверной структуры. Развертывание основывалось на двухуровневой топологии Leaf Spine, в которой каждый листовой коммутатор подключал до 40 узлов графического процессора через каналы 400 Гбит/с.920-9B210-00FN-0D0 MQM9790-NS2F 400 Гбит/с NDRвариант был выбран специально из-за его неблокирующей архитектуры и встроенных сетевых вычислительных возможностей SHARPv3. Это позволило команде перенести операции коллективной связи непосредственно на коммутационную фабрику, снизив нагрузку на ЦП и высвободив циклы графического процессора для реальных вычислений.

Что касается физического развертывания, коммутаторы были установлены с потоком воздуха спереди назад, чтобы соответствовать существующей конфигурации «горячего» и «холодного» коридоров. Команда воспользоваласьТехнический паспорт 920-9B210-00FN-0D0для проверки требований к электропитанию и охлаждению, обеспечивая плавную интеграцию с существующими блоками распределения питания. Кабели поддерживались согласованными с использованием трансиверов QSFP-DD, при этомСовместимость с 920-9B210-00FN-0D0оптика проверена по всему каналу связи, включая соединения «позвоночник-лист» на расстояние до 100 метров.

Подход к развертыванию: пошаговая интеграция

  • Этап 1 – Лабораторная проверка:Небольшой испытательный стенд с 8 узлами графического процессора и двумя коммутаторами использовался для измерения задержки и пропускной способности.NVIDIA Мелланокс 920-9B210-00FN-0D0продемонстрировал задержку переключения менее 600 нс, что на 60 % лучше, чем у предыдущего поколения HDR.
  • Этап 2 – Поэтапное внедрение:Команда переносила по одному обучающему модулю за раз, используя Unified Fabric Manager от NVIDIA для мониторинга показателей работоспособности канала и перегрузки в режиме реального времени. Это свело к минимуму сбои в текущих производственных нагрузках.
  • Этап 3 – Полномасштабная интеграция:Все 18 коммутаторов были развернуты в трех стойках, образуя полностью неблокируемую магистраль с восходящими каналами 400 Гбит/с. Адаптивная маршрутизация была включена для динамической балансировки трафика и предотвращения переподписки во время пиковой отправки заданий.

На протяжении всего развертывания инженерная группа обращалась к комплексномуТехнические характеристики 920-9Б210-00ФН-0Д0для точной настройки параметров буфера и параметров контроля перегрузки. Расширенная телеметрия коммутатора обеспечила детальную визуализацию количества ошибок по каждому порту и использования канала, что позволило осуществлять упреждающее обслуживание и планирование мощности.

Измеримые результаты и эксплуатационные преимущества

В течение двух недель после полномасштабного развертывания улучшения стали ощутимыми. Время завершения стандартного задания по обучению с использованием 1024 графических процессоров при полном сокращении сократилось с 12,3 секунды до 7,8 секунды, что представляет собой сокращение накладных расходов на связь на 37%. Время выполнения заданий для типичной модели в стиле GPT сократилось почти на 30 %, что позволило исследовательской группе выполнять итерации быстрее и проводить больше экспериментов в неделю. Встроенный механизм SHARPv3 разгрузил в среднем 18% коллективных операций, что напрямую привело к более высокой загрузке графического процессора и снижению энергопотребления за один тренировочный цикл.

В оперативном плане ИТ-команда сообщила о меньшем количестве сбоев в работе сети и о значительно меньшем времени, потраченном на диагностику проблем на уровне каналов.920-9B210-00FN-0D0 Коммутатор InfiniBand Решение OPNоказалась на удивление стабильной: за трехмесячный период наблюдения не было никаких незапланированных отключений. Унифицированный интерфейс управления сократил время обучения для группы сетевых операций, которая теперь могла управлять всей структурой через единую панель.

Вопросы стоимости и закупок

В то время как первоначальный920-9Б210-00ФН-0Д0 ценаПоместив коммутатор в сегмент премиум-класса, анализ совокупной стоимости владения показал иную картину. За счет сокращения времени выполнения заданий и улучшения использования графического процессора организация добилась сокращения затрат на облачные экземпляры на 22 % при эквивалентной вычислительной мощности. Кроме того,920-9Б210-00ФН-0Д0 в продажеБлагодаря многочисленным торговым партнерам, компания могла проводить конкурентоспособные торги, а долгосрочная поддержка со стороны NVIDIA Mellanox обеспечила уверенность в инвестициях.

Резюме и перспективы: проект инфраструктуры искусственного интеллекта следующего поколения

РазвертываниеМелланокс (NVIDIA Mellanox) 920-9B210-00FN-0D0в этом крупномасштабном исследовательском центре искусственного интеллекта служит убедительной эталонной архитектурой для организаций, сталкивающихся с аналогичными проблемами межсетевого взаимодействия. Сочетание скорости NDR 400 Гбит/с, задержки менее микросекунды и возможностей внутрисетевых вычислений устраняет основные болевые точки кластеров HPC и искусственного интеллекта на базе RDMA. Сетевые архитекторы оценят гибкость920-9B210-00FN-0D0 Переключатель InfiniBand OPNв различных топологиях, а ИТ-менеджеры могут положиться на надежные инструменты управления и комплексныеТехнический паспорт 920-9B210-00FN-0D0для планирования мощностей.

Заглядывая в будущее, организация уже планирует расширить структуру для поддержки более крупных кластеров графических процессоров, включая интеграцию DPU BlueField-3 для дополнительной разгрузки хранилища и изоляции безопасности.Совместимость с 920-9B210-00FN-0D0экосистема гарантирует, что будущие обновления — будь то новые сетевые карты или оптические технологии — будут беспрепятственно поддерживаться. Для любого предприятия, развертывающего крупномасштабные рабочие нагрузки искусственного интеллекта или высокопроизводительных вычислений, этот коммутатор представляет собой не просто поэтапное обновление, но и фундаментальный фактор повышения производительности в масштабе.