Mellanox (NVIDIA Mellanox) 980-9I45T-00H020 Технический документ | Высоконадежная связь и оптимизация операций
September 1, 2026
Mellanox (NVIDIA Mellanox) 980-9I45T-00H020 Техническая белая книга
В этой книге основное внимание уделяетсяMellanox (NVIDIA Mellanox) 980-9I45T-00H020Сетевое устройство как краеугольный камень высокой надежности подключения и стратегии операционного совершенства для современных дата-центров и корпоративных сетей.980-9I45T-00H020является высокопроизводительным решением для взаимосвязи, предназначенным для обработки самых сложных рабочих нагрузок в кластерах ИИ, средах HPC и критической инфраструктуре.
1. Опыт и бизнес-требования
Современные центры обработки данных переходят от архитектур, ориентированных на процессор, к дизайнам, управляемым GPU и DPU.латентностьОдновременно с этим корпоративные сети сталкиваются с проблемами в области межсетевой взаимосвязи, доступа к нескольким облакам и соблюдения нормативных требований.создание традиционных трехуровневых сетевых архитектур, недостаточных для эластичного масштабирования бизнеса.
ВведениеMellanox (NVIDIA Mellanox) 980-9I45T-00H020обращается к следующим критическим болевым точкам:
- Узкие уголки производительности: Существующие сети 25G/40G не могут удовлетворять требованиям трафика севера-юга кластеров GPU класса 800G;
- Оперативная сложность: оборудование от нескольких поставщиков приводит к изоляционному мониторингу и увеличению среднего времени ремонта (MTTR);
- Пробелы в надежности: сбои ссылок и перегрузки приводят к значительному снижению производительности приложений и нарушениям SLA.
Ключевые показатели успеха для этого решения включают задержку до микросекунды, нулевую потерю пакетов при перегрузке и автоматическое обнаружение и устранение неисправностей.
2. Общий дизайн сетевой архитектуры
Предлагаемая архитектураткань из спиннолистной тканиТопология с двухуровневой конструкцией Clos, позволяющей детерминированную низкую задержку и возможность масштабирования.980-9I45T-00H020 Сетевой продуктна спинном слое высокоплотные коммутаторы обеспечивают бесблокирующее соединение между раками.
Ключевые архитектурные принципы включают:
- Ткань RDMA с нулевыми потерями: Использование RoCEv2 и PFC/ECN управления потоком для обеспечения беспотери транспортировки NVMe-oF и GPUDirect Storage;
- Адаптивное маршрутизация: Динамический выбор маршрута на основе телеметрии в режиме реального времени, исключающий перегруженные связи без ручного вмешательства;
- Изоляция с несколькими помещениями: поддержка VXLAN и GENEVE на основе аппаратного обеспечения позволяет обеспечить безопасную сегментацию для смешанных ИИ, HPC и общецелевых рабочих нагрузок.
Архитектура предназначена для поддержки до 2048 узлов GPU на модуль ткани, с980-9I45T-00H020 высокоскоростная сеть центра обработки данныхустройство, служащее основным узлом для подключения вычислений/хранилищ.
3. Роль Mellanox (NVIDIA Mellanox) 980-9I45T-00H020 в решении
ВMellanox (NVIDIA Mellanox) 980-9I45T-00H020является многофункциональным сетевым адаптером / коммутатором, который соединяет шину хоста (PCIe 6.0) и ткань (InfiniBand или Ethernet).
- 800G скоростное перенаправление: поддерживает XDR InfiniBand и 800GbE, обеспечивая достаточное пространство для будущих поколений графических процессоров (например, B100, X100);
- Вычислительная нагрузка в сети (SHARPv3): сокращает время коллективной связи MPI до 30% путем выполнения операций агрегирования непосредственно в сетевой структуре;
- Аппаратная телеметрия: Встроенное обнаружение перегруженности (например, ECN-маркировка, ограничение потока) обеспечивает детальную видимость динамики очереди без нагрузки на ЦП;
- Усовершенствованная безопасность: аппаратное корневое доверие, безопасная загрузка и встроенное шифрование IPSec/MACsec защищают данные при транспортировке от атак физического уровня.
В качестве980-9I45T-00H020 Сетевой продукт, он легко интегрируется с существующими коммутаторами Mellanox и программным обеспечением NVIDIA DOCA, снижая риск интеграции и ускоряя время до производства.
4. Рекомендации по развертыванию и масштабированию
Типичные сценарии развертывания включают:
- Маломасштабные (до 64 графических процессоров)Двухрамочное развертывание с 1x980-9I45T-00H020на сервер с использованием прямых кабелей OSFP-OSFP DAC для малозадержной внутрираковой связи;
- Крупномасштабные (256+ GPU): многоподная архитектура с980-9I45T-00H020устройства, объединяющие листья коммутаторов через 800G подключения к спинным коммутаторам, позволяющие полную полосу пропускания;
- Гибридная ткань для хранения ИИ +:980-9I45T-00H020могут быть сконфигурированы с разделением портов (2x 400G или 8x 100G), чтобы одновременно обслуживать вычислительные и хранилищные сети, уменьшая капитальные затраты.
Илюстрация топологии (упрощенная):
| Компонент | Количество | Соединение |
|---|---|---|
| Серверы с графическим процессором (по 8 GPU) | 32 | 1x 980-9I45T-00H020 на сервер |
| Листные коммутаторы (32-портные 800G) | 8 | Вверх на позвоночник через 800G |
| Переменники позвоночника (64-порт 800G) | 4 | Полномасштабные с листьями |
Для будущего расширения архитектура поддерживает масштабирование с учетом роста, добавляя дополнительные блоки листьев без перепроектирования позвоночного слоя.
5. Операционный мониторинг, устранение неполадок и оптимизация
В980-9I45T-00H020интегрируется с телеметрическим стеком NVIDIA для обеспечения видимости в режиме реального времени:
- Определение микроразрыва: отчетность на уровне аппаратного обеспечения об занятости буфера на поток, позволяющая предварительные корректировки QoS;
- Мониторинг качества ссылок: счетчики FEC (Forward Error Correction) и сигналы соотношения сигнала к шуму для деградации оптической связи;
- Симуляция сети: Использование встроенных данных телеметрии для восстановления моделей трафика в среде цифровых близнецов для анализа "что если".
Рекомендуемая лучшая практическая практика:
- Настроитьавтоматизированные базовые профилидля задержки и пропускной способности при нормальной нагрузке, и запускать сигналы оповещения, когда отклонения превышают 10%;
- Регулярный аудитверсии прошивкиобеспечить совместимость с последними версиями NVIDIA DOCA и драйверов;
- ИспользоватьСпецификации 980-9I45T-00H020и980-9I45T-00H020 Лист данныхдля калибровки пороговых значений буфера для конкретных смесей трафика (например, модели "все-уменьшить" и "все-на-все");
- При масштабировании проверяйте980-9I45T-00H020 совместимыоптики и кабелей, использующих официальную матрицу совместимости, чтобы избежать проблем с целостностью сигнала.
6. Резюме и оценка стоимости
ВMellanox (NVIDIA Mellanox) 980-9I45T-00H020Он обеспечивает проверенный путь к созданию высоконадежных, оперативно эффективных сетей центров обработки данных.и гранулированной телеметрии позволяет организациям достичь:
- 30-40% сокращение времени завершения обучения ИИпосредством оптимизированной коллективной коммуникации;
- Никакого воздействия на пользователя при сбоях ссылокблагодаря адаптивному маршрутизации и отказной смене на секунду;
- 50% меньше операционных накладных расходовпосредством единого мониторинга и автоматизированных рабочих процессов восстановления.
С980-9I45T-00H020 Сетевой продуктКак крайное основание, предприятия могут уверенно развертывать рабочие нагрузки ИИ следующего поколения, сохраняя при этом полный контроль над надежностью, безопасностью и общей стоимостью владения.980-9I45T-00H020 ценаи980-9I45T-00H020 для продажиЗапросы, пожалуйста, свяжитесь с вашим уполномоченным партнером NVIDIA Mellanox.

