NVIDIA GB300 NVL72: масштабируемая инфраструктура искусственного интеллекта нового поколения

Microsoft представляет первый крупномасштабный производственный кластер с более чем 4600 видеокартами NVIDIA GB300 NVL72 и графическими процессорами NVIDIA Blackwell Ultra, подключенными через сеть NVIDIA InfiniBand нового поколения.

Microsoft предоставляет первый крупномасштабный производственный кластер с более чем 4600 NVIDIA GB300 NVL72, оснащенный графическими процессорами NVIDIA Blackwell Ultra, подключенными через сеть NVIDIA InfiniBand нового поколения. Этот кластер является первым из многих, поскольку мы масштабируемся до сотен тысяч графических процессоров Blackwell Ultra. развернуто в центрах обработки данных Microsoft с искусственным интеллектом во всем мире, что отражает нашу постоянную приверженность переосмыслению инфраструктуры искусственного интеллекта и сотрудничеству с NVIDIA. Крупномасштабные кластеры с графическими процессорами Blackwell Ultra позволят обучать модели за недели, а не за месяцы, обеспечивая высокую пропускную способность для рабочих нагрузок вывода. Мы также открываем более крупные и мощные модели и будем первыми, кто будет поддерживать модели обучения с сотнями триллионов параметров.

Это стало возможным благодаря сотрудничеству специалистов по оборудованию, системам, цепочке поставок, объектам и множеству других дисциплин, а также с NVIDIA.

Запуск Microsoft Azure суперкластера NVIDIA GB300 NVL72 — это захватывающий шаг в развитии передового искусственного интеллекта. Эта совместно разработанная система представляет собой первый в мире крупномасштабный производственный кластер GB300, обеспечивающий супервычислительный механизм, необходимый OpenAI для обслуживания моделей с несколькими триллионами параметров. Это устанавливает новый стандарт ускоренных вычислений.

Ян Бак, вице-президент по гипермасштабированию и высокопроизводительным вычислениям NVIDIA

От NVIDIA GB200 до GB300: новый стандарт производительности ИИ

Ранее в этом году Azure представила виртуальные машины (ВМ) ND GB200 v6ускоренный архитектурой NVIDIA Blackwell. Они быстро стали основой некоторых из самых требовательных рабочих нагрузок ИИ в отрасли, в том числе для таких организаций, как OpenAI и Microsoft, которые уже используют огромные кластеры GB200 NVL2 в Azure для обучения и развертывания передовых моделей.

Read more:  Дома, пострадавшие от наводнения в Лисморе, будут проданы на аукционе по цене от 1 доллара в рамках программы выкупа Нового Южного Уэльса

Теперь, выпустив виртуальные машины ND GB300 v6, Azure снова поднимает планку. Эти виртуальные машины оптимизированы для моделей рассуждения, агентных систем искусственного интеллекта и мультимодального генеративного искусственного интеллекта. Построенная на основе стоечной системы, каждая стойка имеет 18 виртуальных машин с 72 графическими процессорами:

  • 72 графических процессора NVIDIA Blackwell Ultra (с 36 процессорами NVIDIA Grace).
  • Пропускная способность межстоечного масштабирования 800 гигабит в секунду (Гбит/с) на каждый графический процессор благодаря NVIDIA Quantum-X800 InfiniBand нового поколения (2x GB200 NVL72).
  • Пропускная способность NVIDIA NVLink в стойке составляет 130 терабайт (ТБ) в секунду.
  • 37 ТБ быстрой памяти.
  • Производительность тензорного ядра FP4 до 1440 петафлопс (PFLOPS).

Масштабное создание суперкомпьютеров с искусственным интеллектом

Создание инфраструктуры для передового ИИ требует от нас переосмысления каждого уровня стека — вычислений, памяти, сетей, центров обработки данных, охлаждения и электропитания — как единой системы. Виртуальные машины ND GB300 v6 являются наглядным примером этой трансформации, ставшей результатом многолетнего сотрудничества в сфере полупроводников, систем и программного обеспечения.

На уровне стойки NVLink и NVSwitch сокращают ограничения по памяти и пропускной способности, обеспечивая скорость передачи данных внутри стойки до 130 ТБ в секунду, подключая в общей сложности 37 ТБ быстрой памяти. Каждая стойка становится тесно связанным блоком, обеспечивающим более высокую пропускную способность при уменьшении задержек на более крупных моделях и более длинных контекстных окнах, что позволяет агентным и мультимодальным системам искусственного интеллекта быть более отзывчивыми и масштабируемыми, чем когда-либо.

Для масштабирования за пределы стойки Azure развертывает полную неблокирующую архитектуру с использованием NVIDIA Quantum-X800 Гбит/с InfiniBand, самой быстрой сетевой структуры, доступной на сегодняшний день. Это гарантирует, что клиенты смогут эффективно масштабировать обучение сверхбольших моделей до десятков тысяч графических процессоров с минимальными затратами на связь, обеспечивая тем самым лучшую пропускную способность сквозного обучения. Снижение затрат на синхронизацию также приводит к максимальному использованию графических процессоров, что помогает исследователям выполнять итерации быстрее и с меньшими затратами, несмотря на ресурсоемкий характер рабочих нагрузок по обучению ИИ. Совместно разработанный стек Azure, включающий специальные протоколы, коллективные библиотеки и внутрисетевые вычисления, обеспечивает высокую надежность сети и ее полное использование приложениями. Такие функции, как NVIDIA SHARP, ускоряют коллективные операции и удваивают эффективную пропускную способность за счет выполнения математических вычислений на коммутаторе, что делает крупномасштабное обучение и логический вывод более эффективными и надежными.

Усовершенствованные системы охлаждения Azure используют автономные теплообменники и систему охлаждения помещений, чтобы свести к минимуму потребление воды, сохраняя при этом термическую стабильность для плотных высокопроизводительных кластеров, таких как GB300 NVL72. Мы также продолжаем разрабатывать и внедрять новые модели распределения мощности, способные поддерживать высокую плотность энергии и динамическую балансировку нагрузки, необходимые для кластеров графических процессоров ND GB300 v6 VM.

Read more:  Неужели пузырь искусственного интеллекта и кибербезопасности вот-вот лопнет?

Кроме того, наши модернизированные программные стеки для хранения, оркестрации и планирования оптимизированы для полного использования вычислительной, сетевой, хранилища и инфраструктуры центров обработки данных в масштабе суперкомпьютеров, обеспечивая беспрецедентный уровень производительности при высокой эффективности для наших клиентов.

Блейд-сервер из стойки с NVIDIA GB300 NVL72 в инфраструктуре Azure AI.

Заглядывая в будущее

Microsoft уже много лет инвестирует в инфраструктуру искусственного интеллекта, чтобы обеспечить быстрое внедрение и переход на новейшие технологии. Вот почему Лазурный имеет уникальные возможности для быстрого внедрения инфраструктуры GB300 NVL72 в промышленных масштабах, чтобы удовлетворить сегодняшние потребности передового ИИ.

Поскольку Azure продолжает наращивать масштабы развертывания GB300 по всему миру, клиенты могут рассчитывать на обучение и развертывание новых моделей за гораздо меньшее время по сравнению с предыдущими поколениями. Виртуальные машины ND GB300 v6 v6 готовы стать новым стандартом для инфраструктуры искусственного интеллекта, и Azure гордится тем, что лидирует в этом направлении, поддерживая клиентов в продвижении передовых разработок искусственного интеллекта.

Следите за обновлениями и результатами тестов производительности, поскольку Azure расширяет производственное развертывание NVIDIA GB300 NVL72 по всему миру.

Подробную информацию о NVIDIA можно найти здесь.

2025-10-10 18:14:00


1760234421
#NVIDIA #GB300 #NVL72 #масштабируемая #инфраструктура #искусственного #интеллекта #нового #поколения

Ещё по этой теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.