Ранее на этой неделе Нвидиа сюрприз-объявлено их новая архитектура Веры Рубин (никакого отношения к недавно представленному телескоп) в Выставка бытовой электроники в Лас-Вегасе. Новая платформа, которая должна появиться у клиентов позднее в этом году, рекламируется как предлагающая десятикратное сокращение затрат на логические выводы и четырехкратное сокращение количества графические процессоры потребуется обучение определенных моделей по сравнению с Nvidia Блэквелл архитектура.
Обычным подозреваемым в повышении производительности является графический процессор. Действительно, новый графический процессор Rubin может похвастаться 50 квадриллионами операций с плавающей запятой в секунду (петафлопс) 4-битных вычислений по сравнению с 10 петафлопсами у Blackwell, по крайней мере, для рабочих нагрузок на основе трансформаторов, таких как большие языковые модели.
Однако сосредоточение внимания только на графическом процессоре упускает из виду более широкую картину. Всего в компьютерах на базе Vera-Rubin имеется шесть новых чипов: процессор Vera, графический процессор Rubin и четыре отдельных сетевых чипа. По его словам, для достижения преимуществ в производительности компоненты должны работать согласованно. Гилад Шайнерстарший вице-президент по сетевым технологиям Nvidia.
«Одно и то же устройство, подключенное другим способом, обеспечит совершенно другой уровень производительности», — говорит Шайнер. «Вот почему мы называем это экстремальным совместным проектированием».
Расширенные «внутрисетевые вычисления»
Рабочие нагрузки ИИ, как обучение, так и вывод, выполняются на большом количестве графических процессоров одновременно. «Два года назад инференс в основном выполнялся на одном графическом процессоре, в одном блоке и на одном сервере», — говорит Шайнер. «Прямо сейчас процесс вывода становится распределенным, и он не просто хранится в стойке. Он будет перемещаться по стойкам».
Чтобы справиться с этими чрезвычайно распределенными задачами, как можно больше графических процессоров должны эффективно работать как один. Это цель так называемого масштабируемая сеть: соединение графических процессоров в одной стойке. Nvidia обрабатывает это соединение с помощью своего сетевого чипа NVLink. В новую линейку входит коммутатор NVLink6 с удвоенной пропускной способностью по сравнению с предыдущая версия (3600 гигабайт в секунду для соединений между графическими процессорами по сравнению с 1800 ГБ/с для коммутатора NVLink5).
Помимо удвоения пропускной способности, масштабируемые чипы также включают в себя удвоенное количество SerDes — сериализаторов/десериализаторов (которые позволяют передавать данные по меньшему количеству проводов) и расширенное количество вычислений, которые можно выполнять внутри сети.
«Масштабируемая сеть на самом деле не является самой сетью», — говорит Шайнер. «Это вычислительная инфраструктура, и некоторые вычислительные операции выполняются в сети… на коммутаторе».
Обоснование переноса некоторых операций с графических процессоров на сеть двоякое. Во-первых, это позволяет выполнять некоторые задачи только один раз, вместо того чтобы заставлять их выполнять каждый графический процессор. Типичным примером этого является операция полного сокращения при обучении ИИ. Во время обучения каждый графический процессор вычисляет математическую операцию, называемую градиентом, над своим собственным пакетом данных. Чтобы правильно обучить модель, все графические процессоры должны знать средний градиент, рассчитанный для всех пакетов. Вместо того, чтобы каждый графический процессор отправлял свой градиент каждому другому графическому процессору и каждый из них вычислял среднее значение, это экономит вычислительное время и мощность, поскольку эта операция выполняется только один раз в сети.
Второе обоснование состоит в том, чтобы скрыть время, необходимое для шаттл данные между графическими процессорами, выполняя вычисления на них в пути. Шайнер объясняет это аналогией с пиццерией, пытающейся ускорить доставку заказа. “Что вы можете сделать, если у вас будет больше печей или больше рабочих? Это вам не поможет; вы можете приготовить больше пиццы, но время на приготовление одной пиццы останется прежним. Альтернативно, если вы возьмете духовку и поставите ее в машину, и я буду печь пиццу по дороге к вам, вот где я сэкономлю время. Это то, что мы делаем”.
Внутрисетевые вычисления не являются чем-то новым для этой версии архитектуры Nvidia. Фактически, он широко используется примерно с 2016 года. Но эта итерация добавляет более широкий спектр вычислений, которые можно выполнять внутри сети для удовлетворения различных рабочих нагрузок и различных числовых форматов, говорит Шейнер.
Масштабирование по горизонтали
Остальные сетевые чипы, включенные в архитектуру Rubin, составляют так называемую горизонтально масштабируемую сеть. Это часть, которая соединяет разные стойки друг с другом в центре обработки данных.
Те чипсы являются ConnectX-9, сетевая интерфейсная карта; BlueField-4 — так называемый блок обработки данных, который работает в паре с двумя процессорами Vera и картой ConnectX-9 для разгрузки задач сети, хранения и безопасности; и наконец Спектр-6 Ethernet переключатель, который использует сборная оптика для передачи данных между стойками. Коммутатор Ethernet также удваивает пропускную способность по сравнению с предыдущими поколениями, минимизируя при этом джиттер — изменение времени прибытия информационных пакетов.
«Масштабируемая инфраструктура должна гарантировать, что эти графические процессоры могут хорошо взаимодействовать для запуска распределенные вычисления “Дрожание означает потерю денег”, – говорит Шейнер. “Дрожание означает потерю денег”, – говорит Шейнер.
Ни один из множества новых чипов Nvidia не предназначен специально для связи между центры обработки данныхназываемый «масштабированием». Но Шайнер утверждает, что это следующий рубеж. «На этом дело не заканчивается, поскольку мы видим требования увеличить количество графических процессоров в центрах обработки данных», — говорит он. «100 000 графических процессоров уже недостаточно для некоторых рабочих нагрузок, и теперь нам нужно соединить несколько центров обработки данных вместе».
Статьи из вашего сайта
Статьи по теме в Интернете
2026-01-10 14:00:00
1768133142
#Пропускная #способность #сети #Nvidia #Rubin #удвоилась
Продолжение темы

