Nvidia’s Blackwell Ultra доминирует в выводе Mlperf

А машинное обучение Поле движется быстро, и используемые критерии измеряют прогресс в нем, чтобы гонка, чтобы не отставать. В качестве примера, MlperfСоревнование по двунальному обучению иногда называлось «Олимпийским ИИ», вводили три новых теста, отражающие новые направления в этой области.

«В последнее время было очень сложно, пытаясь следовать тому, что происходит в этой области», – говорит Миро ХодакВ Амд Инженер и MLPERF СОВЕТСТВЕННЫЙ СОВЕТСТВИЯ. «Мы видим, что модели становятся все больше, и в последних двух раундах мы представили самые большие модели, которые у нас когда -либо были».

Чипсы, которые решали эти новые критерии, поступили от обычных подозреваемых – nvidia, arm and IntelПолем Нвидия возглавил диаграммы, представляя свои новые Блэквелл Ультра Графический процессор, упакованный в GB300 Дизайн масштаба стойки. AMD выступил сильную производительность, представляя свои последние Mi325x Графические процессорыПолем Intel доказала, что можно сделать вывод на процессорах с их Ксеон материалы, но также вошли в игру GPU с Intel Arc Pro подчинение.

Новые тесты

Последний раунд, Mlperf введено Его самый большой эталон еще, большая языковая модель, основанная на Llama3.1-403B. В этом раунде они снова возглавили себя, представляя эталон, основанный на модели DeepSeek R1 671B – в 1,5 раза больше, чем количество параметров предыдущего крупнейшего эталона.

В качестве модели рассуждений DeepSeek R1 проходит несколько этапов цепочки мыслей при приближении к запросу. Это означает, что большая часть вычислений происходит во время вывода, а затем в обычной работе LLM, что делает этот эталон еще более сложным. Модели рассуждений, как утверждается, являются наиболее точными, что делает их методом выбора для науки, математики и сложных программирование Запросы.

Read more:  NVIDIA для инвестирования 5 млрд. Долл. США в Intel после 10% акций администрации Трампа | Бизнес

В дополнение к крупнейшему эталону LLM, MLPERF также представила наименьшего, на основе LLAMA3.1-8B. Растут растущий спрос на промышленность на низкую задержку, но в то же время рассуждения о высокой точке, объяснил Таран Айенгар, председатель целевой группы MLPERF. Маленькие LLM могут предоставить это и являются отличным выбором для таких задач, как суммирование текста и приложения Edge.

Это подводит общее количество критериев на основе LLM к запутанным четырем. Они включают в себя новый, самый маленький эталон Llama3.1-8b; ранее существовавший эталон Llama2-70B; Внедрение последнего раунда эталона Llama3.1-403B; и самая большая, новая модель Deepseek R1. Если ничего другого, эти сигналы LLM никуда не денутся.

В дополнение к множеству LLMS, этот раунд вывода MLPERF включал новую модель голоса в тексте, основанную на Whisper-Large-V3. Этот эталон является ответом на растущее число приложений с поддержкой голоса, будь то Умные устройства или речевые интерфейсы ИИ.

Соревнование по выводам TheMlperf имеет две широкие категории: «закрыто», которая требует использования модели эталонной нейронной сети как есть без модификаций, и «Open», где разрешены некоторые модификации модели. Внутри этого есть несколько подкатегорий, связанных с тем, как выполняются тесты и в какой инфраструктуре. Мы сосредоточимся на «закрытых» Дата -центр Результаты сервера ради здравомыслия.

Нвидия ведет

Удивительно, что никто, лучшая производительность на акселератор на каждом эталонном эталоне, по крайней мере, в категории «сервер», была достигнута системой на основе графических процессоров NVIDIA. Nvidia также представила Blackwell Ultra, возглавив диаграммы в двух крупнейших критериях: Lllama3.1-405b и Deepseek R1 рассуждения.

Блэквелл Ультра является более мощной итерацией архитектуры Blackwell, в которой значительно больше возможностей памяти, удваивает ускорение слоев внимания, на 1,5 раза больше вычислений ИИ, более быстрой памяти и подключения по сравнению со стандартным Блэквеллом. Он предназначен для более крупных рабочих нагрузок, например, на два теста, на которых он был протестирован.

Read more:  Tesla, Samsung, Energy Stocks и европейские полупроводники поднимаются

В дополнение к улучшению аппаратного обеспечения директор ускоренных вычислительных продуктов в NVIDIA Дэйв Сальватор Приписывает успех Blackwell Ultra двум ключевым изменениям. Во-первых, использование запатентованного 4-битного плавающая точка Номер форматВ NVFP4Полем «Мы можем обеспечить сопоставимую точность для таких форматов, как BF16», – говорит Сальватор, используя гораздо меньшую вычислительную мощность.

Второе так называется дезагрегированная порцияПолем Идея, лежащая в основе дезагрегированной служения, заключается в том, что в рабочей нагрузке с выводом есть две основные части: Prefill, где запрос («Пожалуйста, суммируйте этот отчет».) И все его контекстное окно (отчет) загружается в LLM и генерация/декодирование, где вывод фактически рассчитывается. Эти два этапа имеют разные требования. В то время как префилл вычислил тяжелый, генерация/декодирование гораздо больше зависит от пропускной способности памяти. Сальватор говорит, что, назначая различные группы графических процессоров на два разных этапа, NVIDIA достигает прибыли почти на 50 процентов.

AMD закрывается позади

Новейший чип Amd Accelerator, MI355X, запущен в июле. Компания предложила результаты только в категории «Open», где разрешены программные изменения в модели. Как и Blackwell Ultra, MI355X оснащен 4-битной поддержкой плавающей запятой, а также расширенной памятью с высокой пропускной способностью. MI355X победил своего предшественника, MI325X, в тесте Open Llama2.1-70B в 2,7, говорит Махеш БаласубраманецСтарший директор по маркетингу продукции в центре обработки данных в AMD.

«Закрытые» представления AMD включали системы, основанные на AMD MI300X и графических процессорах MI325X. Более продвинутый компьютер MI325X выполнялся так же, как и с помощью NVIDIA H200S на Lllama2-70B, смесь теста экспертов и тестов генерации изображений.

Этот раунд также включал первую гибридную подчинение, где AMD MI300X и MI325X были использованы для одной и той же задачи вывода, эталона Llama2-70B. Использование гибридных графических процессоров важно, потому что новые графические процессоры идут на Ежегодный каденцияи более старые модели, развернутые En-Masse, никуда не денутся. Возможность распространять рабочие нагрузки между различными видами графических процессоров является важным шагом.

Read more:  Генеральный директор Intel Lip-Bu Tan вызывает «дезинформацию» после того, как Трамп требует, чтобы он ушел в отставку, сообщаемые связи с китайскими военными

Intel входит в игру GPU

В прошлом Intel оставался стойким, что не нужен графический процессор для машинного обучения. Действительно, материалы, использующие процессор Intel Xeon, все еще выполнялись наравне с NVIDIA L4 на эталоне обнаружения объекта, но тянулись на Рекомендованная система эталон.

В этом раунде впервые также показал графический процессор Intel. А Intel Arc Pro был впервые выпущен в 2022 году. В представлении MLPERF была представлена графика Карта под названием MaxSun Intel Arc Pro B60 Dual 48G Turbo который содержит два графических процессора и 48 гигабайт памяти. Система выполнялась на первом месте с L40S NVIDIA на небольшом эталонном эталоне LLM и тянула ее на тесте Llama2-70B.

Из статей вашего сайта

Связанные статьи в Интернете

2025-09-10 15:00:00


1757576912
#Nvidias #Blackwell #Ultra #доминирует #выводе #Mlperf

Ещё по этой теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.