NVIDIA Dynamo Planner обеспечивает автоматизацию на основе SLO для вывода LLM на нескольких узлах

1769853413
2026-01-31 09:00:00

Microsoft и NVIDIA опубликовали вторую часть совместной работы по использованию NVIDIA Dynamo для вывода больших языковых моделей Служба Azure Kubernetes (АКС). Первое объявление было направлено на достижение пропускной способности 1,2 миллиона токенов в секунду в распределенных сетях. графический процессор системы. Теперь этот последний выпуск направлен на то, чтобы помочь разработчикам работать быстрее и повысить эффективность работы. Это достигается за счет автоматического планирования ресурсов и функций динамического масштабирования.

Новые возможности основаны на двух интегрированных компонентах: Профилировщик Планировщика Динамо и основанный на SLO Планировщик Динамо. Эти инструменты работают вместе, чтобы решить проблему «сопоставления ставок» при дезагрегированном обслуживании. Команды используют этот термин, когда разделяют рабочую нагрузку по выводу. Они отделяют операции предварительного заполнения, обрабатывающие входной контекст, от операций декодирования, генерирующих выходные токены. Эти задачи выполняются в разных пулах графических процессоров. Без подходящих инструментов команды тратят много времени на определение оптимального распределения графического процессора на этих этапах.

Dynamo Planner Profiler — это инструмент моделирования перед развертыванием. Автоматизирует поиск лучших конфигураций. Разработчики могут не тестировать вручную различные стратегии распараллеливания и количество графических процессоров, экономя часы использования графического процессора. Вместо этого они определяют свои потребности в DynamoGraphDeploymentRequest (DGDR) манифест. Профилировщик запускает автоматизированный мести конфигурационного пространства. Он тестирует различные размеры тензорного параллелизма как на этапе предварительного заполнения, так и на этапе декодирования. Это помогает найти настройки, которые повышают пропускную способность, сохраняя при этом пределы задержки.

Профилировщик включает режим AI-конфигуратора, который может моделировать производительность примерно за 20–30 секунд на основе предварительно измеренных данных о производительности. Эта возможность позволяет командам быстро изменять конфигурации перед выделением физических ресурсов графического процессора. Результат дает настроенную настройку для усиления того, что команды называют “ГудпутЭто максимально возможная пропускная способность при сохранении установленных ограничений для времени появления первого токена и задержки между токенами.

Read more:  Цвет Cosmic Orange на некоторых моделях Apple iPhone 17 Pro становится розовым.

Как только система поступает в производство, Dynamo Planner на базе SLO берет на себя функции механизма оркестрации среды выполнения. Этот компонент поддерживает LLM, что означает, что, в отличие от традиционных балансировщиков нагрузки, он следит за состоянием кластера. Он отслеживает такие вещи, как загрузка кэша «ключ-значение» в пуле декодирования и глубину очереди предварительного заполнения. Планировщик использует границы производительности профилировщика для масштабирования исполнителей предварительного заполнения и декодирования. Это помогает достичь целей уровня обслуживания по мере изменения структуры трафика.

Объявление иллюстрирует эти возможности посредством подробного сценария помощника авиакомпании. В этом случае Qwen3-32B-FP8 Модель поддерживает мобильное приложение авиакомпании. Он следует строгим соглашениям об уровне обслуживания: 500 миллисекунд для времени до первого токена и 30 миллисекунд для задержки между токенами. Во время обычных операций с короткими запросами пассажиров система работает с одним исполнителем предварительного заполнения и одним исполнителем декодирования. Когда из-за погодных условий 200 пользователей отправляют сложные запросы на изменение маршрута, Планировщик замечает всплеск. Затем он масштабируется до двух рабочих процессов предварительного заполнения, но сохраняет одного рабочего процесса декодирования. Команды сообщают, что новый работник подключается к сети в течение нескольких минут, что позволяет системе поддерживать целевые показатели задержки во время пика трафика.

Переход от ручной настройки к автоматизированному управлению ресурсами на основе SLO показывает, как команды могут лучше справляться с развертыванием больших языковых моделей в Kubernetes. Компоненты Planner предоставляют инструменты, которые превращают потребности в задержке в варианты распределения и масштабирования графического процессора. Это направлено на снижение операционной нагрузки, связанной с запуском дезагрегированных архитектур вывода. Инструменты автоматизации могут помочь организациям с трудоемкими рассуждениями или долгосрочными программами LLM. Они упрощают управление сложными многоузловыми настройками графического процессора. Они также поддерживают достижение целей уровня обслуживания при изменении структуры трафика.

Read more:  Новые правила проверки приложений Apple запрещают приложениям передавать личные данные «стороннему искусственному интеллекту»

#NVIDIA #Dynamo #Planner #обеспечивает #автоматизацию #на #основе #SLO #для #вывода #LLM #на #нескольких #узлах

Продолжение темы

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.