Бегущий луч в масштабе на AKS

1773307160
2026-03-12 09:00:00

Команда Azure Kubernetes Service (AKS) в Microsoft поделилась руководство для запуска управляемого Anyscale Рэй обслуживание в масштабе. Они сосредоточены на трех ключевых проблемах: ограничения мощности графического процессора, разбросанное хранилище ML и проблемы с истечением срока действия учетных данных.

Ray — это платформа распределенных вычислений на основе Python, предназначенная для масштабирования рабочих нагрузок искусственного интеллекта и машинного обучения с одного ноутбука до кластеров, охватывающих тысячи узлов. Управляемая платформа Anyscale расширяет возможности Ray, добавляя функции для производственного использования. Новое руководство демонстрирует партнерство между Microsoft и Anyscale для улучшения интеграции с Azure.

Нехватка графических процессоров — одна из наиболее серьезных операционных проблем в крупномасштабном машинном обучении. Ускорители с высоким спросом, такие как графические процессоры NVIDIA, часто имеют проблемы с квотами и доступностью в регионах Azure. Это может задержать настройку кластера и планирование заданий.

В предложенном Microsoft решении используется многокластерная и многорегиональная установка. Распределение кластеров Ray по разным экземплярам AKS в различных регионах Azure позволяет командам: агрегировать квоту графического процессора за пределами региональных ограничений, автоматически перенаправлять рабочие нагрузки во время сбоев или проблем с емкостью, а также расширять пул вычислений на локальные системы или других облачных поставщиков с помощью Azure Arc с AKS.

Консоль Anyscale отображает эти зарегистрированные кластеры в одном представлении. Anyscale Workspaces управляет планированием рабочей нагрузки, используя доступную мощность, вручную или автоматически. Вы можете добавить новые регионы, создав манифест cloud_resource.yaml. Затем примените его с помощью интерфейса командной строки Anyscale. Такой подход, ориентированный на настройку, упрощает управление расширением нескольких регионов.

Распространенной проблемой в операциях машинного обучения является передача обучающих данных, контрольных точек модели и артефактов между этапами конвейера. Это включает в себя переход от предварительного обучения к точной настройке, а затем к выводу. В руководстве эта проблема решается с помощью Azure BlobFuse2, которая подключает хранилище BLOB-объектов Azure к рабочим модулям Ray как POSIX-совместимую файловую систему.

Read more:  Как бесплатно смотреть «Ягуары против дельфинов»

С точки зрения Рэя, точка монтирования — это просто локальный каталог. Задачи и субъекты читают наборы данных и записывают контрольные точки, используя стандартный файловый ввод-вывод. Затем BlobFuse2 сохраняет данные в хранилище BLOB-объектов Azure. Это делает данные доступными для модулей и пулов узлов. Локальное кэширование предотвращает зависание графического процессора во время больших обучающих запусков, а поскольку данные отделены от вычислений, кластеры Ray могут масштабироваться вверх и вниз без потери данных.

Еще одна важная тема — надежность аутентификации. Anyscale и Azure используются для интеграции с токенами CLI или ключами API, срок действия которых истекает каждые 30 дней. Это означало, что требовалась ручная ротация, что грозило сбоем в обслуживании.

Новый метод использует Вход в Майкрософт субъекты службы и удостоверение рабочей нагрузки AKS. Он автоматически выпускает недолговечные токены. Модуль оператора Anyscale Kubernetes использует управляемое удостоверение, назначаемое пользователем. Это удостоверение запрашивает токен доступа для субъекта-службы Anyscale у Entra ID. Azure обрабатывает обновление токенов прозрачно, то есть в кластере не хранятся долгосрочные учетные данные и не требуется ручная ротация.

Авторы говорят, что это особенно важно в многокластерных средах. В данном случае ручное управление учетными данными во многих кластерах увеличивает операционную нагрузку. Модель идентификации рабочей нагрузки обеспечивает детальный RBAC для доступа к ресурсам Azure и в качестве побочного продукта создает полные журналы аудита через журналы активности Azure.

Интеграция Anyscale с AKS в настоящее время находится в закрытой предварительной версии. Команды, желающие получить доступ, должны обратиться к своей команде по работе с клиентами Microsoft. Они также могут отправить запрос в репозиторий AKS GitHub. Включите подробную информацию о рабочих нагрузках Ray и целевых регионах. Вы можете просмотреть примеры настроек и рабочих нагрузок для точной настройки с помощью DeepSpeed и LLaMA-Factory в разделе Azure-Samples/aks-anyscale репозиторий на GitHub. Сюда также входят конечные точки вывода LLM.

Read more:  Практическая серия Gigabyte Ice, имеет эстетику и производительность для настройки игрового ПК

Microsoft — не единственная организация, делающая такую ставку. АВС объявлено партнерство с Anyscale на Ray Summit 2024. Оно соединяет кластеры EKS со средой выполнения RayTurbo. Он подчеркивает гибкость оборудования за счет сочетания графических процессоров NVIDIA с ускорителями AWS Trainium и Inferentia. Кроме того, SageMaker HyperPod теперь является целью развертывания для длительных учебных заданий, требующих устойчивости на уровне узла. Google Cloud лидирует по количеству проектов с открытым исходным кодом.

Команда ГКЭ работал с инженерами Anyscale для внедрения планирования на основе меток в Ray v2.49. Они также создали слой ray.util.tpu для уменьшения фрагментации ресурсов в многочиповых конфигурациях TPU. Кроме того, они добавили динамическое распределение ресурсов для новых экземпляров с поддержкой GB200.

Все три гиперскалера выбрали одного и того же оператора управляемых лучей, и каждый добавил свою инфраструктуру. Это показывает, что отрасль предпочитает Kubernetes-plus-Ray для рабочих нагрузок ИИ. Теперь конкуренция заключается не столько во времени выполнения, сколько в том, какое облако сможет лучше всего оптимизировать окружающую инфраструктуру.

#Бегущий #луч #масштабе #на #AKS

Читайте также

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.