1773307160
2026-03-12 09:00:00
Команда Azure Kubernetes Service (AKS) в Microsoft поделилась руководство для запуска управляемого Anyscale Рэй обслуживание в масштабе. Они сосредоточены на трех ключевых проблемах: ограничения мощности графического процессора, разбросанное хранилище ML и проблемы с истечением срока действия учетных данных.
Ray — это платформа распределенных вычислений на основе Python, предназначенная для масштабирования рабочих нагрузок искусственного интеллекта и машинного обучения с одного ноутбука до кластеров, охватывающих тысячи узлов. Управляемая платформа Anyscale расширяет возможности Ray, добавляя функции для производственного использования. Новое руководство демонстрирует партнерство между Microsoft и Anyscale для улучшения интеграции с Azure.
Нехватка графических процессоров — одна из наиболее серьезных операционных проблем в крупномасштабном машинном обучении. Ускорители с высоким спросом, такие как графические процессоры NVIDIA, часто имеют проблемы с квотами и доступностью в регионах Azure. Это может задержать настройку кластера и планирование заданий.
В предложенном Microsoft решении используется многокластерная и многорегиональная установка. Распределение кластеров Ray по разным экземплярам AKS в различных регионах Azure позволяет командам: агрегировать квоту графического процессора за пределами региональных ограничений, автоматически перенаправлять рабочие нагрузки во время сбоев или проблем с емкостью, а также расширять пул вычислений на локальные системы или других облачных поставщиков с помощью Azure Arc с AKS.
Консоль Anyscale отображает эти зарегистрированные кластеры в одном представлении. Anyscale Workspaces управляет планированием рабочей нагрузки, используя доступную мощность, вручную или автоматически. Вы можете добавить новые регионы, создав манифест cloud_resource.yaml. Затем примените его с помощью интерфейса командной строки Anyscale. Такой подход, ориентированный на настройку, упрощает управление расширением нескольких регионов.
Распространенной проблемой в операциях машинного обучения является передача обучающих данных, контрольных точек модели и артефактов между этапами конвейера. Это включает в себя переход от предварительного обучения к точной настройке, а затем к выводу. В руководстве эта проблема решается с помощью Azure BlobFuse2, которая подключает хранилище BLOB-объектов Azure к рабочим модулям Ray как POSIX-совместимую файловую систему.
С точки зрения Рэя, точка монтирования — это просто локальный каталог. Задачи и субъекты читают наборы данных и записывают контрольные точки, используя стандартный файловый ввод-вывод. Затем BlobFuse2 сохраняет данные в хранилище BLOB-объектов Azure. Это делает данные доступными для модулей и пулов узлов. Локальное кэширование предотвращает зависание графического процессора во время больших обучающих запусков, а поскольку данные отделены от вычислений, кластеры Ray могут масштабироваться вверх и вниз без потери данных.
Еще одна важная тема — надежность аутентификации. Anyscale и Azure используются для интеграции с токенами CLI или ключами API, срок действия которых истекает каждые 30 дней. Это означало, что требовалась ручная ротация, что грозило сбоем в обслуживании.
Новый метод использует Вход в Майкрософт субъекты службы и удостоверение рабочей нагрузки AKS. Он автоматически выпускает недолговечные токены. Модуль оператора Anyscale Kubernetes использует управляемое удостоверение, назначаемое пользователем. Это удостоверение запрашивает токен доступа для субъекта-службы Anyscale у Entra ID. Azure обрабатывает обновление токенов прозрачно, то есть в кластере не хранятся долгосрочные учетные данные и не требуется ручная ротация.
Авторы говорят, что это особенно важно в многокластерных средах. В данном случае ручное управление учетными данными во многих кластерах увеличивает операционную нагрузку. Модель идентификации рабочей нагрузки обеспечивает детальный RBAC для доступа к ресурсам Azure и в качестве побочного продукта создает полные журналы аудита через журналы активности Azure.
Интеграция Anyscale с AKS в настоящее время находится в закрытой предварительной версии. Команды, желающие получить доступ, должны обратиться к своей команде по работе с клиентами Microsoft. Они также могут отправить запрос в репозиторий AKS GitHub. Включите подробную информацию о рабочих нагрузках Ray и целевых регионах. Вы можете просмотреть примеры настроек и рабочих нагрузок для точной настройки с помощью DeepSpeed и LLaMA-Factory в разделе Azure-Samples/aks-anyscale репозиторий на GitHub. Сюда также входят конечные точки вывода LLM.
Microsoft — не единственная организация, делающая такую ставку. АВС объявлено партнерство с Anyscale на Ray Summit 2024. Оно соединяет кластеры EKS со средой выполнения RayTurbo. Он подчеркивает гибкость оборудования за счет сочетания графических процессоров NVIDIA с ускорителями AWS Trainium и Inferentia. Кроме того, SageMaker HyperPod теперь является целью развертывания для длительных учебных заданий, требующих устойчивости на уровне узла. Google Cloud лидирует по количеству проектов с открытым исходным кодом.
Команда ГКЭ работал с инженерами Anyscale для внедрения планирования на основе меток в Ray v2.49. Они также создали слой ray.util.tpu для уменьшения фрагментации ресурсов в многочиповых конфигурациях TPU. Кроме того, они добавили динамическое распределение ресурсов для новых экземпляров с поддержкой GB200.
Все три гиперскалера выбрали одного и того же оператора управляемых лучей, и каждый добавил свою инфраструктуру. Это показывает, что отрасль предпочитает Kubernetes-plus-Ray для рабочих нагрузок ИИ. Теперь конкуренция заключается не столько во времени выполнения, сколько в том, какое облако сможет лучше всего оптимизировать окружающую инфраструктуру.
#Бегущий #луч #масштабе #на #AKS
Читайте также

