Dash Scheduling обеспечивает на 37,9% более высокую воспроизводимую производительность обучения LLM

1770146278
2026-02-03 19:05:00

Исследователи решают важнейшую задачу обучения моделям большого языка (LLM): поддержание воспроизводимости без ущерба для производительности. Синьвэй Цян, Хунминь Чен и Шисюань Сан из Шанхайского университета Цзяо Тонг и ByteDance Seed вместе с Цзинвэнь Ленг, Синь Лю и Миньи Го и др. демонстрируют, что детерминированное внимание, необходимое для стабильных результатов, может значительно снизить производительность обучения, на целых 37,9% в некоторых реализациях. Их работа представляет DASH (детерминированное планирование внимания для высокой пропускной способности), новый подход, который формулирует детерминированное внимание как задачу планирования и создает графики, минимизирующие вычислительные узкие места. Оптимизируя порядок операций, DASH заметно повышает пропускную способность до 1,28 раза, что представляет собой существенный шаг на пути к эффективному и воспроизводимому обучению LLM.

Команда решила критическую проблему в обучении LLM: значительные затраты на производительность, связанные с обеспечением детерминированных, поразрядно идентичных результатов при нескольких запусках. В широко используемых реализациях внимания, таких как FlashAttention-3, включение детерминированных обратных проходов может снизить пропускную способность до 37,9% из-за сериализации операций накопления градиента, необходимых для числовой согласованности. Эта потеря производительности возникает из-за неэффективного планирования этапов вычислений и уменьшения градиента, что приводит к недостаточному использованию аппаратных ресурсов.

Исследователи сформулировали обратный проход детерминированного внимания как задачу планирования на направленном ациклическом графе (DAG), создав графики, предназначенные для минимизации длины критического пути. Основываясь на этой формулировке, они представляют DASH (детерминированное планирование внимания для высокой пропускной способности), структуру, включающую две взаимодополняющие стратегии планирования. Первый, нисходящая итерация Q-Tile, использует обратный обход блоков запроса для уменьшения простоев конвейера, особенно при причинном внимании. Второй, «Планирование смен», представляет собой теоретически оптимальный график в модели DAG, уменьшающий простои конвейера как для масок полного, так и для причинно-следственных масок внимания.
Этот инновационный подход решает основную проблему согласования исполнения плиток с порядком накопления — несовпадение, которое считается основной причиной снижения производительности. Эмпирические оценки, проведенные на графических процессорах NVIDIA H800, показывают, что DASH эффективно сокращает разрыв в производительности детерминированного внимания. Предложенные стратегии улучшают пропускную способность обратного прохождения внимания до 1,28× по сравнению с исходным уровнем, что представляет собой значительный прогресс в эффективности воспроизводимого обучения LLM. Это улучшение достигается за счет распараллеливания процесса сокращения, что позволяет CTA одновременно начинать сокращение на разных плитках, тем самым избегая узких мест, вызванных последовательными операциями.

Read more:  «Европейский центр как инструмент суверенитета, главный герой Италии в Болонском технополе»

Эта работа устанавливает новый стандарт для детерминированного обучения LLM, предлагая путь к более эффективной и надежной разработке крупномасштабных моделей. Исследование показывает, что разрыв в производительности не связан с сериализацией, а является следствием неоптимального планирования плиток и жесткого порядка накопления. Смоделировав детерминированный обратный проход как DAG, команда смогла разработать стратегии, которые оптимизируют длину критического пути, обеспечивая более сбалансированную рабочую нагрузку и уменьшая конфликты во время операций последовательного сокращения. Эта формализация на основе DAG представляет собой новый вклад, позволяющий принципиально оптимизировать процесс планирования. Открытый исходный код кода DASH облегчает дальнейшие исследования и внедрение в сообществе LLM.

Планирование DAG оптимизирует обратные проходы детерминированного внимания

Ученые рассмотрели ограничения производительности детерминированного внимания при обучении больших языковых моделей, что является решающим аспектом воспроизводимости. Исследовательская группа обнаружила, что детерминированные обратные проходы в реализациях внимания, таких как FlashAttention-3, могут привести к снижению пропускной способности до 37,9% по сравнению с недетерминированными аналогами из-за сериализации накопления градиента. Чтобы преодолеть эту проблему, они сформулировали обратный проход детерминистического внимания как задачу планирования на направленном ациклическом графе (DAG), стремясь минимизировать длину критического пути. Этот инновационный подход позволил разработать DASH (детерминированное планирование внимания для высокой пропускной способности), включающее две взаимодополняющие стратегии.

Ядро DASH лежит в нисходящей итерации Q-Tile, обратном обходе блоков запросов, предназначенном для уменьшения простоев конвейера, особенно в механизмах причинного внимания. Исследователи разработали этот метод для сокращения простоев конвейера за счет обработки блоков запросов в обратном порядке, оптимизации потока данных и уменьшения зависимостей. В дополнение к этому, график смен был разработан как теоретически оптимальный график в рамках модели DAG, уменьшающий простои конвейера как для масок полного, так и для причинно-следственных масок внимания. В экспериментах использовались графические процессоры NVIDIA H800, CUDA 12.6 и Triton 3.4, причем все ядра были реализованы путем расширения реализации FlashAttention-3.

Базовые сравнения проводились с детерминистическим обратным проходом FlashAttention-3 и реализацией причинного внимания из руководства Triton. В исследовании оценивалась производительность с фиксированным общим числом 16 384 токенов, различной длиной последовательности от 512 до 16 384, а также тестировались скрытые измерения 2048 с размерами головы 64 и 128, все с использованием прецизионных случайных входных данных BF16. Результаты показали, что DASH улучшил пропускную способность обратного прохождения внимания до 1,28 по сравнению с исходным уровнем, что значительно повысило эффективность воспроизводимого обучения LLM. Детальный анализ показал, что при длине последовательности 16 384 и размере блока KV 128 вычисления распределялись по 128 потоковым мультипроцессорам (SM).

Read more:  Совершите революцию в розничной торговле на основе искусственного интеллекта с помощью группы решений и услуг Lenovo.

Команда заметила, что ограничивающим фактором стала задержка связи между SM, особенно при доступе к удаленным сегментам кэша L2, составляющая от 200 до более 500 циклов. Хотя сложный граф зависимостей Shift Scheduling давал вычислительные преимущества, он оказался более чувствительным к издержкам связи при крайнем параллелизме, иногда демонстрируя небольшое снижение производительности. Для масок причинного внимания как нисходящая итерация Q-Tile, так и планирование симметричных сдвигов последовательно улучшают пропускную способность, при этом планирование симметричных сдвигов демонстрирует превосходную балансировку рабочей нагрузки при размере головы 64.

Планирование DASH повышает производительность детерминированного обучения LLM

Ученые разработали новую структуру планирования DASH (детерминированное планирование внимания для высокой пропускной способности), чтобы устранить узкие места в производительности при обучении детерминированной модели большого языка (LLM). Детерминированное обучение, имеющее решающее значение для воспроизводимости, часто приводит к значительным потерям производительности: снижение пропускной способности до 37,9% наблюдается в широко используемых реализациях внимания, таких как FlashAttention-3. Эти потери возникают из-за сериализации операций накопления градиента для обеспечения числовой согласованности, что приводит к недостаточному использованию оборудования. Исследователи сформулировали обратный проход детерминированного внимания как задачу планирования направленного ациклического графа (DAG) для минимизации длины критического пути.

Эксперименты показали, что DASH сокращает разрыв в производительности детерминированного внимания, повышая пропускную способность до 1,28 по сравнению с базовым уровнем. Команда измерила это улучшение на графических процессорах NVIDIA H800, продемонстрировав существенное повышение эффективности воспроизводимого обучения LLM. Этот прорыв обеспечивает значительное ускорение обратного прохода детерминированного внимания, решая ключевую проблему масштабирования LLM на тысячи графических процессоров. Данные показывают, что снижение производительности в детерминированном FlashAttention происходит из-за несогласованности между выполнением фрагментов и порядком накопления, что создает узкие места в процессе сокращения.

В работе представлены две взаимодополняющие стратегии планирования: нисходящая итерация Q-плитки и планирование смен. Нисходящая итерация Q-Tile, обратный обход блока запроса, сокращает остановки конвейера при причинном внимании, а планирование сдвига, теоретически оптимальный алгоритм в модели DAG, уменьшает остановки конвейера как для полной, так и для причинной маски. Измерения подтверждают, что планирование смен использует поэтапное распределение вычислительных задач, создавая идеально шахматный шаблон выполнения и приближаясь к теоретическому пределу использования модели. Тесты доказывают, что DASH эффективно распараллеливает процесс сокращения, позволяя CTA одновременно начинать сокращение на разных плитках, в отличие от простого расписания, которое требует последовательного сокращения. Исследование показало, что основным источником снижения производительности при детерминированном внимании является несогласованность между выполнением тайлов и порядком накопления. Следовательно, исследование обеспечивает формализацию обратного планирования детерминированного внимания на основе DAG, что позволяет принципиальную оптимизацию длины критического пути и, в конечном итоге, повышает эффективность обучения LLM.

Read more:  Все игры, выходящие в сентябре 2025 года на PS5, Xbox, Nintendo Switch и ПК | Киберспортивные новости

Фреймворк DASH ускоряет детерминированное внимание к графическим процессорам

Ученые рассмотрели проблему снижения производительности, связанную с детерминированными обратными проходами в механизмах внимания, что является важнейшим аспектом обучения модели большого языка (LLM). Они сформулировали вычисления как задачу планирования на направленном ациклическом графе (DAG), представив DASH, структуру с двумя стратегиями планирования: нисходящая итерация Q-тайла и планирование сдвига. Нисходящая итерация Q-Tile ускоряет внимание к причинно-следственным связям за счет обратного обхода блоков запросов, в то время как планирование сдвига направлено на теоретически оптимальное расписание в модели DAG, чтобы уменьшить остановки конвейера как для полных, так и для причинных масок. Эмпирические оценки графических процессоров H800 показали, что DASH значительно сокращает разрыв в производительности детерминированного внимания, повышая пропускную способность почти в 1,28 раза по сравнению с базовыми методами.

Это достижение способствует более эффективному и воспроизводимому обучению LLM. Авторы признают, что теоретическая оптимальность не всегда приводит к практическому превосходству, определяя аппаратные ограничения, такие как давление регистров и задержка связи между SM, как критические факторы, влияющие на производительность. В будущих работах можно будет изучить дальнейшую оптимизацию с учетом этих аппаратных реалий. Исследование подчеркивает важность совместной оптимизации порядка выполнения и накопления, а не сосредоточения внимания исключительно на пропускной способности или памяти. Предоставляя набор решений, DASH позволяет специалистам-практикам достигать высокой производительности внимания, сохраняя при этом воспроизводимость обучения LLM. Результаты показывают, что для максимизации производительности в этой области необходим детальный подход, балансирующий теоретическую оптимальность с практическими аппаратными ограничениями.

#Dash #Scheduling #обеспечивает #на #более #высокую #воспроизводимую #производительность #обучения #LLM

Ещё по этой теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.