Исследователи из Nvidia разработали метод, который может сократить затраты памяти на рассуждения на основе больших языковых моделей до восьми раз. Их техника, названная динамическое разрежение памяти (DMS), сжимает кеш ключевого значения (KV), LLM временной памяти генерируют и сохраняют по мере обработки подсказок и анализа проблем и документов.
Хотя исследователи и раньше предлагали различные методы сжатия этого кеша, большинству из них трудно сделать это без ухудшения интеллекта модели. Подход Nvidia позволяет отказаться от большей части кэша, сохраняя при этом (а в некоторых случаях улучшая) возможности рассуждения модели.
Эксперименты показывают, что DMS позволяет специалистам LLM «думать» дольше и исследовать больше решений без обычных потерь в скорости или затратах памяти.
Узкое место рассуждения
LLM улучшают свою производительность при выполнении сложных задач, генерируя «цепочка мыслей«токены, по сути, записывающие шаги рассуждения, прежде чем прийти к окончательному ответу. Методы масштабирования времени вывода используют это, предоставляя модели больший бюджет для генерации этих токенов мышления или для параллельного исследования нескольких потенциальных путей рассуждения.
Однако это улучшенное рассуждение требует значительных вычислительных затрат. По мере того как модель генерирует больше токенов, она создает КВ-кэш.
Для реальных приложений кэш KV является основным узким местом. По мере роста цепочки рассуждений кэш растет линейно, потребляя огромные объемы памяти графических процессоров. Это заставляет оборудование тратить больше времени на чтение данных из памяти, чем на фактические вычисления, что замедляет генерацию и увеличивает задержку. Это также ограничивает количество пользователей, которые система может обслуживать одновременно, поскольку нехватка видеопамяти приводит к сбою системы или замедлению ее работы.
Исследователи Nvidia называют это не просто техническим препятствием, но и фундаментальным экономическим препятствием для предприятия.
«Вопрос не только в количестве оборудования; речь идет о том, обрабатывает ли ваша инфраструктура 100 потоков рассуждений или 800 потоков за ту же цену», — сказал VentureBeat Петр Наврот, старший инженер по глубокому обучению в Nvidia.
Предыдущие попытки решить эту проблему были сосредоточены на эвристических подходах. В этих методах используются жесткие правила, такие как «скользящее окно», в котором кэшируются только самые последние токены и удаляются остальные. Хотя это снижает использование памяти, часто вынуждает модель отбрасывать важную информацию, необходимую для решения проблемы, что снижает точность вывода.
«Стандартные методы выселения пытаются выбрать старые и неиспользованные токены для выселения с помощью эвристики», — говорят исследователи. «Они упрощают задачу, надеясь, что если они аппроксимируют внутреннюю механику модели, ответ останется правильным».
Другие решения используют подкачку для разгрузки неиспользуемых частей кэша KV в более медленную память, но постоянная замена данных приводит к увеличению задержки, что замедляет работу приложений реального времени.
Динамическое разрежение памяти
DMS использует другой подход, «модернизируя» существующие LLM для интеллектуального управления собственной памятью. Вместо того, чтобы применять фиксированное правило относительно того, что удалять, DMS обучает модель определять, какие токены необходимы для будущих рассуждений, а какие являются одноразовыми.
«Он не просто угадывает важность; он изучает политику, которая явно сохраняет окончательное распределение выходных данных модели», — сказал Наврот.
Этот процесс преобразует стандартный предварительно обученный LLM, такой как Llama 3 или Qwen 3, в самосжимающуюся модель. Важно отметить, что для этого не требуется обучение модели с нуля, что было бы непомерно дорого. Вместо этого DMS переназначает существующие нейроны в слоях внимания модели, чтобы выводить сигнал «сохранить» или «выселить» для каждого токена.
Для команд, обеспокоенных сложностью модернизации, исследователи отметили, что этот процесс спроектирован так, чтобы быть легким. «Чтобы повысить эффективность этого процесса, веса модели можно заморозить, что делает процесс похожим на адаптацию низкого ранга (LoRA)», — сказал Наврот. Это означает, что стандартная корпоративная модель, такая как Qwen3-8B, «может быть модернизирована с помощью DMS в течение нескольких часов на одном DGX H100».
Одной из важных частей ДМС является механизм под названием «отложенное выселение». При стандартной разреженности, если токен считается неважным, он немедленно удаляется. Это рискованно, поскольку модели может потребоваться доля секунды, чтобы интегрировать контекст этого токена в его текущее состояние.
DMS смягчает эту проблему, помечая токен для вытеснения, но сохраняя его доступным в течение короткого периода времени (например, нескольких сотен шагов). Эта задержка позволяет модели «извлечь» всю оставшуюся необходимую информацию из токена и объединить ее с текущим контекстом до того, как токен будет удален из кэша KV.
“Механизм “отложенного выселения” имеет решающее значение, поскольку не все токены просто “важны” (хранятся навсегда) или “бесполезны” (немедленно удаляются). Многие из них находятся между ними — они несут некоторую информацию, но ее недостаточно, чтобы оправдать занятие целого слота в памяти», — сказал Наврот. “В этом и заключается избыточность. Сохраняя эти токены в локальном окне в течение короткого времени перед выселением, мы позволяем модели обслуживать их и перераспределять их информацию в будущие токены”.
Исследователи обнаружили, что этот процесс модернизации очень эффективен. Они могли оснастить предварительно обученного LLM DMS всего за 1000 шагов обучения, что составляет лишь небольшую часть вычислительных ресурсов, необходимых для первоначального обучения. Полученные модели используют стандартные ядра и могут быть добавлены непосредственно в существующие высокопроизводительные стеки вывода без специального оборудования или сложной переписывания программного обеспечения.
ДМС в действии
Чтобы проверить метод, исследователи применили DMS к нескольким моделям рассуждения, включая серию Qwen-R1 (выделенную из DeepSeek R1) и Llama 3.2, и протестировали их на сложных тестах, таких как AIME 24 (математика), GPQA Diamond (наука) и LiveCodeBench (кодирование).
Результаты показывают, что DMS эффективно перемещает границу Парето, обеспечивая оптимальный компромисс между затратами и производительностью. В математическом тесте AIME 24 модель Qwen-R1 32B, оснащенная DMS, набрала на 12,0 баллов больше, чем стандартная модель, при ограничении того же бюджета пропускной способности памяти. Сжимая кэш, модель могла позволить себе «думать» гораздо глубже и шире, чем стандартная модель, при том же объеме памяти и вычислений.
Возможно, самое удивительное, что DMS бросил вызов общепринятому мнению, что сжатие вредит пониманию длинного контекста. В тестах «иголка в стоге сена», которые измеряют способность модели находить определенную часть информации, скрытую в большом документе, варианты DMS фактически превзошли стандартные модели. Активно управляя своей памятью, а не пассивно накапливая шум, модель поддерживала более чистый и полезный контекст.
Для корпоративной инфраструктуры повышение эффективности напрямую приводит к экономии пропускной способности и оборудования. Поскольку кэш-память значительно меньше, графический процессор тратит меньше времени на выборку данных, что сокращает время ожидания для пользователей. В тестах с моделью Qwen3-8B DMS соответствовала точности базовой модели, обеспечивая при этом пропускную способность в 5 раз выше. Это означает, что один сервер может обрабатывать в пять раз больше запросов клиентов в секунду без снижения качества.
Будущее памяти
Nvidia выпустила DMS как часть своего Библиотека КВПресс. Говоря о том, как предприятия могут начать работу с DMS, Наврот подчеркнул, что входной барьер низок. «Минимально жизнеспособная инфраструктура» — это стандартные конвейеры Hugging Face — никаких специальных ядер CUDA не требуется», — сказал Наврот, отметив, что код полностью совместим со стандартным FlashAttention.
Заглядывая в будущее, команда рассматривает DMS как часть более масштабного сдвига, в котором управление памятью станет отдельным интеллектуальным уровнем стека ИИ. Наврот также подтвердил, что DMS «полностью совместима» с новыми архитектурами, такими как Многоголовое скрытое внимание (MLA), используемая в моделях DeepSeek, позволяет предположить, что объединение этих подходов может привести к еще большему повышению эффективности.
По мере того как предприятия переходят от простых чат-ботов к сложным агентным системам, требующим расширенных рассуждений, стоимость умозаключений становится первоочередной проблемой. Такие методы, как DMS, открывают путь к устойчивому масштабированию этих возможностей.
«Мы едва коснулись поверхности того, что возможно», — сказал Наврот, — «и мы ожидаем, что масштабирование времени вывода будет развиваться и дальше».
2026-02-12 22:00:00
1770974615
#Новая #технология #Nvidia #сокращает #затраты #на #рассуждения #LLM #раз #без #потери #точности
Ещё по этой теме

