Новая технология Nvidia сокращает затраты на рассуждения LLM в 8 раз без потери точности
Исследователи из Nvidia разработали метод, который может сократить затраты памяти на рассуждения на основе больших языковых моделей до восьми раз. Их техника, названная динамическое разрежение памяти (DMS), сжимает кеш ключевого значения (KV), LLM временной памяти генерируют и сохраняют по мере обработки подсказок и анализа проблем и документов. Хотя исследователи и раньше предлагали различные методы сжатия … Read more