Технология искусственного интеллекта может сжать память разговоров чат-бота LLM в 3–4 раза

Фото: Google DeepMind от Pexels

Инженерный колледж Сеульского национального университета объявил, что исследовательская группа под руководством профессора Хён О Сон с факультета компьютерных наук и инженерии разработала новую технологию искусственного интеллекта под названием KVzip, которая интеллектуально сжимает память разговоров чат-ботов на основе большой языковой модели (LLM), используемых в долгоконтекстных задачах, таких как расширенный диалог и обобщение документов. Исследование опубликовано на arXiv сервер препринтов.

Термин «память разговора» относится к временному хранению предложений, вопросов и ответов, которые чат-бот сохраняет во время взаимодействия и использует для генерации контекстуально последовательных ответов. Используя KVzip, чат-бот может сжимать эту память, удаляя избыточную или ненужную информацию, которая не важна для восстановления контекста. Этот метод позволяет чат-боту сохранять точность, уменьшая при этом размер памяти и ускоряя генерацию ответов, что является важным шагом вперед в создании эффективных и масштабируемых диалоговых систем искусственного интеллекта.

Современные чат-боты LLM выполняют такие задачи, как ведение диалога, кодирование и ответы на вопросы, используя огромные контексты, которые могут охватывать сотни или даже тысячи страниц. Однако по мере того, как разговоры становятся длиннее, накопленная память разговоров увеличивает вычислительные затраты и замедляет время ответа.

Чтобы решить эту проблему, исследователи разработали методы сжатия памяти, которые позволяют чат-ботам сохранять только важную контекстную информацию, а не хранить все детали предыдущего обмена сообщениями. Однако большинство существующих методов сжатия зависят от запроса, то есть оптимизируют память только для текущего вопроса. Когда задается новый или дополнительный вопрос, производительность чат-бота обычно значительно ухудшается.

Чтобы преодолеть это ограничение, команда профессора Сонга предложила KVzip, новый метод, который эффективно уменьшает размер памяти разговоров в диалогах с длинным контекстом, сохраняя при этом тот же уровень точности. KVzip выполняет сжатие, сохраняя только информацию, необходимую для реконструкции контекста, позволяя чат-боту обрабатывать несколько будущих запросов без необходимости каждый раз повторно сжимать свою память.

В широком спектре задач, включая ответы на вопросы, извлечение информации, рассуждение и понимание кода, KVzip добился сокращения памяти в 3–4 раза и примерно в 2 раза более быстрого времени отклика, и все это без потери точности. Этот метод также продемонстрировал масштабируемость для чрезвычайно длинных контекстов до 170 000 токенов с использованием основных LLM с открытым исходным кодом, таких как Llama 3.1, Qwen 2.5 и Gemma 3.

Более того, KVzip поддерживал стабильное качество ответов при нескольких раундах разнообразных дополнительных вопросов, преодолевая ограничения обобщения предыдущих методов сжатия памяти. Примечательно, что эта технология была интегрирована в библиотеку сжатия KV-кеша NVIDIA с открытым исходным кодом, KVPress, что делает ее легко доступной для практического внедрения.

Ожидается, что в ближайшем будущем KVzip получит широкое распространение в системах LLM корпоративного масштаба, включая конвейеры генерации с расширенным поиском (RAG) и персонализированные службы чат-ботов. Сокращая использование памяти в 3–4 раза и сокращая задержку ответа примерно в 2 раза, этот метод позволяет серверам обрабатывать больше одновременных пользователей и более длительные разговоры, одновременно значительно снижая эксплуатационные расходы.

Исследователи SNU разрабатывают технологию искусственного интеллекта, которая сжимает «память разговоров» чат-бота LLM в 3–4 раза

В ходе долгих разговоров чат-боты генерируют большие «воспоминания о разговорах» (KV). KVzip выборочно сохраняет только информацию, полезную для любого будущего вопроса, автономно проверяя и сжимая свою память для эффективного повторного использования. Фото: Инженерный колледж Сеульского национального университета / Лаборатория Хён О Сон.

Кроме того, поскольку одну и ту же сжатую память можно повторно использовать для разных типов запросов, нет необходимости повторно сжимать каждый вопрос и нет риска снижения точности при последующих обменах. Эти свойства делают KVzip особенно выгодным для мобильных и периферийных сред, где вычислительные ресурсы и ресурсы памяти ограничены, обеспечивая стабильные возможности персонализации в длинном контексте даже на устройстве.

Профессор Хён О Сон, который консультировал исследование, заявил: «KVzip важен тем, что позволяет повторно использовать сжатые файлы. память который сохраняет только самую важную информацию, даже в агентах LLM, требующих длительного контекстуального понимания».

Доктор Джанг-Хюн Ким, который является основным участником проекта, заявил: «KVzip можно легко применять к реальным приложениям LLM и системам на устройствах, чтобы обеспечить стабильное качество и повышенную скорость для долгоконтекстного взаимодействия».

Первый автор, доктор Чан-Хюн Ким, присоединится к команде AI/ML Foundation Models в Apple в качестве исследователя машинного обучения.

Лаборатория машинного обучения под руководством профессора Сонга также представила два дополнительных доклада, принятых в качестве стендовых докладов на конференции. НейрИПС 2025 и одна статья, опубликованная в журнале Сделки по исследованиям машинного обучения (TMLR).

В статье NeurIPS 2025 под названием «Q-Palette: дробно-битовые квантователи на пути к оптимальному распределению битов для эффективного развертывания LLM» команда представлен теоретический анализ оптимального распределения битовой ширины между слоями при квантовании больших языковых моделей и представил «Q-Palette», набор квантователей дробных битов, которые реализуют это оптимальное распределение.

Этот метод позволил повысить скорость вывода на 36% по сравнению с существующими подходами к квантованию при эквивалентных уровнях производительности.

Еще один документ NeurIPS 2025: «Обучение лучшему поиску с помощью языковых моделей посредством управляемого усиленного самообучения». предложенный Guided-ReST, новый алгоритм обучения с подкреплением, который позволяет большим языковым моделям автономно изучать улучшенные стратегии рассуждения и поиска. В сложном тесте рассуждений «Обратный отсчет» Guided-ReST повысил точность на 10 %, а эффективность рассуждений — на 50 %.

Кроме того, команда ТМЛР документ «Крупномасштабное целенаправленное обнаружение причин посредством обучения на смоделированных данных», представил контролируемый метод причинного вывода для эффективного выявления причинных переменных целевых факторов. Предложенный метод линейно масштабируется в зависимости от количества переменных, что делает его подходящим для крупномасштабных систем и обеспечивает современную эффективность обнаружения причинно-следственных связей в тестах сетей регуляции генов.

Дополнительная информация:
Джанг-Хюн Ким и др., KVzip: независимое от запросов сжатие KV-кэша с реконструкцией контекста, arXiv (2025). DOI: 10.48550/arxiv.2505.23416

Deokjae Lee и др., Q-Palette: дробно-битовые квантователи для оптимального распределения битов для эффективного развертывания LLM, arXiv (2025). DOI: 10.48550/arxiv.2509.20214.

Сынён Мун и др. «Обучение более эффективному поиску с помощью языковых моделей посредством управляемого усиленного самообучения», arXiv (2024). DOI: 10.48550/arxiv.2410.02992.

Джанг-Хюн Ким и др. «Крупномасштабное целенаправленное обнаружение причин посредством обучения на основе смоделированных данных», arXiv (2024). DOI: 10.48550/arxiv.2408.16218.

Информация журнала:
arXiv


Цитирование: Технология искусственного интеллекта может сжимать память разговоров чат-бота LLM в 3–4 раза (2025 г., 7 ноября). Получено 7 ноября 2025 г. с https://techxplore.com/news/2025-11-ai-tech-compress-llm-chatbot.html.

Этот документ защищен авторским правом. За исключением любых добросовестных сделок в целях частного изучения или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Содержимое предоставлено исключительно в информационных целях.

2025-11-07 16:08:00


1762563501
#Технология #искусственного #интеллекта #может #сжать #память #разговоров #чатбота #LLM #раза

Читайте также

Read more:  Цифровые инновации и управление не исключают друг друга – они неразрывно связаны.

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.