Фото: Google DeepMind от Pexels
Инженерный колледж Сеульского национального университета объявил, что исследовательская группа под руководством профессора Хён О Сон с факультета компьютерных наук и инженерии разработала новую технологию искусственного интеллекта под названием KVzip, которая интеллектуально сжимает память разговоров чат-ботов на основе большой языковой модели (LLM), используемых в долгоконтекстных задачах, таких как расширенный диалог и обобщение документов. Исследование опубликовано на arXiv сервер препринтов.
Термин «память разговора» относится к временному хранению предложений, вопросов и ответов, которые чат-бот сохраняет во время взаимодействия и использует для генерации контекстуально последовательных ответов. Используя KVzip, чат-бот может сжимать эту память, удаляя избыточную или ненужную информацию, которая не важна для восстановления контекста. Этот метод позволяет чат-боту сохранять точность, уменьшая при этом размер памяти и ускоряя генерацию ответов, что является важным шагом вперед в создании эффективных и масштабируемых диалоговых систем искусственного интеллекта.
Современные чат-боты LLM выполняют такие задачи, как ведение диалога, кодирование и ответы на вопросы, используя огромные контексты, которые могут охватывать сотни или даже тысячи страниц. Однако по мере того, как разговоры становятся длиннее, накопленная память разговоров увеличивает вычислительные затраты и замедляет время ответа.
Чтобы решить эту проблему, исследователи разработали методы сжатия памяти, которые позволяют чат-ботам сохранять только важную контекстную информацию, а не хранить все детали предыдущего обмена сообщениями. Однако большинство существующих методов сжатия зависят от запроса, то есть оптимизируют память только для текущего вопроса. Когда задается новый или дополнительный вопрос, производительность чат-бота обычно значительно ухудшается.
Чтобы преодолеть это ограничение, команда профессора Сонга предложила KVzip, новый метод, который эффективно уменьшает размер памяти разговоров в диалогах с длинным контекстом, сохраняя при этом тот же уровень точности. KVzip выполняет сжатие, сохраняя только информацию, необходимую для реконструкции контекста, позволяя чат-боту обрабатывать несколько будущих запросов без необходимости каждый раз повторно сжимать свою память.
В широком спектре задач, включая ответы на вопросы, извлечение информации, рассуждение и понимание кода, KVzip добился сокращения памяти в 3–4 раза и примерно в 2 раза более быстрого времени отклика, и все это без потери точности. Этот метод также продемонстрировал масштабируемость для чрезвычайно длинных контекстов до 170 000 токенов с использованием основных LLM с открытым исходным кодом, таких как Llama 3.1, Qwen 2.5 и Gemma 3.
Более того, KVzip поддерживал стабильное качество ответов при нескольких раундах разнообразных дополнительных вопросов, преодолевая ограничения обобщения предыдущих методов сжатия памяти. Примечательно, что эта технология была интегрирована в библиотеку сжатия KV-кеша NVIDIA с открытым исходным кодом, KVPress, что делает ее легко доступной для практического внедрения.
Ожидается, что в ближайшем будущем KVzip получит широкое распространение в системах LLM корпоративного масштаба, включая конвейеры генерации с расширенным поиском (RAG) и персонализированные службы чат-ботов. Сокращая использование памяти в 3–4 раза и сокращая задержку ответа примерно в 2 раза, этот метод позволяет серверам обрабатывать больше одновременных пользователей и более длительные разговоры, одновременно значительно снижая эксплуатационные расходы.

В ходе долгих разговоров чат-боты генерируют большие «воспоминания о разговорах» (KV). KVzip выборочно сохраняет только информацию, полезную для любого будущего вопроса, автономно проверяя и сжимая свою память для эффективного повторного использования. Фото: Инженерный колледж Сеульского национального университета / Лаборатория Хён О Сон.
Кроме того, поскольку одну и ту же сжатую память можно повторно использовать для разных типов запросов, нет необходимости повторно сжимать каждый вопрос и нет риска снижения точности при последующих обменах. Эти свойства делают KVzip особенно выгодным для мобильных и периферийных сред, где вычислительные ресурсы и ресурсы памяти ограничены, обеспечивая стабильные возможности персонализации в длинном контексте даже на устройстве.
Профессор Хён О Сон, который консультировал исследование, заявил: «KVzip важен тем, что позволяет повторно использовать сжатые файлы. память который сохраняет только самую важную информацию, даже в агентах LLM, требующих длительного контекстуального понимания».
Доктор Джанг-Хюн Ким, который является основным участником проекта, заявил: «KVzip можно легко применять к реальным приложениям LLM и системам на устройствах, чтобы обеспечить стабильное качество и повышенную скорость для долгоконтекстного взаимодействия».
Первый автор, доктор Чан-Хюн Ким, присоединится к команде AI/ML Foundation Models в Apple в качестве исследователя машинного обучения.
Лаборатория машинного обучения под руководством профессора Сонга также представила два дополнительных доклада, принятых в качестве стендовых докладов на конференции. НейрИПС 2025 и одна статья, опубликованная в журнале Сделки по исследованиям машинного обучения (TMLR).
В статье NeurIPS 2025 под названием «Q-Palette: дробно-битовые квантователи на пути к оптимальному распределению битов для эффективного развертывания LLM» команда представлен теоретический анализ оптимального распределения битовой ширины между слоями при квантовании больших языковых моделей и представил «Q-Palette», набор квантователей дробных битов, которые реализуют это оптимальное распределение.
Этот метод позволил повысить скорость вывода на 36% по сравнению с существующими подходами к квантованию при эквивалентных уровнях производительности.
Еще один документ NeurIPS 2025: «Обучение лучшему поиску с помощью языковых моделей посредством управляемого усиленного самообучения». предложенный Guided-ReST, новый алгоритм обучения с подкреплением, который позволяет большим языковым моделям автономно изучать улучшенные стратегии рассуждения и поиска. В сложном тесте рассуждений «Обратный отсчет» Guided-ReST повысил точность на 10 %, а эффективность рассуждений — на 50 %.
Кроме того, команда ТМЛР документ «Крупномасштабное целенаправленное обнаружение причин посредством обучения на смоделированных данных», представил контролируемый метод причинного вывода для эффективного выявления причинных переменных целевых факторов. Предложенный метод линейно масштабируется в зависимости от количества переменных, что делает его подходящим для крупномасштабных систем и обеспечивает современную эффективность обнаружения причинно-следственных связей в тестах сетей регуляции генов.
Дополнительная информация:
Джанг-Хюн Ким и др., KVzip: независимое от запросов сжатие KV-кэша с реконструкцией контекста, arXiv (2025). DOI: 10.48550/arxiv.2505.23416
Deokjae Lee и др., Q-Palette: дробно-битовые квантователи для оптимального распределения битов для эффективного развертывания LLM, arXiv (2025). DOI: 10.48550/arxiv.2509.20214.
Сынён Мун и др. «Обучение более эффективному поиску с помощью языковых моделей посредством управляемого усиленного самообучения», arXiv (2024). DOI: 10.48550/arxiv.2410.02992.
Джанг-Хюн Ким и др. «Крупномасштабное целенаправленное обнаружение причин посредством обучения на основе смоделированных данных», arXiv (2024). DOI: 10.48550/arxiv.2408.16218.
Предоставлено
Сеульский национальный университет
Цитирование: Технология искусственного интеллекта может сжимать память разговоров чат-бота LLM в 3–4 раза (2025 г., 7 ноября). Получено 7 ноября 2025 г. с https://techxplore.com/news/2025-11-ai-tech-compress-llm-chatbot.html.
Этот документ защищен авторским правом. За исключением любых добросовестных сделок в целях частного изучения или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Содержимое предоставлено исключительно в информационных целях.
2025-11-07 16:08:00
1762563501
#Технология #искусственного #интеллекта #может #сжать #память #разговоров #чатбота #LLM #раза
Читайте также

