Llamafile, портативный инструмент для запуска LLM от Mozilla, получил поддержку графического процессора и переработанное ядро

1773984489
2026-03-20 05:00:00

Запуск большой языковой модели на одной машине без доступа к облаку или среде выполнения контейнера остается приоритетом для практиков, работающих в средах с ограниченными ресурсами или воздушными зазорами. Llamafile, проект Mozilla-AI по упаковке и запуску LLM как автономных исполняемых файлов, претерпел самые значительные на сегодняшний день архитектурные изменения с версией 0.10.0.

Реконструкция с нуля

Версия 0.10.0 является результатом осознанного решения восстановить ядро Llamafile с нуля. Заявленная цель заключалась в создании космополитической сборки llama.cpp, которая сохранила бы два центральных свойства проекта: переносимость между операционными системами и аппаратными архитектурами, а также возможность связывать веса моделей непосредственно внутри исполняемого файла Llamafile. В ходе пересборки также была обновлена зависимость проекта llama.cpp, включившая поддержку новейших моделей, которой не хватало в старых сборках.

Ускорение графического процессора возвращается

Одним из наиболее значительных изменений в версии 0.10.0 является восстановление поддержки графического процессора, которая отсутствовала в более ранних итерациях перестроенной кодовой базы. Поддержка CUDA для Linux была вновь введена в феврале 2026 года. Металлическая поддержка macOS ARM64 появилась в декабре 2025 года и реализована путем компиляции небольшого модуля с использованием инструментов командной строки Xcode. Металл работает как в терминальном интерфейсе, так и в серверном режиме.

Поддержка графического процессора для Windows указана как отсутствующая в текущей версии.

Интерфейс терминала и режим сервера

Версия 0.10.0 добавляет пользовательский интерфейс терминала (TUI), который позволяет пользователям напрямую взаимодействовать с загруженной моделью из командной строки. Режим сервера доступен через флаг –server. В выпуске также добавлена поддержка трех различных режимов работы: чат, CLI и сервер.

Мультимодальные и речевые возможности

API mtmd теперь доступен через TUI, что обеспечивает доступ к мультимодальной модели непосредственно из терминала. Модели, протестированные с этой возможностью, включают llava 1.6, Qwen3-VL и Ministral 3. В режим CLI добавлена поддержка ввода изображений с помощью флага –image.

Read more:  Обзор vivo X300

Whisper, модель распознавания речи, была добавлена в последнем цикле обновлений (март 2026 г.), что расширило возможности проекта за пределы вывода только текста.

Поддержка моделей и примеры ламафайлов

Mozilla-AI распространяет набор готовых примеров файлов llama, входящих в состав версии 0.10.0. Они варьируются от квантования Qwen3.5 0,8B Q8 объемом 1,6 ГБ, которое, как сообщает проект, генерирует примерно 8 токенов в секунду на Raspberry Pi 5 без графического процессора, до квантования Qwen3.5 27B Q5 объемом 19 ГБ. Другие включенные модели: Ministral 3 3B Instruct, llava v1.6 mistral 7b, Apertus 8B Instruct, gpt-oss 20b и LFM2 24B A2B.

Зависимость llama.cpp была обновлена для фиксации 7f5ee54, что добавляет поддержку моделей Qwen3.5.

Пользователи Windows сталкиваются с практическим ограничением: операционная система устанавливает максимальный размер исполняемого файла в 4 ГБ, который превышает большинство текущих примеров llamafiles. Проект поддерживает использование внешних весов в качестве обходного пути.

Система сборки и зависимости

Система сборки была упрощена в начале цикла разработки 0.10.0. От CMake отказались в пользу специального файла BUILD.mk. Зависимости извлекаются из каталога поставщика llama.cpp. Сейчас проект нацелен на Cosmocc 4.0.2. Утилита zipalign была добавлена в качестве подмодуля GitHub для отслеживания обновлений исходной версии от ее сопровождающего.

Что еще предстоит сделать

В проекте перечислено несколько возможностей, которые еще не перенесены в новый формат сборки. Стабильный код распространения существует в репозитории, но не был портирован в новую сборку. Функции залога() и песочницы SECOMP отсутствуют. Llamafiler для встраивания был откачен до встроенной конечной точки встраивания llama.cpp. Некоторые аргументы CLI, которые работали в более ранних версиях, еще не работают.

Интеграционные тесты были добавлены в марте 2026 года вместе с «документами о навыках», предназначенными для использования с помощниками ИИ.

Read more:  Суд США заявил, что Apple должна выплатить Масимо 634 миллиона долларов по делу о патенте на умные часы

Безопасность благодаря дизайну: Построение безопасности с самого начала

#Llamafile #портативный #инструмент #для #запуска #LLM #от #Mozilla #получил #поддержку #графического #процессора #переработанное #ядро

По теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.