Три двигателя ИИ гуськом входят в бар… • –

1770565525
2026-02-08 15:03:00

Разработчики, желающие лучше понять принципы машинного обучения на локальном оборудовании, могут запустить новый движок llama.

Разработчик программного обеспечения Леонардо Руссо выпустил лама3чистыйкоторый включает в себя три автономных механизма вывода. Существует чистая реализация C для настольных компьютеров, чистая реализация JavaScript для Node.js и чистая версия JavaScript для веб-браузеров, не требующих WebAssembly.

«Все версии совместимы с архитектурами Llama и Gemma», — пояснил Руссо Регистр в электронном письме. «Цель состоит в том, чтобы предоставить изолированную альтернативу, свободную от зависимостей, как на C, так и на JavaScript, способную читать файлы GGUF и обрабатывать подсказки».

GGUF означает унифицированный формат, сгенерированный GPT; это общий формат для распространения моделей машинного обучения.

Llama3pure не предназначен для замены вызов.cppшироко используемый механизм вывода для запуска локальных моделей, который значительно быстрее реагирует на запросы. Llama3pure — образовательный инструмент.

«Я рассматриваю llama3pure как более гибкую альтернативу llama.cpp, особенно когда речь идет о прозрачности архитектуры и широкой аппаратной совместимости», — объяснил Руссо. «Хотя llama.cpp является стандартом высокопроизводительной оптимизации, он включает в себя сложную экосистему зависимостей и конфигураций сборки, llama3pure использует другой подход».

Руссо считает, что разработчики могут получить выгоду от наличия механизма вывода в одном удобочитаемом файле, который наглядно демонстрирует логику анализа файлов и генерации токенов.

«Основная цель проекта — предоставить механизм вывода, содержащийся в одном файле чистого кода», — сказал он. «Удалив внешние зависимости и уровни абстракции, он позволяет разработчикам охватить весь поток выполнения — от анализа GGUF до окончательного токена — без перехода между файлами или библиотеками. Он создан для тех, кому необходимо точно понимать, что делает оборудование».

Read more:  Android Auto 14.9 поступает с новым дизайном материала

Руссо также видит полезность в ситуациях, когда разработчик использует устаревшее программное или аппаратное обеспечение, когда клиентская WebAssembly невозможна и где может быть желательно иметь изолированный инструмент без потенциальных конфликтов зависимостей в будущем.

По его словам, движки C и Node.js были протестированы с моделями Llama до 8 миллиардов параметров и с моделями Gemma до 4 миллиардов параметров. Основным ограничивающим фактором является физическая оперативная память, необходимая для размещения весов моделей.

Оперативная память, необходимая для запуска моделей машинного обучения на локальном оборудовании, составляет примерно 1 ГБ на миллиард параметров, когда модель квантуется в 8 бит. Удвойте или уменьшите вдвое точность, и вы удвоите или уменьшите вдвое требуемую память. Модели обычно квантуются в 16 бит, поэтому для модели с 1 миллиардом параметров обычно требуется 2 ГБ.

По словам Руссо, расчет весов GGUF иной.

«Весовые коэффициенты GGUF загружаются непосредственно в ОЗУ, что обычно означает, что использование ОЗУ соответствует всему размеру файла», — пояснил он. «Вы можете уменьшить размер контекстного окна, передав определенный параметр (context_size) — функция, поддерживаемая большинством механизмов вывода, включая три, которые я разработал. Уменьшение размера контекстного окна является обычным «хитром» для экономии оперативной памяти при локальном запуске моделей, но это также означает, что ИИ не будет «запоминать» столько, сколько было изначально задумано».

Он также сказал, что llama3pure в настоящее время сосредоточена на однооборотном выводе. Он планирует реализовать управление состоянием истории чата позднее.

По словам Руссо, для повседневной работы он использует Gemma 3 в качестве личного помощника, работающего на базе его механизма вывода на основе C, чтобы обеспечить конфиденциальную обработку конфиденциальных данных в автономном режиме.

«В качестве помощника по программированию я рекомендую Gemma 3 27B», — сказал он. «Что касается проблем с задержкой, то хотя локальные модели исторически были медленными, запуск оптимизированных версий на современном оборудовании теперь обеспечивает работу, очень близкую к облачным моделям, таким как Claude, и без необходимости платить за такую услугу».

Read more:  Мобильный планетарий для путешествий в космос

Хотя Руссо ожидает, что общие сценарии использования помощи ИИ будут по-прежнему опираться на модели, размещенные в облаке, он прогнозирует, что разработчики и предприятия все чаще будут обращать внимание на локальный ИИ. Хотя на компьютерах разработчиков с 32 ГБ или 48 ГБ ОЗУ может отсутствовать контекстное окно, доступное в моделях с облачным размещением, они обеспечивают безопасность и конфиденциальность без зависимости от поставщиков услуг.

Отвечая на вопрос, как он как разработчик относится к переходу на ИИ, Руссо сказал, что ожидает, что разработчики в конечном итоге перейдут к супервайзерам ИИ.

«Поскольку модели ИИ дают ответы с высокой степенью достоверности – даже если они неверны – эксперт-человек должен оставаться в курсе, чтобы проверить результаты», – сказал он. «Технические знания не устареют; скорее, они будут становиться все более важными для аудита работы, созданной ИИ.

#Три #двигателя #ИИ #гуськом #входят #бар.. #Register

Ещё по этой теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.