Mamba 3 с открытым исходным кодом превосходит архитектуру Transformer с улучшенным языковым моделированием почти на 4% и уменьшенной задержкой.

Эра генеративного искусственного интеллекта началась для большинства людей с запуск OpenAI ChatGPT в конце 2022 годано базовая технология — архитектура нейронной сети «Трансформер», которая позволяет моделям ИИ по-разному взвешивать важность разных слов в предложении (или пикселей изображения) и параллельно обучаться информации — восходит к основополагающей статье Google от 2017 года».Внимание — это все, что вам нужно.”

Тем не менее, хотя «Трансформеры» обеспечивают беспрецедентное качество моделей и лежат в основе большинства основных моделей генеративного ИИ, используемых сегодня, они прожорливы в вычислительном отношении. Они обременены квадратичными вычислениями и требованиями к линейной памяти, из-за которых крупномасштабный вывод становится дорогостоящим, а зачастую и непомерно дорогим занятием. Отсюда и желание некоторых исследователей улучшить их, разработав в 2023 году новую архитектуру Mamba, которая впоследствии была включена в гибридные модели Mamba-Transformer, такие как Немотрон 3 Супер от NVIDIA.

Теперь те же исследователи, стоящие за оригинальной архитектурой Мамбы, в том числе лидеры Альберт Гу из Карнеги-Меллона и Три Дао из Принстона, выпустили последнюю версию своей новой архитектуры Мамба-3в качестве языковой модели под разрешительной лицензией с открытым исходным кодом Apache 2.0, что делает ее немедленно доступной разработчикам, в том числе предприятиям, для коммерческих целей. Технический документ также имеет опубликовано на arXiv.org.

Эта модель сигнализирует о сдвиге парадигмы от эффективности обучения к дизайну, ориентированному на логические выводы. Как отметил Гу в официальном объявлении, в то время как Mamba-2 сосредоточилась на устранении узких мест перед обучением, Mamba-3 стремится решить проблему «холодного графического процессора»: реальность, заключающаяся в том, что во время декодирования современное оборудование часто простаивает, ожидая движения памяти, а не выполняя вычисления.

Растерянность (нет, не компании) и вновь обретенная эффективность Мамбы 3

Мамба, включая Мамбу 3, представляет собой разновидность государственной космической модели (SSM).

По сути, это высокоскоростная «обобщающая машина» для ИИ. В то время как многим популярным моделям (например, тем, что используются в ChatGPT) приходится перепроверять каждое слово, которое они уже видели, чтобы понять, что будет дальше (что становится медленнее и дороже, чем дольше длится разговор), SSM поддерживает компактное, постоянно меняющееся внутреннее состояние. По сути, это состояние представляет собой цифровой «мысленный снимок» всей истории данных.

По мере поступления новой информации модель просто обновляет этот снимок вместо того, чтобы перечитывать все с самого начала. Это позволяет ИИ обрабатывать огромные объемы информации, например, целые библиотеки книг или длинные нити ДНК, с невероятной скоростью и гораздо меньшими требованиями к памяти.

Чтобы оценить скачок, который представляет собой Mamba-3, нужно сначала понять недоумение — основной показатель, используемый в исследованиях для измерения качества модели.

В контексте языкового моделирования недоумение — это мера того, насколько «удивлена» модель новыми данными.

Read more:  США в неведении относительно взглядов Моджтабы Хаменеи на бомбу

Представьте себе модель как профессионального игрока. Если модель испытывает сильное недоумение, она не знает, куда делать ставки; он считает многие возможные следующие слова равновероятными.

Более низкий показатель недоумения указывает на то, что модель более «определенна» — она лучше понимает основные закономерности человеческого языка. Для создателей ИИ недоумение служит точным показателем интеллекта.

Прорыв, о котором сообщается в исследовании «Мамба-3», заключается в том, что он достигает уровня запутанности, сравнимого с его предшественником, «Мамба-2», используя при этом только половину размера государства. Это означает, что модель может быть такой же умной, но в два раза более эффективной в эксплуатации.

Новая философия

Схема архитектуры Мамбы 3. 1 кредит

Философия, лежащая в основе Mamba-3, — это фундаментальный сдвиг в том, как мы думаем об «интеллекте» ИИ в сравнении со скоростью оборудования, на котором он работает. В то время как предыдущее поколение, Mamba-2, было разработано для обучения на рекордных скоростях, Mamba-3 представляет собой архитектуру, ориентированную на вывод — вывод относится к тому, как модели ИИ предоставляются конечным пользователям через веб-сайты, такие как ChatGPT или Google Gemini, или через интерфейсы прикладного программирования (API).

Основная цель Mamba 3 — максимально использовать каждую секунду активности компьютерного чипа (GPU), гарантируя, что модель думает как можно усерднее, не заставляя пользователя ждать ответа.

В мире языковых моделей каждая точка точности достигается с большим трудом. В масштабе 1,5 миллиардов параметров самый продвинутый вариант MIMO Mamba-3 достиг средней точности 57,6% по всем тестам, что представляет собой скачок на 2,2 процентных пункта по сравнению со стандартным трансформатором Transformer.

Таблица тестов точности Mamba 3

Сравнительная таблица тестов Mamba 3. Авторы и права: Аакаш Лахоти, Кевин Ю. Ли, Берлин Чен, Кейтлин Ван, Авив Бик, Дж. Зико Колтер, Три Дао, Альберт Гу

Хотя скачок на два пункта может показаться скромным, на самом деле он представляет собой относительное увеличение возможностей языкового моделирования почти на 4% по сравнению с базовым уровнем Transformer. Еще более впечатляюще то, что, как упоминалось выше, Mamba-3 может соответствовать качеству прогнозирования своего предшественника, используя при этом только половину внутреннего «размера состояния», эффективно обеспечивая тот же уровень интеллекта со значительно меньшей задержкой памяти.

В течение многих лет эффективные альтернативы Трансформерам страдали от «логического разрыва» — они часто не справлялись с простыми задачами рассуждения, такими как отслеживание закономерностей или решение элементарных арифметических действий, потому что их внутренняя математика была слишком жесткой. Мамба-3 решает эту проблему, вводя комплексные состояния.

Это математическое обновление действует как внутренний компас, позволяя модели представлять «вращательную» логику. Используя этот «вращательный» подход, Мамба-3 может почти идеально решать логические головоломки и задачи отслеживания состояний, о которых ее предшественники могли только догадываться, наконец, доведя аналитическую силу линейных моделей до уровня самых продвинутых систем.

Read more:  Китайская комната защищает платежные вампиры кланов Bloodlines 2

Последняя часть головоломки — то, как Мамба-3 взаимодействует с физическим оборудованием. Большинство современных моделей искусственного интеллекта «привязаны к памяти», то есть компьютерный чип большую часть времени простаивает, ожидая перемещения данных из памяти в процессор.

Mamba-3 представляет формулу Multi-Input, Multi-Output (MIMO), которая фундаментально меняет эту динамику. Выполняя в четыре раза больше математических операций параллельно на каждом этапе, Мамба-3 использует эту ранее «проставшую» мощность. Это позволяет модели значительно больше «обдумывать» каждое сгенерированное ею слово, не увеличивая фактическое время, которое пользователь тратит на ожидание ответа. Подробнее об этом ниже.

Три новых технологических скачка

Привлекательность линейных моделей всегда заключалась в их постоянных требованиях к памяти и линейном масштабировании вычислений.

Однако, как отмечают авторы «Мамбы 3», «бесплатных обедов не бывает». Фиксируя размер состояния для обеспечения эффективности, эти модели вынуждены сжимать весь исторический контекст в единое представление — полная противоположность постоянно растущему KV-кешу Transformer. Мамба-3 тянет за собой три особых рычага, чтобы заставить это фиксированное состояние выполнять больше работы.

1. Экспоненциально-трапециевидная дискретизация.

Модели пространства состояний по своей сути представляют собой системы с непрерывным временем, которые должны быть «дискретизированы» для обработки дискретных последовательностей цифровых данных.

Предыдущие итерации основывались на дискретизации «Экспоненциального Эйлера» — эвристике, которая обеспечивала только аппроксимацию системы первого порядка.

Мамба-3 представляет обобщенное правило трапецийобеспечивая аппроксимацию второго порядка. Это не просто математическое уточнение; он вызывает «неявную свертку» внутри основного повторения.

Объединив это с явными терминами смещения B и C, исследователи смогли устранить короткую причинную свертку, которая была основным элементом рекуррентных архитектур в течение многих лет.

2. Комплексные SSM и «трюк RoPE»

Одной из наиболее настойчивых критических замечаний в адрес линейных моделей была их неспособность решать простые задачи отслеживания состояния, такие как определение четности битовой последовательности.

Эта неудача связана с ограничением матрицы перехода действительными числами, что не позволяет модели представлять «вращательную» динамику. Mamba-3 преодолевает эту проблему, рассматривая базовый SSM как комплекснозначный.

Используя то, что команда называет “трюк с RoPE», они демонстрируют, что обновление комплексного состояния математически эквивалентно зависимому от данных ротационному встраиванию (RoPE), применяемому к входным и выходным проекциям.

Это позволяет Мамбе-3 решать задачи синтетического мышления, которые были невозможны для Мамбы-2.

3. MIMO: повышение интенсивности арифметических операций

Самый значительный скачок в эффективности вывода происходит в результате перехода от системы с одним входом и одним выходом (SISO) к модели с одним входом и одним выходом (SISO). Мультивход, мультивыход (MIMO) ССМ.

В стандартном SSM обновление состояния представляет собой операцию внешнего продукта, которая сильно ограничена памятью. Переключаясь на обновление состояния на основе матричного умножения, Mamba-3 увеличивает «арифметическую интенсивность» модели — соотношение FLOP к трафику памяти.

Read more:  хаос эвакуации американцев на Ближнем Востоке

Это позволяет модели выполнять больше вычислений на этапе декодирования с привязкой к памяти. По сути, Mamba-3 использует «простаивающие» вычислительные ядра графического процессора для «бесплатного» увеличения мощности модели, сохраняя ту же скорость декодирования, что и ее более простые предшественники.

Что означает Mamba 3 для предприятий и разработчиков искусственного интеллекта

Для предприятий Mamba-3 представляет собой стратегический сдвиг в совокупной стоимости владения (TCO) при развертывании ИИ.

  • Стоимость против производительности: По производительности согласованных параметров Mamba-3 (MIMO) соответствует по сложности Mamba-2, используя при этом половину размера состояния. Для корпоративного развертывания это эффективно удваивает пропускную способность вывода при том же объеме оборудования.

  • Агентские рабочие процессы: По мере того, как организации переходят к параллельным, агентным рабочим процессам (таким как автоматическое кодирование или агенты обслуживания клиентов в режиме реального времени), спрос на генерацию с малой задержкой возрастает в геометрической прогрессии. Mamba-3 разработан специально для предотвращения «холодного» оборудования графического процессора во время выполнения этих задач.

  • Гибридное преимущество: Исследователи предсказывают, что будущее корпоративного ИИ лежит в гибридные модели. Перемежая Mamba-3 самообслуживанием, организации могут объединить эффективную «память» SSM с точным хранилищем «базы данных» Transformers.

Доступность, лицензирование и использование

«Мамба-3» — это не просто теоретическое исследование; это полностью реализованный выпуск с открытым исходным кодом, доступный для немедленного использования, код модели опубликован на Гитхаб.

Проект распространяется под лицензией Apache-2.0. Это разрешительная, удобная для бизнеса лицензия, которая позволяет бесплатное использование, модификацию и коммерческое распространение без требования раскрытия проприетарного исходного кода.

Этот выпуск подойдет разработчикам, создающим приложения с длинным контекстом, агентам рассуждения в реальном времени, а также тем, кто хочет снизить затраты на графические процессоры в крупносерийных производственных средах.

Возглавляя революцию в области государственных космических моделей (SSM)

Релиз был встречен с энтузиазмом в социальных сетях, особенно в связи с тем, что проект «под руководством студентов». Гу, чья биография в X/Twitter описывает его как «руководителя революции ССМ», полностью отдает должное студенческим лидерам, в том числе Акаш Лахоти и Кевин Ю. Ли

.Тема Гу подчеркнул удовлетворенность команды дизайном:

«Мы очень довольны окончательным дизайном модели! Три основных методологических изменения вдохновлены (на мой взгляд) некоторыми элегантными математическими расчетами и методами».

Поскольку агентские рабочие процессы поднимают спрос на логические выводы «запредельно», появление Мамбы-3 предполагает, что будущее ИИ может заключаться не только в самой большой модели, но и в самой эффективной.

Мамба-3 успешно привела SSM в соответствие с реалиями современного оборудования, доказав, что даже в эпоху Трансформаторов принципы классической теории управления по-прежнему играют жизненно важную роль.

2026-03-17 23:04:00


1773814647
#Mamba #открытым #исходным #кодом #превосходит #архитектуру #Transformer #улучшенным #языковым #моделированием #почти #на #уменьшенной #задержкой

Продолжение темы

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.