Это мир Квена, и мы будем жить в нем, согласно отчету CAISI и обновлению GPT-OSS.

1760802285
2025-10-18 15:26:00

Прежде чем перейти к новейшим артефактам, нам нужно рассмотреть несколько частей важной открытой экосистемы.

Во-первых, Центр стандартов и инноваций ИИ (CAISI) опубликовал отчет, в котором наблюдалась экосистема и оценивается DeepSeek 3.1 против ведущих закрытых моделей. Оценочные баллы, которые они выделили, показывают некоторое несоответствие с принятыми в сообществе результатами. В то время как MMLU-Pro, GPQA и HLE близки к оценкам DeepSeek, полученным самостоятельно, и находятся в пределах обычных планок погрешностей, оценки SWE-bench Verified значительно отстают из-за слабого использования эталонного теста. Обвязка — это программная среда, в которой модель используется для агентских тестов, и она оказывает такое же большое влияние, как и сама модель, как показано на рис. этот анализ SWE-bench от Epoch AI.

Таким образом, отчет CAISI занижает возможности моделей DeepSeek по основному тесту для последних моделей (например, это один из тестов, на который Anthropic больше всего полагается при маркетинге Claude).

Далее в отчете CAISI показывает график совокупного количества загрузок с HuggingFace (слева), что мы также показываем на атомпроект.ай (средний, справа). Однако наши цифры сильно отличаются от цифр CAISI, а еще больше — от цифр, ОбнимаюСамо лицо. Итак, что происходит?

Короче говоря, это зависит от того, какие данные вы просматриваете и как вы их очищаете. В проекте ATOM мы рассматриваем только модели, выпущенные после ChatGPT и имеющие степень LLM (согласно нашей оценке). Сюда не входят такие модели, как GPT-2 (именно поэтому OpenAI превосходит всех по числу загрузок CAISI, слева), BERT-подобные модели и ViT, такие как SigLIP (которые доминируют в количестве загрузок Google).

Кроме того, мы выполнили базовую фильтрацию выбросов для ежедневных загрузок для каждой модели. Многие модели, такие как Квен 2,5 1,5Бкоторая является одной из самых загружаемых моделей всех времен, имеет резкие выбросы порядка 10+ миллионов загрузок, что может сильно искажать общие цифры. Эти выбросы влияют на каждую организацию, но в разной степени. Кроме того, мы также исключаем квантованные версии (например, FP8, MLX или GGUF), поскольку они могут исказить цифры.

Read more:  Пантерс Ксавье Легетте, Браунс Рэйшон Дженкинс Браул в первой предсезонной игре

Делиться

Вторая новость посвящена обновленной информации о полезности GPT-OSS: когда модель впервые была исключена, она страдала от трудностей реализации, связанных с выбором архитектуры (например, новая 4-точечная точность) и сложным использованием инструментов (несколько вариантов инструментов в каждой категории). OpenAI на самом деле опережает всех по сложности инструментов, которые они поддерживают с помощью этих моделей, среди открытых вариантов. С момента выпуска использование GPT-OSS 20Б и 120Б models очень сильна: за последний месяц их загрузили 5,6 млн и 3,2 млн соответственно. Эти модели превосходят некоторые популярные модели, такие как Квен 3 4Б или Qwen3-VL-30B-A3B-Инструктировать. Кроме того, я получил очень сильный отзывы сообщества, когда я сделал базовая проверка пульса на моделях. Это одна из первых моделей, которые я примерил на свой новая NVIDIA DGX-Spark чтобы почувствовать вещи.

  • гранит-4.0-h-маленький к IBM-гранит: Мы уже некоторое время рассказывали об IBM и их серии Granite LLM. В этой серии IBM, наконец, увеличила размер модели, представив серию гибридных моделей (внимание + мамба), от плотной 3B до 32B-A9B MoE. Мы использовали эти модели и были впечатлены, хотя и не удивлены, качеством, учитывая постоянное упорство команды IBM в выпуске все более и более лучших моделей.

    Гранит, по крайней мере для варианта 3B, находится примерно в СмолЛМ3 диапазон качества, уступая только Qwen3 4B с точки зрения многоязычности и возможностей следования инструкциям. Тон Granite 4.0 на удивление неинтересен по сравнению с небрежно оптимизированными моделями в последнее время (т.е. с тенденцией в отрасли к игривым, наполненным смайликами и часто подхалимским моделям), что заставляет его в хорошем смысле напоминать старые модели Mistral. Интересно, что они также следуют примеру Квена и выпустят отдельная модель рассуждения позже в этом году. Мы слышали много сообщений от моделей обучения людей о том, что гибридное мышление — то есть включение и выключение жетонов мышления — увеличивает сложность обучения, что снижает пиковую производительность обоих режимов. ИБМ дебютировал подход гибридного мышления (переключаемый с помощью подсказок) на самых ранних стадиях открытых моделей, который позже был принят другими.

  • Qwen3-VL-235B-A22B-Инструктировать к Квен: Серия Qwen VL наконец-то получила долгожданное и ожидаемое обновление с небольшими (4B, 8B) плотными и более крупными (30B-A3B, 235B-A22B) MoE как в версии для инструкций, так и в версии для рассуждений. Мы хотим обратить особое внимание на Вариант 8Б: Их текстовые тесты также улучшились по всем направлениям по сравнению с первоначальной версией 8B, что подтверждает нашу точку зрения на проблему гибридного рассуждения. Поскольку версии 8B не получили обновления 2507, эти версии должны быть простым обновлением и заменой, если вы использовали Qwen3 8B (или все еще используете Llama3.1 8B).

  • ГЛМ-4.6 к Зай-орг: Компания Zhipu выпустила обновление своей основной серии моделей. Этот выпуск примечателен тем, что много люди говорят, что это по сути Сонет (или Хайку) 4.5 дома, хотя он падает (сложнее) при более длительном контексте, чем закрытые модели. Тем не менее, высокая похвала и продолжение темы о том, что китайские открытые модели совершенствуются с поразительной скоростью, приближаясь к лучшим закрытым моделям.

  • Лин-1Т к включениеИИ: Инклюзивный ИИ просыпается и начинает следовать ритму выпуска своего старшего брата, выпуская модели слева, справа и по центру. Как и в случае с Qwen, они также начали значительно увеличивать размеры моделей, достигнув порога 1T. Они также опубликовать аргументированную версию и экспериментируйте с различными архитектурами и модальностями. Следите за ними!

  • лунная мечта3-превью к лунная мечта: Moondream в наши дни далеко не неизвестный игрок и известен тем, что наносит удары, намного превышающие его размер. Они также приняли архитектуру MoE с общим количеством 9B и 2B активных параметров и еще больше улучшили и без того отличные показатели. Интересным аспектом является его уникальная (в мире ИИ) лицензия:

    TL;DR — Вы можете свободно использовать Moondream 3 (предварительная версия) для личных, исследовательских и большинства коммерческих целей. Что НЕ разрешено без отдельной сделки, так это предложение платного продукта, конкурирующего с платными версиями M87 Labs (например, продажа размещенного или встроенного доступа к возможностям модели третьим лицам).

    ориентиры

В оставшейся части выпуска мы выделяем «длинный хвост» моделей, что еще раз подчеркивает масштабный подход, который мы наблюдали на протяжении всего года от Qwen, но при постоянной поддержке со стороны других развивающихся китайских лабораторий. Одна из печальных вещей в этом выпуске заключается в том, что на самом деле существует 0 наборов данных, которые превысили бы нашу планку релевантности. Открытые данные по-прежнему находятся в очень шатком положении.

  • Qwen3-Next-80B-A3B-Инструктировать к Квен: Конечно, Qwen также изучает различные архитектуры, выпуская LLM с гибридным вниманием, состоящее из Gated DeltaNet и Gated Attention. Эта модель обучена на более чем 15Т токенах и может стать основой для следующего поколения моделей Qwen. Цзюньян Линь пишет в твиттере об этом сериале:

Qwen3-Next, или, так сказать, предварительная версия нашего следующего поколения (3.5?) вышла!

На этот раз мы стараемся быть смелыми, но на самом деле мы уже около года проводим эксперименты по гибридным моделям и линейному вниманию. Мы считаем, что наше решение должно быть как минимум стабильным и надежным решением для архитектуры новой модели для сверхдлинного контекста!

#Это #мир #Квена #мы #будем #жить #нем #согласно #отчету #CAISI #обновлению #GPTOSS

По теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.