Представляем Сонет 4.6 \ Антропный

Claude Sonnet 4.6 — наша самая функциональная модель Sonnet.. Это полное обновление навыков модели в области программирования, использования компьютера, рассуждений в длинном контексте, планирования агентов, работы с знаниями и дизайна. Sonnet 4.6 также включает контекстное окно токена 1M в бета-версии.

Для тех, кто на нашем Бесплатные и профессиональные планыClaude Sonnet 4.6 теперь является моделью по умолчанию в Клод.ай и Клод Коворк. Цены остается таким же, как Sonnet 4.5, начиная с $3/$15 за миллион токенов.

Sonnet 4.6 дает значительно улучшенные навыки программирования большему количеству наших пользователей. Улучшения в согласованности, следовании инструкциям и многое другое заставили разработчиков с ранним доступом с большим отрывом предпочесть Sonnet 4.6 его предшественнику. Зачастую они даже предпочитают его нашей самой умной модели ноября 2025 года Claude Opus 4.5.

Производительность, которая раньше требовала достижения модели класса Opus, в том числе на реальных, экономически ценных объектах. офисные задачи— теперь доступен в Sonnet 4.6. Модель также демонстрирует значительное улучшение навыков использования компьютера по сравнению с предыдущими моделями Sonnet.

Как и в случае с каждой новой моделью Claude, мы использовали обширные оценки безопасности Sonnet 4.6, который в целом показал, что он так же безопасен, как и другие наши последние модели Claude, или даже безопаснее. Наши исследователи безопасности пришли к выводу, что Сонет 4.6 имеет «в целом теплый, честный, просоциальный и временами забавный характер, очень строгое поведение в области безопасности и никаких признаков серьезных опасений по поводу форм несогласованности с высокими ставками».

Использование компьютера

Почти в каждой организации есть программное обеспечение, которое сложно автоматизировать: специализированные системы и инструменты, созданные до того, как появились современные интерфейсы, такие как API. Раньше, чтобы ИИ мог использовать такое программное обеспечение, пользователям приходилось создавать специальные разъемы. Но модель, которая может использовать компьютер так же, как человек, меняет это уравнение.

В октябре 2024 года мы были первым представить универсальная компьютерная модель. В то время мы писали, что он «все еще экспериментальный, временами громоздкий и подвержен ошибкам», но ожидали быстрого улучшения. ОСМирстандартный тест для использования компьютеров с искусственным интеллектом, показывает, насколько далеко продвинулись наши модели. Он представляет сотни задач для реального программного обеспечения (Chrome, LibreOffice, VS Code и т. д.), работающего на смоделированном компьютере. Никаких специальных API или специальных соединителей не существует; модель видит компьютер и взаимодействует с ним почти так же, как человек: щелкает (виртуальной) мышью и печатает на (виртуальной) клавиатуре.

За шестнадцать месяцев наши модели Sonnet стабильно добились успеха в OSWorld. Улучшения можно увидеть и за пределами тестов: первые пользователи Sonnet 4.6 видят возможности человеческого уровня в таких задачах, как навигация по сложной электронной таблице или заполнение многоэтапной веб-формы, прежде чем собрать все это воедино на нескольких вкладках браузера.

Модель определенно все еще отстает от наиболее опытных людей в использовании компьютеров. Но тем не менее темпы прогресса впечатляют. Это означает, что использование компьютера гораздо полезнее для ряда рабочих задач и что в пределах досягаемости доступны гораздо более функциональные модели.

Оценки до версии Claude Sonnet 4.5 измерялись на оригинальной OSWorld; оценки, начиная с Sonnet 4.5, используют OSWorld-Verified. OSWorld-Verified (выпущен в июле 2025 г.) — это обновление исходного эталонного теста OSWorld с обновлениями качества задач, оценки оценок и инфраструктуры.

В то же время использование компьютера сопряжено с риском: злоумышленники могут попытаться перехватить модель, скрывая инструкции на веб-сайтах, что известно как атака с быстрым внедрением. Мы работаем над повышением устойчивости наших моделей к быстрым инъекциям. оценки безопасности показывают, что Sonnet 4.6 является значительным улучшением по сравнению со своим предшественником Sonnet 4.5 и работает так же, как Opus 4.6. Вы можете узнать больше о том, как избежать немедленных инъекций и других проблем безопасности, в наша документация по API.

Read more:  Как наши ИИ-боты игнорируют свои программы и наделяют хакеров сверхспособностями

Оценка сонета Клода 4.6

Помимо использования компьютера, Claude Sonnet 4.6 улучшил результаты тестов по всем направлениям. Он приближается к уровню интеллекта Opus по цене, что делает его более практичным для решения гораздо большего числа задач. Вы можете найти полное обсуждение возможностей Sonnet 4.6 и его поведения, связанного с безопасностью, в наша системная карта; Краткое описание и сравнение с другими последними моделями приведены ниже.

Таблица популярных тестов и относительная производительность Sonnet 4.6 по сравнению с другими моделями Frontier.

В Claude Code наше раннее тестирование показало, что пользователи предпочитают Sonnet 4.6 Sonnet 4.5 примерно в 70% случаев. Пользователи сообщили, что он более эффективно читает контекст перед изменением кода и консолидирует общую логику, а не дублирует ее. Это сделало использование в течение длительных сеансов менее утомительным, чем более ранние модели.

Пользователи даже предпочитали Sonnet 4.6 Opus 4.5, нашей передовой модели ноября, в 59% случаев. Они оценили Sonnet 4.6 как значительно менее склонный к чрезмерному проектированию и «лени» и значительно лучше следующий инструкциям. Они сообщили о меньшем количестве ложных заявлений об успехе, меньшем количестве галлюцинаций и более последовательном выполнении многоэтапных задач.

Контекстного окна токена Sonnet 4.6 размером 1M достаточно для хранения целых кодовых баз, длительных контрактов или десятков исследовательских работ в одном запросе. Что еще более важно, Сонет 4.6 эффективно аргументировать во всем этом контексте. Это может значительно улучшить долгосрочное планирование. Особенно ясно мы это видели в Вендинг-Скамейка Арена оценка, которая проверяет, насколько хорошо модель может управлять (моделируемым) бизнесом с течением времени, и которая включает в себя элемент конкуренции, когда различные модели ИИ противостоят друг другу, чтобы получить наибольшую прибыль.

Компания Sonnet 4.6 разработала новую интересную стратегию: она инвестировала значительные средства в мощности в течение первых десяти смоделированных месяцев, тратя значительно больше, чем ее конкуренты, а затем резко развернулась, чтобы сосредоточиться на прибыльности на последнем этапе. Выбор времени для этого поворота помог ему финишировать значительно впереди конкурентов.

Sonnet 4.6 превосходит Sonnet 4.5 на Vending-Bench Arena, поскольку инвестирует в мощности заранее, а затем переходит к прибыльности на последнем этапе.

Первые клиенты также сообщили о значительных улучшениях, среди которых выделялись код внешнего интерфейса и финансовый анализ. Клиенты независимо друг от друга описывали визуальные эффекты Sonnet 4.6 как заметно более совершенные, с лучшими макетами, анимацией и продуманным дизайном, чем у предыдущих моделей. Клиентам также требовалось меньше циклов итераций для достижения результатов производственного качества.

Обновления продукта

На платформе разработчика Claude Sonnet 4.6 поддерживает как адаптивное мышление и расширенное мышление, а также сжатие контекста в бета-версии, которая автоматически суммирует старый контекст по мере приближения разговоров к пределу, увеличивая эффективную длину контекста.

Read more:  Сопротивление Anthropic Министерству обороны США, запись OpenAI: объяснение

В нашем API Клода веб-поиск и принести инструменты теперь автоматически записывают и выполняют код для фильтровать и обрабатывать результаты поискасохраняя в контексте только релевантный контент, что повышает как качество ответов, так и эффективность токенов. Кроме того, выполнение кода, память, программный вызов инструментов, поиск инструментаи примеры использования инструментов теперь общедоступны.

Sonnet 4.6 обеспечивает высокую производительность при любых мыслительных усилиях, даже если длительное мышление отключено. В рамках перехода с Sonnet 4.5 мы рекомендуем изучить весь спектр, чтобы найти идеальный баланс скорости и надежности в зависимости от того, что вы создаете.

Мы обнаружили, что Opus 4.6 остается лучшим вариантом для задач, требующих самого глубокого анализа, таких как рефакторинг кодовой базы, координация нескольких агентов в рабочем процессе и проблемы, связанные с его получением. только верно имеет первостепенное значение.

Для Клод в Excel пользователей, наша надстройка теперь поддерживает соединители MCP, позволяя Клоду работать с другими инструментами, которые вы используете изо дня в день, такими как S&P Global, LSEG, Daloopa, PitchBook, Moody’s и FactSet. Вы можете попросить Клода извлечь контекст из-за пределов вашей электронной таблицы, даже не выходя из Excel. Если вы уже настроили соединители MCP в Claude.ai, эти же соединения будут автоматически работать в Excel. Это доступно в планах Pro, Max, Team и Enterprise.

Как использовать Клод Сонет 4.6

Claude Sonnet 4.6 теперь доступен на всех Планы Клода, Клод Коворк, Клод Коднаш API и все основные облачные платформы. Мы также обновили наш бесплатный уровень до Sonnet 4.6 по умолчанию — теперь он включает в себя создание файлов, соединители, навыки и сжатие.

Если вы разработчик, вы можете быстро начать работу, используя claude-sonnet-4-6 через Клод API.

Read more:  Битва в гольф, открытый ИИ больше, чем SpaceX, уроки от лидеров

2026-02-17 17:48:00


1771353678
#Представляем #Сонет #Антропный

Ещё по этой теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.