Openai наконец запустил GPT-5. Вот все, что вам нужно знать

В сообщении в блоге Openai утверждается, что GPT-5 превзойдет свои предыдущие модели по нескольким контрольным показателям, в том числе SWE-Bench Perified (набрал 74,9 процента), SWE-Lancer (GPT-5, набрал 55 процентов) и полиглот Aider (набрал 88 процентов), который проверяет способность модели на фиксировать ошибки, полные фрилантные кодирование, и работают по всему программам.

Во время брифинга прессы в среду Openai Post Training Lead Yann Dubois побудил GPT-5 «создать красивое, очень интерактивное веб-приложение для моего партнера, говорящего по-английски, учиться французскому». Он поручил ИИ включить такие функции, как ежедневный прогресс, различные мероприятия, такие как карточки и викторины, и отметил, что он хочет, чтобы приложение завершилось в «очень привлекательную тему». Примерно через минуту появилось приложение, сгенерированное AI. В то время как это была только одна демонстрация на Rails, результатом был гладкий сайт, который дал именно то, о чем просил Дюбуа.

«Это отличный сотрудник по кодированию, а также превосходно в агентских задачах»,-говорит Мишель Покрасс, лидерство после тренировки. «Он эффективно выполняет длинные цепочки и вызовы инструментов [which means it better understands when and how to use functions like web browsers or external APIs]следует подробным инструкциям и предоставляет предварительные объяснения своих действий ».

Openai также говорит в своем блоге, что GPT-5-это «лучшая модель, но для вопросов, связанных со здоровьем». В трех критериях LLM Openai, связанных с здоровьем-Healthbench, Healthbench Hard и Healthbench Consensus-системная карта (В документе, который описывает технические возможности продукта и другие результаты исследований) гласит, что GPT-5-мышление опережает предыдущие модели «с существенным отрывом». Мыслительная версия GPT-5 набрала 25,5 процента на Healthbench, по сравнению с 31,6-процентным баллом O3. Эти оценки подтверждены двумя или более врачами, согласно системной карте.

Read more:  Более надежная, более точная, более внимательная, более настраиваемое… OpenAI запускает GPT-5, новую версию CHATGPT

По словам Pokrass, общая проблема для ИИ также предположительно галлюцинирует меньше. Исследование безопасности Openai, ведущее, Алекс Бейтель добавляет, что они «значительно снизили показатели обмана в GPT-5».

«Мы предприняли шаги, чтобы уменьшить склонность к GPT-5 к обману, обмануть, обмануть или взломать проблемы, хотя наши смягчения не являются идеальными, и необходимы дополнительные исследования»,-говорится в системной карте. «В частности, мы обучили модель изящно терпеть неудачу, когда поставили с задачами, которые она не может решить».

Системная карта компании сообщает, что после тестирования моделей GPT-5 без доступа к просмотру веб-сайта исследователи обнаружили, что уровень галлюцинации (который они определяли как «процент фактических претензий, которые содержат незначительные или основные ошибки») на 26 процентов реже, чем модель GPT-4O. GPT-5 Comings имеет 65-процентную снижение уровня галлюцинации по сравнению с O3.

Для подсказок, которые могут быть двойным использованием (потенциально вредным или доброкачественным), Beutel говорит, что GPT-5 использует «безопасные завершения», что побуждает модель «дать как можно более полезный ответ, но в пределах ограничений оставшихся в безопасности». По словам Beutel, OpenAI проделал более 5000 часов красной команды, а также тестирование с внешними организациями, чтобы убедиться, что система была надежной.

Openai заявляет, что теперь он может похвастаться почти 700 миллионами еженедельных активных пользователей CATGPT, 5 миллионов платежей бизнес -пользователей и 4 миллионами разработчиков, использующих API.

«Вибрации этой модели действительно хороши, и я думаю, что люди действительно почувствуют это», – говорит глава Chatgpt Nick Turley. «Особенно обычные люди, которые не тратили свое время на размышления о моделях».

2025-08-07 17:00:00


1754611961
#Openai #наконец #запустил #GPT5 #Вот #все #что #вам #нужно #знать

Ещё по этой теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.