В сообщении в блоге Openai утверждается, что GPT-5 превзойдет свои предыдущие модели по нескольким контрольным показателям, в том числе SWE-Bench Perified (набрал 74,9 процента), SWE-Lancer (GPT-5, набрал 55 процентов) и полиглот Aider (набрал 88 процентов), который проверяет способность модели на фиксировать ошибки, полные фрилантные кодирование, и работают по всему программам.
Во время брифинга прессы в среду Openai Post Training Lead Yann Dubois побудил GPT-5 «создать красивое, очень интерактивное веб-приложение для моего партнера, говорящего по-английски, учиться французскому». Он поручил ИИ включить такие функции, как ежедневный прогресс, различные мероприятия, такие как карточки и викторины, и отметил, что он хочет, чтобы приложение завершилось в «очень привлекательную тему». Примерно через минуту появилось приложение, сгенерированное AI. В то время как это была только одна демонстрация на Rails, результатом был гладкий сайт, который дал именно то, о чем просил Дюбуа.
«Это отличный сотрудник по кодированию, а также превосходно в агентских задачах»,-говорит Мишель Покрасс, лидерство после тренировки. «Он эффективно выполняет длинные цепочки и вызовы инструментов [which means it better understands when and how to use functions like web browsers or external APIs]следует подробным инструкциям и предоставляет предварительные объяснения своих действий ».
Openai также говорит в своем блоге, что GPT-5-это «лучшая модель, но для вопросов, связанных со здоровьем». В трех критериях LLM Openai, связанных с здоровьем-Healthbench, Healthbench Hard и Healthbench Consensus-системная карта (В документе, который описывает технические возможности продукта и другие результаты исследований) гласит, что GPT-5-мышление опережает предыдущие модели «с существенным отрывом». Мыслительная версия GPT-5 набрала 25,5 процента на Healthbench, по сравнению с 31,6-процентным баллом O3. Эти оценки подтверждены двумя или более врачами, согласно системной карте.
По словам Pokrass, общая проблема для ИИ также предположительно галлюцинирует меньше. Исследование безопасности Openai, ведущее, Алекс Бейтель добавляет, что они «значительно снизили показатели обмана в GPT-5».
«Мы предприняли шаги, чтобы уменьшить склонность к GPT-5 к обману, обмануть, обмануть или взломать проблемы, хотя наши смягчения не являются идеальными, и необходимы дополнительные исследования»,-говорится в системной карте. «В частности, мы обучили модель изящно терпеть неудачу, когда поставили с задачами, которые она не может решить».
Системная карта компании сообщает, что после тестирования моделей GPT-5 без доступа к просмотру веб-сайта исследователи обнаружили, что уровень галлюцинации (который они определяли как «процент фактических претензий, которые содержат незначительные или основные ошибки») на 26 процентов реже, чем модель GPT-4O. GPT-5 Comings имеет 65-процентную снижение уровня галлюцинации по сравнению с O3.
Для подсказок, которые могут быть двойным использованием (потенциально вредным или доброкачественным), Beutel говорит, что GPT-5 использует «безопасные завершения», что побуждает модель «дать как можно более полезный ответ, но в пределах ограничений оставшихся в безопасности». По словам Beutel, OpenAI проделал более 5000 часов красной команды, а также тестирование с внешними организациями, чтобы убедиться, что система была надежной.
Openai заявляет, что теперь он может похвастаться почти 700 миллионами еженедельных активных пользователей CATGPT, 5 миллионов платежей бизнес -пользователей и 4 миллионами разработчиков, использующих API.
«Вибрации этой модели действительно хороши, и я думаю, что люди действительно почувствуют это», – говорит глава Chatgpt Nick Turley. «Особенно обычные люди, которые не тратили свое время на размышления о моделях».
2025-08-07 17:00:00
1754611961
#Openai #наконец #запустил #GPT5 #Вот #все #что #вам #нужно #знать
Ещё по этой теме

