1772302065
2026-02-28 17:51:00
Последнее поколение больших языковых моделей — начиная с GPT-5 — по-прежнему испытывает проблемы, когда задачи распределяются по нескольким этапам разговора. Исследователь Филипп Лабан и его команда протестировали текущие модели на шести задачах, охватывающих код, базы данных, действия, преобразование данных в текст, математические вычисления и обобщение. Производительность значительно падает, когда информация разбивается на несколько сообщений (шардирование) вместо одного приглашения (конкат).
Новые модели показали себя немного лучше — снижение производительности сократилось с 39 до 33 процентов, — но проблема еще далека от решения. Наибольший прирост наблюдался в задачах Python, где некоторые модели потеряли всего от 10 до 20 процентов. Лабан подозревает, что реальные потери могут быть еще хуже, поскольку в тестах использовалось простое пользовательское моделирование. Пользователи, которые передумают во время разговора, скорее всего, вызовут более резкое падение.
Технические изменения, такие как снижение значений температуры, не решают проблему, как показало оригинальное исследование. Исследователи рекомендуют начинать новый разговор, когда что-то идет не так, в идеале сначала предложите модели суммировать все запросы и использовать это резюме в качестве отправной точки для нового чата.
Новости искусственного интеллекта без ажиотажа – курируют люди
Как Абонент ДЕКОДЕРвы получаете чтение без рекламы, наш еженедельный информационный бюллетень по искусственному интеллектуэксклюзив Отчет «AI Radar» Frontier 6 раз в годдоступ к комментариям и нашему полный архив.
Подпишитесь сейчас
#Даже #передовые #LLM #начиная #GPT5 #теряют #точность #до #если #вы #слишком #долго #общаетесь
По теме

