Даже передовые LLM, начиная с GPT-5, теряют точность до 33%, если вы слишком долго общаетесь.

1772302065
2026-02-28 17:51:00

Последнее поколение больших языковых моделей — начиная с GPT-5 — по-прежнему испытывает проблемы, когда задачи распределяются по нескольким этапам разговора. Исследователь Филипп Лабан и его команда протестировали текущие модели на шести задачах, охватывающих код, базы данных, действия, преобразование данных в текст, математические вычисления и обобщение. Производительность значительно падает, когда информация разбивается на несколько сообщений (шардирование) вместо одного приглашения (конкат).

Лабан и др.

Новые модели показали себя немного лучше — снижение производительности сократилось с 39 до 33 процентов, — но проблема еще далека от решения. Наибольший прирост наблюдался в задачах Python, где некоторые модели потеряли всего от 10 до 20 процентов. Лабан подозревает, что реальные потери могут быть еще хуже, поскольку в тестах использовалось простое пользовательское моделирование. Пользователи, которые передумают во время разговора, скорее всего, вызовут более резкое падение.

Технические изменения, такие как снижение значений температуры, не решают проблему, как показало оригинальное исследование. Исследователи рекомендуют начинать новый разговор, когда что-то идет не так, в идеале сначала предложите модели суммировать все запросы и использовать это резюме в качестве отправной точки для нового чата.

Новости искусственного интеллекта без ажиотажа – курируют люди

Как Абонент ДЕКОДЕРвы получаете чтение без рекламы, наш еженедельный информационный бюллетень по искусственному интеллектуэксклюзив Отчет «AI Radar» Frontier 6 раз в годдоступ к комментариям и нашему полный архив.

Подпишитесь сейчас
#Даже #передовые #LLM #начиная #GPT5 #теряют #точность #до #если #вы #слишком #долго #общаетесь

По теме

Read more:  Новый Datamag SSD придерживается вашего ноутбука или телефона MSI и бьет с безумными скоростями 4000 МБ/с с магнитной магией

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.