Глобальное решение «лучшее из N» включает только одну точку ветвления для поиска наилучшего результата. Фото: Калифорнийский технологический институт.
Если вы используете потребительские системы искусственного интеллекта, вы, вероятно, столкнулись с чем-то вроде «мозгового тумана» искусственного интеллекта: вы уже углубились в разговор, когда внезапно ИИ, кажется, теряет из виду различные идеи, о которых вы говорили, и то, как они сочетаются друг с другом.
Та же самая проблема возникает, когда программисты создают «агенты» — системы, использующие большие языковые модели (LLM) и символьные компьютерные программы для решения определенных многоэтапных задач. Как только такая программа достигает определенного размера, то есть код принимает решения, включающие много шагов, LLM почти неизбежно совершает ошибки.
Команда ученых во главе с основанной выпускниками компанией Asari AI вместе с исследователями из Калифорнийского технологического института и Массачусетского технологического института разработала новую структуру, которая позволяет программистам улучшать свой агент, чтобы совершать меньше ошибок и быстро восстанавливаться после ошибок, не переписывая основную логику своего агента. Платформа под названием EnCompass позволяет программистам легко вернуться назад в случае возникновения ошибки и просто протестировать различные стратегии поиска, методы поиска по различным возможным путям выполнения кода. Исследователи представлен EnCompass на Тридцать девятая ежегодная конференция по нейронным системам обработки информации (NeurIPS) в Сан-Диего в прошлом месяце.
«Если мы хотим разработать системы искусственного интеллекта, способные решать сложнейшие проблемы, стоящие перед обществом, от здравоохранения до государственного управления и инженерного проектирования, нам нужны более совершенные инструменты для организации основной логики наших систем искусственного интеллекта», — говорит Исонг Юэ, профессор компьютерных и математических наук в Калифорнийском технологическом институте. «Среда EnCompass — это важный шаг, позволяющий программистам агентов ИИ поддерживать чистую организацию кода, поскольку логика агента становится более сложной».
Важно отметить, что агенты ИИ используют большие нейронные сети с огромным количеством потенциальных путей в своих рабочих процессах. На каждом этапе рассуждения появляется дополнительная неопределенность, позволяющая накапливаться небольшим ошибкам.

Локальное решение «лучшее из N» включает поэтапную оценку, при которой программа выбирает лучший результат на каждом этапе, прежде чем продолжить работу над кодом. Фото: Калифорнийский технологический институт.
«Ошибка, допущенная на раннем этапе рассуждения, может не иметь немедленных катастрофических последствий, но такие ошибки накапливаются и в конечном итоге приводят к неудаче», — говорит Стефан Чжэн, доктор философии, основатель и генеральный директор Asari AI и бывший аспирант Юэ.
Чтобы программа находила правильные решения, программисты могут писать код, использующий сложные циклы, включая правила в точках принятия решения, которые диктуют, когда следует вернуться и убедиться, что он не делает ошибок. Но по мере усложнения агентов такое «жесткое программирование» становится слишком громоздким.
«В результате получается монолитная система, устойчивая к итерациям и экспериментам, а это именно то, чего не нужно при создании агентов с LLM», — говорит Чжэн.
EnCompass позволяет агентам быстро восстанавливаться после ошибок, сохраняя при этом гибкость. Вместо жесткого кодирования логики программисты отмечают точки принятия решений, к которым они, возможно, захотят вернуться, как «точки ветвления», а места, которые могут помочь им оценить полезность определенного пути, как «баллы». Вводя эти простые аннотации, EnCompass отделяет основную логику агента от его стратегии поиска, позволяя программистам легко экспериментировать с различными стратегиями поиска без каких-либо серьезных переписываний кода.
Представьте, что программист хочет перевести репозиторий кода с одного языка программирования Java на другой, например Python. Они могут использовать LLM для перевода каждой функции Java (блока кода) в Python, а затем для проверки успешности перевода.
Чтобы протестировать агента, программисту необходимо просмотреть различные пути, которыми может воспользоваться программа для получения ответов, а затем оценить результаты. Программист может обнаружить, что при некоторых запусках программа идет по пути, где перевод неверен в точке А, тогда как при других запусках она следует по пути ветвления, на котором функция неверна в точке C из-за ошибочного перевода другой функции в точке B.
«В некоторых редких случаях в программе есть один или два пути, где LLM правильно выполнил перевод на каждом этапе и был успешным. Это те пути, которые в идеале хочет, чтобы программа пошла по программе», — говорит Женин Ли, ведущий автор статьи о EnCompass и аспирант Массачусетского технологического института, прошедший стажировку в Asari AI под руководством Чжэна.
Чтобы найти наилучшие пути, программист пишет код, который следует одной или нескольким стратегиям поиска. Сумма всех путей может быть представлена в виде ветвящегося дерева с выходами в узлах ступенчатых ветвей.
Простейшей стратегией поиска было бы использование LLM для поиска «глобального лучшего из N» решения, которое включает в себя несколько запусков агента и выбор наилучшего результата. Визуально каждый проход будет выглядеть как прямой путь от вершины дерева к низу.
Более тонкая стратегия поиска заключалась бы в поиске решения «локального лучшего из N», где на каждом шаге кода агент будет пытаться выполнить этот шаг несколько раз и выбирать лучший результат, прежде чем двигаться дальше и повторять процесс на каждом последующем шаге. Выбранный путь может идти зигзагом вниз по ветвящемуся дереву.
«Но реализация этих стратегий поиска обычно включает в себя их встраивание в основную логику агента», — говорит Ли. Это означает, что каждый раз, когда программист хочет попробовать другую стратегию поиска, ему приходится возвращаться и переписывать большие разделы. Более того, более сложные стратегии сложны в реализации и ухудшают читаемость кода.
«EnCompass позволяет быстро и легко опробовать различные стратегии поиска», — говорит Ли. «Это означает, что вы можете эффективно найти наиболее эффективную стратегию».
В целом, исследователи обнаружили, что использование EnCompass может уменьшить объем кода, необходимого для реализации поиска, на 80%. В конкретном случае использования агента для перевода репозитория с Java на Python компания EnCompass оценила оптимальную стратегию поиска и пришла к выводу, что стратегия, называемая лучевым поиском, которая включает в себя дополнительное ветвление от узлов, требует 75 строк кода по сравнению с 423 строками, необходимыми для выполнения того же поиска без новой структуры. При этом лучевой поиск увеличил точность работы агента с 15% до 40% на нескольких разных хранилищах.
Армандо Солар-Лезама из Массачусетского технологического института — научный руководитель Ли и дополнительный автор статьи.
Дополнительная информация:
EnCompass: Улучшение программирования агентов с помощью поиска по путям выполнения программы. neurips.cc/virtual/2025/loc/sa … -diego/poster/118817
Zhening Li et al, ENCOMPASS: улучшение программирования агентов с помощью
Поиск по путям выполнения программы (2025)
Предоставлено
Калифорнийский технологический институт
Цитирование: Новая платформа помогает системам ИИ восстанавливаться после ошибок и находить оптимальные решения (14 января 2026 г.), получено 14 января 2026 г. с https://techxplore.com/news/2026-01-framework-ai-recover-optimal-solutions.html.
Этот документ защищен авторским правом. За исключением любых добросовестных сделок в целях частного изучения или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Содержимое предоставлено исключительно в информационных целях.
2026-01-14 12:59:00
1768446306
#Новая #структура #помогает #системам #искусственного #интеллекта #восстанавливаться #после #ошибок #находить #оптимальные #решения
Ещё по этой теме

