Оптимизация проксимальной политики (PPO) для обучения оптических процессоров на месте без использования моделей. Фото: Инженерный институт развития технологий Калифорнийского университета в Лос-Анджелесе.
Оптические вычисления стали мощным подходом для высокоскоростной и энергоэффективной обработки информации. В частности, дифракционные оптические сети позволяют проводить крупномасштабные параллельные вычисления за счет использования пассивных структурированных фазовых масок и распространения света. Тем не менее, остается одна серьезная проблема: системы, обученные с помощью моделирования на основе моделей, часто не могут оптимально работать в реальных экспериментальных условиях, где трудно уловить перекосы, шум и неточности модели.
Исследователи внедряют безмодельное обучение
В новой статье опубликовано в Свет: наука и приложенияИсследователи из Калифорнийского университета в Лос-Анджелесе (UCLA) представляют без модели на месте среда обучения дифракционных оптических процессоров, основанная на оптимизации проксимальной политики (PPO), алгоритме обучения с подкреплением, известном своей стабильностью и эффективностью выборки. Вместо того, чтобы полагаться на цифрового двойника или знание приблизительной физической модели, система учится непосредственно на реальных оптических измерениях, оптимизируя свои дифракционные характеристики на самом оборудовании.
«Вместо того, чтобы пытаться идеально моделировать сложное оптическое поведение, мы позволяем устройству учиться на опыте или экспериментах», — сказал Айдоган Озджан, профессор электротехники и вычислительной техники Калифорнийского университета в Лос-Анджелесе и автор исследования. «PPO делает этот процесс на месте быстрым, стабильным и масштабируемым для реалистичных экспериментальных условий».
Экспериментальные демонстрации и приложения
Чтобы продемонстрировать, что PPO может успешно научить оптический процессор выполнять вычислительную задачу, даже не зная базовой физики экспериментальной установки, исследователи Калифорнийского университета в Лос-Анджелесе провели комплексные экспериментальные тесты, чтобы продемонстрировать адаптируемость к нескольким оптическим задачам. Например, система успешно научилась фокусировать оптическую энергию через случайный, неизвестный диффузор, быстрее, чем стандартная оптимизация политического градиента, демонстрируя свою способность эффективно исследовать пространство оптических параметров.
Та же самая схема применялась также для генерации голограмм и коррекции аберраций. В другой демонстрации, дифракционный процессор прошел обучение работе с оптическим оборудованием для классификации рукописных цифр с помощью измерений. По мере обучения на месте выходные шаблоны становились более четкими и отчетливыми для каждого входного числа, демонстрируя правильную классификацию без какой-либо цифровой обработки.
Преимущества и будущий потенциал
PPO повторно использует измеренные данные для нескольких этапов обновления, ограничивая при этом изменения в политике; следовательно, он значительно снижает требования к экспериментальным образцам и предотвращает нестабильное поведение во время обучения, что делает его идеальным для оптических сред с шумом. Этот подход не ограничивается дифракционной оптикой, но может быть применен ко многим другим физическим системам, которые обеспечивают обратную связь и могут регулироваться в режиме реального времени.
«Эта работа представляет собой шаг к интеллектуальным физическим системам, которые автономно обучаются, адаптируются и выполняют вычисления, не требуя подробных физических моделей экспериментальной установки», — сказал Озкан. «Этот подход может быть расширен до фотонных ускорителей, нанофотонных процессоров, адаптивных систем визуализации и оптического оборудования искусственного интеллекта в реальном времени».
Дополнительная информация:
Юхан Ли и др., «Безмодельные оптические процессоры, использующие обучение с подкреплением на месте и оптимизацию проксимальной политики», Свет: наука и приложения (2026). DOI: 10.1038/s41377-025-02148-7
Цитирование: Обучение с подкреплением ускоряет обучение оптических систем искусственного интеллекта без использования моделей (3 января 2026 г.), получено 3 января 2026 г. с https://techxplore.com/news/2026-01-free-optical-ai.html.
Этот документ защищен авторским правом. За исключением любых добросовестных сделок в целях частного изучения или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Содержимое предоставлено исключительно в информационных целях.
2026-01-03 15:00:00
1767502139
#Обучение #подкреплением #ускоряет #безмодельное #обучение #оптических #систем #искусственного #интеллекта
Ещё по этой теме
