Управляемое обучение позволяет «необучаемым» нейронным сетям реализовать свой потенциал | Новости Массачусетского технологического института

1766100808
2025-12-18 21:20:00

Их результаты показывают, что многие так называемые «неэффективные» сети могут просто начинаться с далеко не идеальных отправных точек и что краткосрочное руководство может поставить их в такое положение, которое облегчит обучение сети.

Метод руководства команды работает, побуждая целевую сеть соответствовать внутренним представлениям направляющей сети во время обучения. В отличие от традиционных методов, таких как дистилляция знаний, которые направлены на имитацию результатов работы учителя, руководство передает структурные знания непосредственно из одной сети в другую. Это означает, что цель узнает, как руководство организует информацию на каждом уровне, а не просто копирует ее поведение. Примечательно, что даже необученные сети содержат архитектурные предубеждения, которые можно перенести, в то время как обученные гиды дополнительно передают изученные закономерности.

«Мы нашли эти результаты довольно неожиданными», — говорит Вигнеш Субраманиам 23 года, инженер 24 лет, аспирант факультета электротехники и информатики Массачусетского технологического института (EECS) и исследователь CSAIL, ведущий автор исследования. бумага представляя эти выводы. «Впечатляет, что мы можем использовать репрезентативное сходство, чтобы заставить эти традиционно «дрянные» сети действительно работать».

Ангел-проводник

Центральный вопрос заключался в том, должно ли руководство продолжаться на протяжении всего обучения, или его основной эффект заключается в обеспечении лучшей инициализации. Чтобы изучить это, исследователи провели эксперимент с глубокими полностью подключенными сетями (FCN). Прежде чем приступить к решению реальной проблемы, сеть провела несколько шагов, потренировавшись с другой сетью, используя случайный шум, например, растяжку перед тренировкой. Результаты были поразительными: сети, которые обычно переобучаются, сразу же оставались стабильными, достигали меньших потерь при обучении и избегали классического ухудшения производительности, наблюдаемого в так называемых стандартных FCN. Такое согласование послужило полезной разминкой для сети, показав, что даже короткий практический сеанс может принести долгосрочную пользу без необходимости постоянного руководства.

Read more:  GPT-5 от Openai сделает чатфт более умнее и меньше склонна обмануть вас к

В исследовании также сравнивалось руководство с дистилляцией знаний — популярным подходом, при котором студенческая сеть пытается имитировать результаты работы учителя. Когда сеть учителей не была обучена, дистилляция полностью провалилась, поскольку выходные данные не содержали значимого сигнала. Руководство, напротив, все же привело к значительным улучшениям, поскольку оно использует внутренние представления, а не окончательные прогнозы. Этот результат подчеркивает ключевой вывод: необученные сети уже кодируют ценные архитектурные особенности, которые могут направить другие сети к эффективному обучению.

Помимо экспериментальных результатов, полученные результаты имеют широкое значение для понимания архитектуры нейронных сетей. Исследователи предполагают, что успех — или неудача — часто зависит не столько от данных по конкретной задаче, сколько от положения сети в пространстве параметров. Присоединяясь к направляющей сети, можно отделить вклад архитектурных предубеждений от полученных знаний. Это позволяет ученым определить, какие особенности конструкции сети способствуют эффективному обучению, а какие проблемы возникают просто из-за плохой инициализации.

Спасение безнадежного

«Принято считать, что разные архитектуры нейронных сетей имеют определенные сильные и слабые стороны», — говорит Лейла Исик, доцент кафедры когнитивных наук Университета Джонса Хопкинса, которая не участвовала в исследовании. “Это захватывающее исследование показывает, что один тип сети может унаследовать преимущества другой архитектуры, не теряя при этом своих первоначальных возможностей. Примечательно, что авторы показывают, что это можно сделать с использованием небольших, необученных “направляющих” сетей. В этой статье представлен новый и конкретный способ добавления различных индуктивных смещений в нейронные сети, что имеет решающее значение для разработки более эффективного и ориентированного на человека ИИ”.

Субраманиам написал статью вместе с коллегами из CSAIL: ученым-исследователем Брайаном Ченгом; Аспирант Дэвид Мэйо ’18, МЭН ’19; научный сотрудник Колин Конвелл; ведущие исследователи Борис Кац, главный научный сотрудник CSAIL, и Томазо Поджо, профессор Массачусетского технологического института в области наук о мозге и когнитивных науках; и бывший научный сотрудник CSAIL Андрей Барбу. Их работу частично поддержали Центр мозга, разума и машин, Национальный научный фонд, Инициатива по приложениям машинного обучения MIT CSAIL, Лаборатория ИИ Watson MIT-IBM, Агентство перспективных исследовательских проектов Министерства обороны США (DARPA), Ускоритель искусственного интеллекта Департамента ВВС США и Управление научных исследований ВВС США.

Read more:  Silence повышает практичность и динамичность своего успешного S02.

Их работа недавно была представлена на конференции и семинаре по нейронным системам обработки информации (NeurIPS).

#Управляемое #обучение #позволяет #необучаемым #нейронным #сетям #реализовать #свой #потенциал #Новости #Массачусетского #технологического #института

Ещё по этой теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.