Три динамических режима обучения в двухслойной нейронной сети с m скрытыми нейронами (на рисунке обозначены MF, Feat. Learning, Feat. Learning и Overfit/Unlearn). Набор данных из n образцов в d измерениях в предположении, что n, m, d большие и n/(md) = 0,3. Синим цветом: ошибка теста (обобщение). Фиолетовый: ошибка обучения. Красным цветом: сложность модели, измеренная по норме l^1 весов второго слоя |W_2nd|. Фото: А. Монтанари и П. Урбани.
Современные нейронные сети с миллиардами параметров настолько чрезмерно параметризованы, что могут «переобучать» даже случайные, бесструктурные данные. Тем не менее, при обучении на наборах данных со структурой они изучают основные функции.
Понимание того, почему чрезмерная параметризация не снижает их эффективность, является фундаментальной проблемой в области ИИ. Два исследователя, Андра Монтанари (Стэнфорд) и Пьерфранческо Урбани (IPhT), предполагают, что обучение функциям и переобучение сосуществуют, но происходят в разные временные рамки во время обучения.
Эволюция машинного обучения
Информатика началась с новаторской работы Алана Тьюринга. Он задумал программируемую машину, способную автоматически оценивать сложные функции на основе первоначальных входных данных. Очень важно, что инструкции для этих операций, известные как алгоритмы (или программное обеспечение), должны поступать в машину извне и изменяться при изменении задачи/вычисления. Это разделение между «машиной» и «инструкциями» представляет собой архитектуру, которая контролирует работу ноутбуков/смартфонов/устройств посредством кодов/программ/приложений.
Смена парадигмы произошла в пятидесятые годы, когда исследователи предложили создать вычислительную структуру открытого назначения, которая изучает необходимые инструкции непосредственно на обширном наборе обучающих данных с примерами. Рассмотрим пример беспилотного автомобиля.
Вместо того, чтобы программистам приходилось кодировать каждое решение для каждого возможного дорожного сценария, система обучается на большом наборе условий вождения и решений. Машина изучает основные функции, необходимые для принятия безопасных решений вождения в режиме реального времени, эффективно находя собственное программное обеспечение для вождения. Это основная концепция машинного обучения и нейронных сетей.
Понимание нейронных сетей и сверхпараметризации
Искусственные нейронные сети (ИНС) — это вычислительные системы, в которых огромное количество настраиваемых параметров, называемых весами, автоматически настраиваются (подгоняются) во время обучения для изучения сложных математических функций, позволяющих выполнить желаемую задачу. Теоретическое понимание простых нейронных сетей основано на статистической теории обучения.
Центральным столпом этой теории является идея о том, что сети должны работать эффективно, когда (грубо) их сложность подбора (например, количество весов) остается низкой по сравнению с количеством обучающих данных, отдавая предпочтение простейшей эффективной модели. По сути, это вычислительная форма принципа Бритвы Оккама.
Крупный теоретический кризис начался около пятнадцати лет назад, когда эмпирически было показано, что глубокие нейронные сети, класс очень сложных подгоночных функций, очень эффективны даже при решении простых задач. Это было удивительно, потому что эти модели часто имеют больший вес, чем обучающий пример. Эту ситуацию обычно называют чрезмерной параметризацией: они настолько сложны, что могут соответствовать даже совершенно безликим (случайным) данным.
Несмотря на этот факт, эти модели изучают скрытые особенности значимых данных (обучение признаков) и, следовательно, говорят, что они хорошо обобщают. Понимание того, почему чрезмерная параметризация не влияет и действительно ли она полезна для производительности современных нейронных сетей, стало центральной проблемой, лежащей в основе основ ИИ и парадигм обучения в целом.
Новое исследование о сроках обучения
В недавней работе (принятой как устный вклад в Конференция НейрИПС 2025), Андреа Монтанари (Стэнфордский университет) и Пьерфранческо Урбани (IPhT) предложили решение этой загадки. Используя комбинацию инновационных методов теоретической физики и строгого статистического анализа, они показали, что переоснащение и обучение функциям сосуществуют в чрезмерно параметризованных нейронных сетях, но возникают в разные моменты динамики обучения (так называемое возникающее явление разделения временных масштабов).
Результирующая динамическая развязка между обучением функций и переоснащением возникает в результате взаимодействия между алгоритмом обучения и архитектурой сетей с более крупными моделями, имеющими большее разделение временных масштабов. Учитывая, что обучение функциям происходит до переобучения, этот сценарий предполагает надежный механизм, который объясняет, почему и как работают огромные нейронные сети с перепараметризацией.
Дополнительная информация:
Андреа Монтанари и Пьерфранческо Урбани (2025) Динамическое разделение обобщения и переоснащения в больших двухуровневых сетях». Тридцать девятая ежегодная конференция по нейронным системам обработки информации.
Предоставлено
Институт теоретической физики (ИПТ)
Цитирование: Нейронные сети с чрезмерными параметрами: обучение функциям предшествует переоснащению, результаты исследования (2025 г., 5 декабря) получены 5 декабря 2025 г. с https://techxplore.com/news/2025-12-overparameterized-neural-networks-feature-overfitting.html.
Этот документ защищен авторским правом. За исключением любых добросовестных сделок в целях частного изучения или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Содержимое предоставлено исключительно в информационных целях.
2025-12-05 18:27:00
1764967587
#Исследование #показывает #что #изучение #функций #предшествует #переоснащению
Ещё по этой теме