Иллюстрация масштабированного семейства, оценочного закона о масштабировании и его ошибки прогнозирования для целевой модели. Кредит: Руководство автостопа (2025).
Когда исследователи создают модели крупных языков (LLMS), они стремятся максимизировать производительность в соответствии с конкретным вычислительным и финансовым бюджетом. Поскольку обучение модели может составить миллионы долларов, разработчики должны быть разумными с решениями, влияющими на затрат, о том, что касается модельной архитектуры, оптимизаторов и обучающих наборов данных, прежде чем принять модель.
Чтобы предвидеть качество и точность прогнозов большой модели, практикующие часто обращаются к законам масштабирования: использование меньших, более дешевых моделей, чтобы попытаться приблизительно производительность гораздо более крупной целевой модели. Задача, однако, заключается в том, что есть тысячи способов создать закон масштабирования.
Новая работа от исследователей MIT и MIT-IBM Watson AI Lab рассматривает это, накопив и высвобождая коллекцию сотен моделей и показателей, касающихся обучения и эффективности, чтобы приблизиться к более чем тысячам законов о масштабировании. Исходя из этого, команда разработала метаанализ и руководство по выбору небольших моделей и оценки законов масштабирования для различных семейств моделей LLM, так что бюджет оптимально применяется к созданию надежных прогнозов производительности.
«Мысли о том, что вы, возможно, захотите построить математические модели учебного процесса,-это пара лет, но я думаю, что здесь было новое, что большая часть работы, которую люди делали раньше, говорится:« Можем ли мы сказать что-то постсоотровую о том, что произошло, когда мы обучали все эти модели, так что, когда мы пытаемся выяснить, как тренировать новую крупную модель, мы можем принять лучшие решения о том, как использовать нашу бюджет,-«Ассоциация». Департамент электротехники и информатики и главный следователь в лаборатории MIT-IBM Watson AI.
А исследовать недавно была представлена на Международной конференции по машинному обучению (ICML 2025) от Андреаса вместе с исследователями MIT-IBM Watson AI Lab Leshem Choshen и Yang Zhang из IBM Research.
Экстраполяция производительности
Независимо от того, как вы его нарезаете, разработка LLMS является дорогостоящим усилием: от принятия решений относительно количества параметров и токенов, выбора данных и размеров, а также методов обучения до определения точности вывода и настройки целевых приложений и задач. Законы масштабирования предлагают способ прогнозировать поведение модели, связывая потерю большой модели с производительностью более мелких и менее дорогостоящих моделей из одной и той же семьи, избегая необходимости полностью обучать каждого кандидата.
В основном различия между меньшими моделями – это количество параметров и размера обучения токена. По словам Чошен, разъяснение законов о масштабировании не только позволяет лучшие решения перед тренировкой, но и демократизирует эту область, позволяя исследователям без обширных ресурсов понимать и создавать эффективные законы масштабирования.
Функциональная форма законов масштабирования является относительно проста, включающая компоненты из небольших моделей, которые отражают количество параметров и их эффект масштабирования, количество учебных токенов и их масштабирование и базовые характеристики для интересующего модельного семейства. Вместе они помогают исследователям оценить потерю производительности крупной модели; Чем меньше потери, тем лучше будут выходы целевой модели.
Эти законы позволяют исследовательским группам эффективно взвесить компромиссы и проверять, как лучше всего распределить ограниченные ресурсы. Они особенно полезны для оценки масштабирования определенной переменной, такой как количество токенов, и для A/B-тестирования различных настройков перед тренировкой.
В общем, законы масштабирования не новы; Однако в области ИИ они появились по мере роста моделей, а стоимость взлетела. «Это как законы масштабирования, только что появились в какой -то момент в этой области», – говорит Чошен. «Они начали привлекать внимание, но никто не проверял, насколько они хороши и что вам нужно сделать, чтобы сделать хороший закон масштабирования». Кроме того, в некотором смысле законы масштабирования сами также были черным ящиком.
«Всякий раз, когда люди создавали законы о масштабировании в прошлом, это всегда было просто одной моделью, или одной модельной семейством, а также одним набором данных, а также одним разработчиком», – говорит Андреас. “На самом деле не было много систематических Метаанализпоскольку все индивидуально обучают свои собственные законы масштабирования. Так, [we wanted to know,] Существуют ли тенденции высокого уровня, которые вы видите в этих вещах? “
Здание лучше
Чтобы исследовать это, Чошен, Андреас и Чжан создали большой набор данных. Они собрали LLM из 40 модельных семейств, включая Pythia, Opt, Olmo, Llama, Bloom, T5-пили, модулеформирующих смеси экспертов, GPT и других семей. Они включали 485 уникальных, предварительно обученных моделей и, где доступны, данные об их обучающих контрольно-пропускных пунктах, вычислительные затраты (флопы), эпохи обучения и семена, а также 1,9 миллионов показателей производительности потерь и задачи вниз по течению. Модели различались по их архитектуре, весам и так далее.
Используя эти модели, исследователи соответствуют 1000 законов о масштабировании и сравнивали свою точность между архитектурами, размерами моделей и режимами обучения, а также тестировали, как количество моделей, включение промежуточных контрольных точек обучения и частичное обучение повлияло на прогнозирующую силу масштабирования законов для целевых моделей.
Они использовали измерения абсолютной относительной ошибки (являются); Это разница между прогнозом закона масштабирования и наблюдаемой потерей большой, обученной модели. При этом команда сравнила законы масштабирования, а после анализа дистиллированные практические рекомендации для практикующих ИИ о том, что делает эффективные законы масштабирования.
Их общие руководящие принципы проводят разработчик по шагам и вариантам для рассмотрения и ожиданий. Во -первых, очень важно определить точность вычислительного бюджета и целевой модели. Команда обнаружила, что 4%-это наилучшая достижимая точность, которую можно ожидать из-за случайного шума семян, но до 20% по-прежнему полезно для принятия решений.
Исследователи определили несколько факторов, которые улучшают прогнозы, такие как включающие контрольные точки промежуточного обучения, а не полагаются только на окончательные потери; Это сделало законы масштабирования более надежными. Тем не менее, очень ранние данные обучения до 10 миллиардов жетонов являются шумными, снижают точность и должны быть отброшены.
Они рекомендуют приоритетировать приоритеты в обучении больше моделей по распространению размеров, чтобы повысить надежность прогнозирования закона масштабирования, а не только более крупные модели; Выбор пяти моделей обеспечивает прочную отправную точку.
Как правило, включая более крупные модели улучшает прогноз, но затраты могут быть сохранены путем частично обучения целевой модели примерно 30% его набора данных и использования этого для экстраполяции. Если бюджет значительно ограничен, разработчики должны рассмотреть возможность обучения одной меньшей модели в целевой модели семейства и параметров масштабирования заимствования у модельного семейства с аналогичной архитектурой; Тем не менее, это может не работать для моделей Encoder -Decoder.
Наконец, исследовательская группа MIT-IBM обнаружила, что при масштабировании законов сравнивались по модельным семействам, существует сильная корреляция между двумя наборами гиперпараметров, что означает, что три из пяти гиперпараметров объяснили почти все вариации и, вероятно, могут захватить поведение модели. Вместе эти руководящие принципы обеспечивают систематический подход к расширению оценки закона масштабирования более эффективной, надежной и доступной для исследователей искусственного интеллекта, работающих в рамках различных бюджетных ограничений.
Во время этой работы возникли несколько сюрпризов: небольшие модели, частично обученные, все еще очень предсказательны, и, кроме того, могут использоваться промежуточные стадии обучения от полностью обученной модели (как если бы они являются отдельными моделями) для прогнозирования другой целевой модели. «По сути, вы ничего не платите в обучении, потому что вы уже обучили полную модель, поэтому, например, полу-подготовленная модель-это просто побочный продукт того, что вы сделали»,-говорит Чошен.
Другая особенность Андреаса отметил, что при агрегировании изменчивость между семействами моделей и различные эксперименты выскочила и была более шумной, чем ожидалось. Неожиданно исследователи обнаружили, что можно использовать законы масштабирования на больших моделях для прогнозирования производительности до более мелких моделей.
Другие исследования в этой области предположили, что меньшие модели были «разными зверями» по сравнению с большими; Однако Чошен не согласен. «Если они совершенно разные, они должны были показать совершенно другое поведение, а не».
В то время как эта работа была сосредоточена на модельном времени обучения, исследователи планируют расширить свой анализ на моделирование вывода. Андреас говорит, что это не так: «Как моя модель становится лучше, когда я добавляю больше обучение Данные или больше параметров, но вместо этого я позволяю ему думать дольше, нарисуйте больше образцов. Я думаю, что здесь определенно есть уроки о том, как также создать прогнозирующие модели того, сколько думать вам нужно сделать во время выполнения ».
Он говорит, что теория законов о масштабировании времени вывода может стать еще более важной, потому что «не похоже, что я собираюсь тренировать одну модель, а затем быть сделанным. [Rather,] Каждый раз, когда пользователь приходит ко мне, у него будет новый запрос, и мне нужно выяснить, как тяжело [my model needs] подумать, чтобы придумать лучший ответ. Таким образом, возможность создавать такие прогнозные модели, как мы делаем в этой статье, еще более важна ».
Больше информации:
Руководство автостопщика по оценке закона о масштабе: OpenReview.net/pdf?id=kugshth0c8
Предоставлено
Массачусетский технологический институт
Эта история переиздана предоставлена MIT News (web.mit.edu/newsoffice/), популярный сайт, который охватывает новости о исследованиях, инновациях и преподавании MIT.
Цитирование: AI Закоры об масштабировании: Universal Guide оценивает, как LLMS будет работать на основе небольших моделей в одном семействе (2025, 16 сентября), полученных 17 сентября 2025 г.
Этот документ подлежит авторским правам. Помимо каких -либо справедливых сделок с целью частного исследования или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Контент предоставляется только для информационных целей.
2025-09-16 17:13:00
1758123265
#Universal #Guide #оценивает #как #LLMS #будет #работать #на #основе #небольших #моделей #одном #семье
По теме

