Дистилляция может сделать модели ИИ меньше и дешевле

Оригинальная версия из эта история появился в Сколько журналаПолем

В начале этого года китайская компания AI Deepseek выпустила чат -бот под названием R1, который привлекло огромное внимание. Большая часть этого сосредоточен на факте В то, что относительно небольшая и неизвестная компания заявила, что создала чат -бот, который соперничал с показателями самых известных компаний искусственного интеллекта в мире, но используя часть компьютерной мощности и стоимости. В результате акции многих западных технологических компаний резко упали; Nvidia, которая продает чипы, которые запускают ведущие модели искусственного интеллекта, Потерял больше стоимости акций за один день чем любая компания в истории.

Некоторые из этого внимания включали элемент обвинения. Источники утверждаются что DeepSeek получилБез разрешения знания из проприетарной модели O1 OpenAI с использованием методики, известной как дистилляция. Большая часть освещения новостей Сформулировал эту возможность как шок для индустрии ИИ, подразумевая, что Deepseek обнаружил новый, более эффективный способ построения ИИ.

Но дистилляция, также называемая дистилляцией знаний, является широко используемым инструментом в области искусственного интеллекта, предметом исследований в области компьютерных наук, уходящих за десятилетие, и инструмент, который крупные технологические компании используют на своих собственных моделях. «Дистилляция является одним из наиболее важных инструментов, которые компании имеют сегодня, чтобы сделать модели более эффективными», – сказал Энрик Боикс-АдсераИсследователь, который изучает дистилляцию в школе Уортон Университета Пенсильвании.

Темные знания

Идея дистилляции началась с Бумага 2015 года Три исследователя в Google, в том числе Джеффри Хинтон, так называемый крестный отец ИИ и 2024 Нобелевский лауреатПолем В то время исследователи часто управляли ансамблями моделей – «Многие модели склеены вместе», – сказали в Ориол ВиньялыГлавный ученый в Google DeepMind и один из авторов статьи – улучшить их производительность. «Но было невероятно громоздко и дорого запускать все модели параллельно», – сказал Виньялс. «Мы были заинтригованы идеей перевести это на одну модель».

Read more:  Новинка DeepMind: ИИ для обработки математических доказательств

Исследователи думали, что они могут добиться прогресса, обращаясь к заметному слабым моментам в алгоритмах машинного обучения: все неправильные ответы считались одинаково плохими, независимо от того, насколько они не правы. Например, в модели классификации изображений «смущение собаки с лисой была наказывана так же, как и сбивает с толку собаку с пиццей»,-сказал Виналс. Исследователи подозревали, что модели ансамблей действительно содержали информацию о том, какие неправильные ответы были менее плохими, чем другие. Возможно, меньшая «студенческая» модель может использовать информацию из большой модели «учителя», чтобы быстрее понять категории, в которую она должна была сортировать изображения. Хинтон назвал это «темным знанием», ссылаясь на аналогию с космологической темной материей.

После обсуждения этой возможности с Хинтоном, Vinynals разработал способ получить большую модель учителя, чтобы передать больше информации о категориях изображений меньшей модели ученика. Ключ был на дому по «мягким целям» в модели учителя, где он назначает вероятности каждой возможности, а не устойчивые эти или эти ответы. Одна модель, например, рассчитан Что было 30 -процентное вероятность того, что изображение показало собаку, 20 процентов, что на ней показали кошку, 5 процентов, на которых показана корова, и на 0,5 процента, что на нем показали автомобиль. Используя эти вероятности, модель учителя эффективно показала ученику, что собаки очень похожи на кошек, не так отличаются от коров и совершенно отличаются от автомобилей. Исследователи обнаружили, что эта информация поможет студенту научиться более эффективно определять изображения собак, кошек, коров и автомобилей. Большая, сложная модель может быть уменьшена до более слабой, с едва потерей точности.

Взрывной рост

Идея не была немедленным ударом. Документ был отвергнут с конференции, и виналы, обескураженные, обратились к другим темам. Но дистилляция прибыла в важный момент. Примерно в это же время инженеры обнаружили, что чем больше учебных данных они подали в нейронные сети, тем более эффективными стали эти сети. Размер моделей вскоре взорвался, как и их возможностино стоимость запуска их поднялась в шаг с их размером.

Read more:  Это модель ИИ с открытым исходным кодом Швейцарии

Многие исследователи обратились к дистилляции как способ сделать меньшие модели. Например, в 2018 году исследователи Google представили мощную языковую модель под названием БЕРТкоторый компания вскоре начала использовать, чтобы помочь проанализировать миллиарды веб -поисков. Но Берт был большим и дорогостоящим, поэтому в следующем году другие разработчики перегоняли меньшую версию, разумно названную Дистилбертом, которая широко использовалась в бизнесе и исследованиях. Дистилляция постепенно стала вездесущей, и теперь она предлагается в качестве услуги такими компаниями, как GoogleВ Openaiи АмазонкаПолем Оригинальная дистилляционная бумага, все еще опубликованная только на сервере Arxiv.org Preprint, теперь имеет цитируется более 25 000 разПолем

Учитывая, что дистилляция требует доступа к внутренним моделью учителя, третья сторона невозможно подсказывать данные из модели с закрытым источником, такой как O1 Openai, как думал, что Deepseek. Тем не менее, студенческая модель все еще может многое научиться из модели учителя, просто побуждая учителя определенные вопросы и используя ответы для обучения своих собственных моделей – почти Сократический подход к дистилляции.

Между тем, другие исследователи продолжают находить новые приложения. В январе, лаборатория Novasky в Калифорнийском университете в Беркли показал, что дистилляция хорошо работает для моделей рассуждений за тренировкикоторые используют многоэтапное «мышление», чтобы лучше ответить на сложные вопросы. Лаборатория сообщает, что его модель Sky-T1 с открытым исходным кодом стоит менее 450 долларов США, и она достигла аналогичных результатов с гораздо большей моделью с открытым исходным кодом. «Мы были искренне удивлены тем, насколько хорошо работала дистилляция в этой обстановке», – сказал Дахенг Ли, Беркли докторская студентка и соучредитель команды Novasky. «Дистилляция – это фундаментальная техника в ИИ».

Read more:  Обмен Макса Кросби может произойти «на этой неделе»: инсайдер НФЛ

Оригинальная история Перепечатано с разрешения от Сколько журналаВ редакционная независимая публикация Фонд Саймонса чья миссия состоит в том, чтобы улучшить общественное понимание науки, охватывая исследования и тенденции в области математики и физических и жизненных наук.

2025-09-20 11:00:00


1758395027
#Дистилляция #может #сделать #модели #ИИ #меньше #дешевле

Ещё по этой теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.