Для создания связных изображений или видео модели генеративного распространения ИИ, такие как Stable Diffusion или FLUX, обычно полагаются на внешних «учителей» — замороженные кодеры, такие как CLIP или DINOv2, — чтобы обеспечить семантическое понимание, которому они не могли научиться самостоятельно.
Но за эту уверенность приходится платить: возникает «узкое место», при котором масштабирование модели больше не дает лучших результатов, поскольку внешний преподаватель достиг своего предела.
Сегодня немецкий AI-стартап Black Forest Labs (производитель серии FLUX моделей изображений AI) объявила потенциальный конец этой эры академических заимствований с выпуск Self-Flowплатформа сопоставления потоков с самоконтролем, которая позволяет моделям одновременно изучать представление и генерацию.
Интегрировав новый механизм планирования с двумя временными шагами, Black Forest Labs продемонстрировала, что одна модель может достигать самых современных результатов при обработке изображений, видео и аудио без какого-либо внешнего контроля.
Технология: преодоление «смыслового разрыва»
Фундаментальная проблема традиционного генеративного обучения заключается в том, что это задача «шумоподавления». Модели показывают шум и просят найти изображение; у него очень мало стимулов понимать, что представляет собой изображение, а только то, как оно выглядит.
Чтобы исправить это, исследователи ранее «согласовали» генеративные особенности с внешними дискриминативными моделями. Однако Black Forest Labs утверждает, что это в корне ошибочно: эти внешние модели часто преследуют несовпадающие цели и не могут обобщать различные модальности, такие как аудио или робототехника.
Новая методика Лабораторий, Self-Flow, вводит «информационную асимметрию» для решения этой проблемы. Используя метод, называемый двухшаговым планированием, система применяет разные уровни шума к различным частям входных данных. Учащийся получает сильно искаженную версию данных, в то время как учитель — версия самой модели в виде экспоненциальной скользящей средней (EMA) — видит «более чистую» версию тех же данных.
Затем перед учеником ставится задача не просто сгенерировать окончательный результат, но и спрогнозировать, что видит его «более чистое» «я» — процесс самоочистки, в котором учитель находится на уровне 20, а ученик — на уровне 8. Такой подход «двойного прохода» заставляет модель развивать глубокое внутреннее семантическое понимание, эффективно обучая себя тому, как видеть, в то время как он учится создавать.
Значение продукта: быстрее, четче и мультимодальность
Практические результаты этого сдвига поразительны. Согласно исследовательской работе, Self-Flow сходится примерно в 2,8 раза быстрее, чем метод REpresentation Alignment (REPA), текущий отраслевой стандарт выравнивания функций. Возможно, что еще более важно, он не выходит на плато; По мере увеличения вычислений и параметров Self-Flow продолжает улучшаться, в то время как старые методы показывают уменьшающуюся отдачу.
Скачок в эффективности обучения лучше всего понять через призму простых вычислительных шагов: в то время как стандартное «ванильное» обучение традиционно требует 7 миллионов шагов для достижения базового уровня производительности, REPA сократила этот путь всего до 400 000 шагов, что означает ускорение в 17,5 раз.
Платформа Self-Flow от Black Forest Labs расширяет этот горизонт еще больше, работая в 2,8 раза быстрее, чем REPA, и достигает того же показателя производительности примерно за 143 000 шагов.
В совокупности эта эволюция представляет собой почти 50-кратное сокращение общего количества этапов обучения, необходимых для достижения высококачественных результатов, эффективно превращая то, что когда-то требовало огромных ресурсов, в значительно более доступный и оптимизированный процесс.
Лаборатории Шварцвальда продемонстрировали эти достижения с помощью мультимодальной модели с параметрами 4B. Обученная на огромном наборе данных, состоящем из 200 миллионов изображений, 6 миллионов видео и 2 миллионов пар аудио-видео, модель продемонстрировала значительный прогресс в трех ключевых областях:
-
Типографика и рендеринг текста: Одним из наиболее настойчивых «признаков» изображений ИИ является искаженный текст. Self-Flow значительно превосходит стандартное сопоставление потоков при отображении сложных, разборчивых знаков и надписей, таких как неоновая вывеска с правильным написанием «FLUX is multimodal».
-
Временная согласованность: При создании видео Self-Flow устраняет многие «галлюцинационные» артефакты, распространенные в текущих моделях, например, конечности, которые самопроизвольно исчезают во время движения.
-
Совместный видео-аудио синтез: Поскольку модель самостоятельно изучает представления, она может генерировать синхронизированное видео и аудио из одной подсказки — задача, в которой внешние «заимствованные» представления часто терпят неудачу, поскольку кодировщик изображений не понимает звук.
С точки зрения количественных показателей Self-Flow достигла превосходящих результатов по сравнению с базовыми показателями конкурентов. По Image FID модель получила оценку 3,61 по сравнению с 3,92 у REPA. Для видео (FVD) он достиг 47,81 по сравнению с 49,59 у REPA, а для аудио (FAD) он набрал 145,65 против 148,87 в базовой версии.
От пикселей к планированию: путь к моделям мира
Анонс завершается взглядом на модели мира — искусственный интеллект, который не просто генерирует красивые картинки, но и понимает основную физику и логику сцены для планирования и робототехники.
Путем точной настройки версии Self-Flow с параметрами 675M на наборе робототехнических данных RT-1 исследователи достигли значительно более высоких показателей успеха в сложных, многоэтапных задачах в симуляторе SIMPLER. В то время как стандартное сопоставление потоков с трудом справлялось со сложными задачами «Открыть и разместить» и часто полностью терпело неудачу, модель Self-Flow сохраняла стабильный уровень успеха, предполагая, что ее внутренние представления достаточно надежны для визуального рассуждения в реальном мире.
Детали реализации и инженерные разработки
Для исследователей, желающих проверить эти утверждения, Black Forest Labs выпустила пакет для вывода на GitHub специально для поколения ImageNet 256×256. Проект, в основном написанный на Python, предоставляет архитектуру модели SelfFlowPerTokenDiT, основанную на SiT-XL/2.
Инженеры могут использовать предоставленный скрипт sample.py для создания 50 000 изображений для стандартной оценки FID. В репозитории подчеркивается, что ключевой архитектурной модификацией в этой реализации является согласование временных интервалов для каждого токена, что позволяет приводить в соответствие каждый токен в последовательности с его конкретным временным шагом шума. Во время обучения модель использовала смешанную точность BFloat16 и оптимизатор AdamW с ограничением градиента для поддержания стабильности.
Лицензирование и доступность
Лаборатории Шварцвальда имеют сделал исследовательскую работу и официальный код вывода доступен через GitHub и их исследовательский портал. Хотя в настоящее время это предварительная версия исследования, опыт компании с семейством моделей FLUX позволяет предположить, что эти инновации, скорее всего, найдут свое применение в их коммерческих API и предложениях с открытым весом в ближайшем будущем.
Для разработчиков отказ от внешних кодировщиков — это огромный выигрыш в эффективности. Это устраняет необходимость управления отдельными тяжелыми моделями, такими как DINOv2, во время обучения, упрощая стек и позволяя проводить более специализированное, специфичное для предметной области обучение, которое не зависит от чьего-либо «замороженного» понимания мира.
Выводы для лиц, принимающих технические решения на предприятии, и тех, кто внедряет их
Для предприятий появление Self-Flow представляет собой значительный сдвиг в анализе затрат и выгод разработки собственного ИИ.
Хотя наиболее непосредственными бенефициарами являются организации, обучающие крупномасштабные модели с нуля, исследование показывает, что эта технология одинаково эффективна для точной настройки с высоким разрешением. Поскольку этот метод сходится почти в три раза быстрее, чем существующие стандарты, компании могут достигать самых современных результатов, тратя лишь часть традиционного бюджета на вычисления.
Такая эффективность позволяет предприятиям выйти за рамки стандартных готовых решений и разработать специализированные модели, которые глубоко соответствуют их конкретным областям данных, будь то нишевая медицинская визуализация или данные собственных промышленных датчиков.
Практическое применение этой технологии распространяется на важные промышленные отрасли, в первую очередь на робототехнику и автономные системы. Используя способность платформы изучать «мировые модели», предприятия производства и логистики могут разрабатывать модели «видение-язык-действие» (VLA), которые обладают превосходным пониманием физического пространства и последовательным рассуждением.
В симуляционных тестах Self-Flow позволил роботизированным контроллерам успешно выполнять сложные многообъектные задачи, такие как открытие ящика и помещение предмета внутрь, где традиционные генеративные модели потерпели неудачу. Это говорит о том, что данная технология является основополагающим инструментом для любого предприятия, стремящегося преодолеть разрыв между созданием цифрового контента и реальной физической автоматизацией.
Помимо повышения производительности, Self-Flow предлагает предприятиям стратегическое преимущество за счет упрощения базовой инфраструктуры искусственного интеллекта. Большинство современных генеративных систем представляют собой модели «Франкенштейна», для которых требуются сложные внешние семантические кодировщики, часто принадлежащие и лицензируемые третьими лицами.
Объединив представление и генерацию в единую архитектуру, Self-Flow позволяет предприятиям устранить эти внешние зависимости, сокращая технический долг и устраняя «узкие места», связанные с масштабированием сторонних преподавателей. Такая автономная природа гарантирует, что по мере того, как предприятие масштабирует свои вычисления и данные, производительность модели будет предсказуемо и синхронно масштабироваться, обеспечивая более четкую окупаемость долгосрочных инвестиций в ИИ.
2026-03-04 20:18:00
1772660383
#Новая #технология #SelfFlow #от #Black #Forest #Labs #делает #обучение #мультимодальных #моделей #ИИ #раза #более #эффективным
По теме

