Новая технология Self-Flow от Black Forest Labs делает обучение мультимодальных моделей ИИ в 2,8 раза более эффективным

Для создания связных изображений или видео модели генеративного распространения ИИ, такие как Stable Diffusion или FLUX, обычно полагаются на внешних «учителей» — замороженные кодеры, такие как CLIP или DINOv2, — чтобы обеспечить семантическое понимание, которому они не могли научиться самостоятельно.

Но за эту уверенность приходится платить: возникает «узкое место», при котором масштабирование модели больше не дает лучших результатов, поскольку внешний преподаватель достиг своего предела.

Сегодня немецкий AI-стартап Black Forest Labs (производитель серии FLUX моделей изображений AI) объявила потенциальный конец этой эры академических заимствований с выпуск Self-Flowплатформа сопоставления потоков с самоконтролем, которая позволяет моделям одновременно изучать представление и генерацию.

Интегрировав новый механизм планирования с двумя временными шагами, Black Forest Labs продемонстрировала, что одна модель может достигать самых современных результатов при обработке изображений, видео и аудио без какого-либо внешнего контроля.

Технология: преодоление «смыслового разрыва»

Фундаментальная проблема традиционного генеративного обучения заключается в том, что это задача «шумоподавления». Модели показывают шум и просят найти изображение; у него очень мало стимулов понимать, что представляет собой изображение, а только то, как оно выглядит.

Чтобы исправить это, исследователи ранее «согласовали» генеративные особенности с внешними дискриминативными моделями. Однако Black Forest Labs утверждает, что это в корне ошибочно: эти внешние модели часто преследуют несовпадающие цели и не могут обобщать различные модальности, такие как аудио или робототехника.

Новая методика Лабораторий, Self-Flow, вводит «информационную асимметрию» для решения этой проблемы. Используя метод, называемый двухшаговым планированием, система применяет разные уровни шума к различным частям входных данных. Учащийся получает сильно искаженную версию данных, в то время как учитель — версия самой модели в виде экспоненциальной скользящей средней (EMA) — видит «более чистую» версию тех же данных.

Затем перед учеником ставится задача не просто сгенерировать окончательный результат, но и спрогнозировать, что видит его «более чистое» «я» — процесс самоочистки, в котором учитель находится на уровне 20, а ученик — на уровне 8. Такой подход «двойного прохода» заставляет модель развивать глубокое внутреннее семантическое понимание, эффективно обучая себя тому, как видеть, в то время как он учится создавать.

Значение продукта: быстрее, четче и мультимодальность

Практические результаты этого сдвига поразительны. Согласно исследовательской работе, Self-Flow сходится примерно в 2,8 раза быстрее, чем метод REpresentation Alignment (REPA), текущий отраслевой стандарт выравнивания функций. Возможно, что еще более важно, он не выходит на плато; По мере увеличения вычислений и параметров Self-Flow продолжает улучшаться, в то время как старые методы показывают уменьшающуюся отдачу.

Read more:  Attackmate обеспечивает реалистичную эмуляцию кибератак по всей цепочке кибер-убийств.

Скачок в эффективности обучения лучше всего понять через призму простых вычислительных шагов: в то время как стандартное «ванильное» обучение традиционно требует 7 миллионов шагов для достижения базового уровня производительности, REPA сократила этот путь всего до 400 000 шагов, что означает ускорение в 17,5 раз.

Платформа Self-Flow от Black Forest Labs расширяет этот горизонт еще больше, работая в 2,8 раза быстрее, чем REPA, и достигает того же показателя производительности примерно за 143 000 шагов.

В совокупности эта эволюция представляет собой почти 50-кратное сокращение общего количества этапов обучения, необходимых для достижения высококачественных результатов, эффективно превращая то, что когда-то требовало огромных ресурсов, в значительно более доступный и оптимизированный процесс.

Лаборатории Шварцвальда продемонстрировали эти достижения с помощью мультимодальной модели с параметрами 4B. Обученная на огромном наборе данных, состоящем из 200 миллионов изображений, 6 миллионов видео и 2 миллионов пар аудио-видео, модель продемонстрировала значительный прогресс в трех ключевых областях:

  1. Типографика и рендеринг текста: Одним из наиболее настойчивых «признаков» изображений ИИ является искаженный текст. Self-Flow значительно превосходит стандартное сопоставление потоков при отображении сложных, разборчивых знаков и надписей, таких как неоновая вывеска с правильным написанием «FLUX is multimodal».

  2. Временная согласованность: При создании видео Self-Flow устраняет многие «галлюцинационные» артефакты, распространенные в текущих моделях, например, конечности, которые самопроизвольно исчезают во время движения.

  3. Совместный видео-аудио синтез: Поскольку модель самостоятельно изучает представления, она может генерировать синхронизированное видео и аудио из одной подсказки — задача, в которой внешние «заимствованные» представления часто терпят неудачу, поскольку кодировщик изображений не понимает звук.

С точки зрения количественных показателей Self-Flow достигла превосходящих результатов по сравнению с базовыми показателями конкурентов. По Image FID модель получила оценку 3,61 по сравнению с 3,92 у REPA. Для видео (FVD) он достиг 47,81 по сравнению с 49,59 у REPA, а для аудио (FAD) он набрал 145,65 против 148,87 в базовой версии.

Read more:  оборот 90 миллионов и рекордный тендерный портфель более 150 миллионов

От пикселей к планированию: путь к моделям мира

Анонс завершается взглядом на модели мира — искусственный интеллект, который не просто генерирует красивые картинки, но и понимает основную физику и логику сцены для планирования и робототехники.

Путем точной настройки версии Self-Flow с параметрами 675M на наборе робототехнических данных RT-1 исследователи достигли значительно более высоких показателей успеха в сложных, многоэтапных задачах в симуляторе SIMPLER. В то время как стандартное сопоставление потоков с трудом справлялось со сложными задачами «Открыть и разместить» и часто полностью терпело неудачу, модель Self-Flow сохраняла стабильный уровень успеха, предполагая, что ее внутренние представления достаточно надежны для визуального рассуждения в реальном мире.

Детали реализации и инженерные разработки

Для исследователей, желающих проверить эти утверждения, Black Forest Labs выпустила пакет для вывода на GitHub специально для поколения ImageNet 256×256. Проект, в основном написанный на Python, предоставляет архитектуру модели SelfFlowPerTokenDiT, основанную на SiT-XL/2.

Инженеры могут использовать предоставленный скрипт sample.py для создания 50 000 изображений для стандартной оценки FID. В репозитории подчеркивается, что ключевой архитектурной модификацией в этой реализации является согласование временных интервалов для каждого токена, что позволяет приводить в соответствие каждый токен в последовательности с его конкретным временным шагом шума. Во время обучения модель использовала смешанную точность BFloat16 и оптимизатор AdamW с ограничением градиента для поддержания стабильности.

Лицензирование и доступность

Лаборатории Шварцвальда имеют сделал исследовательскую работу и официальный код вывода доступен через GitHub и их исследовательский портал. Хотя в настоящее время это предварительная версия исследования, опыт компании с семейством моделей FLUX позволяет предположить, что эти инновации, скорее всего, найдут свое применение в их коммерческих API и предложениях с открытым весом в ближайшем будущем.

Для разработчиков отказ от внешних кодировщиков — это огромный выигрыш в эффективности. Это устраняет необходимость управления отдельными тяжелыми моделями, такими как DINOv2, во время обучения, упрощая стек и позволяя проводить более специализированное, специфичное для предметной области обучение, которое не зависит от чьего-либо «замороженного» понимания мира.

Выводы для лиц, принимающих технические решения на предприятии, и тех, кто внедряет их

Для предприятий появление Self-Flow представляет собой значительный сдвиг в анализе затрат и выгод разработки собственного ИИ.

Read more:  Акции Novo Nordisk резко упали из-за неудачи в исследовании лекарства от болезни Альцгеймера

Хотя наиболее непосредственными бенефициарами являются организации, обучающие крупномасштабные модели с нуля, исследование показывает, что эта технология одинаково эффективна для точной настройки с высоким разрешением. Поскольку этот метод сходится почти в три раза быстрее, чем существующие стандарты, компании могут достигать самых современных результатов, тратя лишь часть традиционного бюджета на вычисления.

Такая эффективность позволяет предприятиям выйти за рамки стандартных готовых решений и разработать специализированные модели, которые глубоко соответствуют их конкретным областям данных, будь то нишевая медицинская визуализация или данные собственных промышленных датчиков.

Практическое применение этой технологии распространяется на важные промышленные отрасли, в первую очередь на робототехнику и автономные системы. Используя способность платформы изучать «мировые модели», предприятия производства и логистики могут разрабатывать модели «видение-язык-действие» (VLA), которые обладают превосходным пониманием физического пространства и последовательным рассуждением.

В симуляционных тестах Self-Flow позволил роботизированным контроллерам успешно выполнять сложные многообъектные задачи, такие как открытие ящика и помещение предмета внутрь, где традиционные генеративные модели потерпели неудачу. Это говорит о том, что данная технология является основополагающим инструментом для любого предприятия, стремящегося преодолеть разрыв между созданием цифрового контента и реальной физической автоматизацией.

Помимо повышения производительности, Self-Flow предлагает предприятиям стратегическое преимущество за счет упрощения базовой инфраструктуры искусственного интеллекта. Большинство современных генеративных систем представляют собой модели «Франкенштейна», для которых требуются сложные внешние семантические кодировщики, часто принадлежащие и лицензируемые третьими лицами.

Объединив представление и генерацию в единую архитектуру, Self-Flow позволяет предприятиям устранить эти внешние зависимости, сокращая технический долг и устраняя «узкие места», связанные с масштабированием сторонних преподавателей. Такая автономная природа гарантирует, что по мере того, как предприятие масштабирует свои вычисления и данные, производительность модели будет предсказуемо и синхронно масштабироваться, обеспечивая более четкую окупаемость долгосрочных инвестиций в ИИ.

2026-03-04 20:18:00


1772660383
#Новая #технология #SelfFlow #от #Black #Forest #Labs #делает #обучение #мультимодальных #моделей #ИИ #раза #более #эффективным

По теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.