Данных для обучения ИИ мало, но у нас есть решение

  • Колодец неиспользованных данных, которые послужили топливом для последней волны прорывов в области ИИ, иссякает, оставляя модели ИИ в подвешенном состоянии.
  • Нам доступна возможность создавать новые данные и наборы данных для обучения моделей, но препятствия остаются.
  • Компании и экономики, которые устранят барьеры для создания новых данных, получат конкурентное преимущество.

Поколение назад появление Всемирной паутины положило начало эпохе больших данных и способствовало революции искусственного интеллекта, которую мы наблюдаем сегодня. Поначалу больше данных трансформировалось в более глубокое понимание, что привело к прогрессу в моделировании рисков, целевой рекламе, бизнес-аналитике и другим инновациям, основанным на данных. Однако, несмотря на мировые данные удваивается каждые три-четыре годаЭксперты теперь говорят, что моделям ИИ не хватает данных, что значительно замедлит их рост и эффективность.

Реальность такова, что ИИ способен принимать и синтезировать данные быстрее, чем мы можем генерировать «новые» данные, которых он раньше не видел. Например, как только ИИ впитает все знания из научного учебника, новые идеи не смогут быть получены до тех пор, пока не будет опубликовано новое издание. Но даже в этом случае предмет практически один и тот же, поэтому расширение знаний в области ИИ происходит постепенно. Хотя объем данных увеличивается, недостаток разнообразия и новизны сдерживает ИИ.

Независимо от технологических достижений, модели большого языка (LLM), обученные на одних и тех же существующих данных, в конечном итоге будут генерировать одни и те же коммерческие результаты. Без новых данных ИИ не сможет помочь нам решить более сложные бизнес-, научные и социальные задачи.

Это особенно очевидно в количественных отраслях, таких как фармацевтика, финансовые услуги или химическая промышленность, где бесконечные возможные варианты — комбинации лекарств, рыночные условия, атомные структуры — намного превосходят наши возможности их моделирования и извлечения новых данных и идей. В прошлом единственным способом добиться этого было проведение физических экспериментов для каждой перестановки – невероятно медленный, непомерно дорогой или просто неосуществимый процесс.

Read more:  У Скотта Дженнингс есть три слова в ответ на анти-чарлискую рану Жасмин Крокетт

Колодец неиспользованных данных, которые послужили топливом для последней волны прорывов в области ИИ, иссякает, оставляя эти все более мощные модели ИИ в подвешенном состоянии. Чтобы раскрыть истинный потенциал ИИ, нам нужны новые источники количественных данных, которые позволят нам моделировать и исследовать будущее, а не просто анализировать прошлое.

Хорошая новость заключается в том, что у нас есть способы создания новых «синтетических» данных.

Как мы можем генерировать новые данные

К быстрому созданию новых наборов данных для сложных систем искусственного интеллекта можно подходить двумя способами: автоматизация или вычисления.

Автоматизация использует робототехнику и современные датчики для круглосуточного проведения физических экспериментов. Хотя это увеличивает производительность, развертывание тысяч лабораторных роботов не является экономически эффективным и лишает ученых возможности важного практического обучения и сбора знаний посредством экспериментов.

Вычисления объединяют разнообразные наборы данных, физические законы и глубокие вычислительные модели для цифрового моделирования сложных систем – от биохимических реакций до уравнений механического напряжения – более точно, быстро, безопасно и экономично.

Вычисления составляют основу больших количественных моделей (LQM). В отличие от LLM, которые экстраполируют исторический текст, пронизанный предубеждениями, ошибками и дезинформацией, LQM обучаются на уравнениях основных принципов, управляющих физикой, химией, биологией и другими количественными областями. Эти модели не только моделируют результаты, но и генерируют проверяемые причинно-следственные объяснения и новые данные, которых нет в современной литературе.

Влияние на различные отрасли является значительным. Например, вместо того, чтобы для разработки новых лекарств требовались десятилетия дорогостоящих лабораторных экспериментов, LQM могут быстро моделировать взаимодействие лекарств, вероятные механизмы действия или токсичность для тысяч потенциальных кандидатов одновременно до начала лабораторных экспериментов. Эти виртуальные эксперименты делают физические исследования гораздо более целенаправленными и эффективными и сводят к минимуму длительные и дорогостоящие методы поиска лекарств методом проб и ошибок. Они также помогают исследователям исследовать химические пространства, которые еще предстоит каталогизировать, или решать сложные, «непреодолимые» условия, в которых прогресс застопорился из-за отсутствия новых данных.

Read more:  Стримерша – «Мисс Германия» | ФАЗ

Синтетические данные для новой инновационной экосистемы

Хотя эта способность генерировать синтетические данные является преобразующей, ее влияние зависит от более широкой инновационной экосистемы. Сегодня доступ к важным наборам данных, необходимым для медицинских или промышленных прорывов, может быть затруднен. Это создает барьер для инноваций в области искусственного интеллекта. Однако сдвиг происходит.

Данные для базовых моделей можно предоставлять через платформы или специальные программы для доступа к ним, что делает новаторские возможности ИИ более доступными без ущерба для интеллектуальной собственности или стандартов конфиденциальности, управления и безопасности данных. Затраты и опыт, необходимые для создания этих моделей, остаются нетривиальными, но доступ на основе платформы демократизирует участие, позволяя процветать коллективному разуму.

Например, совместное использование ресурсов данных, таких как виртуальные популяции пациентов или комбинации белков и лигандов, может позволить исследователям исследовать новые методы лечения в виртуальных испытаниях на более широком генетическом фоне. Этот подход может способствовать развитию методов лечения сложных заболеваний, таких как рак, вакцины от глобальных пандемий или персонализированная медицина. Подобные модели появляются в финансах, материаловедении и энергетике, каждая из которых использует демократизированный доступ для ускорения масштабного решения проблем.

Генерация данных для конкурентного преимущества

Способность генерировать данные — это не просто техническое преимущество, это стратегическое преимущество. Компании или правительства, которые смогут перейти от медленных и дорогостоящих циклов «проектирование-сборка-тестирование» к быстрым итеративным рабочим процессам «моделирование-уточнение-проверка» возьмут на себя инициативу в преобразовании своих отраслей или стран. Вот как это может выглядеть в некоторых крупнейших отраслях мира:

Науки о жизни: Синтетические данные пациентов и модели виртуальных клеток могут существенно сократить сроки и затраты на разработку лекарств, а также помочь предсказать результаты клинических испытаний до включения пациентов в исследование.

Read more:  Наборы плит Yahoo Fantasy x Arena Club 18-й недели — Дрейк Мэй Красный, белый и синий приз для новичков среди карточек погони

Финансы: Моделирование сложных рыночных сценариев позволяет провести надежное стресс-тестирование портфеля, выходя за рамки исторических кризисов и готовясь к действительно новым рискам.

Производство: Цифровое моделирование атомных структур и физических свойств позволяет быстрее выявлять новые соединения, химические вещества, катализаторы или сплавы и производить высококачественные продукты, соответствующие точным критериям эффективности.

Энергия: Превращение уловленного углерода, отходов или малоценных побочных продуктов в ценную продукцию повышает устойчивость и создает новые потоки доходов. Ускорение исследований и разработок в области современных аккумуляторов поддерживает глобальные усилия по электрификации.

Грядущая волна экономического и научного лидерства на базе ИИ будет определяться теми, кто освоит методологии генерации данных, а не теми, кто накапливает наборы исторических данных. Генерация причинно-следственных и достоверных данных станет ключом к ускорению инноваций во всех секторах.

Проектирование будущего, ориентированного на данные

Сейчас мы находимся на переломном этапе: выбираем зависимость от конечных исторических данных или используем возможности, предоставляемые сгенерированными данными. Лидеры бизнеса и правительства должны уделять приоритетное внимание инвестициям в новые методы генерации данных для создания искусственного интеллекта и промышленных экосистем, которые будут более инновационными, конкурентоспособными и устойчивыми. Внедрение архитектуры, ориентированной на данные, имеет важное значение для раскрытия мощи коллективного искусственного интеллекта и достижения будущих прорывов.

Лидеры должны поддерживать этот переход, культивируя таланты, партнерские отношения и структуры, чтобы продвинуть свои организации в новую эпоху, где инновации подпитываются не дефицитом того, что наблюдалось в прошлом, а изобилием того, что возможно в будущем.

2025-12-06 16:30:00


1765080186
#Данных #для #обучения #ИИ #мало #но #нас #есть #решение

По теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.