Допустим, ученый-эколог изучает, связано ли воздействие загрязнения воздуха с более низким весом при рождении в конкретном округе.
Они могли бы обучить модель машинного обучения, чтобы оценить величину этой связи, поскольку методы машинного обучения особенно хороши для изучения сложных отношений.
Стандартные методы машинного обучения превосходно справляются с прогнозами и иногда обеспечивают неопределенности, такие как доверительные интервалы, для этих прогнозов. Однако они обычно не предоставляют оценок или доверительных интервалов при определении связи двух переменных. Другие методы были разработаны специально для решения этой проблемы ассоциации и обеспечения доверительных интервалов. Но в пространственных условиях исследователи Массачусетского технологического института обнаружили, что эти доверительные интервалы могут быть совершенно неверными.
Когда такие переменные, как уровни загрязнения воздуха или количество осадков, изменяются в разных местах, общие методы построения доверительных интервалов могут претендовать на высокий уровень достоверности, хотя на самом деле оценка полностью не отражает фактическое значение. Эти ошибочные доверительные интервалы могут ввести пользователя в заблуждение и заставить его доверять неудачной модели.
Выявив этот недостаток, исследователи разработали новый метод, предназначенный для создания достоверных доверительных интервалов для задач, связанных с данными, которые различаются в пространстве. В моделировании и экспериментах с реальными данными их метод был единственным методом, который постоянно генерировал точные доверительные интервалы.
Эта работа может помочь исследователям в таких областях, как наука об окружающей среде, экономика и эпидемиология, лучше понять, когда следует доверять результатам определенных экспериментов.
“Существует очень много проблем, в которых люди заинтересованы в понимании явлений в космосе, таких как погода или управление лесами. Мы показали, что для этого широкого класса проблем существуют более подходящие методы, которые могут помочь нам повысить производительность, лучше понять, что происходит, и получить более надежные результаты”, – говорит Тамара Бродерик, доцент кафедры электротехники и компьютерных наук Массачусетского технологического института (EECS), член Лаборатории систем информации и принятия решений (LIDS) и Института данных, систем и Society, филиал Лаборатории компьютерных наук и искусственного интеллекта (CSAIL) и старший автор этого документа. изучать.
К Бродерику в работе присоединяются соавторы Дэвид Р. Берт, постдок, и Ренато Берлингьери, аспирант EECS; и Стивен Бейтс, доцент EECS и член LIDS. Исследование было недавно представлено на конференции по нейронным системам обработки информации.
Неверные предположения
Пространственная ассоциация предполагает изучение того, как переменная и определенный результат связаны в географической области. Например, можно было бы захотеть изучить, как древесный покров в Соединенных Штатах связан с высотой над уровнем моря.
Чтобы решить проблему такого типа, ученый мог бы собрать данные наблюдений из многих мест и использовать их для оценки ассоциации в другом месте, где у него нет данных.
Исследователи из Массачусетского технологического института поняли, что в этом случае существующие методы часто генерируют совершенно неправильные доверительные интервалы. Модель может утверждать, что с 95-процентной уверенностью ее оценка отражает истинную взаимосвязь между древесным покровом и высотой над уровнем моря, хотя она вообще не отражает эту взаимосвязь.
Изучив эту проблему, исследователи определили, что предположения, на которых основаны эти методы доверительного интервала, не работают, когда данные различаются в пространстве.
Предположения подобны правилам, которым необходимо следовать, чтобы гарантировать достоверность результатов статистического анализа. Общие методы создания доверительных интервалов работают при различных предположениях.
Во-первых, они предполагают, что исходные данные, то есть данные наблюдений, собранные для обучения модели, независимы и одинаково распределены. Это предположение подразумевает, что вероятность включения в данные одного местоположения не влияет на то, будет ли включено другое. Но, например, датчики воздуха Агентства по охране окружающей среды США (EPA) размещаются с учетом расположения других датчиков воздуха.
Во-вторых, существующие методы часто предполагают, что модель совершенно правильна, но на практике это предположение никогда не бывает верным. Наконец, они предполагают, что исходные данные аналогичны целевым данным, которые необходимо оценить.
Но в пространственных настройках исходные данные могут фундаментально отличаться от целевых данных, поскольку целевые данные находятся в другом месте, чем то место, где были собраны исходные данные.
Например, учёный может использовать данные мониторов загрязнения EPA для обучения модели машинного обучения, которая может прогнозировать последствия для здоровья в сельской местности, где нет мониторов. Но мониторы загрязнения EPA, скорее всего, будут размещены в городских районах, где больше транспорта и тяжелой промышленности, поэтому данные о качестве воздуха будут сильно отличаться от данных о качестве воздуха в сельской местности.
В этом случае оценки связи с использованием городских данных страдают от систематической ошибки, поскольку целевые данные систематически отличаются от исходных данных.
Гладкое решение
Новый метод создания доверительных интервалов явно учитывает эту потенциальную погрешность.
Вместо того чтобы предполагать, что исходные и целевые данные схожи, исследователи предполагают, что данные плавно изменяются в пространстве.
Например, при загрязнении воздуха мелкими частицами нельзя ожидать, что уровень загрязнения в одном городском квартале будет резко отличаться от уровня загрязнения в следующем городском квартале. Вместо этого уровень загрязнения будет плавно снижаться по мере удаления от источника загрязнения.
“Для подобных задач предположение о пространственной гладкости является более подходящим. Оно лучше соответствует тому, что на самом деле происходит с данными”, – говорит Бродерик.
Когда они сравнили свой метод с другими распространенными методами, они обнаружили, что только он может последовательно создавать надежные доверительные интервалы для пространственного анализа. Кроме того, их метод остается надежным даже тогда, когда данные наблюдений искажены случайными ошибками.
В будущем исследователи хотят применить этот анализ к различным типам переменных и изучить другие приложения, где он мог бы дать более надежные результаты.
Это исследование частично финансировалось за счет начального гранта MIT Social and Ethical Responsibilities of Computing (SERC), Управления военно-морских исследований, компаний Generali, Microsoft и Национального научного фонда (NSF).
2025-12-12 05:00:00
1765532992
#Новый #метод #повышает #надежность #статистических #оценок #Новости #Массачусетского #технологического #института
По теме
