Обзор трубопровода M-CBM. Кредит: Изучение моделей узких мест концепции на основе механистических объяснений. https://openreview.net/pdf?id=gdEWoxhb70
В таких важных областях, как медицинская диагностика, пользователи часто хотят знать, что заставило модель компьютерного зрения сделать определенный прогноз, чтобы они могли решить, стоит ли доверять ее результатам. Моделирование концептуальных узких мест — это один из методов, который позволяет системам искусственного интеллекта объяснять процесс принятия решений. Эти методы заставляют модель глубокого обучения использовать набор понятных людям понятий для прогнозирования. В новом исследовании ученые-компьютерщики Массачусетского технологического института разработали метод, который позволяет модели добиться большей точности и более четких и кратких объяснений.
Концепции, используемые в модели, обычно заранее определяются экспертами. Например, врач может предложить использовать такие понятия, как «группы коричневых точек» и «разнообразная пигментация», чтобы предсказать, что на медицинском изображении видна меланома.
Однако ранее определенные концепции могут оказаться нерелевантными или не иметь достаточной детализации для конкретной задачи, что снижает точность модели. Новый метод извлекает концепции, которые модель уже изучила, пока ее обучали выполнять эту конкретную задачу, и заставляет модель использовать их, обеспечивая более качественные объяснения, чем стандартные модели с узкими местами понятий.
В этом подходе используется пара специализированных моделей машинного обучения, которые автоматически извлекают знания из целевой модели и переводят их в понятные концепции. В конце концов, их метод может преобразовать любую предварительно обученную модель компьютерного зрения в модель, которая может использовать концепции для объяснения своих рассуждений.
«В некотором смысле мы хотим иметь возможность читать мысли этих моделей компьютерного зрения. Концептуальная модель узкого места — это один из способов для пользователей сказать, о чем думает модель и почему она делает определенный прогноз. Поскольку наш метод использует лучшие концепции, он может привести к более высокой точности и в конечном итоге улучшить подотчетность моделей искусственного интеллекта черного ящика», — говорит ведущий автор Антонио Де Сантис, аспирант Миланского политехнического университета, который завершил это исследование, будучи приглашенным аспирантом в Лаборатории компьютерных наук и искусственного интеллекта (CSAIL) в Массачусетский технологический институт.
К нему присоединяются на бумага о работе Шрасинг Тонг С.М., доктор философии, Марко Брамбилла, профессор компьютерных наук и инженерии Миланского политехнического университета, и старший автор Лалана Кагал, главный научный сотрудник CSAIL. Исследование будет представлено на Международной конференции по обучению представлений.
Устранение узкого места
Концептуальные модели узких мест (CBM) — популярный подход для улучшения объяснимости ИИ. Эти методы добавляют промежуточный шаг, заставляя модель компьютерного зрения предсказывать концепции, присутствующие в изображении, а затем использовать эти концепции для окончательного прогноза.
Этот промежуточный шаг, или «узкое место», помогает пользователям понять логику модели.
Например, модель, определяющая виды птиц, могла бы выбрать такие понятия, как «желтые ноги» и «синие крылья», прежде чем предсказывать ласточку.
Но поскольку эти концепции часто генерируются заранее людьми или большими языковыми моделями (LLM), они могут не соответствовать конкретной задаче. Кроме того, даже если модель имеет набор заранее определенных концепций, она все равно иногда использует нежелательную полученную информацию, что является проблемой, известной как утечка информации.
«Эти модели обучены максимизировать производительность, поэтому они могут тайно использовать концепции, о которых мы не знаем», — объясняет Де Сантис.
У исследователей из Массачусетского технологического института была другая идея: поскольку модель была обучена на огромном объеме данных, она, возможно, усвоила концепции, необходимые для создания точных прогнозов для конкретной поставленной задачи. Они стремились создать CBM, извлекая существующие знания и преобразуя их в текст, понятный человеку.
На первом этапе их метода специализированная модель глубокого обучения, называемая разреженным автокодировщиком, выборочно берет наиболее важные функции, изученные моделью, и реконструирует их в несколько концепций. Затем мультимодальный LLM описывает каждое понятие простым языком.
Этот мультимодальный LLM также аннотирует изображения в наборе данных, определяя, какие концепции присутствуют и отсутствуют в каждом изображении. Исследователи используют этот аннотированный набор данных для обучения модуля «узких мест» в распознавании концепций.
Они включают этот модуль в целевую модель, заставляя ее делать прогнозы, используя только набор изученных концепций, извлеченных исследователями.
Контроль концепций
При разработке этого метода они преодолели множество проблем: от обеспечения правильности аннотированных концепций LLM до определения того, определил ли разреженный автокодировщик концепции, понятные человеку.
Чтобы модель не использовала неизвестные или нежелательные концепции, они ограничивают ее использованием только пяти концепций для каждого прогноза. Это также заставляет модель выбирать наиболее подходящие концепции и делает объяснения более понятными.
Когда они сравнили свой подход с современными методами CBM для решения таких задач, как прогнозирование видов птиц и выявление поражений кожи на медицинских изображениях, их метод достиг высочайшей точности, обеспечивая при этом более точные объяснения.
Их подход также позволил создать концепции, более применимые к изображениям в наборе данных.
«Мы показали, что извлечение концепций из исходной модели может превзойти другие CBM, но все еще существует компромисс между интерпретируемостью и точностью, который необходимо решить. Модели черного ящика, которые не поддаются интерпретации, по-прежнему превосходят наши», — говорит Де Сантис.
В будущем исследователи хотят изучить потенциальные решения проблемы утечки информации, возможно, путем добавления дополнительных модулей, определяющих узкие места, чтобы нежелательные концепции не могли просочиться. Они также планируют расширить свой метод, используя более крупный мультимодальный LLM для аннотирования большего набора обучающих данных, что может повысить производительность.
«Я воодушевлен этой работой, потому что она продвигает интерпретируемый ИИ в очень многообещающем направлении и создает естественный мост к символическому ИИ и графам знаний», — говорит Андреас Хото, профессор и заведующий кафедрой науки о данных в Вюрцбургском университете, который не участвовал в этой работе.
«Выявив узкие места в концепциях из собственных внутренних механизмов модели, а не только из концепций, определенных человеком, он предлагает путь к объяснениям, которые более соответствуют модели, и открывает множество возможностей для последующей работы со структурированными знаниями».
Дополнительная информация
Антонио Де Сантис и др. Модели «узких мест» концепции обучения на основе механистических объяснений. openreview.net/pdf?id=gdEWoxhb70
Предоставлено
Массачусетский технологический институт
Эта история переиздана с любезного разрешения MIT News (web.mit.edu/newsoffice/), популярный сайт, освещающий новости об исследованиях, инновациях и преподавании MIT.
Цитирование: Улучшение способности моделей ИИ объяснять свои прогнозы (9 марта 2026 г.), получено 10 марта 2026 г. с https://techxplore.com/news/2026-03-ai-ability.html.
Этот документ защищен авторским правом. За исключением любых добросовестных сделок в целях частного изучения или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Содержимое предоставлено исключительно в информационных целях.
2026-03-09 15:20:00
1773122122
#Улучшение #способности #моделей #ИИ #объяснять #свои #прогнозы
Продолжение темы

