Чат-боты с искусственным интеллектом упускают насущные вопросы в запросах о женском здоровье

Многие женщины используют ИИ для получения медицинской информации, но ответы не всегда на должном уровне.

Оскар Вонг/Getty Images

Обычно используемые модели искусственного интеллекта не могут точно диагностировать или давать советы по многим вопросам, касающимся женского здоровья, которые требуют срочного внимания.

Тринадцать большие языковые моделисозданный такими компаниями, как OpenAI, Google, Anthropic, Mistral AI и xAI, было получено 345 медицинских запросов по пяти специальностям, включая неотложную медицину, гинекологию и неврологию. Запросы написали 17 исследователей женского здоровья, фармацевтов и врачей из США и Европы.

Ответы рассматривались теми же экспертами. Любые вопросы, на которые модели не ответили, были объединены в сравнительный тест медицинской экспертизы моделей ИИ, который включал 96 запросов.

Во всех моделях примерно на 60 процентов вопросов были даны ответы, которые, по мнению экспертов-людей, были недостаточными для медицинской консультации. Модель GPT-5 оказалась самой эффективной моделью: она не удалась при 47 процентах запросов, а у Ministral 8B был самый высокий уровень ошибок — 73 процента.

«Я видела, как все больше и больше женщин в моем кругу обращаются к инструментам искусственного интеллекта для решения вопросов о здоровье и поддержки принятия решений», — говорит член команды. Виктория-Элизабет Грубер в Lumos AI, фирме, которая помогает компаниям оценивать и улучшать свои собственные модели ИИ. Она и ее коллеги осознали риски, связанные с использованием технологии, которая наследует и усиливает существующие гендерные различия в медицинских знаниях. «Именно это побудило нас создать первый эталон в этой области», — говорит она.

Частота неудач удивила Грубера. «Мы ожидали некоторых расхождений, но что бросалось в глаза, так это степень различий между моделями», — говорит она.

Результаты неудивительны, поскольку модели ИИ обучаются на основе исторических данных, созданных человеком и имеющих встроенные предвзятости, говорит он. Кара Танненбаум в Университете Монреаля, Канада. Они указывают на «очевидную необходимость онлайн-источников здравоохранения, а также профессиональных обществ здравоохранения обновлять свой веб-контент более откровенной информацией, основанной на фактах, связанной с сексом и гендером, которую ИИ может использовать для более точной поддержки женского здоровья», — говорит она.

Read more:  Манос Консолас: Транспондеры устанавливаются для цифрового ТВ-сигнала на Касосе, Лейпсосе, Тилосе и Халки - Новый тендер также для других островов

Джонатан Х. Чен В Стэнфордском университете в Калифорнии говорят, что 60-процентный процент неудач, заявленный исследователями, стоящими за анализом, несколько вводит в заблуждение. «Я бы не стал останавливаться на цифре в 60 процентов, поскольку это была ограниченная выборка, составленная экспертами», — говорит он. «[It] не был задуман как широкая выборка или репрезентация того, о чем регулярно спрашивают пациенты или врачи».

Чен также отмечает, что некоторые сценарии, которые тестирует модель, являются чрезмерно консервативными и имеют высокий потенциальный уровень отказов. Например, если женщина в послеродовом периоде жалуется на головную боль, модель предполагает, что модели ИИ потерпят неудачу, если сразу не заподозрить преэклампсию.

Грубер признает и признает эту критику. «Наша цель заключалась не в том, чтобы заявить, что модели в целом небезопасны, а в том, чтобы определить четкий, клинически обоснованный стандарт оценки», — говорит она. «Показатель намеренно консервативен и более строг в том, как он определяет неудачи, потому что в здравоохранении даже, казалось бы, незначительные упущения могут иметь значение в зависимости от контекста».

Представитель OpenAI заявил: “ChatGPT предназначен для поддержки, а не замены медицинской помощи. Мы тесно сотрудничаем с врачами по всему миру, чтобы совершенствовать наши модели и проводить постоянные оценки, чтобы уменьшить вредные или вводящие в заблуждение ответы. Наша последняя модель GPT 5.2 является нашей самой сильной в плане учета важного пользовательского контекста, такого как пол. Мы серьезно относимся к точности результатов модели, и хотя ChatGPT может предоставить полезную информацию, пользователи всегда должны полагаться на квалифицированных врачей в принятии решений по уходу и лечению”. Остальные компании, чьи ИИ были протестированы, не ответили на запрос. Новый учёный запрос на комментарий.

Read more:  Звезды MCU хотели, чтобы легенда боевиков произнесла эту фразу

Темы:

2026-01-07 10:00:00


1767785141
#Чатботы #искусственным #интеллектом #упускают #насущные #вопросы #запросах #женском #здоровье

Читайте также

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.