HealthBench: объяснение результатов OpenAI в области медицинского ИИ и их значение для клинического ИИ
OpenAI описывает HealthBench как «новый тест, предназначенный для лучшего измерения возможностей систем искусственного интеллекта в области здравоохранения». Он выставляет оценки на основе набора из более чем 48 000 критериев, написанных врачами и имеющих отношение к разговору. Эти разговоры могут относиться к одной из 7 категорий, определенных HealthBench: от направления к специалистам в случае неотложной помощи и задач по сбору данных о состоянии здоровья до запроса контекста или выявления неопределенности. Кроме того, каждый критерий дополнительно оценивается по таким факторам, как точность, ясность и полнота, что включает рекомендации по следующим лучшим действиям.
В исследовательской статье, сопровождающей выпуск HealthBench, OpenAI сообщает об «стабильном начальном прогрессе» … и более быстрые недавние улучшения» в производительности и безопасности модели.
Независимые исследования были более неоднозначными. В одной газете говорится HealthBench «надежен и хорошо соответствует рейтингам врачей» но отмечает, что ему не хватает «оценки клинического взаимодействия в реальном времени или измерения последующих клинических результатов». Во второй статье HealthBench описывается как «значительный прогресс в сравнительном анализе медицинского ИИ», но отмечает недостаточную представленность редких заболеваний и неспособность оценить продольные рабочие процессы, что «ограничивает понимание влияния ИИ на весь континуум медицинской помощи».
Гейн говорит, что важно помнить, что такие тесты, как HealthBench, не являются прямой заменой реальные доказательства. «Оценки отражают производительность в смоделированных средах и должны интерпретироваться наряду с реальными локальными испытаниями, интеграцией рабочих процессов и безопасностью», — говорит она. «Системы здравоохранения не должны полностью полагаться на критерии для принятия решений о развертывании; они должны быть одним из многих показателей, используемых для информирования о закупках ИИ».
Вопросы корпоративного развертывания: Клод, Gemini и OpenAI
Между тем, в последние месяцы каждый из основных игроков LLM выпустил набор продуктов на базе искусственного интеллекта для больниц и систем здравоохранения. Каждое предложение немного отличается, и организациям важно понимать этот нюанс при оценке инструментов искусственного интеллекта корпоративного уровня. «Самое главное — это то, как решение действует на ваших уникальных пациентов, контекст использования, данные и рабочие процессы», — говорит Гейн.
Клод для здравоохранения. Клод может использовать «стандартные отраслевые системы и базы данных», а также Национальный реестр идентификаторов поставщиков услуг, кодовую базу МКБ-10 и базы данных определения покрытия. Организации могут развертывать агенты ИИ для предварительной авторизации и Ресурсы по быстрой совместимости в здравоохранении обмен данными, которые предоставляют возможности для автоматизации ряда административных процессов.
Близнецы 3.0. Аашима Гупта, глобальный директор по здравоохранению компании Google Облакопредполагает в сообщении LinkedIn, что Отличительная черта Близнецов — мультимодальность.или способность объединять «текст, голос, изображения, сигналы, сканы, данные геномики, клинические рекомендации и операционные данные». Это можно использовать для поддержки рекомендаций по следующим лучшим действиям. Gemini 3.0 также включает в себя агенты искусственного интеллекта для автоматизации рабочих процессов в бизнес-приложениях.
Нажмите на баннер ниже подписаться на ЗдоровьеТехеженедельный информационный бюллетень.
2026-03-03 15:41:00
1772993050
#ИИ #соответствующий #требованиям #HIPAA #как #работают #OpenAI #HealthBench #Claude
Читайте также

