Microsoft поднимает планку: более разумный способ измерения ИИ для кибербезопасности

ExCyTIIn-Скамейка это новейший продукт Microsoft с открытым исходным кодом инструмент сравнительного анализа, предназначенный для оценки того, насколько хорошо системы искусственного интеллекта выполняют реальные расследования кибербезопасности.1 Он помогает бизнес-лидерам оценивать языковые модели, моделируя реалистичные сценарии киберугроз и предоставляя четкое и действенное представление о том, как эти инструменты решают сложные проблемы. В отличие от предыдущих тестов, которые концентрировались на мелочах или статических знаниях об угрозах, этот тест оценивает агенты ИИ в многоэтапных, насыщенных данными и многоэтапных сценариях кибератак в моделируемом центре операций безопасности (SOC) в Microsoft Azure. Он включает в себя 57 таблиц журналов из Microsoft Сентинел и сопутствующие услуги, чтобы отразить масштаб, шум и сложность реальных инцидентов и операций SOC.2

Почему ExCyTIn-Bench важен для бизнеса

Для директоров по информационной безопасности (CISO), ИТ-руководителей и покупателей ExCyTIn-Bench предлагает четкий и объективный способ оценить возможности ИИ для обеспечения безопасности. Речь идет не только о точности отчетов о киберугрозах, мелочах или игрушечных симуляциях, но и о том, насколько хорошо ИИ может исследовать, адаптировать и объяснять свои выводы перед лицом реальных киберугроз. По мере усложнения кибератак такие инструменты, как ExCyTIn-Bench, помогают организациям выбирать решения, которые действительно улучшают обнаружение, реагирование и устойчивость.

Microsoft использует эту структуру внутри компании, чтобы усилить свои функции безопасности на базе искусственного интеллекта и проверить их способность противостоять реальным кибератакам. Наши собственные модели, ориентированные на безопасность, опираются на обратную связь от ExCyTIn для выявления слабых мест в логике обнаружения, возможностях инструментов и навигации по данным. Для более широкой интеграции мы также сотрудничаем с такими продуктами безопасности, как Второй пилотный проект безопасности MicrosoftMicrosoft Sentinel и Защитник Майкрософт для оценки и предоставления отзывов об их функциях ИИ. Кроме того, владельцы продуктов Microsoft Security могут отслеживать эффективность различных моделей и их стоимость, что позволяет им выбирать модели, подходящие для конкретных функций.

Read more:  Проекты ИТ-форм требуют раскрытия информации арендаторами и арендодателями для подачи заявления о налоговом вычете | Новости финансов

Чем ExCyTIn-Bench превосходит традиционные тесты

В отличие от традиционных тестов3,4 которые основаны на вопросах с несколькими вариантами ответов, которые часто допускают догадки, ExCyTIn-Bench использует инновационную, принципиальную методологию для создания вопросов и ответов от графики расследования угроз. Человеческие аналитики концептуализируют расследования угроз, используя графы инцидентов, в частности, двудольные графы объектов оповещения.5 Они служат основой истины, поддерживая создание объяснимых пар вопросов и ответов, основанных на достоверных данных безопасности. Это позволяет провести тщательный анализ качество стратегии, а не только окончательные ответы. Даже недавние отраслевые публикации, такие как CyberSOCEval,3 сосредоточьтесь на упаковке реалистичных сценариев SOC и оценке того, как модели исследуют в них статические доказательства. ExCyTIn использует другой подход как к дизайну, так и к технической реализации, помещая агент в контролируемая среда Azure SOC: где агент запрашивает живые журнальные таблицы, переходы между источниками данных и планирование многоэтапных расследований.

В результате ExCyTIn оценивает всестороннее рассуждение процессы, включая декомпозицию целей, использование инструментов и синтез доказательств, в условиях ограничений, имитирующих рабочий процесс аналитика. Определяя строгие основные истины и расширяемые структуры, ExCyTIn-Bench позволяет реалистичные, многоходовые, агентные эксперименты, сотрудничество и постоянное самосовершенствованиевсе усилено проверяемые, детальные механизмы вознаграждения для киберзащиты на базе искусственного интеллекта.6

Инновации ExCyTIn-Bench, обеспечивающие стратегическую ценность

  • Реалистичная оценка безопасности. В отличие от большинства тестов с открытым исходным кодом,3,4 ExCyTIn-Bench отражает сложность и неоднозначность реальных киберрасследований. Перед агентами искусственного интеллекта стоит задача анализировать зашумленные многотабличные данные безопасности, создавать сложные запросы и выявлять индикаторы компрометации (IoC), что отражает работу людей-аналитиков SOC.
  • Прозрачные, действенные показатели. Тест предоставляет подробные, пошаговые сигналы вознаграждения за каждое следственное действие по базовым двоичным показателям успеха и неудач, найденным в текущих тестах. Эта прозрачность помогает организациям понять не только то, на что способна модель, но и то, как она приходит к своим выводам, что имеет решающее значение для действенности, доверия и соответствия требованиям.
  • Ускорение инноваций. ExCyTIn-Bench имеет открытый исходный код и предназначен для совместной работы. Исследователи и поставщики по всему миру могут использовать его для тестирования, сравнения и улучшения новых моделей, способствуя быстрому прогрессу в области автоматизированной киберзащиты.
  • Персонализированные тесты (скоро). Создавайте индивидуальные тесты по расследованию киберугроз, специфичные для угроз, возникающих в каждом арендаторе клиента.
Read more:  За пост европейского прокурора претендуют семеро, в том числе заместитель Гешева и постоянный кандидат («Обзор»).

Последние результаты: языковые модели становятся умнее

Недавние оценки показывают, что новейшие модели добиваются значительных успехов:

  • GPT-5 (Высокое мышление) лидирует со средним вознаграждением 56,2%.превосходя предыдущие модели и демонстрируя ценность расширенных рассуждений для задач безопасности.
  • Меньшие модели с эффективным рассуждением по цепочке мыслей (ЦП).— например, GPT-5-mini — теперь конкурируют с более крупными моделями, предлагая высокую производительность при более низкой цене.
  • Явные рассуждения имеют значение— Более низкие настройки рассуждения в GPT-5 снижают производительность почти на 19 %, подчеркивая, что глубокие, пошаговые рассуждения необходимы для сложных расследований.
  • Модели с открытым исходным кодом сокращают разрыв с собственными решениями, делающими качественную автоматизацию безопасности более доступной.
  • Новые модели приближаются к лучшим технологиям CoT (ReAct, отражение и BoN — 56,3%), но не превосходите их, предлагая при выводе сопоставимые рассуждения.

Примите участие

ExCyTIIn-Скамейка имеет открытый исходный код и доступен бесплатно. Разработчикам моделей и командам безопасности предлагается внести свой вклад, провести тестирование и поделиться результатами через официальный сайт. Репозиторий GitHub. По вопросам или возможностям партнерства обращайтесь к команде по адресу [email protected].

Спасибо команде MSECAI Benchmarking за то, что помогли этому стать реальностью.

Чтобы узнать больше о решениях Microsoft Security, посетите наш веб-сайт. Добавьте в закладки Блог о безопасности чтобы быть в курсе наших экспертных репортажей по вопросам безопасности. Также подписывайтесь на нас в LinkedIn (Microsoft Безопасность) и X (@MSFTSecurity) для получения последних новостей и обновлений в области кибербезопасности.


1Сравнительный анализ агентов LLM по расследованию киберугроз

2https://huggingface.co/datasets/anandmudgerikar/excytin-bench

3CyberSOCEval: Сравнительный анализ возможностей LLM для анализа вредоносного ПО и анализа угроз

4[2406.07599] CTIBench: эталон для оценки LLM в области анализа киберугроз

Read more:  Государственная банкетная речь короля Чарльза для Дональда Трампа в полном объеме | Королевский | Новости

5Графики расследования инцидентов или угроз отображают многоэтапные атаки путем объединения предупреждений, событий и индикаторов компрометации (IoC) в единое представление. Узлы обозначают оповещения (например, подозрительные загрузки файлов) или объекты (например, учетные записи пользователей), а края фиксируют их взаимоотношения (например, фишинговое электронное письмо, которое запускает вредоносную загрузку).

6[2507.14201] ExCyTIn-Bench: оценка агентов LLM при расследовании киберугроз


2025-10-14 17:13:00


1760469057
#Microsoft #поднимает #планку #более #разумный #способ #измерения #ИИ #для #кибербезопасности

Ещё по этой теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.