Ki-firewall против атомных бомб: антропические строительны цифровые защитные барьеры

25. август 2025

Антропик разрабатывает фильтр ИИ против ядерных угроз с властями США. Новая технология блокирует опасные запросы о ядерном оружии с точностью 95% и устанавливает новые стандарты для безопасности искусственного интеллекта.

Кошмар экспертов по безопасности звучит просто: террорист спрашивает бота в чате ИИ о подробных инструкциях по строительству атомной бомбы и получает ее. То, что ранее звучало как сценарий мрачного будущего, становится все более реалистичным благодаря передовым системам ИИ.

Именно этот риск теперь обращается к антропическому инструменту с новаторским инструментом безопасности.

Цифровой брандмауэр против ядерных угроз

Anpropic, компания по искусственному искусству, стоящему за конкурентом CHATGPT Claude, разработала механизм безопасности в сотрудничестве с правительством США, который предотвращает злоупотребление его моделями ИИ для развития ядерного оружия. Согласно «Semafor», инструмент был создан в одном сотрудничестве с Национальной администрацией ядерной безопасности (NNSA).

Фильтр, известный как «классификатор», потенциально опасные разговоры, такие как запросы о построении ядерных реакторов, может автоматически идентифицировать и блокировать. С растущей эффективностью моделей ИИ следует внимательно наблюдать, можете ли вы передать опасные технические знания, которые могут угрожать национальной безопасности, объясняет антроповые в соответствии с «WebPronews». Проект появился из упражнений «Красной команды» с Министерством энергетики США, которое началось в 2024 году.

Технология с высоте 95%

Разработанный классификатор работает аналогично фильтру по электронной почте и определяет угрозы в режиме реального времени. Как сообщает «Первый пост», система может распознавать с почти 95 -процентной точностью, общается ли пользователь с ботом искусственного интеллекта со злонамеренным намерением.

В тестах фильтр специально определил 94,8% запросов о ядерном оружии, в то время как 5,2% запросов были неправильно классифицированы как опасные. Особая вещь: классификатор различает безвредные запросы, такие как студенты или исследователи, и потенциально вредные разговоры, которые могут способствовать распространению оружия. Это обеспечивает законное научное и образовательное использование, в то время как злоупотребление предотвращается одновременно.

Read more:  Голодовка политзаключенного против изоляции в турецких тюрьмах длится 350 дней

Страница 1/2

2025-08-25 13:31:00


1756160603
#Kifirewall #против #атомных #бомб #антропические #строительны #цифровые #защитные #барьеры

Продолжение темы

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.