Канадская группа защиты детей обнаружила оскорбительный контент в академическом наборе данных искусственного интеллекта | Марк Руссо | Октябрь 2025 г.

Нажмите Enter или нажмите, чтобы просмотреть изображение в полном размере

(Ссылка из моего предыдущего поста: AI-наблюдение Google стерло 130 тысяч моих файлов — суровое напоминание: облако не ваше)

Когда моя учетная запись Google была заблокирована, я был в середине стендовое тестирование собственной модели обнаружения NSFW Я создал для своего приложения Кошелек (iOS, андроид) — инструмент, предназначенный для автоматического обнаружения и фильтрации контента для взрослых. Набор данных, который я анализировал, был общедоступен и широко используется для академических исследований в области ИИ.

Осознав, что произошло, я немедленно уведомил Google об источнике набора данных и связался с Национальный центр пропавших без вести и эксплуатируемых детей (NCMEC). Я также начал публично документировать все — в своем блоге, публикациях в социальных сетях и по электронной почте — чтобы вести прозрачную запись.

Сначала я искренне верил, что это ложное срабатываниепоскольку набор данных взят из академического репозитория.
Аналогичная ситуация произошла с Наборы данных LAIONбольшие коллекции изображений, используемые при обучении ИИ. Позже выяснилось, что некоторые версии включают материалы о сексуальном насилии над детьми (CSAM). Канадский центр защиты детей (C3P) был частью группы, которая исследовала эти базы данных.

(Для контекста: Google использовал версию, полученную из LAION-5B, которая никогда не анализировалась на предмет содержания CSAM.)

Обращение к следователям

В середине сентября я обратился напрямую к Q3P. Вскоре после этого со мной связался Жак Маркудиректор по исследованиям и аналитике. Я поделился своей полной историей и всеми техническими подробностями набора данных.

К середине октября г-н Марку подтвердил, что его команда нашла подтвержденные материалы о сексуальном насилии и эксплуатации детей (CSAEM) в наборе данных — 320 изображений из примерно 700 000.

Read more:  Джанель Джеймс о том, почему в «Эбботт Элементарная школа» были проблемы с кастингом детей

Это примерно 0,00045 набора данных – или менее одного изображения из двух тысяч.

Ложные срабатывания и превышение полномочий

Несмотря на такое соотношение, Google удалил около 137 000 моих файлов. — в сотни раз больше, чем фактическое подтвержденное количество CSAM.

Итак, обе вещи могут быть правдой:

  • ДаC3P нашел CSAEM.
  • Носистема Google также производит массовые ложные срабатывания.

Один Реддит пользователь даже подтвердил, что изображение помечено от Google не был CSAM. Это означает, что по крайней мере один файл был явным ложноположительным, что позволяет предположить, что из 137 000 удаленных файлов могут быть еще десятки или даже сотни.

Когда г-н Марку сообщил мне, что сообщение в блоге C3P о наборе данных NudeNet вот-вот будет опубликовано, я спросил, могут ли они проверить эти конкретные спорные изображения. К сожалению, это противоречит их политике.

Тем не менее, цифры говорят сами за себя. 320 проверенных файлов из всего 700 000еще 137 000 удалено с моего аккаунта. Масштаб несоответствия убедительно свидетельствует о том, что система обнаружения Google чрезмерный запуск — потенциально сметая огромное количество доброкачественного материала.

Кто на самом деле нашел проблему

Важно внести ясность: Google не инициировал более широкое расследование.
Это началось с мое обращение к C3P.

Несмотря на заявления о наличии надежных систем обнаружения и эскалации CSAM, Google так и не связался с хостинговым сайтом, даже после того, как я сообщил о происхождении набора данных. Файлы оставались в сети более два месяца — пока не вмешался C3P.

Тем временем я потерял доступ ко всем своим учетным записям Google, включая электронную почту, файлы и личные данные, хотя мои действия были непреднамеренный и в конечном итоге помог удалить вредоносный контент из Интернета.

Read more:  Группа поддержки: где они сейчас?

Этика и ответственность

Отчет C3P завершается важным напоминанием:

«Поскольку страны продолжают инвестировать в развитие технологий искусственного интеллекта, крайне важно, чтобы исследователи и промышленность учитывали этику своей работы на каждом этапе пути».

Я не мог не согласиться.
Я считаю, что действовал этично: я выявил проблему, сообщил о ней и добился удаления вредоносного контента.

Но справедливо спросить: Действовал ли Google этично?

Возможно, они отправляли автоматические отчеты в NCMEC, но, насколько мне известно, они никогда не связывались с веб-сайтом, на котором размещались данные. Удаление произошло только после мой охват.

Большая картина

Реальность такова, что CSAM может появиться в любом большом очищенном наборе данных.особенно те, которые собраны для исследования ИИ. Ни один ответственный исследователь не хочет, чтобы этот контент был рядом с его работой.

Но то, как Google справился с моим делом — приостановив мою учетную запись, удалив более 130 000 файлов и отрезав доступ ко всему — посылает опасный сигнал.

Если так относятся к исследователям,
кто сообщит о следующей проблеме?

2025-10-22 22:44:00


1761173525
#Канадская #группа #защиты #детей #обнаружила #оскорбительный #контент #академическом #наборе #данных #искусственного #интеллекта #Марк #Руссо #Октябрь

Ещё по этой теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.