Интернет-архив поставил перед собой цель хранить все веб-сайты по всему миру; крупнейший в мире архив Всемирной паутины сейчас содержит более триллиона отдельных страниц. Там же хранятся многочисленные новостные сайты – но многие медиакомпании сейчас сопротивляются этому архивированию, как написал вчера в статье Фонд журналистики Нимана.
Причиной является обеспокоенность тем, что языковые модели ИИ, подобные моделям OpenAI и Google, обучаются с помощью таких новостных статей без приобретения соответствующих лицензий. Вместо продажи подписок клиентам и лицензий компаниям есть опасения, что весь контент можно будет получить бесплатно через архив.
От «Guardian» до «New York Times»
Например, «Гардиан» блокирует не только автоматических ботов, которые читают новостные статьи по наборам данных ИИ прямо на своем сайте, но и Интернет-архив. Financial Times и New York Times также подтвердили Ниману, что Интернет-архиву не позволяют читать статьи.
«Если издатели ограничат работу таких библиотек, как Интернет-архив, у общественности будет меньше доступа к историческим записям», — заявил Брюстер Кале, основатель Интернет-архива, Фонду Нимана.
Ограничение во многих случаях не является обязательным
По словам Нимана, сотни других медиа-компаний также, вероятно, будут препятствовать автоматическому чтению Интернет-архивом и другими провайдерами. Для этого был прочитан текстовый файл, который хранится на многих веб-серверах и позволяет средствам автоматизации разрешать или запрещать доступ к данным.
Однако этот файл «Robots.txt» не имеет юридической силы — но на протяжении десятилетий он считался в сети неписаным законом, регулирующим автоматизированную обработку данных. Фактически, во многих случаях можно выдать себя за обычный веб-браузер и таким образом обойти ограничения.
2026-01-29 12:39:00
1769690441
#Беспокойство #по #поводу #ИИ #многие #медиакомпании #блокируют #интернетархивы
По теме

