1768721211
2026-01-18 06:40:00
Актер Руперт Гринт (слева), Эмма Уотсон (справа) и Дэниел Рэдклифф (справа) на съемках фильма «Гарри Поттер и узник Азкабана», Лондон, Англия, 2003 год (Фото Murray Close/Getty Images)
Гетти Изображения
При инвестировании в любую компанию или отрасль — или если ваш доход зависит от одной из них — важно знать потенциальные риски. Генеративный искусственный интеллект, по крайней мере в виде больших языковых моделей, таких как ChatGPT, имеет свои слабые стороны. Новое исследование показывает серьезную проблему.
Известный пример риска в отрасли искусственного интеллекта
Примером риска в отрасли является то, что продавцы инвестируют и предлагают друг другу предварительные кредиты, что по сути похоже на построение отрасли на формах долга.
По оценкам BNY Mellon, в 2025 году такие поставщики облачной инфраструктуры, как Amazon, Alphabet/Google, Meta, Microsoft и Oracle, привлекли $121 млрд нового долгапричем более 90 миллиардов долларов из этой суммы было собрано в четвертом квартале года. Согласно отчету, кредитные спреды расширились у всех компаний, особенно у Oracle и Meta. Инвесторы все чаще обращаются к кредитно-дефолтным свопам (которые стали одним из крупнейших взрывов во время мирового финансового кризиса).
BNY Mellon также отметил: «Аналитики UBS предсказывают, что в 2026 году новые долги глобальных компаний составят 900 миллиардов долларов. В дальнейшем, по прогнозам Morgan Stanley и JP Morgan, технологическому сектору, возможно, придется выпустить новые долговые обязательства на сумму до 1,5 триллиона долларов в течение следующих нескольких лет для финансирования строительства ИИ и инфраструктуры центров обработки данных».
Авторское право лежит в основе того, что делают LLM
В защиту, которую использует индустрия, заключается в том, что программное обеспечение не сохраняет оригинальные произведения, и они откладываются. Вместо этого системы хранят сложные взаимосвязи между словами из многих опубликованных материалов, используя сложные статистические методы для выбора подходящего сообщения пользователю. Предположительно, восстановление блоков письма, аналогичных оригиналам, встречается редко.
Исследования показывают воспроизводство
По крайней мере, так предполагалось. Новое исследование Ахмеда Ахмеда, Санми Койеджо и Перси Ляна из Стэнфордского университета и А. Федера Купера из Стэнфордского и Йельского университетов углубилось в проблему, которая возникла, когда Нью-Йорк Таймс подала в суд OpenAI (создатели ChatGPT) и Microsoft. Один из пункты в жалобе было следующее: «Используемые LLM, содержащие копии контента Times, инструменты GenAI Ответчиков могут генерировать выходные данные, которые дословно воспроизводят контент Times, точно резюмируют его и имитируют его выразительный стиль, о чем свидетельствует множество примеров».
Затем следует новое исследование с «итеративными предложениями продолжения попытки извлечь книгу», о которой идет речь. Они опробовали это на четырех серийных LLM: Claude 3.7 Sonnet, GPT-4.1, Gemini 2.5 Pro и Grok 3.
Работы, защищенные авторским правом, не хотят быть бесплатными
Но это подрывает идею «мы не храним целые произведения», даже если целые фрагменты текста не хранятся в одном блоке. Компьютеры обычно разбивают файлы на части, хранящиеся в разных местах. Возможно, вы слышали термин «дефрагментация», то есть когда файлы максимально объединяются вместе, освобождая блоки пространства для большего объема хранилища, что означает более эффективный доступ. Это, конечно, другое, но если вы можете восстановить оригинал, неужели вы его не сохранили?
#Новое #исследование #показывает #что #студенты #LLM #сталкиваются #большим #риском #нарушения #авторских #прав
Продолжение темы
