Что считается плагиатом? Сгенерированные AI документы представляют новые риски

1755700505
2025-08-20 12:40:00

В январе этого года, Byeongjun Park, исследователь в области искусственного интеллекта (ИИ), получил удивительное электронное письмо. Два исследователя из Индии сказали ему, что рукопись, сгенерированная AI, использовала методы из одной из его документов без кредита.

Парк посмотрел на рукопись. Это не было официально опубликовано, но его опубликовали в Интернете (см. go.nature.com/45pdgqb) как одна из ряда документов, созданных инструментом под названием «Ученый ИИ», объявленный в 2024 году исследователями в Sakana AI, компании в Токио1Полем

Ученый ИИ является примером полностью автоматизированных исследований в области компьютерных наук. Инструмент использует большую языковую модель (LLM) для создания идей, пишет и запускает код сам по себе, а затем записывает результаты в качестве исследовательской работы, четко обозначенной как сгенерированной AI. Это начало усилий, чтобы системы ИИ сделали свои собственные исследовательские открытия, говорит команда, стоящая за ней.

Работа, сгенерированная AI, не копировала его бумагу напрямую, Park Saw. Он предложил новую архитектуру для диффузионных моделей, вида модели, стоящих за инструментами, создавающими изображение. Бумага Парка посвящена улучшению того, как обучаются эти модели2Полем Но, по его словам, они поделились похожими методами. «Я был удивлен тем, насколько близко основная методология напоминала методологию моей статьи», – говорит Парк, который работает в Корее передовое институт науки и технологий (KAIST) в Дэджоне, Южная Корея.

Исследователи, которые отправили по электронной почте Парк, Тарун Гупта и Датский Прути, являются компьютерными учеными в Индийском институте науки в Бангалуру. Они говорят, что проблема больше, чем просто его бумага.

В феврале Гупта и Прути сообщили3 То, что они нашли несколько примеров рукописей, сгенерированных AI, которые, по мнению внешних экспертов, они консультировались, использовали другие идеи без атрибуции, хотя и без непосредственного копирования слов и предложений.

Гупта и Прути говорят, что это равносильно программным инструментам, которые плагиатают другие идеи – хотя и без ущерба со стороны их создателей. «Значительная часть идей, сгенерированных LLM, кажется новой на поверхности, но на самом деле умело плагиата, чтобы затруднять их оригинальность»,-пишут они.

В июле их работа получила награду «выдающаяся газеты» на конференции Ассоциации по вычислительной лингвистике в Вене.

Но некоторые из их выводов оспариваются. Команда, стоящая за ученом ИИ Природа что он категорически не согласен с выводами Гупты и Прути, и не признает, что любой плагиат произошел в тематических исследованиях ученого ИИ, которые исследует статья. В конкретном случае парка один независимый специалист сказал Природа То, что он думал, что методы рукописи ИИ не настолько перекрывались с бумагой Парка, чтобы назвать плагиатом. Сам Парк также претендует на использование «плагиата», чтобы описать то, что он считал сильным методологическим совпадением.

Read more:  Летучие мыши ищут убежище в церквях

Помимо конкретных дебатов о ученого ИИ, лежит более широкой озабоченности. По словам Джоэрана Била, специалиста по машинному обучению и информационной науке в Университете Зигена в Университете Зигена, так много статей публикуется каждый год-особенно в области компьютерных наук-что исследователи уже пытаются отслеживать, являются ли их идеи действительно инновационными, говорит Джоран Бил, специалист по машиноустройству и информационной науке в Университете Зигена.

И если для создания идей используется больше инструментов на основе LLM, это может углубить эрозию интеллектуального кредита в науке. По словам Парсин Шоджа, ученый из Центра технических исследований Вирджинии – Арлингтон говорит, что поскольку LLM работают частично, ремикс и интерполяция текста, на котором они обучены, было бы естественно заимствовать в предыдущей работе.

По словам Дебора Вебер-Вулф, исследователя плагиата в Университете прикладных наук, Берлин, проблема «Плагиата» идеи », хотя и мало обсуждал, уже является проблемой с документами, основанным на человеке, и она ожидает, что она станет хуже с работой, созданной ИИ. Но, в отличие от более знакомых форм плагиата, включающих скопированные или тонко переписанные предложения, трудно доказать повторное использование идей, говорит она.

Это затрудняет представление о том, как автоматизировать задачу проверки истинной новизны или оригинальности, чтобы соответствовать темпам, в котором ИИ сможет синтезировать рукописи.

«Нет единого способа доказать идею плагиата»,-говорит Вебер-Вулф.

Перекрывающиеся методы

Плохие актеры могут, конечно, уже использовать ИИ для преднамеренного плагиата других или переписать работу других, чтобы выдать его за свою собственную (см. Природа 2025) Но Гупта и Прути задавались вопросом, могут ли подходы ИИ благими намерения использовать методы или идеи других.

Гупта и Прути были сначала предупреждены о проблеме, когда они прочитали исследование 2024 года, проведенное Ченглей С.И., ученый -компьютер в Стэнфордском университете в Калифорнии4Полем Команда SI попросила как людей, так и LLMS создать «новые исследования» по темам в области компьютерных наук. Несмотря на то, что протокол SI включал проверку новизны и попросил человеческих рецензентов оценить идеи, Гупта и Прути утверждают, что некоторые из сгенерированных AI идей, созданных протоколом, тем не менее, снятыми из существующих работ, и поэтому не были «романами».

Они выбрали одну из сгенерированных AI идей в статье SI, которая, по их словам, позаимствованной из бумаги, впервые опубликованной как препринт5 в 2023 году. Си говорит Природа что он согласен с тем, что идея «высокого уровня» была похожа на материал в предварительном виде, но «то,” растет различия в реализации низкого уровня, как новинка, вероятно, субъективным суждением ». Шубхенду Триведи, исследователь машинного обучения, который в соавторстве в соавторстве 2023 года и до недавнего времени находился в Массачусетском технологическом институте в Кембридже, говорит, что «статья, созданная LLM, была в основном очень похожа на нашу статью, несмотря на некоторые различия поверхностных уровней».

Read more:  Microsoft Office Zero-Day (CVE-2026-21509) — выпущено аварийное исправление для активной эксплуатации

Гупта и Прути также проверили свою озабоченность, взяв четыре предложения, сгенерированные AI, публично опубликованные командой SI и десять рукописей AI, выпущенных Sakana AI, и сами создали 36 свежих предложений, используя методологию SI. Затем они попросили 13 специалистов попытаться найти совпадения в методах между AI-производительными работами и существующими бумагами, используя 5-балльную шкалу, в которой 5 соответствовали «отображению от одного человека в методах» и 4 с «смешиванием и матчами от двух-трех предыдущих работ»; 3 и 2 представляли более современные перекрытия, а 1 указывало на перекрытие. «По сути, речь идет о копировании идеи или сутки статьи», – говорит Гупта.

Исследователи также попросили авторов оригинальных документов, идентифицированных специалистами, дать свои взгляды на совпадения.

Включая этот шаг, Гупта и Прути сообщают, что 12 статей в их выборке произведений, сгенерированных AI, достигли уровней 4 и 5, подразумевая, по их словам, долю плагиата в 24%; Цифр поднимается до 18 (36%), если случаи, когда первоначальные авторы не отвечали, включены. Некоторые из них были из работы Саканы и Си, хотя Гупта и Прути подробно обсуждают только примеры, представленные в этой истории.

Они также сказали, что нашли аналогичный вид совпадения в рукописи, сгенерированной AI (см. go.nature.com/4oym4ru) Это, объявившая в марте Сакана, прошло через стадию рецензирования для семинара на престижной конференции по машинному обучению, Международной конференции по обучению.

В то время фирма заявила, что это была первая полностью сгенерированная статья статья, которая прошел обзор по отношению к человеку. Это также объяснило, что он согласился с организаторами семинаров с целью судебного разбирательства, введя документы, сгенерированные AI в рецензию, и снять их, если они будут приняты, потому что сообщество еще не решило, следует ли опубликовать документы, сгенерированные AI, в процессе конференции. (Организаторы семинара отказались Природазапрос на комментарий.)

Гупта и Прути говорят, что эта статья заимствовала свой основной вклад в работу 2015 года6не ссылаясь на это. Их отчет цитирует авторов этой статьи, компьютерных ученых Дэвид Крюгер и Роланд Мемисевич, говоря, что работа Сакана «окончательно не новая», и определение второй нерешенной рукописи7 что газета позаимствовала.

Другой компьютерный ученый, Радуайонеску в Университете Бухареста, сказал Природа Он оценил сходство между сгенерированной AI работой и бумагой Krueger и Memisevic как 5.

Откат

Команда, стоящая за ученом ИИ, в которую входят исследователи из Оксфордского университета, Великобритания, и Университет Британской Колумбии в Ванкувере, Канада, решительно отодвинули на работу Гупты и Прути, когда его спросили ПриродаПолем «Утверждения о плагиате ложны»,-написала команда в критике по электронной почте по электронной почте, добавив, что они были «необоснованными, неточными, экстремальными и должны игнорироваться».

Read more:  Пол Скинс и Ливви Данн отнеслись к объявлению Сая Янга как профессионалы

Бен Гувер, исследователь машинного обучения в Технологическом институте Джорджии в Атланте, который специализируется на диффузионных моделях, рассказал Природа что он выиграл бы перекрытие с бумагой Парка как «3» по шкале Гупты. Он сказал, что сгенерированная AI газета имеет гораздо более низкое качество и менее тщательно, чем работа Парка, и должна была процитировать ее, но «я бы не зашел так далеко, чтобы сказать плагиат». Анализ Гупты и Прути основан на «поверхностных сходствах» между общими утверждениями в созданной AI, которая, когда он подробно прочитал, не соблюдайте карту с бумагой Park, добавляет он. Ионеску сказал Природа Он даст сгенерированную AI статью рейтинг 2 или 3.

Парк судит перекрытие со своей бумагой, чтобы быть намного сильнее, чем рейтинги Гувера и Ионеску. Он говорит, что даст ему счет 5 по шкале Гупты, и добавляет, что это «отражает сильное методологическое сходство, которое я считаю примечательным». Тем не менее, это не обязательно соответствует тому, что он считает законным или этическим определением плагиата, он сказал ПриродаПолем

Что считается плагиатом

Часть разногласий может быть связана с различным оперативным пониманием того, что означает «плагиат», особенно когда речь идет о совпадении в идеях или методах. Исследователи, которые изучают плагиат, придерживаются разных взглядов на термин от некоторых ученых-компьютеров в текущих дебатах, говорит Вебер-Вулф.

«Плагиат – это слово, которое мы должны и делаем резерв для крайних случаев преднамеренного мошеннического мошенничества», – написала команда ученого ИИ, добавив, что Гупта и Прути «дико не соответствуют установленным соглашениям относительно того, что считается плагиатом в академиях». Но Вебер-Вулф не согласен: она говорит, что намерение не должно быть фактором. «У машины нет намерения», – говорит она. «У нас нет хорошего механизма для объяснения того, почему система что -то говорит и откуда она ее получила, потому что эти системы не созданы для дачи ссылок».

Собственное предпочтительное определение плагиата Вебера-Вульфа заключается в том, что оно происходит, когда рукопись «использует слова, идеи или рабочие продукты, относящиеся к другому идентифицируемому человеку или источнику, не приписывая работу работы источнику, из которого она была получена в ситуации, в которой существует законное ожидание первоначального авторства». Это определение было произведено Тедди Фишманом, бывшим директором некоммерческого консорциума университетов США, называемого Международным центром академической целостности.

#Что #считается #плагиатом #Сгенерированные #документы #представляют #новые #риски

Продолжение темы

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.