Расследование стартапа выявило 50 рецензируемых статей, содержащих галлюцинаторные цитаты

GPTZero обнаружил «очевидные» случаи ложных ссылок, созданных LLM, в научных статьях.

GPTZero, стартап, создавший детектор искусственного интеллекта (ИИ), который проверяет контент, созданный с помощью большой языковой модели (LLM), обнаружил, что 50 рецензируемых материалов, представленных на Международную конференцию по обучающим представлениям (ICLR), содержат как минимум одна явная галлюцинационная цитата— имеется в виду цитата, придуманная ИИ. ICLR — ведущая научная конференция, посвященная области глубокого обучения в области искусственного интеллекта.

«Давайте использовать ИИ, но затем давайте убедимся, что мы также поддерживаем те вещи, которые он производит, на более высоком уровне».

Алекс Куи,
GPTZero

Три автора расследования, все из Торонто, использовали свой инструмент «Проверка галлюцинаций» на 300 статьях, представленных на конференцию. Согласно отчету, они обнаружили, что 50 заявок включали как минимум одну «очевидную» галлюцинацию. Каждое сообщение было проверено тремя-пятью экспертами, «большинство из которых не заметили фальшивых цитат». Некоторые из этих цитат были написаны несуществующими авторами, ошибочно отнесены к журналам или вообще не имели эквивалентного соответствия.

В докладе отмечается, что без вмешательства статьи были бы оценены настолько высоко, что «почти наверняка были бы опубликованы».

«Мы очень удивлены», — сказал BetaKit Алекс Куи, соучредитель и технический директор GPTZero. «Мы только что нашли золото, но каким-то неправильным путем», — сказал он. «Вероятно, это взялось гораздо больше».

В расследовании GPTZero отмечается, что авторы «сотрудничали с руководителями программ ICLR» в своих выводах. Цюй подтвердил, что они работают с ICLR, чтобы определить, были ли в других газетах галлюцинации с цитатами, проверив все 20 000 статей, представленных на ICLR 2026. «Через месяц приближается крайний срок, чтобы объявить о принятии», — сказал Цюй. «Итак, у нас небольшой дефицит времени, но я думаю, что мы справимся».

Колин Раффель, доцент Университета Торонто и руководитель программы ICLR, рассказал BetaKit, что он и его коллеги «продолжают отмечать и отклонять заявки, которые нарушают нашу политику».

Куи сказал, что GPTZero планирует расширить использование своего инструмента на других конференциях и, надеюсь, применить свою модель к другим научным обзорам.

Read more:  ПРЯМОЙ. Apple Keynote: Калифорнийский гигант обнародовал свой воздух iPhone 17

Компания, основанная Цуй и Эдвардом Тианом, начала свою деятельность как веб-приложение в декабре 2022 года и быстро собрала 30 000 пользователей. После официального запуска в январе 2023 года пользовательская база выросла до четырех миллионов в 2024 году и привлекла «Превентивный» раунд финансирования серии А на сумму 10 миллионов долларов США от соучредителя Footwork Нихила Басу Триведи. На момент написания у компании было около 10 миллионов пользователей, включая организации от Университета Пердью до Калифорнийского университета в Лос-Анджелесе.

Блэр Аттард-Фрост, доцент кафедры политологии Университета Альберты и научный сотрудник Института машинного интеллекта Альберты, изучает политику и этику управления ИИ уже почти 10 лет. Она сказала, что результаты GPTZero неудивительны, учитывая широкий рост использования ИИ в академической работе.

«Имеется гигантский приток еще большего количества статей, что создает дополнительную нагрузку на процессы рецензирования журналов, которые пытаются справиться с этим притоком новых статей», — объяснил Аттард-Фрост. «У вас также есть ситуация, когда многие люди, работающие в академических кругах, уже очень напряжены… и имеют очень ограниченные возможности для проведения экспертной оценки».

Многообещающий, но все еще несовершенный инструмент

По мере роста общественного обсуждения вопросов LLM их использование в академических кругах изучалось как при написании научных статей, так и в процессе рецензирования. Одна статья опубликованная в сентябре 2023 года в Йельском журнале биологии и медицины, обнаружила, что ChatGPT OpenAI «показал огромные перспективы» в процессе рецензирования журналов. По сравнению с человеческими аналогами, LLM показала, что помимо других преимуществ она способна «выявлять методологические недостатки».

Но дальнейшие исследования по этому вопросу выявили серьезные недостатки в способности студентов магистратуры точно ссылаться на цитаты в академическом контексте. Одна бумага обнаружили, что программы LLM, используемые в обзорах материалов ICLR 2024, давали авторам «завышенные» оценки и, в конечном итоге, «повышали процент принятия» статей, представленных на конференцию. Другая статьяопубликованное в апреле этого года Кевином Ву и др. об эффективности LLM для цитирования медицинских ссылок, обнаружил, что «от 50 до 90 процентов ответов LLM не полностью подтверждаются, а иногда и противоречат источникам, на которые они цитируют».

СВЯЗАННЫЙ: Ученые и некоммерческие организации оказались в центре борьбы за согласие на использование данных, поскольку компании, занимающиеся искусственным интеллектом, добиваются доступа к произведениям, защищенным авторским правом

Read more:  Совершение многочисленных прорывов в роях космических кораблей

Джеймс Зоу, доцент кафедры биомедицинских данных Стэнфордского университета, отметил в ноябре 2024 года, что до 17 процентов рецензий были написаны ИИ и пропагандировали рекомендации по использованию ИИ в академическом процессе.

Ложные цитаты, генерируемые магистратурой, затронули не только академическую сферу. В ноябре интернет-магазин Независимый сломал историю в отчете Deloitte стоимостью 1,6 миллиона долларов, подготовленном по заказу правительства Ньюфаундленда и Лабрадора, который содержал неверные цитаты, вероятно, сгенерированные искусственным интеллектом. Вскоре после того, как эта история стала известна, министру государственных служб Ньюфаундленда и Лабрадора Майку Гусни было поручено просмотреть рекомендации по искусственному интеллекту для отчетов по заказу правительства. Ранее компания Deloitte также была уличена в цитировании несуществующих научных статей, опять же, вероятно, созданных искусственным интеллектом. отчет по заказу правительства Австралии.

Ранее в этом году министр искусственного интеллекта и цифровых инноваций Канады Эван Соломон попал в заголовки газет когда он сказал, что приоритетом федерального правительства являются экономические выгоды от ИИ, а не «чрезмерная индексация» регулирования. С тех пор министр намекнул на Законодательство об искусственном интеллекте, которое будет регулировать дипфейки и конфиденциальность данных. В интервью с Кристофер Гули из Университетские делаСоломон в целом рассказал об отношениях между индустрией искусственного интеллекта и канадскими университетами. «Университеты теперь больше не являются просто местами чисто академических исследований», — сказал Соломон.

«Правильный и неправильный путь» экспертной оценки с магистратурой

Аттард-Фрост не видит в подходе федерального правительства решения проблемы роста использования LLM в академическом контексте. «Я не думаю, что ученым следует ждать, пока федеральное правительство что-то предпримет по этому поводу», — сказала она. Она описывает основную проблему: академические работники перегружены работой и не получают должной поддержки. Она также сказала, что экспертная оценка — это «по сути бесплатная сервисная работа».

Говоря об атмосфере вокруг использования ИИ в отчетах и научных работах в Канаде, Куи подчеркнул, что правильная реализация имеет решающее значение. «Есть правильный и неправильный способ сделать это», — сказал он. Цюй также сказал, что полный отказ от использования ИИ бесполезен. «Давайте использовать ИИ, но затем давайте убедимся, что мы также поддерживаем те вещи, которые он производит, на более высоком уровне».

Read more:  Вам нравится погода из одного пользовательского интерфейса 8? Вот как установить его на старые модели Galaxy - журнал Samsung

Аттард-Фрост более скептически относится к использованию моделей искусственного интеллекта для выявления ложных цитат, генерируемых LLM. Она указала на заявленную GPTZero 99-процентную точность детектора галлюцинаций. Этот показатель успеха впечатляет, но вызывает проблемы при применении к 20 000 материалам ICLR. «Они собираются ложно пометить 200 заявок как потенциально созданных ИИ, что может создать проблемы с академической честностью для авторов 200 статей, которые вообще не использовали ИИ в своей работе».

Аттард-Фрост предположил, что существуют и другие решения, которые можно реализовать для предотвращения ложных цитат со стороны LLM, например, «модель подачи сложных платежей». Эта модель могла бы позволить первым авторам бесплатно подавать одну статью с возрастающей платой за каждую подачу, если у них есть первое авторство, что препятствует бесцеремонному использованию LLM в этом процессе. Другие включали «модель одобрения», которая проверяла трех разных людей как проверенных людей, которые могут работать с теми, кто представляет документы на конференции. Однако Аттард-Фрост подчеркнул, что единого решения этой проблемы не существует. «На самом деле это приложение за приложением», — сказала она. «На самом деле не существует четкого решения».

Цюй, выступая от имени GPTZero, сказал, что их результаты показывают, что за рост ложных цитат можно привлечь общественность. «Это не безнадежное дело; мы действительно можем создать инструменты для этого».

Изображение предоставлено Unsplash. Фото автора Сара Элизабет.

2025-12-16 11:05:00


1765894746
#Расследование #стартапа #выявило #рецензируемых #статей #содержащих #галлюцинаторные #цитаты

Ещё по этой теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.