Нейросети создают одних и тех же вымышленных учёных - их имена уже появляются в научных базах
Генеративный искусственный интеллект начал формировать не только тексты, изображения и программный код, но и целый слой несуществующих персонажей. Исследователи из Samsung и Варшавского университета обнаружили, что языковые модели регулярно используют одни и те же вымышленные имена, когда их просят придумать специалиста, автора исследования или эксперта в определённой сфере.
К такому выводу авторы пришли в препринте "Призрачная пара: коррелированные LLM-имена и их призраки в веб- и академических публикациях". Работа пока не прошла независимое рецензирование, поэтому её результаты требуют дополнительной проверки. Однако обнаруженная тенденция уже вызывает вопросы к качеству научных архивов и механизмам автоматической индексации публикаций.
Елена Васкес и Маркус Чен стали "универсальными" экспертами
Нейросети не распределяют вымышленные имена равномерно. При повторных запросах они склонны возвращаться к ограниченному набору знакомых сочетаний. Наиболее часто в сгенерированных материалах исследователи встречали Елену Васкес и Маркуса Чена.
В разных документах эти персонажи представали в совершенно разных ролях. Их называли вулканологами, астронавтами, авторами подкастов, героями художественных триллеров и специалистами, участвующими в подготовке научных статей. Всего в анализ попали 1655 публикаций и записей, связанных с такими вымышленными авторами.
У каждой языковой модели, по данным исследователей, может быть собственный набор "предпочтительных" имён. Кроме того, некоторые персонажи регулярно появляются вместе. Такие сочетания образуют устойчивые пары и даже небольшие группы соавторов, хотя за ними не стоят реальные люди, лаборатории или исследовательские коллективы.
Как фиктивные статьи попадают в научные каталоги
Особое внимание авторы препринта уделили репозиторию Zenodo, который администрируется CERN. Платформа позволяет пользователям размещать научные материалы и получать для них цифровые идентификаторы DOI. Бесплатно зарегистрироваться и загрузить документ может практически любой желающий.
Именно эта открытость, с одной стороны, помогает быстро распространять результаты исследований, а с другой - создаёт возможности для злоупотреблений. В Zenodo обнаружили свыше 1655 записей, подписанных несуществующими именами. Часть материалов ссылалась на журналы, которых не существует, а даты публикации в некоторых случаях были выставлены задним числом.
Проблема усиливается из-за того, что DOI выглядит как настоящий библиографический идентификатор. После присвоения такого кода информация о документе может автоматически попасть в сторонние каталоги и поисковые системы. В результате фиктивная работа способна появиться в Google Scholar и Semantic Scholar без полноценной проверки содержания, авторства и существования указанных журналов.
В течение одного из пиковых месяцев на платформе, согласно приведённым в исследовании данным, было создано 991 подозрительная запись. На ResearchGate вымышленные авторы также начали формировать целые "исследовательские группы", где в качестве соавторов указывались персонажи, созданные разными нейросетями.
Чем опасно появление "призрачных" авторов
Фальшивые публикации способны загрязнять научную информационную среду сразу по нескольким направлениям. Исследователь, проводящий поиск по теме, может принять сгенерированную статью за реальную и использовать её в собственной работе. Затем ошибочная ссылка начнёт копироваться в новые публикации, создавая цепочку вторичных цитирований.
Автоматические алгоритмы также могут воспринимать количество упоминаний как признак значимости. Если фиктивный материал будет процитирован несколько раз, поисковая система способна поднять его в выдаче, даже если исходная публикация не содержит проверяемых данных или опирается на несуществующие источники.
В долгосрочной перспективе это осложняет библиометрический анализ. Невозможно корректно оценить продуктивность автора, влияние научной школы или динамику развития конкретного направления, если в базы попадают документы без реальных исследователей и подтверждённых результатов.
Имена могут стать "отпечатками" нейросетей
Повторяющиеся имена представляют интерес не только как признак автоматической генерации. Они потенциально могут использоваться для выявления того, какая именно модель подготовила текст или метаданные публикации.
Если конкретная нейросеть постоянно выбирает одни и те же имена, сочетает их в одинаковые пары и приписывает им похожие биографии, такие особенности становятся своеобразным языковым отпечатком. В дальнейшем подобные признаки можно применять для предварительного скрининга документов.
Однако одного имени недостаточно для окончательного вывода. Реальные люди также могут носить распространённые имена, а разные модели способны обучаться на одних и тех же корпусах данных. Поэтому проверка должна учитывать стиль текста, структуру ссылок, повторяемость формулировок, происхождение файлов и историю загрузки документа.
Почему автоматическая модерация не всегда срабатывает
Многие репозитории проверяют формат файла, наличие обязательных полей и техническую корректность метаданных. Но такие процедуры не гарантируют, что автор существует, журнал действительно выпускал указанную статью, а приведённые результаты получены в ходе эксперимента.
Проверка научной добросовестности требует сопоставления сразу нескольких источников: профиля исследователя, данных об организации, публикационной истории, информации о журнале и реальности приведённых ссылок. Для открытых архивов такая проверка особенно сложна из-за огромного количества загружаемых материалов.
Ситуацию усложняет и рост числа автоматизированных сервисов, которые умеют создавать не только основной текст, но и аннотацию, список ключевых слов, сведения об авторах и библиографическое описание. Внешне такой документ может выглядеть как обычный препринт, если не проводить содержательный анализ.
Какие меры могут снизить риск
Платформам потребуется усилить проверку авторства и происхождения материалов. Среди возможных мер - подтверждение институциональной электронной почты, привязка автора к ORCID, проверка заявленной организации и обязательная верификация подозрительных публикаций до выдачи DOI.
Полезным инструментом может стать маркировка материалов, прошедших только техническую загрузку, но не научную экспертизу. Пользователь должен ясно видеть разницу между препринтом, прошедшим редакционную проверку, и файлом, размещённым исключительно по инициативе автора.
Научным поисковикам также необходимо совершенствовать фильтры. Важную роль могут сыграть анализ повторяющихся имён, выявление несуществующих журналов, проверка дат, поиск одинаковых фрагментов и обнаружение аномальных всплесков публикационной активности.
Пока неизвестно, сколько из найденных записей администрация платформ сочтёт недостоверными и будет ли их удалять. Ни один из упомянутых сервисов публично не сообщил о результатах собственной проверки. Авторы исследования подчёркивают, что академическая инфраструктура рискует незаметно накапливать искусственно созданные данные, которые впоследствии будет трудно отделить от настоящих.
Похожая проблема наблюдается и за пределами науки. Массовое использование нейросетей уже привело к появлению большого числа автоматически подготовленных законопроектов в американском Конгрессе. В таких документах находили ошибки в юридических формулировках, неточные ссылки на законодательство и путаницу в терминах. За первые два месяца работы нового созыва юридическая служба Палаты представителей получила более 5,6 тысячи запросов на подготовку законопроектов - на 72% больше, чем двумя годами ранее.
С распространением генеративного ИИ проверка происхождения информации становится такой же важной, как её содержание. Сам факт наличия DOI, профиля автора или упоминания в поисковой выдаче больше не гарантирует, что за документом стоит реальное исследование.


