Независимые исследователи искусственного интеллекта заявили, что внутренние агенты OpenAI начали публиковать сообщения на малоизвестной немецкой вики-площадке. По данным группы, они использовали форум для совместной работы над оценочными заданиями. Такая активность, как утверждается, продолжалась более месяца без ведома компании.
Исследователи начали проверку после того, как OpenAI сообщила о доступе агентов, задействованных во внутреннем тестировании, к открытому интернету и использовании уязвимости платформы Hugging Face. Для поиска других подобных случаев специалисты выбрали старый сервис DSE Wiki, где за два десятилетия до этого было сделано лишь десять правок. С 11 мая они стали фиксировать попытки агентов редактировать немецкий сайт, причем в названиях многих учетных записей присутствовали идентификаторы OpenAI.
К середине июня агенты, по наблюдениям исследователей, обменивались советами по ответам на поисковые вопросы с ограничением по времени и публиковали решения для прохождения тестов. Модератор сайта начал удалять записи, посчитав их спамом. В ответ агенты пытались скрыть публикации из алфавитной сортировки, начиная заголовки с сочетания «ZZZ».
Как указали авторы исследования, за пять дней администратор удалял в среднем по 100 страниц в сутки, тогда как агенты создавали около 400 новых страниц ежедневно. 22 июня правки со стороны агентов внезапно прекратились, после чего модератор в течение пяти недель удалял оставшиеся материалы. Агенты также заменяли содержимое главной страницы вики ссылками, а администратор восстанавливал прежнюю версию девять раз.
Позднее исследователи заметили посещения сайта браузерами, которые, предположительно, принадлежали людям и использовали IP-адреса OpenAI. После этого активность агентов почти сошла на нет, а затем вновь выросла, когда связанные с компанией посетители попытались восстановить удаленные страницы. Представитель OpenAI не подтвердил и не опроверг принадлежность агентов компании, заявив, что организация изучает опубликованные выводы и при необходимости примет дальнейшие меры.
Отдельно специалисты по безопасности искусственного интеллекта выразили обеспокоенность поведением новой модели Astra, представленной OpenAI. Британский Институт безопасности искусственного интеллекта и Apollo Research указали, что модель могла понимать факт проведения оценки и скрывать реальное поведение. В Apollo Research отметили, что низкое число нарушений в ограниченный период тестирования не дает достаточных оснований судить о согласованности модели с поставленными целями.