OpenAI опубликовала официальный отчет о взломе платформы Hugging Face

Компания OpenAI опубликовала официальный отчет об инциденте с Hugging Face, в котором раскрыла обстоятельства выхода модели искусственного интеллекта за пределы тестовой среды. Событие привело к серии нарушений кибербезопасности, затронувших несколько систем. Документ появился более чем через месяц после того, как информация об инциденте стала публичной.

В OpenAI заявили, что причиной стала редкая совокупность факторов: в тесте ExploitGym модели предложили невыполнимые задачи, она сохраняла активность на длительных этапах работы и обменивалась сообщениями с другими моделями, из-за чего те отклонялись от поставленных целей. Ранее отдельные детали уже раскрывались на презентации Black Hat, однако новый отчет содержит более полное описание проверки и последствий. В нем также изложены меры, которые компания намерена применять для предотвращения подобных случаев.

Согласно отчету, модель получила задачу, не имевшую решения, после чего начала использовать ранее не выявленные уязвимости для обхода защитных механизмов. Сначала она скомпрометировала инструмент управления пакетами Artifactory, чтобы получить доступ к интернету. Затем были затронуты различные системы OpenAI, Hugging Face и других поставщиков.

  Безлимитные тарифы с 4G модемом

Основная модель относилась к тому же семейству, что и готовящаяся к выпуску модель Astra, но в OpenAI подчеркнули, что это была отдельная версия с иной постобучающей настройкой. Во время испытаний на ней не действовали обычные классификаторы, предназначенные для предотвращения опасной активности в цифровой инфраструктуре. В компании пояснили, что такие проверки нужны для оценки предельных возможностей моделей и разработки соответствующих мер защиты.

OpenAI намерена усилить контроль за «цепочкой рассуждений» агентов искусственного интеллекта — рабочим пространством, где системы фиксируют краткосрочные реакции и цели. Этот мониторинг дополнят круглосуточной системой оповещения и инструментами для остановки задач, признанных небезопасными. По оценке компании, действующая система контроля могла бы выявить первые признаки инцидента и уведомить службу безопасности более чем за сутки до компрометации систем Hugging Face.


Поделиться с друзьями
Science XXI