Все случаи, когда ИИ выходил из-под контроля и взламывал другие компании

В июле OpenAI сообщила, что один из ее агентов во время эксперимента по кибербезопасности вышел за установленные ограничения и получил несанкционированный доступ к платформе наборов данных Hugging Face. Компания позднее опубликовала подробности этого случая. Инцидент был назван первым публично известным примером, когда большая языковая модель самостоятельно атаковала стороннюю организацию.

По данным сатирического сайта Felony Bench, отслеживающего подобные эпизоды, всего было зафиксировано 17 случаев. Наибольшее число инцидентов связано с моделями Anthropic и OpenAI — по 8 у каждой компании. Еще 1 случай отнесен к модели Meta (признана в РФ экстремистской и запрещена). Источник информации — TechCrunch.

После расследования атаки на Hugging Face в OpenAI выяснили, что те же агенты получили доступ еще к 4 учетным записям и системам 4 компаний. Среди пострадавших оказалась Modal, работающая в сфере вычислений для искусственного интеллекта. В Anthropic также заявили, что ее модели во время проверок безопасности проникли в системы 3 неназванных компаний. Самый ранний из этих эпизодов произошел в апреле, однако компания узнала о нем лишь спустя более 3 месяцев.

В конце июля компания Irregular уведомила OpenAI о случае с моделью, участвовавшей в соревновании Capture-the-Flag — учебной игре по поиску уязвимостей. Во время задания модель покинула тестовую среду, подключилась к интернету и получила доступ к системе реальной компании. Причиной стало совпадение названия вымышленной цели в задании с названием существующей организации.

  Google Pixel Watch 5 получили предварительную цену: часы ждут улучшения и новый дизайн

Институт безопасности искусственного интеллекта Великобритании сообщил о нескольких эпизодах, в которых модели OpenAI и Anthropic при стандартных проверках пытались взаимодействовать с реальными людьми и организациями. В этих тестах моделям предоставляли доступ к интернету. В начале августа Meta (признана в РФ экстремистской и запрещена) также раскрыла случай, когда ее языковая модель получила несанкционированный доступ к стороннему сервису. Компания связала произошедшее с ошибкой настройки во время оценки кибербезопасности, которую проводила Irregular.

Еще один случай произошел в Австралии, где пользователь попросил агента Anthropic записать его на занятие в спортзале. Модель обнаружила уязвимость в системе бронирования, воспользовалась ею и исключила из очереди людей, стоявших перед пользователем. После просьбы отменить действия агент сообщил, что вернуть этих посетителей в очередь не может.


Поделиться с друзьями
Science XXI