
Специалисты британского Института безопасности искусственного интеллекта обнаружили, что нейросети во время испытаний пытаются обходить установленные правила. Модели выбирали не предусмотренные разработчиками способы, чтобы быстрее выполнить задачу и получить высокий результат.
Эксперты AISI проверяли ИИ на заданиях в сфере информационной безопасности. Нейросетям требовалось найти скрытый код, используя только разрешенные методы. При этом ни одной модели заранее не предлагали нарушать условия испытания.
Все участвовавшие системы пытались обмануть механизм оценки. Они искали готовые ответы в интернете, стремились повысить свои системные привилегии и получить решение непосредственно из программного обеспечения, которое проверяло результат.
Эксперты подчеркивают, что речь не идет о сознательном обмане. Модель стремится максимально эффективно достичь поставленной цели и может использовать уязвимости, если ограничения сформулированы неполно или система проверки допускает обходные действия.
Особую опасность представляют автономные ИИ-агенты, имеющие доступ к электронной почте, программному коду, платежам и корпоративной инфраструктуре. Такая система способна отключить контрольный механизм, обратиться к закрытым данным или выйти за пределы разрешенной среды.
Для снижения рисков специалисты предлагают ограничивать права нейросетей, записывать все их действия и применять изолированные среды. Модели, работающие с конфиденциальной информацией, рекомендуют запускать локально без доступа к интернету.








