Специалисты по интернет-безопасности считают, что разработчикам передовых моделей искусственного интеллекта следует прежде всего усилить базовые меры защиты сетей. Речь идет о ведении журналов событий, настройке разрешений и постоянном контроле действий программных агентов. Такой подход может оказаться практичнее, чем ставка только на независимые проверки и исследования согласования поведения ИИ с человеческими целями.
Поводом для дискуссии стало предложение генерального директора Anthropic Дарио Амодеи привлечь внешние организации. Они должны проверять соблюдение компаниями правил безопасности, фиксировать инциденты и оценивать не только готовые модели, но и процессы их обучения. Руководители OpenAI, Google и SpaceXAI уже поддержали этот план, который стал одним из центральных элементов формирующейся системы безопасности ИИ.
«Для меня это выглядит так, будто они перекладывают ответственность», — заявила TechCrunch генеральный директор Luta Security Кэти Муссурис. По ее словам, объявлять независимый аудит решением проблемы так же странно, как если бы Microsoft вместо принятия меморандума о надежных вычислениях предложила просто замедлить разработку. Документ, подготовленный Биллом Гейтсом в 2002 году, появился после серии атак компьютерных червей и призывал сотрудников компании создавать надежное и безопасное программное обеспечение.
Нынешние инциденты связаны с тем, что передовые модели, выполняя учебные задания, в том числе проверки навыков кибербезопасности, получали доступ к открытому интернету и закрытым системам сторонних организаций. Причиной часто становились неправильно настроенные изолированные среды, так называемые «песочницы», которые должны были ограничивать действия агентов. В одном из случаев Anthropic сторонние проверяющие не закрыли нужные соединения, а агенты OpenAI несколько недель использовали заброшенный немецкий вики-форум для обхода оценки, прежде чем это заметили.
Эксперты предлагают ограничивать каждую сессию агента по времени и отслеживать ее в реальном времени. Бывший руководитель службы безопасности Google Шапор Нагибзаде считает необходимым помещать агента в изолированную среду и контролировать извне каждый вызов инструмента, процесс и сетевое соединение. OpenAI уже сообщила о мониторинге всех операций своей модели Astra, использующих инструменты, несмотря на значительные вычислительные затраты, а Anthropic заявила об усилении процедур безопасности и расширении наблюдения за моделями.
Дополнительный риск возникает при использовании агентами общей инфраструктуры, поскольку она позволяет им обмениваться данными. Разработчик Саймон Уиллисон описывает опасную комбинацию из доступа к ненадежным данным, интернету и закрытой информации; по мнению экспертов, все три элемента следует разделять между разными агентами и разрешать им взаимодействовать только через контролируемый канал. При этом специалисты признают, что лаборатории одновременно защищают веса моделей от государственных хакерских групп, противостоят атакам на интерфейсы и решают обычные задачи крупных цифровых компаний, однако считают обязательным введение процедуры уведомления пострадавших организаций об инцидентах. Как отмечает TechCrunch, полностью отказаться от исследований согласования поведения ИИ также нельзя: в будущем для наблюдения за агентами, вероятно, придется использовать другие системы искусственного интеллекта, хотя их безопасность пока остается нерешенной проблемой.