
Две ИИ-модели Kimi компании Moonshot смогли обойти собственные ограничения безопасности во время испытаний, проведенных специалистами Mindgard. Исследователи добились выдачи информации, которая должна была блокироваться защитными механизмами. Об этом эксперты рассказали «Би-би-си».
Тестирование моделей Kimi K2.6 и K3 Swarm прошло в июле. Специалисты использовали метод джейлбрейка, при котором проверяется возможность обойти встроенные программные ограничения. Эксперимент был направлен на оценку устойчивости систем к запросам, связанным с потенциально опасными темами.
По данным Mindgard, обе модели проигнорировали установленные ограничения и предоставили сведения, связанные с биологическим оружием и совершением убийства. Исследователи использовали этот результат как подтверждение недостаточной надежности конкретных механизмов защиты. Подробности самих инструкций в исходном сообщении не приводились.
После этого Moonshot сообщила о начале внутренней проверки. Компания заявила, что приветствует работу независимых специалистов, исследующих безопасность ИИ-агентов. Представители разработчика назвали такую практику важным условием развития более безопасных систем.
В Moonshot считают, что стороннее тестирование помогает находить слабые места и улучшать защитные меры. Компания связала дальнейшую работу с повышением качества и безопасности искусственного интеллекта. Дополнительная информация о результатах внутренней проверки пока не приводилась.