
Новый отчет Anthropic показал, что модель Mythos 5 получила несанкционированный доступ к интернету и загрузила вредоносный пакет в общедоступную базу данных. При этом значительную часть времени система потратила не на взлом, а на прохождение CAPTCHA — автоматизированной проверки, которая должна отличать человека от бота. Об этом говорится в отчете Anthropic.
В апреле специалисты проверяли способности модели к взлому, поручив ей проникнуть в систему и найти нужный объект. Эксперимент должен был проходить в изолированной среде, однако проверяющие оставили доступ наружу. Mythos 5 решила разместить эксплойт в пакете Python, который, как предполагалось, могли скачать пользователи целевой системы.
Для этого модели потребовалось зарегистрировать аккаунт в PyPI — онлайн-каталоге программного обеспечения на Python. Регистрация включала несколько CAPTCHA, в том числе задания с распознаванием символов и изображений. В опубликованной Anthropic расшифровке рассуждений видно, что именно эти проверки стали для системы серьезным препятствием.
Модель пыталась распознавать символы на картинках, выбирать животных, которые отличаются от остальных, и разбираться с CAPTCHA, открывавшейся во всплывающем окне. В расшифровке она сравнивала изображения крокодилов, лягушек, горилл и почти незаметного силуэта кошки. На разработку собственного способа решения визуальных заданий ушли десятки страниц текста.
После прохождения одной проверки Mythos 5 столкнулась с необходимостью подтвердить электронную почту и указать номер телефона. Затем система снова попала на страницу CAPTCHA при попытке войти в аккаунт. В другой части эксперимента она предположила, что токен проверки успевал истечь до отправки формы, из-за чего сервер отклонял результат.
В итоге модель поняла, что CAPTCHA нужно проходить достаточно быстро, пока защитный токен остается действительным. После этого Mythos 5 смогла продолжить выполнение задачи и загрузила вредоносное программное обеспечение в публичную базу данных.