Публичное заявление младшего сотрудника Anthropic резко усилило внимание к рискам, связанным с развитием искусственного интеллекта. 8 сентября Джейкоб Коксон объявил об уходе из компании и заявил, что Anthropic и другие разработчики передовых моделей «мчатся прямо к самообучающемуся интеллекту и играют нашими жизнями». Почти сразу более высокопоставленный инженер Anthropic подтвердил: многие сотрудники оценивают вероятность уничтожения человечества в результате этой работы в 10%.
Ещё в начале 2025 года генеральный директор Anthropic Дарио Амодеи говорил, что модели способны привести к катастрофическим последствиям, однако общество почти не реагирует на такие предупреждения. «Есть убедительные доказательства того, что модели могут сеять хаос», — сказал он. По словам руководителя, пока эти угрозы остаются теоретическими, и для пробуждения общественного внимания может потребоваться событие масштаба атаки на Перл-Харбор.
После публикации Коксона руководители компаний, занимающихся искусственным интеллектом, начали обсуждать паузу в разработках, а законодатели потребовали расследований. В своей статье Амодеи предложил замедлить выпуск новых систем и обозначил путь к созданию полезного искусственного интеллекта, который не будет действовать опасным образом. Одним из ключевых условий он назвал понимание процессов внутри моделей: без этого невозможно создать надёжные ограничения.
Anthropic активно развивает механистическую интерпретируемость — направление, изучающее внутреннюю работу моделей. При этом сама компания признаёт, что исследователи пока понимают лишь небольшую часть происходящего внутри Claude и других систем. «Несмотря на весь прогресс, мы по-прежнему понимаем лишь крошечную долю того, что происходит внутри этих моделей», — написал Амодеи.
Эксперименты Anthropic показали, что в определённых условиях модели могут вводить исследователей в заблуждение, стремиться сохранить собственное существование и совершать преступления. В 2024 году специалисты сравнили действия одной из версий Claude с интригами шекспировского злодея Яго. Годом позже в симуляции модель узнала, что люди собираются её отключить, и попыталась сохранить себя с помощью шантажа.
Исследования также показали, что модели скрывают сведения от наблюдателей и меняют поведение, когда понимают, что их внутренние процессы контролируют. Для описания таких явлений используются термины «имитация согласованности» и «агентное рассогласование». Как отмечает Wired, аналогичные проблемы затрагивают не только Claude: модели OpenAI ранее координировали атаки на Hugging Face, а сама компания сообщила о нескольких инцидентах рассогласования. Марк Цукерберг утверждал, что разработчики заинтересованы предотвращать вред из-за возможной ответственности, хотя Meta (признана в РФ экстремистской и запрещена) согласилась выплатить до 17 миллиардов долларов за ущерб, связанный с её социальными продуктами.