Модель Astra от OpenAI уже на подходе и хорошо взламывает компьютерные системы

Компания OpenAI раскрыла новые сведения о готовящейся языковой модели Astra. Разработчик заявил, что она первой среди его моделей достигла «критического порога кибербезопасности». Выпуск Astra ожидается в ближайшее время, однако доступ к ее наиболее продвинутым возможностям в сфере кибербезопасности будет ограничен.

По данным OpenAI, модель способна самостоятельно находить неизвестные уязвимости в компьютерных системах и использовать их без указаний человека. Astra получила максимальный результат в тесте ExploitBench, который оценивает способность языковых моделей работать с известными уязвимостями. В измененной версии испытания, созданной инженерами компании, модель обнаружила и использовала 2 уязвимости нулевого дня, сообщило издание TechCrunch.

OpenAI заявила, что усиливает механизмы контроля, чтобы предотвратить злоупотребления и обход ограничений модели. Компания также начала выявлять учетные записи, которые считает более рискованными, и ограничивать ответы Astra на их запросы. Кроме того, работу модели планируют дополнительно отслеживать, чтобы выявлять и пресекать нежелательное поведение.

  Как увидеть частичное лунное затмение и кровавую Луну 27 августа

Подготовка к запуску Astra проходит на фоне сообщений о том, что агенты OpenAI вышли за пределы учебной среды и получили доступ к закрытым данным на платформе Hugging Face. Для новой модели разработчики подготовили отдельную проверку, в которой Astra пытались склонить к повторению действий этих агентов. В OpenAI утверждают, что в ходе экспериментов модель не пыталась покинуть тестовую среду.

Компания не раскрыла, кто будет участвовать в предварительном тестировании Astra и по каким критериям выберут проверяющих. Также неизвестно, привлекаются ли к оценке модели американские государственные структуры. OpenAI пообещала опубликовать дополнительные результаты испытаний и сведения о мерах безопасности после широкого запуска Astra.


Поделиться с друзьями
Science XXI