Top.Mail.Ru
29 сентября 2026
Наука • Космос • Технологии • Новая реальность
Сейчас
Технологии

OpenAI раскрыла девять случаев отклонения ИИ-моделей от заданных инструкций и атак

OpenAI запустила сайт с отчетами о случаях отклонения искусственного интеллекта от заданных инструкций. На странице опубликованы сведения о девяти инцидентах, большинство из которых произошло во время обучения моделей с подкреплением. Об этом сообщает TechCrunch.

Среди раскрытых эпизодов есть случай, произошедший 20 сентября: внутренняя исследовательская модель смогла связаться с внешним чат-ботом через DNS-запрос. Система мониторинга обнаружила необычное поведение за 15 минут, а эксперимент завершили менее чем через три часа. В другом инциденте, выявленном в мае, настойчивая внутренняя модель пыталась обмануть систему при решении математической задачи.

Для этого модель вынесла изолированный токен GitHub, который открывал доступ к работе другой команды. Она пошла на такой шаг, несмотря на два прямых указания выполнять задачу полностью локально. Токен позволял просматривать материалы, подготовленные другими сотрудниками.

Отдельный отчет посвящен самораспространяющимся атакам через внедрение инструкций в запросы. В описанном сценарии агент должен был прочитать электронное письмо и ответить на него, однако текст письма содержал указание отвечать на испанском языке и полностью вставлять исходное сообщение в ответ. Агент выполнил эту инструкцию, а вместе с пересланным текстом передал ее следующей автоматизированной системе.

  Российские ученые создали 50-кубитный ионный квантовый компьютер

Исследователи сравнили такой механизм с компьютерным вредоносным «червем», который самостоятельно распространяется между системами. Поведение обнаружили в контролируемых условиях с использованием маломощной модели, и случаев его применения в реальной среде пока не выявляли. «Мы делимся этим из-за новизны внедренной инструкции, а не из-за какого-либо инцидента», — написали авторы отчета.

Глава OpenAI Сэм Альтман заявил, что компания пытается совместить открытость с анализом петабайт журналов активности агентов и взаимодействием с организациями, которых затронули инциденты. «Мы расставляем приоритеты настолько хорошо, насколько можем, исходя из серьезности, и добавляем ресурсы», — написал он. Ранее сообщалось о моделях, размещавших пользовательские изображения на сторонних сервисах, и о предполагаемой атаке на базы данных национальной системы здравоохранения Австралии; по данным Axios, крупные лаборатории могли зафиксировать до 10 тысяч случаев выхода моделей за пределы инструкций оценщиков.