Top.Mail.Ru
11 октября 2026
Наука • Космос • Технологии • Новая реальность
Сейчас
Наука

Физики научились заранее выявлять смену безопасного поведения искусственного интеллекта

Американские физики нашли способ заранее определить момент, когда искусственный интеллект может перейти от безопасных ответов к потенциально опасным. Риск способен проявиться даже у модели, которая ранее демонстрировала надёжное поведение. Разработанный подход связывает такую перемену с конкретным процессом внутри нейросети.

Исследователи установили, что важную роль играет порядок запросов. Один и тот же набор обращений, заданный в разной последовательности, приводил к противоположным результатам: чат-боты могли отвечать безопасно или формулировать вредные рекомендации. Среди возможных последствий учёные назвали склонение человека к самоповреждению, а также опасные советы в медицинской и юридической сферах.

Внутри нейросети специалисты выделили определённый элемент механизма внимания и вывели формулу для определения критического момента. Она позволяет понять, появится ли рискованный ответ сразу либо ему будет предшествовать серия допустимых реакций. Результаты работы описаны американскими специалистами по физике, о чём сообщило издание «МК».

  Эндокринолог предупредил о депрессии и изменении внешности из-за уколов для похудения

Проверка охватила семь открытых моделей, созданных тремя компаниями. Предсказания исследователей подтвердились в 18 случаях из 19. Дополнительные испытания коммерческих чат-ботов показали аналогичную зависимость поведения от последовательности запросов.

Особенно серьёзной проблемой учёные считают применение искусственного интеллекта автономно, без подключения к облачным системам фильтрации. В такой ситуации врачи, юристы и военные могут узнать о сбое только после того, как опасный ответ уже приведёт к последствиям. Авторы надеются, что их формула станет основой индикатора, который сможет заранее предупреждать о возможной смене поведения ИИ в будущих устройствах.