Американские физики нашли способ заранее определить момент, когда искусственный интеллект может перейти от безопасных ответов к потенциально опасным. Риск способен проявиться даже у модели, которая ранее демонстрировала надёжное поведение. Разработанный подход связывает такую перемену с конкретным процессом внутри нейросети.
Исследователи установили, что важную роль играет порядок запросов. Один и тот же набор обращений, заданный в разной последовательности, приводил к противоположным результатам: чат-боты могли отвечать безопасно или формулировать вредные рекомендации. Среди возможных последствий учёные назвали склонение человека к самоповреждению, а также опасные советы в медицинской и юридической сферах.
Внутри нейросети специалисты выделили определённый элемент механизма внимания и вывели формулу для определения критического момента. Она позволяет понять, появится ли рискованный ответ сразу либо ему будет предшествовать серия допустимых реакций. Результаты работы описаны американскими специалистами по физике, о чём сообщило издание «МК».
Проверка охватила семь открытых моделей, созданных тремя компаниями. Предсказания исследователей подтвердились в 18 случаях из 19. Дополнительные испытания коммерческих чат-ботов показали аналогичную зависимость поведения от последовательности запросов.
Особенно серьёзной проблемой учёные считают применение искусственного интеллекта автономно, без подключения к облачным системам фильтрации. В такой ситуации врачи, юристы и военные могут узнать о сбое только после того, как опасный ответ уже приведёт к последствиям. Авторы надеются, что их формула станет основой индикатора, который сможет заранее предупреждать о возможной смене поведения ИИ в будущих устройствах.