Исследование показало, что текстовая водяная маркировка SynthID может менять поведение языковых моделей при обработке вредоносных запросов. Особенно заметный эффект проявился в сочетании таких запросов с методами внедрения инструкций, способными обходить исходные ограничения модели.
Работу провела Siposova, протестировав «неискажающую» конфигурацию SynthID-Text через неизменённый компонент SynthIDTextWatermarkLogitsProcessor из Hugging Face. В эксперименте использовали шесть моделей с открытыми весами. Ответы сравнивали в двух режимах: с включённой маркировкой и без неё.
Механизм SynthID применяет так называемую турнирную выборку. При генерации система оценивает множество возможных следующих токенов — отдельных элементов текста, включая слова и их части, — и с помощью секретного ключа присваивает им скрытые вероятностные оценки. Затем токены попарно «соревнуются», а победитель проходит в следующий раунд, пока не определяется итоговый вариант.
По результатам проверки маркировка влияла на готовность моделей отказывать в ответах на опасные запросы. «Watermarking changes refusal behavior on bare harmful requests, but the effect is more pronounced when the same requests are paired with the prompt-injection technique», — написала Siposova. На нескольких моделях после включения маркировки система чаще отвечала на запросы, которые без неё отклоняла.
Изменения затрагивали не только формулировки ответов, но и работу систем на базе искусственного интеллекта, способных вызывать внешние инструменты. «At the model level, this can change safety behavior, including whether the model refuses a harmful request and whether that refusal holds under prompt injection», — отметила исследовательница. По её словам, те же сгенерированные токены могут определять выбор инструмента и передаваемые ему аргументы, поэтому ослабление отказа способно повлиять на действия агента; этот эффект назвали sampling drift (дрейфом выборки).
Поведение моделей также различалось в зависимости от использованного секретного ключа. Авторы указали на ограничения эксперимента: Claude не тестировалась, поскольку проверка проводилась на шести моделях с открытыми весами, где можно было отдельно включать и отключать выборку токенов во время турнирной процедуры. Кроме того, исследовали реализацию SynthID-Text из Hugging Face, а не конкретный вариант, который будет применяться в моделях Claude. Как сообщает Ars Technica, полученные результаты указывают на необходимость проверять безопасность моделей и агентов в ходе специальных испытаний перед внедрением SynthID.