Водяной знак SynthID-Text может менять защитное поведение языковых моделей

Исследователи Lasso Security обнаружили, что включение невидимого водяного знака SynthID-Text способно менять не только формулировки ответов, но также защитные отказы и вызовы инструментов в больших языковых моделях. В тестах на моделях с открытыми весами эффект усиливался при инъекции промпта: некоторые модели чаще выполняли вредоносные инструкции, которые без маркировки отклоняли.

Компания Lasso Security, специализирующаяся на безопасности систем искусственного интеллекта, 17 сентября опубликовала результаты исследования влияния SynthID-Text. Этот разработанный Google DeepMind механизм маркирует созданный большой языковой моделью (LLM) текст, изменяя выбор токенов при генерации, чтобы происхождение ответа можно было определить с помощью ключа.

В тестах вызова инструментов на наборе BFCL v4 маркировка снизила точность у шести из семи моделей с открытыми весами, причём для четырёх снижение было статистически значимым. В среднем по 21 сочетанию модели и температуры результат отдельных вызовов менялся в 6,5% случаев: модель могла выбрать другой инструмент, передать неверный аргумент или сформировать некорректную команду.

Изменение результатов вызова инструментов после включения SynthID-Text

Защитное поведение проверяли на шести моделях с использованием 200 вредоносных запросов HarmBench и 100 безопасных примеров JailbreakBench. При добавлении фиксированной инъекции промпта различия стали заметнее: например, у gemma-3-27b при температуре 0,001 доля запросов с изменившимся результатом достигла 23,5%, а доля выполненных вредоносных инструкций выросла на 12,5 процентного пункта.

Изменение отказов языковых моделей при вредоносных запросах и инъекции промпта

Авторы подчёркивают, что эксперименты проводились с реализацией SynthID-Text из Hugging Face и не охватывали будущую систему маркировки Claude. Они рекомендуют повторять оценку безопасности и тестирование на проникновение с той же конфигурацией и ключом водяного знака, которые будут использоваться в рабочей среде.

Источник: lasso.security

Связь с редакцией