11.08.2026
Исследователи нашли способ восстанавливать скрытые цепочки рассуждений моделей Anthropic, OpenAI и Google, передавая зашифрованные блоки более слабым моделям того же провайдера. Метод также позволял извлекать пароли, API-ключи и персональные данные из опубликованных журналов работы ИИ-агентов.
Группа исследователей обнаружила уязвимость в API крупных поставщиков языковых моделей, связанную с хранением цепочек рассуждений на стороне клиента. Anthropic, OpenAI и Google возвращали эти данные в виде зашифрованных блоков, которые клиент должен был передавать обратно при последующих запросах.
Блоки можно было переносить между сеансами, пользователями и моделями внутри экосистемы одного провайдера. Исследователи передавали рассуждения мощной модели ее менее защищенной и более дешевой версии, а затем заставляли ту воспроизводить содержимое открытым текстом. Доступ к инфраструктуре поставщика или ключам шифрования для атаки не требовался.
Авторы обработали 315 320 блоков из общедоступных репозиториев и обнаружили 367 фрагментов персональных данных и 182 учетных секрета, включая API-ключи и пароли. Уязвимость также могла использоваться для извлечения рассуждений с целью дистилляции моделей и для скрытого внедрения инструкций в журналы работы ИИ-агентов.
Anthropic, OpenAI и Google получили технические подробности до публикации исследования. После внесенных ими изменений прежние варианты атак перестали воспроизводиться. Авторы рекомендуют не публиковать необработанные журналы API с непрозрачными блоками рассуждений, а провайдерам — криптографически привязывать такие блоки к конкретным пользователям, сеансам и моделям.
Отдельный анализ выявил сходство между рассуждениями открытой модели Kimi K3 и закрытых моделей Claude и GPT на некоторых заданиях. Исследователи подчеркивают, что этот результат не доказывает использование дистилляции при обучении Kimi K3.
Источник: stolen-thoughts.com