Как выкрасть скрытые «размышления» проприетарных языковых моделей

· Искусственный интеллект
Исследователи показали, что зашифрованные блоки рассуждений LLM взаимозаменяемы внутри экосистемы одного провайдера — и это открывает сразу несколько путей для атак.

cover.svg

Ведущие поставщики больших языковых моделей давно прячут пошаговые «размышления» своих систем — так называемую цепочку рассуждений (chain-of-thought). Делается это ради защиты интеллектуальной собственности и чтобы ограничить утечку информации. Однако сами эти рассуждения никуда не исчезают: вместо того чтобы хранить их на сервере, провайдеры возвращают их клиенту в виде блоков зашифрованного текста, который клиент затем прикладывает к каждому следующему запросу.

Новое исследование под названием «Stealing Reasoning Traces from Proprietary LLM APIs» указывает на архитектурный изъян этой схемы. Оказалось, что зашифрованные блоки полностью совместимы и взаимозаменяемы между разными сессиями, пользователями и даже разными моделями в рамках экосистемы одного провайдера.

Дешифровка чужими руками

На этой совместимости авторы построили масштабируемый «джейлбрейк-дешифратор». Идея проста и оттого неприятна: зашифрованный след рассуждений от сильной модели подсовывают более слабой и хуже защищённой модели того же провайдера — и та послушно расшифровывает и выводит текст дословно. Взламывать напрямую более способную модель при этом не требуется вовсе.

Исследователи выделяют четыре вектора атаки. Первый — обход механизмов защиты от «дистилляции»: чужие фирменные рассуждения удаётся извлечь, что продемонстрировано на моделях Anthropic, OpenAI и Google. Второй — массовая утечка приватных данных. Разработчики часто выкладывают логи сессий в открытый доступ, не подозревая, что скрыто внутри зашифрованных блоков. Расшифровав 315 320 таких блоков, собранных из публичных репозиториев, авторы восстановили 367 фрагментов персональных данных и 182 набора учётных данных.

Третий вектор особенно любопытен: метод вытаскивает на свет опасную информацию, спрятанную в процессе рассуждения, даже когда финальный видимый ответ модели вежливо отклоняет вредоносный запрос. Иными словами, модель «подумала» о запрещённом, отказалась это произносить вслух — но мысль осталась в зашифрованном блоке. Четвёртый — «невидимые» инъекции команд: вредоносную нагрузку можно целиком спрятать внутри зашифрованного блока и таким образом отравить публичные агентные сценарии.

Что дальше

Авторы работы прошли процедуру ответственного раскрытия и предложили конкретные меры защиты — как криптографические, так и на уровне архитектуры системы, — чтобы обезопасить рассуждения, обрабатываемые на стороне клиента. Пока же вывод довольно отрезвляющий: попытка спрятать «мышление» модели, переложив хранение зашифрованного контекста на клиента, породила новый класс уязвимостей вместо надёжной защиты.


Источник: Schneier on Security

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.