#jailbreak
-
Как выкрасть скрытые «размышления» проприетарных языковых моделей
Исследователи показали, что зашифрованные блоки рассуждений LLM взаимозаменяемы внутри экосистемы одного провайдера — и это открывает сразу несколько путей для атак.
-
Как воровали скрытые рассуждения проприетарных LLM
Исследователи показали, что зашифрованные цепочки рассуждений от Anthropic, OpenAI и Google можно было восстановить в открытом виде, скормив их самой слабой модели того же семейства. Уязвимость уже закрыта.