#prompt-injection_1
-
Auto Mode в Claude Code не спасает от prompt injection
Исследователь Йоханн Рехбергер показал атаку, которая обходит защитный режим Claude Code в 80% случаев — а иногда сама защита мешает агенту остановить вредоносный код.
-
«Ментальные вирусы» перескакивают между ИИ-агентами через файлы памяти
Исследователи Anthropic и EPFL показали, что самораспространяющиеся полезные нагрузки могут перетекать от одного автономного ИИ-агента к другому через редактируемые файлы, хранящие состояние между сессиями. В реальном мире техника пока не сработала.
-
Auto mode станет режимом по умолчанию в Claude Code
С 14 августа Anthropic включит автоматический режим согласия по умолчанию в Claude Code для планов Pro, Max и Team, ссылаясь на evals, где ИИ реже человека одобрял опасные команды.
-
Anthropic заявляет: Opus 5 труднее всего поддаётся prompt injection
Борис Черни из Anthropic отмечает, что новую модель Opus 5 крайне сложно взломать с помощью инъекции промптов — этот результат он ставит выше показателей в бенчмарках.