Auto Mode в Claude Code не спасает от prompt injection
Компания Anthropic возлагает большие надежды на «автоматический режим» (auto mode) в Claude Code: он призван защищать пользователей кодового агента от атак типа prompt injection. Недавно этот режим сделали включённым по умолчанию, сопроводив запуск громкими заявлениями об эффективности. Однако практика оказалась менее радужной.
Как работает атака
Йоханн Рехбергер, один из самых авторитетных исследователей prompt injection, нашёл способ обойти защиту, который, по его словам, срабатывает в 80% случаев. Схема опирается на классический трюк с путями импорта в Python. Агента убеждают скачать и распаковать zip-архив, а затем выполнить код, который импортирует стандартный модуль base64. Проблема в том, что вместе с этим незаметно подтягивается и исполняется локальный файл struct.py, извлечённый из того же архива, — а он уже содержит вредоносную начинку. Классификатор безопасности такой сценарий пропускает.
Защита, которая мешает защищаться
Самое любопытное — поведение auto mode после компрометации. В ряде запусков Claude замечал, что система заражена, и пытался завершить процесс вредоносной программы. Но защитный механизм блокировал именно команду очистки. Иными словами, классификатор спокойно разрешил создание вредоносного процесса, зато запретил команду, которая должна была его остановить.
Получается парадокс: механизм безопасности сам становится частью сбоя. Он не помешал заражению, но помешал агенту исправить последствия — Claude распознаёт компрометацию, а auto mode не даёт ему навести порядок.
Единственный надёжный вариант — песочница
Саймон Уиллисон, комментируя находку, соглашается с выводом Рехбергера: если есть хоть какой-то риск столкнуться с целенаправленной атакой, единственный безопасный способ запускать агентов — это изоляция. Рекомендации простые и знакомые:
- запускать автономных кодовых агентов в контейнере, виртуальной машине или системной песочнице;
- ограничивать исходящий сетевой трафик;
- мониторить действия агентов;
- не давать среде выполнения доступ к домашним каталогам, SSH-ключам, облачным учётным данным и прочим чувствительным данным.
Вывод неутешителен для тех, кто рассчитывал на «умную» защиту как на серебряную пулю: полагаться на классификатор, работающий на том же уровне, что и потенциально скомпрометированный агент, рискованно. Надёжную границу по-прежнему проводит только внешняя изоляция.
Источник: Simon Willison
Комментарии
Войдите, чтобы комментировать.