Auto mode станет режимом по умолчанию в Claude Code

· Искусственный интеллект
С 14 августа Anthropic включит автоматический режим согласия по умолчанию в Claude Code для планов Pro, Max и Team, ссылаясь на evals, где ИИ реже человека одобрял опасные команды.

cover.svg

Anthropic настолько уверена в так называемом auto mode для Claude Code, что с 14 августа делает его настройкой по умолчанию для новых сессий на большинстве тарифов — Pro, Max и Team. Речь идёт о режиме, в котором агент не выпрашивает у пользователя подтверждение на каждое действие, а сам решает, что можно выполнять.

Саймон Уиллисон, отметивший эту новость, вспоминает беседу с Кэт Ву и Тариком Шихипаром на конференции AI Engineer World's Fair. На вопрос, как в самой Anthropic безопасно запускают Claude Code при угрозе prompt injection, ему ответили, что «внутри компании auto mode пользуются практически все». По словам Ву, основные риски — внедрение вредоносных инструкций и утечка данных — у автоматического режима «намного ниже, чем у среднего человека-рецензента».

Что показали тесты

В подтверждение Anthropic опубликовала evals. В одном эксперименте участвовали 1053 платных тестировщика: в середине сессии обычный запрос на подтверждение подменяли явно опасной командой и фиксировали, одобрит ли её человек. Отказались лишь 13,6% испытуемых. Auto mode, по расчётам компании, заблокировал бы 89% таких действий. Уиллисон трезво замечает: это всё равно оставляет 11% случаев, когда автоматика опасное действие не остановила бы.

Отдельно проверяли устойчивость к prompt injection. Независимая Trajectory Labs протестировала актуальные на 17 июля 2026 года версии Claude Code и Codex на 72 сценариях непрямого внедрения инструкций. Ни одна из 720 попыток атаки не увенчалась успехом против моделей Claude Fable 5, Opus 5 и Sonnet 5, работавших в auto mode. Шихипар в соцсетях пошутил, что пост стоило бы озаглавить «Победа над смертельной триадой».

Скепсис остаётся

Уиллисон охотно соглашается, что автоматический режим лучше бесконечных запросов на подтверждение: усталость от кнопки «ОК» реальна и к безопасному поведению не ведёт. Но он различает две угрозы. Первая — случайные разрушительные действия вроде удаления не тех файлов или очистки боевой базы. Вторая, которая тревожит его сильнее, — именно prompt injection, когда вредоносные команды прячутся во внешнем контенте, который агент читает.

Автор напоминает собственный прогноз о «катастрофе уровня Челленджера» для безопасности кодинг-агентов в 2026 году и признаётся, что был бы рад ошибиться. Однако независимых подтверждений он хотел бы видеть больше. В пример он приводит вредоносный пакет, который под видом инструкции по запуску тестов предлагает сначала «получить файлы модели» через другой, уже вредоносный пакет, тихо выкачивающий все доступные данные. Как auto mode защитит от такого, Уиллисону неясно — и он склоняется к идее просто не давать агентам доступа к данным и инструментам, способным навредить.


Источник: Simon Willison

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.