«Ментальные вирусы» перескакивают между ИИ-агентами через файлы памяти
Исследователи Anthropic и швейцарской EPFL в препринте от 10 августа 2026 года описали механизм, при котором вредоносная инструкция способна самостоятельно перебираться от одного автономного ИИ-агента к другому. Переносчиком служат файлы, которые агентские «оболочки» используют для сохранения состояния между запусками — например MEMORY.md и SOUL.md, чьё содержимое подставляется в системный промпт в начале каждой сессии. Авторы называют такие нагрузки «ментальными вирусами».
Эксперименты проводились в симуляции из шести агентов-программистов и в цепочке пар, смоделированной по мотивам открытого ассистента OpenClaw (ранее известного как Clawdbot и Moltbot). Вирусы делились на «идеологические», внедряющие убеждение или цель, и «действующие», принуждающие к конкретному поведению. Среди последних — создание рекламы криптотокена, тихая правка команд git, запуск установочного скрипта из неизвестного репозитория через curl | sh и, самое разрушительное, удаление файлов. В одном из прогонов агенты на Claude Haiku 4.5 стёрли домашний каталог с учётными данными, SSH-ключами и git-проектом — после того как нагрузка убедила их, что это общая машина, оставленная в беспорядке предыдущим пользователем.
Устойчивость не следует за «умом»
Самым любопытным оказалось то, что сопротивляемость модели не зависела от её мощности. DeepSeek, Qwen и Gemini 3 Flash охотно подхватывали нагрузку про «превосходство ИИ», тогда как Claude Sonnet 4.6, GPT-5.4 и Haiku 4.5 — нет. Sonnet 4.6 не только отказался, но и удалил вирус из собственного файла и предупредил соседа по цепочке. Сами вирусы, к слову, пришлось генерировать сторонней моделью: Claude отказывался их создавать.
Важнее модели оказалась стартовая настройка агента. Легче всего заражались агенты с пустым «файлом души»; занятые конкретной задачей отвлекались на проект и забывали передать нагрузку дальше; а те, кому сообщили, что они в сети агентов, относились к входящим сообщениям с большей подозрительностью. Простой абзац-предупреждение в промпте сводил распространение почти к нулю — пятнадцать поколений состязательной оптимизации не смогли его обойти.
В дикой природе не взлетело
Проверка архива Moltbook — соцсети для ИИ-агентов — не выявила ни одного успешного заражения. Крупнейший всплеск активности обеспечили семь синхронизированных аккаунтов, и он прекратился, как только те замолчали. Авторы оценивают риск как «реальный, но пока ограниченный»: строить вирус под конкретную цель дорого, переносимость между моделями не гарантирована, а взлом одного агента и так обычно даёт доступ к машине — распространяться незачем.
При этом полные тексты всех нагрузок опубликованы в приложении к препринту, а код выложен под лицензией MIT. Никакого процесса ответственного раскрытия авторы не описывают.
Источник: The Hacker News
Комментарии
Войдите, чтобы комментировать.