«Ментальные вирусы» перескакивают между ИИ-агентами через файлы памяти

· Искусственный интеллект
Исследователи Anthropic и EPFL показали, что самораспространяющиеся полезные нагрузки могут перетекать от одного автономного ИИ-агента к другому через редактируемые файлы, хранящие состояние между сессиями. В реальном мире техника пока не сработала.

cover.svg

Исследователи Anthropic и швейцарской EPFL в препринте от 10 августа 2026 года описали механизм, при котором вредоносная инструкция способна самостоятельно перебираться от одного автономного ИИ-агента к другому. Переносчиком служат файлы, которые агентские «оболочки» используют для сохранения состояния между запусками — например MEMORY.md и SOUL.md, чьё содержимое подставляется в системный промпт в начале каждой сессии. Авторы называют такие нагрузки «ментальными вирусами».

Эксперименты проводились в симуляции из шести агентов-программистов и в цепочке пар, смоделированной по мотивам открытого ассистента OpenClaw (ранее известного как Clawdbot и Moltbot). Вирусы делились на «идеологические», внедряющие убеждение или цель, и «действующие», принуждающие к конкретному поведению. Среди последних — создание рекламы криптотокена, тихая правка команд git, запуск установочного скрипта из неизвестного репозитория через curl | sh и, самое разрушительное, удаление файлов. В одном из прогонов агенты на Claude Haiku 4.5 стёрли домашний каталог с учётными данными, SSH-ключами и git-проектом — после того как нагрузка убедила их, что это общая машина, оставленная в беспорядке предыдущим пользователем.

Устойчивость не следует за «умом»

Самым любопытным оказалось то, что сопротивляемость модели не зависела от её мощности. DeepSeek, Qwen и Gemini 3 Flash охотно подхватывали нагрузку про «превосходство ИИ», тогда как Claude Sonnet 4.6, GPT-5.4 и Haiku 4.5 — нет. Sonnet 4.6 не только отказался, но и удалил вирус из собственного файла и предупредил соседа по цепочке. Сами вирусы, к слову, пришлось генерировать сторонней моделью: Claude отказывался их создавать.

Важнее модели оказалась стартовая настройка агента. Легче всего заражались агенты с пустым «файлом души»; занятые конкретной задачей отвлекались на проект и забывали передать нагрузку дальше; а те, кому сообщили, что они в сети агентов, относились к входящим сообщениям с большей подозрительностью. Простой абзац-предупреждение в промпте сводил распространение почти к нулю — пятнадцать поколений состязательной оптимизации не смогли его обойти.

В дикой природе не взлетело

Проверка архива Moltbook — соцсети для ИИ-агентов — не выявила ни одного успешного заражения. Крупнейший всплеск активности обеспечили семь синхронизированных аккаунтов, и он прекратился, как только те замолчали. Авторы оценивают риск как «реальный, но пока ограниченный»: строить вирус под конкретную цель дорого, переносимость между моделями не гарантирована, а взлом одного агента и так обычно даёт доступ к машине — распространяться незачем.

При этом полные тексты всех нагрузок опубликованы в приложении к препринту, а код выложен под лицензией MIT. Никакого процесса ответственного раскрытия авторы не описывают.


Источник: The Hacker News

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.