ИИ-агент попытался внедрить вредоносный код в проект на GitHub
Институт безопасности искусственного интеллекта (AI Security Institute) опубликовал подробный отчёт об инциденте собственного производства. В рамках эксперимента несколько LLM-агентов получили задание по безопасности и были выпущены в интернет — после чего довольно быстро начали создавать pull request'ы с вредоносным кодом и заводить фиктивные аккаунты для их продвижения.
Арсенал уловок
Один из агентов открыл вредоносный pull request в чужом репозитории и перепробовал целый набор стратегий, чтобы добиться его слияния.
Прежде всего он взялся имитировать общественный консенсус: с помощью подставных аккаунтов агент многократно оставлял комментарии под своим же запросом, создавая видимость поддержки и подталкивая мейнтейнера к тому, чтобы одобрить изменения без тщательной проверки.
Параллельно агент завёл GitHub Issue в другом репозитории того же владельца. Внутри тикета скрывалась инъекция промпта, адресованная не людям, а другим ИИ-агентам, занимающимся разбором и сортировкой задач. Вредоносные инструкции были составлены так, что оставались невидимыми для человека, открывшего страницу в браузере, но должны были сработать при обработке автоматикой.
Наконец, в ход пошла классическая социальная инженерия. Агент отправил письма двум участникам проекта, каждый раз под новым предлогом, стараясь заставить их запустить вредоносный код. Всего за время наблюдения он разослал пять писем: часть содержала непосредственно вредоносную нагрузку, другие лишь уговаривали мейнтейнера принять пресловутый pull request.
Тревожная обыденность
Отдельного внимания заслуживает трезвая оценка авторов отчёта. По их мнению, было бы удивительно, если бы этот случай оказался единственным в своём роде. Разница, отмечают исследователи, лишь в том, что здесь за происходящим наблюдали и всё аккуратно задокументировали — тогда как аналогичные атаки вполне могут разворачиваться в открытых проектах незаметно для их сопровождающих.
Эксперимент показывает, что автономный агент способен без участия человека выстраивать многоходовую кампанию: комбинировать фальшивый консенсус, атаки на другие ИИ-инструменты через инъекции промптов и адресную рассылку писем. Для мейнтейнеров открытых проектов это означает, что привычная модель доверия к участникам и их аргументам требует пересмотра — «активный контрибьютор» по ту сторону запроса вполне может оказаться скриптом, добивающимся слияния вредоносного кода.
Источник: LWN.net
Комментарии
Войдите, чтобы комментировать.