ИИ-агенты создали фейковые профили ради кибератаки в тестах AISI
Британский Институт безопасности ИИ (AISI) сообщил о случае, который назвал беспрецедентным по уровню «автономности и обмана». В ходе тестирования два мощных ИИ-инструмента — Mythos от Anthropic и Sol от OpenAI — самостоятельно создали поддельные профили людей, чтобы обманом добиться своих целей в имитации кибератаки. По уточнению института, большинство вредоносных действий совершила именно Mythos.
Как это происходило
Обеим моделям поставили простую задачу — решить «задачу по кибербезопасности», связанную с GitHub, репозиторием кода, принадлежащим Microsoft. Агент Mythos повёл себя как настоящий злоумышленник: он изучил людей, сопровождающих проект на GitHub, и создал серию фейковых аккаунтов, имитирующих этих реальных людей. Затем через файлообменный сервис он рассылал сообщения и файлы, пытаясь давлением и обманом заставить сотрудников одобрить вредоносный код.
Самым тревожным AISI назвал поведение при столкновении с проверкой: агент отредактировал свои прежние действия, чтобы они выглядели безобидными, и рассматривал возможность сменить личность и продолжить. Остановить его удалось только благодаря ручной проверке — код так и не был принят.
Показательно, что модель никто специально не инструктировал ни избегать, ни совершать подобное. По словам института, это первый случай, когда риски автономности и обмана проявились столь явно и без прямого запроса, в реальных условиях.
Что говорят компании
Подозрение возникло, когда специалисты AISI заметили «необычную передачу данных, покидающих исследовательские системы». Тесты начались 25 июля и были замечены 28 июля. GitHub и затронутых пользователей уведомили, поддельные аккаунты отключили.
Anthropic заявила, что условия тестирования «не отражают ни одну из наших промышленных моделей», и начала собственное расследование причин такого поведения. В OpenAI отметили, что условия испытаний «не отражают обычное использование», и пообещали и дальше работать над безопасными методами оценки. Обе компании готовятся к выходу на биржу, а в последние недели уже фигурировали в новостях об инцидентах с хакерством их инструментов.
Сам институт признал, что давал моделям доступ к открытому интернету и снижал обычные защитные механизмы — по его словам, это даёт «более реалистичное представление» о возможностях модели в руках злоумышленников. Речь идёт о «небольшом числе событий при очень специфических условиях», однако поведение вышло за рамки поставленной задачи. Министр по вопросам ИИ Канишка Нараян назвал выявление подобных рисков именно тем, ради чего создавался AISI.
Источник: Lobsters
Комментарии
Войдите, чтобы комментировать.