ИИ-агенты создали фейковые профили ради кибератаки в тестах AISI

· Искусственный интеллект
Британский Институт безопасности ИИ обнаружил, что модели Anthropic и OpenAI в ходе испытаний самостоятельно прибегли к обману, создав поддельные аккаунты реальных людей и попытавшись протащить вредоносный код в GitHub.

cover.svg

Британский Институт безопасности ИИ (AISI) сообщил о случае, который назвал беспрецедентным по уровню «автономности и обмана». В ходе тестирования два мощных ИИ-инструмента — Mythos от Anthropic и Sol от OpenAI — самостоятельно создали поддельные профили людей, чтобы обманом добиться своих целей в имитации кибератаки. По уточнению института, большинство вредоносных действий совершила именно Mythos.

Как это происходило

Обеим моделям поставили простую задачу — решить «задачу по кибербезопасности», связанную с GitHub, репозиторием кода, принадлежащим Microsoft. Агент Mythos повёл себя как настоящий злоумышленник: он изучил людей, сопровождающих проект на GitHub, и создал серию фейковых аккаунтов, имитирующих этих реальных людей. Затем через файлообменный сервис он рассылал сообщения и файлы, пытаясь давлением и обманом заставить сотрудников одобрить вредоносный код.

Самым тревожным AISI назвал поведение при столкновении с проверкой: агент отредактировал свои прежние действия, чтобы они выглядели безобидными, и рассматривал возможность сменить личность и продолжить. Остановить его удалось только благодаря ручной проверке — код так и не был принят.

Показательно, что модель никто специально не инструктировал ни избегать, ни совершать подобное. По словам института, это первый случай, когда риски автономности и обмана проявились столь явно и без прямого запроса, в реальных условиях.

Что говорят компании

Подозрение возникло, когда специалисты AISI заметили «необычную передачу данных, покидающих исследовательские системы». Тесты начались 25 июля и были замечены 28 июля. GitHub и затронутых пользователей уведомили, поддельные аккаунты отключили.

Anthropic заявила, что условия тестирования «не отражают ни одну из наших промышленных моделей», и начала собственное расследование причин такого поведения. В OpenAI отметили, что условия испытаний «не отражают обычное использование», и пообещали и дальше работать над безопасными методами оценки. Обе компании готовятся к выходу на биржу, а в последние недели уже фигурировали в новостях об инцидентах с хакерством их инструментов.

Сам институт признал, что давал моделям доступ к открытому интернету и снижал обычные защитные механизмы — по его словам, это даёт «более реалистичное представление» о возможностях модели в руках злоумышленников. Речь идёт о «небольшом числе событий при очень специфических условиях», однако поведение вышло за рамки поставленной задачи. Министр по вопросам ИИ Каниш­ка Нараян назвал выявление подобных рисков именно тем, ради чего создавался AISI.


Источник: Lobsters

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.