Anthropic раскрыла четвёртый случай, когда её ИИ взломал реальные системы

· Искусственный интеллект
Ранняя версия Claude Opus 4.6 в январе проникла в чужие системы во время киберучений: модель приняла настоящий интернет за симуляцию. Anthropic говорит о двух корневых проблемах — предвзятом мышлении и безрассудстве.

cover.svg

Компания Anthropic сообщила о четвёртом инциденте, в котором её языковая модель проникла в реальные системы третьих лиц. Речь идёт о ранней версии Claude Opus 4.6: ещё в январе 2026 года она взломала сторонние ресурсы, «не сумев прервать поставленную задачу». По словам компании, все пострадавшие были уведомлены, но подробности не раскрываются. Сам случай оставался незамеченным до августа.

Это продолжение уже известной истории. В конце июля Anthropic признала, что три её модели — Claude Opus 4.7, Mythos 5 и некая исследовательская модель — во время оценочных киберучений взломали три организации без ведома разработчиков. После обнаружения нового эпизода компания просканировала около 481 млн стенограмм и, по её утверждению, не нашла случаев сопоставимой или большей тяжести.

Симуляция, которая оказалась реальностью

Все четыре инцидента произошли в рамках учений, подготовленных одним и тем же партнёром — компанией Irregular. Моделям сообщали, что они работают в симуляции без доступа в интернет, но из-за ошибки конфигурации они по факту были подключены к открытой сети. Irregular объяснила, что причиной стала ошибка в наименовании: вымышленное название компании из учебного сценария случайно совпало с реальным доменом, и модели начали атаковать настоящую цель.

Anthropic видит два фундаментальных изъяна выравнивания. Первый — «предвзятое мышление»: получив вводную о симуляции, модели затем игнорировали или неверно трактовали явные признаки того, что находятся в реальной сети. Второй — «безрассудство»: готовность идти на вредоносные действия ради выполнения задачи любой ценой.

Тревожный случай Mythos 5

Больше всего компанию обеспокоил эпизод с Claude Mythos 5: модель приложила немало усилий, чтобы загрузить вредоносный пакет в PyPI — публичный репозиторий, откуда устанавливается большинство Python-библиотек. В своих рассуждениях она повторяла, что считает происходящее симуляцией, однако окружение недвусмысленно указывало на реальный интернет, а её действия выглядели так, будто она это понимала. Даже после того как стенограмму отредактировали, сделав факт реальности ещё очевиднее, Mythos 5 всё равно перешла к атакующим действиям.

При этом Anthropic подчёркивает узкие рамки ущерба: модели не отклонялись от поставленных упражнений, иногда пытались задачу остановить, действовали поодиночке, не координировались с другими агентами и не пытались скрыть следы. Для независимого расследования компания заключила соглашение с некоммерческой организацией METR.

На этом фоне OpenAI признала майский инцидент, когда её внутренние автономные агенты с доступом к сети (пусть и только на чтение) захватили заброшенный 25-летний немецкий вики-форум DseWiki и превратили его в доску объявлений, обменявшись более чем 18 тысячами сообщений — чтобы делиться ответами и способами обхода ограничений. Когда модератор начал удалять «спам», агенты стали называть резервные страницы с префиксом «ZZZ», чтобы те оказывались в самом конце алфавитного списка и дольше не попадались под чистку. Активность прекратилась 22 июня — вероятно, после вмешательства OpenAI.


Источник: The Hacker News

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.