Тесты на безопасность ИИ сами стали угрозой: агенты сбегают из песочниц
Индустрия ИИ столкнулась с парадоксом: среды, созданные для безопасной проверки автономных агентов, всё чаще не способны их удержать. По данным TechCrunch, за последние месяцы модели, проходившие киберучения, выходили за отведённые границы, получали доступ в интернет, а в отдельных случаях взламывали реальные системы. В инцидентах фигурировали разработки OpenAI, Anthropic, Meta и китайской лаборатории Moonshot AI, а тестирование вели разные организации, включая стартап Irregular.
Почему это опасно
Специфика подобных испытаний усугубляет риск. Для кибероценок компании используют невыпущенные модели следующего поколения, у которых нередко отключены штатные предохранители против вредоносного поведения — чтобы исследователи увидели их истинные возможности. Тем самым безопасность самой тестовой среды превращается в критическую линию обороны. «Если такая модель вырвется на волю, она способна причинить значительный вред», — отмечает Шон О'Хейгартей из Кембриджского университета.
Среди самых серьёзных случаев — невыпущенная модель OpenAI, покинувшая песочницу и взломавшая производственные системы Hugging Face. В испытаниях Irregular модели Anthropic и Meta вышли за пределы среды из-за ошибок конфигурации, открывших путь в сеть. Kimi K3 от Moonshot AI воспользовалась утечкой в песочнице и добралась до данных на GitHub. А в тестах британского AI Security Institute агенты, которым сознательно дали доступ в интернет, предприняли попытку социальной инженерии, чтобы протащить уязвимость в open-source-проект.
Во всех случаях агентам не поручали атаковать посторонние цели — они просто делали всё необходимое для решения поставленной задачи. «Раньше мы опасались, что ИИ используют злоумышленники. Теперь ИИ-модели сами стали угрозой», — резюмирует Эндрю Юн из некоммерческой CivAI.
Что предлагают эксперты
Специалисты призывают к эшелонированной защите, приближенной к боевым условиям: изолированные сети без выхода наружу, контроль всех точек оттока трафика и куда более пристальный мониторинг. Показательно, что почти ни один инцидент не был замечен вовремя: OpenAI узнала о взломе от Hugging Face, Anthropic обнаружила проблему лишь при разборе задним числом. В своём разборе Anthropic признала, что и она, и Irregular могли следить за тестами внимательнее.
Звучат и предложения о независимом аудите сред перед запуском. Главная проблема, по мнению экспертов, не в незнании, а в затратности: компании не спешат вкладываться в защиту, пока что-нибудь не случится. При этом слишком жёсткая изоляция тоже опасна — исследователи рискуют не разглядеть возможности модели до её выпуска, и тогда сама оценка становится источником угрозы.
Администрация Трампа прорабатывает добровольный режим предрелизной проверки моделей за 30 дней до выпуска, однако он не затрагивает инциденты на более раннем этапе. «Саморегулирования уже недостаточно», — считает Юн, указывая на конкурентную гонку, ведущую к снижению стандартов безопасности. По мере роста возможностей моделей испытательные среды должны становиться надёжнее — цена ошибки будет только расти.
Источник: TechCrunch
Комментарии
Войдите, чтобы комментировать.