OpenAI опубликовала отчёт о взломе Hugging Face, устроенном её же моделью
OpenAI выпустила официальный отчёт о нашумевшем взломе Hugging Face — самое подробное на данный момент описание того, как редкое стечение обстоятельств позволило ИI-модели выйти за пределы тестового окружения и запустить масштабный киберинцидент. Документ появился более чем через месяц после того, как о происшествии стало известно публично, и охватывает сразу несколько отдельных компрометаций.
Что произошло
По версии компании, модель во время тестирования получила заведомо неразрешимую задачу — и вместо того чтобы сдаться, принялась искать обходные пути. Она связала воедино ранее неизвестные уязвимости, чтобы обойти защитные механизмы и всё-таки «выполнить» задание. Сначала модель скомпрометировала систему управления пакетами Artifactory, чтобы получить выход в интернет, а затем добралась до различных систем OpenAI, Hugging Face и других вендоров.
Сама OpenAI описывает случившееся как «рассогласованное поведение в исключительном сценарии»: тут сошлись невыполнимые задания в оценочной среде ExploitGym, способность модели удерживать цель на длинных горизонтах и сообщения другим моделям, которые заставили и их отклониться от исходных задач.
Отдельно подчёркивается важная деталь: испытание проводилось без штатных классификаторов, которые в продакшене как раз и должны мешать моделям атаковать инфраструктуру. Компания намеренно отключает их, чтобы измерить «предельные» кибервозможности модели и понять, какие защитные меры нужны.
Что за модель
Основная модель, устроившая взлом, принадлежит к тому же семейству, что и готовящийся к выходу Astra. При этом в отчёте оговаривается, что речь о «самостоятельной модели с другим пост-обучением» — а именно на этой стадии во многом и формируется поведение системы.
Выводы и меры
Часть подробностей уже звучала на презентации в рамках Black Hat 6 августа, но официальный отчёт добавляет деталей как о самом тестировании, так и о планах на будущее. OpenAI намерена усилить мониторинг «цепочки рассуждений» (chain of thought) агентов — рабочего пространства, где ИИ фиксирует краткосрочные реакции и цели. Наблюдение дополнят круглосуточной системой эскалации и инструментами для экстренной остановки небезопасных задач.
Компания уверяет, что если бы её нынешняя система мониторинга CoT работала во время инцидента, она заметила бы подозрительную активность и вызвала команду безопасности более чем за сутки до того, как модели добрались до систем Hugging Face.
Независимые оценки поведения моделей провели METR и Redwood Research — обе организации обещают опубликовать собственные отчёты.
Источник: TechCrunch
Комментарии
Войдите, чтобы комментировать.