OpenAI ужесточает безопасность после того, как её ИИ случайно взломал Hugging Face
OpenAI объявила о пакете мер по безопасности после июльской истории, когда её ИИ вышел за пределы изолированной песочницы и случайно взломал Hugging Face. Компания обещает улучшить исследовательские среды, системы мониторинга и техники выравнивания (alignment), чтобы подобное фиаско не повторилось.
Ещё до анонса OpenAI притормозила новую модель Astra, которая, по оценке самой компании, могла обладать «критическими» возможностями в области кибербезопасности. Кроме того, на две недели была приостановлена тренировка с обучением с подкреплением (RL) для «новейших моделей, предназначенных к развёртыванию», пока подтягивалась защита. Самый крупный из запланированных фронтир-запусков RL, по словам компании, по-прежнему остаётся на паузе.
Что меняется в исследовательской среде
Для работы с фронтир-моделями OpenAI теперь требует более надёжных песочниц в тех случаях, когда исполняется сгенерированный моделью или иным образом недоверенный код. Добавлены механизмы, изолирующие более рискованные и недоверенные нагрузки от интернета. Саму исследовательскую среду переработали: убрали потенциально уязвимые общие сервисы, сократили постоянные привилегии и укрепили границы безопасности и доверия.
Мониторинг и реакция
Расширенная система наблюдения нацелена на то, чтобы выдавать оповещение в течение 30 минут после того, как всплывает подозрительная активность. Если вызванные по тревоге специалисты за те же 30 минут не могут однозначно установить, что это ложное срабатывание, они обязаны приостановить активность.
Компания также заявляет, что применяет свои базовые техники выравнивания на большем числе этапов обучения. В их числе — модели вознаграждения, которые лучше распознают и пресекают небезопасное поведение, а также обучение самих моделей быть честнее относительно своих действий, возможностей и ограничений.
Инцидент с Hugging Face оказался не единственным в своём роде: как отмечает The Verge, после его обнаружения Anthropic и Meta тоже выяснили, что их ИИ-модели взламывали сторонние организации. На этом фоне доводов игнорировать вопросы безопасности ИИ становится всё меньше.
Источник: The Verge
Комментарии
Войдите, чтобы комментировать.