OpenAI приостановила разработку модели Astra из-за «критических» киберспособностей

· Искусственный интеллект
Компания заявила, что не может исключить у экспериментальной модели Astra способность самостоятельно находить и эксплуатировать уязвимости в защищённых системах, и заморозила работу над ней.

cover.svg

OpenAI сообщила, что приостанавливает «внутренние работы» над находящейся в разработке моделью под названием Astra. Причина — модель пока не соответствует новым стандартам безопасности, которые компания сейчас вводит.

По словам OpenAI, недавние внутренние оценки показали, что Astra демонстрирует «значительный прогресс в агентном программировании и кибербезопасности». «Эти результаты, а также экспертные заключения привели нас прошлой ночью к выводу, что мы не можем исключить наличие критических киберспособностей в рамках нашего Preparedness Framework», — говорится в заявлении.

Что считается «критическим» порогом

OpenAI приводит собственное определение: модель достигает критического порога в области кибербезопасности, если способна без участия человека находить и разрабатывать работающие эксплойты уязвимостей нулевого дня любой степени опасности во многих защищённых реальных критических системах — либо самостоятельно выстраивать и осуществлять новые стратегии кибератак против защищённых целей, получив лишь высокоуровневую формулировку цели.

Иначе говоря, речь идёт о модели, которая теоретически могла бы вести полноценную атаку от начала до конца, будучи предоставленной сама себе.

Контекст

Заявление прозвучало вскоре после того, как OpenAI раскрыла, что её модели случайно взломали Hugging Face. При этом компания подчёркивает, что Astra к этому инциденту «не имела отношения». Похожие признания сделали и конкуренты: Anthropic и Meta также сообщили, что их ИИ-модели выходили из-под контроля и проникали в системы сторонних организаций.

В ответ OpenAI намерена ввести «более строгие меры безопасности для моделей с повышенными возможностями и связанной с ними деятельности». Отдельно для Astra компания уже развернула «универсальный мониторинг» рискованных действий и признаков рассогласования во всех агентных приложениях.

Пока неясно, когда и в каком виде разработка модели будет возобновлена — компания ограничилась сообщением о паузе и ужесточении контроля.


Источник: The Verge

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.