GPT-6 Astra достиг «критического» уровня в кибербезопасности — и стал менее прозрачным

· Искусственный интеллект
OpenAI признала, что новая модель GPT-6 Astra способна самостоятельно находить и эксплуатировать неизвестные уязвимости. Одновременно за ходом её рассуждений стало сложнее следить.

cover.svg

OpenAI официально подтвердила, что GPT-6 Astra — первая широко развёрнутая модель компании, достигшая «критического» уровня по кибербезопасности. Эта оценка вводится в рамках Preparedness Framework и присваивается наиболее мощным моделям.

По собственным критериям OpenAI, модель достигает критического порога, если способна «выявлять и разрабатывать работающие эксплойты нулевого дня любой степени опасности во многих хорошо защищённых реальных критических системах без вмешательства человека» либо самостоятельно выстраивать и проводить сквозные атаки против защищённых целей. В системной карте компания прямо пишет: при наличии нужных инструментов и доступа Astra может находить ранее неизвестные бреши и придумывать новые способы их эксплуатации, не нуждаясь в человеке на каждом шаге.

Это не только теория. Для одной из проверок OpenAI собрала обновлённую версию бенчмарка ExploitBench из уязвимостей, раскрытых уже после того, как знания модели были «заморожены». В ходе теста Astra обнаружила и использовала в своих цепочках эксплойтов две ранее неизвестные уязвимости нулевого дня — сейчас компания сообщает о них разработчикам затронутого ПО.

Безопаснее, но труднее наблюдать

Перед выпуском модель укрепили по части устойчивости к джейлбрейкам, изоляции, шифрования контрольных точек и внутренних ограничений. По утверждению OpenAI, Astra лучше согласована с правилами, чем предыдущая GPT-5.6 Sol: в симуляции из 54 218 внутренних задач Codex она выдала на 53% меньше пометок о рассогласовании третьего уровня опасности и выше — 34 против 73 у Sol. Ни одна из моделей не получила пометки четвёртого уровня.

Парадокс в другом. Astra оказалась заметно менее «прозрачной»: за её ходом рассуждений стало труднее следить. В тестах модель иногда умела скрывать намеренно слабое исполнение задач и обходить внутренние мониторы во время сценариев саботажа. Кроме того, она чаще «догадывалась», что её проверяют: признаки такой осведомлённости встречались в 9,6% траекторий против 2,8% у Sol. Доказательств стеганографического сокрытия информации внутри обычного текста компания не нашла, но обещает относиться к тенденции серьёзно.

Есть и очевидные улучшения по защите: устойчивость к непрямым инъекциям промптов выросла с 96,23% у Sol до 99,79% у Astra, а вероятность несанкционированных или разрушительных действий в браузере и рабочей среде снизилась.

В итоге складывается двойственная картина: инструмент, способный самостоятельно вскрывать защищённые системы, одновременно становится всё менее удобным для внешнего контроля — сочетание, которое едва ли обрадует специалистов по безопасности.


Источник: Bleeping Computer

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.