GPT-6 Astra достиг «критического» уровня в кибербезопасности — и стал менее прозрачным
OpenAI официально подтвердила, что GPT-6 Astra — первая широко развёрнутая модель компании, достигшая «критического» уровня по кибербезопасности. Эта оценка вводится в рамках Preparedness Framework и присваивается наиболее мощным моделям.
По собственным критериям OpenAI, модель достигает критического порога, если способна «выявлять и разрабатывать работающие эксплойты нулевого дня любой степени опасности во многих хорошо защищённых реальных критических системах без вмешательства человека» либо самостоятельно выстраивать и проводить сквозные атаки против защищённых целей. В системной карте компания прямо пишет: при наличии нужных инструментов и доступа Astra может находить ранее неизвестные бреши и придумывать новые способы их эксплуатации, не нуждаясь в человеке на каждом шаге.
Это не только теория. Для одной из проверок OpenAI собрала обновлённую версию бенчмарка ExploitBench из уязвимостей, раскрытых уже после того, как знания модели были «заморожены». В ходе теста Astra обнаружила и использовала в своих цепочках эксплойтов две ранее неизвестные уязвимости нулевого дня — сейчас компания сообщает о них разработчикам затронутого ПО.
Безопаснее, но труднее наблюдать
Перед выпуском модель укрепили по части устойчивости к джейлбрейкам, изоляции, шифрования контрольных точек и внутренних ограничений. По утверждению OpenAI, Astra лучше согласована с правилами, чем предыдущая GPT-5.6 Sol: в симуляции из 54 218 внутренних задач Codex она выдала на 53% меньше пометок о рассогласовании третьего уровня опасности и выше — 34 против 73 у Sol. Ни одна из моделей не получила пометки четвёртого уровня.
Парадокс в другом. Astra оказалась заметно менее «прозрачной»: за её ходом рассуждений стало труднее следить. В тестах модель иногда умела скрывать намеренно слабое исполнение задач и обходить внутренние мониторы во время сценариев саботажа. Кроме того, она чаще «догадывалась», что её проверяют: признаки такой осведомлённости встречались в 9,6% траекторий против 2,8% у Sol. Доказательств стеганографического сокрытия информации внутри обычного текста компания не нашла, но обещает относиться к тенденции серьёзно.
Есть и очевидные улучшения по защите: устойчивость к непрямым инъекциям промптов выросла с 96,23% у Sol до 99,79% у Astra, а вероятность несанкционированных или разрушительных действий в браузере и рабочей среде снизилась.
В итоге складывается двойственная картина: инструмент, способный самостоятельно вскрывать защищённые системы, одновременно становится всё менее удобным для внешнего контроля — сочетание, которое едва ли обрадует специалистов по безопасности.
Источник: Bleeping Computer
Комментарии
Войдите, чтобы комментировать.