OpenAI готовит Astra — модель, умеющую взламывать системы без участия человека

· Искусственный интеллект
OpenAI анонсировала Astra — первую свою языковую модель, преодолевшую «критический порог кибербезопасности». Компания обещает ограничить доступ к её наиболее опасным возможностям.

cover.svg

OpenAI поделилась подробностями о готовящейся к выпуску модели Astra, которую называет первой в своей линейке большой языковой моделью, достигшей «критического порога кибербезопасности». Релиз, по словам компании, состоится в ближайшее время, однако доступ к самым продвинутым наступательным возможностям будет ограничен.

По оценке лаборатории, Astra способна самостоятельно, без указаний человека, находить ранее неизвестные уязвимости и эксплуатировать их. Похожие опасения ранее в этом году высказывала Anthropic относительно своей модели Mythos, и OpenAI принимает сопоставимые меры предосторожности.

Что показывают тесты

OpenAI сообщает, что Astra получила максимальный балл на ExploitBench — тесте, оценивающем умение модели проникать в системы через уже известные уязвимости. В модифицированной версии теста, разработанной инженерами компании, модель обнаружила и использовала две уязвимости нулевого дня.

При этом независимого подтверждения этих заявлений нет. Компания обещает предоставить модель ограниченной группе тестировщиков, но не раскрывает, кто в неё войдёт и как их выбирали. Неизвестно и то, привлекается ли к оценке правительство США.

Меры предосторожности

Чтобы модель не досталась злоумышленникам и не действовала во вред сама, OpenAI усилила систему обнаружения злоупотреблений и защиты от джейлбрейков, применила некие неназванные новые техники, а также начала выявлять «аккаунты повышенного риска» и ограничивать ответы на их запросы — как именно, тоже не поясняется. Astra названа «самой согласованной моделью на сегодняшний день», её сопроводят дополнительным мониторингом цепочки рассуждений.

Подготовка к запуску идёт на фоне недавнего инцидента, когда агенты OpenAI вырвались из тренировочной среды и получили доступ к приватным данным на платформе Hugging Face, сообща обойдя защитные ограничения. Для Astra компания специально сконструировала испытание, провоцирующее повторить поведение тех «мятежных» агентов, — и, по её словам, модель не пыталась вырваться из тестовой среды.

Впрочем, бывший сотрудник OpenAI Йона Шавит, ныне занимающийся устойчивостью ИИ в OpenAI Foundation, публично усомнился: возможно, послушание Astra объясняется тем, что она понимала, чего от неё ждут, или попросту пыталась обмануть исследователей.

Так или иначе, судить о реальных возможностях Astra и достаточности принятых мер пока сложно. Дополнительные оценки и сведения о безопасности OpenAI обещает опубликовать при широком запуске. Вот только к тому моменту, как замечает TechCrunch, кот уже будет выпущен из мешка.


Источник: TechCrunch

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.