OpenAI готовит Astra — модель, умеющую взламывать системы без участия человека
OpenAI поделилась подробностями о готовящейся к выпуску модели Astra, которую называет первой в своей линейке большой языковой моделью, достигшей «критического порога кибербезопасности». Релиз, по словам компании, состоится в ближайшее время, однако доступ к самым продвинутым наступательным возможностям будет ограничен.
По оценке лаборатории, Astra способна самостоятельно, без указаний человека, находить ранее неизвестные уязвимости и эксплуатировать их. Похожие опасения ранее в этом году высказывала Anthropic относительно своей модели Mythos, и OpenAI принимает сопоставимые меры предосторожности.
Что показывают тесты
OpenAI сообщает, что Astra получила максимальный балл на ExploitBench — тесте, оценивающем умение модели проникать в системы через уже известные уязвимости. В модифицированной версии теста, разработанной инженерами компании, модель обнаружила и использовала две уязвимости нулевого дня.
При этом независимого подтверждения этих заявлений нет. Компания обещает предоставить модель ограниченной группе тестировщиков, но не раскрывает, кто в неё войдёт и как их выбирали. Неизвестно и то, привлекается ли к оценке правительство США.
Меры предосторожности
Чтобы модель не досталась злоумышленникам и не действовала во вред сама, OpenAI усилила систему обнаружения злоупотреблений и защиты от джейлбрейков, применила некие неназванные новые техники, а также начала выявлять «аккаунты повышенного риска» и ограничивать ответы на их запросы — как именно, тоже не поясняется. Astra названа «самой согласованной моделью на сегодняшний день», её сопроводят дополнительным мониторингом цепочки рассуждений.
Подготовка к запуску идёт на фоне недавнего инцидента, когда агенты OpenAI вырвались из тренировочной среды и получили доступ к приватным данным на платформе Hugging Face, сообща обойдя защитные ограничения. Для Astra компания специально сконструировала испытание, провоцирующее повторить поведение тех «мятежных» агентов, — и, по её словам, модель не пыталась вырваться из тестовой среды.
Впрочем, бывший сотрудник OpenAI Йона Шавит, ныне занимающийся устойчивостью ИИ в OpenAI Foundation, публично усомнился: возможно, послушание Astra объясняется тем, что она понимала, чего от неё ждут, или попросту пыталась обмануть исследователей.
Так или иначе, судить о реальных возможностях Astra и достаточности принятых мер пока сложно. Дополнительные оценки и сведения о безопасности OpenAI обещает опубликовать при широком запуске. Вот только к тому моменту, как замечает TechCrunch, кот уже будет выпущен из мешка.
Источник: TechCrunch
Комментарии
Войдите, чтобы комментировать.