Защитные ограничители ИИ мешают легальным исследователям безопасности

· Безопасность
Специалисты по наступательной безопасности жалуются, что guardrails моделей OpenAI и Anthropic тормозят их работу и выталкивают к нерегулируемым, в том числе китайским, open-source-моделям.

cover.svg

Крупные ИИ-компании выстроили вокруг своих моделей систему проверок и ограничителей, чтобы отсечь злоумышленников. Но, как выяснил TechCrunch, поговорив с несколькими исследователями безопасности, те же барьеры бьют по легальным специалистам — как по защитникам сетей, так и по тем, кто занимается наступательной безопасностью.

Поводом для разговора послужил июньский эпизод: правительство США ввело экспортные ограничения на модели Anthropic Mythos и Fable — отчасти из-за отчёта о возможности обойти их защиту и использовать для кибератак. Ограничения позже сняли: Fable 5 вернулась в общий доступ 1 июля, а Mythos 5 — пока только для проверенных американских организаций. Anthropic, впрочем, сама годами позиционировала Mythos как «кибермашину судного дня», которую можно доверять лишь тщательно отобранным пользователям.

Инструмент, который нельзя разделить

И Anthropic, и OpenAI предлагают исследователям программы верификации (Trusted Access for Cyber и Cyber Verification Program), дающие доступ к моделям с ослабленными ограничениями. Но многие критикуют сам подход. Известный исследователь Марк Дауд признаётся, что ему неуютно от того, что «случайные крупные компании принимают произвольные решения о том, что в безопасности допустимо, а что нет».

Главный научный сотрудник NCC Group Крис Энли объясняет суть проблемы: запрос «исправь этот код» одновременно и защитный механизм, и карта для поиска критических уязвимостей. Один и тот же инструмент неразделимо служит и обороне, и нападению — «как молоток: без него не построить дом, но он же неизбежно и оружие». Когда модель отказывается отвечать, страдают в первую очередь защитники.

Куда уходят исследователи

Некоторые специалисты выработали обходные тактики. В CrowdFense фронтирные модели используют только для реверс-инжиниринга, а поиск уязвимостей ведут на локальных open-source-моделях — чтобы конфиденциальные данные не утекли в облако и не попали в будущие обучающие выборки. Исследователь Джузеппе Кали и вовсе не доверяет ИИ саму охоту за багами: «Я ревную к своим багам и слишком люблю эту игру, чтобы отдавать её моделям».

Аноним из производителя смартфонных компонентов рассказал, что без участия в программе Anthropic инструменты почти бесполезны: «Стоит модели учуять, что мы делаем что-то по безопасности, — она просто останавливается».

Глава RemoteThreat Крис Томпсон отмечает, что ограничители работают непоследовательно и «каждый день по-разному», так что вместо анализа уязвимостей исследователи тратят время на «переговоры с моделью». Итог, по его словам, парадоксален: ответственных специалистов выталкивают из подконтрольных США систем к иностранным — например, к свободно скачиваемым китайским моделям вроде GLM, у которых нет ни проверок, ни ограничений.

Томпсон призывает лаборатории не закручивать гайки, а открыть программы, дать ответственный доступ и наказывать тех, кто злоупотребляет. Иначе, предупреждает он, надвигающуюся волну атак «невиданного масштаба и скорости» защитники встретят со связанными руками.


Источник: TechCrunch

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.