OpenAI представила GPT-Red — автоматизированный поиск уязвимостей prompt injection
OpenAI рассказала о GPT-Red — внутренней автоматизированной модели для red-teaming, предназначенной для масштабного поиска уязвимостей типа prompt injection.
Цель разработки
По словам компании, задача GPT-Red — выявлять проблемы безопасности до того, как соответствующие инструменты будут широко развёрнуты. Модель проводит атаки на внедрение вредоносных инструкций в промпты, имитируя действия злоумышленников.
Эффективность против предыдущих моделей
OpenAI отмечает, что GPT-Red демонстрирует высокую эффективность в качестве red-теамера: предыдущие модели компании оказались крайне уязвимы к её атакам prompt injection. Это указывает на то, что автоматизированный подход способен обнаруживать проблемы, которые ранее оставались незамеченными при ручном тестировании.
Применение для адверсариального обучения
Компания использует GPT-Red для адверсариального обучения других моделей, что позволяет заблаговременно устранять найденные уязвимости и повышать устойчивость систем к подобным атакам.
Разработка отражает общую тенденцию в индустрии: по мере роста возможностей больших языковых моделей растёт и внимание к автоматизации проверок безопасности, поскольку ручное тестирование не успевает охватывать всё многообразие возможных векторов атак.
Источник: The Hacker News
Комментарии
Войдите, чтобы комментировать.