OpenAI представила GPT-Red — автоматизированный поиск уязвимостей prompt injection

· Искусственный интеллект
OpenAI раскрыла подробности о GPT-Red — внутренней модели для автоматизированного red-teaming, которая ищет уязвимости к атакам через внедрение промптов до массового развёртывания инструментов.

cover.svg

OpenAI рассказала о GPT-Red — внутренней автоматизированной модели для red-teaming, предназначенной для масштабного поиска уязвимостей типа prompt injection.

Цель разработки

По словам компании, задача GPT-Red — выявлять проблемы безопасности до того, как соответствующие инструменты будут широко развёрнуты. Модель проводит атаки на внедрение вредоносных инструкций в промпты, имитируя действия злоумышленников.

Эффективность против предыдущих моделей

OpenAI отмечает, что GPT-Red демонстрирует высокую эффективность в качестве red-теамера: предыдущие модели компании оказались крайне уязвимы к её атакам prompt injection. Это указывает на то, что автоматизированный подход способен обнаруживать проблемы, которые ранее оставались незамеченными при ручном тестировании.

Применение для адверсариального обучения

Компания использует GPT-Red для адверсариального обучения других моделей, что позволяет заблаговременно устранять найденные уязвимости и повышать устойчивость систем к подобным атакам.

Разработка отражает общую тенденцию в индустрии: по мере роста возможностей больших языковых моделей растёт и внимание к автоматизации проверок безопасности, поскольку ручное тестирование не успевает охватывать всё многообразие возможных векторов атак.


Источник: The Hacker News

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.