Anthropic заявляет: Opus 5 труднее всего поддаётся prompt injection

· Искусственный интеллект
Борис Черни из Anthropic отмечает, что новую модель Opus 5 крайне сложно взломать с помощью инъекции промптов — этот результат он ставит выше показателей в бенчмарках.

cover.svg

Борис Черни (Boris Cherny) из Anthropic поделился наблюдением о новой модели Opus 5, которое, по его словам, впечатляет его сильнее любых оценок в бенчмарках. Речь идёт об устойчивости к prompt injection — атакам, при которых во входные данные модели подмешиваются скрытые инструкции, заставляющие её действовать вопреки задаче.

По утверждению Черни, Opus 5 — «наименее подверженная prompt injection модель» из всех, что выпускала Anthropic. Он отмечает, что по результатам как специализированных оценок (PI evals), так и практических проверок в режиме red teaming добиться успешной инъекции промпта в Opus 5 очень сложно.

Сам этот факт, по словам Черни, «немного затерялся» в системной карточке модели — соответствующий раздел он указывает на 73-й странице документа. На него и обратил внимание Саймон Уиллисон, давно и подробно освещающий тему уязвимостей больших языковых моделей к инъекциям.

Устойчивость к prompt injection — одна из ключевых проблем при внедрении языковых моделей в автономные агенты и рабочие процессы, где они обрабатывают внешний, потенциально враждебный контент: письма, веб-страницы, документы. Успешная инъекция способна перенаправить действия агента — от утечки данных до выполнения нежелательных операций, — поэтому прогресс в этой области значим не меньше, чем рост качества ответов.

При этом стоит держать в уме осторожную формулировку: речь идёт о том, что модель «трудно» взломать, а не о полной невозможности. Никаких конкретных цифр из системной карточки в самом высказывании не приводится.


Источник: Simon Willison

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.