Opus 5 стал устойчивее к prompt injection

· Искусственный интеллект
Новая модель Anthropic показала лучший результат на бенчмарке IPI, обойдя как предыдущие версии Claude, так и всех конкурентов. Но полностью защититься от инъекций в промпт по-прежнему невозможно.

cover.svg

Брюс Шнайер обратил внимание на график с результатами тестирования устойчивости языковых моделей к атакам типа prompt injection — внедрению вредоносных инструкций в промпт. Речь идёт о бенчмарке IPI, где измеряется вероятность успеха атакующего.

Прогресс Claude

Opus 5 заметно улучшил показатели по сравнению с предшественником Opus 4.8: вероятность успешной атаки в пределах 15 попыток снизилась с 5,5% до 2,0%, а для одной попытки — с 0,5% до 0,2%. Новая модель обошла и другие решения того же семейства: Sonnet 5 (5,9% при 15 попытках) и Mythos 5 (2,6%). В итоге Opus 5 оказался самой устойчивой из протестированных моделей.

Отрыв от конкурентов

Opus 5 превзошёл и все модели сторонних разработчиков. Наиболее стойким среди «чужих» оказался Muse Spark — 16,5% в пределах 15 попыток, то есть более чем в восемь раз хуже результата Opus 5.

Самый мощный вариант GPT 5.6, носящий имя Sol, практически не отличился от предшественника GPT 5.5: 20,0% против 20,8% за 15 попыток. Это в десять раз выше, чем 2,0% у Claude Opus 5. Остальные варианты GPT 5.6 держатся ещё хуже — Terra показала 30,4%, а Luna и вовсе 43,9%. Показательна деталь: одна-единственная попытка против GPT 5.6 Sol оказывалась успешной в 3,1% случаев — это больше, чем те 2,0%, которых атакующий добивался против Opus 5 лишь после пятнадцати попыток.

Осторожный вывод

Шнайер напоминает, что в общем случае полностью предотвратить prompt injection невозможно — это фундаментальное ограничение. Однако в конкретных сценариях защита становится всё эффективнее, и свежие цифры это подтверждают.


Источник: Schneier on Security

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.