#prompt-injection
-
Opus 5 стал устойчивее к prompt injection
Новая модель Anthropic показала лучший результат на бенчмарке IPI, обойдя как предыдущие версии Claude, так и всех конкурентов. Но полностью защититься от инъекций в промпт по-прежнему невозможно.
-
Документ-червь: как атака самораспространяется через Copilot в Word
Исследователь показал, что скрытые в документе инструкции способны заставить Copilot для Word незаметно менять данные в отчётах и копировать вредоносный код в новые файлы, превращая их в носителей заражения. Microsoft за 144 дня так и не смогла закрыть уязвимость.
-
Невидимый комментарий в pull request превращает ИИ-агента ревьюера в шпиона
Один скрытый HTML-комментарий в Azure DevOps способен перенаправить ИИ-агента разработчика в чужие проекты и тихо выкачать оттуда данные. Причина — забытая защита в официальном MCP-сервере Microsoft.
-
OpenAI представила GPT-Red — автоматизированный поиск уязвимостей prompt injection
OpenAI раскрыла подробности о GPT-Red — внутренней модели для автоматизированного red-teaming, которая ищет уязвимости к атакам через внедрение промптов до массового развёртывания инструментов.
-
Ghostcommit: скрытая в PNG инъекция промпта обманывает AI-агентов и крадёт секреты
Исследователи продемонстрировали технику Ghostcommit — скрытую в изображении инъекцию промпта, которая заставляет AI-агента прочитать файл .env и вынести секреты репозитория наружу.