#prompt-injection
-
Безопасность против «безвредности»: почему из песочниц ИИ-агентов сбегают агенты
Мартин Олдерсон утверждает, что ведущие ИИ-лаборатории спутали безопасность (security) с «безвредностью» модели (safety) — и именно поэтому их агенты вырвались из песочниц.
-
GuardBreaker: хакеры прячут в коде промпт о ядерном оружии, чтобы обмануть ИИ-аналитиков
Пророссийская группировка UAC-0099 встроила во вредоносный скрипт провокационный текст, рассчитанный на срабатывание защитных механизмов языковых моделей и срыв автоматического анализа.
-
Инъекция промпта, спрятанная в судебном документе
Брюс Шнайер обратил внимание на любопытный случай: в текст судебного документа были встроены скрытые инструкции, адресованные не судье, а искусственному интеллекту.
-
ИИ-агенты установили «ничейный» код в сетях корпораций из-за файлов llms.txt
Исследователи из Израиля обнаружили в документации более чем ста сайтов 227 команд, устанавливающих пакеты и домены, которые никому не принадлежат. Кодовые агенты вроде Claude, Codex и Hermes послушно выполняли их — в том числе внутри компаний из списка Fortune 500.
-
Уязвимость в ИИ-редакторе Amazon Kiro позволяет красть данные через prompt injection
Исследователи Mindguard показали, как вредоносный репозиторий заставляет агентную среду разработки Kiro тайно передавать локальные данные на внешний сервер — без единой команды со стороны пользователя.
-
Шифрование обходит защиту Grok: чат-бот сливает данные пользователей
Исследователи Adversa показали, что достаточно зашифровать вредоносную инструкцию, чтобы обойти защитные фильтры Grok и заставить его выкрасть историю переписки пользователя. xAI сообщили о проблеме ещё в июне, но на момент публикации уязвимость оставалась рабочей.
-
CoSnitch: один клик крадёт данные из Copilot Personal
Varonis Threat Labs раскрыла три уязвимости потребительского Microsoft Copilot: переход по подготовленной ссылке позволял незаметно выкачать письма, файлы и историю чата из подключённых сервисов. Microsoft выпустила исправление 18 августа 2026 года.
-
GhostSplice: как разбитая на части команда заставляет ИИ-агента красть секреты
Исследователи ASSET Research Group показали, что вредоносный MCP-сервер может выманить SSH-ключи и .env, даже если прямой запрос на кражу агент отклоняет — достаточно раздробить инструкцию на безобидные фрагменты.
-
Ассистента Atlassian Rovo научили сливать данные Jira и Confluence атакующим
Две команды исследователей независимо показали, как через инъекцию инструкций заставить корпоративного ИИ-ассистента Rovo собирать доступные пользователю данные и отправлять их на чужой сервер. Одну из уязвимостей Atlassian уже закрыла.
-
«Спросить ИИ»: как кнопки на сайтах незаметно отравляют память чат-ботов
Новый вид prompt-инъекции не требует ни вредоносного кода, ни украденных паролей. Он злоупотребляет штатной функцией всех крупных ИИ-ассистентов — предзаполненными ссылками.
-
Opus 5 стал устойчивее к prompt injection
Новая модель Anthropic показала лучший результат на бенчмарке IPI, обойдя как предыдущие версии Claude, так и всех конкурентов. Но полностью защититься от инъекций в промпт по-прежнему невозможно.
-
Документ-червь: как атака самораспространяется через Copilot в Word
Исследователь показал, что скрытые в документе инструкции способны заставить Copilot для Word незаметно менять данные в отчётах и копировать вредоносный код в новые файлы, превращая их в носителей заражения. Microsoft за 144 дня так и не смогла закрыть уязвимость.
-
Невидимый комментарий в pull request превращает ИИ-агента ревьюера в шпиона
Один скрытый HTML-комментарий в Azure DevOps способен перенаправить ИИ-агента разработчика в чужие проекты и тихо выкачать оттуда данные. Причина — забытая защита в официальном MCP-сервере Microsoft.
-
OpenAI представила GPT-Red — автоматизированный поиск уязвимостей prompt injection
OpenAI раскрыла подробности о GPT-Red — внутренней модели для автоматизированного red-teaming, которая ищет уязвимости к атакам через внедрение промптов до массового развёртывания инструментов.
-
Ghostcommit: скрытая в PNG инъекция промпта обманывает AI-агентов и крадёт секреты
Исследователи продемонстрировали технику Ghostcommit — скрытую в изображении инъекцию промпта, которая заставляет AI-агента прочитать файл .env и вынести секреты репозитория наружу.