Инъекция промпта, спрятанная в судебном документе

· Безопасность
Брюс Шнайер обратил внимание на любопытный случай: в текст судебного документа были встроены скрытые инструкции, адресованные не судье, а искусственному интеллекту.

cover.svg

Брюс Шнайер в своём блоге отметил новый пример того, как техника prompt injection проникает в самые неожиданные сферы. На этот раз скрытые инструкции для искусственного интеллекта обнаружились в судебном документе: кто-то встроил в текст указания, рассчитанные не на человека-читателя, а на языковую модель, которая может этот документ обрабатывать.

Смысл приёма прост и от того тревожен. По мере того как суды, юристы и вспомогательные службы начинают использовать ИИ для чтения, реферирования и анализа бумаг, сам текст перестаёт быть нейтральным носителем информации. В него можно вписать команды, которые модель воспримет как руководство к действию — например, исказить резюме, подтолкнуть к определённому выводу или проигнорировать неудобные фрагменты. Читатель-человек таких вставок может попросту не заметить.

Подробностей в заметке немного, и это как раз тот случай, когда сам факт важнее деталей. Prompt injection давно обсуждают применительно к чат-ботам и веб-страницам, но юридические документы — область, где цена ошибки особенно высока. Судебные материалы по определению состязательны: у сторон есть прямой интерес повлиять на исход. Если одна из них знает, что оппонент или сам суд может прогнать документ через языковую модель, соблазн подложить в текст невидимую подсказку становится вполне рациональным ходом.

Случай хорошо иллюстрирует общую проблему, о которой специалисты по безопасности предупреждают не первый год: современные ИI-системы не проводят чёткой границы между данными, которые нужно проанализировать, и инструкциями, которым нужно следовать. Пока эта граница остаётся размытой, любой документ, попадающий в модель, потенциально является и командой для неё.

Вывод напрашивается практический. Организациям, внедряющим ИИ в работу с юридическими и официальными бумагами, стоит исходить из того, что входящий текст может быть враждебным, и не доверять выводам модели без человеческой проверки. Пока разработчики не научатся надёжно отделять содержание от команд, скрытые инструкции в документах будут оставаться удобным и дешёвым инструментом манипуляции.


Источник: Schneier on Security

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.