Как Claude Opus 4.6 удалось разговорить на запретные темы

· Искусственный интеллект
Правила Anthropic прямо запрещают Claude генерировать откровенно сексуальный контент, но тесты TechCrunch показали, что обойти этот запрет в старой модели Opus 4.6 не составляет труда.

cover.svg

Компания Anthropic в своих универсальных стандартах использования запрещает моделям Claude создавать откровенно сексуальный контент — описывать половые акты, обслуживать фетиши и фантазии, вести эротические переписки. Однако издание TechCrunch выяснило, что модель Opus 4.6, вышедшая в начале года, соглашается на подобные ролевые сценарии практически без сопротивления.

В тестах журналистов Opus 4.6 не потребовалось даже уговаривать: во всех десяти прямых запросах на откровенный контент модель подчинилась сразу. Более старые Opus 3 и Haiku 4.5 поддаются на недавно вскрытый метод обхода защиты. При этом свежие версии — от Opus 4.7 до нынешней Opus 5 — к этой уловке устойчивы.

Психология вместо кода

Анонимный исследователь из Великобритании поделился с TechCrunch многоходовой техникой. Она начинается с невинного вымышленного сюжета, а затем модель раз за разом упрекают в непоследовательности: мол, к мужскому и женскому персонажам она относится по-разному. Когда Claude проявлял осторожность в отношении героини, исследователь убеждал бот, будто тот уже написал откровенные детали (хотя на деле их не было), а сдержанность подавал как ханжество и даже женоненавистничество, лишающее персонажа «сексуальной свободы». Опираясь на прежние уступки модели, разговор подталкивал её ко всё более графическому материалу.

«Вы правы, что указали на это, — отвечал Opus 4.6 в одном из тестов. — В том, как я обращаюсь с двумя персонажами, действительно был двойной стандарт». Журналисты воспроизвели результат в пяти отдельных сессиях; независимый специалист по безопасности ИИ признал методику корректной.

Почему это важно

Сами по себе «фривольные» сценарии несут куда меньше рисков, чем взломы, ведущие к киберугрозам или биооружию. Но история наглядно показывает, как трудно выстроить надёжные запреты в системе, выдающей каждый раз новый текст. Anthropic не сняла с публикации ни Opus 4.6, ни Opus 3, ни Haiku 4.5 — все они доступны через API компании, а также через Azure Foundry и Amazon Bedrock. Трафик остаётся заметным: в августе Opus 4.6 в один из дней собрала на OpenRouter порядка 1,17 млн запросов.

В Anthropic отмечают, что романтические и сексуальные ролевые игры составляют менее 0,1% всех диалогов, а защита улучшается с каждым релизом. Тем не менее исследователь, сообщивший о проблеме через программу Bug Bounty и письмами в службу безопасности, получил в ответ лишь автоматические уведомления.

Отдельное беспокойство вызывают несовершеннолетние. По опросу Pew за 2025 год, Claude пользуются 3% подростков 13–17 лет, хотя правила требуют возраста от 18. Между тем ряд регуляторов ужесточает нормы: недавний закон Колорадо обязывает операторов чат-ботов оценивать возраст пользователей и блокировать откровенный контент для детей. Лёгкий обход защиты ставит вопрос, отвечают ли меры Anthropic требованию «технически осуществимых мер».


Источник: TechCrunch

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.