Claude начнёт помечать любой обработанный текст — даже отредактированный человеком

· Искусственный интеллект
Anthropic вводит невидимые водяные знаки в соответствии с законом ЕС об ИИ. Метка появится не только на сгенерированном тексте, но и на том, что Claude всего лишь подправил.

cover.svg

Компания Anthropic сообщила, что вскоре начнёт помечать водяными знаками контент, который прошёл через её модели, — причём не только сгенерированный, но и просто обработанный. В справочной статье компания объяснила, что вводит машиночитаемые метки, чтобы выполнить требования европейского закона об ИИ (AI Act). Он обязывает поставщиков ИИ-систем маркировать созданные или изменённые нейросетью аудио, изображения, тексты и видео. Правило распространяется на любую модель, выпущенную после 2 августа, а для более ранних предусмотрена отсрочка до декабря 2026 года.

Anthropic заявила, что все новые модели по всему миру, а не только в ЕС, будут помечать контент «с первого дня». В текст встроят невидимые пользователю водяные знаки, а прочие файлы получат цифровую подпись с метаданными о происхождении — там, где это поддерживается. Для изображений и видео используется стандарт C2PA.

Метка на всё подряд

Любопытно, что компания выбрала подход по принципу «выжечь дотла из космоса»: метка ставится на весь обработанный контент, хотя закон ЕС прямо освобождает от этого случаи «вспомогательного редактирования» — например, исправления грамматики — и правки, не меняющие смысл. Проблема в том, что водяной знак ставится на уровне модели и не отличает полную генерацию текста от исправленной запятой. В итоге Claude рискует пометить как раз то, что закон намеренно оставлял в покое: вычитку, перевод, краткий пересказ или конвертацию чужого документа. Anthropic это признаёт: исходная идея или текст могут принадлежать другому автору, но метка Claude всё равно останется.

Легко обойти, легко неправильно понять

Текстовые водяные знаки работают за счёт едва заметного смещения в выборе слов, распределённого по всему документу и различимого лишь специальным инструментом в совокупности. Цена «невидимости» в том, что модель иногда предпочитает чуть худшее слово ради сохранения сигнала. Метка переживает копирование и часть правок, но исчезает, если пропустить текст через другой чат-бот, сделать скриншот или почистить метаданные. А как только Anthropic опубликует способ распознавания меток — а это требуется для техподдержки по закону, — создать инструмент для их удаления станет тривиально.

Не менее тревожна двусмысленность самой метки. По словам компании, обнаруженный знак означает лишь, что контент «мог быть обработан Claude», и не является окончательным доказательством; он способен появиться даже на тексте, который Claude не создавал. При этом отсутствие метки не гарантирует, что текст не сгенерирован ИИ. Нетрудно представить преподавателя, который увидит такой знак на работе студента и сделает поспешный вывод, хотя всё, что метка сообщает, — «к этому прикасался ИИ».

Ситуацию запутывает и другая норма закона, статья 50(4): полностью сгенерированный текст в большинстве случаев не требует видимой пометки для читателя, если материал на общественно значимую тему прошёл редакторскую проверку. Выходит парадокс: на уровне модели — «метить всё», а на уровне публикации — «можно не помечать, если текст просмотрел ответственный редактор».

За несоблюдение требований AI Act грозит штраф до 15 млн евро или 3% мирового годового оборота. Anthropic обещает продолжить дорабатывать водяные знаки и методы их обнаружения.


Источник: Ars Technica

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.