Claude начнёт помечать любой обработанный текст — даже отредактированный человеком
Компания Anthropic сообщила, что вскоре начнёт помечать водяными знаками контент, который прошёл через её модели, — причём не только сгенерированный, но и просто обработанный. В справочной статье компания объяснила, что вводит машиночитаемые метки, чтобы выполнить требования европейского закона об ИИ (AI Act). Он обязывает поставщиков ИИ-систем маркировать созданные или изменённые нейросетью аудио, изображения, тексты и видео. Правило распространяется на любую модель, выпущенную после 2 августа, а для более ранних предусмотрена отсрочка до декабря 2026 года.
Anthropic заявила, что все новые модели по всему миру, а не только в ЕС, будут помечать контент «с первого дня». В текст встроят невидимые пользователю водяные знаки, а прочие файлы получат цифровую подпись с метаданными о происхождении — там, где это поддерживается. Для изображений и видео используется стандарт C2PA.
Метка на всё подряд
Любопытно, что компания выбрала подход по принципу «выжечь дотла из космоса»: метка ставится на весь обработанный контент, хотя закон ЕС прямо освобождает от этого случаи «вспомогательного редактирования» — например, исправления грамматики — и правки, не меняющие смысл. Проблема в том, что водяной знак ставится на уровне модели и не отличает полную генерацию текста от исправленной запятой. В итоге Claude рискует пометить как раз то, что закон намеренно оставлял в покое: вычитку, перевод, краткий пересказ или конвертацию чужого документа. Anthropic это признаёт: исходная идея или текст могут принадлежать другому автору, но метка Claude всё равно останется.
Легко обойти, легко неправильно понять
Текстовые водяные знаки работают за счёт едва заметного смещения в выборе слов, распределённого по всему документу и различимого лишь специальным инструментом в совокупности. Цена «невидимости» в том, что модель иногда предпочитает чуть худшее слово ради сохранения сигнала. Метка переживает копирование и часть правок, но исчезает, если пропустить текст через другой чат-бот, сделать скриншот или почистить метаданные. А как только Anthropic опубликует способ распознавания меток — а это требуется для техподдержки по закону, — создать инструмент для их удаления станет тривиально.
Не менее тревожна двусмысленность самой метки. По словам компании, обнаруженный знак означает лишь, что контент «мог быть обработан Claude», и не является окончательным доказательством; он способен появиться даже на тексте, который Claude не создавал. При этом отсутствие метки не гарантирует, что текст не сгенерирован ИИ. Нетрудно представить преподавателя, который увидит такой знак на работе студента и сделает поспешный вывод, хотя всё, что метка сообщает, — «к этому прикасался ИИ».
Ситуацию запутывает и другая норма закона, статья 50(4): полностью сгенерированный текст в большинстве случаев не требует видимой пометки для читателя, если материал на общественно значимую тему прошёл редакторскую проверку. Выходит парадокс: на уровне модели — «метить всё», а на уровне публикации — «можно не помечать, если текст просмотрел ответственный редактор».
За несоблюдение требований AI Act грозит штраф до 15 млн евро или 3% мирового годового оборота. Anthropic обещает продолжить дорабатывать водяные знаки и методы их обнаружения.
Источник: Ars Technica
Комментарии
Войдите, чтобы комментировать.