ShieldFont: шрифт, который превращает страницы в бессмыслицу для ИИ-скраперов
Массовый сбор веб-контента для обучения ИИ уже обернулся судебными исками и техническими контрмерами. Очередным ответом стал шрифт ShieldFont, созданный дизайнерами Исаке Сенедой и Габриэлем Абрусио. Идея, изложенная в их white paper, проста: страница остаётся полностью читаемой для человека, но скраперу, который скачивает исходный HTML как обычный текст, достаётся подменённая, бессмысленная версия.
Когда лошадь становится картошкой
В основе лежат лигатуры — давняя типографская функция, обычно заменяющая пары букв на более аккуратное начертание. В ShieldFont лигатуры подставляют вместо целых слов другие слова, но только в момент отрисовки на экране. Читатель видит верный текст, а в исходном коде остаётся подделка.
Авторы отказались от простых синонимов и явной абракадабры: и то, и другое легко обнаружить или обратить. Вместо этого слова заменяются на другие той же части речи, но из совершенно иного смыслового контекста — «лошадь» становится «картошкой». Предложение выглядит грамматически корректным, но смысл искажён, что и портит ценность данных для обучения.
За три месяца доработки словаря авторы собрали около 12 000 распространённых слов, пригодных для подмены. Чтобы усложнить обнаружение, для каждого слова доступны три варианта замены, а издатель может задавать собственные соответствия и менять их от абзаца к абзацу.
В среднем ShieldFont заменяет 24,5% всех слов на странице и 45,8% «содержательных» слов, искажая смысл от 31 до 56% фрагментов. При проверке на шести публичных скрейпер-конвейерах свыше 90% страниц, которые прошли бы фильтр качества, после подмены им отбраковываются. У оставшихся около 20% слов авторы называют «мусором для обучения»: настоящий английский, написанный без ошибок, но не утверждающий ничего истинного. По их формуле: «Отброшено — значит, они не получили вашу работу. Принято — значит, получили что-то неверное».
Игра в кошки-мышки
У метода есть побочные эффекты. Поисковики, программы чтения с экрана, копирование текста и переводчики тоже спотыкаются об изменённый HTML, делая страницу менее удобной для настоящей аудитории. И защита не абсолютна: скрапер может отрендерить страницу целиком и распознать текст оптически. Но такой рендеринг, по оценке авторов, обходится в 5–13 раз дороже простого чтения HTML, что резко бьёт по массовому сбору данных.
Именно неизбирательный сбор в промышленных масштабах авторы и хотят затруднить. «Быть находимым не значит соглашаться на обучение ИИ», — пишут они, надеясь, что появятся и другие реализации принципа «показывать одно людям и другое машинам»: чем больше разных приёмов, тем труднее скраперам обойти их все.
Источник: Ars Technica
Комментарии
Войдите, чтобы комментировать.