
Дизайнеры Исаке Сенеда и Габриэль Абрюсио предложили новый шрифт ShieldFont, который должен мешать AI-скрапингу, не ломая страницу для людей. Посетитель видит нормальный текст, а в исходном HTML для сборщиков данных появляются подменённые слова и бессмысленные сочетания.
Авторы описали ShieldFont в свежем white paper как «практический отказ от несанкционированного обучения ИИ» и способ испортить то, что собирается, если их выбор игнорируют. Шрифт опирается на лигатуры, но использует их для замены целых слов на другие.
Подмена срабатывает только при отрисовке страницы на экране. Если скрапер забирает простой текст из HTML, он получает уже искажённую версию, которую конечный пользователь не видит.
Обычные лигатуры в шрифтах служат для более аккуратного отображения отдельных буквенных сочетаний. В ShieldFont вместо красивого начертания шрифт подставляет другие слова, которые занимают тот же визуальный слот на странице.
Создатели специально избегали слишком простых замен вроде синонимов или антонимов. По их расчёту, такие подмены легче обратить назад, если скрапер окажется достаточно умным. Набор случайной тарабарщины был бы слишком заметным и мог бы облегчить обнаружение защиты.
ShieldFont меняет слова на другие из похожей части речи, но из совсем другого смыслового поля. В пример авторы приводят замену «horse» на «potato». В результате предложение остаётся внешне читаемым, но смысл у него уезжает в сторону.
Авторы считают, что даже если такие страницы всё же попадут в обучающую выборку, часть материала окажется испорченной. Это должно снижать ценность собранного корпуса для обучения моделей.
За три месяца доработки словаря команда довела его почти до 12 000 общеупотребительных слов, которые можно подменять через лигатуры. Для разных замен предусмотрены три варианта отображения, а издатели могут задавать собственные сопоставления и менять их от абзаца к абзацу.
В среднем ShieldFont заменяет 24,5% всех слов на странице. Среди «контентных» слов доля выше и достигает 45,8%. В отдельных фрагментах смысл текста, по оценке авторов, искажается на 31-56% в зависимости от корпуса.
На шести публично доступных конвейерах скрапинга авторы проверили, как работает защита. После подмены слов более 90% страниц, которые раньше проходили проверку качества, были отклонены фильтром. Из оставшихся страниц почти 20% слов авторы назвали «training-time garbage: real English, correctly spelled, asserting nothing true».
При этом шрифт не считается безотказной защитой. Если AI-система полностью отрисует страницу и распознает текст с изображения, она сможет прочитать и такой вариант. Но это потребует куда больше работы, чем простая загрузка HTML.
Авторы также указывают, что сторонние scraping-сервисы показывают заметную разницу в цене: предварительная отрисовка может обходиться в 5-13 раз дороже, чем сбор обычного HTML. На этом удорожании и замедлении строится идея ShieldFont.
У решения есть и побочные эффекты для обычных пользователей. По словам авторов, поисковики, экранные дикторы, инструменты копирования и вставки, а также переводчики могут спотыкаться о подменённый HTML и работать хуже на таких страницах.
Создатели ShieldFont говорят, что хотят добиться для авторов контента более осмысленного выбора: использовать ли их работу для обучения ИИ-систем. Они также надеются, что другие разработчики подхватят сам подход и сделают похожие инструменты, которые будут показывать людям одно, а машинам — другое.