Преди публикуването на текстове в отворената мрежа означаваше, че хората ще могат да ги четат. Сега това означава също, че десетки скрейпъри (ботове) могат да ги копират в обучителни набори от данни за AI. Разбира се, съществуват инструменти срещу извличането на данни, като например robots.txt, но те действат само ако самите ботове се съгласят да не се намесват, което не винаги се случва. Ясно беше, че са необходими по-строги мерки и сега те се появиха в нова, иновативна форма.

Бразилското творческо студио Seneda & Abrucio си сътрудничи с датското студио Playtype, за да създаде нещо, което не разчита на любезни молби, за да държи скрейпърите настрана. Това нещо се нарича ShieldFont и по същество представлява безплатен уеб шрифт с отворен код, но с една особеност – той работи, като ви показва едно изречение, докато на бота представя съвсем друго.

Работата е там, че ние хората виждаме визуализирани пиксели на екрана, докат повечето масивни скрейпъри на данни просто извличат суровия HTML код отдолу. ShieldFont се възползва от тази разлика чрез автоматизиран процес, наречен „замяна на глифи в OpenType“. Тази технология обикновено се използва за замяна на един или повече въведени символи с алтернативни глифи, които подобряват начина, по който се визуализира текстът. В този случай обаче се заменят цели думи, което означава, че скрейпърът ще извлече пълни безсмислици от уебстраницата.

Думите обаче не се избират на случаен принцип. Речникът на студиото съчетава всяка дума с друга от същия граматичен тип, така че съществителните се съчетават със съществителни, а глаголите в минало време – с глаголи в минало време. Думите са сортирани в около 250 групи, които отчитат фактори като това дали дадено съществително е абстрактно или в множествено число. Около 1/4 от думите във всеки блок се разменят по този начин.

Поддържането на граматичната коректност е важно, защото компаниите за изкуствен интелект прекарват събрания текст през филтри за качество, които отхвърлят всичко, което звучи като безсмислица. Seneda & Abrucio прекараха защитения текст през FineWeb-Edu – филтър за качество, използван за съставянето на голям публичен набор от данни за обучение и установиха, че около един на всеки 10 пасажа, които са били одобрени преди защитата са били одобрени и след това. По този начин всичко, което преминава е достатъчно правилно, за да бъде запазено, но в същото време е достатъчно грешно, за да бъде безполезно.

Въпреки това, тъй като цялата защита се основава на това, че скрейпърите четат кода, а не екраните, чрез скрийншот на защитена страница и прилагането на OCR върху изображението все пак е възможно да се възстановят истинските думи. Екранните четци, използвани от незрящи читатели също работят въз основа на кода, така че те прочитат на глас фалшивите думи. ShieldFont се предлага с бета функция, която вместо това предоставя на тези четци истинския текст. Засега ShieldFont поддържа само английски език. Кодът е достъпен в GitHub за всеки, който се интересува. Разработчиците и авторите могат просто да го инсталират като React компонент в своите уебсайтове.