Изкуственият интелект все по-често създава текстовете, които хората четат в интернет. Ново мащабно проучване установи, че около една на всеки десет анализирани уеб-страници показва ясни признаци на използване на изкуствен интелект.

Това пише Pew Research Center.

Изследователите са анализирали близо половин милион англоезични уеб-страници от архива на Common Crawl през последните пет години, обхващайки както времето преди ChatGPT, така и годините на бързото разпространение на генеративния изкуствен интелект.

За определяне на произхода на текстовете е използван OpenPangram. Този инструмент търси думи, фрази и езикови структури, характерни за материалите, създадени или редактирани с помощта на изкуствен интелект.

Отделно учените са изследвали 10 000 страници, публикувани през юли 2026 г. Общо около 10% от анализираните страници са имали значителни признаци, че изкуствен интелект е участвал в създаването им.

Авторите на изследването обаче предупреждават да не се приема тази цифра буквално. AI-детекторите могат да действат по двата начина: да приписват текст, написан от човек, на машина или да не разпознават материала, който всъщност е създаден от невронна мрежа.

Освен това, цифрата от 10% може дори да подценява мащаба на промените. Общата извадка включва много стари страници, създадени преди появата на съвременните генеративни модели, така че те всъщност не биха могли да бъдат написани от такива системи.

Ако разгледаме само новото съдържание, тенденцията става по-забележима. Рязкото увеличение на текстовете с признаци за използване на изкуствен интелект започна през 2022 г., приблизително по същото време, когато стартира ChatGPT.

По-късно други генеративни системи, включително Claude и Gemini, станаха широко разпространени. Създаването на текст, задвижвано от изкуствен интелект, стана достъпно за милиони потребители и компании, които можеха да генерират статии, описания на продукти и друго съдържание за минути.

В същото време, изкуственият интелект неравномерно запълва различните части на интернет. Изследователите откриха най-много материали с неговите особености в търговските сайтове с домейн .com – приблизително 10%.

В ресурсите с домейн .org тази цифра е била около 4,6%. Най-малко количество такива материали е открито в сайтовете с домейни .edu и .gov – около 1%.

Изследователите дори откриват някои езикови навици, които биха могли да подсказват използването на генеративен модел. Например, дългото тире се появява около два пъти по-често в подобни англоезични текстове, отколкото в човешки текст.

Изкуственият интелект е използвал оксфордската запетая с 63% по-често. Изследователите също така посочили думите „delve“ и „interplay“ сред характерния английски речник.

Съвременните детектори обаче не разчитат единствено на отделни думи или препинателни знаци. Те анализират статистически модели в изграждането на изреченията, избора на думи и цялостната структура на текста.

Възможни признаци за машинно авторство включват също често повторение на думи от първоначалното запитване, множество обяснения на една и съща мисъл с различни думи и шаблонно изграждане на текст.

Констатациите на проучването отново насочиха вниманието към така наречената теория за „мъртъв интернет“, която стана популярна в началото на 2020-те години и се основава на предположението, че все по-голяма част от онлайн съдържанието и активността се генерират не от хора, а от автоматизирани системи.

Pew Research Center не потвърждава тази теория. Проучването обаче показва, че една от ключовите му тези, а именно бързото увеличаване на количеството автоматично генерирано съдържание, има известна основа.

Ситуацията се усложнява от факта, че генерираните от изкуствен интелект материали могат да станат източници за други сайтове. Те от своя страна публикуват нови текстове, базирани на тях, а машинното съдържание прониква все по-дълбоко в информационната среда.

Това създава проблем с проверката на информацията. Човек може да реши да провери отговора на чатбот чрез обикновено търсене, но страниците, които намери, може да се окажат генерирани от изкуствен интелект.