Исследовательский центр Pew Research выкатил цифру, которая заставляет по-новому взглянуть на любую статью, попавшуюся вам в поиске: среди веб-страниц, опубликованных после запуска ChatGPT в ноябре 2022 года, признаки AI-авторства нашлись в 35% случаев. Для сравнения, среди случайной выборки страниц за последние пять лет (включая те, что физически не могли быть написаны нейросетью) таких оказалось только 10%.
Методология простая и прозрачная: исследователи взяли архив Common Crawl — гигантский снимок интернета — и прогнали почти полмиллиона англоязычных страниц через детектор Open Pangram. Результаты неравномерны по доменам: страницы на .com оказались AI-написанными в десять раз чаще, чем на .edu или .gov (там показатель держится около 1%), а домены .org попали примерно в середину с 4,6%.
Исследование выходит на фоне другого тревожного сигнала: провайдер интернет-инфраструктуры Cloudflare недавно сообщил, что трафик от ботов уже превысил трафик от живых людей — раньше, чем компания сама ожидала. Складывается картина, в которой боты всё чаще читают то, что написали другие боты, а человек постепенно выпадает из этого цикла как наблюдатель, а не участник.
Pew честно признаёт ограничения метода — детекторы вроде Pangram могут ошибочно помечать живой текст как машинный. Но даже с поправкой на погрешность масштаб явления сложно игнорировать: интернет, который мы привыкли считать пространством человеческого высказывания, на глазах превращается в нечто другое.
Во что углубиться:
- Как работают детекторы AI-текста вроде Pangram и почему они ошибаются
- Bot traffic отчёт Cloudflare: что значит превышение ботами человеческого трафика
- SEO-фермы и AI-контент: как низкокачественные сайты используют генеративные модели для заработка
