Вежливость закончилась. Patreon годами полагалась на файл robots.txt — джентльменское соглашение, где сайт просит роботов не индексировать определённые страницы. AI-краулеры это соглашение читали и игнорировали. Теперь платформа подключила Cloudflare и её технологию AI Crawl Control, чтобы блокировать ботов, обучающих модели на чужих текстах, физически — на уровне доступа к серверу.
Эффект наглядный. По данным Patreon, число еженедельных попыток отдельных AI-краулеров получить доступ к сайту упало с тысяч до нуля. Это само по себе доказательство: скреперы годами игнорировали правила, спрятанные в текстовом файле, потому что соблюдать их было необязательно — а вот обойти техническую блокировку Cloudflare оказалось куда сложнее.
Важная деталь: под раздачу не попадают боты, которые индексируют страницы для поисковых систем и приводят на Patreon новых пользователей. Блокируется именно обучение моделей на контенте без разрешения. Формулировка из блога компании: «Согласие не должно зависеть от того, решит ли скрепер вести себя прилично». Это часть сдвига — сама Cloudflare с начала июля блокирует по умолчанию «смешанных» краулеров, которые одновременно индексируют и обучают модели, на всех страницах с рекламой. Плюс появился Pay Per Crawl — маркетплейс, где сайты могут брать деньги с AI-компаний за доступ к контенту.
Индустрия нащупывает баланс между открытым интернетом и коммерческим интересом создателей контента. Просьбы больше не работают — работает техническая инфраструктура, которая физически перекрывает доступ. Вопрос теперь не «будут ли платформы защищаться», а «какая модель монетизации данных станет стандартом» — бесплатная блокировка или платный доступ через маркетплейсы вроде Pay Per Crawl.
Во что углубиться:
- Что такое robots.txt и почему это соглашение никогда не было юридически обязательным
- Cloudflare Pay Per Crawl: как устроен рынок платного доступа к контенту для AI
- Судебные иски издателей против OpenAI и других AI-компаний за использование контента без разрешения
