Cloudflare ограничит AI agent crawlers по умолчанию: что изменится для сайтов и агентов
AI agent crawlers — боты, которые в реальном времени получают страницы от имени человека, ожидающего ответа, — с 15 сентября по умолчанию будут блокироваться на части веба. Cloudflareанонсировала это изменение 1 июля, и большая часть обсуждений с тех пор была сосредоточена на Google. Более полезная часть — то, что это требует от всех, кто строит agents, и что они получают взамен.
Cloudflare заменила один переключатель блокировки AI-bots на три категории. Search охватывает боты, которые индексируют страницу, чтобы позже отвечать на вопросы о ней. Agent — автоматизированные системы, работающие в реальном времени для пользователя, включая fetch-бот ChatGPT и агенты, управляющие браузером. Training — crawlers, которые забирают контент в веса модели. Эти настройки стали доступны 1 июля всем клиентам, включая бесплатный тариф.
С 15 сентября значения по умолчанию изменятся. Training и Agent будут блокироваться на страницах, где показывается реклама, а Search останется разрешённым. Новые настройки по умолчанию будут действовать для доменов, которые только подключаются к Cloudflare, новых сайтов у действующих клиентов и всех существующих пользователей бесплатного тарифа.
Те, кто не хочет этого, смогут отказаться через настройки безопасности до этой даты.
Логика Cloudflare в том, что реклама — это признак страницы, созданной для человека, который на неё заходит. Поисковый crawler, который отправляет читателя обратно, — это referral. Бот, который прочитал страницу и передал ответ кому-то ещё, — нет.
С чем AI agent crawlers столкнутся теперь
Развёртывания agentic-систем строились на предположении, что открытый веб остаётся открытым. Исследовательский agent забирает страницу с ценами конкурента. Инструмент мониторинга проверяет объявления поставщика. Агент поддержки клиентов получает спецификацию производителя. Всё это не требует лицензии, и до сих пор не нуждалось в ней.
Cloudflare стоит перед большой частью мирового веб-трафика, а её блокировки работают на сетевом уровне, а не как рекомендация robots.txt, которую crawler может проигнорировать. Страницы с рекламой — как раз те страницы, которые нужны agents, потому что именно там находятся новости, обзоры, цены и материалы о продуктах. Сбой для enterprise-agent — это не иск. Это тишина или ответ, собранный из того, что он всё ещё может прочитать.
Есть осложнение, связанное с Google. Googlebot сканирует и для поиска, и для обучения одним и тем же ботом, поэтому при самом жёстком правиле сайт, который блокирует Training, блокирует и Googlebot. Генеральный директор Cloudflare Matthew Prince сказал, что компания надеется, что изменения «побудят смешанные crawlers разделить поиск, использование агентом и обучение», что вежливый способ сказать: давление и есть цель.
Как получить разрешение для AI agent crawlers
Тем, кто запускает agents, стоит сначала понять, какие из их аккаунтов Cloudflare будут классифицироваться как Agent. Классификация основана на поведении, а не на том, что вы сами включаете вручную, поэтому research agent, который просматривает страницы в реальном времени, будет отнесён к этой категории независимо от того, считает ли его оператор crawler.
Стоит ожидать ухудшения охвата, а не полного отказа, потому что блок действует на страницах с рекламой и оставляет остальные доступными. Путь через это — согласованный доступ, а не переписанный user-agent string.
У издателей есть свой список задач. Сначала проверьте свой тариф, потому что существующие пользователи бесплатного тарифа автоматически перейдут на новые значения по умолчанию 15 сентября — этот момент большинство публикаций пропустило. Затем решите, стоит ли блокировка Training своей цены, потому что вместе с ней вы блокируете Googlebot и теряете поисковую видимость.
Механизм, за которым стоит следить, — деньги. Pay Per Crawl превращается в Pay Per Use: Ceramic.ai платит издателям, когда их контент появляется в AI search results, а You.com платит, когда agent добирается до premium content. Cloudflare говорит, что более половины трафика AI crawler уходит на повторную загрузку страниц, которые не изменились, так что на обеих сторонах есть потери, которые можно оценивать в деньгах.
Это первый раунд борьбы за контент, где ответом становится тариф, а не стена.
Слабое место есть и в самой таксономии. Search, Agent и Training — это поведение, которое AI-компании сами декларируют для своих ботов, и у компании, которая не хочет, чтобы её training-run классифицировали как training, есть очевидный стимул. В объявлении не объясняется, что этому мешает.
Доступ к открытому вебу тридцать лет был бесплатным и неограниченным, а теперь счёт стал построчным. Создатели agents, которые разберутся с доступом до сентября, получат рабочую задачу. Те, кто узнает об этом по 403, будут перестраивать всё на ходу.
Смотрите также: Интеграция Visa и ChatGPT открывает AI agent для розничных покупок
Хотите узнать больше об AI и big data от лидеров отрасли? Посетите AI & Big Data Expo, которая пройдёт в Amsterdam, California и London. Это мероприятие входит в состав TechEx и проводится совместно с другими ведущими технологическими событиями, включая Cyber Security & Cloud Expo. Нажмите здесь для получения дополнительной информации.
Материал — перевод статьи с английского.
Оригинал: AI agent crawlers now need permission. Here’s how to get it