Год назад мы объявили первый День независимости контента и предоставили владельцам веб-сайтов инструменты для возвращения контроля над своим контентом. Сделка между краулерами и владельцами сайтов, которая действовала 30 лет — мы сканируем вас, а вы получаете трафик — больше не работала. ИИ забирал всё и ничего не давал взамен, создавая экзистенциальную угрозу для владельцев сайтов. Поэтому мы запустили опцию "Блокировать AI-ботов" в один клик, а также рынок "Плати за сканирование" (Pay-Per-Crawl).
За год многое изменилось. В прошлом июле разговоры об "AI-ботах" вращались вокруг блокировки обучения ИИ без компенсации, указывая на проигрышную сделку, когда контент использовался для тренировки моделей без какой-либо выгоды для владельца сайта. Но появилось стремление к большей нюансировке: владельцы контента по-прежнему хотят защищать свой контент и получать компенсацию за оригинальные материалы, которые они создают, курируют и распространяют. Мы также понимаем, что полная блокировка контента — не универсальное решение; владельцы сайтов хотят больше опций, чем просто "блокировать всю автоматизацию всегда".
Если у вас небольшой сайт, проблема не только в том, что кто-то может обучать модели на вашем контенте — проблема в том, что вас вообще невозможно найти. Поэтому приходится заключать сделку с дьяволом: либо появляться в поиске и позволять ИИ обучаться на вас, либо рисковать потерей видимости. Это несправедливо ставит в преимущество действующих поисковых провайдеров, если они используют одних и тех же ботов и для поиска, и для обучения; а это несправедливое преимущество побуждает новых игроков уклоняться от правил, пытаясь сократить конкурентный разрыв.
Теперь ИИ может быть чем угодно
Сегодня ИИ может быть встроен во что угодно. Google Поиск изменился с сортировки с помощью ИИ на полноценную поисковую систему, которая отвечает на ваш вопрос прямо на странице результатов. И Google не уникален в этом — это направление, в котором движется "поиск".
Мы могли бы спорить о том, что считать "ИИ" сегодня, но завтра стандарты изменятся. Поэтому вместо того, чтобы определять бота как "ИИ" или нет, наш обновленный подход к классификации будет задавать более глубокие вопросы о поведении бота или агента: Что они делают на моем сайте? Что они сохраняют? И как они будут распространять мой контент?
Прагматичная таксономия
Чтобы ответить на эти вопросы, нам нужен более нюансированный взгляд — прагматичная таксономия, соответствующая сценариям использования ИИ, которые важны для наших клиентов. Поэтому мы расширяем обсуждение за пределы только обучения ИИ и фокусируемся на трех сценариях использования ИИ, которыми мы хотим дать возможность управлять всем клиентам:
-
Поиск: любое поведение, которое собирает или индексирует ваш контент, чтобы затем отвечать на вопросы о нем. Ключевой момент: Поиск активно создает базу данных вашего сайта для последующих ответов на запросы. Владельцы сайтов должны рассчитывать на реферальный трафик или другую справедливую компенсацию в результате.
-
Агент: автоматизированное поведение, которое действует, обычно в реальном времени, от имени человека, чтобы выполнить задачу прямо сейчас. Сюда входят чат-боты для получения данных (например, ChatGPT-User) и агенты, управляющие браузером (например, Gemini или Claude, управляющие Chrome). Ключевой момент: он посещает ваше веб-приложение, чтобы выполнить задачу, и часто на другом конце находится человек.
-
Обучение: краулер, забирающий ваш контент для обучения или тонкой настройки модели. Ключевой момент: ваши данные навсегда впитываются в базовую архитектуру ИИ для улучшения его возможностей.
Многие популярные краулеры в интернете попадают в одну из вышеуказанных категорий; некоторые — в несколько. Мы также классифицируем множество других видов поведения, помимо трех перечисленных — включая проверку рекламы, получение фидов и агентные транзакции (подробнее об этом ниже). Но мы считаем, что для всех владельцев сайтов должно быть просто управлять доступом для этих трех сценариев использования, связанных с ИИ. Мы считаем, что операторы ботов должны разделять свои краулеры, потому что это создает большую прозрачность для владельцев сайтов: позволяя им лучше понимать, почему данный краулер посещает их сайт, а также лучше управлять доступом, который они предоставляют этому краулеру. Если компания использует автоматизацию для построения поисковых индексов, действует как агент и собирает данные для обучения своих моделей, то мы настоятельно рекомендуем этой компании разделить автоматизацию на три отдельных краулера.
Мы хотим создать систему классификации, которая будет масштабируемой и отражающей мир автоматизированного трафика по мере его развития. Отслеживание целей ботов — не новость, но наша новая таксономия включает несколько обновлений, которые лучше отражают текущее состояние бот-трафика. Самое главное, мы хотим признать, что боты с несколькими целями должны отслеживаться со всеми целями, а не только с одной из них.
Новые опции для управления AI-трафиком
Мы хотим предоставить больше возможностей для управления различными видами AI-трафика всем владельцам сайтов в сети Cloudflare.
Ранее анонсированная предустановка "Блокировать AI-ботов" включала однозадачных ботов, которые сканировали данные для обучения моделей, как показано ниже:
Скриншот существующей настройки управления AI-бот-трафиком на 1 июля 2025 года.
Но не все варианты использования ИИ одинаковы, и мы хотим, чтобы наши клиенты имели необходимые инструменты управления. Поэтому мы запускаем возможность управлять AI-трафиком на основе трех основных сценариев использования: краулеры для Поиска, Агента и Обучения. С помощью этих новых опций наши клиенты смогут более тонко настраивать управление AI-бот-трафиком — включая клиентов на нашем бесплатном тарифе.
Скриншот новых опций для управления AI-бот-трафиком на 1 июля 2026 года.
Установка новых значений по умолчанию
15 сентября 2026 года мы установим новые значения по умолчанию для каждой из этих трех классификаций. Для всех новых доменов, подключающихся к Cloudflare, категории Обучение и Агент будут заблокированы по умолчанию на страницах, где отображается реклама, в то время как Поиск останется разрешенным по умолчанию.
Реклама — это сигнал о том, что владелец сайта планировал, чтобы пользователь попал туда и увидел ее — нечто монетизируемое, что поддерживает бизнес. Поэтому на таких страницах мы рассматриваем человеческое внимание как конечную цель и не допускаем ботов, которые могут этому вниманию помешать (т.е. ботов для Обучения и Агентов). С другой стороны, Поиск — это поведение, которое наиболее естественно возвращает посетителей, и мы считаем, что большинству владельцев сайтов выгодно его разрешить.
Еще одно изменение, которое вступит в силу 15 сентября, заключается в том, что многоцелевые краулеры (в частности, те, которые сочетают Поиск с Обучением) будут разрешены/заблокированы в соответствии со всеми их типами поведения, в рамках нашего призыва к прозрачности для владельцев сайтов. Поскольку значения по умолчанию будут применяться согласно наиболее строгим применимым правилам, многоцелевые краулеры, такие как Googlebot, Applebot и BingBot, будут заблокированы для клиентов, которые выбрали блокировку Обучения (либо через новые опции управления AI-трафиком, либо через устаревший сервис "Блокировать AI-ботов").
Конечно, выбор клиента имеет первостепенное значение: если владелец сайта хочет отказаться от этих новых конфигураций по умолчанию, он может легко отметить это в своих настройках безопасности в любое время до 15 сентября, что подтвердит, что он не хочет никаких изменений в отношении краулеров для Обучения, которые также сканируют для целей Поиска. Мы также продолжим уведомлять клиентов о предстоящем изменении значений по умолчанию по мере приближения 15 сентября, чтобы у клиентов, желающих выбрать настройки, отличные от значений по умолчанию, была такая возможность.
BotBase: новая плоскость видимости для корпоративных клиентов
Мы также рады запустить крупное обновление видимости в рамках новой функции корпоративного управления ботами (Enterprise Bot Management). Поскольку каталог отслеживаемых ботов Cloudflare вырос, выросло и желание управлять этими ботами в разумных группах и получать более детальную информацию о конкретном боте.
Представляем BotBase. BotBase — это наша новая база данных, отслеживающая всех известных ботов, включая проверенных ботов и агентов. Эта база данных обеспечивает всеобъемлющее, доступное для поиска представление всего нашего каталога ботов прямо на панели управления Cloudflare. Сейчас мы решаем задачу видимости в первую очередь, но позднее в этом году мы расширим BotBase, предоставив прямой центр управления для известного автоматизированного контента на вашем сайте.
С этим новым представлением клиенты Enterprise Bot Management могут видеть полный каталог всех проверенных ботов/агентов и то, как они классифицируются в этой обновленной таксономии — представление, которое мы никогда ранее не показывали динамически на панели управления Cloudflare. Клиенты, которые хотят точно нацелиться на конкретного бота, могут также легко отфильтровать весь трафик от этого бота, а также скопировать идентификатор обнаружения для использования в правилах безопасности. Все это теперь доступно на специальной странице, доступ к которой можно получить через карточку конфигурации Bot Management.
Создавая BotBase, мы хотели учесть все фрагменты информации, которые позволили бы нам получать масштабируемые и мощные аналитические данные от бота к боту. Один из таких фрагментов является краеугольным камнем нашей обновленной таксономии, которая основана на том, что бот может делать на вашем сайте — его поведении. Мы разделяем эти классификации, как показано ниже, и каждый бот классифицируется по одному или нескольким из этих поведений.
|
Классификация бота |
Поведение и использование |
|
Поиск |
Сканирование вашего сайта для помощи в его отображении в результатах поисковых систем |
|
Агент |
Агенты, управляемые пользователем, посещающие страницу от имени человека |
|
Обучение |
Сканирование для обучения или тонкой настройки моделей |
|
Транзакции |
Действия по оформлению заказа от имени пользователей |
|
Сбор данных |
Включает сбор цен, сбор конкурентной разведки и стороннюю аналитику |
|
Тестирование безопасности |
Включает сканирование уязвимостей и тестирование на проникновение |
|
SEO |
SEO-сканирование, аудит сайта, проверки доступности |
|
Верификация рекламы |
Проверка размещения рекламы, обнаружение мошенничества с рекламой |
|
Социальные сети / Предпросмотр ссылок |
Предпросмотр ссылок для социальных платформ и мессенджеров |
|
Получение фидов |
Включает RSS-ридеры, агрегаторы подкастов и ботов новостных лент |
|
Мониторинг & Operations |
Включает мониторинг времени безотказной работы, вебхуки и проверки работоспособности |
Строки, выделенные жирным курсивом, указывают на новые настраиваемые параметры, доступные всем клиентам.
Как краулер использует мой контент?
Еще одна информация, которая, как мы слышали, важна для наших клиентов, — это использование контента ботом — что бот может сохранить и повторно распространить после сканирования вашего контента. Для решения этой проблемы мы разрабатываем возможности для клиентов Bot Management выбирать и блокировать на основе «использования контента». Этот параметр может быть установлен на один из трех уровней, от наименее до наиболее разрешительного:
-
immediate— взаимодействовать, но ничего не хранить и не использовать повторно -
reference(по умолчанию) — индексировать, делать выдержки и ссылаться обратно -
full— обобщать и воспроизводить
Эти значения могут быть объединены с классификациями ботов для выражения тонких правил, например: «разрешить всех ботов, которые используются для Поиска, SEO и Верификации рекламы, но только до уровня использования reference». Это позволяет владельцам сайтов принимать решения в разумных группах, а не управлять индивидуальными правилами для каждого бота.
Для дальнейшей поддержки этого, начиная с сегодняшнего дня, мы тестируем новый сигнал use, который расширяет Content Signals и находится в вашем robots.txt. Это расширяет три поля первой версии Content Signals четвертым необязательным полем, которое выражает те же предпочтения, что и выше:
-
use=immediate -
use=reference -
use=full
Как и все остальные элементы, перечисленные в файле robots.txt, значения использования контента указывают на предпочтение владельца сайта, а не на прямую блокировку. Теперь мы добавляем поддержку этого расширения: все клиенты, которые уже включили управляемый robots.txt (который добавляет в robots.txt предпочтение, что сканирование для поиска разрешено, а для обучения — нет), теперь получат дополнительное предпочтение use=reference в своем robots.txt.
# Управляемый контент Cloudflare с оригинальными Content Signals
User-agent: *
Content-Signal: search=yes,ai-train=no
Allow: /
Содержимое управляемого Cloudflare robots.txt с оригинальными значениями Content Signals.
# Управляемый контент Cloudflare с новым сигналом content-use
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /
Содержимое управляемого Cloudflare robots.txt с добавленным параметром.
Мы также начинаем отслеживать использование контента для каждого бота в BotBase, и если мы обнаружим, что бот злоупотребляет этими сигналами, он потеряет статус «Verified», в результате чего ему больше не будет разрешено действовать. Сегодня боты, которые воспроизводят контент полностью, не могут иметь статус Verified.
Что значит быть Verified для бота?
Говоря о «Verified», определение Verified обновляется, чтобы отразить предстоящие изменения в базовых значениях разрешения и блокировки по умолчанию. Ранее все Verified боты были разрешены по умолчанию, что отражалось в нашем базовом предложении Bot Fight Mode для блокировки нежелательного автоматического трафика и в наших шаблонах правил для клиентов Enterprise Bot Management.
Начиная с сегодняшнего дня, мы корректируем это, добавляя нюансы: непроверенные боты по-прежнему блокируются по умолчанию, но мы больше не рассматриваем Verified как «разрешено по умолчанию». Теперь метка Verified делает бота допустимым в рамках его соответствующей категории, что означает, что разрешенная категория (например, разрешение Search) будет определять, что допускается к доступу на веб-сайт.
Чтобы сбалансировать это изменение, мы открываем процесс получения статуса Verified бота и делаем его более прозрачным. Чтобы «верифицировать» бота, оператор бота должен показать две вещи: что вы честно представляете себя и не злоупотребляете доступом, который дает честность. И чтобы облегчить это операторам ботов, мы сейчас создаем инструменты управления для операторов ботов, чтобы лучше гарантировать, что они точно представлены в системе классификации Cloudflare (будет объявлено в ближайшем будущем).
Предварительный скриншот будущей платформы, созданной непосредственно для операторов ботов, которые являются частью BotBase (следующего поколения каталога ботов Cloudflare) или хотят стать его частью.
Эксперименты с транзитивным доверием
Еще один момент: бот (или агент), который стучится к вам, все чаще управляется не компанией, которая его создала. Такая платформа, как Cloudflare Developer Platform, запускает автоматизацию для тысяч разных операторов одновременно, от предприятий до разработчика, о котором вы никогда не слышали. Вы можете доверять Stripe, но вы не обязательно доверяете каждому, кто встроил инструменты Stripe в свой проект выходного дня.
Мы называем случай (владелец сайта → компания-владелец бота → конечный пользователь) вопросом транзитивного доверия и предлагаем использовать существующий заголовок Forwarded, определенный в RFC 7239, который передается вместе с запросом и позволяет «компонентам прокси раскрывать информацию, потерянную в процессе проксирования».
Это похоже на то, что X-Forwarded-For делает для IP-адресов, или X-Forwarded-Host для сохранения исходного заголовка Host. Таким образом, когда владелец сайта говорит: «Разрешить этого оператора», это предпочтение будет действовать, независимо от того, приходит ли оператор к вам напрямую или через три уровня доверенных посредников. Более подробную информацию можно найти в нашей документации, ниже приведен краткий пример для демонстрации формата.
Forwarded: for="openai"
Добавление расширения с content-use, обсуждавшегося выше, будет выглядеть примерно так, как показано ниже, с указанием того, как оператор заявляет, что будет использовать контент, к которому он получает доступ:
Forwarded: for="openai";use="reference"
Это также соответствует модели стимулирования, которую мы хотим развивать. Потеря доверенного статуса на более чем 20% веб-доменов, которые находятся за Cloudflare, является сдерживающим фактором, имеющим реальную силу. Доверие становится тем, что вы можете носить с собой и что можете потерять.
Однако, поскольку трафик ботов смешивается с человеческим трафиком, возможно, что эта система транзитивного доверия не распространяется на пользователей, которые не могут позволить себе быть идентифицируемыми. Меры, которые мы предлагаем сегодня, помогают передавать доверие, но они не подойдут для всей сети на все времена. Небольшие источники трафика нуждаются в конфиденциальности, и компании, которые хотят сохранить свои обязательства по конфиденциальности, должны иметь возможность исследовать справедливые строительные блоки для будущего агентского интернета, такие как частное ограничение скорости.
Установите свои условия сегодня
Это небольшие изменения, которые движутся в одном направлении: владельцы сайтов получают больше контроля над тем, кто и как использует их контент. Мы считаем, что новые настройки по умолчанию, которые мы обсудили сегодня и скоро внедрим, способствуют прозрачности и лучше отражают направление, в котором движется мир.
Конечно, приливы и отливы интернета будут продолжать меняться, и мы будем подстраиваться под них. Но направление не изменится, потому что это то, с чего начинала Cloudflare: веб-экосистема, построенная на доверии. Где создатели могут решать, как используется их контент, и где честность в отношении своих действий дает вам больше доступа, а не меньше.
Эти новые возможности управления AI-трафиком уже доступны, и все существующие клиенты могут настроить их в своих настройках зоны. Еще не с Cloudflare? Начните бесплатно, чтобы установить нужные вам средства контроля трафика уже сегодня.
С Днем независимости контента.