Cloudflare AI Audit: Управление доступом AI-ботов и соблюдение политики Robots.txt

Cloudflare представил AI Audit — панель управления, которая позволяет легко анализировать, как сервисы и компании, использующие искусственный интеллект, получают доступ к вашему контенту. Новый инструмент предоставляет:

  1. Общее количество запросов, разбитое по ботам.
  2. Детализированный анализ путей, что позволяет получить более глубокое понимание.
  3. Фильтрацию по категориям, например, AI Search (поисковые AI-боты) или AI Crawler (AI-пауки).

Теперь Cloudflare делает следующий шаг: вы можете не только отслеживать, какие AI-сервисы соблюдают ваши политики, определенные в robots.txt, но и программно принуждать их к соблюдению этих правил.


Что такое Robots.txt?

Robots.txt — это простой текстовый файл, размещенный на вашем домене и реализующий Robots Exclusion Protocol (протокол исключения роботов), который существует с 1994 года. Этот файл сообщает автоматическим сканерам (краулерам), таким как Google, Bing и другим, какие разделы сайта они могут индексировать или посещать.

Зачем нужен robots.txt?

Существует несколько причин, по которым владельцы сайтов используют robots.txt:

  • Контроль над контентом: нежелание, чтобы определенный контент попадал в поисковые системы или социальные сети.
  • Выбор платформы: доверие одним сервисам больше, чем другим.
  • Снижение нагрузки: сокращение автоматического трафика на серверы.

С развитием генеративного AI многие компании начали массово сканировать интернет для сбора данных, используемых в обучении моделей. Эти модели обычно коммерческие и часто закрыты для публичного доступа. Многие издатели и создатели контента теперь используют robots.txt, чтобы ограничить доступ AI-ботов к их материалам.


Пример политики Robots.txt

Рассмотрим сокращенный пример robots.txt одного из крупнейших новостных сайтов:

User-agent: GPTBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Bytespider
Disallow: /
  • GPTBot и ChatGPT-User относятся к краулерам OpenAI.
  • Anthropic-ai — бот Anthropic.
  • Google-Extended — бот Google для AI-систем.
  • Bytespider — бот ByteDance.

Эта политика четко заявляет, что сайт не разрешает этим AI-ботам сканировать какой-либо контент.


Переход от добровольного соблюдения к принуждению

Исторически соблюдение Robots Exclusion Protocol всегда было добровольным. Боты могли следовать указаниям, а могли и игнорировать их.

Cloudflare AI Audit решает эту проблему. Теперь у владельцев сайтов есть возможность:

  1. Получить прозрачность: увидеть, какие AI-сервисы нарушают правила robots.txt.
  2. Принудительно соблюдать правила: автоматически применять политики на уровне сети с помощью Web Application Firewall (WAF).

Вы определяете свою политику в robots.txt, а Cloudflare помогает воплотить её в жизнь. Такой подход можно метафорически назвать “Robotcop” (робот-полицейский).


Как это работает?

  1. Анализ robots.txt: AI Audit считывает файл robots.txt на ваших веб-ресурсах, анализирует его и сопоставляет с трафиком AI-ботов.
  2. Отчет по нарушениям: на панели отображается сводка с количеством запросов и нарушений для каждого бота.
    • Если навести мышкой на колонку Robots.txt, можно увидеть политики для конкретного бота.
    • Дополнительно доступна фильтрация по нарушениям.

Пример интерфейса:

  • Самые популярные пути: если на определенный путь был отправлен трафик, нарушающий политику, он будет помечен.
  • Подсветка нарушений: если в столбце Robots.txt есть нарушения, это указывает на несоблюдение политик ботом.

Принудительное соблюдение через WAF

Главное преимущество AI Audit заключается в возможности принудительно применять правила на уровне сети.

Как это сделать?

  1. Нажмите кнопку “Enforce robots.txt rules” в верхней части панели управления.
  2. Cloudflare автоматически трансформирует правила из robots.txt в расширенные WAF-правила.
  3. Вас перенаправят на экран конфигурации WAF для развертывания правила на уровне сети.
Пример переведенного WAF-правила:
if (User-Agent matches GPTBot || ChatGPT-User || anthropic-ai || Google-Extended || Bytespider) {
    block;
}

После активации WAF-правила:

  • Вы перестаете просить AI-сервисы соблюдать политику.
  • Вы начинаете принудительно блокировать их доступ.

Cloudflare AI Audit — это мощный инструмент для защиты вашего контента от нежелательных AI-ботов. Он сочетает:

  • Прозрачность: мониторинг доступа AI-сервисов и нарушений.
  • Контроль: фильтрация и детализация данных.
  • Принуждение: автоматическое блокирование на уровне сети через WAF.

В эпоху генеративного AI защита интеллектуальной собственности и контроль над доступом к контенту становятся критически важными. С помощью Cloudflare AI Audit вы можете уверенно управлять своей цифровой территорией и предотвращать несанкционированное использование ваших данных.

Источник: https://blog.cloudflare.com/ai-audit-enforcing-robots-txt/

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Получить индивидуальное предложение

Позвоните или заполните форму ниже, и мы свяжемся с вами. Стараемся отвечать на все запросы в течение 24 часов в рабочие дни.