Как заблокировать ChatGPT от использования контента вашего сайта

ChatGPT получает доступ к содержимому веб-сайта, чтобы учиться на нем. Вот как заблокировать ваш контент от превращения в обучающие данные ИИ.

Существует обеспокоенность по поводу отсутствия простого способа отказаться от использования своего контента для обучения больших языковых моделей (LLM), таких как ChatGPT . Есть способ сделать это, но он не простой и не гарантирует работу.

Как ИИ учатся на вашем контенте

Модели большого языка (LLM) обучаются на данных, поступающих из нескольких источников. Многие из этих наборов данных имеют открытый исходный код и свободно используются для обучения ИИ.

Как правило, в больших языковых моделях для обучения используются самые разные источники.

Примеры используемых источников:

  • Википедия
  • Государственные судебные протоколы
  • Книги
  • электронные письма
  • Просканированные веб-сайты

На самом деле существуют порталы и веб-сайты, предлагающие наборы данных, которые выдают огромное количество информации.

Один из порталов размещен на Amazon и предлагает тысячи наборов данных в Реестре открытых данных на AWS (https://registry.opendata.aws/).

Как заблокировать ChatGPT от использования контента вашего сайта

Скриншот с Amazon, январь 2023 г.

Портал Amazon с тысячами наборов данных — это всего лишь один из множества других порталов, содержащих больше наборов данных.

В Википедии перечислены 28 порталов для загрузки наборов данных, в том числе порталы Google Dataset и Hugging Face для поиска тысяч наборов данных. (https://en.wikipedia.org/wiki/List_of_datasets_for_machine-learning_research)

Наборы данных, используемые для обучения ChatGPT

ChatGPT основан на GPT-3.5, также известном как InstructGPT.

Наборы данных, используемые для обучения GPT-3.5, такие же, как и для GPT-3. Основное различие между ними заключается в том, что GPT-3.5 использовал метод, известный как обучение с подкреплением на основе обратной связи с человеком (RLHF).

Пять наборов данных, используемых для обучения GPT-3 (и GPT-3.5), описаны на странице 9 исследовательской работы Language Models are Few-Shot Learners (PDF – https://arxiv.org/pdf/2005.14165.pdf)

Наборы данных:

  1. Обычный обход (отфильтровано)
  2. Вебтекст2
  3. Книги1
  4. Книги2
  5. Википедия

Из пяти наборов данных два основаны на сканировании Интернета:

  • Общий обход
  • Вебтекст2

О наборе данных WebText2

WebText2 — это частный набор данных OpenAI, созданный путем сканирования ссылок из Reddit, за который проголосовали три раза.

Идея состоит в том, что эти URL-адреса заслуживают доверия и будут содержать качественный контент.

WebText2 — это расширенная версия исходного набора данных WebText, разработанного OpenAI.

Исходный набор данных WebText содержал около 15 миллиардов токенов. WebText использовался для обучения GPT-2.

WebText2 немного больше — 19 миллиардов токенов. WebText2 — это то, что использовалось для обучения GPT-3 и GPT-3.5.

OpenWebText2

WebText2 (созданный OpenAI) не является общедоступным.

Однако существует общедоступная версия с открытым исходным кодом под названием OpenWebText2. OpenWebText2 — это общедоступный набор данных, созданный с использованием тех же шаблонов сканирования, которые предположительно предлагают аналогичный, если не такой же, набор данных URL-адресов, что и OpenAI WebText2.

Я упоминаю об этом только на тот случай, если кто-то захочет узнать, что находится в WebText2. Можно скачать OpenWebText2, чтобы получить представление о содержащихся в нем URL-адресах.

  • Очищенная версия OpenWebText2: https://openwebtext2.readthedocs.io/en/latest/#download-plug-and-play-version. 
  • Сырая версия OpenWebText2 – https://openwebtext2.readthedocs.io/en/latest/#download-raw-scrapes-version

Я не смог найти информацию о пользовательском агенте, используемом для любого поискового робота, возможно, он просто идентифицирован как Python, я не уверен.

Итак, насколько мне известно, пользовательского агента для блокировки нет, хотя я не уверен на 100%.

Тем не менее, мы знаем, что если ваш сайт связан с Reddit по крайней мере тремя голосами, то есть большая вероятность, что ваш сайт находится как в наборе данных OpenAI WebText2 с закрытым исходным кодом, так и в его версии с открытым исходным кодом, OpenWebText2.

Общий обход

Одним из наиболее часто используемых наборов данных, состоящих из интернет-контента, является набор данных Common Crawl, созданный некоммерческой организацией Common Crawl .

Данные Common Crawl поступают от бота, который сканирует весь Интернет.

Данные скачиваются организациями, желающими использовать данные, а затем очищаются от спам-сайтов и т. д.

Имя бота Common Crawl — CCBot.

CCBot подчиняется протоколу robots.txt, поэтому можно заблокировать Common Crawl с помощью Robots.txt и предотвратить попадание данных вашего веб-сайта в другой набор данных.

Однако, если ваш сайт уже просканирован, он, скорее всего, уже включен в несколько наборов данных.

Тем не менее, заблокировав Common Crawl, вы можете отказаться от включения контента вашего веб-сайта в новые наборы данных , полученные из более новых наборов данных Common Crawl.

Именно это я имел в виду в самом начале статьи, когда писал, что процесс «ни простой, ни гарантированно работающий».

Строка User-Agent CCBot:

CCBot/2.0

Добавьте следующее в файл robots.txt, чтобы заблокировать бота Common Crawl:

User-agent: CCBot
Disallow: /

Дополнительный способ подтвердить подлинность пользовательского агента CCBot — сканирование с IP-адресов Amazon AWS.

CCBot также подчиняется директивам метатегов nofollow robots.

Используйте это в метатеге robots:

<meta name="CCBot" content="nofollow">

Соображение перед блокировкой любых ботов

Многие наборы данных, в том числе Common Crawl, могут использоваться компаниями, которые фильтруют и классифицируют URL-адреса, чтобы создавать списки веб-сайтов для целевой рекламы.

Например, компания Alpha Quantum предлагает набор данных URL-адресов, классифицированных с использованием таксономии Interactive Advertising Bureau . Набор данных полезен для маркетинга AdTech и контекстной рекламы. Такое исключение из базы данных может привести к тому, что издатель потеряет потенциальных рекламодателей.

Блокировка ИИ от использования вашего контента

Поисковые системы позволяют веб-сайтам отказаться от сканирования. Common Crawl также позволяет отказаться. Но в настоящее время нет возможности удалить содержимое веб-сайта из существующих наборов данных.

Кроме того, ученые-исследователи, похоже, не предлагают издателям веб-сайтов способ отказаться от сканирования.

Многие издатели могут быть признательны, если в ближайшем будущем им будет предоставлено больше информации о том, как используется их контент, особенно в таких продуктах искусственного интеллекта, как ChatGPT.

Произойдет ли это, пока неизвестно.

Избранное изображение Shutterstock/ViDI Studio.

Перевод статьи: https://www.searchenginejournal.com/how-to-block-chatgpt-from-using-your-website-content/478384/

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Получить индивидуальное предложение

Позвоните или заполните форму ниже, и мы свяжемся с вами. Стараемся отвечать на все запросы в течение 24 часов в рабочие дни.