
ChatGPT получает доступ к содержимому веб-сайта, чтобы учиться на нем. Вот как заблокировать ваш контент от превращения в обучающие данные ИИ.
Существует обеспокоенность по поводу отсутствия простого способа отказаться от использования своего контента для обучения больших языковых моделей (LLM), таких как ChatGPT . Есть способ сделать это, но он не простой и не гарантирует работу.
Как ИИ учатся на вашем контенте
Модели большого языка (LLM) обучаются на данных, поступающих из нескольких источников. Многие из этих наборов данных имеют открытый исходный код и свободно используются для обучения ИИ.
Как правило, в больших языковых моделях для обучения используются самые разные источники.
Примеры используемых источников:
- Википедия
- Государственные судебные протоколы
- Книги
- электронные письма
- Просканированные веб-сайты
На самом деле существуют порталы и веб-сайты, предлагающие наборы данных, которые выдают огромное количество информации.
Один из порталов размещен на Amazon и предлагает тысячи наборов данных в Реестре открытых данных на AWS (https://registry.opendata.aws/).

Скриншот с Amazon, январь 2023 г.
Портал Amazon с тысячами наборов данных — это всего лишь один из множества других порталов, содержащих больше наборов данных.
В Википедии перечислены 28 порталов для загрузки наборов данных, в том числе порталы Google Dataset и Hugging Face для поиска тысяч наборов данных. (https://en.wikipedia.org/wiki/List_of_datasets_for_machine-learning_research)
Наборы данных, используемые для обучения ChatGPT
ChatGPT основан на GPT-3.5, также известном как InstructGPT.
Наборы данных, используемые для обучения GPT-3.5, такие же, как и для GPT-3. Основное различие между ними заключается в том, что GPT-3.5 использовал метод, известный как обучение с подкреплением на основе обратной связи с человеком (RLHF).
Пять наборов данных, используемых для обучения GPT-3 (и GPT-3.5), описаны на странице 9 исследовательской работы Language Models are Few-Shot Learners (PDF – https://arxiv.org/pdf/2005.14165.pdf)
Наборы данных:
- Обычный обход (отфильтровано)
- Вебтекст2
- Книги1
- Книги2
- Википедия
Из пяти наборов данных два основаны на сканировании Интернета:
- Общий обход
- Вебтекст2
О наборе данных WebText2
WebText2 — это частный набор данных OpenAI, созданный путем сканирования ссылок из Reddit, за который проголосовали три раза.
Идея состоит в том, что эти URL-адреса заслуживают доверия и будут содержать качественный контент.
WebText2 — это расширенная версия исходного набора данных WebText, разработанного OpenAI.
Исходный набор данных WebText содержал около 15 миллиардов токенов. WebText использовался для обучения GPT-2.
WebText2 немного больше — 19 миллиардов токенов. WebText2 — это то, что использовалось для обучения GPT-3 и GPT-3.5.
OpenWebText2
WebText2 (созданный OpenAI) не является общедоступным.
Однако существует общедоступная версия с открытым исходным кодом под названием OpenWebText2. OpenWebText2 — это общедоступный набор данных, созданный с использованием тех же шаблонов сканирования, которые предположительно предлагают аналогичный, если не такой же, набор данных URL-адресов, что и OpenAI WebText2.
Я упоминаю об этом только на тот случай, если кто-то захочет узнать, что находится в WebText2. Можно скачать OpenWebText2, чтобы получить представление о содержащихся в нем URL-адресах.
- Очищенная версия OpenWebText2: https://openwebtext2.readthedocs.io/en/latest/#download-plug-and-play-version.
- Сырая версия OpenWebText2 – https://openwebtext2.readthedocs.io/en/latest/#download-raw-scrapes-version
Я не смог найти информацию о пользовательском агенте, используемом для любого поискового робота, возможно, он просто идентифицирован как Python, я не уверен.
Итак, насколько мне известно, пользовательского агента для блокировки нет, хотя я не уверен на 100%.
Тем не менее, мы знаем, что если ваш сайт связан с Reddit по крайней мере тремя голосами, то есть большая вероятность, что ваш сайт находится как в наборе данных OpenAI WebText2 с закрытым исходным кодом, так и в его версии с открытым исходным кодом, OpenWebText2.
Общий обход
Одним из наиболее часто используемых наборов данных, состоящих из интернет-контента, является набор данных Common Crawl, созданный некоммерческой организацией Common Crawl .
Данные Common Crawl поступают от бота, который сканирует весь Интернет.
Данные скачиваются организациями, желающими использовать данные, а затем очищаются от спам-сайтов и т. д.
Имя бота Common Crawl — CCBot.
CCBot подчиняется протоколу robots.txt, поэтому можно заблокировать Common Crawl с помощью Robots.txt и предотвратить попадание данных вашего веб-сайта в другой набор данных.
Однако, если ваш сайт уже просканирован, он, скорее всего, уже включен в несколько наборов данных.
Тем не менее, заблокировав Common Crawl, вы можете отказаться от включения контента вашего веб-сайта в новые наборы данных , полученные из более новых наборов данных Common Crawl.
Именно это я имел в виду в самом начале статьи, когда писал, что процесс «ни простой, ни гарантированно работающий».
Строка User-Agent CCBot:
CCBot/2.0
Добавьте следующее в файл robots.txt, чтобы заблокировать бота Common Crawl:
User-agent: CCBot
Disallow: /
Дополнительный способ подтвердить подлинность пользовательского агента CCBot — сканирование с IP-адресов Amazon AWS.
CCBot также подчиняется директивам метатегов nofollow robots.
Используйте это в метатеге robots:
<meta name="CCBot" content="nofollow">
Соображение перед блокировкой любых ботов
Многие наборы данных, в том числе Common Crawl, могут использоваться компаниями, которые фильтруют и классифицируют URL-адреса, чтобы создавать списки веб-сайтов для целевой рекламы.
Например, компания Alpha Quantum предлагает набор данных URL-адресов, классифицированных с использованием таксономии Interactive Advertising Bureau . Набор данных полезен для маркетинга AdTech и контекстной рекламы. Такое исключение из базы данных может привести к тому, что издатель потеряет потенциальных рекламодателей.
Блокировка ИИ от использования вашего контента
Поисковые системы позволяют веб-сайтам отказаться от сканирования. Common Crawl также позволяет отказаться. Но в настоящее время нет возможности удалить содержимое веб-сайта из существующих наборов данных.
Кроме того, ученые-исследователи, похоже, не предлагают издателям веб-сайтов способ отказаться от сканирования.
Многие издатели могут быть признательны, если в ближайшем будущем им будет предоставлено больше информации о том, как используется их контент, особенно в таких продуктах искусственного интеллекта, как ChatGPT.
Произойдет ли это, пока неизвестно.
Избранное изображение Shutterstock/ViDI Studio.
Перевод статьи: https://www.searchenginejournal.com/how-to-block-chatgpt-from-using-your-website-content/478384/








