AutoPodAutoPod

Лицензирование и роботы для максимальной инклюзивности: Как приветствовать краулеры ИИ

23 мин чтения
Аудиостатья
Лицензирование и роботы для максимальной инклюзивности: Как приветствовать краулеры ИИ
0:000:00
Лицензирование и роботы для максимальной инклюзивности: Как приветствовать краулеры ИИ

Лицензирование и роботы для максимальной инклюзивности: Как приветствовать краулеры искусственного интеллекта

Обновлено 25 августа 2026 г.

Веб-сайты теперь имеют более одного способа достичь аудитории. Страница может быть найдена через Google Поиск, обобщена ChatGPT, процитирована Perplexity, использована в поиске Claude, отображена через сервисы Apple или собрана общедоступным веб-архивом.

Эти системы не все используют один и тот же краулер и не следуют одним и тем же правилам. Веб-сайт, который блокирует GPTBot, всё равно может появиться в поиске ChatGPT, если он разрешает OAI-SearchBot. Веб-сайт, который разрешает Applebot, может оставаться видимым в поиске Apple, блокируя при этом Applebot-Extended от использования для обучения моделей искусственного интеллекта. Google-Extended от Google вовсе не обычный краулер; это токен управления robots.txt.

Поэтому лучшая политика — это не просто «разрешить искусственный интеллект» или «заблокировать искусственный интеллект». Это создание отдельных разрешений для:

  1. Поиск и обнаружение
  2. Извлечение по запросу пользователя
  3. Разработка и обучение моделей
  4. Общедоступные наборы данных
  5. Конфиденциальные, частные или ограниченные материалы

Эта статья содержит текущий перечень краулеров, примеры robots.txt, рекомендации по метатегам, методы проверки IP-адресов, советы по лицензированию Creative Commons, юридические формулировки и матрицу рисков и выгод.

Четыре элемента управления, которые должен понимать каждый издатель

1. robots.txt управляет запрошенным сканированием

Файл robots.txt сообщает соответствующим автоматизированным клиентам, какие страницы они могут запрашивать. Он полезен для управления трафиком краулеров и выражения предпочтений издателя.

Однако robots.txt — это не система контроля доступа. Протокол исключения роботов гласит, что его правила не являются авторизацией доступа. Google также предупреждает, что заблокированный адрес всё ещё может появляться в результатах поиска, если другие страницы ссылаются на него. Используйте пароли, аутентификацию или серверные средства контроля доступа для конфиденциальной информации. (rfc-editor.org)

2. Метатеги управляют индексацией и сниппетами

Метатеги Robots и заголовок ответа X-Robots-Tag могут контролировать, индексируется ли страница и может ли поисковая система показывать сниппет.

Эти элементы управления обычно видны только после того, как краулеру разрешено получить страницу. Если robots.txt блокирует страницу первой, краулер может никогда не увидеть метатег. (developers.google.com)

3. Сетевые элементы управления проверяют краулер

Имя пользовательского агента легко скопировать. Злоумышленник может отправить запрос, заявляя, что он GPTBot, Googlebot или PerplexityBot.

Более надёжный подход сочетает:

  • Заявленный пользовательский агент
  • Опубликованный диапазон IP-адресов
  • Обратная проверка Системы доменных имён
  • Прямая проверка Системы доменных имён
  • Ограничения скорости и мониторинг запросов

4. Лицензия предоставляет права на повторное использование

Robots.txt сообщает, что краулеру разрешено делать. Лицензия сообщает, что люди или организации могут на законных основаниях делать с материалами, когда требуется разрешение на использование авторских прав.

Это разные инструменты. Разрешительная лицензия может уменьшить правовую неопределённость, но она не гарантирует, что краулер посетит страницу, что модель её использует или что ассистент сошлётся на неё.

Перечень важных краулеров

Следующий перечень был проверен по документации поставщиков, доступной 25 августа 2026 года. Имена пользовательских агентов, их назначение и диапазоны IP-адресов могут меняться, поэтому производственные системы должны использовать текущую документацию поставщика и актуальные фиды адресов.

ПоставщикКраулер или токен robots.txtОсновное назначениеВажный элемент управления
OpenAIOAI-SearchBotНаходит и анализирует страницы для поиска ChatGPTРазрешите его, чтобы увеличить вероятность появления страниц в результатах поиска ChatGPT.
OpenAIGPTBotСобирает страницы, которые могут быть использованы для обучения генеративных моделей искусственного интеллекта OpenAIРазрешить или запретить отдельно от поиска.
OpenAIChatGPT-UserИзвлекает страницы после того, как пользователь попросит ChatGPT или пользовательский GPT получить к ним доступЗапускается пользователем, а не автоматическим веб-краулером, поэтому правила robots.txt могут не применяться.
OpenAIOAI-AdsBotПроверяет веб-страницы, представленные в качестве рекламных направлений ChatGPTАктуально в основном для рекламодателей. Собранный контент не используется для обучения базовых генеративных моделей искусственного интеллекта.
GoogleGooglebotОсновной краулер Google SearchУправляет обычным сканированием Google Search.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-NewsИзображения, видео и Google НовостиУ них есть отдельные токены robots.txt, и ими можно управлять независимо.
GoogleGoogleOtherУниверсальный краулер Google для различных продуктовых команд, включая исследования и разработкиОн не представляет какой-либо конкретный продукт Google.
GoogleGoogle-ExtendedКонтролирует, может ли контент, просканированный Google, использоваться для обучения моделей Gemini и определённых систем обоснованияЭто токен управления robots.txt, а не отдельный пользовательский агент запроса. Он не влияет на обычное включение в Google Search.
AnthropicClaudeBotСобирает общедоступный веб-контент, который может способствовать разработке моделей ClaudeЗапретите его, чтобы сигнализировать о том, что будущие материалы должны быть исключены из обучающих наборов данных Anthropic.
AnthropicClaude-SearchBotУлучшает качество результатов поиска ClaudeРазрешите его для видимости в поиске Claude.
AnthropicClaude-UserИзвлекает страницы в ответ на запрос пользователя к ClaudeОтдельно от автоматического сканирования.
PerplexityPerplexityBotИндексирует страницы для результатов поиска PerplexityPerplexity заявляет, что этот краулер не используется для сбора контента для обучения базовых моделей искусственного интеллекта.
PerplexityPerplexity-UserИзвлекает страницу после запроса пользователяДокументация Perplexity утверждает, что этот извлекатель обычно игнорирует robots.txt, поскольку запрос был инициирован пользователем.
AppleApplebotПоддерживает Apple Search, Spotlight, Siri, Safari и другие сервисы AppleРазрешите его для обнаружения в Apple.
AppleApplebot-ExtendedКонтролирует, может ли контент, просканированный Applebot, использоваться для обучения базовых моделей AppleОн сам не сканирует страницы. Это средство контроля использования данных.
Common CrawlCCBotСобирает общедоступные веб-данные для открытого веб-архива Common CrawlЭто не ассистент, но его наборы данных могут использоваться исследователями и разработчиками искусственного интеллекта.
MicrosoftBingbotОсновной краулер Bing SearchРазрешите его для обнаружения и видимости в поиске Bing.
MicrosoftMicrosoftPreview, BingVideoPreviewПредварительный просмотр страниц и видео для продуктов MicrosoftИх можно контролировать отдельно от Bingbot.
AmazonAmzn-SearchBotПоиск Amazon и обнаружение контентаAmazon заявляет, что не сканирует контент для обучения моделей генеративного искусственного интеллекта.
AmazonAmzn-UserИзвлекает текущую информацию в ответ на действия пользователя, включая запросы AlexaЗапускается пользователем и отдельно от автоматического сканирования для поиска.

OpenAI документирует свои краулеры для поиска, обучения, рекламы и запускаемые пользователем краулеры как отдельные элементы управления. Его документация конкретно рекомендует разрешать OAI-SearchBot для поиска ChatGPT, используя GPTBot отдельно для настроек обучения. (developers.openai.com)

Google аналогично разделяет Googlebot, GoogleOther и Google-Extended. Google-Extended не имеет собственного пользовательского агента HTTP-запроса, и его блокировка не удаляет страницу из Google Search. (developers.google.com)

Anthropic документирует отдельные роли для ClaudeBot, Claude-SearchBot и Claude-User. Anthropic также заявляет, что его боты следуют robots.txt и поддерживают нестандартную директиву Crawl-delay. (support.anthropic.com)

Perplexity различает автоматическое сканирование для поиска и извлечение по запросу пользователя. Его текущая документация утверждает, что PerplexityBot соблюдает robots.txt, в то время как Perplexity-User обычно этого не делает, поскольку он отвечает на запрос пользователя. (docs.perplexity.ai)

Текущая документация Apple проводит такое же различие между поиском и обучением: Applebot поддерживает обнаружение, в то время как Applebot-Extended позволяет издателям контролировать использование для обучения, не удаляя страницы из Apple Search. (support.apple.com)

Рекомендуемые конфигурации robots.txt

Разместите robots.txt в корне каждого хоста, например:

text https://www.example.org/robots.txt

Правила применяются к конкретному хосту, протоколу и порту, где размещён файл. Отдельному поддомену может потребоваться собственный файл. (developers.google.com)

Конфигурация 1: Максимальная инклюзивность

Используйте это, когда общедоступный редакционный контент может быть найден, обобщён, процитирован, проиндексирован и собран соответствующими краулерами.

text

Public pages are available to compliant crawlers.

User-agent: * Allow: /

Keep private, transactional, and administrative paths out.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Это разрешает именованным краулерам, включая OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft и Amazon, если только другое конкретное правило их не блокирует.

Не размещайте общее правило, такое как User-agent: * Disallow: /, ниже этой конфигурации. Позднее или более конкретная группа может изменить то, как краулер интерпретирует файл.

Конфигурация 2: Разрешить поиск, но блокировать краулеры для разработки моделей

Это часто лучший компромисс для издателей, которые хотят ссылок и поискового трафика, но не хотят давать разрешение на сбор данных для разработки моделей.

text

Block OpenAI model-development crawling.

User-agent: GPTBot Disallow: /

Block Anthropic model-development crawling.

User-agent: ClaudeBot Disallow: /

Block Google model-training and related grounding use.

User-agent: Google-Extended Disallow: /

Block Apple foundation-model training use.

User-agent: Applebot-Extended Disallow: /

Optional: block Common Crawl dataset collection.

User-agent: CCBot

Disallow: /

Allow ordinary search and retrieval crawling, except for sensitive paths.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Эта конфигурация оставляет OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot и Applebot под действием группы с подстановочным знаком. Она также разделяет разрешения на поиск и обучение.

Для Apple, блокировка Applebot-Extended при разрешении Applebot сохраняет обнаружение через сервисы Apple. Для Google, блокировка Google-Extended не блокирует обычный поиск Google. (developers.google.com)

Конфигурация 3: Явно разрешить выбранные поисковые краулеры

Если существующий файл robots.txt блокирует все краулеры, добавьте отдельные группы для поисковых краулеров, которые вы хотите приветствовать.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Keep all other crawlers out.

User-agent: * Disallow: /

При использовании конкретных групп повторяйте правила для конфиденциальных путей внутри каждой группы. Некоторые краулеры используют наиболее специфичную совпадающую группу, а не объединяют её с группой с подстановочным знаком. Bing документирует это поведение напрямую, а Google предоставляет отдельные рекомендации по группам для конкретных краулеров. (bing.com)

Важные ограничения robots.txt

  • Краулер может игнорировать robots.txt.
  • Вредоносный краулер может притворяться доверенным краулером.
  • Заблокированная страница всё ещё может быть известна по её названию или веб-адресу.
  • Robots.txt не защищает пароли, частные файлы, записи клиентов или конфиденциальные интерфейсы прикладного программирования.
  • Директива Crawl-delay не является частью основного Протокола исключения роботов и поддерживается не всеми краулерами. Anthropic и Bing документируют её поддержку, в то время как Apple заявляет, что Applebot не следует crawl-delay. (rfc-editor.org)

Метатеги и HTTP-заголовки

Пример общедоступной страницы

Для общедоступной статьи используйте чёткий заголовок, автора, канонический веб-адрес, дату публикации и дату изменения.

html

Директива max-snippet документирована в основном для Google. Не следует предполагать, что каждый краулер искусственного интеллекта поддерживает каждую мета-директиву.

Пример частной или конфиденциальной страницы

html

Используйте это для страниц, которые не должны появляться в результатах поиска. Страница должна оставаться доступной для сканирования достаточно долго, чтобы краулер мог увидеть директиву. Если страница должна действительно оставаться частной, используйте вместо этого аутентификацию или защиту паролем. (developers.google.com)

Скрывать только конфиденциальные разделы из сниппетов поиска

Google поддерживает data-nosnippet для определённых частей HTML-страницы:

html

This paragraph may be shown in a search result.

Personal telephone numbers, private email addresses, or internal notes go here.

Это полезно для контактных данных, внутренних заметок или информации, сгенерированной пользователем. Это не универсальная инструкция для каждой системы искусственного интеллекта. (developers.google.com)

Использование заголовка X-Robots-Tag для файлов

Метатеги не могут быть размещены внутри файла портативного документа, изображения или видеофайла. Вместо этого используйте заголовок HTTP-ответа:

text X-Robots-Tag: noindex, nosnippet

Для страницы, которая должна оставаться доступной для поиска, но не должна предоставлять текст для сниппетов или ответов искусственного интеллекта, используйте:

text X-Robots-Tag: nosnippet

Google документирует X-Robots-Tag для не-HTML ресурсов, и Apple также поддерживает его для Applebot. (developers.google.com)

Специальные элементы управления Apple

Apple поддерживает:

html

Apple заявляет, что nosnippet предотвращает использование страницы в качестве дополнительного контекста и текущего контента, когда модели Apple генерируют вывод. Страница может по-прежнему оставаться доступной для обнаружения через Apple Search, Spotlight, Siri и Safari. (support.apple.com)

Для платных страниц Apple также поддерживает структурированные данные, используя:

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Apple заявляет, что такие страницы могут оставаться подходящими для результатов поиска, но не будут использоваться в качестве дополнительного контекста для ответов искусственного интеллекта. (support.apple.com)

Как проверить IP-адреса краулеров

Почему сопоставления по user-agent недостаточно

Такое правило слабое:

text if User-Agent contains "GPTBot": allow

Любой может отправить этот текст. Лучшее правило:

text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block

Не доверяйте заголовку X-Forwarded-For, если он не поступает от прокси-сервера или сети доставки контента, контролируемой вашей организацией.

Методы проверки поставщиков

ПоставщикРекомендуемый метод проверки
OpenAIИспользуйте актуальные фиды IP-адресов, опубликованные в документации краулеров OpenAI для OAI-SearchBot, GPTBot и OAI-AdsBot. Обновляйте их автоматически, а не копируйте фиксированные диапазоны в межсетевой экран.
GoogleИспользуйте опубликованные Google диапазоны краулеров или выполняйте прямые и обратные проверки Системы доменных имён. Настоящий краулер Google должен разрешаться в утверждённое имя хоста Google и обратно в исходный адрес.
AnthropicИспользуйте текущий опубликованный фид адресов краулеров в качестве вторичной сетевой проверки. Основным методом отказа от Anthropic остаётся robots.txt.
PerplexityОбъедините user-agent с текущим фидом адресов PerplexityBot или Perplexity-User. Perplexity специально рекомендует объединять оба условия в правиле межсетевого экрана веб-приложений.
AppleИспользуйте обратную проверку Системы доменных имён по applebot.apple.com, затем выполните прямую проверку. Apple также публикует текущие диапазоны адресов в JSON-фиде.
Common CrawlИспользуйте обратную проверку Системы доменных имён по crawl.commoncrawl.org и текущий фид адресов CCBot. Common Crawl отмечает, что обратная проверка пока недоступна для некоторого трафика IPv6.
MicrosoftИспользуйте официальный инструмент Verify Bingbot или документированные Microsoft методы обратного и прямого поиска.
AmazonИспользуйте опубликованные Amazon списки IP-адресов краулеров и сопоставляйте их с соответствующим пользовательским агентом Amazon.

Google, Apple, Common Crawl, OpenAI, Anthropic и Perplexity — все публикуют методы, специфичные для поставщика, или фиды адресов. Эти списки могут меняться, поэтому процесс запланированного обновления безопаснее, чем постоянный список, скопированный вручную. (developers.google.com)

Простой дизайн межсетевого экрана может выглядеть так:

text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match

rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers

Не применяйте широкое правило разрешения ко всему облачному провайдеру. Легитимный краулер может использовать облачную инфраструктуру, но большая часть трафика от этого облачного провайдера не обязательно является краулером.

Как открытое лицензирование влияет на инклюзивность

CC BY 4.0 простыми словами

Международная лицензия Creative Commons Attribution 4.0, обычно называемая CC BY 4.0, позволяет людям:

  • Копировать и распространять произведение
  • Адаптировать, переводить, ремикшировать и создавать на его основе
  • Использовать его в коммерческих целях

Основные условия:

  • Указывать надлежащее авторство
  • Ссылаться на лицензию
  • Указывать, были ли внесены изменения
  • Не подразумевать, что первоначальный автор одобряет повторное использование
  • Не добавлять юридические или технические ограничения, препятствующие использованию, разрешённому лицензией

Creative Commons также предупреждает, что лицензия может не охватывать права на неприкосновенность частной жизни, права на публичность, моральные права, права на товарные знаки, патентные права или материалы третьих сторон. (creativecommons.org)

Лицензия сама по себе не является приглашением для краулера

Размещение «CC BY 4.0» на странице не гарантирует, что организация будет её сканировать. Краулер всё ещё может быть заблокирован:

  • robots.txt
  • Сетью доставки контента
  • Межсетевым экраном веб-приложений
  • Ограничением скорости
  • JavaScript-проверкой
  • Стеной авторизации
  • Плохим ответом сервера
  • Недоступной картой сайта

И наоборот, разрешение краулеру не означает автоматического предоставления всех необходимых авторских прав для каждого последующего использования. Robots.txt и лицензирование должны разрабатываться совместно.

Почему CC BY может способствовать более широкой инклюзивности

Чёткая разрешительная лицензия может упростить понимание политики издателя для команд по работе с данными, поисковых систем и операторов ассистентов. Она может уменьшить неопределённость в отношении копирования, адаптации, коммерческого использования, перевода и распространения, когда эти действия требуют разрешения на использование авторских прав.

Однако Creative Commons объясняет, что обучение искусственного интеллекта юридически сложно. Ограничительная лицензия не всегда является эффективным способом предотвращения обучения, поскольку некоторые виды использования для обучения могут быть разрешены исключениями или ограничениями авторского права. Creative Commons также отмечает, что условия лицензии может быть трудно применить к машинному обучению и выводам моделей. (creativecommons.org)

Практический урок таков:

Используйте CC BY, когда вы действительно хотите широкого законного повторного использования. Не используйте ограничительную лицензию Creative Commons как гарантированный отказ от обучения искусственного интеллекта.

Атрибуция улучшает ясность источника

Creative Commons рекомендует метод TASL:

  • Название
  • Автор
  • Источник
  • Лицензия

Например:

«Лицензирование и роботы для максимальной инклюзивности», Example Publishing, https://www.example.org/articles/ai-crawlers, лицензировано в соответствии с Creative Commons Attribution 4.0 International. Внесенные изменения: обновлён перечень краулеров.

Чёткая атрибуция не заставляет каждого ассистента цитировать страницу. Она облегчает правильное цитирование, когда система извлекает название страницы, автора, источник и информацию о лицензировании. (wiki.creativecommons.org)

Добавьте структурированную информацию о статье

Используйте видимую информацию и структурированные данные вместе:

html

Google рекомендует чёткую информацию об авторе, страницы авторов, даты публикации, даты изменения и стабильные канонические страницы. Эти сигналы могут помочь поисковым системам понять, кто создал материал и какая версия является авторитетной. Они не гарантируют ранжирование, включение или цитирование. (developers.google.com)

Юридические формулировки для открытого, удобного для цитирования сайта

Следующее является примерным текстом, а не юридической консультацией. Попросите юриста адаптировать его к вашей юрисдикции, структуре собственности, обязательствам по конфиденциальности и стороннему контенту.

Заявление о лицензировании CC BY 4.0

text

Лицензия на контент

За исключением случаев, когда указано иное, оригинальный текст и оригинальные редакционные материалы на этой странице лицензируются в соответствии с международной лицензией Creative Commons Attribution 4.0:

https://creativecommons.org/licenses/by/4.0/

Это разрешение позволяет копировать, распространять, адаптировать, переводить, использовать в коммерческих целях, обрабатывать машиночитаемым способом, индексировать для поиска, извлекать, резюмировать и использовать в системах искусственного интеллекта при условии соблюдения условий лицензии.

Предпочтительная атрибуция:

«[Название страницы]», [автор или организация], [канонический адрес страницы], опубликовано или обновлено [дата], лицензировано в соответствии с Creative Commons Attribution 4.0 International. Внесенные изменения: [опишите изменения или укажите «нет»].

Пожалуйста, сохраняйте информацию об авторе, издателе, источнике, лицензии и изменениях, когда это разумно возможно. Это руководство по предпочтительной атрибуции не добавляет ограничений к лицензии Creative Commons и не заменяет текст лицензии.

Фраза «включая системы искусственного интеллекта» уточняет намерение издателя. Её не следует использовать для того, чтобы притворяться, будто издатель владеет правами на материал, созданный кем-то другим.

Уведомление о бренде, конфиденциальности и правах третьих лиц

text

Права на бренд, конфиденциальность и права третьих лиц

Вышеуказанная лицензия распространяется только на оригинальные материалы, идентифицированные как лицензированные. Она не предоставляет разрешения на использование:

  • Товарных знаков, знаков обслуживания, логотипов или фирменного стиля
  • Имён, изображений или подобий людей
  • Частной, конфиденциальной, учётной, медицинской, финансовой информации или информации о безопасности
  • Пользовательских материалов, если они отдельно не идентифицированы как лицензированные
  • Фотографий, иллюстраций, карт, видео, музыки, цитат или других материалов третьих лиц
  • Контента, помеченного как «все права защищены» или подлежащего отдельной лицензии

Использование названия, логотипов и знаков Example Publishing не должно подразумевать спонсорство, одобрение, партнёрство или поддержку. Пожалуйста, ссылайтесь на оригинальную страницу и чётко различайте цитаты, перефразирования, резюме и сгенерированный материал.

Этот язык важен, потому что лицензии Creative Commons не предоставляют автоматически все виды юридических прав, связанных со страницей. (creativecommons.org)

Руководство по цитированию для поиска и ассистентов

text

Руководство по цитированию для поиска и ассистентов

Мы приветствуем соответствующее индексирование для поиска, извлечение по запросу пользователя, цитирование и резюмирование лицензированных материалов на этом сайте.

При цитировании этого сайта, пожалуйста, используйте название страницы, автора или издателя, канонический адрес страницы, дату публикации или обновления и прямую ссылку на источник. Пожалуйста, идентифицируйте источник как один из любых использованных вводов, отличайте сгенерированный анализ от цитируемого материала и не заявляйте или не подразумевайте, что Example Publishing одобряет сгенерированный ответ, продукт, человека или услугу.

Это руководство предназначено для повышения точности и атрибуции. Оно не предоставляет прав, выходящих за рамки применимой лицензии на контент, и не лицензирует товарные знаки, личную информацию, конфиденциальную информацию или материалы третьих сторон.

Если вы хотите видимость в поиске, но не хотите предоставлять широкую лицензию на обучение

text

Доступ для поиска и авторское право

Наши общедоступные страницы могут быть доступны соответствующим поисковым краулерам и краулерам для извлечения, указанным в нашем файле robots.txt. Это разрешение предназначено для поддержки обнаружения, результатов поиска, извлечения по запросу пользователя и цитирования.

За исключением случаев, когда показана отдельная лицензия, оригинальный контент остаётся со всеми правами защищёнными. Доступ к общедоступной странице не предоставляет отдельной лицензии на разработку моделей, обучение, распространение, коммерческое повторное использование или создание производных работ сверх прав, предусмотренных применимым законодательством.

Пожалуйста, цитируйте канонический адрес страницы и издателя при ссылке на этот материал. Ничто на этом сайте не предоставляет разрешения на использование товарных знаков, логотипов, личной информации, конфиденциальной информации или стороннего контента.

Не размещайте заявление CC BY и заявление «все права защищены» над одним и тем же материалом. Чётко укажите, какая лицензия применяется к какому контенту.

Матрица рисков и выгод для открытого лицензирования

Законодательство об авторском праве и правила обучения искусственного интеллекта различаются в разных странах и остаются неурегулированными. Бюро по авторским правам США продолжает изучать эти вопросы, в то время как Creative Commons описывает обучение искусственного интеллекта как зависящее от конкретных фактов и юридически сложное. (copyright.gov)

ПодходПотенциал инклюзивностиОсновные преимуществаОсновные рискиЛучше всего подходит
CC BY 4.0Очень высокийШирокое копирование, адаптация, коммерческое использование, перевод, индексация и повторное использование, связанное с моделями, когда требуется разрешение авторского праваКоммерческие конкуренты могут повторно использовать или адаптировать контент; атрибуция может быть неполной; лицензия не может контролировать конфиденциальность, товарные знаки или права третьих лицИздатели, которым требуется максимально широкое законное повторное использование и строгая атрибуция источника
CC BY-SA 4.0Высокий, но более сложныйСпособствует открытому циклу обмена и требует, чтобы адаптации оставались на совместимых условияхПравила ShareAlike могут быть сложны для применения к наборам данных, обучению моделей и публичным результатам; некоторые организации могут избегать материала из-за неопределённостиОткрытые образовательные и общественно значимые проекты, которые хотят, чтобы последующие адаптации оставались открытыми
CC BY-NC 4.0Средний или низкийОграничивает использование, предназначенное в основном для получения коммерческой выгоды или денежной компенсации«Некоммерческое использование» может быть трудно интерпретировать; может исключать коммерческий поиск, использование моделей и ассистентов; это не гарантированный отказ от обученияМатериалы, предназначенные для некоммерческого, образовательного или общественного использования
CC BY-ND 4.0СреднийРазрешает распространение, ограничивая адаптацииПеревод, трансформация и некоторые сценарии использования ассистентами могут стать юридически неопределёнными; менее привлекателен для систем, которые резюмируют или ремикшируютОфициальные уведомления или произведения, которые должны оставаться неизменными
CC0 или посвящение общественному достояниюОчень высокийУпрощает повторное использование и снимает большинство условий авторского права, где это юридически эффективноНет обязательной атрибуции; слабый контроль над представлением бренда; права на конфиденциальность, товарные знаки и публичность остаются отдельнымиФакты, наборы данных, справочные материалы или произведения, предназначенные для неограниченного повторного использования
Все права защищены плюс открытое сканирование для поискаВысокий для поиска, низкий для обученияМожет сохранять видимость в поиске и цитирование без предоставления широкой лицензии на повторное использованиеБольшая правовая неопределённость для разработчиков моделей; может уменьшить включение в обучающие наборы данных и коммерческие системы повторного использованияИздатели, которые хотят обнаружения и цитирования, но предпочитают отдельно договариваться о более широких лицензиях

Наиболее сбалансированная стратегия для многих организаций:

  • CC BY 4.0 для оригинального общедоступного редакционного текста
  • Отдельные метки для сторонних материалов
  • Отсутствие публичной личной или конфиденциальной информации
  • Разрешить поисковые краулеры и краулеры для извлечения
  • Разрешать краулеры для разработки моделей только в том случае, если организация действительно принимает такое использование
  • Использовать чёткую атрибуцию и канонические ссылки
  • Защищать товарные знаки с помощью отдельного уведомления о бренде

Практический контрольный список реализации

Контент и лицензирование

  • Определите, кому принадлежат каждая страница, изображение, диаграмма, видео и цитата.
  • Лицензируйте только тот материал, права на который контролирует ваша организация.
  • Отмечайте сторонние материалы отдельно.
  • Добавьте видимое заявление о лицензии.
  • Предоставьте предпочтительную цитату, используя название, автора, источник и лицензию.
  • Держите логотипы, товарные знаки, персональные данные и конфиденциальную информацию вне сферы действия лицензии.

Robots.txt

  • Создайте публичный файл robots.txt в корне каждого хоста.
  • Разрешайте поисковые краулеры отдельно от краулеров для обучения.
  • Блокируйте административные пути, пути учётных записей, оформления заказа, частные и внутренние пути приложений.
  • Не полагайтесь на robots.txt для обеспечения безопасности.
  • Тестируйте файл после каждого крупного развёртывания веб-сайта.

Метатеги

  • Используйте канонические ссылки.
  • Добавьте автора, дату публикации и дату изменения.
  • Используйте noindex для страниц, которые не должны появляться в поиске.
  • Используйте nosnippet или data-nosnippet для конфиденциальных фрагментов, где это поддерживается.
  • Используйте X-Robots-Tag для файлов портативных документов, изображений и других не-HTML ресурсов.
  • Помните, что краулер должен иметь возможность получить страницу, прежде чем он сможет прочитать её метатеги.

Сетевая безопасность

  • Регистрируйте строки user-agent, исходные адреса, коды ответов и пути запросов.
  • Проверяйте доверенные краулеры, используя официальные фиды адресов или методы Системы доменных имён.
  • Обновляйте фиды адресов автоматически.
  • Объединяйте проверки user-agent и исходного адреса.
  • Ограничивайте скорость проверенных краулеров, вместо того чтобы предоставлять им неограниченный доступ.
  • Отклоняйте или блокируйте запросы, которые заявляют о себе как о доверенных краулерах, но не проходят проверку.

Измерение

Отслеживайте:

  • Посещения от поисковых сервисов искусственного интеллекта
  • Переходы на оригинальную страницу
  • Частота цитирования
  • Нагрузка на сервер по краулерам
  • Запросы, возвращающие 403, 404 или 429
  • Доступ краулеров к непредусмотренным путям
  • Находятся ли текущие статьи после публикации

Заключение

Максимальная инклюзивность требует избирательной открытости, а не единого всеобъемлющего разрешения.

Используйте robots.txt для разделения сканирования для поиска, извлечения по запросу пользователя, обучения и публичных наборов данных. Используйте метатеги и заголовки HTTP для управления индексацией и сниппетами. Используйте аутентификацию для всего приватного. Проверяйте IP-адреса краулеров, а не доверяйте только именам пользовательских агентов.

Разрешительная лицензия, такая как CC BY 4.0, может упростить широкое повторное использование, если вы действительно этого хотите. Чёткая информация об атрибуции — название, автор, источник, лицензия, каноническая страница и дата обновления — также может облегчить поисковым системам и ассистентам идентификацию и цитирование правильного источника.

Самая сильная издательская политика, следовательно, такова:

**Откройте публичный контент, который вы хотите обнаружить, чётко лицензируйте материал, который вы хотите повторно использовать, отметьте материал, которым вы не владеете, защитите частную информацию на уровне сервера и предоставьте каждому краулеру отдельное, подлежащее проверке разрешение.

Похожие статьи

Создание авторских хабов: ORCID, Crossref и профили исследователей как основы доверия

Создание авторских хабов: ORCID, Crossref и профили исследователей как основы доверия

Кто создал эту работу? Что именно представляет собой эта работа? Почему следует доверять связи между человеком, работой и организацией?

Читать статью
Основные показатели качества веб-страниц и задержка: Получают ли более быстрые страницы больше цитирований ИИ?

Основные показатели качества веб-страниц и задержка: Получают ли более быстрые страницы больше цитирований ИИ?

Более быстрая страница может улучшить сканирование и доступность контента. Это не означает, что одна лишь скорость побуждает систему искусственного...

Читать статью
Структурированный контент «Вопрос-Ответ» и «Как сделать»: Создаем ответы, которые нужны ИИ

Структурированный контент «Вопрос-Ответ» и «Как сделать»: Создаем ответы, которые нужны ИИ

Повышает ли добавление структурированных данных QAPage или HowTo вероятность появления страницы в ответе, сгенерированном ИИ, особенно в пошаговом...

Читать статью
Новое руководство по получению ИИ-ссылок в Google AI Overviews, Bing Copilot и Perplexity

Новое руководство по получению ИИ-ссылок в Google AI Overviews, Bing Copilot и Perplexity

Google теперь часто предоставляет ИИ-обзор (генеративный ИИ-ответ) в верхней части результатов поиска. Эти обзоры дают краткий ответ, а затем...

Читать статью

Понравился этот контент?

Подпишитесь на нашу рассылку, чтобы получать последние новости контент-маркетинга и руководства по росту.

Эта статья носит исключительно информационный характер. Контент и стратегии могут варьироваться в зависимости от ваших конкретных потребностей.
Лицензирование и роботы для максимальной инклюзивности: Как приветствовать краулеры ИИ | AutoPod