Лицензирование и роботы для максимальной инклюзивности: Как приветствовать краулеры искусственного интеллекта
Обновлено 25 августа 2026 г.
Веб-сайты теперь имеют более одного способа достичь аудитории. Страница может быть найдена через Google Поиск, обобщена ChatGPT, процитирована Perplexity, использована в поиске Claude, отображена через сервисы Apple или собрана общедоступным веб-архивом.
Эти системы не все используют один и тот же краулер и не следуют одним и тем же правилам. Веб-сайт, который блокирует GPTBot, всё равно может появиться в поиске ChatGPT, если он разрешает OAI-SearchBot. Веб-сайт, который разрешает Applebot, может оставаться видимым в поиске Apple, блокируя при этом Applebot-Extended от использования для обучения моделей искусственного интеллекта. Google-Extended от Google вовсе не обычный краулер; это токен управления robots.txt.
Поэтому лучшая политика — это не просто «разрешить искусственный интеллект» или «заблокировать искусственный интеллект». Это создание отдельных разрешений для:
- Поиск и обнаружение
- Извлечение по запросу пользователя
- Разработка и обучение моделей
- Общедоступные наборы данных
- Конфиденциальные, частные или ограниченные материалы
Эта статья содержит текущий перечень краулеров, примеры robots.txt, рекомендации по метатегам, методы проверки IP-адресов, советы по лицензированию Creative Commons, юридические формулировки и матрицу рисков и выгод.
Четыре элемента управления, которые должен понимать каждый издатель
1. robots.txt управляет запрошенным сканированием
Файл robots.txt сообщает соответствующим автоматизированным клиентам, какие страницы они могут запрашивать. Он полезен для управления трафиком краулеров и выражения предпочтений издателя.
Однако robots.txt — это не система контроля доступа. Протокол исключения роботов гласит, что его правила не являются авторизацией доступа. Google также предупреждает, что заблокированный адрес всё ещё может появляться в результатах поиска, если другие страницы ссылаются на него. Используйте пароли, аутентификацию или серверные средства контроля доступа для конфиденциальной информации. (rfc-editor.org)
2. Метатеги управляют индексацией и сниппетами
Метатеги Robots и заголовок ответа X-Robots-Tag могут контролировать, индексируется ли страница и может ли поисковая система показывать сниппет.
Эти элементы управления обычно видны только после того, как краулеру разрешено получить страницу. Если robots.txt блокирует страницу первой, краулер может никогда не увидеть метатег. (developers.google.com)
3. Сетевые элементы управления проверяют краулер
Имя пользовательского агента легко скопировать. Злоумышленник может отправить запрос, заявляя, что он GPTBot, Googlebot или PerplexityBot.
Более надёжный подход сочетает:
- Заявленный пользовательский агент
- Опубликованный диапазон IP-адресов
- Обратная проверка Системы доменных имён
- Прямая проверка Системы доменных имён
- Ограничения скорости и мониторинг запросов
4. Лицензия предоставляет права на повторное использование
Robots.txt сообщает, что краулеру разрешено делать. Лицензия сообщает, что люди или организации могут на законных основаниях делать с материалами, когда требуется разрешение на использование авторских прав.
Это разные инструменты. Разрешительная лицензия может уменьшить правовую неопределённость, но она не гарантирует, что краулер посетит страницу, что модель её использует или что ассистент сошлётся на неё.
Перечень важных краулеров
Следующий перечень был проверен по документации поставщиков, доступной 25 августа 2026 года. Имена пользовательских агентов, их назначение и диапазоны IP-адресов могут меняться, поэтому производственные системы должны использовать текущую документацию поставщика и актуальные фиды адресов.
| Поставщик | Краулер или токен robots.txt | Основное назначение | Важный элемент управления |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Находит и анализирует страницы для поиска ChatGPT | Разрешите его, чтобы увеличить вероятность появления страниц в результатах поиска ChatGPT. |
| OpenAI | GPTBot | Собирает страницы, которые могут быть использованы для обучения генеративных моделей искусственного интеллекта OpenAI | Разрешить или запретить отдельно от поиска. |
| OpenAI | ChatGPT-User | Извлекает страницы после того, как пользователь попросит ChatGPT или пользовательский GPT получить к ним доступ | Запускается пользователем, а не автоматическим веб-краулером, поэтому правила robots.txt могут не применяться. |
| OpenAI | OAI-AdsBot | Проверяет веб-страницы, представленные в качестве рекламных направлений ChatGPT | Актуально в основном для рекламодателей. Собранный контент не используется для обучения базовых генеративных моделей искусственного интеллекта. |
Googlebot | Основной краулер Google Search | Управляет обычным сканированием Google Search. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Изображения, видео и Google Новости | У них есть отдельные токены robots.txt, и ими можно управлять независимо. | |
GoogleOther | Универсальный краулер Google для различных продуктовых команд, включая исследования и разработки | Он не представляет какой-либо конкретный продукт Google. | |
Google-Extended | Контролирует, может ли контент, просканированный Google, использоваться для обучения моделей Gemini и определённых систем обоснования | Это токен управления robots.txt, а не отдельный пользовательский агент запроса. Он не влияет на обычное включение в Google Search. | |
| Anthropic | ClaudeBot | Собирает общедоступный веб-контент, который может способствовать разработке моделей Claude | Запретите его, чтобы сигнализировать о том, что будущие материалы должны быть исключены из обучающих наборов данных Anthropic. |
| Anthropic | Claude-SearchBot | Улучшает качество результатов поиска Claude | Разрешите его для видимости в поиске Claude. |
| Anthropic | Claude-User | Извлекает страницы в ответ на запрос пользователя к Claude | Отдельно от автоматического сканирования. |
| Perplexity | PerplexityBot | Индексирует страницы для результатов поиска Perplexity | Perplexity заявляет, что этот краулер не используется для сбора контента для обучения базовых моделей искусственного интеллекта. |
| Perplexity | Perplexity-User | Извлекает страницу после запроса пользователя | Документация Perplexity утверждает, что этот извлекатель обычно игнорирует robots.txt, поскольку запрос был инициирован пользователем. |
| Apple | Applebot | Поддерживает Apple Search, Spotlight, Siri, Safari и другие сервисы Apple | Разрешите его для обнаружения в Apple. |
| Apple | Applebot-Extended | Контролирует, может ли контент, просканированный Applebot, использоваться для обучения базовых моделей Apple | Он сам не сканирует страницы. Это средство контроля использования данных. |
| Common Crawl | CCBot | Собирает общедоступные веб-данные для открытого веб-архива Common Crawl | Это не ассистент, но его наборы данных могут использоваться исследователями и разработчиками искусственного интеллекта. |
| Microsoft | Bingbot | Основной краулер Bing Search | Разрешите его для обнаружения и видимости в поиске Bing. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Предварительный просмотр страниц и видео для продуктов Microsoft | Их можно контролировать отдельно от Bingbot. |
| Amazon | Amzn-SearchBot | Поиск Amazon и обнаружение контента | Amazon заявляет, что не сканирует контент для обучения моделей генеративного искусственного интеллекта. |
| Amazon | Amzn-User | Извлекает текущую информацию в ответ на действия пользователя, включая запросы Alexa | Запускается пользователем и отдельно от автоматического сканирования для поиска. |
OpenAI документирует свои краулеры для поиска, обучения, рекламы и запускаемые пользователем краулеры как отдельные элементы управления. Его документация конкретно рекомендует разрешать OAI-SearchBot для поиска ChatGPT, используя GPTBot отдельно для настроек обучения. (developers.openai.com)
Google аналогично разделяет Googlebot, GoogleOther и Google-Extended. Google-Extended не имеет собственного пользовательского агента HTTP-запроса, и его блокировка не удаляет страницу из Google Search. (developers.google.com)
Anthropic документирует отдельные роли для ClaudeBot, Claude-SearchBot и Claude-User. Anthropic также заявляет, что его боты следуют robots.txt и поддерживают нестандартную директиву Crawl-delay. (support.anthropic.com)
Perplexity различает автоматическое сканирование для поиска и извлечение по запросу пользователя. Его текущая документация утверждает, что PerplexityBot соблюдает robots.txt, в то время как Perplexity-User обычно этого не делает, поскольку он отвечает на запрос пользователя. (docs.perplexity.ai)
Текущая документация Apple проводит такое же различие между поиском и обучением: Applebot поддерживает обнаружение, в то время как Applebot-Extended позволяет издателям контролировать использование для обучения, не удаляя страницы из Apple Search. (support.apple.com)
Рекомендуемые конфигурации robots.txt
Разместите robots.txt в корне каждого хоста, например:
text https://www.example.org/robots.txt
Правила применяются к конкретному хосту, протоколу и порту, где размещён файл. Отдельному поддомену может потребоваться собственный файл. (developers.google.com)
Конфигурация 1: Максимальная инклюзивность
Используйте это, когда общедоступный редакционный контент может быть найден, обобщён, процитирован, проиндексирован и собран соответствующими краулерами.
text
Public pages are available to compliant crawlers.
User-agent: * Allow: /
Keep private, transactional, and administrative paths out.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Это разрешает именованным краулерам, включая OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft и Amazon, если только другое конкретное правило их не блокирует.
Не размещайте общее правило, такое как User-agent: * Disallow: /, ниже этой конфигурации. Позднее или более конкретная группа может изменить то, как краулер интерпретирует файл.
Конфигурация 2: Разрешить поиск, но блокировать краулеры для разработки моделей
Это часто лучший компромисс для издателей, которые хотят ссылок и поискового трафика, но не хотят давать разрешение на сбор данных для разработки моделей.
text
Block OpenAI model-development crawling.
User-agent: GPTBot Disallow: /
Block Anthropic model-development crawling.
User-agent: ClaudeBot Disallow: /
Block Google model-training and related grounding use.
User-agent: Google-Extended Disallow: /
Block Apple foundation-model training use.
User-agent: Applebot-Extended Disallow: /
Optional: block Common Crawl dataset collection.
User-agent: CCBot
Disallow: /
Allow ordinary search and retrieval crawling, except for sensitive paths.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Эта конфигурация оставляет OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot и Applebot под действием группы с подстановочным знаком. Она также разделяет разрешения на поиск и обучение.
Для Apple, блокировка Applebot-Extended при разрешении Applebot сохраняет обнаружение через сервисы Apple. Для Google, блокировка Google-Extended не блокирует обычный поиск Google. (developers.google.com)
Конфигурация 3: Явно разрешить выбранные поисковые краулеры
Если существующий файл robots.txt блокирует все краулеры, добавьте отдельные группы для поисковых краулеров, которые вы хотите приветствовать.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Keep all other crawlers out.
User-agent: * Disallow: /
При использовании конкретных групп повторяйте правила для конфиденциальных путей внутри каждой группы. Некоторые краулеры используют наиболее специфичную совпадающую группу, а не объединяют её с группой с подстановочным знаком. Bing документирует это поведение напрямую, а Google предоставляет отдельные рекомендации по группам для конкретных краулеров. (bing.com)
Важные ограничения robots.txt
- Краулер может игнорировать robots.txt.
- Вредоносный краулер может притворяться доверенным краулером.
- Заблокированная страница всё ещё может быть известна по её названию или веб-адресу.
- Robots.txt не защищает пароли, частные файлы, записи клиентов или конфиденциальные интерфейсы прикладного программирования.
- Директива
Crawl-delayне является частью основного Протокола исключения роботов и поддерживается не всеми краулерами. Anthropic и Bing документируют её поддержку, в то время как Apple заявляет, что Applebot не следует crawl-delay. (rfc-editor.org)
Метатеги и HTTP-заголовки
Пример общедоступной страницы
Для общедоступной статьи используйте чёткий заголовок, автора, канонический веб-адрес, дату публикации и дату изменения.
html
Директива max-snippet документирована в основном для Google. Не следует предполагать, что каждый краулер искусственного интеллекта поддерживает каждую мета-директиву.
Пример частной или конфиденциальной страницы
html
Используйте это для страниц, которые не должны появляться в результатах поиска. Страница должна оставаться доступной для сканирования достаточно долго, чтобы краулер мог увидеть директиву. Если страница должна действительно оставаться частной, используйте вместо этого аутентификацию или защиту паролем. (developers.google.com)
Скрывать только конфиденциальные разделы из сниппетов поиска
Google поддерживает data-nosnippet для определённых частей HTML-страницы:
html
This paragraph may be shown in a search result.
Это полезно для контактных данных, внутренних заметок или информации, сгенерированной пользователем. Это не универсальная инструкция для каждой системы искусственного интеллекта. (developers.google.com)
Использование заголовка X-Robots-Tag для файлов
Метатеги не могут быть размещены внутри файла портативного документа, изображения или видеофайла. Вместо этого используйте заголовок HTTP-ответа:
text X-Robots-Tag: noindex, nosnippet
Для страницы, которая должна оставаться доступной для поиска, но не должна предоставлять текст для сниппетов или ответов искусственного интеллекта, используйте:
text X-Robots-Tag: nosnippet
Google документирует X-Robots-Tag для не-HTML ресурсов, и Apple также поддерживает его для Applebot. (developers.google.com)
Специальные элементы управления Apple
Apple поддерживает:
html
Apple заявляет, что nosnippet предотвращает использование страницы в качестве дополнительного контекста и текущего контента, когда модели Apple генерируют вывод. Страница может по-прежнему оставаться доступной для обнаружения через Apple Search, Spotlight, Siri и Safari. (support.apple.com)
Для платных страниц Apple также поддерживает структурированные данные, используя:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple заявляет, что такие страницы могут оставаться подходящими для результатов поиска, но не будут использоваться в качестве дополнительного контекста для ответов искусственного интеллекта. (support.apple.com)
Как проверить IP-адреса краулеров
Почему сопоставления по user-agent недостаточно
Такое правило слабое:
text if User-Agent contains "GPTBot": allow
Любой может отправить этот текст. Лучшее правило:
text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block
Не доверяйте заголовку X-Forwarded-For, если он не поступает от прокси-сервера или сети доставки контента, контролируемой вашей организацией.
Методы проверки поставщиков
| Поставщик | Рекомендуемый метод проверки |
|---|---|
| OpenAI | Используйте актуальные фиды IP-адресов, опубликованные в документации краулеров OpenAI для OAI-SearchBot, GPTBot и OAI-AdsBot. Обновляйте их автоматически, а не копируйте фиксированные диапазоны в межсетевой экран. |
| Используйте опубликованные Google диапазоны краулеров или выполняйте прямые и обратные проверки Системы доменных имён. Настоящий краулер Google должен разрешаться в утверждённое имя хоста Google и обратно в исходный адрес. | |
| Anthropic | Используйте текущий опубликованный фид адресов краулеров в качестве вторичной сетевой проверки. Основным методом отказа от Anthropic остаётся robots.txt. |
| Perplexity | Объедините user-agent с текущим фидом адресов PerplexityBot или Perplexity-User. Perplexity специально рекомендует объединять оба условия в правиле межсетевого экрана веб-приложений. |
| Apple | Используйте обратную проверку Системы доменных имён по applebot.apple.com, затем выполните прямую проверку. Apple также публикует текущие диапазоны адресов в JSON-фиде. |
| Common Crawl | Используйте обратную проверку Системы доменных имён по crawl.commoncrawl.org и текущий фид адресов CCBot. Common Crawl отмечает, что обратная проверка пока недоступна для некоторого трафика IPv6. |
| Microsoft | Используйте официальный инструмент Verify Bingbot или документированные Microsoft методы обратного и прямого поиска. |
| Amazon | Используйте опубликованные Amazon списки IP-адресов краулеров и сопоставляйте их с соответствующим пользовательским агентом Amazon. |
Google, Apple, Common Crawl, OpenAI, Anthropic и Perplexity — все публикуют методы, специфичные для поставщика, или фиды адресов. Эти списки могут меняться, поэтому процесс запланированного обновления безопаснее, чем постоянный список, скопированный вручную. (developers.google.com)
Простой дизайн межсетевого экрана может выглядеть так:
text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match
rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers
Не применяйте широкое правило разрешения ко всему облачному провайдеру. Легитимный краулер может использовать облачную инфраструктуру, но большая часть трафика от этого облачного провайдера не обязательно является краулером.
Как открытое лицензирование влияет на инклюзивность
CC BY 4.0 простыми словами
Международная лицензия Creative Commons Attribution 4.0, обычно называемая CC BY 4.0, позволяет людям:
- Копировать и распространять произведение
- Адаптировать, переводить, ремикшировать и создавать на его основе
- Использовать его в коммерческих целях
Основные условия:
- Указывать надлежащее авторство
- Ссылаться на лицензию
- Указывать, были ли внесены изменения
- Не подразумевать, что первоначальный автор одобряет повторное использование
- Не добавлять юридические или технические ограничения, препятствующие использованию, разрешённому лицензией
Creative Commons также предупреждает, что лицензия может не охватывать права на неприкосновенность частной жизни, права на публичность, моральные права, права на товарные знаки, патентные права или материалы третьих сторон. (creativecommons.org)
Лицензия сама по себе не является приглашением для краулера
Размещение «CC BY 4.0» на странице не гарантирует, что организация будет её сканировать. Краулер всё ещё может быть заблокирован:
- robots.txt
- Сетью доставки контента
- Межсетевым экраном веб-приложений
- Ограничением скорости
- JavaScript-проверкой
- Стеной авторизации
- Плохим ответом сервера
- Недоступной картой сайта
И наоборот, разрешение краулеру не означает автоматического предоставления всех необходимых авторских прав для каждого последующего использования. Robots.txt и лицензирование должны разрабатываться совместно.
Почему CC BY может способствовать более широкой инклюзивности
Чёткая разрешительная лицензия может упростить понимание политики издателя для команд по работе с данными, поисковых систем и операторов ассистентов. Она может уменьшить неопределённость в отношении копирования, адаптации, коммерческого использования, перевода и распространения, когда эти действия требуют разрешения на использование авторских прав.
Однако Creative Commons объясняет, что обучение искусственного интеллекта юридически сложно. Ограничительная лицензия не всегда является эффективным способом предотвращения обучения, поскольку некоторые виды использования для обучения могут быть разрешены исключениями или ограничениями авторского права. Creative Commons также отмечает, что условия лицензии может быть трудно применить к машинному обучению и выводам моделей. (creativecommons.org)
Практический урок таков:
Используйте CC BY, когда вы действительно хотите широкого законного повторного использования. Не используйте ограничительную лицензию Creative Commons как гарантированный отказ от обучения искусственного интеллекта.
Атрибуция улучшает ясность источника
Creative Commons рекомендует метод TASL:
- Название
- Автор
- Источник
- Лицензия
Например:
«Лицензирование и роботы для максимальной инклюзивности», Example Publishing, https://www.example.org/articles/ai-crawlers, лицензировано в соответствии с Creative Commons Attribution 4.0 International. Внесенные изменения: обновлён перечень краулеров.
Чёткая атрибуция не заставляет каждого ассистента цитировать страницу. Она облегчает правильное цитирование, когда система извлекает название страницы, автора, источник и информацию о лицензировании. (wiki.creativecommons.org)
Добавьте структурированную информацию о статье
Используйте видимую информацию и структурированные данные вместе:
html
Google рекомендует чёткую информацию об авторе, страницы авторов, даты публикации, даты изменения и стабильные канонические страницы. Эти сигналы могут помочь поисковым системам понять, кто создал материал и какая версия является авторитетной. Они не гарантируют ранжирование, включение или цитирование. (developers.google.com)
Юридические формулировки для открытого, удобного для цитирования сайта
Следующее является примерным текстом, а не юридической консультацией. Попросите юриста адаптировать его к вашей юрисдикции, структуре собственности, обязательствам по конфиденциальности и стороннему контенту.
Заявление о лицензировании CC BY 4.0
text
Лицензия на контент
За исключением случаев, когда указано иное, оригинальный текст и оригинальные редакционные материалы на этой странице лицензируются в соответствии с международной лицензией Creative Commons Attribution 4.0:
https://creativecommons.org/licenses/by/4.0/
Это разрешение позволяет копировать, распространять, адаптировать, переводить, использовать в коммерческих целях, обрабатывать машиночитаемым способом, индексировать для поиска, извлекать, резюмировать и использовать в системах искусственного интеллекта при условии соблюдения условий лицензии.
Предпочтительная атрибуция:
«[Название страницы]», [автор или организация], [канонический адрес страницы], опубликовано или обновлено [дата], лицензировано в соответствии с Creative Commons Attribution 4.0 International. Внесенные изменения: [опишите изменения или укажите «нет»].
Пожалуйста, сохраняйте информацию об авторе, издателе, источнике, лицензии и изменениях, когда это разумно возможно. Это руководство по предпочтительной атрибуции не добавляет ограничений к лицензии Creative Commons и не заменяет текст лицензии.
Фраза «включая системы искусственного интеллекта» уточняет намерение издателя. Её не следует использовать для того, чтобы притворяться, будто издатель владеет правами на материал, созданный кем-то другим.
Уведомление о бренде, конфиденциальности и правах третьих лиц
text
Права на бренд, конфиденциальность и права третьих лиц
Вышеуказанная лицензия распространяется только на оригинальные материалы, идентифицированные как лицензированные. Она не предоставляет разрешения на использование:
- Товарных знаков, знаков обслуживания, логотипов или фирменного стиля
- Имён, изображений или подобий людей
- Частной, конфиденциальной, учётной, медицинской, финансовой информации или информации о безопасности
- Пользовательских материалов, если они отдельно не идентифицированы как лицензированные
- Фотографий, иллюстраций, карт, видео, музыки, цитат или других материалов третьих лиц
- Контента, помеченного как «все права защищены» или подлежащего отдельной лицензии
Использование названия, логотипов и знаков Example Publishing не должно подразумевать спонсорство, одобрение, партнёрство или поддержку. Пожалуйста, ссылайтесь на оригинальную страницу и чётко различайте цитаты, перефразирования, резюме и сгенерированный материал.
Этот язык важен, потому что лицензии Creative Commons не предоставляют автоматически все виды юридических прав, связанных со страницей. (creativecommons.org)
Руководство по цитированию для поиска и ассистентов
text
Руководство по цитированию для поиска и ассистентов
Мы приветствуем соответствующее индексирование для поиска, извлечение по запросу пользователя, цитирование и резюмирование лицензированных материалов на этом сайте.
При цитировании этого сайта, пожалуйста, используйте название страницы, автора или издателя, канонический адрес страницы, дату публикации или обновления и прямую ссылку на источник. Пожалуйста, идентифицируйте источник как один из любых использованных вводов, отличайте сгенерированный анализ от цитируемого материала и не заявляйте или не подразумевайте, что Example Publishing одобряет сгенерированный ответ, продукт, человека или услугу.
Это руководство предназначено для повышения точности и атрибуции. Оно не предоставляет прав, выходящих за рамки применимой лицензии на контент, и не лицензирует товарные знаки, личную информацию, конфиденциальную информацию или материалы третьих сторон.
Если вы хотите видимость в поиске, но не хотите предоставлять широкую лицензию на обучение
text
Доступ для поиска и авторское право
Наши общедоступные страницы могут быть доступны соответствующим поисковым краулерам и краулерам для извлечения, указанным в нашем файле robots.txt. Это разрешение предназначено для поддержки обнаружения, результатов поиска, извлечения по запросу пользователя и цитирования.
За исключением случаев, когда показана отдельная лицензия, оригинальный контент остаётся со всеми правами защищёнными. Доступ к общедоступной странице не предоставляет отдельной лицензии на разработку моделей, обучение, распространение, коммерческое повторное использование или создание производных работ сверх прав, предусмотренных применимым законодательством.
Пожалуйста, цитируйте канонический адрес страницы и издателя при ссылке на этот материал. Ничто на этом сайте не предоставляет разрешения на использование товарных знаков, логотипов, личной информации, конфиденциальной информации или стороннего контента.
Не размещайте заявление CC BY и заявление «все права защищены» над одним и тем же материалом. Чётко укажите, какая лицензия применяется к какому контенту.
Матрица рисков и выгод для открытого лицензирования
Законодательство об авторском праве и правила обучения искусственного интеллекта различаются в разных странах и остаются неурегулированными. Бюро по авторским правам США продолжает изучать эти вопросы, в то время как Creative Commons описывает обучение искусственного интеллекта как зависящее от конкретных фактов и юридически сложное. (copyright.gov)
| Подход | Потенциал инклюзивности | Основные преимущества | Основные риски | Лучше всего подходит |
|---|---|---|---|---|
| CC BY 4.0 | Очень высокий | Широкое копирование, адаптация, коммерческое использование, перевод, индексация и повторное использование, связанное с моделями, когда требуется разрешение авторского права | Коммерческие конкуренты могут повторно использовать или адаптировать контент; атрибуция может быть неполной; лицензия не может контролировать конфиденциальность, товарные знаки или права третьих лиц | Издатели, которым требуется максимально широкое законное повторное использование и строгая атрибуция источника |
| CC BY-SA 4.0 | Высокий, но более сложный | Способствует открытому циклу обмена и требует, чтобы адаптации оставались на совместимых условиях | Правила ShareAlike могут быть сложны для применения к наборам данных, обучению моделей и публичным результатам; некоторые организации могут избегать материала из-за неопределённости | Открытые образовательные и общественно значимые проекты, которые хотят, чтобы последующие адаптации оставались открытыми |
| CC BY-NC 4.0 | Средний или низкий | Ограничивает использование, предназначенное в основном для получения коммерческой выгоды или денежной компенсации | «Некоммерческое использование» может быть трудно интерпретировать; может исключать коммерческий поиск, использование моделей и ассистентов; это не гарантированный отказ от обучения | Материалы, предназначенные для некоммерческого, образовательного или общественного использования |
| CC BY-ND 4.0 | Средний | Разрешает распространение, ограничивая адаптации | Перевод, трансформация и некоторые сценарии использования ассистентами могут стать юридически неопределёнными; менее привлекателен для систем, которые резюмируют или ремикшируют | Официальные уведомления или произведения, которые должны оставаться неизменными |
| CC0 или посвящение общественному достоянию | Очень высокий | Упрощает повторное использование и снимает большинство условий авторского права, где это юридически эффективно | Нет обязательной атрибуции; слабый контроль над представлением бренда; права на конфиденциальность, товарные знаки и публичность остаются отдельными | Факты, наборы данных, справочные материалы или произведения, предназначенные для неограниченного повторного использования |
| Все права защищены плюс открытое сканирование для поиска | Высокий для поиска, низкий для обучения | Может сохранять видимость в поиске и цитирование без предоставления широкой лицензии на повторное использование | Большая правовая неопределённость для разработчиков моделей; может уменьшить включение в обучающие наборы данных и коммерческие системы повторного использования | Издатели, которые хотят обнаружения и цитирования, но предпочитают отдельно договариваться о более широких лицензиях |
Наиболее сбалансированная стратегия для многих организаций:
- CC BY 4.0 для оригинального общедоступного редакционного текста
- Отдельные метки для сторонних материалов
- Отсутствие публичной личной или конфиденциальной информации
- Разрешить поисковые краулеры и краулеры для извлечения
- Разрешать краулеры для разработки моделей только в том случае, если организация действительно принимает такое использование
- Использовать чёткую атрибуцию и канонические ссылки
- Защищать товарные знаки с помощью отдельного уведомления о бренде
Практический контрольный список реализации
Контент и лицензирование
- Определите, кому принадлежат каждая страница, изображение, диаграмма, видео и цитата.
- Лицензируйте только тот материал, права на который контролирует ваша организация.
- Отмечайте сторонние материалы отдельно.
- Добавьте видимое заявление о лицензии.
- Предоставьте предпочтительную цитату, используя название, автора, источник и лицензию.
- Держите логотипы, товарные знаки, персональные данные и конфиденциальную информацию вне сферы действия лицензии.
Robots.txt
- Создайте публичный файл robots.txt в корне каждого хоста.
- Разрешайте поисковые краулеры отдельно от краулеров для обучения.
- Блокируйте административные пути, пути учётных записей, оформления заказа, частные и внутренние пути приложений.
- Не полагайтесь на robots.txt для обеспечения безопасности.
- Тестируйте файл после каждого крупного развёртывания веб-сайта.
Метатеги
- Используйте канонические ссылки.
- Добавьте автора, дату публикации и дату изменения.
- Используйте
noindexдля страниц, которые не должны появляться в поиске. - Используйте
nosnippetилиdata-nosnippetдля конфиденциальных фрагментов, где это поддерживается. - Используйте
X-Robots-Tagдля файлов портативных документов, изображений и других не-HTML ресурсов. - Помните, что краулер должен иметь возможность получить страницу, прежде чем он сможет прочитать её метатеги.
Сетевая безопасность
- Регистрируйте строки user-agent, исходные адреса, коды ответов и пути запросов.
- Проверяйте доверенные краулеры, используя официальные фиды адресов или методы Системы доменных имён.
- Обновляйте фиды адресов автоматически.
- Объединяйте проверки user-agent и исходного адреса.
- Ограничивайте скорость проверенных краулеров, вместо того чтобы предоставлять им неограниченный доступ.
- Отклоняйте или блокируйте запросы, которые заявляют о себе как о доверенных краулерах, но не проходят проверку.
Измерение
Отслеживайте:
- Посещения от поисковых сервисов искусственного интеллекта
- Переходы на оригинальную страницу
- Частота цитирования
- Нагрузка на сервер по краулерам
- Запросы, возвращающие
403,404или429 - Доступ краулеров к непредусмотренным путям
- Находятся ли текущие статьи после публикации
Заключение
Максимальная инклюзивность требует избирательной открытости, а не единого всеобъемлющего разрешения.
Используйте robots.txt для разделения сканирования для поиска, извлечения по запросу пользователя, обучения и публичных наборов данных. Используйте метатеги и заголовки HTTP для управления индексацией и сниппетами. Используйте аутентификацию для всего приватного. Проверяйте IP-адреса краулеров, а не доверяйте только именам пользовательских агентов.
Разрешительная лицензия, такая как CC BY 4.0, может упростить широкое повторное использование, если вы действительно этого хотите. Чёткая информация об атрибуции — название, автор, источник, лицензия, каноническая страница и дата обновления — также может облегчить поисковым системам и ассистентам идентификацию и цитирование правильного источника.
Самая сильная издательская политика, следовательно, такова:
**Откройте публичный контент, который вы хотите обнаружить, чётко лицензируйте материал, который вы хотите повторно использовать, отметьте материал, которым вы не владеете, защитите частную информацию на уровне сервера и предоставьте каждому краулеру отдельное, подлежащее проверке разрешение.
Auto