AutoPodAutoPod

Ліцензування та роботи для максимальної інклюзивності: Як вітати краулери штучного інтелекту

23 хв читання
Аудіостаття
Ліцензування та роботи для максимальної інклюзивності: Як вітати краулери штучного інтелекту
0:000:00
Ліцензування та роботи для максимальної інклюзивності: Як вітати краулери штучного інтелекту

Ліцензування та роботи для максимальної інклюзивності: Як вітати краулери штучного інтелекту

Оновлено 25 серпня 2026 року

Веб-сайти тепер мають більше одного способу охопити аудиторію. Сторінка може бути знайдена через Пошук Google, узагальнена ChatGPT, процитована Perplexity, використана в пошуку Claude, відображена через сервіси Apple або зібрана публічним веб-архівом.

Ці системи не всі використовують однаковий краулер або дотримуються однакових правил. Веб-сайт, який блокує GPTBot, все ще може з'явитися в пошуку ChatGPT, якщо він дозволяє OAI-SearchBot. Веб-сайт, який дозволяє Applebot, може залишатися видимим у Пошуку Apple, блокуючи при цьому Applebot-Extended від використання для навчання моделей штучного інтелекту. Google-Extended від Google взагалі не є звичайним краулером; це токен керування robots.txt.

Тому найкраща політика – це не просто «дозволити штучний інтелект» або «заблокувати штучний інтелект». Вона полягає у створенні окремих дозволів для:

  1. Пошуку та виявлення
  2. Отримання за запитом користувача
  3. Розробки та навчання моделей
  4. Публічних наборів даних
  5. Конфіденційних, приватних або обмежених матеріалів

Ця стаття містить актуальний перелік краулерів, приклади robots.txt, рекомендації щодо мета-тегів, методи перевірки IP-адрес, поради щодо ліцензування Creative Commons, типові юридичні формулювання та матрицю ризиків і переваг.

Чотири елементи керування, які повинен розуміти кожен видавець

1. robots.txt контролює запитуване сканування

Файл robots.txt повідомляє сумісним автоматизованим клієнтам, які сторінки вони можуть запитувати. Він корисний для керування трафіком краулерів та вираження уподобань видавця.

Однак, robots.txt не є системою контролю доступу. Протокол виключення роботів (Robots Exclusion Protocol) стверджує, що його правила не є дозволом на доступ. Google також попереджає, що заблокована адреса все ще може з'явитися в результатах пошуку, якщо на неї посилаються інші сторінки. Використовуйте паролі, автентифікацію або серверні засоби контролю доступу для конфіденційної інформації. (rfc-editor.org)

2. Мета-теги контролюють індексування та сніпети

Мета-теги Robots та заголовок відповіді X-Robots-Tag можуть контролювати, чи буде сторінка індексуватися або чи може пошукова система показувати сніпет.

Ці елементи керування зазвичай видимі лише після того, як краулеру дозволено отримати сторінку. Якщо robots.txt спочатку блокує сторінку, краулер може ніколи не побачити мета-тег. (developers.google.com)

3. Мережеві елементи керування перевіряють краулер

Ім'я user-agent легко скопіювати. Зловмисник може надіслати запит, стверджуючи, що він GPTBot, Googlebot або PerplexityBot.

Сильніший підхід поєднує:

  • Заявлений user-agent
  • Опублікований діапазон IP-адрес
  • Зворотну перевірку системи доменних імен (Reverse Domain Name System)
  • Пряму перевірку системи доменних імен (Forward Domain Name System)
  • Обмеження швидкості та моніторинг запитів

4. Ліцензія надає права на повторне використання

Robots.txt вказує, що краулеру дозволено робити. Ліцензія вказує, що люди або організації можуть законно робити з матеріалами, коли потрібен дозвіл на авторське право.

Це різні інструменти. Дозвільна ліцензія може зменшити юридичну невизначеність, але вона не гарантує, що краулер відвідає сторінку, що модель її використовуватиме або що помічник на неї посилатиметься.

Перелік важливих краулерів

Наступний перелік був перевірений за документацією провайдерів, доступною станом на 25 серпня 2026 року. Імена user-agent, цілі та діапазони IP-адрес можуть змінюватися, тому виробничі системи повинні використовувати поточну документацію провайдера та поточні стрічки адрес.

ПровайдерКраулер або токен robots.txtОсновна метаВажливий контроль
OpenAIOAI-SearchBotЗнаходить та аналізує сторінки для пошуку ChatGPTДозвольте його, щоб покращити шанс появи сторінок у результатах пошуку ChatGPT.
OpenAIGPTBotЗбирає сторінки, які можуть бути використані для навчання генеративних моделей штучного інтелекту OpenAIДозволити або заборонити окремо від пошуку.
OpenAIChatGPT-UserОтримує сторінки після того, як користувач просить ChatGPT або користувацький GPT отримати до них доступЦе ініціюється користувачем, а не автоматичним веб-краулером, тому правила robots.txt можуть не застосовуватися.
OpenAIOAI-AdsBotПеревіряє веб-сторінки, подані як рекламні призначення ChatGPTСтосується переважно рекламодавців. Зібраний вміст не використовується для навчання фундаментальних моделей генеративного штучного інтелекту.
GoogleGooglebotОсновний краулер Пошуку GoogleКонтролює звичайне сканування Пошуку Google.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-NewsЗображення, відео та Google НовиниВони мають окремі токени robots.txt і можуть контролюватися незалежно.
GoogleGoogleOtherЗагального призначення сканування Google для різних команд продуктів, включаючи дослідження та розробкиВін не представляє один конкретний продукт Google.
GoogleGoogle-ExtendedКонтролює, чи може вміст, сканований Google, використовуватися для навчання моделі Gemini та певних систем обґрунтуванняЦе токен керування robots.txt, а не окремий user-agent для запитів. Він не впливає на звичайне включення в Пошук Google.
AnthropicClaudeBotЗбирає публічний веб-контент, який може сприяти розробці моделі ClaudeЗабороніть його, щоб сигналізувати, що майбутні матеріали повинні бути виключені з навчальних наборів даних Anthropic.
AnthropicClaude-SearchBotПокращує якість результатів пошуку ClaudeДозвольте його для видимості в пошуку Claude.
AnthropicClaude-UserОтримує сторінки у відповідь на запит користувача до ClaudeОкремо від автоматичного сканування.
PerplexityPerplexityBotІндексує сторінки для результатів пошуку PerplexityPerplexity стверджує, що цей краулер не використовується для збору контенту для навчання фундаментальних моделей штучного інтелекту.
PerplexityPerplexity-UserОтримує сторінку після запиту користувачаДокументація Perplexity стверджує, що цей завантажувач зазвичай ігнорує robots.txt, оскільки запит був ініційований користувачем.
AppleApplebotПідтримує Apple Search, Spotlight, Siri, Safari та інші сервіси AppleДозвольте його для виявлення Apple.
AppleApplebot-ExtendedКонтролює, чи може вміст, сканований Applebot, використовуватися для навчання фундаментальних моделей AppleВін сам не сканує сторінки. Це контроль використання даних.
Common CrawlCCBotЗбирає публічні веб-дані для відкритого веб-архіву Common CrawlЦе не помічник, але його набори даних можуть використовуватися дослідниками та розробниками штучного інтелекту.
MicrosoftBingbotОсновний краулер пошуку BingДозвольте його для виявлення Bing та видимості в пошуку.
MicrosoftMicrosoftPreview, BingVideoPreviewПопередній перегляд сторінок та відео для продуктів MicrosoftЇх можна контролювати окремо від Bingbot.
AmazonAmzn-SearchBotПошук та виявлення контенту AmazonAmazon стверджує, що він не сканує контент для навчання моделей генеративного штучного інтелекту.
AmazonAmzn-UserОтримує актуальну інформацію у відповідь на дії користувача, включаючи запити AlexaІніціюється користувачем та окремо від автоматичного сканування пошуку.

OpenAI документує свої пошукові, навчальні, рекламні та ініційовані користувачем краулери як окремі елементи керування. Його документація спеціально рекомендує дозволяти OAI-SearchBot для пошуку ChatGPT, використовуючи GPTBot окремо для налаштувань навчання. (developers.openai.com)

Google аналогічно розділяє Googlebot, GoogleOther та Google-Extended. Google-Extended не має власного user-agent для HTTP-запитів, і його блокування не видаляє сторінку з Пошуку Google. (developers.google.com)

Anthropic документує окремі ролі для ClaudeBot, Claude-SearchBot та Claude-User. Anthropic також заявляє, що його боти дотримуються robots.txt та підтримують нестандартну директиву Crawl-delay. (support.anthropic.com)

Perplexity розрізняє автоматичне сканування для пошуку та отримання за запитом користувача. Його поточна документація стверджує, що PerplexityBot поважає robots.txt, тоді як Perplexity-User зазвичай ні, оскільки він відповідає на запит користувача. (docs.perplexity.ai)

Поточна документація Apple робить таке ж розрізнення між пошуком та навчанням: Applebot підтримує виявлення, тоді як Applebot-Extended дозволяє видавцям контролювати використання для навчання, не видаляючи сторінки з Apple Search. (support.apple.com)

Рекомендовані конфігурації robots.txt

Розміщуйте robots.txt у корені кожного хосту, наприклад:

text https://www.example.org/robots.txt

Правила застосовуються до конкретного хосту, протоколу та порту, де розміщено файл. Окремий субдомен може потребувати власного файлу. (developers.google.com)

Конфігурація 1: Максимальна інклюзивність

Використовуйте це, коли публічний редакційний контент може бути знайдений, узагальнений, процитований, індексований та зібраний сумісними краулерами.

text

Публічні сторінки доступні для сумісних краулерів.

User-agent: * Allow: /

Не допускайте приватні, транзакційні та адміністративні шляхи.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Це дозволяє іменованим краулерам, включаючи OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft та Amazon, якщо інше конкретне правило їх не блокує.

Не розміщуйте загальне правило, таке як User-agent: * Disallow: /, під цією конфігурацією. Пізніша або більш конкретна група може змінити інтерпретацію файлу краулером.

Конфігурація 2: Дозволити пошук, але заблокувати краулери для розробки моделей

Це часто найкращий компроміс для видавців, які хочуть отримувати цитати та пошуковий трафік, але не бажають дозволяти збір даних для розробки моделей.

text

Блокувати сканування OpenAI для розробки моделей.

User-agent: GPTBot Disallow: /

Блокувати сканування Anthropic для розробки моделей.

User-agent: ClaudeBot Disallow: /

Блокувати використання Google для навчання моделей та пов'язаних систем обґрунтування.

User-agent: Google-Extended Disallow: /

Блокувати використання Apple для навчання фундаментальних моделей.

User-agent: Applebot-Extended Disallow: /

Додатково: заблокувати збір наборів даних Common Crawl.

User-agent: CCBot

Disallow: /

Дозволити звичайне сканування для пошуку та отримання, за винятком конфіденційних шляхів.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Ця конфігурація залишає OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot та Applebot під дією групи з символом узагальнення. Вона також розділяє дозволи на пошук та навчання.

Для Apple, блокування Applebot-Extended при дозволі Applebot зберігає виявлення через сервіси Apple. Для Google, блокування Google-Extended не блокує звичайний Пошук Google. (developers.google.com)

Конфігурація 3: Явно дозволити вибрані пошукові краулери

Якщо існуючий файл robots.txt блокує всі краулери, додайте окремі групи для пошукових краулерів, які ви бажаєте вітати.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Не допускайте всі інші краулери.

User-agent: * Disallow: /

При використанні конкретних груп повторіть правила щодо конфіденційних шляхів у кожній групі. Деякі краулери використовують найбільш специфічну відповідну групу замість того, щоб поєднувати її з групою з символом узагальнення. Bing безпосередньо документує цю поведінку, а Google надає окремі рекомендації щодо груп, специфічних для краулерів. (bing.com)

Важливі обмеження robots.txt

  • Краулер може ігнорувати robots.txt.
  • Зловмисний краулер може прикидатися довіреним краулером.
  • Заблокована сторінка все ще може бути відома за її заголовком або веб-адресою.
  • Robots.txt не захищає паролі, приватні файли, записи клієнтів або конфіденційні програмні інтерфейси (API).
  • Директива Crawl-delay не є частиною основного протоколу виключення роботів і не підтримується кожним краулером. Anthropic та Bing документують підтримку, тоді як Apple заявляє, що Applebot не дотримується crawl-delay. (rfc-editor.org)

Мета-теги та HTTP-заголовки

Приклад публічної сторінки

Для публічної статті використовуйте чіткий заголовок, автора, канонічну веб-адресу, дату публікації та дату модифікації.

html

Директива max-snippet документується переважно для Google. Не припускайте, що кожен краулер штучного інтелекту підтримує кожну мета-директиву.

Приклад приватної або конфіденційної сторінки

html

Використовуйте це для сторінок, які не повинні з'являтися в результатах пошуку. Сторінка повинна залишатися доступною для сканування достатньо довго, щоб краулер побачив директиву. Якщо сторінка повинна справді залишатися приватною, використовуйте замість цього автентифікацію або захист паролем. (developers.google.com)

Приховувати лише конфіденційні розділи від сніпетів пошуку

Google підтримує data-nosnippet для окремих частин HTML-сторінки:

html

Цей абзац може бути показаний у результатах пошуку.

Особисті телефонні номери, приватні електронні адреси або внутрішні примітки розміщуються тут.

Це корисно для контактних даних, внутрішніх приміток або інформації, створеної користувачами. Це не універсальна інструкція для кожної системи штучного інтелекту. (developers.google.com)

Використовуйте заголовок X-Robots-Tag для файлів

Мета-теги не можуть бути розміщені всередині портативного документа, файлу зображення або відеофайлу. Замість цього використовуйте заголовок HTTP-відповіді:

text X-Robots-Tag: noindex, nosnippet

Для сторінки, яка повинна залишатися доступною для пошуку, але не повинна надавати текст для сніпетів або відповідей штучного інтелекту, використовуйте:

text X-Robots-Tag: nosnippet

Google документує X-Robots-Tag для не-HTML ресурсів, і Apple також підтримує його для Applebot. (developers.google.com)

Специфічні елементи керування Apple

Apple підтримує:

html

Apple стверджує, що nosnippet запобігає використанню сторінки як додаткового контексту та поточного вмісту, коли моделі Apple генерують вивід. Сторінка все ще може бути виявлена через Apple Search, Spotlight, Siri та Safari. (support.apple.com)

Для платних сторінок Apple також підтримує структуровані дані, використовуючи:

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Apple стверджує, що такі сторінки можуть залишатися придатними для результатів пошуку, але не будуть використовуватися як додатковий контекст для відповідей штучного інтелекту. (support.apple.com)

Як перевіряти IP-адреси краулерів

Чому зіставлення user-agent недостатньо

Таке правило є слабким:

text if User-Agent contains "GPTBot": allow

Будь-хто може надіслати цей текст. Краще правило:

text if User-Agent є відомим краулером і вихідна IP-адреса знаходиться в офіційному діапазоні провайдера: дозволити або обмежити швидкість else: викликати, обмежити швидкість або заблокувати

Не довіряйте заголовку X-Forwarded-For, якщо він не надходить від проксі або мережі доставки контенту (CDN), яку контролює ваша організація.

Методи верифікації провайдера

ПровайдерРекомендований метод верифікації
OpenAIВикористовуйте поточні потоки IP-адрес, опубліковані в документації краулера OpenAI для OAI-SearchBot, GPTBot та OAI-AdsBot. Автоматично оновлюйте їх, а не копіюйте фіксовані діапазони у брандмауер.
GoogleВикористовуйте опубліковані діапазони краулерів Google або виконуйте зворотну та пряму перевірку системи доменних імен (Domain Name System). Справжній краулер Google повинен вирішуватися на затверджене ім'я хосту Google та вирішуватися назад до початкової адреси.
AnthropicВикористовуйте поточний опублікований потік адрес краулерів як вторинну перевірку мережі. Основним методом відмови Anthropic залишається robots.txt.
PerplexityПоєднуйте user-agent з поточним потоком адрес PerplexityBot або Perplexity-User. Perplexity спеціально рекомендує поєднувати обидві умови в правилі Web Application Firewall.
AppleВикористовуйте зворотну перевірку системи доменних імен (Reverse Domain Name System) під applebot.apple.com, потім виконайте прямий пошук. Apple також публікує поточні діапазони адрес у JSON-стрічці.
Common CrawlВикористовуйте зворотну перевірку системи доменних імен (Reverse Domain Name System) під crawl.commoncrawl.org та поточний потік адрес CCBot. Common Crawl зазначає, що зворотна перевірка ще не доступна для деякого IPv6-трафіку.
MicrosoftВикористовуйте офіційний інструмент Verify Bingbot або документовані методи зворотного та прямого пошуку Microsoft.
AmazonВикористовуйте опубліковані Amazon списки адрес краулерів та зіставляйте їх з відповідним user-agent Amazon.

Google, Apple, Common Crawl, OpenAI, Anthropic та Perplexity публікують специфічні для провайдерів методи або потоки адрес. Ці списки можуть змінюватися, тому запланований процес оновлення є безпечнішим, ніж постійний список, скопійований вручну. (developers.google.com)

Проста конструкція брандмауера може виглядати так:

text дозволити OAI-SearchBot тільки тоді, коли вихідна адреса знаходиться в поточному діапазоні пошуку OpenAI дозволити GPTBot тільки тоді, коли вихідна адреса знаходиться в поточному діапазоні навчання OpenAI дозволити PerplexityBot тільки тоді, коли вихідна адреса знаходиться в поточному діапазоні PerplexityBot дозволити Applebot тільки тоді, коли зворотна та пряма перевірка DNS успішна дозволити CCBot тільки тоді, коли зворотний DNS та поточний діапазон Common Crawl збігаються

обмежити швидкість для всіх перевірених краулерів блокувати або викликати запити, які стверджують, що є довіреними краулерами, але не пройшли перевірку

Не застосовуйте широке правило дозволу до всього хмарного провайдера. Легітимний краулер може використовувати хмарну інфраструктуру, але більша частина трафіку від цього хмарного провайдера не обов'язково є краулером.

Як відкрите ліцензування впливає на інклюзивність

CC BY 4.0 простою мовою

Міжнародна ліцензія Creative Commons Attribution 4.0, яку зазвичай називають CC BY 4.0, дозволяє людям:

  • Копіювати та розповсюджувати роботу
  • Адаптувати, перекладати, реміксувати та створювати на її основі
  • Використовувати її в комерційних цілях

Основні умови:

  • Надати належне авторство
  • Послатися на ліцензію
  • Вказати, чи були внесені зміни
  • Не натякати, що початковий творець підтримує повторне використання
  • Не додавати юридичних або технічних обмежень, які перешкоджають використанню, дозволеному ліцензією

Creative Commons також попереджає, що ліцензія може не охоплювати права на конфіденційність, права на публічність, моральні права, права на торгові марки, патентні права або матеріали третіх сторін. (creativecommons.org)

Ліцензія сама по собі не є запрошенням для краулера

Розміщення "CC BY 4.0" на сторінці не гарантує, що організація її просканує. Краулер все ще може бути заблокований через:

  • robots.txt
  • Мережу доставки контенту (CDN)
  • Веб-брандмауер застосунків (Web Application Firewall)
  • Обмеження швидкості
  • Виклик JavaScript
  • Стіну авторизації
  • Погану відповідь сервера
  • Недоступний sitemap

Навпаки, дозвіл краулеру не надає автоматично всі авторські права, необхідні для кожного подальшого використання. Robots.txt та ліцензування повинні розроблятися разом.

Чому CC BY може підтримувати ширшу інклюзивність

Чітка дозвільна ліцензія може зробити політику видавця простішою для розуміння командами даних, пошуковими системами та операторами помічників. Вона може зменшити невизначеність щодо копіювання, адаптації, комерційного використання, перекладу та розповсюдження, коли ці дії вимагають дозволу на авторське право.

Однак Creative Commons пояснює, що навчання штучного інтелекту є юридично складним. Обмежувальна ліцензія не завжди є ефективним способом запобігання навчанню, оскільки деякі навчальні використання можуть бути дозволені винятками або обмеженнями авторського права. Creative Commons також зазначає, що умови ліцензії можуть бути важко застосовні до машинного навчання та вихідних даних моделей. (creativecommons.org)

Практичний урок такий:

Використовуйте CC BY, коли ви щиро бажаєте широкого законного повторного використання. Не використовуйте обмежувальну ліцензію Creative Commons як гарантований спосіб відмови від навчання штучного інтелекту.

Атрибуція покращує ясність джерела

Creative Commons рекомендує метод TASL:

  • Title (Заголовок)
  • Author (Автор)
  • Source (Джерело)
  • License (Ліцензія)

Наприклад:

«Ліцензування та роботи для максимальної інклюзивності», Example Publishing, https://www.example.org/articles/ai-crawlers, ліцензовано за міжнародною ліцензією Creative Commons Attribution 4.0. Внесені зміни: оновлено перелік краулерів.

Чітка атрибуція не змушує кожного помічника цитувати сторінку. Вона полегшує правильне цитування, коли система витягує заголовок, автора, джерело та інформацію про ліцензування сторінки. (wiki.creativecommons.org)

Додайте структуровану інформацію про статтю

Використовуйте видиму інформацію та структуровані дані разом:

html

Google рекомендує чітку інформацію про автора, сторінки автора, дати публікації, дати модифікації та стабільні канонічні сторінки. Ці сигнали можуть допомогти пошуковим системам зрозуміти, хто створив матеріал та яка версія є авторитетною. Вони не гарантують ранжування, включення або цитування. (developers.google.com)

Юридичний типовий текст для відкритого сайту, дружнього до цитування

Наведене нижче є зразком формулювання, а не юридичною консультацією. Залучайте юриста, щоб адаптувати його до вашої юрисдикції, структури власності, зобов'язань щодо конфіденційності та стороннього контенту.

Заява про ліцензування CC BY 4.0

text

Ліцензія на контент

За винятком випадків, коли зазначено інше, оригінальний текст та оригінальні редакційні матеріали на цій сторінці ліцензовані за міжнародною ліцензією Creative Commons Attribution 4.0:

https://creativecommons.org/licenses/by/4.0/

Цей дозвіл дозволяє копіювання, розповсюдження, адаптацію, переклад, комерційне використання, машинну обробку, індексування для пошуку, отримання, узагальнення та використання в системах штучного інтелекту за умови дотримання умов ліцензії.

Бажана атрибуція:

«[Заголовок сторінки]», [автор або організація], [канонічна адреса сторінки], опубліковано або оновлено [дата], ліцензовано за міжнародною ліцензією Creative Commons Attribution 4.0. Внесені зміни: [описати зміни або вказати «немає»].

Будь ласка, зберігайте інформацію про автора, видавця, джерело, ліцензію та модифікації, коли це можливо. Цей посібник з бажаної атрибуції не додає обмежень до ліцензії Creative Commons і не замінює текст ліцензії.

Фраза «включаючи системи штучного інтелекту» уточнює намір видавця. Вона не повинна використовуватися для прикидання, що видавець володіє правами на матеріали, створені кимось іншим.

Повідомлення про торгові марки, конфіденційність та права третіх сторін

text

Торгові марки, конфіденційність та права третіх сторін

Вищезгадана ліцензія поширюється лише на оригінальні матеріали, ідентифіковані як ліцензовані. Вона не надає дозволу на використання:

  • Торгових марок, знаків обслуговування, логотипів або комерційної тари
  • Імен, зображень або подоби людей
  • Приватної, конфіденційної, облікової, медичної, фінансової або безпекової інформації
  • Матеріалів користувачів, якщо вони окремо не ідентифіковані як ліцензовані
  • Фотографій, ілюстрацій, карт, відео, музики, цитат або інших матеріалів третіх сторін
  • Контенту, ідентифікованого як «всі права захищені» або такого, що підлягає окремій ліцензії

Використання назви, логотипів та знаків Example Publishing не повинно натякати на спонсорство, схвалення, партнерство або підтримку. Будь ласка, посилайтеся на оригінальну сторінку та чітко розрізняйте цитати, перефразовування, узагальнення та згенерований матеріал.

Ця мова важлива, оскільки ліцензії Creative Commons не надають автоматично кожен тип юридичного права, пов'язаного зі сторінкою. (creativecommons.org)

Рекомендації щодо цитування для пошуку та помічників

text

Рекомендації щодо цитування для пошуку та помічників

Ми вітаємо сумісне індексування для пошуку, отримання за запитом користувача, цитування та узагальнення ліцензованих матеріалів на цьому сайті.

Під час цитування цього сайту, будь ласка, використовуйте заголовок сторінки, автора або видавця, канонічну адресу сторінки, дату публікації або оновлення та пряме посилання на джерело. Будь ласка, ідентифікуйте джерело як один із використаних джерел, відрізняйте згенерований аналіз від цитованого матеріалу та не стверджуйте або не натякайте, що Example Publishing підтримує згенеровану відповідь, продукт, особу або послугу.

Ці рекомендації мають на меті покращити точність та атрибуцію. Вони не надають прав, що перевищують застосовну ліцензію на контент, і не ліцензують торгові марки, особисту інформацію, конфіденційну інформацію або матеріали третіх сторін.

Якщо ви хочете видимості в пошуку, але не бажаєте надавати широку ліцензію на навчання

text

Доступ для пошуку та авторське право

Наші публічні сторінки можуть бути доступні для сумісних краулерів пошуку та отримання, ідентифікованих у нашому файлі robots.txt. Цей дозвіл призначений для підтримки виявлення, результатів пошуку, отримання за запитом користувача та цитування.

За винятком випадків, коли вказана окрема ліцензія, оригінальний контент залишається під «всі права захищені». Доступ до публічної сторінки не надає окремої ліцензії на розробку моделей, навчання, розповсюдження, комерційне повторне використання або створення похідних робіт поза правами, передбаченими чинним законодавством.

Будь ласка, цитуйте канонічну адресу сторінки та видавця, посилаючись на цей матеріал. Ніщо на цьому сайті не надає дозволу на використання торгових марок, логотипів, особистої інформації, конфіденційної інформації або стороннього контенту.

Не розміщуйте заяву CC BY та заяву «всі права захищені» для одного й того ж матеріалу. Чітко визначте, яка ліцензія застосовується до якого контенту.

Матриця ризиків і переваг відкритого ліцензування

Закон про авторське право та правила навчання штучного інтелекту відрізняються залежно від країни та залишаються неврегульованими. Бюро авторських прав Сполучених Штатів продовжує вивчати ці питання, тоді як Creative Commons описує навчання штучного інтелекту як специфічне для фактів та юридично складне. (copyright.gov)

ПідхідПотенціал інклюзіїОсновні перевагиОсновні ризикиНайкраще підходить
CC BY 4.0Дуже високийШироке копіювання, адаптація, комерційне використання, переклад, індексування та пов'язане з моделями повторне використання, коли потрібен дозвіл на авторське правоКомерційні конкуренти можуть повторно використовувати або адаптувати контент; атрибуція може бути недосконалою; ліцензія не може контролювати конфіденційність, торгові марки або права третіх сторінВидавці, які хочуть найширшого законного повторного використання та чіткої атрибуції джерела
CC BY-SA 4.0Високий, але складнішийЗаохочує цикл відкритого обміну та вимагає, щоб адаптації залишалися на сумісних умовахПравила ShareAlike можуть бути важко застосовні до наборів даних, навчання моделей та публічних вихідних даних; деякі організації можуть уникати матеріалу через невизначеністьВідкриті освітні та громадсько-орієнтовані проекти, які хочуть, щоб подальші адаптації залишалися відкритими
CC BY-NC 4.0Середній або низькийОбмежує використання, призначене переважно для комерційної вигоди або грошової компенсації«Некомерційний» може бути важко інтерпретувати; може виключати комерційний пошук, використання моделей та помічників; це не гарантований спосіб відмови від навчанняМатеріали, призначені для некомерційного, освітнього або громадського використання
CC BY-ND 4.0СереднійДозволяє спільний доступ, обмежуючи адаптаціїПереклад, трансформація та деякі випадки використання помічників можуть стати юридично невизначеними; менш привабливо для систем, які узагальнюють або реміксуютьОфіційні повідомлення або роботи, які повинні залишатися незмінними
CC0 або присвята суспільному надбаннюДуже високийСпрощує повторне використання та усуває більшість умов авторського права, де це юридично ефективноНемає обов'язкової атрибуції; слабкий контроль над представленням бренду; права на конфіденційність, торгові марки та публічність залишаються окремимиФакти, набори даних, довідкові матеріали або роботи, призначені для необмеженого повторного використання
Всі права захищені плюс відкрите сканування для пошукуВисокий для пошуку, нижчий для навчанняМоже зберігати видимість у пошуку та цитування без надання широкої ліцензії на повторне використанняБільша юридична невизначеність для розробників моделей; може зменшити включення в навчальні набори даних та комерційні системи повторного використанняВидавці, які хочуть виявлення та цитування, але вважають за краще окремо домовлятися про ширші ліцензії

Найбільш збалансована стратегія для багатьох організацій:

  • CC BY 4.0 для оригінального публічного редакційного тексту
  • Окремі позначки для матеріалів третіх сторін
  • Жодної публічної особистої або конфіденційної інформації
  • Дозволити краулери для пошуку та отримання
  • Дозволяти краулери для розробки моделей лише, якщо організація дійсно погоджується на таке використання
  • Використовувати чітку атрибуцію та канонічні посилання
  • Захищати торгові марки за допомогою окремого повідомлення про бренд

Практичний контрольний список реалізації

Контент та ліцензування

  • Визначте, кому належить кожна сторінка, зображення, діаграма, відео та цитата.
  • Ліцензуйте лише ті матеріали, на які ваша організація контролює права.
  • Окремо позначайте матеріали третіх сторін.
  • Додайте видиму заяву про ліцензію.
  • Надайте бажану цитату із зазначенням заголовка, автора, джерела та ліцензії.
  • Тримайте логотипи, торгові марки, особисті дані та конфіденційну інформацію поза межами ліцензованого обсягу.

Robots.txt

  • Створіть публічний файл robots.txt у корені кожного хосту.
  • Дозволяйте пошукові краулери окремо від навчальних краулерів.
  • Блокуйте адміністративні, облікові, касові, приватні та внутрішні шляхи застосунків.
  • Не покладайтеся на robots.txt для безпеки.
  • Тестуйте файл після кожного значного розгортання веб-сайту.

Мета-теги

  • Використовуйте канонічні посилання.
  • Додайте автора, дату публікації та дату модифікації.
  • Використовуйте noindex для сторінок, які не повинні з'являтися в пошуку.
  • Використовуйте nosnippet або data-nosnippet для конфіденційних уривків, де це підтримується.
  • Використовуйте X-Robots-Tag для портативних документів, зображень та інших не-HTML ресурсів.
  • Пам'ятайте, що краулер повинен мати можливість отримати сторінку, перш ніж він зможе прочитати її мета-теги.

Мережева безпека

  • Ведіть журнали рядків user-agent, вихідних адрес, кодів відповідей та шляхів запитів.
  • Перевіряйте довірених краулерів, використовуючи офіційні потоки адрес або методи системи доменних імен.
  • Автоматично оновлюйте потоки адрес.
  • Поєднуйте перевірки user-agent та вихідних адрес.
  • Обмежуйте швидкість перевірених краулерів замість надання їм необмеженого доступу.
  • Викликайте або блокуйте запити, які стверджують, що є довіреними краулерами, але не пройшли перевірку.

Вимірювання

Відстежуйте:

  • Відвідування з пошукових сервісів штучного інтелекту
  • Посилання на оригінальну сторінку
  • Частоту цитування
  • Навантаження на сервер за краулером
  • Запити, що повертають 403, 404 або 429
  • Доступ краулера до ненавмисних шляхів
  • Чи знаходяться поточні статті після публікації

Висновок

Максимальна інклюзивність вимагає вибіркової відкритості, а не єдиного загального дозволу.

Використовуйте robots.txt для розділення сканування для пошуку, отримання за запитом користувача, навчання та публічних наборів даних. Використовуйте мета-теги та HTTP-заголовки для керування індексуванням та сніпетами. Використовуйте автентифікацію для всього приватного. Перевіряйте IP-адреси краулерів, а не довіряйте лише іменам user-agent.

Дозвільна ліцензія, така як CC BY 4.0, може полегшити широке повторне використання, коли ви дійсно цього хочете. Чітка інформація про атрибуцію – заголовок, автор, джерело, ліцензія, канонічна сторінка та дата оновлення – також може полегшити пошуковим системам та помічникам ідентифікацію та цитування правильного джерела.

Тому найсильніша видавнича політика:

**Відкрийте публічний контент, який ви бажаєте виявити, чітко ліцензуйте матеріал, який ви хочете повторно використовувати, позначте матеріал, яким ви не володієте, захищайте приватну інформацію на рівні сервера та надайте кожному краулеру окремий дозвіл, який можна переглянути.

Схожі статті

Створення авторських хабів: ORCID, Crossref та профілі науковців як примітиви довіри

Створення авторських хабів: ORCID, Crossref та профілі науковців як примітиви довіри

Хто створив цю роботу? Що саме представляє собою робота? Чому слід довіряти зв'язку між особою, роботою та організацією?

Читати статтю
Core Web Vitals та затримка: чи швидші сторінки отримують більше цитат від ШІ?

Core Web Vitals та затримка: чи швидші сторінки отримують більше цитат від ШІ?

Швидша сторінка може покращити сканування та доступність контенту. Це не означає, що сама швидкість змушує систему штучного інтелекту цитувати...

Читати статтю
Структурований контент «Запитання та відповіді» та «Як це зробити»: Створюємо відповіді, яких прагне ШІ

Структурований контент «Запитання та відповіді» та «Як це зробити»: Створюємо відповіді, яких прагне ШІ

Чи додавання структурованих даних QAPage або HowTo підвищує ймовірність появи сторінки у відповіді, згенерованій ШІ, особливо у покроковій відповіді?

Читати статтю
Новий посібник із отримання посилань від ШІ в оглядах Google AI, Bing Copilot та Perplexity

Новий посібник із отримання посилань від ШІ в оглядах Google AI, Bing Copilot та Perplexity

Google тепер часто надає Огляд ШІ (генеративну відповідь ШІ) у верхній частині результатів пошуку. Ці огляди дають лаконічну відповідь, а потім...

Читати статтю

Подобається цей контент?

Підпишіться на нашу розсилку, щоб отримувати останні новини контент-маркетингу та посібники зі зростання.

Ця стаття має виключно інформаційний характер. Контент та стратегії можуть варіюватися залежно від ваших конкретних потреб.
Ліцензування та роботи для максимальної інклюзивності: Як вітати краулери штучного інтелекту | AutoPod