Ліцензування та роботи для максимальної інклюзивності: Як вітати краулери штучного інтелекту
Оновлено 25 серпня 2026 року
Веб-сайти тепер мають більше одного способу охопити аудиторію. Сторінка може бути знайдена через Пошук Google, узагальнена ChatGPT, процитована Perplexity, використана в пошуку Claude, відображена через сервіси Apple або зібрана публічним веб-архівом.
Ці системи не всі використовують однаковий краулер або дотримуються однакових правил. Веб-сайт, який блокує GPTBot, все ще може з'явитися в пошуку ChatGPT, якщо він дозволяє OAI-SearchBot. Веб-сайт, який дозволяє Applebot, може залишатися видимим у Пошуку Apple, блокуючи при цьому Applebot-Extended від використання для навчання моделей штучного інтелекту. Google-Extended від Google взагалі не є звичайним краулером; це токен керування robots.txt.
Тому найкраща політика – це не просто «дозволити штучний інтелект» або «заблокувати штучний інтелект». Вона полягає у створенні окремих дозволів для:
- Пошуку та виявлення
- Отримання за запитом користувача
- Розробки та навчання моделей
- Публічних наборів даних
- Конфіденційних, приватних або обмежених матеріалів
Ця стаття містить актуальний перелік краулерів, приклади robots.txt, рекомендації щодо мета-тегів, методи перевірки IP-адрес, поради щодо ліцензування Creative Commons, типові юридичні формулювання та матрицю ризиків і переваг.
Чотири елементи керування, які повинен розуміти кожен видавець
1. robots.txt контролює запитуване сканування
Файл robots.txt повідомляє сумісним автоматизованим клієнтам, які сторінки вони можуть запитувати. Він корисний для керування трафіком краулерів та вираження уподобань видавця.
Однак, robots.txt не є системою контролю доступу. Протокол виключення роботів (Robots Exclusion Protocol) стверджує, що його правила не є дозволом на доступ. Google також попереджає, що заблокована адреса все ще може з'явитися в результатах пошуку, якщо на неї посилаються інші сторінки. Використовуйте паролі, автентифікацію або серверні засоби контролю доступу для конфіденційної інформації. (rfc-editor.org)
2. Мета-теги контролюють індексування та сніпети
Мета-теги Robots та заголовок відповіді X-Robots-Tag можуть контролювати, чи буде сторінка індексуватися або чи може пошукова система показувати сніпет.
Ці елементи керування зазвичай видимі лише після того, як краулеру дозволено отримати сторінку. Якщо robots.txt спочатку блокує сторінку, краулер може ніколи не побачити мета-тег. (developers.google.com)
3. Мережеві елементи керування перевіряють краулер
Ім'я user-agent легко скопіювати. Зловмисник може надіслати запит, стверджуючи, що він GPTBot, Googlebot або PerplexityBot.
Сильніший підхід поєднує:
- Заявлений user-agent
- Опублікований діапазон IP-адрес
- Зворотну перевірку системи доменних імен (Reverse Domain Name System)
- Пряму перевірку системи доменних імен (Forward Domain Name System)
- Обмеження швидкості та моніторинг запитів
4. Ліцензія надає права на повторне використання
Robots.txt вказує, що краулеру дозволено робити. Ліцензія вказує, що люди або організації можуть законно робити з матеріалами, коли потрібен дозвіл на авторське право.
Це різні інструменти. Дозвільна ліцензія може зменшити юридичну невизначеність, але вона не гарантує, що краулер відвідає сторінку, що модель її використовуватиме або що помічник на неї посилатиметься.
Перелік важливих краулерів
Наступний перелік був перевірений за документацією провайдерів, доступною станом на 25 серпня 2026 року. Імена user-agent, цілі та діапазони IP-адрес можуть змінюватися, тому виробничі системи повинні використовувати поточну документацію провайдера та поточні стрічки адрес.
| Провайдер | Краулер або токен robots.txt | Основна мета | Важливий контроль |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Знаходить та аналізує сторінки для пошуку ChatGPT | Дозвольте його, щоб покращити шанс появи сторінок у результатах пошуку ChatGPT. |
| OpenAI | GPTBot | Збирає сторінки, які можуть бути використані для навчання генеративних моделей штучного інтелекту OpenAI | Дозволити або заборонити окремо від пошуку. |
| OpenAI | ChatGPT-User | Отримує сторінки після того, як користувач просить ChatGPT або користувацький GPT отримати до них доступ | Це ініціюється користувачем, а не автоматичним веб-краулером, тому правила robots.txt можуть не застосовуватися. |
| OpenAI | OAI-AdsBot | Перевіряє веб-сторінки, подані як рекламні призначення ChatGPT | Стосується переважно рекламодавців. Зібраний вміст не використовується для навчання фундаментальних моделей генеративного штучного інтелекту. |
Googlebot | Основний краулер Пошуку Google | Контролює звичайне сканування Пошуку Google. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Зображення, відео та Google Новини | Вони мають окремі токени robots.txt і можуть контролюватися незалежно. | |
GoogleOther | Загального призначення сканування Google для різних команд продуктів, включаючи дослідження та розробки | Він не представляє один конкретний продукт Google. | |
Google-Extended | Контролює, чи може вміст, сканований Google, використовуватися для навчання моделі Gemini та певних систем обґрунтування | Це токен керування robots.txt, а не окремий user-agent для запитів. Він не впливає на звичайне включення в Пошук Google. | |
| Anthropic | ClaudeBot | Збирає публічний веб-контент, який може сприяти розробці моделі Claude | Забороніть його, щоб сигналізувати, що майбутні матеріали повинні бути виключені з навчальних наборів даних Anthropic. |
| Anthropic | Claude-SearchBot | Покращує якість результатів пошуку Claude | Дозвольте його для видимості в пошуку Claude. |
| Anthropic | Claude-User | Отримує сторінки у відповідь на запит користувача до Claude | Окремо від автоматичного сканування. |
| Perplexity | PerplexityBot | Індексує сторінки для результатів пошуку Perplexity | Perplexity стверджує, що цей краулер не використовується для збору контенту для навчання фундаментальних моделей штучного інтелекту. |
| Perplexity | Perplexity-User | Отримує сторінку після запиту користувача | Документація Perplexity стверджує, що цей завантажувач зазвичай ігнорує robots.txt, оскільки запит був ініційований користувачем. |
| Apple | Applebot | Підтримує Apple Search, Spotlight, Siri, Safari та інші сервіси Apple | Дозвольте його для виявлення Apple. |
| Apple | Applebot-Extended | Контролює, чи може вміст, сканований Applebot, використовуватися для навчання фундаментальних моделей Apple | Він сам не сканує сторінки. Це контроль використання даних. |
| Common Crawl | CCBot | Збирає публічні веб-дані для відкритого веб-архіву Common Crawl | Це не помічник, але його набори даних можуть використовуватися дослідниками та розробниками штучного інтелекту. |
| Microsoft | Bingbot | Основний краулер пошуку Bing | Дозвольте його для виявлення Bing та видимості в пошуку. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Попередній перегляд сторінок та відео для продуктів Microsoft | Їх можна контролювати окремо від Bingbot. |
| Amazon | Amzn-SearchBot | Пошук та виявлення контенту Amazon | Amazon стверджує, що він не сканує контент для навчання моделей генеративного штучного інтелекту. |
| Amazon | Amzn-User | Отримує актуальну інформацію у відповідь на дії користувача, включаючи запити Alexa | Ініціюється користувачем та окремо від автоматичного сканування пошуку. |
OpenAI документує свої пошукові, навчальні, рекламні та ініційовані користувачем краулери як окремі елементи керування. Його документація спеціально рекомендує дозволяти OAI-SearchBot для пошуку ChatGPT, використовуючи GPTBot окремо для налаштувань навчання. (developers.openai.com)
Google аналогічно розділяє Googlebot, GoogleOther та Google-Extended. Google-Extended не має власного user-agent для HTTP-запитів, і його блокування не видаляє сторінку з Пошуку Google. (developers.google.com)
Anthropic документує окремі ролі для ClaudeBot, Claude-SearchBot та Claude-User. Anthropic також заявляє, що його боти дотримуються robots.txt та підтримують нестандартну директиву Crawl-delay. (support.anthropic.com)
Perplexity розрізняє автоматичне сканування для пошуку та отримання за запитом користувача. Його поточна документація стверджує, що PerplexityBot поважає robots.txt, тоді як Perplexity-User зазвичай ні, оскільки він відповідає на запит користувача. (docs.perplexity.ai)
Поточна документація Apple робить таке ж розрізнення між пошуком та навчанням: Applebot підтримує виявлення, тоді як Applebot-Extended дозволяє видавцям контролювати використання для навчання, не видаляючи сторінки з Apple Search. (support.apple.com)
Рекомендовані конфігурації robots.txt
Розміщуйте robots.txt у корені кожного хосту, наприклад:
text https://www.example.org/robots.txt
Правила застосовуються до конкретного хосту, протоколу та порту, де розміщено файл. Окремий субдомен може потребувати власного файлу. (developers.google.com)
Конфігурація 1: Максимальна інклюзивність
Використовуйте це, коли публічний редакційний контент може бути знайдений, узагальнений, процитований, індексований та зібраний сумісними краулерами.
text
Публічні сторінки доступні для сумісних краулерів.
User-agent: * Allow: /
Не допускайте приватні, транзакційні та адміністративні шляхи.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Це дозволяє іменованим краулерам, включаючи OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft та Amazon, якщо інше конкретне правило їх не блокує.
Не розміщуйте загальне правило, таке як User-agent: * Disallow: /, під цією конфігурацією. Пізніша або більш конкретна група може змінити інтерпретацію файлу краулером.
Конфігурація 2: Дозволити пошук, але заблокувати краулери для розробки моделей
Це часто найкращий компроміс для видавців, які хочуть отримувати цитати та пошуковий трафік, але не бажають дозволяти збір даних для розробки моделей.
text
Блокувати сканування OpenAI для розробки моделей.
User-agent: GPTBot Disallow: /
Блокувати сканування Anthropic для розробки моделей.
User-agent: ClaudeBot Disallow: /
Блокувати використання Google для навчання моделей та пов'язаних систем обґрунтування.
User-agent: Google-Extended Disallow: /
Блокувати використання Apple для навчання фундаментальних моделей.
User-agent: Applebot-Extended Disallow: /
Додатково: заблокувати збір наборів даних Common Crawl.
User-agent: CCBot
Disallow: /
Дозволити звичайне сканування для пошуку та отримання, за винятком конфіденційних шляхів.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Ця конфігурація залишає OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot та Applebot під дією групи з символом узагальнення. Вона також розділяє дозволи на пошук та навчання.
Для Apple, блокування Applebot-Extended при дозволі Applebot зберігає виявлення через сервіси Apple. Для Google, блокування Google-Extended не блокує звичайний Пошук Google. (developers.google.com)
Конфігурація 3: Явно дозволити вибрані пошукові краулери
Якщо існуючий файл robots.txt блокує всі краулери, додайте окремі групи для пошукових краулерів, які ви бажаєте вітати.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Не допускайте всі інші краулери.
User-agent: * Disallow: /
При використанні конкретних груп повторіть правила щодо конфіденційних шляхів у кожній групі. Деякі краулери використовують найбільш специфічну відповідну групу замість того, щоб поєднувати її з групою з символом узагальнення. Bing безпосередньо документує цю поведінку, а Google надає окремі рекомендації щодо груп, специфічних для краулерів. (bing.com)
Важливі обмеження robots.txt
- Краулер може ігнорувати robots.txt.
- Зловмисний краулер може прикидатися довіреним краулером.
- Заблокована сторінка все ще може бути відома за її заголовком або веб-адресою.
- Robots.txt не захищає паролі, приватні файли, записи клієнтів або конфіденційні програмні інтерфейси (API).
- Директива
Crawl-delayне є частиною основного протоколу виключення роботів і не підтримується кожним краулером. Anthropic та Bing документують підтримку, тоді як Apple заявляє, що Applebot не дотримується crawl-delay. (rfc-editor.org)
Мета-теги та HTTP-заголовки
Приклад публічної сторінки
Для публічної статті використовуйте чіткий заголовок, автора, канонічну веб-адресу, дату публікації та дату модифікації.
html
Директива max-snippet документується переважно для Google. Не припускайте, що кожен краулер штучного інтелекту підтримує кожну мета-директиву.
Приклад приватної або конфіденційної сторінки
html
Використовуйте це для сторінок, які не повинні з'являтися в результатах пошуку. Сторінка повинна залишатися доступною для сканування достатньо довго, щоб краулер побачив директиву. Якщо сторінка повинна справді залишатися приватною, використовуйте замість цього автентифікацію або захист паролем. (developers.google.com)
Приховувати лише конфіденційні розділи від сніпетів пошуку
Google підтримує data-nosnippet для окремих частин HTML-сторінки:
html
Цей абзац може бути показаний у результатах пошуку.
Це корисно для контактних даних, внутрішніх приміток або інформації, створеної користувачами. Це не універсальна інструкція для кожної системи штучного інтелекту. (developers.google.com)
Використовуйте заголовок X-Robots-Tag для файлів
Мета-теги не можуть бути розміщені всередині портативного документа, файлу зображення або відеофайлу. Замість цього використовуйте заголовок HTTP-відповіді:
text X-Robots-Tag: noindex, nosnippet
Для сторінки, яка повинна залишатися доступною для пошуку, але не повинна надавати текст для сніпетів або відповідей штучного інтелекту, використовуйте:
text X-Robots-Tag: nosnippet
Google документує X-Robots-Tag для не-HTML ресурсів, і Apple також підтримує його для Applebot. (developers.google.com)
Специфічні елементи керування Apple
Apple підтримує:
html
Apple стверджує, що nosnippet запобігає використанню сторінки як додаткового контексту та поточного вмісту, коли моделі Apple генерують вивід. Сторінка все ще може бути виявлена через Apple Search, Spotlight, Siri та Safari. (support.apple.com)
Для платних сторінок Apple також підтримує структуровані дані, використовуючи:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple стверджує, що такі сторінки можуть залишатися придатними для результатів пошуку, але не будуть використовуватися як додатковий контекст для відповідей штучного інтелекту. (support.apple.com)
Як перевіряти IP-адреси краулерів
Чому зіставлення user-agent недостатньо
Таке правило є слабким:
text if User-Agent contains "GPTBot": allow
Будь-хто може надіслати цей текст. Краще правило:
text if User-Agent є відомим краулером і вихідна IP-адреса знаходиться в офіційному діапазоні провайдера: дозволити або обмежити швидкість else: викликати, обмежити швидкість або заблокувати
Не довіряйте заголовку X-Forwarded-For, якщо він не надходить від проксі або мережі доставки контенту (CDN), яку контролює ваша організація.
Методи верифікації провайдера
| Провайдер | Рекомендований метод верифікації |
|---|---|
| OpenAI | Використовуйте поточні потоки IP-адрес, опубліковані в документації краулера OpenAI для OAI-SearchBot, GPTBot та OAI-AdsBot. Автоматично оновлюйте їх, а не копіюйте фіксовані діапазони у брандмауер. |
| Використовуйте опубліковані діапазони краулерів Google або виконуйте зворотну та пряму перевірку системи доменних імен (Domain Name System). Справжній краулер Google повинен вирішуватися на затверджене ім'я хосту Google та вирішуватися назад до початкової адреси. | |
| Anthropic | Використовуйте поточний опублікований потік адрес краулерів як вторинну перевірку мережі. Основним методом відмови Anthropic залишається robots.txt. |
| Perplexity | Поєднуйте user-agent з поточним потоком адрес PerplexityBot або Perplexity-User. Perplexity спеціально рекомендує поєднувати обидві умови в правилі Web Application Firewall. |
| Apple | Використовуйте зворотну перевірку системи доменних імен (Reverse Domain Name System) під applebot.apple.com, потім виконайте прямий пошук. Apple також публікує поточні діапазони адрес у JSON-стрічці. |
| Common Crawl | Використовуйте зворотну перевірку системи доменних імен (Reverse Domain Name System) під crawl.commoncrawl.org та поточний потік адрес CCBot. Common Crawl зазначає, що зворотна перевірка ще не доступна для деякого IPv6-трафіку. |
| Microsoft | Використовуйте офіційний інструмент Verify Bingbot або документовані методи зворотного та прямого пошуку Microsoft. |
| Amazon | Використовуйте опубліковані Amazon списки адрес краулерів та зіставляйте їх з відповідним user-agent Amazon. |
Google, Apple, Common Crawl, OpenAI, Anthropic та Perplexity публікують специфічні для провайдерів методи або потоки адрес. Ці списки можуть змінюватися, тому запланований процес оновлення є безпечнішим, ніж постійний список, скопійований вручну. (developers.google.com)
Проста конструкція брандмауера може виглядати так:
text дозволити OAI-SearchBot тільки тоді, коли вихідна адреса знаходиться в поточному діапазоні пошуку OpenAI дозволити GPTBot тільки тоді, коли вихідна адреса знаходиться в поточному діапазоні навчання OpenAI дозволити PerplexityBot тільки тоді, коли вихідна адреса знаходиться в поточному діапазоні PerplexityBot дозволити Applebot тільки тоді, коли зворотна та пряма перевірка DNS успішна дозволити CCBot тільки тоді, коли зворотний DNS та поточний діапазон Common Crawl збігаються
обмежити швидкість для всіх перевірених краулерів блокувати або викликати запити, які стверджують, що є довіреними краулерами, але не пройшли перевірку
Не застосовуйте широке правило дозволу до всього хмарного провайдера. Легітимний краулер може використовувати хмарну інфраструктуру, але більша частина трафіку від цього хмарного провайдера не обов'язково є краулером.
Як відкрите ліцензування впливає на інклюзивність
CC BY 4.0 простою мовою
Міжнародна ліцензія Creative Commons Attribution 4.0, яку зазвичай називають CC BY 4.0, дозволяє людям:
- Копіювати та розповсюджувати роботу
- Адаптувати, перекладати, реміксувати та створювати на її основі
- Використовувати її в комерційних цілях
Основні умови:
- Надати належне авторство
- Послатися на ліцензію
- Вказати, чи були внесені зміни
- Не натякати, що початковий творець підтримує повторне використання
- Не додавати юридичних або технічних обмежень, які перешкоджають використанню, дозволеному ліцензією
Creative Commons також попереджає, що ліцензія може не охоплювати права на конфіденційність, права на публічність, моральні права, права на торгові марки, патентні права або матеріали третіх сторін. (creativecommons.org)
Ліцензія сама по собі не є запрошенням для краулера
Розміщення "CC BY 4.0" на сторінці не гарантує, що організація її просканує. Краулер все ще може бути заблокований через:
- robots.txt
- Мережу доставки контенту (CDN)
- Веб-брандмауер застосунків (Web Application Firewall)
- Обмеження швидкості
- Виклик JavaScript
- Стіну авторизації
- Погану відповідь сервера
- Недоступний sitemap
Навпаки, дозвіл краулеру не надає автоматично всі авторські права, необхідні для кожного подальшого використання. Robots.txt та ліцензування повинні розроблятися разом.
Чому CC BY може підтримувати ширшу інклюзивність
Чітка дозвільна ліцензія може зробити політику видавця простішою для розуміння командами даних, пошуковими системами та операторами помічників. Вона може зменшити невизначеність щодо копіювання, адаптації, комерційного використання, перекладу та розповсюдження, коли ці дії вимагають дозволу на авторське право.
Однак Creative Commons пояснює, що навчання штучного інтелекту є юридично складним. Обмежувальна ліцензія не завжди є ефективним способом запобігання навчанню, оскільки деякі навчальні використання можуть бути дозволені винятками або обмеженнями авторського права. Creative Commons також зазначає, що умови ліцензії можуть бути важко застосовні до машинного навчання та вихідних даних моделей. (creativecommons.org)
Практичний урок такий:
Використовуйте CC BY, коли ви щиро бажаєте широкого законного повторного використання. Не використовуйте обмежувальну ліцензію Creative Commons як гарантований спосіб відмови від навчання штучного інтелекту.
Атрибуція покращує ясність джерела
Creative Commons рекомендує метод TASL:
- Title (Заголовок)
- Author (Автор)
- Source (Джерело)
- License (Ліцензія)
Наприклад:
«Ліцензування та роботи для максимальної інклюзивності», Example Publishing, https://www.example.org/articles/ai-crawlers, ліцензовано за міжнародною ліцензією Creative Commons Attribution 4.0. Внесені зміни: оновлено перелік краулерів.
Чітка атрибуція не змушує кожного помічника цитувати сторінку. Вона полегшує правильне цитування, коли система витягує заголовок, автора, джерело та інформацію про ліцензування сторінки. (wiki.creativecommons.org)
Додайте структуровану інформацію про статтю
Використовуйте видиму інформацію та структуровані дані разом:
html
Google рекомендує чітку інформацію про автора, сторінки автора, дати публікації, дати модифікації та стабільні канонічні сторінки. Ці сигнали можуть допомогти пошуковим системам зрозуміти, хто створив матеріал та яка версія є авторитетною. Вони не гарантують ранжування, включення або цитування. (developers.google.com)
Юридичний типовий текст для відкритого сайту, дружнього до цитування
Наведене нижче є зразком формулювання, а не юридичною консультацією. Залучайте юриста, щоб адаптувати його до вашої юрисдикції, структури власності, зобов'язань щодо конфіденційності та стороннього контенту.
Заява про ліцензування CC BY 4.0
text
Ліцензія на контент
За винятком випадків, коли зазначено інше, оригінальний текст та оригінальні редакційні матеріали на цій сторінці ліцензовані за міжнародною ліцензією Creative Commons Attribution 4.0:
https://creativecommons.org/licenses/by/4.0/
Цей дозвіл дозволяє копіювання, розповсюдження, адаптацію, переклад, комерційне використання, машинну обробку, індексування для пошуку, отримання, узагальнення та використання в системах штучного інтелекту за умови дотримання умов ліцензії.
Бажана атрибуція:
«[Заголовок сторінки]», [автор або організація], [канонічна адреса сторінки], опубліковано або оновлено [дата], ліцензовано за міжнародною ліцензією Creative Commons Attribution 4.0. Внесені зміни: [описати зміни або вказати «немає»].
Будь ласка, зберігайте інформацію про автора, видавця, джерело, ліцензію та модифікації, коли це можливо. Цей посібник з бажаної атрибуції не додає обмежень до ліцензії Creative Commons і не замінює текст ліцензії.
Фраза «включаючи системи штучного інтелекту» уточнює намір видавця. Вона не повинна використовуватися для прикидання, що видавець володіє правами на матеріали, створені кимось іншим.
Повідомлення про торгові марки, конфіденційність та права третіх сторін
text
Торгові марки, конфіденційність та права третіх сторін
Вищезгадана ліцензія поширюється лише на оригінальні матеріали, ідентифіковані як ліцензовані. Вона не надає дозволу на використання:
- Торгових марок, знаків обслуговування, логотипів або комерційної тари
- Імен, зображень або подоби людей
- Приватної, конфіденційної, облікової, медичної, фінансової або безпекової інформації
- Матеріалів користувачів, якщо вони окремо не ідентифіковані як ліцензовані
- Фотографій, ілюстрацій, карт, відео, музики, цитат або інших матеріалів третіх сторін
- Контенту, ідентифікованого як «всі права захищені» або такого, що підлягає окремій ліцензії
Використання назви, логотипів та знаків Example Publishing не повинно натякати на спонсорство, схвалення, партнерство або підтримку. Будь ласка, посилайтеся на оригінальну сторінку та чітко розрізняйте цитати, перефразовування, узагальнення та згенерований матеріал.
Ця мова важлива, оскільки ліцензії Creative Commons не надають автоматично кожен тип юридичного права, пов'язаного зі сторінкою. (creativecommons.org)
Рекомендації щодо цитування для пошуку та помічників
text
Рекомендації щодо цитування для пошуку та помічників
Ми вітаємо сумісне індексування для пошуку, отримання за запитом користувача, цитування та узагальнення ліцензованих матеріалів на цьому сайті.
Під час цитування цього сайту, будь ласка, використовуйте заголовок сторінки, автора або видавця, канонічну адресу сторінки, дату публікації або оновлення та пряме посилання на джерело. Будь ласка, ідентифікуйте джерело як один із використаних джерел, відрізняйте згенерований аналіз від цитованого матеріалу та не стверджуйте або не натякайте, що Example Publishing підтримує згенеровану відповідь, продукт, особу або послугу.
Ці рекомендації мають на меті покращити точність та атрибуцію. Вони не надають прав, що перевищують застосовну ліцензію на контент, і не ліцензують торгові марки, особисту інформацію, конфіденційну інформацію або матеріали третіх сторін.
Якщо ви хочете видимості в пошуку, але не бажаєте надавати широку ліцензію на навчання
text
Доступ для пошуку та авторське право
Наші публічні сторінки можуть бути доступні для сумісних краулерів пошуку та отримання, ідентифікованих у нашому файлі robots.txt. Цей дозвіл призначений для підтримки виявлення, результатів пошуку, отримання за запитом користувача та цитування.
За винятком випадків, коли вказана окрема ліцензія, оригінальний контент залишається під «всі права захищені». Доступ до публічної сторінки не надає окремої ліцензії на розробку моделей, навчання, розповсюдження, комерційне повторне використання або створення похідних робіт поза правами, передбаченими чинним законодавством.
Будь ласка, цитуйте канонічну адресу сторінки та видавця, посилаючись на цей матеріал. Ніщо на цьому сайті не надає дозволу на використання торгових марок, логотипів, особистої інформації, конфіденційної інформації або стороннього контенту.
Не розміщуйте заяву CC BY та заяву «всі права захищені» для одного й того ж матеріалу. Чітко визначте, яка ліцензія застосовується до якого контенту.
Матриця ризиків і переваг відкритого ліцензування
Закон про авторське право та правила навчання штучного інтелекту відрізняються залежно від країни та залишаються неврегульованими. Бюро авторських прав Сполучених Штатів продовжує вивчати ці питання, тоді як Creative Commons описує навчання штучного інтелекту як специфічне для фактів та юридично складне. (copyright.gov)
| Підхід | Потенціал інклюзії | Основні переваги | Основні ризики | Найкраще підходить |
|---|---|---|---|---|
| CC BY 4.0 | Дуже високий | Широке копіювання, адаптація, комерційне використання, переклад, індексування та пов'язане з моделями повторне використання, коли потрібен дозвіл на авторське право | Комерційні конкуренти можуть повторно використовувати або адаптувати контент; атрибуція може бути недосконалою; ліцензія не може контролювати конфіденційність, торгові марки або права третіх сторін | Видавці, які хочуть найширшого законного повторного використання та чіткої атрибуції джерела |
| CC BY-SA 4.0 | Високий, але складніший | Заохочує цикл відкритого обміну та вимагає, щоб адаптації залишалися на сумісних умовах | Правила ShareAlike можуть бути важко застосовні до наборів даних, навчання моделей та публічних вихідних даних; деякі організації можуть уникати матеріалу через невизначеність | Відкриті освітні та громадсько-орієнтовані проекти, які хочуть, щоб подальші адаптації залишалися відкритими |
| CC BY-NC 4.0 | Середній або низький | Обмежує використання, призначене переважно для комерційної вигоди або грошової компенсації | «Некомерційний» може бути важко інтерпретувати; може виключати комерційний пошук, використання моделей та помічників; це не гарантований спосіб відмови від навчання | Матеріали, призначені для некомерційного, освітнього або громадського використання |
| CC BY-ND 4.0 | Середній | Дозволяє спільний доступ, обмежуючи адаптації | Переклад, трансформація та деякі випадки використання помічників можуть стати юридично невизначеними; менш привабливо для систем, які узагальнюють або реміксують | Офіційні повідомлення або роботи, які повинні залишатися незмінними |
| CC0 або присвята суспільному надбанню | Дуже високий | Спрощує повторне використання та усуває більшість умов авторського права, де це юридично ефективно | Немає обов'язкової атрибуції; слабкий контроль над представленням бренду; права на конфіденційність, торгові марки та публічність залишаються окремими | Факти, набори даних, довідкові матеріали або роботи, призначені для необмеженого повторного використання |
| Всі права захищені плюс відкрите сканування для пошуку | Високий для пошуку, нижчий для навчання | Може зберігати видимість у пошуку та цитування без надання широкої ліцензії на повторне використання | Більша юридична невизначеність для розробників моделей; може зменшити включення в навчальні набори даних та комерційні системи повторного використання | Видавці, які хочуть виявлення та цитування, але вважають за краще окремо домовлятися про ширші ліцензії |
Найбільш збалансована стратегія для багатьох організацій:
- CC BY 4.0 для оригінального публічного редакційного тексту
- Окремі позначки для матеріалів третіх сторін
- Жодної публічної особистої або конфіденційної інформації
- Дозволити краулери для пошуку та отримання
- Дозволяти краулери для розробки моделей лише, якщо організація дійсно погоджується на таке використання
- Використовувати чітку атрибуцію та канонічні посилання
- Захищати торгові марки за допомогою окремого повідомлення про бренд
Практичний контрольний список реалізації
Контент та ліцензування
- Визначте, кому належить кожна сторінка, зображення, діаграма, відео та цитата.
- Ліцензуйте лише ті матеріали, на які ваша організація контролює права.
- Окремо позначайте матеріали третіх сторін.
- Додайте видиму заяву про ліцензію.
- Надайте бажану цитату із зазначенням заголовка, автора, джерела та ліцензії.
- Тримайте логотипи, торгові марки, особисті дані та конфіденційну інформацію поза межами ліцензованого обсягу.
Robots.txt
- Створіть публічний файл robots.txt у корені кожного хосту.
- Дозволяйте пошукові краулери окремо від навчальних краулерів.
- Блокуйте адміністративні, облікові, касові, приватні та внутрішні шляхи застосунків.
- Не покладайтеся на robots.txt для безпеки.
- Тестуйте файл після кожного значного розгортання веб-сайту.
Мета-теги
- Використовуйте канонічні посилання.
- Додайте автора, дату публікації та дату модифікації.
- Використовуйте
noindexдля сторінок, які не повинні з'являтися в пошуку. - Використовуйте
nosnippetабоdata-nosnippetдля конфіденційних уривків, де це підтримується. - Використовуйте
X-Robots-Tagдля портативних документів, зображень та інших не-HTML ресурсів. - Пам'ятайте, що краулер повинен мати можливість отримати сторінку, перш ніж він зможе прочитати її мета-теги.
Мережева безпека
- Ведіть журнали рядків user-agent, вихідних адрес, кодів відповідей та шляхів запитів.
- Перевіряйте довірених краулерів, використовуючи офіційні потоки адрес або методи системи доменних імен.
- Автоматично оновлюйте потоки адрес.
- Поєднуйте перевірки user-agent та вихідних адрес.
- Обмежуйте швидкість перевірених краулерів замість надання їм необмеженого доступу.
- Викликайте або блокуйте запити, які стверджують, що є довіреними краулерами, але не пройшли перевірку.
Вимірювання
Відстежуйте:
- Відвідування з пошукових сервісів штучного інтелекту
- Посилання на оригінальну сторінку
- Частоту цитування
- Навантаження на сервер за краулером
- Запити, що повертають
403,404або429 - Доступ краулера до ненавмисних шляхів
- Чи знаходяться поточні статті після публікації
Висновок
Максимальна інклюзивність вимагає вибіркової відкритості, а не єдиного загального дозволу.
Використовуйте robots.txt для розділення сканування для пошуку, отримання за запитом користувача, навчання та публічних наборів даних. Використовуйте мета-теги та HTTP-заголовки для керування індексуванням та сніпетами. Використовуйте автентифікацію для всього приватного. Перевіряйте IP-адреси краулерів, а не довіряйте лише іменам user-agent.
Дозвільна ліцензія, така як CC BY 4.0, може полегшити широке повторне використання, коли ви дійсно цього хочете. Чітка інформація про атрибуцію – заголовок, автор, джерело, ліцензія, канонічна сторінка та дата оновлення – також може полегшити пошуковим системам та помічникам ідентифікацію та цитування правильного джерела.
Тому найсильніша видавнича політика:
**Відкрийте публічний контент, який ви бажаєте виявити, чітко ліцензуйте матеріал, який ви хочете повторно використовувати, позначте матеріал, яким ви не володієте, захищайте приватну інформацію на рівні сервера та надайте кожному краулеру окремий дозвіл, який можна переглянути.
Auto