AutoPodAutoPod

Licencjonowanie i pliki robots.txt dla maksymalnej inkluzji: Jak powitać crawlery sztucznej inteligencji

23 min czytania
Artykuł audio
Licencjonowanie i pliki robots.txt dla maksymalnej inkluzji: Jak powitać crawlery sztucznej inteligencji
0:000:00
Licencjonowanie i pliki robots.txt dla maksymalnej inkluzji: Jak powitać crawlery sztucznej inteligencji

Licencjonowanie i pliki robots.txt dla maksymalnej inkluzji: Jak powitać crawlery sztucznej inteligencji

Zaktualizowano 25 sierpnia 2026 r.

Witryny internetowe mają teraz więcej niż jeden sposób dotarcia do odbiorców. Strona może zostać znaleziona poprzez Wyszukiwarkę Google, podsumowana przez ChatGPT, cytowana przez Perplexity, wykorzystana w wyszukiwaniu Claude, wyświetlona za pośrednictwem usług Apple lub zebrana przez publiczne archiwum internetowe.

Te systemy nie używają tych samych crawlerów ani nie przestrzegają tych samych zasad. Witryna blokująca GPTBot może nadal pojawiać się w wyszukiwarce ChatGPT, jeśli zezwala na OAI-SearchBot. Witryna, która zezwala na Applebot, może pozostać widoczna w wyszukiwarce Apple, blokując jednocześnie Applebot-Extended przed wykorzystaniem do szkolenia modeli sztucznej inteligencji. Google-Extended firmy Google wcale nie jest zwykłym crawlerem; to token kontrolny robots.txt.

Najlepsza polityka nie polega zatem po prostu na „zezwalaniu sztucznej inteligencji” lub „blokowaniu sztucznej inteligencji”. Polega ona na tworzeniu oddzielnych uprawnień dla:

  1. Wyszukiwanie i odkrywanie
  2. Pobieranie na żądanie użytkownika
  3. Rozwój i szkolenie modeli
  4. Publiczne zbiory danych
  5. Materiały wrażliwe, prywatne lub zastrzeżone

Ten artykuł zawiera aktualny spis crawlerów, przykłady robots.txt, wskazówki dotyczące meta tagów, metody weryfikacji adresów IP, porady dotyczące licencjonowania Creative Commons, standardowe klauzule prawne oraz macierz ryzyka i korzyści.

Cztery kontrole, które każdy wydawca powinien zrozumieć

1. robots.txt kontroluje żądane indeksowanie

Plik robots.txt informuje zgodne z protokołem zautomatyzowane klienty, o jakie strony mogą prosić. Jest on przydatny do zarządzania ruchem crawlerów i wyrażania preferencji wydawcy.

Jednak robots.txt nie jest systemem kontroli dostępu. Protokół wykluczania robotów (Robots Exclusion Protocol) stwierdza, że jego zasady nie stanowią autoryzacji dostępu. Google ostrzega również, że zablokowany adres może nadal pojawiać się w wynikach wyszukiwania, jeśli inne strony do niego linkują. Używaj haseł, uwierzytelniania lub serwerowych kontroli dostępu do informacji poufnych. (rfc-editor.org)

2. Meta tagi kontrolują indeksowanie i fragmenty

Meta tagi robots i nagłówek odpowiedzi X-Robots-Tag mogą kontrolować, czy strona jest indeksowana i czy wyszukiwarka może wyświetlić fragment (snippet).

Te kontrolki są zazwyczaj widoczne dopiero po zezwoleniu crawlerowi na pobranie strony. Jeśli robots.txt najpierw zablokuje stronę, crawler może nigdy nie zobaczyć meta tagu. (developers.google.com)

3. Kontrole sieciowe weryfikują crawlera

Nazwę user-agent łatwo skopiować. Atakujący może wysłać żądanie, podając się za GPTBot, Googlebot lub PerplexityBot.

Silniejsze podejście łączy:

  • Zgłoszony user-agent
  • Opublikowany zakres adresów protokołu internetowego (IP)
  • Weryfikacja odwrotnego Systemu Nazw Domen (Reverse DNS)
  • Weryfikacja Systemu Nazw Domen (Forward DNS)
  • Ograniczenia szybkości (rate limits) i monitorowanie żądań

4. Licencja udziela praw do ponownego wykorzystania

Robots.txt mówi, co crawler ma zrobić. Licencja mówi, co osoby lub organizacje mogą legalnie zrobić z materiałem, gdy wymagane jest zezwolenie autorskie.

To różne narzędzia. Licencja permisywna może zmniejszyć niepewność prawną, ale nie gwarantuje, że crawler odwiedzi stronę, że model ją wykorzysta lub że asystent ją zacytuje.

Spis ważnych crawlerów

Poniższy spis został zweryfikowany na podstawie dokumentacji dostawców dostępnej 25 sierpnia 2026 r. Nazwy user-agent, przeznaczenie i zakresy adresów protokołu internetowego mogą ulec zmianie, dlatego systemy produkcyjne powinny korzystać z aktualnej dokumentacji dostawcy i bieżących strumieni adresów.

DostawcaCrawler lub token robots.txtGłówne przeznaczenieWażna kontrola
OpenAIOAI-SearchBotZnajduje i analizuje strony dla wyszukiwarki ChatGPTZezwól na niego, aby zwiększyć szansę na pojawienie się stron w wynikach wyszukiwania ChatGPT.
OpenAIGPTBotZbieranie stron, które mogą być wykorzystane do szkolenia generatywnych modeli sztucznej inteligencji OpenAIZezwalaj lub blokuj niezależnie od wyszukiwania.
OpenAIChatGPT-UserPobiera strony po tym, jak użytkownik poprosi ChatGPT lub niestandardowego GPT o dostęp do nichJest wyzwalany przez użytkownika, a nie automatycznym crawlerem internetowym, więc zasady robots.txt mogą nie mieć zastosowania.
OpenAIOAI-AdsBotSprawdza strony internetowe zgłoszone jako miejsca docelowe reklam ChatGPTDotyczy głównie reklamodawców. Zebrane treści nie są wykorzystywane do szkolenia generatywnych modeli podstawowych sztucznej inteligencji.
GoogleGooglebotGłówny crawler wyszukiwarki GoogleKontroluje zwykłe indeksowanie Google Search.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-NewsObrazy, filmy i Wiadomości GooglePosiadają oddzielne tokeny robots.txt i mogą być kontrolowane niezależnie.
GoogleGoogleOtherIndeksowanie ogólnego przeznaczenia Google dla różnych zespołów produktowych, w tym badań i rozwojuNie reprezentuje jednego konkretnego produktu Google.
GoogleGoogle-ExtendedKontroluje, czy treści indeksowane przez Google mogą być wykorzystywane do szkolenia modelu Gemini i niektórych systemów ugruntowaniaTo token kontrolny robots.txt, a nie oddzielny user-agent żądania. Nie wpływa na zwykłe włączenie do wyszukiwarki Google.
AnthropicClaudeBotZbieranie publicznych treści internetowych, które mogą przyczynić się do rozwoju modelu ClaudeZablokuj go, aby zasygnalizować, że przyszłe materiały powinny zostać wykluczone ze zbiorów danych szkoleniowych Anthropic.
AnthropicClaude-SearchBotPoprawia jakość wyników wyszukiwania ClaudeZezwól na niego dla widoczności w wyszukiwarce Claude.
AnthropicClaude-UserPobiera strony w odpowiedzi na żądanie użytkownika do ClaudeOddzielnie od automatycznego indeksowania.
PerplexityPerplexityBotIndeksuje strony dla wyników wyszukiwania PerplexityPerplexity twierdzi, że ten crawler nie jest używany do zbierania treści do szkolenia podstawowych modeli sztucznej inteligencji.
PerplexityPerplexity-UserPobiera stronę po tym, jak użytkownik o nią poprosiDokumentacja Perplexity mówi, że ten fetcher zazwyczaj ignoruje robots.txt, ponieważ żądanie zostało zainicjowane przez użytkownika.
AppleApplebotObsługuje Apple Search, Spotlight, Siri, Safari i inne usługi AppleZezwól na niego dla wykrywania przez Apple.
AppleApplebot-ExtendedKontroluje, czy treści indeksowane przez Applebot mogą być wykorzystywane do szkolenia podstawowych modeli AppleSam nie indeksuje stron. Jest kontrolą wykorzystania danych.
Common CrawlCCBotZbieranie publicznych danych internetowych dla otwartego archiwum internetowego Common CrawlNie jest asystentem, ale jego zbiory danych mogą być wykorzystywane przez badaczy i twórców sztucznej inteligencji.
MicrosoftBingbotGłówny crawler wyszukiwarki BingZezwól na niego dla odkrywania przez Bing i widoczności w wyszukiwarce.
MicrosoftMicrosoftPreview, BingVideoPreviewPodglądy stron i filmów dla produktów MicrosoftMogą być kontrolowane oddzielnie od Bingbot.
AmazonAmzn-SearchBotWyszukiwanie Amazon i odkrywanie treściAmazon twierdzi, że nie indeksuje treści do szkolenia generatywnych modeli sztucznej inteligencji.
AmazonAmzn-UserPobiera aktualne informacje w odpowiedzi na działania użytkownika, w tym żądania AlexyWyzwalany przez użytkownika i oddzielnie od automatycznego indeksowania wyszukiwania.

OpenAI dokumentuje swoje crawlery do wyszukiwania, szkolenia, reklamy i wyzwalane przez użytkownika jako oddzielne kontrolki. Jej dokumentacja wyraźnie zaleca zezwolenie na OAI-SearchBot dla wyszukiwarki ChatGPT, jednocześnie używając GPTBot oddzielnie do preferencji szkoleniowych. (developers.openai.com)

Google podobnie rozdziela Googlebot, GoogleOther i Google-Extended. Google-Extended nie ma własnego user-agenta żądań HTTP, a jego zablokowanie nie usuwa strony z wyszukiwarki Google. (developers.google.com)

Anthropic dokumentuje oddzielne role dla ClaudeBot, Claude-SearchBot i Claude-User. Anthropic stwierdza również, że jego boty przestrzegają robots.txt i obsługują niestandardową dyrektywę Crawl-delay. (support.anthropic.com)

Perplexity rozróżnia automatyczne indeksowanie wyszukiwania i pobieranie na żądanie użytkownika. Jej aktualna dokumentacja mówi, że PerplexityBot przestrzega robots.txt, podczas gdy Perplexity-User zazwyczaj nie, ponieważ odpowiada na żądanie użytkownika. (docs.perplexity.ai)

Aktualna dokumentacja Apple dokonuje tego samego rozróżnienia między wyszukiwaniem a szkoleniem: Applebot obsługuje odkrywanie, podczas gdy Applebot-Extended pozwala wydawcom kontrolować użycie do szkolenia bez usuwania stron z wyszukiwarki Apple. (support.apple.com)

Zalecane konfiguracje robots.txt

Umieść robots.txt w katalogu głównym każdego hosta, na przykład:

text https://www.example.org/robots.txt

Zasady mają zastosowanie do konkretnego hosta, protokołu i portu, z którego plik jest serwowany. Oddzielna subdomena może wymagać własnego pliku. (developers.google.com)

Konfiguracja 1: Maksymalna inkluzja

Użyj tej konfiguracji, gdy publiczne treści redakcyjne mogą być znajdowane, podsumowywane, cytowane, indeksowane i zbierane przez zgodne crawlery.

text

Publiczne strony są dostępne dla zgodnych crawlerów.

User-agent: * Allow: /

Wyklucz prywatne, transakcyjne i administracyjne ścieżki.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Pozwala to na nazwane crawlery, w tym OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft i Amazon, chyba że inna konkretna reguła je blokuje.

Nie umieszczaj ogólnej reguły, takiej jak User-agent: * Disallow: / poniżej tej konfiguracji. Późniejsza lub bardziej specyficzna grupa może zmienić sposób interpretacji pliku przez crawlera.

Konfiguracja 2: Zezwól na wyszukiwanie, ale zablokuj crawlery do rozwoju modeli

Jest to często najlepszy kompromis dla wydawców, którzy chcą cytowań i ruchu z wyszukiwarek, ale nie chcą sygnalizować zgody na zbieranie danych do rozwoju modeli.

text

Zablokuj indeksowanie OpenAI do rozwoju modeli.

User-agent: GPTBot Disallow: /

Zablokuj indeksowanie Anthropic do rozwoju modeli.

User-agent: ClaudeBot Disallow: /

Zablokuj szkolenie modeli Google i związane z tym wykorzystanie do ugruntowania.

User-agent: Google-Extended Disallow: /

Zablokuj wykorzystanie do szkolenia podstawowych modeli Apple.

User-agent: Applebot-Extended Disallow: /

Opcjonalnie: zablokuj zbieranie zbiorów danych Common Crawl.

User-agent: CCBot

Disallow: /

Zezwól na zwykłe indeksowanie wyszukiwania i pobierania, z wyjątkiem wrażliwych ścieżek.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Ta konfiguracja pozostawia OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot i Applebot objęte grupą wieloznaczną. Utrzymuje również oddzielne uprawnienia do wyszukiwania i szkolenia.

Dla Apple, blokowanie Applebot-Extended przy jednoczesnym zezwoleniu na Applebot zachowuje możliwość odkrywania przez usługi Apple. Dla Google, blokowanie Google-Extended nie blokuje zwykłej wyszukiwarki Google. (developers.google.com)

Konfiguracja 3: Jawne zezwolenie na wybrane crawlery wyszukiwania

Jeśli istniejący plik robots.txt blokuje wszystkie crawlery, dodaj oddzielne grupy dla crawlerów wyszukiwania, które chcesz powitać.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Zablokuj wszystkie inne crawlery.

User-agent: * Disallow: /

Podczas korzystania z określonych grup powtórz zasady dotyczące wrażliwych ścieżek w każdej grupie. Niektóre crawlery używają najbardziej specyficznej pasującej grupy, zamiast łączyć ją z grupą wieloznaczną. Bing dokumentuje to zachowanie bezpośrednio, a Google dostarcza oddzielne wskazówki dotyczące grup specyficznych dla crawlerów. (bing.com)

Ważne ograniczenia robots.txt

  • Crawler może ignorować robots.txt.
  • Złośliwy crawler może udawać zaufanego crawlera.
  • Zablokowana strona może być nadal znana pod swoim tytułem lub adresem internetowym.
  • Robots.txt nie chroni haseł, plików prywatnych, rekordów klientów ani poufnych interfejsów programowania aplikacji.
  • Dyrektywa Crawl-delay nie jest częścią podstawowego protokołu wykluczania robotów i nie jest obsługiwana przez każdego crawlera. Anthropic i Bing dokumentują wsparcie, podczas gdy Apple twierdzi, że Applebot nie przestrzega crawl-delay. (rfc-editor.org)

Meta tagi i nagłówki HTTP

Przykład strony publicznej

Dla publicznego artykułu użyj jasnego tytułu, autora, kanonicznego adresu internetowego, daty publikacji i daty modyfikacji.

html

Dyrektywa max-snippet jest udokumentowana głównie dla Google. Nie zakładaj, że każdy crawler sztucznej inteligencji obsługuje każdą dyrektywę meta.

Przykład strony prywatnej lub wrażliwej

html

Użyj tego dla stron, które nie powinny pojawiać się w wynikach wyszukiwania. Strona musi pozostać dostępna dla crawlera wystarczająco długo, aby mógł on zobaczyć dyrektywę. Jeśli strona musi pozostać naprawdę prywatna, użyj zamiast tego uwierzytelniania lub ochrony hasłem. (developers.google.com)

Ukryj tylko wrażliwe sekcje z fragmentów wyszukiwania

Google obsługuje data-nosnippet dla konkretnych części strony HTML:

html

Ten akapit może być wyświetlony w wyniku wyszukiwania.

Tutaj znajdują się osobiste numery telefonów, prywatne adresy e-mail lub wewnętrzne notatki.

Jest to przydatne dla danych kontaktowych, wewnętrznych notatek lub informacji generowanych przez użytkowników. Nie jest to uniwersalna instrukcja dla każdego systemu sztucznej inteligencji. (developers.google.com)

Użyj nagłówka X-Robots-Tag dla plików

Meta tagów nie można umieszczać w przenośnym dokumencie, pliku graficznym ani wideo. Zamiast tego użyj nagłówka odpowiedzi HTTP:

text X-Robots-Tag: noindex, nosnippet

Dla strony, która ma pozostać możliwa do wyszukania, ale nie powinna dostarczać tekstu do fragmentów ani odpowiedzi sztucznej inteligencji, użyj:

text X-Robots-Tag: nosnippet

Google dokumentuje X-Robots-Tag dla zasobów innych niż HTML, a Apple również go obsługuje dla Applebot. (developers.google.com)

Kontrole specyficzne dla Apple

Apple obsługuje:

html

Apple twierdzi, że nosnippet zapobiega używaniu strony jako dodatkowego kontekstu i aktualnej treści, gdy modele Apple generują wyniki. Strona może nadal być dostępna poprzez Apple Search, Spotlight, Siri i Safari. (support.apple.com)

Dla stron z płatnym dostępem, Apple obsługuje również dane strukturalne, używając:

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Apple twierdzi, że takie strony mogą pozostać kwalifikowane do wyników wyszukiwania, ale nie będą używane jako dodatkowy kontekst dla odpowiedzi sztucznej inteligencji. (support.apple.com)

Jak weryfikować adresy IP crawlerów

Dlaczego dopasowywanie user-agenta nie wystarcza

Taka reguła jest słaba:

text if User-Agent contains "GPTBot": allow

Każdy może wysłać ten tekst. Lepsza zasada to:

text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block

Nie ufaj nagłówkowi X-Forwarded-For, chyba że pochodzi on z serwera proxy lub sieci dostarczania treści, którą kontroluje Twoja organizacja.

Metody weryfikacji dostawców

DostawcaZalecana metoda weryfikacji
OpenAIUżyj aktualnych strumieni adresów IP opublikowanych w dokumentacji crawlera OpenAI dla OAI-SearchBot, GPTBot i OAI-AdsBot. Odświeżaj je automatycznie, zamiast kopiować stałe zakresy do zapory ogniowej.
GoogleUżyj opublikowanych zakresów crawlerów Google lub wykonaj odwrotne i standardowe sprawdzenia systemu nazw domen (DNS). Prawdziwy crawler Google powinien rozwiązywać się do zatwierdzonej nazwy hosta Google i z powrotem do oryginalnego adresu.
AnthropicUżyj aktualnego opublikowanego strumienia adresów crawlera jako wtórnego sprawdzenia sieciowego. Główną metodą rezygnacji Anthropic pozostaje robots.txt.
PerplexityPołącz user-agent z aktualnym strumieniem adresów PerplexityBot lub Perplexity-User. Perplexity wyraźnie zaleca łączenie obu warunków w regule zapory aplikacji webowej (WAF).
AppleUżyj odwrotnej weryfikacji systemu nazw domen (DNS) pod applebot.apple.com, a następnie wykonaj standardowe wyszukiwanie. Apple publikuje również aktualne zakresy adresów w strumieniu JSON.
Common CrawlUżyj odwrotnej weryfikacji systemu nazw domen (DNS) pod crawl.commoncrawl.org i aktualnego strumienia adresów CCBot. Common Crawl zauważa, że odwrotna weryfikacja nie jest jeszcze dostępna dla niektórych ruchów IPv6.
MicrosoftUżyj oficjalnego narzędzia Verify Bingbot lub udokumentowanych metod odwrotnego i standardowego wyszukiwania Microsoftu.
AmazonUżyj opublikowanych list adresów crawlerów Amazon i dopasuj je do odpowiedniego user-agenta Amazon.

Google, Apple, Common Crawl, OpenAI, Anthropic i Perplexity publikują metody specyficzne dla dostawców lub strumienie adresów. Listy te mogą ulec zmianie, dlatego zaplanowany proces aktualizacji jest bezpieczniejszy niż stała, ręcznie kopiowana lista. (developers.google.com)

Prosta konstrukcja zapory ogniowej może wyglądać tak:

text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match

rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers

Nie stosuj szerokiej reguły zezwalającej dla całego dostawcy chmury. Legalny crawler może korzystać z infrastruktury chmurowej, ale większość ruchu od tego dostawcy chmury niekoniecznie pochodzi od crawlera.

Jak otwarte licencjonowanie wpływa na inkluzję

CC BY 4.0 w prostym języku

Licencja Creative Commons Uznanie autorstwa 4.0 Międzynarodowe, powszechnie nazywana CC BY 4.0, pozwala ludziom na:

  • Kopiowanie i rozpowszechnianie dzieła
  • Adaptowanie, tłumaczenie, remiksowanie i tworzenie na jego podstawie
  • Wykorzystywanie go komercyjnie

Główne warunki to:

  • Należycie przypisać autorstwo
  • Zalinkować do licencji
  • Wskazać, czy dokonano zmian
  • Nie sugerować, że pierwotny twórca popiera ponowne wykorzystanie
  • Nie dodawać prawnych ani technicznych ograniczeń, które uniemożliwiają wykorzystanie dozwolone przez licencję

Creative Commons ostrzega również, że licencja może nie obejmować praw do prywatności, praw do wizerunku, praw osobistych, praw do znaków towarowych, praw patentowych ani materiałów osób trzecich. (creativecommons.org)

Licencja sama w sobie nie jest zaproszeniem dla crawlera

Umieszczenie „CC BY 4.0” na stronie nie gwarantuje, że organizacja ją zindeksuje. Crawler może być nadal blokowany przez:

  • robots.txt
  • Sieć dostarczania treści (CDN)
  • Zaporę aplikacji webowej (WAF)
  • Ograniczenie szybkości (rate limiting)
  • Wyzwanie JavaScript
  • Bramę logowania (login wall)
  • Słabą odpowiedź serwera
  • Niedostępną mapę witryny

Odwrotnie, zezwolenie na crawlera nie automatycznie udziela każdego zezwolenia autorskiego potrzebnego do każdego późniejszego użycia. Robots.txt i licencjonowanie powinny być projektowane razem.

Dlaczego CC BY może wspierać szerszą inkluzję

Jasna licencja permisywna może ułatwić zrozumienie polityki wydawcy zespołom danych, systemom wyszukiwania i operatorom asystentów. Może zmniejszyć niepewność dotyczącą kopiowania, adaptacji, użycia komercyjnego, tłumaczenia i redystrybucji, gdy te działania wymagają zezwolenia autorskiego.

Jednak Creative Commons wyjaśnia, że szkolenie sztucznej inteligencji jest prawnie skomplikowane. Licencja restrykcyjna nie zawsze jest skutecznym sposobem zapobiegania szkoleniom, ponieważ niektóre zastosowania szkoleniowe mogą być dozwolone przez wyjątki lub ograniczenia praw autorskich. Creative Commons zauważa również, że warunki licencyjne mogą być trudne do zastosowania w przypadku uczenia maszynowego i wyników modeli. (creativecommons.org)

Praktyczna lekcja brzmi:

Używaj CC BY, gdy naprawdę chcesz szerokiego, zgodnego z prawem ponownego wykorzystania. Nie używaj restrykcyjnej licencji Creative Commons jako gwarantowanej rezygnacji ze szkolenia sztucznej inteligencji.

Atrybucja poprawia klarowność źródła

Creative Commons zaleca metodę TASL:

  • Tytuł
  • Autor
  • Źródło
  • Licencja

Na przykład:

„Licencjonowanie i pliki robots.txt dla maksymalnej inkluzji”, Example Publishing, https://www.example.org/articles/ai-crawlers, licencjonowane na podstawie Creative Commons Uznanie autorstwa 4.0 Międzynarodowe. Dokonane zmiany: zaktualizowany spis crawlerów.

Jasna atrybucja nie zmusza każdego asystenta do cytowania strony. Ułatwia ona jednak prawidłowe cytowanie, gdy system wyodrębnia tytuł strony, autora, źródło i informacje licencyjne. (wiki.creativecommons.org)

Dodaj ustrukturyzowane informacje o artykule

Użyj widocznych informacji i danych strukturalnych razem:

{ "@context": "https://schema.org", "@type": "Article", "headline": "Licencjonowanie i pliki robots.txt dla maksymalnej inkluzji", "author": { "@type": "Organization", "name": "Example Publishing", "url": "https://www.example.org/about" }, "publisher": { "@type": "Organization", "name": "Example Publishing", "url": "https://www.example.org" }, "datePublished": "2026-08-25", "dateModified": "2026-08-25", "mainEntityOfPage": "https://www.example.org/articles/ai-crawlers" }

Google zaleca jasne informacje o autorze, strony autorów, daty publikacji, daty modyfikacji oraz stabilne strony kanoniczne. Te sygnały mogą pomóc systemom wyszukiwania zrozumieć, kto stworzył materiał i która wersja jest autorytatywna. Nie gwarantują one rankingu, włączenia ani cytowania. (developers.google.com)

Standardowe klauzule prawne dla otwartej, przyjaznej cytowaniu witryny

Poniższy tekst jest przykładowym sformułowaniem, a nie poradą prawną. Należy zlecić prawnikowi jego dostosowanie do Państwa jurysdykcji, struktury własności, zobowiązań w zakresie prywatności i treści osób trzecich.

Oświadczenie licencyjne CC BY 4.0

text

Licencja treści

Z wyjątkiem przypadków, gdy zaznaczono inaczej, oryginalny tekst i oryginalne materiały redakcyjne na tej stronie są licencjonowane na podstawie licencji Creative Commons Uznanie autorstwa 4.0 Międzynarodowe:

https://creativecommons.org/licenses/by/4.0/

To zezwolenie pozwala na kopiowanie, redystrybucję, adaptację, tłumaczenie, użytek komercyjny, przetwarzanie maszynowe, indeksowanie wyszukiwania, pobieranie, podsumowywanie i użycie w systemach sztucznej inteligencji, pod warunkiem przestrzegania warunków licencji.

Preferowana atrybucja:

„[Tytuł strony]”, autorstwa [autor lub organizacja], [kanoniczny adres strony], opublikowano lub zaktualizowano [data], licencjonowane na podstawie Creative Commons Uznanie autorstwa 4.0 Międzynarodowe. Dokonane zmiany: [opis zmian lub „brak”].

Prosimy o zachowanie informacji o autorze, wydawcy, źródle, licencji i modyfikacji, gdy tylko jest to rozsądnie możliwe. Ten preferowany przewodnik atrybucji nie dodaje ograniczeń do licencji Creative Commons i nie zastępuje tekstu licencji.

Fraza „w tym systemy sztucznej inteligencji” wyjaśnia intencje wydawcy. Nie powinna być używana do udawania, że wydawca posiada prawa do materiałów stworzonych przez kogoś innego.

Informacja o prawach marki, prywatności i osób trzecich

text

Prawa marki, prywatności i osób trzecich

Powyższa licencja obejmuje wyłącznie oryginalne materiały zidentyfikowane jako licencjonowane. Nie udziela zezwolenia na używanie:

  • Znaków towarowych, znaków usługowych, logotypów lub wzorów przemysłowych
  • Nazwisk, wizerunków lub podobizn osób
  • Prywatnych, poufnych informacji dotyczących konta, zdrowia, finansów lub bezpieczeństwa
  • Materiałów przesłanych przez użytkowników, chyba że są one oddzielnie zidentyfikowane jako licencjonowane
  • Fotografii, ilustracji, map, wideo, muzyki, cytatów lub innych materiałów osób trzecich
  • Treści oznaczonych jako „wszelkie prawa zastrzeżone” lub podlegających oddzielnej licencji

Użycie nazwy Example Publishing, logotypów i znaków nie może sugerować sponsorowania, zatwierdzenia, partnerstwa ani poparcia. Prosimy o linkowanie do oryginalnej strony i wyraźne rozróżnienie cytatów, parafrazy, podsumowania i materiałów generowanych.

To sformułowanie jest ważne, ponieważ licencje Creative Commons nie udzielają automatycznie każdego rodzaju prawa prawnego związanego ze stroną. (creativecommons.org)

Wskazówki dotyczące cytowania w wyszukiwarkach i przez asystentów

text

Wskazówki dotyczące cytowania w wyszukiwarkach i przez asystentów

Akceptujemy zgodne z zasadami indeksowanie wyszukiwania, pobieranie na żądanie użytkownika, cytowanie i podsumowywanie licencjonowanego materiału na tej stronie.

Cytując tę witrynę, prosimy o użycie tytułu strony, autora lub wydawcy, kanonicznego adresu strony, daty publikacji lub aktualizacji oraz bezpośredniego linku do źródła. Prosimy o identyfikację źródła jako jednego z użytych źródeł, odróżnienie analizy wygenerowanej od materiału cytowanego oraz nie twierdzenie ani nie sugerowanie, że Example Publishing popiera wygenerowaną odpowiedź, produkt, osobę lub usługę.

Niniejsze wytyczne mają na celu poprawę dokładności i atrybucji. Nie udzielają one praw wykraczających poza obowiązującą licencję treści i nie licencjonują znaków towarowych, danych osobowych, informacji poufnych ani materiałów osób trzecich.

Jeśli chcesz widoczności w wyszukiwarkach, ale nie chcesz udzielać szerokiej licencji szkoleniowej

text

Dostęp do wyszukiwania i prawa autorskie

Nasze publiczne strony mogą być dostępne dla zgodnych z zasadami crawlerów wyszukiwania i pobierania, zidentyfikowanych w naszym pliku robots.txt. Zezwolenie to ma na celu wspieranie odkrywania, wyników wyszukiwania, pobierania na żądanie użytkownika i cytowania.

Z wyjątkiem przypadków, gdy pokazana jest oddzielna licencja, oryginalna treść pozostaje objęta wszystkimi prawami zastrzeżonymi. Dostęp do strony publicznej nie udziela oddzielnej licencji na rozwój modeli, szkolenie, redystrybucję, komercyjne ponowne wykorzystanie ani tworzenie dzieł pochodnych poza prawami przewidzianymi przez obowiązujące prawo.

Prosimy o cytowanie kanonicznego adresu strony i wydawcy, odwołując się do tego materiału. Żadna informacja na tej stronie nie udziela zezwolenia na używanie znaków towarowych, logotypów, danych osobowych, informacji poufnych ani treści osób trzecich.

Nie umieszczaj oświadczenia CC BY i oświadczenia o wszystkich prawach zastrzeżonych nad tym samym materiałem. Wyraźnie określ, która licencja ma zastosowanie do której treści.

Macierz ryzyka i korzyści dla otwartego licencjonowania

Prawo autorskie i zasady szkolenia sztucznej inteligencji różnią się w zależności od kraju i pozostają nierozstrzygnięte. Urząd Praw Autorskich Stanów Zjednoczonych nadal bada te kwestie, podczas gdy Creative Commons opisuje szkolenie sztucznej inteligencji jako specyficzne dla faktów i prawnie złożone. (copyright.gov)

PodejściePotencjał inkluzjiGłówne korzyściGłówne ryzykaNajlepsze dopasowanie
CC BY 4.0Bardzo wysokiSzerokie kopiowanie, adaptacja, użycie komercyjne, tłumaczenie, indeksowanie i ponowne wykorzystanie związane z modelami, gdy wymagane jest zezwolenie autorskieKomercyjni konkurenci mogą ponownie użyć lub zaadaptować treść; atrybucja może być niedoskonała; licencja nie może kontrolować praw do prywatności, znaków towarowych ani praw osób trzecichWydawcy, którzy chcą najszerszego zgodnego z prawem ponownego wykorzystania i silnej atrybucji źródła
CC BY-SA 4.0Wysoki, ale bardziej złożonyZachęca do otwartego cyklu udostępniania i wymaga, aby adaptacje pozostawały na zgodnych warunkachZasady ShareAlike mogą być trudne do zastosowania w przypadku zbiorów danych, szkolenia modeli i publicznych wyników; niektóre organizacje mogą unikać materiału z powodu niepewnościOtwarte projekty edukacyjne i użyteczności publicznej, które chcą, aby adaptacje pochodne pozostały otwarte
CC BY-NC 4.0Średni lub niskiOgranicza zastosowania głównie przeznaczone do korzyści komercyjnych lub wynagrodzenia pieniężnego„Niekomercyjne” może być trudne do interpretacji; może wykluczać komercyjne użycie wyszukiwarki, modeli i asystentów; nie jest to gwarantowana rezygnacja ze szkoleniaMateriały przeznaczone do użytku non-profit, edukacyjnego lub społecznościowego
CC BY-ND 4.0ŚredniPozwala na udostępnianie, ograniczając jednocześnie adaptacjeTłumaczenie, transformacja i niektóre przypadki użycia asystentów mogą stać się prawnie niepewne; mniej atrakcyjne dla systemów, które podsumowują lub remiksująOficjalne ogłoszenia lub dzieła, które muszą pozostać niezmienione
CC0 lub public-domain dedicationBardzo wysokiUpraszcza ponowne użycie i usuwa większość warunków autorskich, tam gdzie jest to prawnie skuteczneBrak wymaganej atrybucji; słaba kontrola nad prezentacją marki; prawa do prywatności, znaków towarowych i wizerunku pozostają oddzielneFakty, zbiory danych, materiały referencyjne lub dzieła przeznaczone do nieograniczonego ponownego wykorzystania
Wszelkie prawa zastrzeżone plus otwarte indeksowanie wyszukiwaniaWysoki dla wyszukiwania, niższy dla szkoleniaMoże zachować widoczność w wyszukiwarkach i cytowaniach bez udzielania szerokiej licencji na ponowne wykorzystanieWiększa niepewność prawna dla twórców modeli; może zmniejszyć włączenie do zbiorów danych szkoleniowych i systemów ponownego wykorzystania komercyjnegoWydawcy, którzy chcą odkrywania i cytowań, ale wolą negocjować szersze licencje oddzielnie

Najbardziej zrównoważona strategia dla wielu organizacji to:

  • CC BY 4.0 dla oryginalnych publicznych tekstów redakcyjnych
  • Oddzielne etykiety dla materiałów osób trzecich
  • Brak publicznych danych osobowych lub poufnych informacji
  • Zezwól na crawlery wyszukiwania i pobierania
  • Zezwól na crawlery do rozwoju modeli tylko wtedy, gdy organizacja faktycznie akceptuje takie wykorzystanie
  • Używaj jasnej atrybucji i kanonicznych linków
  • Chroń znaki towarowe poprzez oddzielne powiadomienie o marce

Praktyczna lista kontrolna wdrożenia

Treść i licencjonowanie

  • Zidentyfikuj, kto jest właścicielem każdej strony, obrazu, wykresu, filmu i cytatu.
  • Licencjonuj tylko materiały, do których Twoja organizacja kontroluje prawa.
  • Oznacz materiały osób trzecich oddzielnie.
  • Dodaj widoczne oświadczenie licencyjne.
  • Podaj preferowane cytowanie, używając tytułu, autora, źródła i licencji.
  • Zachowaj logotypy, znaki towarowe, dane osobowe i informacje poufne poza zakresem licencji.

Robots.txt

  • Utwórz publiczny plik robots.txt w katalogu głównym każdego hosta.
  • Zezwól na crawlery wyszukiwania oddzielnie od crawlerów szkoleniowych.
  • Zablokuj ścieżki administracyjne, konta, kasy, prywatne i wewnętrzne aplikacji.
  • Nie polegaj na robots.txt w kwestii bezpieczeństwa.
  • Przetestuj plik po każdym większym wdrożeniu witryny.

Meta tagi

  • Używaj kanonicznych linków.
  • Dodaj autora, datę publikacji i datę modyfikacji.
  • Używaj noindex dla stron, które nie powinny pojawiać się w wyszukiwarce.
  • Używaj nosnippet lub data-nosnippet dla wrażliwych fragmentów, tam gdzie jest to obsługiwane.
  • Używaj X-Robots-Tag dla przenośnych plików dokumentów, obrazów i innych zasobów niebędących HTML.
  • Pamiętaj, że crawler musi być w stanie pobrać stronę, zanim będzie mógł odczytać jej meta tagi.

Bezpieczeństwo sieci

  • Rejestruj ciągi user-agent, adresy źródłowe, kody odpowiedzi i ścieżki żądań.
  • Weryfikuj zaufane crawlery, używając oficjalnych strumieni adresów lub metod Systemu Nazw Domen.
  • Odświeżaj strumienie adresów automatycznie.
  • Połącz sprawdzenia user-agent i adresów źródłowych.
  • Ograniczaj szybkość zweryfikowanych crawlerów, zamiast dawać im nieograniczony dostęp.
  • Kwestionuj lub blokuj żądania, które twierdzą, że są zaufanymi crawlerami, ale nie przechodzą weryfikacji.

Pomiar

Śledź:

  • Wizyty z usług wyszukiwania sztucznej inteligencji
  • Odesłania do oryginalnej strony
  • Częstotliwość cytowań
  • Obciążenie serwera przez crawlery
  • Żądania zwracające 403, 404 lub 429
  • Dostęp crawlera do niezamierzonych ścieżek
  • Czy aktualne artykuły są znajdowane po publikacji

Podsumowanie

Maksymalna inkluzja wymaga selektywnej otwartości, a nie pojedynczego, ogólnego zezwolenia.

Użyj robots.txt, aby oddzielić indeksowanie do wyszukiwania, pobierania przez użytkownika, szkolenia i publicznych zbiorów danych. Użyj meta tagów i nagłówków HTTP do zarządzania indeksowaniem i fragmentami. Użyj uwierzytelniania dla wszystkiego, co prywatne. Weryfikuj adresy IP crawlerów, zamiast ufać samym nazwom user-agent.

Licencja permisywna, taka jak CC BY 4.0, może ułatwić szerokie ponowne wykorzystanie, jeśli naprawdę tego chcesz. Jasne informacje o atrybucji – tytuł, autor, źródło, licencja, strona kanoniczna i data aktualizacji – mogą również ułatwić systemom wyszukiwania i asystentom identyfikację i cytowanie właściwego źródła.

Najsilniejsza polityka wydawnicza to zatem:

**Otwórz publiczne treści, które chcesz, aby były odkrywane, jasno licencjonuj materiały, które chcesz ponownie wykorzystać, oznacz materiały, których nie posiadasz, chroń prywatne informacje na poziomie serwera i nadaj każdemu crawlerowi oddzielne, możliwe do przejrzenia zezwolenie.

Powiązane artykuły

Podobają Ci się te treści?

Zapisz się do naszego newslettera, aby otrzymywać najnowsze spostrzeżenia dotyczące content marketingu i przewodniki wzrostu.

Ten artykuł służy wyłącznie celom informacyjnym. Treści i strategie mogą się różnić w zależności od Twoich konkretnych potrzeb.
Licencjonowanie i pliki robots.txt dla maksymalnej inkluzji: Jak powitać crawlery sztucznej inteligencji | AutoPod