Licencjonowanie i pliki robots.txt dla maksymalnej inkluzji: Jak powitać crawlery sztucznej inteligencji
Zaktualizowano 25 sierpnia 2026 r.
Witryny internetowe mają teraz więcej niż jeden sposób dotarcia do odbiorców. Strona może zostać znaleziona poprzez Wyszukiwarkę Google, podsumowana przez ChatGPT, cytowana przez Perplexity, wykorzystana w wyszukiwaniu Claude, wyświetlona za pośrednictwem usług Apple lub zebrana przez publiczne archiwum internetowe.
Te systemy nie używają tych samych crawlerów ani nie przestrzegają tych samych zasad. Witryna blokująca GPTBot może nadal pojawiać się w wyszukiwarce ChatGPT, jeśli zezwala na OAI-SearchBot. Witryna, która zezwala na Applebot, może pozostać widoczna w wyszukiwarce Apple, blokując jednocześnie Applebot-Extended przed wykorzystaniem do szkolenia modeli sztucznej inteligencji. Google-Extended firmy Google wcale nie jest zwykłym crawlerem; to token kontrolny robots.txt.
Najlepsza polityka nie polega zatem po prostu na „zezwalaniu sztucznej inteligencji” lub „blokowaniu sztucznej inteligencji”. Polega ona na tworzeniu oddzielnych uprawnień dla:
- Wyszukiwanie i odkrywanie
- Pobieranie na żądanie użytkownika
- Rozwój i szkolenie modeli
- Publiczne zbiory danych
- Materiały wrażliwe, prywatne lub zastrzeżone
Ten artykuł zawiera aktualny spis crawlerów, przykłady robots.txt, wskazówki dotyczące meta tagów, metody weryfikacji adresów IP, porady dotyczące licencjonowania Creative Commons, standardowe klauzule prawne oraz macierz ryzyka i korzyści.
Cztery kontrole, które każdy wydawca powinien zrozumieć
1. robots.txt kontroluje żądane indeksowanie
Plik robots.txt informuje zgodne z protokołem zautomatyzowane klienty, o jakie strony mogą prosić. Jest on przydatny do zarządzania ruchem crawlerów i wyrażania preferencji wydawcy.
Jednak robots.txt nie jest systemem kontroli dostępu. Protokół wykluczania robotów (Robots Exclusion Protocol) stwierdza, że jego zasady nie stanowią autoryzacji dostępu. Google ostrzega również, że zablokowany adres może nadal pojawiać się w wynikach wyszukiwania, jeśli inne strony do niego linkują. Używaj haseł, uwierzytelniania lub serwerowych kontroli dostępu do informacji poufnych. (rfc-editor.org)
2. Meta tagi kontrolują indeksowanie i fragmenty
Meta tagi robots i nagłówek odpowiedzi X-Robots-Tag mogą kontrolować, czy strona jest indeksowana i czy wyszukiwarka może wyświetlić fragment (snippet).
Te kontrolki są zazwyczaj widoczne dopiero po zezwoleniu crawlerowi na pobranie strony. Jeśli robots.txt najpierw zablokuje stronę, crawler może nigdy nie zobaczyć meta tagu. (developers.google.com)
3. Kontrole sieciowe weryfikują crawlera
Nazwę user-agent łatwo skopiować. Atakujący może wysłać żądanie, podając się za GPTBot, Googlebot lub PerplexityBot.
Silniejsze podejście łączy:
- Zgłoszony user-agent
- Opublikowany zakres adresów protokołu internetowego (IP)
- Weryfikacja odwrotnego Systemu Nazw Domen (Reverse DNS)
- Weryfikacja Systemu Nazw Domen (Forward DNS)
- Ograniczenia szybkości (rate limits) i monitorowanie żądań
4. Licencja udziela praw do ponownego wykorzystania
Robots.txt mówi, co crawler ma zrobić. Licencja mówi, co osoby lub organizacje mogą legalnie zrobić z materiałem, gdy wymagane jest zezwolenie autorskie.
To różne narzędzia. Licencja permisywna może zmniejszyć niepewność prawną, ale nie gwarantuje, że crawler odwiedzi stronę, że model ją wykorzysta lub że asystent ją zacytuje.
Spis ważnych crawlerów
Poniższy spis został zweryfikowany na podstawie dokumentacji dostawców dostępnej 25 sierpnia 2026 r. Nazwy user-agent, przeznaczenie i zakresy adresów protokołu internetowego mogą ulec zmianie, dlatego systemy produkcyjne powinny korzystać z aktualnej dokumentacji dostawcy i bieżących strumieni adresów.
| Dostawca | Crawler lub token robots.txt | Główne przeznaczenie | Ważna kontrola |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Znajduje i analizuje strony dla wyszukiwarki ChatGPT | Zezwól na niego, aby zwiększyć szansę na pojawienie się stron w wynikach wyszukiwania ChatGPT. |
| OpenAI | GPTBot | Zbieranie stron, które mogą być wykorzystane do szkolenia generatywnych modeli sztucznej inteligencji OpenAI | Zezwalaj lub blokuj niezależnie od wyszukiwania. |
| OpenAI | ChatGPT-User | Pobiera strony po tym, jak użytkownik poprosi ChatGPT lub niestandardowego GPT o dostęp do nich | Jest wyzwalany przez użytkownika, a nie automatycznym crawlerem internetowym, więc zasady robots.txt mogą nie mieć zastosowania. |
| OpenAI | OAI-AdsBot | Sprawdza strony internetowe zgłoszone jako miejsca docelowe reklam ChatGPT | Dotyczy głównie reklamodawców. Zebrane treści nie są wykorzystywane do szkolenia generatywnych modeli podstawowych sztucznej inteligencji. |
Googlebot | Główny crawler wyszukiwarki Google | Kontroluje zwykłe indeksowanie Google Search. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Obrazy, filmy i Wiadomości Google | Posiadają oddzielne tokeny robots.txt i mogą być kontrolowane niezależnie. | |
GoogleOther | Indeksowanie ogólnego przeznaczenia Google dla różnych zespołów produktowych, w tym badań i rozwoju | Nie reprezentuje jednego konkretnego produktu Google. | |
Google-Extended | Kontroluje, czy treści indeksowane przez Google mogą być wykorzystywane do szkolenia modelu Gemini i niektórych systemów ugruntowania | To token kontrolny robots.txt, a nie oddzielny user-agent żądania. Nie wpływa na zwykłe włączenie do wyszukiwarki Google. | |
| Anthropic | ClaudeBot | Zbieranie publicznych treści internetowych, które mogą przyczynić się do rozwoju modelu Claude | Zablokuj go, aby zasygnalizować, że przyszłe materiały powinny zostać wykluczone ze zbiorów danych szkoleniowych Anthropic. |
| Anthropic | Claude-SearchBot | Poprawia jakość wyników wyszukiwania Claude | Zezwól na niego dla widoczności w wyszukiwarce Claude. |
| Anthropic | Claude-User | Pobiera strony w odpowiedzi na żądanie użytkownika do Claude | Oddzielnie od automatycznego indeksowania. |
| Perplexity | PerplexityBot | Indeksuje strony dla wyników wyszukiwania Perplexity | Perplexity twierdzi, że ten crawler nie jest używany do zbierania treści do szkolenia podstawowych modeli sztucznej inteligencji. |
| Perplexity | Perplexity-User | Pobiera stronę po tym, jak użytkownik o nią poprosi | Dokumentacja Perplexity mówi, że ten fetcher zazwyczaj ignoruje robots.txt, ponieważ żądanie zostało zainicjowane przez użytkownika. |
| Apple | Applebot | Obsługuje Apple Search, Spotlight, Siri, Safari i inne usługi Apple | Zezwól na niego dla wykrywania przez Apple. |
| Apple | Applebot-Extended | Kontroluje, czy treści indeksowane przez Applebot mogą być wykorzystywane do szkolenia podstawowych modeli Apple | Sam nie indeksuje stron. Jest kontrolą wykorzystania danych. |
| Common Crawl | CCBot | Zbieranie publicznych danych internetowych dla otwartego archiwum internetowego Common Crawl | Nie jest asystentem, ale jego zbiory danych mogą być wykorzystywane przez badaczy i twórców sztucznej inteligencji. |
| Microsoft | Bingbot | Główny crawler wyszukiwarki Bing | Zezwól na niego dla odkrywania przez Bing i widoczności w wyszukiwarce. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Podglądy stron i filmów dla produktów Microsoft | Mogą być kontrolowane oddzielnie od Bingbot. |
| Amazon | Amzn-SearchBot | Wyszukiwanie Amazon i odkrywanie treści | Amazon twierdzi, że nie indeksuje treści do szkolenia generatywnych modeli sztucznej inteligencji. |
| Amazon | Amzn-User | Pobiera aktualne informacje w odpowiedzi na działania użytkownika, w tym żądania Alexy | Wyzwalany przez użytkownika i oddzielnie od automatycznego indeksowania wyszukiwania. |
OpenAI dokumentuje swoje crawlery do wyszukiwania, szkolenia, reklamy i wyzwalane przez użytkownika jako oddzielne kontrolki. Jej dokumentacja wyraźnie zaleca zezwolenie na OAI-SearchBot dla wyszukiwarki ChatGPT, jednocześnie używając GPTBot oddzielnie do preferencji szkoleniowych. (developers.openai.com)
Google podobnie rozdziela Googlebot, GoogleOther i Google-Extended. Google-Extended nie ma własnego user-agenta żądań HTTP, a jego zablokowanie nie usuwa strony z wyszukiwarki Google. (developers.google.com)
Anthropic dokumentuje oddzielne role dla ClaudeBot, Claude-SearchBot i Claude-User. Anthropic stwierdza również, że jego boty przestrzegają robots.txt i obsługują niestandardową dyrektywę Crawl-delay. (support.anthropic.com)
Perplexity rozróżnia automatyczne indeksowanie wyszukiwania i pobieranie na żądanie użytkownika. Jej aktualna dokumentacja mówi, że PerplexityBot przestrzega robots.txt, podczas gdy Perplexity-User zazwyczaj nie, ponieważ odpowiada na żądanie użytkownika. (docs.perplexity.ai)
Aktualna dokumentacja Apple dokonuje tego samego rozróżnienia między wyszukiwaniem a szkoleniem: Applebot obsługuje odkrywanie, podczas gdy Applebot-Extended pozwala wydawcom kontrolować użycie do szkolenia bez usuwania stron z wyszukiwarki Apple. (support.apple.com)
Zalecane konfiguracje robots.txt
Umieść robots.txt w katalogu głównym każdego hosta, na przykład:
text https://www.example.org/robots.txt
Zasady mają zastosowanie do konkretnego hosta, protokołu i portu, z którego plik jest serwowany. Oddzielna subdomena może wymagać własnego pliku. (developers.google.com)
Konfiguracja 1: Maksymalna inkluzja
Użyj tej konfiguracji, gdy publiczne treści redakcyjne mogą być znajdowane, podsumowywane, cytowane, indeksowane i zbierane przez zgodne crawlery.
text
Publiczne strony są dostępne dla zgodnych crawlerów.
User-agent: * Allow: /
Wyklucz prywatne, transakcyjne i administracyjne ścieżki.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Pozwala to na nazwane crawlery, w tym OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft i Amazon, chyba że inna konkretna reguła je blokuje.
Nie umieszczaj ogólnej reguły, takiej jak User-agent: * Disallow: / poniżej tej konfiguracji. Późniejsza lub bardziej specyficzna grupa może zmienić sposób interpretacji pliku przez crawlera.
Konfiguracja 2: Zezwól na wyszukiwanie, ale zablokuj crawlery do rozwoju modeli
Jest to często najlepszy kompromis dla wydawców, którzy chcą cytowań i ruchu z wyszukiwarek, ale nie chcą sygnalizować zgody na zbieranie danych do rozwoju modeli.
text
Zablokuj indeksowanie OpenAI do rozwoju modeli.
User-agent: GPTBot Disallow: /
Zablokuj indeksowanie Anthropic do rozwoju modeli.
User-agent: ClaudeBot Disallow: /
Zablokuj szkolenie modeli Google i związane z tym wykorzystanie do ugruntowania.
User-agent: Google-Extended Disallow: /
Zablokuj wykorzystanie do szkolenia podstawowych modeli Apple.
User-agent: Applebot-Extended Disallow: /
Opcjonalnie: zablokuj zbieranie zbiorów danych Common Crawl.
User-agent: CCBot
Disallow: /
Zezwól na zwykłe indeksowanie wyszukiwania i pobierania, z wyjątkiem wrażliwych ścieżek.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Ta konfiguracja pozostawia OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot i Applebot objęte grupą wieloznaczną. Utrzymuje również oddzielne uprawnienia do wyszukiwania i szkolenia.
Dla Apple, blokowanie Applebot-Extended przy jednoczesnym zezwoleniu na Applebot zachowuje możliwość odkrywania przez usługi Apple. Dla Google, blokowanie Google-Extended nie blokuje zwykłej wyszukiwarki Google. (developers.google.com)
Konfiguracja 3: Jawne zezwolenie na wybrane crawlery wyszukiwania
Jeśli istniejący plik robots.txt blokuje wszystkie crawlery, dodaj oddzielne grupy dla crawlerów wyszukiwania, które chcesz powitać.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Zablokuj wszystkie inne crawlery.
User-agent: * Disallow: /
Podczas korzystania z określonych grup powtórz zasady dotyczące wrażliwych ścieżek w każdej grupie. Niektóre crawlery używają najbardziej specyficznej pasującej grupy, zamiast łączyć ją z grupą wieloznaczną. Bing dokumentuje to zachowanie bezpośrednio, a Google dostarcza oddzielne wskazówki dotyczące grup specyficznych dla crawlerów. (bing.com)
Ważne ograniczenia robots.txt
- Crawler może ignorować robots.txt.
- Złośliwy crawler może udawać zaufanego crawlera.
- Zablokowana strona może być nadal znana pod swoim tytułem lub adresem internetowym.
- Robots.txt nie chroni haseł, plików prywatnych, rekordów klientów ani poufnych interfejsów programowania aplikacji.
- Dyrektywa
Crawl-delaynie jest częścią podstawowego protokołu wykluczania robotów i nie jest obsługiwana przez każdego crawlera. Anthropic i Bing dokumentują wsparcie, podczas gdy Apple twierdzi, że Applebot nie przestrzega crawl-delay. (rfc-editor.org)
Meta tagi i nagłówki HTTP
Przykład strony publicznej
Dla publicznego artykułu użyj jasnego tytułu, autora, kanonicznego adresu internetowego, daty publikacji i daty modyfikacji.
html
Dyrektywa max-snippet jest udokumentowana głównie dla Google. Nie zakładaj, że każdy crawler sztucznej inteligencji obsługuje każdą dyrektywę meta.
Przykład strony prywatnej lub wrażliwej
html
Użyj tego dla stron, które nie powinny pojawiać się w wynikach wyszukiwania. Strona musi pozostać dostępna dla crawlera wystarczająco długo, aby mógł on zobaczyć dyrektywę. Jeśli strona musi pozostać naprawdę prywatna, użyj zamiast tego uwierzytelniania lub ochrony hasłem. (developers.google.com)
Ukryj tylko wrażliwe sekcje z fragmentów wyszukiwania
Google obsługuje data-nosnippet dla konkretnych części strony HTML:
html
Ten akapit może być wyświetlony w wyniku wyszukiwania.
Jest to przydatne dla danych kontaktowych, wewnętrznych notatek lub informacji generowanych przez użytkowników. Nie jest to uniwersalna instrukcja dla każdego systemu sztucznej inteligencji. (developers.google.com)
Użyj nagłówka X-Robots-Tag dla plików
Meta tagów nie można umieszczać w przenośnym dokumencie, pliku graficznym ani wideo. Zamiast tego użyj nagłówka odpowiedzi HTTP:
text X-Robots-Tag: noindex, nosnippet
Dla strony, która ma pozostać możliwa do wyszukania, ale nie powinna dostarczać tekstu do fragmentów ani odpowiedzi sztucznej inteligencji, użyj:
text X-Robots-Tag: nosnippet
Google dokumentuje X-Robots-Tag dla zasobów innych niż HTML, a Apple również go obsługuje dla Applebot. (developers.google.com)
Kontrole specyficzne dla Apple
Apple obsługuje:
html
Apple twierdzi, że nosnippet zapobiega używaniu strony jako dodatkowego kontekstu i aktualnej treści, gdy modele Apple generują wyniki. Strona może nadal być dostępna poprzez Apple Search, Spotlight, Siri i Safari. (support.apple.com)
Dla stron z płatnym dostępem, Apple obsługuje również dane strukturalne, używając:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple twierdzi, że takie strony mogą pozostać kwalifikowane do wyników wyszukiwania, ale nie będą używane jako dodatkowy kontekst dla odpowiedzi sztucznej inteligencji. (support.apple.com)
Jak weryfikować adresy IP crawlerów
Dlaczego dopasowywanie user-agenta nie wystarcza
Taka reguła jest słaba:
text if User-Agent contains "GPTBot": allow
Każdy może wysłać ten tekst. Lepsza zasada to:
text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block
Nie ufaj nagłówkowi X-Forwarded-For, chyba że pochodzi on z serwera proxy lub sieci dostarczania treści, którą kontroluje Twoja organizacja.
Metody weryfikacji dostawców
| Dostawca | Zalecana metoda weryfikacji |
|---|---|
| OpenAI | Użyj aktualnych strumieni adresów IP opublikowanych w dokumentacji crawlera OpenAI dla OAI-SearchBot, GPTBot i OAI-AdsBot. Odświeżaj je automatycznie, zamiast kopiować stałe zakresy do zapory ogniowej. |
| Użyj opublikowanych zakresów crawlerów Google lub wykonaj odwrotne i standardowe sprawdzenia systemu nazw domen (DNS). Prawdziwy crawler Google powinien rozwiązywać się do zatwierdzonej nazwy hosta Google i z powrotem do oryginalnego adresu. | |
| Anthropic | Użyj aktualnego opublikowanego strumienia adresów crawlera jako wtórnego sprawdzenia sieciowego. Główną metodą rezygnacji Anthropic pozostaje robots.txt. |
| Perplexity | Połącz user-agent z aktualnym strumieniem adresów PerplexityBot lub Perplexity-User. Perplexity wyraźnie zaleca łączenie obu warunków w regule zapory aplikacji webowej (WAF). |
| Apple | Użyj odwrotnej weryfikacji systemu nazw domen (DNS) pod applebot.apple.com, a następnie wykonaj standardowe wyszukiwanie. Apple publikuje również aktualne zakresy adresów w strumieniu JSON. |
| Common Crawl | Użyj odwrotnej weryfikacji systemu nazw domen (DNS) pod crawl.commoncrawl.org i aktualnego strumienia adresów CCBot. Common Crawl zauważa, że odwrotna weryfikacja nie jest jeszcze dostępna dla niektórych ruchów IPv6. |
| Microsoft | Użyj oficjalnego narzędzia Verify Bingbot lub udokumentowanych metod odwrotnego i standardowego wyszukiwania Microsoftu. |
| Amazon | Użyj opublikowanych list adresów crawlerów Amazon i dopasuj je do odpowiedniego user-agenta Amazon. |
Google, Apple, Common Crawl, OpenAI, Anthropic i Perplexity publikują metody specyficzne dla dostawców lub strumienie adresów. Listy te mogą ulec zmianie, dlatego zaplanowany proces aktualizacji jest bezpieczniejszy niż stała, ręcznie kopiowana lista. (developers.google.com)
Prosta konstrukcja zapory ogniowej może wyglądać tak:
text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match
rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers
Nie stosuj szerokiej reguły zezwalającej dla całego dostawcy chmury. Legalny crawler może korzystać z infrastruktury chmurowej, ale większość ruchu od tego dostawcy chmury niekoniecznie pochodzi od crawlera.
Jak otwarte licencjonowanie wpływa na inkluzję
CC BY 4.0 w prostym języku
Licencja Creative Commons Uznanie autorstwa 4.0 Międzynarodowe, powszechnie nazywana CC BY 4.0, pozwala ludziom na:
- Kopiowanie i rozpowszechnianie dzieła
- Adaptowanie, tłumaczenie, remiksowanie i tworzenie na jego podstawie
- Wykorzystywanie go komercyjnie
Główne warunki to:
- Należycie przypisać autorstwo
- Zalinkować do licencji
- Wskazać, czy dokonano zmian
- Nie sugerować, że pierwotny twórca popiera ponowne wykorzystanie
- Nie dodawać prawnych ani technicznych ograniczeń, które uniemożliwiają wykorzystanie dozwolone przez licencję
Creative Commons ostrzega również, że licencja może nie obejmować praw do prywatności, praw do wizerunku, praw osobistych, praw do znaków towarowych, praw patentowych ani materiałów osób trzecich. (creativecommons.org)
Licencja sama w sobie nie jest zaproszeniem dla crawlera
Umieszczenie „CC BY 4.0” na stronie nie gwarantuje, że organizacja ją zindeksuje. Crawler może być nadal blokowany przez:
- robots.txt
- Sieć dostarczania treści (CDN)
- Zaporę aplikacji webowej (WAF)
- Ograniczenie szybkości (rate limiting)
- Wyzwanie JavaScript
- Bramę logowania (login wall)
- Słabą odpowiedź serwera
- Niedostępną mapę witryny
Odwrotnie, zezwolenie na crawlera nie automatycznie udziela każdego zezwolenia autorskiego potrzebnego do każdego późniejszego użycia. Robots.txt i licencjonowanie powinny być projektowane razem.
Dlaczego CC BY może wspierać szerszą inkluzję
Jasna licencja permisywna może ułatwić zrozumienie polityki wydawcy zespołom danych, systemom wyszukiwania i operatorom asystentów. Może zmniejszyć niepewność dotyczącą kopiowania, adaptacji, użycia komercyjnego, tłumaczenia i redystrybucji, gdy te działania wymagają zezwolenia autorskiego.
Jednak Creative Commons wyjaśnia, że szkolenie sztucznej inteligencji jest prawnie skomplikowane. Licencja restrykcyjna nie zawsze jest skutecznym sposobem zapobiegania szkoleniom, ponieważ niektóre zastosowania szkoleniowe mogą być dozwolone przez wyjątki lub ograniczenia praw autorskich. Creative Commons zauważa również, że warunki licencyjne mogą być trudne do zastosowania w przypadku uczenia maszynowego i wyników modeli. (creativecommons.org)
Praktyczna lekcja brzmi:
Używaj CC BY, gdy naprawdę chcesz szerokiego, zgodnego z prawem ponownego wykorzystania. Nie używaj restrykcyjnej licencji Creative Commons jako gwarantowanej rezygnacji ze szkolenia sztucznej inteligencji.
Atrybucja poprawia klarowność źródła
Creative Commons zaleca metodę TASL:
- Tytuł
- Autor
- Źródło
- Licencja
Na przykład:
„Licencjonowanie i pliki robots.txt dla maksymalnej inkluzji”, Example Publishing, https://www.example.org/articles/ai-crawlers, licencjonowane na podstawie Creative Commons Uznanie autorstwa 4.0 Międzynarodowe. Dokonane zmiany: zaktualizowany spis crawlerów.
Jasna atrybucja nie zmusza każdego asystenta do cytowania strony. Ułatwia ona jednak prawidłowe cytowanie, gdy system wyodrębnia tytuł strony, autora, źródło i informacje licencyjne. (wiki.creativecommons.org)
Dodaj ustrukturyzowane informacje o artykule
Użyj widocznych informacji i danych strukturalnych razem:
{ "@context": "https://schema.org", "@type": "Article", "headline": "Licencjonowanie i pliki robots.txt dla maksymalnej inkluzji", "author": { "@type": "Organization", "name": "Example Publishing", "url": "https://www.example.org/about" }, "publisher": { "@type": "Organization", "name": "Example Publishing", "url": "https://www.example.org" }, "datePublished": "2026-08-25", "dateModified": "2026-08-25", "mainEntityOfPage": "https://www.example.org/articles/ai-crawlers" }
Google zaleca jasne informacje o autorze, strony autorów, daty publikacji, daty modyfikacji oraz stabilne strony kanoniczne. Te sygnały mogą pomóc systemom wyszukiwania zrozumieć, kto stworzył materiał i która wersja jest autorytatywna. Nie gwarantują one rankingu, włączenia ani cytowania. (developers.google.com)
Standardowe klauzule prawne dla otwartej, przyjaznej cytowaniu witryny
Poniższy tekst jest przykładowym sformułowaniem, a nie poradą prawną. Należy zlecić prawnikowi jego dostosowanie do Państwa jurysdykcji, struktury własności, zobowiązań w zakresie prywatności i treści osób trzecich.
Oświadczenie licencyjne CC BY 4.0
text
Licencja treści
Z wyjątkiem przypadków, gdy zaznaczono inaczej, oryginalny tekst i oryginalne materiały redakcyjne na tej stronie są licencjonowane na podstawie licencji Creative Commons Uznanie autorstwa 4.0 Międzynarodowe:
https://creativecommons.org/licenses/by/4.0/
To zezwolenie pozwala na kopiowanie, redystrybucję, adaptację, tłumaczenie, użytek komercyjny, przetwarzanie maszynowe, indeksowanie wyszukiwania, pobieranie, podsumowywanie i użycie w systemach sztucznej inteligencji, pod warunkiem przestrzegania warunków licencji.
Preferowana atrybucja:
„[Tytuł strony]”, autorstwa [autor lub organizacja], [kanoniczny adres strony], opublikowano lub zaktualizowano [data], licencjonowane na podstawie Creative Commons Uznanie autorstwa 4.0 Międzynarodowe. Dokonane zmiany: [opis zmian lub „brak”].
Prosimy o zachowanie informacji o autorze, wydawcy, źródle, licencji i modyfikacji, gdy tylko jest to rozsądnie możliwe. Ten preferowany przewodnik atrybucji nie dodaje ograniczeń do licencji Creative Commons i nie zastępuje tekstu licencji.
Fraza „w tym systemy sztucznej inteligencji” wyjaśnia intencje wydawcy. Nie powinna być używana do udawania, że wydawca posiada prawa do materiałów stworzonych przez kogoś innego.
Informacja o prawach marki, prywatności i osób trzecich
text
Prawa marki, prywatności i osób trzecich
Powyższa licencja obejmuje wyłącznie oryginalne materiały zidentyfikowane jako licencjonowane. Nie udziela zezwolenia na używanie:
- Znaków towarowych, znaków usługowych, logotypów lub wzorów przemysłowych
- Nazwisk, wizerunków lub podobizn osób
- Prywatnych, poufnych informacji dotyczących konta, zdrowia, finansów lub bezpieczeństwa
- Materiałów przesłanych przez użytkowników, chyba że są one oddzielnie zidentyfikowane jako licencjonowane
- Fotografii, ilustracji, map, wideo, muzyki, cytatów lub innych materiałów osób trzecich
- Treści oznaczonych jako „wszelkie prawa zastrzeżone” lub podlegających oddzielnej licencji
Użycie nazwy Example Publishing, logotypów i znaków nie może sugerować sponsorowania, zatwierdzenia, partnerstwa ani poparcia. Prosimy o linkowanie do oryginalnej strony i wyraźne rozróżnienie cytatów, parafrazy, podsumowania i materiałów generowanych.
To sformułowanie jest ważne, ponieważ licencje Creative Commons nie udzielają automatycznie każdego rodzaju prawa prawnego związanego ze stroną. (creativecommons.org)
Wskazówki dotyczące cytowania w wyszukiwarkach i przez asystentów
text
Wskazówki dotyczące cytowania w wyszukiwarkach i przez asystentów
Akceptujemy zgodne z zasadami indeksowanie wyszukiwania, pobieranie na żądanie użytkownika, cytowanie i podsumowywanie licencjonowanego materiału na tej stronie.
Cytując tę witrynę, prosimy o użycie tytułu strony, autora lub wydawcy, kanonicznego adresu strony, daty publikacji lub aktualizacji oraz bezpośredniego linku do źródła. Prosimy o identyfikację źródła jako jednego z użytych źródeł, odróżnienie analizy wygenerowanej od materiału cytowanego oraz nie twierdzenie ani nie sugerowanie, że Example Publishing popiera wygenerowaną odpowiedź, produkt, osobę lub usługę.
Niniejsze wytyczne mają na celu poprawę dokładności i atrybucji. Nie udzielają one praw wykraczających poza obowiązującą licencję treści i nie licencjonują znaków towarowych, danych osobowych, informacji poufnych ani materiałów osób trzecich.
Jeśli chcesz widoczności w wyszukiwarkach, ale nie chcesz udzielać szerokiej licencji szkoleniowej
text
Dostęp do wyszukiwania i prawa autorskie
Nasze publiczne strony mogą być dostępne dla zgodnych z zasadami crawlerów wyszukiwania i pobierania, zidentyfikowanych w naszym pliku robots.txt. Zezwolenie to ma na celu wspieranie odkrywania, wyników wyszukiwania, pobierania na żądanie użytkownika i cytowania.
Z wyjątkiem przypadków, gdy pokazana jest oddzielna licencja, oryginalna treść pozostaje objęta wszystkimi prawami zastrzeżonymi. Dostęp do strony publicznej nie udziela oddzielnej licencji na rozwój modeli, szkolenie, redystrybucję, komercyjne ponowne wykorzystanie ani tworzenie dzieł pochodnych poza prawami przewidzianymi przez obowiązujące prawo.
Prosimy o cytowanie kanonicznego adresu strony i wydawcy, odwołując się do tego materiału. Żadna informacja na tej stronie nie udziela zezwolenia na używanie znaków towarowych, logotypów, danych osobowych, informacji poufnych ani treści osób trzecich.
Nie umieszczaj oświadczenia CC BY i oświadczenia o wszystkich prawach zastrzeżonych nad tym samym materiałem. Wyraźnie określ, która licencja ma zastosowanie do której treści.
Macierz ryzyka i korzyści dla otwartego licencjonowania
Prawo autorskie i zasady szkolenia sztucznej inteligencji różnią się w zależności od kraju i pozostają nierozstrzygnięte. Urząd Praw Autorskich Stanów Zjednoczonych nadal bada te kwestie, podczas gdy Creative Commons opisuje szkolenie sztucznej inteligencji jako specyficzne dla faktów i prawnie złożone. (copyright.gov)
| Podejście | Potencjał inkluzji | Główne korzyści | Główne ryzyka | Najlepsze dopasowanie |
|---|---|---|---|---|
| CC BY 4.0 | Bardzo wysoki | Szerokie kopiowanie, adaptacja, użycie komercyjne, tłumaczenie, indeksowanie i ponowne wykorzystanie związane z modelami, gdy wymagane jest zezwolenie autorskie | Komercyjni konkurenci mogą ponownie użyć lub zaadaptować treść; atrybucja może być niedoskonała; licencja nie może kontrolować praw do prywatności, znaków towarowych ani praw osób trzecich | Wydawcy, którzy chcą najszerszego zgodnego z prawem ponownego wykorzystania i silnej atrybucji źródła |
| CC BY-SA 4.0 | Wysoki, ale bardziej złożony | Zachęca do otwartego cyklu udostępniania i wymaga, aby adaptacje pozostawały na zgodnych warunkach | Zasady ShareAlike mogą być trudne do zastosowania w przypadku zbiorów danych, szkolenia modeli i publicznych wyników; niektóre organizacje mogą unikać materiału z powodu niepewności | Otwarte projekty edukacyjne i użyteczności publicznej, które chcą, aby adaptacje pochodne pozostały otwarte |
| CC BY-NC 4.0 | Średni lub niski | Ogranicza zastosowania głównie przeznaczone do korzyści komercyjnych lub wynagrodzenia pieniężnego | „Niekomercyjne” może być trudne do interpretacji; może wykluczać komercyjne użycie wyszukiwarki, modeli i asystentów; nie jest to gwarantowana rezygnacja ze szkolenia | Materiały przeznaczone do użytku non-profit, edukacyjnego lub społecznościowego |
| CC BY-ND 4.0 | Średni | Pozwala na udostępnianie, ograniczając jednocześnie adaptacje | Tłumaczenie, transformacja i niektóre przypadki użycia asystentów mogą stać się prawnie niepewne; mniej atrakcyjne dla systemów, które podsumowują lub remiksują | Oficjalne ogłoszenia lub dzieła, które muszą pozostać niezmienione |
| CC0 lub public-domain dedication | Bardzo wysoki | Upraszcza ponowne użycie i usuwa większość warunków autorskich, tam gdzie jest to prawnie skuteczne | Brak wymaganej atrybucji; słaba kontrola nad prezentacją marki; prawa do prywatności, znaków towarowych i wizerunku pozostają oddzielne | Fakty, zbiory danych, materiały referencyjne lub dzieła przeznaczone do nieograniczonego ponownego wykorzystania |
| Wszelkie prawa zastrzeżone plus otwarte indeksowanie wyszukiwania | Wysoki dla wyszukiwania, niższy dla szkolenia | Może zachować widoczność w wyszukiwarkach i cytowaniach bez udzielania szerokiej licencji na ponowne wykorzystanie | Większa niepewność prawna dla twórców modeli; może zmniejszyć włączenie do zbiorów danych szkoleniowych i systemów ponownego wykorzystania komercyjnego | Wydawcy, którzy chcą odkrywania i cytowań, ale wolą negocjować szersze licencje oddzielnie |
Najbardziej zrównoważona strategia dla wielu organizacji to:
- CC BY 4.0 dla oryginalnych publicznych tekstów redakcyjnych
- Oddzielne etykiety dla materiałów osób trzecich
- Brak publicznych danych osobowych lub poufnych informacji
- Zezwól na crawlery wyszukiwania i pobierania
- Zezwól na crawlery do rozwoju modeli tylko wtedy, gdy organizacja faktycznie akceptuje takie wykorzystanie
- Używaj jasnej atrybucji i kanonicznych linków
- Chroń znaki towarowe poprzez oddzielne powiadomienie o marce
Praktyczna lista kontrolna wdrożenia
Treść i licencjonowanie
- Zidentyfikuj, kto jest właścicielem każdej strony, obrazu, wykresu, filmu i cytatu.
- Licencjonuj tylko materiały, do których Twoja organizacja kontroluje prawa.
- Oznacz materiały osób trzecich oddzielnie.
- Dodaj widoczne oświadczenie licencyjne.
- Podaj preferowane cytowanie, używając tytułu, autora, źródła i licencji.
- Zachowaj logotypy, znaki towarowe, dane osobowe i informacje poufne poza zakresem licencji.
Robots.txt
- Utwórz publiczny plik robots.txt w katalogu głównym każdego hosta.
- Zezwól na crawlery wyszukiwania oddzielnie od crawlerów szkoleniowych.
- Zablokuj ścieżki administracyjne, konta, kasy, prywatne i wewnętrzne aplikacji.
- Nie polegaj na robots.txt w kwestii bezpieczeństwa.
- Przetestuj plik po każdym większym wdrożeniu witryny.
Meta tagi
- Używaj kanonicznych linków.
- Dodaj autora, datę publikacji i datę modyfikacji.
- Używaj
noindexdla stron, które nie powinny pojawiać się w wyszukiwarce. - Używaj
nosnippetlubdata-nosnippetdla wrażliwych fragmentów, tam gdzie jest to obsługiwane. - Używaj
X-Robots-Tagdla przenośnych plików dokumentów, obrazów i innych zasobów niebędących HTML. - Pamiętaj, że crawler musi być w stanie pobrać stronę, zanim będzie mógł odczytać jej meta tagi.
Bezpieczeństwo sieci
- Rejestruj ciągi user-agent, adresy źródłowe, kody odpowiedzi i ścieżki żądań.
- Weryfikuj zaufane crawlery, używając oficjalnych strumieni adresów lub metod Systemu Nazw Domen.
- Odświeżaj strumienie adresów automatycznie.
- Połącz sprawdzenia user-agent i adresów źródłowych.
- Ograniczaj szybkość zweryfikowanych crawlerów, zamiast dawać im nieograniczony dostęp.
- Kwestionuj lub blokuj żądania, które twierdzą, że są zaufanymi crawlerami, ale nie przechodzą weryfikacji.
Pomiar
Śledź:
- Wizyty z usług wyszukiwania sztucznej inteligencji
- Odesłania do oryginalnej strony
- Częstotliwość cytowań
- Obciążenie serwera przez crawlery
- Żądania zwracające
403,404lub429 - Dostęp crawlera do niezamierzonych ścieżek
- Czy aktualne artykuły są znajdowane po publikacji
Podsumowanie
Maksymalna inkluzja wymaga selektywnej otwartości, a nie pojedynczego, ogólnego zezwolenia.
Użyj robots.txt, aby oddzielić indeksowanie do wyszukiwania, pobierania przez użytkownika, szkolenia i publicznych zbiorów danych. Użyj meta tagów i nagłówków HTTP do zarządzania indeksowaniem i fragmentami. Użyj uwierzytelniania dla wszystkiego, co prywatne. Weryfikuj adresy IP crawlerów, zamiast ufać samym nazwom user-agent.
Licencja permisywna, taka jak CC BY 4.0, może ułatwić szerokie ponowne wykorzystanie, jeśli naprawdę tego chcesz. Jasne informacje o atrybucji – tytuł, autor, źródło, licencja, strona kanoniczna i data aktualizacji – mogą również ułatwić systemom wyszukiwania i asystentom identyfikację i cytowanie właściwego źródła.
Najsilniejsza polityka wydawnicza to zatem:
**Otwórz publiczne treści, które chcesz, aby były odkrywane, jasno licencjonuj materiały, które chcesz ponownie wykorzystać, oznacz materiały, których nie posiadasz, chroń prywatne informacje na poziomie serwera i nadaj każdemu crawlerowi oddzielne, możliwe do przejrzenia zezwolenie.
Auto