AutoPodAutoPod

Licencování a roboti pro maximální inkluzi: Jak přivítat prohledávače s umělou inteligencí

22 min čtení
Audio článek
Licencování a roboti pro maximální inkluzi: Jak přivítat prohledávače s umělou inteligencí
0:000:00
Licencování a roboti pro maximální inkluzi: Jak přivítat prohledávače s umělou inteligencí

Licencování a roboti pro maximální inkluzi: Jak přivítat prohledávače s umělou inteligencí

Aktualizováno 25. srpna 2026

Webové stránky nyní mají více než jeden způsob, jak oslovit publikum. Stránka může být nalezena prostřednictvím Vyhledávání Google, shrnuta ChatGPT, citována Perplexity, použita ve vyhledávání Claude, zobrazena prostřednictvím služeb Apple nebo shromážděna veřejným webovým archivem.

Tyto systémy nepoužívají všechny stejného prohledávače ani se neřídí stejnými pravidly. Webová stránka, která blokuje GPTBot, se stále může objevit ve vyhledávání ChatGPT, pokud povolí OAI-SearchBot. Webová stránka, která povoluje Applebot, může zůstat viditelná ve Vyhledávání Apple a zároveň blokovat Applebot-Extended pro trénování modelů umělé inteligence. Google Google-Extended vůbec není běžným prohledávačem; je to řídicí token robots.txt.

Nejlepší politikou proto není jednoduše „povolit umělou inteligenci“ nebo „blokovat umělou inteligenci“. Je třeba vytvořit samostatná oprávnění pro:

  1. Vyhledávání a objevování
  2. Uživatelem požadované načítání
  3. Vývoj a trénování modelů
  4. Veřejné datové sady
  5. Citlivý, soukromý nebo omezený materiál

Tento článek poskytuje aktuální inventář prohledávačů, příklady robots.txt, pokyny pro meta tagy, metody ověřování IP adres, doporučení pro licencování Creative Commons, právní šablony a matici rizik a přínosů.

Čtyři ovládací prvky, které by měl každý vydavatel znát

1. robots.txt řídí požadované prohledávání

Soubor robots.txt sděluje vyhovujícím automatizovaným klientům, které stránky mohou požadovat. Je užitečný pro správu provozu prohledávačů a vyjádření preferencí vydavatele.

Robots.txt však není systémem kontroly přístupu. Protokol Robots Exclusion Protocol uvádí, že jeho pravidla nejsou autorizací přístupu. Google také varuje, že blokovaná adresa se stále může objevit ve výsledcích vyhledávání, pokud na ni odkazují jiné stránky. Pro důvěrné informace použijte hesla, ověřování nebo serverové kontroly přístupu. (rfc-editor.org)

2. Meta tagy řídí indexování a úryvky

Robots meta tagy a hlavička odpovědi X-Robots-Tag mohou řídit, zda bude stránka indexována nebo zda vyhledávač může zobrazit úryvek.

Tyto ovládací prvky jsou normálně viditelné až poté, co bylo prohledávači povoleno stránku načíst. Pokud robots.txt stránku nejprve blokuje, prohledávač meta tag možná nikdy neuvidí. (developers.google.com)

3. Síťové kontroly ověřují prohledávač

Jméno uživatelského agenta je snadné zkopírovat. Útočník může poslat požadavek, který tvrdí, že je GPTBot, Googlebot nebo PerplexityBot.

Silnější přístup kombinuje:

  • Prohlašovaný uživatelský agent
  • Zveřejněný rozsah IP adres
  • Ověření reverzního systému doménových jmen (Reverse Domain Name System)
  • Ověření dopředného systému doménových jmen (Forward Domain Name System)
  • Omezení rychlosti a monitorování požadavků

4. Licence uděluje práva k opětovnému použití

Robots.txt říká, co má prohledávač dělat. Licence říká, co mohou lidé nebo organizace legálně dělat s materiálem, když je vyžadován souhlas s autorskými právy.

Jedná se o různé nástroje. Permisivní licence může snížit právní nejistotu, ale nezaručuje, že prohledávač stránku navštíví, že ji model použije, nebo že ji asistent cituje.

Inventář důležitých prohledávačů

Následující inventář byl zkontrolován oproti dokumentaci poskytovatele dostupné 25. srpna 2026. Názvy uživatelských agentů, účely a rozsahy IP adres se mohou měnit, takže produkční systémy by měly používat aktuální dokumentaci poskytovatele a živé zdroje adres.

PoskytovatelProhledávač nebo token robots.txtHlavní účelDůležitá kontrola
OpenAIOAI-SearchBotNajde a analyzuje stránky pro vyhledávání ChatGPTPovolte jej pro zvýšení šance, že se stránky objeví ve výsledcích vyhledávání ChatGPT.
OpenAIGPTBotShromažďuje stránky, které mohou být použity pro trénování generativních modelů umělé inteligence OpenAIPovolit nebo zakázat odděleně od vyhledávání.
OpenAIChatGPT-UserNačítá stránky poté, co uživatel požádá ChatGPT nebo vlastní GPT o přístup k nimJe spuštěn uživatelem, nikoli automatickým webovým prohledávačem, takže pravidla robots.txt se nemusí uplatňovat.
OpenAIOAI-AdsBotKontroluje webové stránky odeslané jako reklamní cíle ChatGPTRelevantní hlavně pro inzerenty. Shromážděný obsah se nepoužívá k trénování generativních základních modelů umělé inteligence.
GoogleGooglebotHlavní prohledávač Vyhledávání GoogleŘídí běžné prohledávání Vyhledávání Google.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-NewsObrázky, videa a Zprávy GoogleTyto mají samostatné tokeny robots.txt a lze je ovládat nezávisle.
GoogleGoogleOtherObecné prohledávání Google pro různé produktové týmy, včetně výzkumu a vývojeNepředstavuje jeden konkrétní produkt Google.
GoogleGoogle-ExtendedŘídí, zda může být obsah prohledávaný Googlem použit pro trénování modelu Gemini a určité systémy uzemněníJe to řídicí token robots.txt, nikoli samostatný uživatelský agent požadavku. Nemá vliv na běžnou inkluzi ve Vyhledávání Google.
AnthropicClaudeBotShromažďuje veřejný webový obsah, který může přispět k vývoji modelu ClaudeZakažte jej, abyste signalizovali, že budoucí materiál by měl být vyloučen z tréninkových datových sad Anthropic.
AnthropicClaude-SearchBotZlepšuje kvalitu výsledků vyhledávání ClaudePovolte jej pro viditelnost ve vyhledávání Claude.
AnthropicClaude-UserNačítá stránky v reakci na požadavek uživatele na ClaudeOdděleně od automatického prohledávání.
PerplexityPerplexityBotIndexuje stránky pro výsledky vyhledávání PerplexityPerplexity uvádí, že tento prohledávač se nepoužívá ke shromažďování obsahu pro trénování základních modelů umělé inteligence.
PerplexityPerplexity-UserNačítá stránku poté, co ji uživatel požádáDokumentace Perplexity uvádí, že tento načítací program obecně ignoruje robots.txt, protože požadavek byl iniciován uživatelem.
AppleApplebotPodporuje Apple Search, Spotlight, Siri, Safari a další prostředí ApplePovolte jej pro objevování Apple.
AppleApplebot-ExtendedŘídí, zda může být obsah prohledávaný Applebotem použit k trénování základních modelů AppleSám stránky neprohledává. Je to kontrola použití dat.
Common CrawlCCBotShromažďuje veřejná webová data pro otevřený webový archiv Common CrawlNení to asistent, ale jeho datové sady mohou být použity výzkumníky a vývojáři umělé inteligence.
MicrosoftBingbotHlavní prohledávač vyhledávání BingPovolte jej pro objevování a viditelnost ve vyhledávání Bing.
MicrosoftMicrosoftPreview, BingVideoPreviewNáhledy stránek a videí pro produkty MicrosoftTyto lze ovládat odděleně od Bingbotu.
AmazonAmzn-SearchBotVyhledávání a objevování obsahu AmazonAmazon uvádí, že neprohledává obsah pro trénování generativních modelů umělé inteligence.
AmazonAmzn-UserNačítá aktuální informace v reakci na uživatelské akce, včetně požadavků AlexaSpuštěno uživatelem a odděleně od automatického prohledávání vyhledávání.

OpenAI dokumentuje své prohledávače pro vyhledávání, trénování, reklamu a uživatelem spouštěné prohledávače jako samostatné ovládací prvky. Jeho dokumentace konkrétně doporučuje povolení OAI-SearchBot pro vyhledávání ChatGPT a zároveň samostatné použití GPTBot pro preference trénování. (developers.openai.com)

Google podobně odděluje Googlebot, GoogleOther a Google-Extended. Google-Extended nemá vlastního uživatelského agenta pro HTTP požadavky a jeho blokování neodstraní stránku z Vyhledávání Google. (developers.google.com)

Anthropic dokumentuje samostatné role pro ClaudeBot, Claude-SearchBot a Claude-User. Anthropic také uvádí, že jeho roboti dodržují robots.txt a podporují nestandardní direktivu Crawl-delay. (support.anthropic.com)

Perplexity rozlišuje mezi automatickým prohledáváním vyhledávání a uživatelem požadovaným načítáním. Jeho aktuální dokumentace uvádí, že PerplexityBot respektuje robots.txt, zatímco Perplexity-User obecně ne, protože reaguje na uživatelský požadavek. (docs.perplexity.ai)

Aktuální dokumentace Apple činí stejné rozlišení mezi vyhledáváním a trénováním: Applebot podporuje objevování, zatímco Applebot-Extended umožňuje vydavatelům kontrolovat použití pro trénování, aniž by se stránky odstranily z Vyhledávání Apple. (support.apple.com)

Doporučené konfigurace robots.txt

Soubor robots.txt umístěte do kořenového adresáře každého hostitele, například:

text https://www.example.org/robots.txt

Pravidla se vztahují na konkrétního hostitele, protokol a port, na kterém je soubor obsluhován. Samostatná subdoména může potřebovat svůj vlastní soubor. (developers.google.com)

Konfigurace 1: Maximální inkluze

Tuto konfiguraci použijte, když veřejný redakční obsah může být nalezen, shrnut, citován, indexován a shromažďován vyhovujícími prohledávači.

text

Veřejné stránky jsou dostupné vyhovujícím prohledávačům.

User-agent: * Allow: /

Udržujte soukromé, transakční a administrativní cesty mimo.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

To umožňuje pojmenovaným prohledávačům, včetně OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft a Amazon, pokud je jiné specifické pravidlo neblokuje.

Pod tuto konfiguraci neumisťujte obecné pravidlo, jako je User-agent: * Disallow: /. Pozdější nebo specifičtější skupina může změnit, jak prohledávač soubor interpretuje.

Konfigurace 2: Povolit vyhledávání, ale blokovat prohledávače pro vývoj modelů

To je často nejlepší kompromis pro vydavatele, kteří chtějí citace a návštěvnost z vyhledávání, ale nechtějí signalizovat povolení pro shromažďování pro vývoj modelů.

text

Blokovat prohledávání pro vývoj modelu OpenAI.

User-agent: GPTBot Disallow: /

Blokovat prohledávání pro vývoj modelu Anthropic.

User-agent: ClaudeBot Disallow: /

Blokovat trénování modelu Google a související uzemňující použití.

User-agent: Google-Extended Disallow: /

Blokovat použití pro trénování základního modelu Apple.

User-agent: Applebot-Extended Disallow: /

Volitelné: blokovat shromažďování datové sady Common Crawl.

User-agent: CCBot

Disallow: /

Povolit běžné prohledávání vyhledávání a načítání, kromě citlivých cest.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Tato konfigurace ponechává OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot a Applebot pokryté zástupnou skupinou. Také udržuje oprávnění pro vyhledávání a trénování oddělená.

Pro Apple, blokování Applebot-Extended a zároveň povolení Applebotu zachovává objevování prostřednictvím služeb Apple. Pro Google, blokování Google-Extended neblokuje běžné Vyhledávání Google. (developers.google.com)

Konfigurace 3: Explicitně povolit vybrané prohledávače pro vyhledávání

Pokud stávající soubor robots.txt blokuje všechny prohledávače, přidejte samostatné skupiny pro prohledávače vyhledávání, které chcete přivítat.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Ostatní prohledávače držte mimo.

User-agent: * Disallow: /

Při použití specifických skupin opakujte pravidla pro citlivé cesty uvnitř každé skupiny. Některé prohledávače používají nejpřesnější odpovídající skupinu, spíše než aby ji kombinovaly se zástupnou skupinou. Bing toto chování dokumentuje přímo a Google poskytuje samostatné pokyny pro skupiny specifické pro prohledávače. (bing.com)

Důležitá omezení robots.txt

  • Prohledávač může ignorovat robots.txt.
  • Záludný prohledávač se může vydávat za důvěryhodného prohledávače.
  • Blokovaná stránka může být stále známa svým názvem nebo webovou adresou.
  • Robots.txt nechrání hesla, soukromé soubory, záznamy zákazníků ani důvěrná rozhraní pro programování aplikací.
  • Direktiva Crawl-delay není součástí jádra protokolu Robots Exclusion Protocol a není podporována každým prohledávačem. Anthropic a Bing dokumentují podporu, zatímco Apple uvádí, že Applebot nedodržuje crawl-delay. (rfc-editor.org)

Meta tagy a HTTP hlavičky

Příklad veřejné stránky

Pro veřejný článek použijte jasný název, autora, kanonickou webovou adresu, datum publikace a datum úpravy.

html

Direktiva max-snippet je primárně dokumentována pro Google. Nepředpokládejte, že každý prohledávač umělé inteligence podporuje každou meta direktivu.

Příklad soukromé nebo citlivé stránky

html

Toto použijte pro stránky, které by se neměly objevovat ve výsledcích vyhledávání. Stránka musí zůstat prohledávatelná dostatečně dlouho, aby prohledávač direktivu viděl. Pokud stránka musí skutečně zůstat soukromá, použijte místo toho ověřování nebo ochranu heslem. (developers.google.com)

Skrýt pouze citlivé sekce z úryvků vyhledávání

Google podporuje data-nosnippet pro konkrétní části HTML stránky:

html

This paragraph may be shown in a search result.

Personal telephone numbers, private email addresses, or internal notes go here.

Toto je užitečné pro kontaktní údaje, interní poznámky nebo uživatelem generované informace. Není to univerzální instrukce pro každý systém umělé inteligence. (developers.google.com)

Použijte hlavičku X-Robots-Tag pro soubory

Meta tagy nelze umístit do souboru PDF, obrázku nebo video souboru. Místo toho použijte hlavičku HTTP odpovědi:

text X-Robots-Tag: noindex, nosnippet

Pro stránku, která by měla zůstat prohledávatelná, ale neměla by poskytovat text pro úryvky nebo odpovědi umělé inteligence, použijte:

text X-Robots-Tag: nosnippet

Google dokumentuje X-Robots-Tag pro ne-HTML zdroje a Apple jej podporuje také pro Applebot. (developers.google.com)

Ovládací prvky specifické pro Apple

Apple podporuje:

html

Apple uvádí, že nosnippet brání použití stránky jako dodatečného kontextu a aktuálního obsahu, když modely Apple generují výstup. Stránka může stále zůstat zjistitelná prostřednictvím Apple Search, Spotlight, Siri a Safari. (support.apple.com)

Pro stránky s platbou Apple také podporuje strukturovaná data pomocí:

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Apple uvádí, že takové stránky mohou zůstat způsobilé pro výsledky vyhledávání, ale nebudou použity jako dodatečný kontext pro odpovědi umělé inteligence. (support.apple.com)

Jak ověřit IP adresy prohledávačů

Proč shoda uživatelského agenta nestačí

Pravidlo jako toto je slabé:

text if User-Agent contains "GPTBot": allow

Tento text může poslat kdokoli. Lepší pravidlo je:

text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block

Důvěřujte hlavičce X-Forwarded-For pouze v případě, že pochází z proxy nebo sítě pro doručování obsahu (CDN), kterou vaše organizace kontroluje.

Metody ověření poskytovatelem

PoskytovatelDoporučená metoda ověření
OpenAIPoužijte živé zdroje IP adres zveřejněné v dokumentaci prohledávače OpenAI pro OAI-SearchBot, GPTBot a OAI-AdsBot. Obnovujte je automaticky, spíše než kopírovat pevné rozsahy do firewallu.
GooglePoužijte zveřejněné rozsahy prohledávačů Google nebo proveďte kontrolu reverzního a dopředného systému doménových jmen (Domain Name System). Pravý prohledávač Google by se měl přeložit na schválený název hostitele Google a zpět na původní adresu.
AnthropicPoužijte aktuální zveřejněný zdroj adres prohledávače jako sekundární síťovou kontrolu. Primární metoda odhlášení Anthropicu zůstává robots.txt.
PerplexityZkombinujte uživatelského agenta s aktuálním zdrojem adres PerplexityBot nebo Perplexity-User. Perplexity konkrétně doporučuje kombinovat obě podmínky v pravidle Web Application Firewall.
ApplePoužijte ověření reverzního systému doménových jmen pod applebot.apple.com, poté proveďte dopředné vyhledávání. Apple také zveřejňuje aktuální rozsahy adres v JSON zdroji.
Common CrawlPoužijte ověření reverzního systému doménových jmen pod crawl.commoncrawl.org a aktuální zdroj adres CCBot. Common Crawl poznamenává, že reverzní ověření zatím není dostupné pro některé IPv6 provoz.
MicrosoftPoužijte oficiální nástroj Verify Bingbot nebo dokumentované metody reverzního a dopředného vyhledávání Microsoftu.
AmazonPoužijte zveřejněné seznamy adres prohledávačů Amazonu a spárujte je s příslušným uživatelským agentem Amazonu.

Google, Apple, Common Crawl, OpenAI, Anthropic a Perplexity – všichni zveřejňují metody specifické pro poskytovatele nebo zdroje adres. Tyto seznamy se mohou měnit, takže plánovaný proces aktualizace je bezpečnější než trvalý ručně zkopírovaný seznam. (developers.google.com)

Jednoduchý návrh firewallu by mohl vypadat takto:

text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match

rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers

Neaplikujte široké pravidlo povolení na celého poskytovatele cloudu. Legitimní prohledávač může používat cloudovou infrastrukturu, ale většina provozu od tohoto poskytovatele cloudu nemusí nutně být prohledávač.

Jak otevřené licencování ovlivňuje inkluzi

CC BY 4.0 v běžném jazyce

Mezinárodní licence Creative Commons Uveďte původ 4.0, běžně nazývaná CC BY 4.0, umožňuje lidem:

  • Kopírovat a redistribuovat dílo
  • Přizpůsobovat, překládat, remixovat a stavět na něm
  • Používat jej komerčně

Hlavní podmínky jsou:

  • Uvést příslušný původ
  • Odkazovat na licenci
  • Uvést, zda byly provedeny změny
  • Nenaznačovat, že původní tvůrce schvaluje opětovné použití
  • Nepřidávat právní nebo technická omezení, která brání použití povolenému licencí

Creative Commons také varuje, že licence nemusí pokrývat práva na soukromí, práva na publicitu, morální práva, práva k ochranným známkám, patentová práva nebo materiál třetích stran. (creativecommons.org)

Samotná licence není pozvánkou pro prohledávač

Umístění „CC BY 4.0“ na stránku nezaručuje, že ji organizace prohledá. Prohledávač může být stále blokován:

  • robots.txt
  • Sítí pro doručování obsahu (CDN)
  • Web Application Firewall (WAF)
  • Omezením rychlosti
  • JavaScriptovou výzvou
  • Přihlašovací zdí
  • Špatnou odezvou serveru
  • Nepřístupnou mapou stránek

Naopak, povolení prohledávači automaticky neuděluje veškerá potřebná autorská práva pro každé pozdější použití. Robots.txt a licencování by měly být navrženy společně.

Proč CC BY může podpořit širší inkluzi

Jasná permisivní licence může usnadnit pochopení politiky vydavatele pro datové týmy, vyhledávací systémy a operátory asistentů. Může snížit nejistotu ohledně kopírování, adaptace, komerčního použití, překladu a redistribuce, když tyto činnosti vyžadují souhlas s autorskými právy.

Creative Commons však vysvětluje, že trénování umělé inteligence je právně složité. Restriktivní licence není vždy účinným způsobem, jak zabránit trénování, protože některá použití pro trénování mohou být povolena výjimkami nebo omezeními autorských práv. Creative Commons také poznamenává, že licenční podmínky mohou být obtížně aplikovatelné na strojové trénování a výstupy modelů. (creativecommons.org)

Praktická lekce zní:

Používejte CC BY, když skutečně chcete široké legální opětovné použití. Nepoužívejte restriktivní licenci Creative Commons jako zaručenou možnost odhlášení od trénování umělé inteligence.

Uvádění zdroje zlepšuje jasnost

Creative Commons doporučuje metodu TASL:

  • Název
  • Autor
  • Zdroj
  • Licence

Například:

„Licencování a roboti pro maximální inkluzi,“ Example Publishing, https://www.example.org/articles/ai-crawlers, licencováno pod Creative Commons Attribution 4.0 International. Provedené změny: aktualizován inventář prohledávačů.

Jasné uvádění zdroje nenutí každého asistenta citovat stránku. Usnadňuje však správnou citaci, když systém extrahuje název, autora, zdroj a licenční informace stránky. (wiki.creativecommons.org)

Přidejte strukturované informace o článku

Použijte viditelné informace a strukturovaná data dohromady:

html

Google doporučuje jasné informace o autorovi, autorské stránky, data publikace, data úprav a stabilní kanonické stránky. Tyto signály mohou pomoci vyhledávacím systémům pochopit, kdo materiál vytvořil a která verze je autoritativní. Nezaručují hodnocení, zahrnutí nebo citaci. (developers.google.com)

Právní šablony pro otevřený web vhodný pro citace

Následující je ukázkový jazyk, nikoli právní rada. Nechte právníka přizpůsobit jej vaší jurisdikci, struktuře vlastnictví, závazkům v oblasti ochrany soukromí a obsahu třetích stran.

Prohlášení o licenci CC BY 4.0

text

Licence obsahu

Pokud není uvedeno jinak, původní text a původní redakční materiály na této stránce jsou licencovány pod Creative Commons Attribution 4.0 International license:

https://creativecommons.org/licenses/by/4.0/

Tato oprávnění umožňují kopírování, redistribuci, adaptaci, překlad, komerční použití, strojové zpracování, indexování pro vyhledávání, načítání, sumarizaci a použití v systémech umělé inteligence, za předpokladu dodržení licenčních podmínek.

Preferované uvedení zdroje:

„[Název stránky],“ od [autor nebo organizace], [kanonická adresa stránky], publikováno nebo aktualizováno [datum], licencováno pod Creative Commons Attribution 4.0 International. Provedené změny: [popište změny, nebo uveďte „žádné“].

Prosím, zachovejte informace o autorovi, vydavateli, zdroji, licenci a úpravách, kdykoli je to rozumně možné. Tento preferovaný průvodce uváděním zdroje nepřidává omezení k licenci Creative Commons a nenahrazuje text licence.

Fráze „včetně systémů umělé inteligence“ objasňuje záměr vydavatele. Neměla by být používána k předstírání, že vydavatel vlastní práva k materiálu vytvořenému někým jiným.

Oznámení o právech značky, soukromí a třetích stran

text

Práva značky, soukromí a třetích stran

Výše uvedená licence pokrývá pouze původní materiály označené jako licencované. Neuděluje povolení k použití:

  • Ochranných známek, servisních známek, log nebo obchodních úprav
  • Jmen, obrázků nebo podob osob
  • Soukromých, důvěrných, účetních, zdravotních, finančních nebo bezpečnostních informací
  • Uživatelských příspěvků, pokud nejsou samostatně označeny jako licencované
  • Fotografií, ilustrací, map, videí, hudby, citací nebo jiných materiálů třetích stran
  • Obsahu označeného jako „všechna práva vyhrazena“ nebo podléhajícího samostatné licenci

Použití názvu Example Publishing, log a značek nesmí naznačovat sponzorství, schválení, partnerství nebo podporu. Prosím, odkazujte na původní stránku a jasně rozlišujte citaci, parafrázi, shrnutí a generovaný materiál.

Tento jazyk je důležitý, protože licence Creative Commons automaticky neudělují každý typ právního nároku spojeného se stránkou. (creativecommons.org)

Pokyny pro citace ve vyhledávání a u asistentů

text

Pokyny pro citace ve vyhledávání a u asistentů

Vítáme vyhovující indexování pro vyhledávání, uživatelem požadované načítání, citace a shrnování licencovaného materiálu na tomto webu.

Při citování tohoto webu prosím uveďte název stránky, autora nebo vydavatele, kanonickou adresu stránky, datum publikace nebo aktualizace a přímý odkaz na zdroj. Prosím, označte zdroj jako jeden z použitých vstupů, rozlišujte generovanou analýzu od citovaného materiálu a neuvádějte ani nenaznačujte, že Example Publishing schvaluje generovanou odpověď, produkt, osobu nebo službu.

Tento průvodce má za cíl zlepšit přesnost a uvádění zdroje. Neuděluje práva nad rámec příslušné licence obsahu a nelicencuje ochranné známky, osobní údaje, důvěrné informace nebo materiál třetích stran.

Pokud chcete viditelnost ve vyhledávání, ale nechcete udělit širokou tréninkovou licenci

text

Přístup k vyhledávání a autorská práva

Naše veřejné stránky mohou být přístupné prohledávačům vyhovujícím vyhledávání a načítání, identifikovaným v našem souboru robots.txt. Toto povolení je určeno k podpoře objevování, výsledků vyhledávání, uživatelem požadovaného načítání a citací.

Pokud není uvedena samostatná licence, původní obsah zůstává se všemi právy vyhrazena. Přístup k veřejné stránce neuděluje samostatnou licenci pro vývoj modelu, trénování, redistribuci, komerční opětovné použití nebo vytváření odvozených děl nad rámec práv poskytovaných platnými zákony.

Při odkazování na tento materiál prosím citujte kanonickou adresu stránky a vydavatele. Nic na tomto webu neuděluje povolení k použití ochranných známek, log, osobních informací, důvěrných informací nebo obsahu třetích stran.

Nepokládejte prohlášení CC BY a prohlášení o všech právech vyhrazena na stejný materiál. Jasně identifikujte, která licence se vztahuje na který obsah.

Matice rizik a přínosů pro otevřené licencování

Autorské právo a pravidla pro trénování umělé inteligence se liší podle země a zůstávají nevyřešena. Úřad pro autorská práva Spojených států (United States Copyright Office) tyto otázky nadále zkoumá, zatímco Creative Commons popisuje trénování umělé inteligence jako záležitost specifickou pro fakta a právně složitou. (copyright.gov)

PřístupPotenciál inkluzeHlavní přínosyHlavní rizikaNejlepší využití
CC BY 4.0Velmi vysokýŠiroké kopírování, adaptace, komerční použití, překlad, indexování a opětovné použití související s modely, když je vyžadován souhlas s autorskými právyKomerční konkurenti mohou obsah znovu použít nebo adaptovat; uvádění zdroje může být nedokonalé; licence nemůže kontrolovat soukromí, ochranné známky nebo práva třetích stranVydavatelé, kteří chtějí nejširší legální opětovné použití a silné uvádění zdroje
CC BY-SA 4.0Vysoký, ale složitějšíPodporuje cyklus otevřeného sdílení a vyžaduje, aby adaptace zůstaly pod kompatibilními podmínkamiPravidla ShareAlike mohou být obtížně aplikovatelná na datové sady, trénování modelů a veřejné výstupy; některé organizace se mohou materiálu vyhýbat kvůli nejistotěOtevřené vzdělávací a veřejně prospěšné projekty, které chtějí, aby následné adaptace zůstaly otevřené
CC BY-NC 4.0Střední nebo nízkýOmezuje použití primárně určené pro komerční výhody nebo peněžní kompenzaci„Nekomerční“ může být obtížné interpretovat; může vyloučit komerční vyhledávání, modely a asistenční použití; není to zaručená možnost odhlášení od trénováníMateriál určený pro neziskové, vzdělávací nebo komunitní použití
CC BY-ND 4.0StředníUmožňuje sdílení při omezení adaptacíPřeklad, transformace a některé případy použití asistentů se mohou stát právně nejistými; méně atraktivní pro systémy, které shrnují nebo remixujíOficiální oznámení nebo díla, která musí zůstat nezměněna
CC0 nebo zasvěcení do veřejné doményVelmi vysokýZjednodušuje opětovné použití a odstraňuje většinu podmínek autorských práv, kde je to právně účinnéNení vyžadováno uvádění zdroje; slabá kontrola nad prezentací značky; soukromí, ochranné známky a práva na publicitu zůstávají oddělenáFakta, datové sady, referenční materiály nebo díla určená pro neomezené opětovné použití
Všechna práva vyhrazena plus otevřené prohledávání vyhledáváníVysoké pro vyhledávání, nižší pro trénováníMůže zachovat viditelnost ve vyhledávání a citacích bez udělení široké licence pro opětovné použitíVíce právní nejistoty pro vývojáře modelů; může snížit zahrnutí do tréninkových datových sad a systémů pro komerční opětovné použitíVydavatelé, kteří chtějí objevování a citace, ale preferují vyjednávání širších licencí samostatně

Nejvyváženější strategie pro mnoho organizací je:

  • CC BY 4.0 pro původní veřejný redakční text
  • Samostatné štítky pro materiál třetích stran
  • Žádné veřejné osobní ani důvěrné informace
  • Povolit prohledávače pro vyhledávání a načítání
  • Povolit prohledávače pro vývoj modelů pouze tehdy, pokud organizace skutečně takové použití přijímá
  • Používat jasné uvádění zdroje a kanonické odkazy
  • Chránit ochranné známky prostřednictvím samostatného upozornění na značku

Praktický kontrolní seznam implementace

Obsah a licencování

  • Identifikujte, kdo vlastní každou stránku, obrázek, graf, video a citaci.
  • Licencujte pouze materiál, k němuž vaše organizace kontroluje práva.
  • Označte materiál třetích stran samostatně.
  • Přidejte viditelné prohlášení o licenci.
  • Poskytněte preferovanou citaci s použitím názvu, autora, zdroje a licence.
  • Udržujte loga, ochranné známky, osobní data a důvěrné informace mimo licencovaný rozsah.

Robots.txt

  • Vytvořte veřejný soubor robots.txt v kořenovém adresáři každého hostitele.
  • Povolte prohledávače pro vyhledávání odděleně od prohledávačů pro trénování.
  • Blokujte administrativní, účetní, pokladní, soukromé a interní aplikační cesty.
  • Nespoléhejte se na robots.txt pro zabezpečení.
  • Po každém větším nasazení webu soubor otestujte.

Meta tagy

  • Používejte kanonické odkazy.
  • Přidejte autora, datum publikace a datum úpravy.
  • Používejte noindex pro stránky, které by se neměly objevovat ve vyhledávání.
  • Používejte nosnippet nebo data-nosnippet pro citlivé výňatky, kde je to podporováno.
  • Používejte X-Robots-Tag pro soubory PDF, obrázky a další ne-HTML zdroje.
  • Pamatujte, že prohledávač musí být schopen načíst stránku, než si přečte její meta tagy.

Zabezpečení sítě

  • Protokolujte řetězce uživatelských agentů, zdrojové adresy, kódy odpovědí a cesty požadavků.
  • Ověřujte důvěryhodné prohledávače pomocí oficiálních zdrojů adres nebo metod systému doménových jmen.
  • Automaticky obnovujte zdroje adres.
  • Kombinujte kontroly uživatelského agenta a zdrojové adresy.
  • Omezujte rychlost ověřených prohledávačů, namísto aby jim byl poskytnut neomezený přístup.
  • Vyzývejte nebo blokujte požadavky, které tvrdí, že jsou důvěryhodnými prohledávači, ale selžou při ověření.

Měření

Sledujte:

  • Návštěvy z vyhledávacích služeb umělé inteligence
  • Odkazy na původní stránku
  • Frekvence citací
  • Zatížení serveru podle prohledávače
  • Požadavky vracející 403, 404 nebo 429
  • Přístup prohledávače k nezamýšleným cestám
  • Zda jsou aktuální články nalezeny po publikaci

Závěr

Maximální inkluze vyžaduje selektivní otevřenost, nikoli jediné plošné povolení.

Použijte robots.txt k oddělení vyhledávání, uživatelského načítání, trénování a prohledávání veřejných datových sad. Použijte meta tagy a hlavičky HTTP ke správě indexování a úryvků. Pro cokoli soukromého použijte ověřování. Ověřujte IP adresy prohledávačů, spíše než abyste důvěřovali samotným názvům uživatelských agentů.

Permisivní licence, jako je CC BY 4.0, může usnadnit široké opětovné použití, když si to skutečně přejete. Jasné informace o uvádění zdroje – název, autor, zdroj, licence, kanonická stránka a datum aktualizace – mohou také usnadnit vyhledávacím systémům a asistentům identifikaci a citování správného zdroje.

Nejsilnější publikační politika je proto:

**Otevřete veřejný obsah, který chcete objevit, jasně licencujte materiál, který chcete znovu použít, označte materiál, který nevlastníte, chraňte soukromé informace na úrovni serveru a každému prohledávači dejte samostatné, přezkoumatelné povolení.

Související články

Líbí se vám tento obsah?

Přihlaste se k odběru našeho newsletteru pro nejnovější poznatky z obsahového marketingu a průvodce růstem.

Tento článek slouží pouze pro informační účely. Obsah a strategie se mohou lišit v závislosti na vašich konkrétních potřebách.
Licencování a roboti pro maximální inkluzi: Jak přivítat prohledávače s umělou inteligencí | AutoPod