Licencování a roboti pro maximální inkluzi: Jak přivítat prohledávače s umělou inteligencí
Aktualizováno 25. srpna 2026
Webové stránky nyní mají více než jeden způsob, jak oslovit publikum. Stránka může být nalezena prostřednictvím Vyhledávání Google, shrnuta ChatGPT, citována Perplexity, použita ve vyhledávání Claude, zobrazena prostřednictvím služeb Apple nebo shromážděna veřejným webovým archivem.
Tyto systémy nepoužívají všechny stejného prohledávače ani se neřídí stejnými pravidly. Webová stránka, která blokuje GPTBot, se stále může objevit ve vyhledávání ChatGPT, pokud povolí OAI-SearchBot. Webová stránka, která povoluje Applebot, může zůstat viditelná ve Vyhledávání Apple a zároveň blokovat Applebot-Extended pro trénování modelů umělé inteligence. Google Google-Extended vůbec není běžným prohledávačem; je to řídicí token robots.txt.
Nejlepší politikou proto není jednoduše „povolit umělou inteligenci“ nebo „blokovat umělou inteligenci“. Je třeba vytvořit samostatná oprávnění pro:
- Vyhledávání a objevování
- Uživatelem požadované načítání
- Vývoj a trénování modelů
- Veřejné datové sady
- Citlivý, soukromý nebo omezený materiál
Tento článek poskytuje aktuální inventář prohledávačů, příklady robots.txt, pokyny pro meta tagy, metody ověřování IP adres, doporučení pro licencování Creative Commons, právní šablony a matici rizik a přínosů.
Čtyři ovládací prvky, které by měl každý vydavatel znát
1. robots.txt řídí požadované prohledávání
Soubor robots.txt sděluje vyhovujícím automatizovaným klientům, které stránky mohou požadovat. Je užitečný pro správu provozu prohledávačů a vyjádření preferencí vydavatele.
Robots.txt však není systémem kontroly přístupu. Protokol Robots Exclusion Protocol uvádí, že jeho pravidla nejsou autorizací přístupu. Google také varuje, že blokovaná adresa se stále může objevit ve výsledcích vyhledávání, pokud na ni odkazují jiné stránky. Pro důvěrné informace použijte hesla, ověřování nebo serverové kontroly přístupu. (rfc-editor.org)
2. Meta tagy řídí indexování a úryvky
Robots meta tagy a hlavička odpovědi X-Robots-Tag mohou řídit, zda bude stránka indexována nebo zda vyhledávač může zobrazit úryvek.
Tyto ovládací prvky jsou normálně viditelné až poté, co bylo prohledávači povoleno stránku načíst. Pokud robots.txt stránku nejprve blokuje, prohledávač meta tag možná nikdy neuvidí. (developers.google.com)
3. Síťové kontroly ověřují prohledávač
Jméno uživatelského agenta je snadné zkopírovat. Útočník může poslat požadavek, který tvrdí, že je GPTBot, Googlebot nebo PerplexityBot.
Silnější přístup kombinuje:
- Prohlašovaný uživatelský agent
- Zveřejněný rozsah IP adres
- Ověření reverzního systému doménových jmen (Reverse Domain Name System)
- Ověření dopředného systému doménových jmen (Forward Domain Name System)
- Omezení rychlosti a monitorování požadavků
4. Licence uděluje práva k opětovnému použití
Robots.txt říká, co má prohledávač dělat. Licence říká, co mohou lidé nebo organizace legálně dělat s materiálem, když je vyžadován souhlas s autorskými právy.
Jedná se o různé nástroje. Permisivní licence může snížit právní nejistotu, ale nezaručuje, že prohledávač stránku navštíví, že ji model použije, nebo že ji asistent cituje.
Inventář důležitých prohledávačů
Následující inventář byl zkontrolován oproti dokumentaci poskytovatele dostupné 25. srpna 2026. Názvy uživatelských agentů, účely a rozsahy IP adres se mohou měnit, takže produkční systémy by měly používat aktuální dokumentaci poskytovatele a živé zdroje adres.
| Poskytovatel | Prohledávač nebo token robots.txt | Hlavní účel | Důležitá kontrola |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Najde a analyzuje stránky pro vyhledávání ChatGPT | Povolte jej pro zvýšení šance, že se stránky objeví ve výsledcích vyhledávání ChatGPT. |
| OpenAI | GPTBot | Shromažďuje stránky, které mohou být použity pro trénování generativních modelů umělé inteligence OpenAI | Povolit nebo zakázat odděleně od vyhledávání. |
| OpenAI | ChatGPT-User | Načítá stránky poté, co uživatel požádá ChatGPT nebo vlastní GPT o přístup k nim | Je spuštěn uživatelem, nikoli automatickým webovým prohledávačem, takže pravidla robots.txt se nemusí uplatňovat. |
| OpenAI | OAI-AdsBot | Kontroluje webové stránky odeslané jako reklamní cíle ChatGPT | Relevantní hlavně pro inzerenty. Shromážděný obsah se nepoužívá k trénování generativních základních modelů umělé inteligence. |
Googlebot | Hlavní prohledávač Vyhledávání Google | Řídí běžné prohledávání Vyhledávání Google. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Obrázky, videa a Zprávy Google | Tyto mají samostatné tokeny robots.txt a lze je ovládat nezávisle. | |
GoogleOther | Obecné prohledávání Google pro různé produktové týmy, včetně výzkumu a vývoje | Nepředstavuje jeden konkrétní produkt Google. | |
Google-Extended | Řídí, zda může být obsah prohledávaný Googlem použit pro trénování modelu Gemini a určité systémy uzemnění | Je to řídicí token robots.txt, nikoli samostatný uživatelský agent požadavku. Nemá vliv na běžnou inkluzi ve Vyhledávání Google. | |
| Anthropic | ClaudeBot | Shromažďuje veřejný webový obsah, který může přispět k vývoji modelu Claude | Zakažte jej, abyste signalizovali, že budoucí materiál by měl být vyloučen z tréninkových datových sad Anthropic. |
| Anthropic | Claude-SearchBot | Zlepšuje kvalitu výsledků vyhledávání Claude | Povolte jej pro viditelnost ve vyhledávání Claude. |
| Anthropic | Claude-User | Načítá stránky v reakci na požadavek uživatele na Claude | Odděleně od automatického prohledávání. |
| Perplexity | PerplexityBot | Indexuje stránky pro výsledky vyhledávání Perplexity | Perplexity uvádí, že tento prohledávač se nepoužívá ke shromažďování obsahu pro trénování základních modelů umělé inteligence. |
| Perplexity | Perplexity-User | Načítá stránku poté, co ji uživatel požádá | Dokumentace Perplexity uvádí, že tento načítací program obecně ignoruje robots.txt, protože požadavek byl iniciován uživatelem. |
| Apple | Applebot | Podporuje Apple Search, Spotlight, Siri, Safari a další prostředí Apple | Povolte jej pro objevování Apple. |
| Apple | Applebot-Extended | Řídí, zda může být obsah prohledávaný Applebotem použit k trénování základních modelů Apple | Sám stránky neprohledává. Je to kontrola použití dat. |
| Common Crawl | CCBot | Shromažďuje veřejná webová data pro otevřený webový archiv Common Crawl | Není to asistent, ale jeho datové sady mohou být použity výzkumníky a vývojáři umělé inteligence. |
| Microsoft | Bingbot | Hlavní prohledávač vyhledávání Bing | Povolte jej pro objevování a viditelnost ve vyhledávání Bing. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Náhledy stránek a videí pro produkty Microsoft | Tyto lze ovládat odděleně od Bingbotu. |
| Amazon | Amzn-SearchBot | Vyhledávání a objevování obsahu Amazon | Amazon uvádí, že neprohledává obsah pro trénování generativních modelů umělé inteligence. |
| Amazon | Amzn-User | Načítá aktuální informace v reakci na uživatelské akce, včetně požadavků Alexa | Spuštěno uživatelem a odděleně od automatického prohledávání vyhledávání. |
OpenAI dokumentuje své prohledávače pro vyhledávání, trénování, reklamu a uživatelem spouštěné prohledávače jako samostatné ovládací prvky. Jeho dokumentace konkrétně doporučuje povolení OAI-SearchBot pro vyhledávání ChatGPT a zároveň samostatné použití GPTBot pro preference trénování. (developers.openai.com)
Google podobně odděluje Googlebot, GoogleOther a Google-Extended. Google-Extended nemá vlastního uživatelského agenta pro HTTP požadavky a jeho blokování neodstraní stránku z Vyhledávání Google. (developers.google.com)
Anthropic dokumentuje samostatné role pro ClaudeBot, Claude-SearchBot a Claude-User. Anthropic také uvádí, že jeho roboti dodržují robots.txt a podporují nestandardní direktivu Crawl-delay. (support.anthropic.com)
Perplexity rozlišuje mezi automatickým prohledáváním vyhledávání a uživatelem požadovaným načítáním. Jeho aktuální dokumentace uvádí, že PerplexityBot respektuje robots.txt, zatímco Perplexity-User obecně ne, protože reaguje na uživatelský požadavek. (docs.perplexity.ai)
Aktuální dokumentace Apple činí stejné rozlišení mezi vyhledáváním a trénováním: Applebot podporuje objevování, zatímco Applebot-Extended umožňuje vydavatelům kontrolovat použití pro trénování, aniž by se stránky odstranily z Vyhledávání Apple. (support.apple.com)
Doporučené konfigurace robots.txt
Soubor robots.txt umístěte do kořenového adresáře každého hostitele, například:
text https://www.example.org/robots.txt
Pravidla se vztahují na konkrétního hostitele, protokol a port, na kterém je soubor obsluhován. Samostatná subdoména může potřebovat svůj vlastní soubor. (developers.google.com)
Konfigurace 1: Maximální inkluze
Tuto konfiguraci použijte, když veřejný redakční obsah může být nalezen, shrnut, citován, indexován a shromažďován vyhovujícími prohledávači.
text
Veřejné stránky jsou dostupné vyhovujícím prohledávačům.
User-agent: * Allow: /
Udržujte soukromé, transakční a administrativní cesty mimo.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
To umožňuje pojmenovaným prohledávačům, včetně OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft a Amazon, pokud je jiné specifické pravidlo neblokuje.
Pod tuto konfiguraci neumisťujte obecné pravidlo, jako je User-agent: * Disallow: /. Pozdější nebo specifičtější skupina může změnit, jak prohledávač soubor interpretuje.
Konfigurace 2: Povolit vyhledávání, ale blokovat prohledávače pro vývoj modelů
To je často nejlepší kompromis pro vydavatele, kteří chtějí citace a návštěvnost z vyhledávání, ale nechtějí signalizovat povolení pro shromažďování pro vývoj modelů.
text
Blokovat prohledávání pro vývoj modelu OpenAI.
User-agent: GPTBot Disallow: /
Blokovat prohledávání pro vývoj modelu Anthropic.
User-agent: ClaudeBot Disallow: /
Blokovat trénování modelu Google a související uzemňující použití.
User-agent: Google-Extended Disallow: /
Blokovat použití pro trénování základního modelu Apple.
User-agent: Applebot-Extended Disallow: /
Volitelné: blokovat shromažďování datové sady Common Crawl.
User-agent: CCBot
Disallow: /
Povolit běžné prohledávání vyhledávání a načítání, kromě citlivých cest.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Tato konfigurace ponechává OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot a Applebot pokryté zástupnou skupinou. Také udržuje oprávnění pro vyhledávání a trénování oddělená.
Pro Apple, blokování Applebot-Extended a zároveň povolení Applebotu zachovává objevování prostřednictvím služeb Apple. Pro Google, blokování Google-Extended neblokuje běžné Vyhledávání Google. (developers.google.com)
Konfigurace 3: Explicitně povolit vybrané prohledávače pro vyhledávání
Pokud stávající soubor robots.txt blokuje všechny prohledávače, přidejte samostatné skupiny pro prohledávače vyhledávání, které chcete přivítat.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Ostatní prohledávače držte mimo.
User-agent: * Disallow: /
Při použití specifických skupin opakujte pravidla pro citlivé cesty uvnitř každé skupiny. Některé prohledávače používají nejpřesnější odpovídající skupinu, spíše než aby ji kombinovaly se zástupnou skupinou. Bing toto chování dokumentuje přímo a Google poskytuje samostatné pokyny pro skupiny specifické pro prohledávače. (bing.com)
Důležitá omezení robots.txt
- Prohledávač může ignorovat robots.txt.
- Záludný prohledávač se může vydávat za důvěryhodného prohledávače.
- Blokovaná stránka může být stále známa svým názvem nebo webovou adresou.
- Robots.txt nechrání hesla, soukromé soubory, záznamy zákazníků ani důvěrná rozhraní pro programování aplikací.
- Direktiva
Crawl-delaynení součástí jádra protokolu Robots Exclusion Protocol a není podporována každým prohledávačem. Anthropic a Bing dokumentují podporu, zatímco Apple uvádí, že Applebot nedodržuje crawl-delay. (rfc-editor.org)
Meta tagy a HTTP hlavičky
Příklad veřejné stránky
Pro veřejný článek použijte jasný název, autora, kanonickou webovou adresu, datum publikace a datum úpravy.
html
Direktiva max-snippet je primárně dokumentována pro Google. Nepředpokládejte, že každý prohledávač umělé inteligence podporuje každou meta direktivu.
Příklad soukromé nebo citlivé stránky
html
Toto použijte pro stránky, které by se neměly objevovat ve výsledcích vyhledávání. Stránka musí zůstat prohledávatelná dostatečně dlouho, aby prohledávač direktivu viděl. Pokud stránka musí skutečně zůstat soukromá, použijte místo toho ověřování nebo ochranu heslem. (developers.google.com)
Skrýt pouze citlivé sekce z úryvků vyhledávání
Google podporuje data-nosnippet pro konkrétní části HTML stránky:
html
This paragraph may be shown in a search result.
Toto je užitečné pro kontaktní údaje, interní poznámky nebo uživatelem generované informace. Není to univerzální instrukce pro každý systém umělé inteligence. (developers.google.com)
Použijte hlavičku X-Robots-Tag pro soubory
Meta tagy nelze umístit do souboru PDF, obrázku nebo video souboru. Místo toho použijte hlavičku HTTP odpovědi:
text X-Robots-Tag: noindex, nosnippet
Pro stránku, která by měla zůstat prohledávatelná, ale neměla by poskytovat text pro úryvky nebo odpovědi umělé inteligence, použijte:
text X-Robots-Tag: nosnippet
Google dokumentuje X-Robots-Tag pro ne-HTML zdroje a Apple jej podporuje také pro Applebot. (developers.google.com)
Ovládací prvky specifické pro Apple
Apple podporuje:
html
Apple uvádí, že nosnippet brání použití stránky jako dodatečného kontextu a aktuálního obsahu, když modely Apple generují výstup. Stránka může stále zůstat zjistitelná prostřednictvím Apple Search, Spotlight, Siri a Safari. (support.apple.com)
Pro stránky s platbou Apple také podporuje strukturovaná data pomocí:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple uvádí, že takové stránky mohou zůstat způsobilé pro výsledky vyhledávání, ale nebudou použity jako dodatečný kontext pro odpovědi umělé inteligence. (support.apple.com)
Jak ověřit IP adresy prohledávačů
Proč shoda uživatelského agenta nestačí
Pravidlo jako toto je slabé:
text if User-Agent contains "GPTBot": allow
Tento text může poslat kdokoli. Lepší pravidlo je:
text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block
Důvěřujte hlavičce X-Forwarded-For pouze v případě, že pochází z proxy nebo sítě pro doručování obsahu (CDN), kterou vaše organizace kontroluje.
Metody ověření poskytovatelem
| Poskytovatel | Doporučená metoda ověření |
|---|---|
| OpenAI | Použijte živé zdroje IP adres zveřejněné v dokumentaci prohledávače OpenAI pro OAI-SearchBot, GPTBot a OAI-AdsBot. Obnovujte je automaticky, spíše než kopírovat pevné rozsahy do firewallu. |
| Použijte zveřejněné rozsahy prohledávačů Google nebo proveďte kontrolu reverzního a dopředného systému doménových jmen (Domain Name System). Pravý prohledávač Google by se měl přeložit na schválený název hostitele Google a zpět na původní adresu. | |
| Anthropic | Použijte aktuální zveřejněný zdroj adres prohledávače jako sekundární síťovou kontrolu. Primární metoda odhlášení Anthropicu zůstává robots.txt. |
| Perplexity | Zkombinujte uživatelského agenta s aktuálním zdrojem adres PerplexityBot nebo Perplexity-User. Perplexity konkrétně doporučuje kombinovat obě podmínky v pravidle Web Application Firewall. |
| Apple | Použijte ověření reverzního systému doménových jmen pod applebot.apple.com, poté proveďte dopředné vyhledávání. Apple také zveřejňuje aktuální rozsahy adres v JSON zdroji. |
| Common Crawl | Použijte ověření reverzního systému doménových jmen pod crawl.commoncrawl.org a aktuální zdroj adres CCBot. Common Crawl poznamenává, že reverzní ověření zatím není dostupné pro některé IPv6 provoz. |
| Microsoft | Použijte oficiální nástroj Verify Bingbot nebo dokumentované metody reverzního a dopředného vyhledávání Microsoftu. |
| Amazon | Použijte zveřejněné seznamy adres prohledávačů Amazonu a spárujte je s příslušným uživatelským agentem Amazonu. |
Google, Apple, Common Crawl, OpenAI, Anthropic a Perplexity – všichni zveřejňují metody specifické pro poskytovatele nebo zdroje adres. Tyto seznamy se mohou měnit, takže plánovaný proces aktualizace je bezpečnější než trvalý ručně zkopírovaný seznam. (developers.google.com)
Jednoduchý návrh firewallu by mohl vypadat takto:
text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match
rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers
Neaplikujte široké pravidlo povolení na celého poskytovatele cloudu. Legitimní prohledávač může používat cloudovou infrastrukturu, ale většina provozu od tohoto poskytovatele cloudu nemusí nutně být prohledávač.
Jak otevřené licencování ovlivňuje inkluzi
CC BY 4.0 v běžném jazyce
Mezinárodní licence Creative Commons Uveďte původ 4.0, běžně nazývaná CC BY 4.0, umožňuje lidem:
- Kopírovat a redistribuovat dílo
- Přizpůsobovat, překládat, remixovat a stavět na něm
- Používat jej komerčně
Hlavní podmínky jsou:
- Uvést příslušný původ
- Odkazovat na licenci
- Uvést, zda byly provedeny změny
- Nenaznačovat, že původní tvůrce schvaluje opětovné použití
- Nepřidávat právní nebo technická omezení, která brání použití povolenému licencí
Creative Commons také varuje, že licence nemusí pokrývat práva na soukromí, práva na publicitu, morální práva, práva k ochranným známkám, patentová práva nebo materiál třetích stran. (creativecommons.org)
Samotná licence není pozvánkou pro prohledávač
Umístění „CC BY 4.0“ na stránku nezaručuje, že ji organizace prohledá. Prohledávač může být stále blokován:
- robots.txt
- Sítí pro doručování obsahu (CDN)
- Web Application Firewall (WAF)
- Omezením rychlosti
- JavaScriptovou výzvou
- Přihlašovací zdí
- Špatnou odezvou serveru
- Nepřístupnou mapou stránek
Naopak, povolení prohledávači automaticky neuděluje veškerá potřebná autorská práva pro každé pozdější použití. Robots.txt a licencování by měly být navrženy společně.
Proč CC BY může podpořit širší inkluzi
Jasná permisivní licence může usnadnit pochopení politiky vydavatele pro datové týmy, vyhledávací systémy a operátory asistentů. Může snížit nejistotu ohledně kopírování, adaptace, komerčního použití, překladu a redistribuce, když tyto činnosti vyžadují souhlas s autorskými právy.
Creative Commons však vysvětluje, že trénování umělé inteligence je právně složité. Restriktivní licence není vždy účinným způsobem, jak zabránit trénování, protože některá použití pro trénování mohou být povolena výjimkami nebo omezeními autorských práv. Creative Commons také poznamenává, že licenční podmínky mohou být obtížně aplikovatelné na strojové trénování a výstupy modelů. (creativecommons.org)
Praktická lekce zní:
Používejte CC BY, když skutečně chcete široké legální opětovné použití. Nepoužívejte restriktivní licenci Creative Commons jako zaručenou možnost odhlášení od trénování umělé inteligence.
Uvádění zdroje zlepšuje jasnost
Creative Commons doporučuje metodu TASL:
- Název
- Autor
- Zdroj
- Licence
Například:
„Licencování a roboti pro maximální inkluzi,“ Example Publishing, https://www.example.org/articles/ai-crawlers, licencováno pod Creative Commons Attribution 4.0 International. Provedené změny: aktualizován inventář prohledávačů.
Jasné uvádění zdroje nenutí každého asistenta citovat stránku. Usnadňuje však správnou citaci, když systém extrahuje název, autora, zdroj a licenční informace stránky. (wiki.creativecommons.org)
Přidejte strukturované informace o článku
Použijte viditelné informace a strukturovaná data dohromady:
html
Google doporučuje jasné informace o autorovi, autorské stránky, data publikace, data úprav a stabilní kanonické stránky. Tyto signály mohou pomoci vyhledávacím systémům pochopit, kdo materiál vytvořil a která verze je autoritativní. Nezaručují hodnocení, zahrnutí nebo citaci. (developers.google.com)
Právní šablony pro otevřený web vhodný pro citace
Následující je ukázkový jazyk, nikoli právní rada. Nechte právníka přizpůsobit jej vaší jurisdikci, struktuře vlastnictví, závazkům v oblasti ochrany soukromí a obsahu třetích stran.
Prohlášení o licenci CC BY 4.0
text
Licence obsahu
Pokud není uvedeno jinak, původní text a původní redakční materiály na této stránce jsou licencovány pod Creative Commons Attribution 4.0 International license:
https://creativecommons.org/licenses/by/4.0/
Tato oprávnění umožňují kopírování, redistribuci, adaptaci, překlad, komerční použití, strojové zpracování, indexování pro vyhledávání, načítání, sumarizaci a použití v systémech umělé inteligence, za předpokladu dodržení licenčních podmínek.
Preferované uvedení zdroje:
„[Název stránky],“ od [autor nebo organizace], [kanonická adresa stránky], publikováno nebo aktualizováno [datum], licencováno pod Creative Commons Attribution 4.0 International. Provedené změny: [popište změny, nebo uveďte „žádné“].
Prosím, zachovejte informace o autorovi, vydavateli, zdroji, licenci a úpravách, kdykoli je to rozumně možné. Tento preferovaný průvodce uváděním zdroje nepřidává omezení k licenci Creative Commons a nenahrazuje text licence.
Fráze „včetně systémů umělé inteligence“ objasňuje záměr vydavatele. Neměla by být používána k předstírání, že vydavatel vlastní práva k materiálu vytvořenému někým jiným.
Oznámení o právech značky, soukromí a třetích stran
text
Práva značky, soukromí a třetích stran
Výše uvedená licence pokrývá pouze původní materiály označené jako licencované. Neuděluje povolení k použití:
- Ochranných známek, servisních známek, log nebo obchodních úprav
- Jmen, obrázků nebo podob osob
- Soukromých, důvěrných, účetních, zdravotních, finančních nebo bezpečnostních informací
- Uživatelských příspěvků, pokud nejsou samostatně označeny jako licencované
- Fotografií, ilustrací, map, videí, hudby, citací nebo jiných materiálů třetích stran
- Obsahu označeného jako „všechna práva vyhrazena“ nebo podléhajícího samostatné licenci
Použití názvu Example Publishing, log a značek nesmí naznačovat sponzorství, schválení, partnerství nebo podporu. Prosím, odkazujte na původní stránku a jasně rozlišujte citaci, parafrázi, shrnutí a generovaný materiál.
Tento jazyk je důležitý, protože licence Creative Commons automaticky neudělují každý typ právního nároku spojeného se stránkou. (creativecommons.org)
Pokyny pro citace ve vyhledávání a u asistentů
text
Pokyny pro citace ve vyhledávání a u asistentů
Vítáme vyhovující indexování pro vyhledávání, uživatelem požadované načítání, citace a shrnování licencovaného materiálu na tomto webu.
Při citování tohoto webu prosím uveďte název stránky, autora nebo vydavatele, kanonickou adresu stránky, datum publikace nebo aktualizace a přímý odkaz na zdroj. Prosím, označte zdroj jako jeden z použitých vstupů, rozlišujte generovanou analýzu od citovaného materiálu a neuvádějte ani nenaznačujte, že Example Publishing schvaluje generovanou odpověď, produkt, osobu nebo službu.
Tento průvodce má za cíl zlepšit přesnost a uvádění zdroje. Neuděluje práva nad rámec příslušné licence obsahu a nelicencuje ochranné známky, osobní údaje, důvěrné informace nebo materiál třetích stran.
Pokud chcete viditelnost ve vyhledávání, ale nechcete udělit širokou tréninkovou licenci
text
Přístup k vyhledávání a autorská práva
Naše veřejné stránky mohou být přístupné prohledávačům vyhovujícím vyhledávání a načítání, identifikovaným v našem souboru robots.txt. Toto povolení je určeno k podpoře objevování, výsledků vyhledávání, uživatelem požadovaného načítání a citací.
Pokud není uvedena samostatná licence, původní obsah zůstává se všemi právy vyhrazena. Přístup k veřejné stránce neuděluje samostatnou licenci pro vývoj modelu, trénování, redistribuci, komerční opětovné použití nebo vytváření odvozených děl nad rámec práv poskytovaných platnými zákony.
Při odkazování na tento materiál prosím citujte kanonickou adresu stránky a vydavatele. Nic na tomto webu neuděluje povolení k použití ochranných známek, log, osobních informací, důvěrných informací nebo obsahu třetích stran.
Nepokládejte prohlášení CC BY a prohlášení o všech právech vyhrazena na stejný materiál. Jasně identifikujte, která licence se vztahuje na který obsah.
Matice rizik a přínosů pro otevřené licencování
Autorské právo a pravidla pro trénování umělé inteligence se liší podle země a zůstávají nevyřešena. Úřad pro autorská práva Spojených států (United States Copyright Office) tyto otázky nadále zkoumá, zatímco Creative Commons popisuje trénování umělé inteligence jako záležitost specifickou pro fakta a právně složitou. (copyright.gov)
| Přístup | Potenciál inkluze | Hlavní přínosy | Hlavní rizika | Nejlepší využití |
|---|---|---|---|---|
| CC BY 4.0 | Velmi vysoký | Široké kopírování, adaptace, komerční použití, překlad, indexování a opětovné použití související s modely, když je vyžadován souhlas s autorskými právy | Komerční konkurenti mohou obsah znovu použít nebo adaptovat; uvádění zdroje může být nedokonalé; licence nemůže kontrolovat soukromí, ochranné známky nebo práva třetích stran | Vydavatelé, kteří chtějí nejširší legální opětovné použití a silné uvádění zdroje |
| CC BY-SA 4.0 | Vysoký, ale složitější | Podporuje cyklus otevřeného sdílení a vyžaduje, aby adaptace zůstaly pod kompatibilními podmínkami | Pravidla ShareAlike mohou být obtížně aplikovatelná na datové sady, trénování modelů a veřejné výstupy; některé organizace se mohou materiálu vyhýbat kvůli nejistotě | Otevřené vzdělávací a veřejně prospěšné projekty, které chtějí, aby následné adaptace zůstaly otevřené |
| CC BY-NC 4.0 | Střední nebo nízký | Omezuje použití primárně určené pro komerční výhody nebo peněžní kompenzaci | „Nekomerční“ může být obtížné interpretovat; může vyloučit komerční vyhledávání, modely a asistenční použití; není to zaručená možnost odhlášení od trénování | Materiál určený pro neziskové, vzdělávací nebo komunitní použití |
| CC BY-ND 4.0 | Střední | Umožňuje sdílení při omezení adaptací | Překlad, transformace a některé případy použití asistentů se mohou stát právně nejistými; méně atraktivní pro systémy, které shrnují nebo remixují | Oficiální oznámení nebo díla, která musí zůstat nezměněna |
| CC0 nebo zasvěcení do veřejné domény | Velmi vysoký | Zjednodušuje opětovné použití a odstraňuje většinu podmínek autorských práv, kde je to právně účinné | Není vyžadováno uvádění zdroje; slabá kontrola nad prezentací značky; soukromí, ochranné známky a práva na publicitu zůstávají oddělená | Fakta, datové sady, referenční materiály nebo díla určená pro neomezené opětovné použití |
| Všechna práva vyhrazena plus otevřené prohledávání vyhledávání | Vysoké pro vyhledávání, nižší pro trénování | Může zachovat viditelnost ve vyhledávání a citacích bez udělení široké licence pro opětovné použití | Více právní nejistoty pro vývojáře modelů; může snížit zahrnutí do tréninkových datových sad a systémů pro komerční opětovné použití | Vydavatelé, kteří chtějí objevování a citace, ale preferují vyjednávání širších licencí samostatně |
Nejvyváženější strategie pro mnoho organizací je:
- CC BY 4.0 pro původní veřejný redakční text
- Samostatné štítky pro materiál třetích stran
- Žádné veřejné osobní ani důvěrné informace
- Povolit prohledávače pro vyhledávání a načítání
- Povolit prohledávače pro vývoj modelů pouze tehdy, pokud organizace skutečně takové použití přijímá
- Používat jasné uvádění zdroje a kanonické odkazy
- Chránit ochranné známky prostřednictvím samostatného upozornění na značku
Praktický kontrolní seznam implementace
Obsah a licencování
- Identifikujte, kdo vlastní každou stránku, obrázek, graf, video a citaci.
- Licencujte pouze materiál, k němuž vaše organizace kontroluje práva.
- Označte materiál třetích stran samostatně.
- Přidejte viditelné prohlášení o licenci.
- Poskytněte preferovanou citaci s použitím názvu, autora, zdroje a licence.
- Udržujte loga, ochranné známky, osobní data a důvěrné informace mimo licencovaný rozsah.
Robots.txt
- Vytvořte veřejný soubor robots.txt v kořenovém adresáři každého hostitele.
- Povolte prohledávače pro vyhledávání odděleně od prohledávačů pro trénování.
- Blokujte administrativní, účetní, pokladní, soukromé a interní aplikační cesty.
- Nespoléhejte se na robots.txt pro zabezpečení.
- Po každém větším nasazení webu soubor otestujte.
Meta tagy
- Používejte kanonické odkazy.
- Přidejte autora, datum publikace a datum úpravy.
- Používejte
noindexpro stránky, které by se neměly objevovat ve vyhledávání. - Používejte
nosnippetnebodata-nosnippetpro citlivé výňatky, kde je to podporováno. - Používejte
X-Robots-Tagpro soubory PDF, obrázky a další ne-HTML zdroje. - Pamatujte, že prohledávač musí být schopen načíst stránku, než si přečte její meta tagy.
Zabezpečení sítě
- Protokolujte řetězce uživatelských agentů, zdrojové adresy, kódy odpovědí a cesty požadavků.
- Ověřujte důvěryhodné prohledávače pomocí oficiálních zdrojů adres nebo metod systému doménových jmen.
- Automaticky obnovujte zdroje adres.
- Kombinujte kontroly uživatelského agenta a zdrojové adresy.
- Omezujte rychlost ověřených prohledávačů, namísto aby jim byl poskytnut neomezený přístup.
- Vyzývejte nebo blokujte požadavky, které tvrdí, že jsou důvěryhodnými prohledávači, ale selžou při ověření.
Měření
Sledujte:
- Návštěvy z vyhledávacích služeb umělé inteligence
- Odkazy na původní stránku
- Frekvence citací
- Zatížení serveru podle prohledávače
- Požadavky vracející
403,404nebo429 - Přístup prohledávače k nezamýšleným cestám
- Zda jsou aktuální články nalezeny po publikaci
Závěr
Maximální inkluze vyžaduje selektivní otevřenost, nikoli jediné plošné povolení.
Použijte robots.txt k oddělení vyhledávání, uživatelského načítání, trénování a prohledávání veřejných datových sad. Použijte meta tagy a hlavičky HTTP ke správě indexování a úryvků. Pro cokoli soukromého použijte ověřování. Ověřujte IP adresy prohledávačů, spíše než abyste důvěřovali samotným názvům uživatelských agentů.
Permisivní licence, jako je CC BY 4.0, může usnadnit široké opětovné použití, když si to skutečně přejete. Jasné informace o uvádění zdroje – název, autor, zdroj, licence, kanonická stránka a datum aktualizace – mohou také usnadnit vyhledávacím systémům a asistentům identifikaci a citování správného zdroje.
Nejsilnější publikační politika je proto:
**Otevřete veřejný obsah, který chcete objevit, jasně licencujte materiál, který chcete znovu použít, označte materiál, který nevlastníte, chraňte soukromé informace na úrovni serveru a každému prohledávači dejte samostatné, přezkoumatelné povolení.
Auto