Licencijavimas ir robotai maksimaliam įtraukimui: kaip priimti dirbtinio intelekto naršykles
Atnaujinta 2026 m. rugpjūčio 25 d.
Tinklalapiai dabar turi ne vieną būdą pasiekti auditoriją. Puslapis gali būti rastas per „Google“ paiešką, apibendrintas „ChatGPT“, cituojamas „Perplexity“, naudojamas „Claude“ paieškoje, rodomas per „Apple“ paslaugas arba surenkamas viešajame žiniatinklio archyve.
Šios sistemos ne visos naudoja tą pačią naršyklę ar laikosi tų pačių taisyklių. Tinklalapis, kuris blokuoja GPTBot, vis tiek gali atsirasti „ChatGPT“ paieškoje, jei leidžia OAI-SearchBot. Tinklalapis, kuris leidžia Applebot, gali likti matomas „Apple Search“ sistemoje, blokuodamas Applebot-Extended nuo dirbtinio intelekto modelio mokymo. „Google“ Google-Extended visai nėra įprasta naršyklė; tai yra „robots.txt“ valdymo žetonas.
Geriausia politika todėl nėra tiesiog „leisti dirbtinį intelektą“ arba „blokuoti dirbtinį intelektą“. Ji skirta atskirų leidimų kūrimui:
- Paieška ir atradimas
- Vartotojo prašomas duomenų gavimas
- Modelio kūrimas ir mokymas
- Viešieji duomenų rinkiniai
- Jautri, privati arba apribota medžiaga
Šiame straipsnyje pateikiamas dabartinis naršyklių sąrašas, „robots.txt“ pavyzdžiai, metatagų gairės, interneto protokolo adresų patvirtinimo metodai, „Creative Commons“ licencijavimo patarimai, standartinė teisinė kalba ir rizikos bei naudos matrica.
Keturios kontrolės priemonės, kurias turėtų suprasti kiekvienas leidėjas
1. „robots.txt“ kontroliuoja prašomą naršymą
robots.txt failas nurodo atitinkamiems automatiniams klientams, kurių puslapių jie gali prašyti. Jis naudingas naršyklių srauto valdymui ir leidėjo pageidavimų išreiškimui.
Tačiau „robots.txt“ nėra prieigos kontrolės sistema. Robotų išskyrimo protokolas teigia, kad jo taisyklės nėra prieigos autorizavimas. „Google“ taip pat perspėja, kad užblokuotas adresas vis tiek gali pasirodyti paieškos rezultatuose, jei kiti puslapiai į jį nukreipia nuorodas. Naudokite slaptažodžius, autentifikavimą arba serverio pusės prieigos kontrolę konfidencialiai informacijai. (rfc-editor.org)
2. Metatagai kontroliuoja indeksavimą ir ištraukas
Robotų metatagai ir X-Robots-Tag atsakymo antraštė gali kontroliuoti, ar puslapis bus indeksuojamas, ar paieškos variklis gali rodyti ištrauką.
Šie kontrolės mechanizmai paprastai matomi tik po to, kai naršyklei leidžiama gauti puslapį. Jei „robots.txt“ pirmiausia blokuoja puslapį, naršyklė gali niekada nematyti metatago. (developers.google.com)
3. Tinklo valdymas patvirtina naršyklę
Vartotojo-agento pavadinimą lengva nukopijuoti. Užpuolikas gali siųsti užklausą, teigdamas esąs GPTBot, Googlebot ar PerplexityBot.
Geresnis požiūris apjungia:
- Nurodytą vartotojo-agentą
- Paskelbtą interneto protokolo adresų diapazoną
- Atvirkštinės domenų vardų sistemos patvirtinimą
- Tiesioginės domenų vardų sistemos patvirtinimą
- Duomenų perdavimo greičio limitus ir užklausų stebėjimą
4. Licencija suteikia pakartotinio naudojimo teises
„robots.txt“ nurodo, ką naršyklė prašoma daryti. Licencija nurodo, ką žmonės ar organizacijos gali teisėtai daryti su medžiaga, kai reikalingas autorių teisių leidimas.
Tai yra skirtingi įrankiai. Leidimas suteikianti licencija gali sumažinti teisinį neaiškumą, tačiau ji negarantuoja, kad naršyklė apsilankys puslapyje, kad modelis jį panaudos ar kad asistentas jį pacituos.
Svarbių naršyklių sąrašas
Šis sąrašas buvo patikrintas pagal teikėjo dokumentus, prieinamus 2026 m. rugpjūčio 25 d. Vartotojo-agento pavadinimai, tikslai ir interneto protokolo adresų diapazonai gali keistis, todėl gamybos sistemos turėtų naudoti dabartinius teikėjo dokumentus ir tiesioginius adresų srautus.
| Teikėjas | Naršyklė arba „robots.txt“ žetonas | Pagrindinis tikslas | Svarbus valdymas |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Randa ir analizuoja puslapius „ChatGPT“ paieškai | Leiskite jai pagerinti tikimybę, kad puslapiai pasirodys „ChatGPT“ paieškos rezultatuose. |
| OpenAI | GPTBot | Kolekcionuoja puslapius, kurie gali būti naudojami „OpenAI“ generatyvinių dirbtinio intelekto modelių apmokymui | Leiskite arba uždrauskite atskirai nuo paieškos. |
| OpenAI | ChatGPT-User | Gauna puslapius po to, kai vartotojas paprašo „ChatGPT“ ar pasirinktinės GPT prieigos prie jų | Tai vartotojo inicijuotas, o ne automatinis žiniatinklio naršyklė, todėl „robots.txt“ taisyklės gali būti netaikomos. |
| OpenAI | OAI-AdsBot | Tikrina tinklalapius, pateiktus kaip „ChatGPT“ reklamos tikslai | Aktualu daugiausia reklamuotojams. Surinktas turinys nenaudojamas generatyvinių dirbtinio intelekto pagrindinių modelių apmokymui. |
Googlebot | Pagrindinė „Google“ paieškos naršyklė | Valdo įprastą „Google“ paieškos naršymą. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Vaizdai, vaizdo įrašai ir „Google News“ | Šie turi atskirus „robots.txt“ žetonus ir gali būti valdomi nepriklausomai. | |
GoogleOther | Bendrosios paskirties „Google“ naršymas įvairioms produktų komandoms, įskaitant tyrimus ir plėtrą | Jis nereprezentuoja vieno konkretaus „Google“ produkto. | |
Google-Extended | Kontroliuoja, ar „Google“ nuskaitytas turinys gali būti naudojamas „Gemini“ modelių apmokymui ir tam tikroms pagrindinėms sistemoms | Tai yra „robots.txt“ valdymo žetonas, o ne atskiras užklausos vartotojo-agentas. Jis neturi įtakos įprastam „Google“ paieškos įtraukimui. | |
| Anthropic | ClaudeBot | Kolekcionuoja viešąjį žiniatinklio turinį, kuris gali prisidėti prie „Claude“ modelio kūrimo | Uždrauskite jam signalizuoti, kad ateities medžiaga turėtų būti neįtraukta į „Anthropic“ mokymo duomenų rinkinius. |
| Anthropic | Claude-SearchBot | Pagerina „Claude“ paieškos rezultatų kokybę | Leiskite jam, kad būtų matomas „Claude“ paieškoje. |
| Anthropic | Claude-User | Gauna puslapius atsakydamas į vartotojo prašymą „Claude“ | Atskirai nuo automatinio naršymo. |
| Perplexity | PerplexityBot | Indeksuoja puslapius „Perplexity“ paieškos rezultatams | „Perplexity“ teigia, kad ši naršyklė nenaudojama turiniui rinkti dirbtinio intelekto pagrindinių modelių apmokymui. |
| Perplexity | Perplexity-User | Gauna puslapį po to, kai vartotojas jo paprašo | „Perplexity“ dokumentacija teigia, kad ši gavimo sistema paprastai ignoruoja „robots.txt“, nes užklausą inicijavo vartotojas. |
| Apple | Applebot | Palaiko „Apple Search“, „Spotlight“, „Siri“, „Safari“ ir kitas „Apple“ patirtis | Leiskite jam „Apple“ paieškai. |
| Apple | Applebot-Extended | Kontroliuoja, ar „Applebot“ nuskaitytas turinys gali būti naudojamas „Apple“ pagrindinių modelių apmokymui | Jis pats nenaršo puslapių. Tai yra duomenų naudojimo kontrolė. |
| Common Crawl | CCBot | Kolekcionuoja viešuosius žiniatinklio duomenis „Common Crawl“ atviram žiniatinklio archyvui | Tai nėra asistentas, tačiau jo duomenų rinkinius gali naudoti tyrėjai ir dirbtinio intelekto kūrėjai. |
| Microsoft | Bingbot | Pagrindinė „Bing“ paieškos naršyklė | Leiskite jam „Bing“ paieškai ir matomumui. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Puslapių ir vaizdo įrašų peržiūros „Microsoft“ produktams | Šios gali būti valdomos atskirai nuo „Bingbot“. |
| Amazon | Amzn-SearchBot | „Amazon“ paieška ir turinio atradimas | „Amazon“ teigia, kad nenaršo turinio generatyvinių dirbtinio intelekto modelių apmokymui. |
| Amazon | Amzn-User | Gauna dabartinę informaciją atsakydamas į vartotojo veiksmus, įskaitant „Alexa“ užklausas | Vartotojo inicijuotas ir atskirtas nuo automatinės paieškos naršymo. |
„OpenAI“ dokumentuoja savo paieškos, mokymo, reklamos ir vartotojo inicijuotas naršykles kaip atskiras kontrolės priemones. Jos dokumentacija konkrečiai rekomenduoja leisti OAI-SearchBot „ChatGPT“ paieškai, o GPTBot naudoti atskirai mokymo nuostatoms. (developers.openai.com)
„Google“ panašiai atskiria Googlebot, GoogleOther ir Google-Extended. Google-Extended neturi savo HTTP užklausos vartotojo-agento, o jo blokavimas nepašalina puslapio iš „Google“ paieškos. (developers.google.com)
„Anthropic“ dokumentuoja atskirus vaidmenis „ClaudeBot“, „Claude-SearchBot“ ir „Claude-User“. „Anthropic“ taip pat teigia, kad jos robotai laikosi „robots.txt“ ir palaiko nestandartinę Crawl-delay direktyvą. (support.anthropic.com)
„Perplexity“ skiria automatinį paieškos naršymą nuo vartotojo prašomo gavimo. Jos dabartinė dokumentacija teigia, kad „PerplexityBot“ gerbia „robots.txt“, o „Perplexity-User“ paprastai ne, nes reaguoja į vartotojo užklausą. (docs.perplexity.ai)
„Apple“ dabartinė dokumentacija daro tą patį paieškos ir mokymo skirtumą: „Applebot“ palaiko atradimą, o „Applebot-Extended“ leidžia leidėjams kontroliuoti mokymo naudojimą nepašalinant puslapių iš „Apple Search“. (support.apple.com)
Rekomenduojamos „robots.txt“ konfigūracijos
Įdėkite robots.txt kiekvieno pagrindinio kompiuterio šaknyje, pavyzdžiui:
text https://www.example.org/robots.txt
Taisyklės taikomos konkrečiam pagrindiniam kompiuteriui, protokolui ir prievadui, kuriame failas yra teikiamas. Atskiram subdomenui gali prireikti savo failo. (developers.google.com)
1 konfigūracija: maksimalus įtraukimas
Naudokite tai, kai viešas redakcinis turinys gali būti randamas, apibendrinamas, cituojamas, indeksuojamas ir surenkamas atitinkamų naršyklių.
text
Viešieji puslapiai prieinami atitinkamiems naršykliams.
User-agent: * Allow: /
Saugoti privačius, transakcinius ir administracinius kelius.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Tai leidžia pavadintas naršykles, įskaitant „OpenAI“, „Google“, „Anthropic“, „Perplexity“, „Apple“, „Common Crawl“, „Microsoft“ ir „Amazon“, nebent kita specifinė taisyklė jas blokuoja.
Neįdėkite bendros taisyklės, pvz., User-agent: * Disallow: / po šia konfigūracija. Vėlesnė ar konkretesnė grupė gali pakeisti, kaip naršyklė interpretuoja failą.
2 konfigūracija: leisti paiešką, bet blokuoti modelio kūrimo naršykles
Tai dažnai yra geriausias kompromisas leidėjams, kurie nori citatų ir paieškos srauto, bet nenori duoti leidimo modelio kūrimo duomenų rinkimui.
text
Blokuoti OpenAI modelio kūrimo naršymą.
User-agent: GPTBot Disallow: /
Blokuoti Anthropic modelio kūrimo naršymą.
User-agent: ClaudeBot Disallow: /
Blokuoti Google modelio mokymo ir susijusį pagrindinį naudojimą.
User-agent: Google-Extended Disallow: /
Blokuoti Apple pagrindinių modelių mokymo naudojimą.
User-agent: Applebot-Extended Disallow: /
Neprivaloma: blokuoti Common Crawl duomenų rinkimo funkciją.
User-agent: CCBot
Disallow: /
Leisti įprastą paieškos ir gavimo naršymą, išskyrus jautrius kelius.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Ši konfigūracija palieka OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot ir Applebot padengtus pakaitos simbolių grupe. Ji taip pat atskiria paieškos ir mokymo leidimus.
Dėl „Apple“, Applebot-Extended blokavimas, leidžiant „Applebot“, išsaugo atradimą per „Apple“ paslaugas. Dėl „Google“, Google-Extended blokavimas neblokuoja įprastos „Google“ paieškos. (developers.google.com)
3 konfigūracija: aiškiai leisti pasirinktas paieškos naršykles
Jei esamas „robots.txt“ failas blokuoja visas naršykles, pridėkite atskiras grupes paieškos naršyklėms, kurias norite priimti.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Laikykite visas kitas naršykles lauke.
User-agent: * Disallow: /
Naudodami konkrečias grupes, pakartokite jautrių kelių taisykles kiekvienoje grupėje. Kai kurios naršyklės naudoja konkrečiausią atitinkančią grupę, o ne derina ją su pakaitos simbolių grupe. „Bing“ tiesiogiai dokumentuoja šį elgesį, o „Google“ pateikia atskiras gaires dėl konkrečių naršyklių grupių. (bing.com)
Svarbūs „robots.txt“ apribojimai
- Naršyklė gali ignoruoti „robots.txt“.
- Piktybinė naršyklė gali apsimesti patikima naršykle.
- Užblokuotas puslapis vis tiek gali būti žinomas pagal jo pavadinimą arba žiniatinklio adresą.
- „robots.txt“ neapsaugo slaptažodžių, privačių failų, klientų įrašų ar konfidencialių programų programavimo sąsajų.
Crawl-delaydirektyva nėra pagrindinės Robotų išskyrimo protokolo dalis ir nepalaikoma kiekvienos naršyklės. „Anthropic“ ir „Bing“ dokumentuoja palaikymą, o „Apple“ teigia, kad „Applebot“ nesilaikocrawl-delay. (rfc-editor.org)
Metatagai ir HTTP antraštės
Viešojo puslapio pavyzdys
Viešam straipsniui naudokite aiškų pavadinimą, autorių, kanoninį žiniatinklio adresą, paskelbimo datą ir pakeitimo datą.
html
max-snippet direktyva daugiausia dokumentuojama „Google“. Negalima manyti, kad kiekviena dirbtinio intelekto naršyklė palaiko kiekvieną metadirektyvą.
Privataus arba jautraus puslapio pavyzdys
html
Naudokite tai puslapiams, kurie neturėtų pasirodyti paieškos rezultatuose. Puslapis turi išlikti naršomas pakankamai ilgai, kad naršyklė galėtų perskaityti direktyvą. Jei puslapis turi išlikti visiškai privatus, naudokite autentifikavimą arba slaptažodžio apsaugą. (developers.google.com)
Paslėpti tik jautrias sekcijas iš paieškos ištraukų
„Google“ palaiko data-nosnippet konkrečioms HTML puslapio dalims:
html
Ši pastraipa gali būti rodoma paieškos rezultatuose.
Tai naudinga kontaktiniams duomenims, vidinėms pastaboms ar vartotojų sugeneruotai informacijai. Tai nėra universali instrukcija kiekvienai dirbtinio intelekto sistemai. (developers.google.com)
Naudoti X-Robots-Tag antraštę failams
Metatagai negali būti įterpiami į nešiojamojo dokumento, vaizdo ar vaizdo įrašo failą. Vietoj to naudokite HTTP atsakymo antraštę:
text X-Robots-Tag: noindex, nosnippet
Jei puslapis turėtų likti ieškomas, bet neturėtų teikti teksto ištraukoms ar dirbtinio intelekto atsakymams, naudokite:
text X-Robots-Tag: nosnippet
„Google“ dokumentuoja X-Robots-Tag ne HTML ištekliams, o „Apple“ taip pat palaiko tai „Applebot“. (developers.google.com)
„Apple“ specifinės kontrolės priemonės
„Apple“ palaiko:
html
„Apple“ teigia, kad nosnippet neleidžia puslapiui būti naudojamam kaip papildomam kontekstui ir dabartiniam turiniui, kai „Apple“ modeliai generuoja išvestį. Puslapis vis tiek gali išlikti atrandamas per „Apple Search“, „Spotlight“, „Siri“ ir „Safari“. (support.apple.com)
Dėl mokamų puslapių, „Apple“ taip pat palaiko struktūrizuotus duomenis naudodama:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
„Apple“ teigia, kad tokie puslapiai gali likti tinkami paieškos rezultatams, tačiau nebus naudojami kaip papildomas kontekstas dirbtinio intelekto atsakymams. (support.apple.com)
Kaip patvirtinti naršyklės interneto protokolo adresus
Kodėl vartotojo-agento atitikimas nepakanka
Taisyklė, pavyzdžiui, ši, yra silpna:
text if User-Agent contains "GPTBot": allow
Bet kas gali atsiųsti tą tekstą. Geresnė taisyklė yra:
text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block
Nepasitikėkite X-Forwarded-For antrašte, nebent ji gaunama iš tarpinio serverio (proxy) ar turinio pristatymo tinklo (CDN), kurį jūsų organizacija valdo.
Teikėjo patvirtinimo metodai
| Teikėjas | Rekomenduojamas patvirtinimo metodas |
|---|---|
| OpenAI | Naudokite tiesioginius interneto protokolo adresų srautus, paskelbtus „OpenAI“ naršyklių dokumentacijoje, skirtoje „OAI-SearchBot“, „GPTBot“ ir „OAI-AdsBot“. Atnaujinkite juos automatiškai, o ne kopijuodami fiksuotus diapazonus į užkardą. |
| Naudokite „Google“ paskelbtus naršyklių diapazonus arba atlikite atvirkštinius ir tiesioginius domenų vardų sistemos patikrinimus. Tikra „Google“ naršyklė turėtų išspręsti į patvirtintą „Google“ pagrindinio kompiuterio pavadinimą ir grįžti prie originalaus adreso. | |
| Anthropic | Naudokite dabartinį paskelbtą naršyklės adresų srautą kaip antrinį tinklo patikrinimą. „Anthropic“ pagrindinis atsisakymo metodas išlieka „robots.txt“. |
| Perplexity | Suderinkite vartotojo-agentą su dabartiniu „PerplexityBot“ arba „Perplexity-User“ adresų srautu. „Perplexity“ konkrečiai rekomenduoja derinti abi sąlygas žiniatinklio programų užkardos taisyklėje. |
| Apple | Naudokite atvirkštinės domenų vardų sistemos patvirtinimą pagal applebot.apple.com, tada atlikite tiesioginę paiešką. „Apple“ taip pat skelbia dabartinius adresų diapazonus JSON sraute. |
| Common Crawl | Naudokite atvirkštinės domenų vardų sistemos patvirtinimą pagal crawl.commoncrawl.org ir dabartinį „CCBot“ adresų srautą. „Common Crawl“ pažymi, kad atvirkštinis patvirtinimas dar negalimas kai kuriems IPv6 srautams. |
| Microsoft | Naudokite oficialų „Verify Bingbot“ įrankį arba „Microsoft“ dokumentuotus atvirkštinės ir tiesioginės paieškos metodus. |
| Amazon | Naudokite „Amazon“ paskelbtus naršyklių adresų sąrašus ir suderinkite juos su atitinkamu „Amazon“ vartotojo-agentu. |
„Google“, „Apple“, „Common Crawl“, „OpenAI“, „Anthropic“ ir „Perplexity“ visos skelbia konkrečias teikėjų metodikas arba adresų srautus. Šie sąrašai gali keistis, todėl suplanuotas atnaujinimo procesas yra saugesnis nei nuolatinis rankiniu būdu kopijuotas sąrašas. (developers.google.com)
Paprasčiausia užkardos konstrukcija galėtų atrodyti taip:
text leisti OAI-SearchBot tik tada, kai šaltinio adresas yra dabartiniame OpenAI paieškos diapazone leisti GPTBot tik tada, kai šaltinio adresas yra dabartiniame OpenAI mokymo diapazone leisti PerplexityBot tik tada, kai šaltinio adresas yra dabartiniame PerplexityBot diapazone leisti Applebot tik tada, kai atvirkštinės ir tiesioginės DNS patvirtinimas sėkmingas leisti CCBot tik tada, kai atvirkštinės DNS ir dabartinio Common Crawl diapazono atitikimas
apriboti visų patvirtintų naršyklių srautą blokuoti arba užginčyti nepatvirtintas užklausas, teigiančias esančios patikimos naršyklės
Netaikykite plačios leidimo taisyklės visam debesų paslaugų teikėjui. Teisėta naršyklė gali naudoti debesies infrastruktūrą, tačiau didžioji dalis srauto iš to debesų paslaugų teikėjo nebūtinai yra naršyklė.
Kaip atviras licencijavimas veikia įtraukimą
CC BY 4.0 paprasta kalba
„Creative Commons Attribution 4.0 International“ licencija, paprastai vadinama CC BY 4.0, leidžia žmonėms:
- Kopijuoti ir platinti kūrinį
- Adaptuoti, versti, perdirbti ir kurti remiantis juo
- Naudoti komerciniais tikslais
Pagrindinės sąlygos yra šios:
- Tinkamai nurodyti autorystę
- Pateikti nuorodą į licenciją
- Nurodyti, ar buvo atlikti pakeitimai
- Nesiūlyti, kad originalus kūrėjas pritaria pakartotiniam naudojimui
- Nepridėti teisinių ar techninių apribojimų, kurie trukdo licencijos leidžiamam naudojimui
„Creative Commons“ taip pat perspėja, kad licencija gali neapimti privatumo teisių, viešumo teisių, moralinių teisių, prekių ženklų teisių, patentų teisių ar trečiųjų šalių medžiagos. (creativecommons.org)
Licencija pati savaime nėra naršyklės kvietimas
Uždėjus „CC BY 4.0“ ant puslapio, negarantuojama, kad organizacija jį nuskaitys. Naršyklė vis tiek gali būti užblokuota dėl:
- „robots.txt“
- Turinio pristatymo tinklo (CDN)
- Žiniatinklio programų užkardos (WAF)
- Duomenų perdavimo greičio apribojimo
- „JavaScript“ iššūkio
- Prisijungimo sienos
- Prasto serverio atsako
- Neprieinamo svetainės žemėlapio
Priešingai, leidimas naršyklei automatiškai nesuteikia visų autorių teisių leidimų, reikalingų kiekvienam vėlesniam naudojimui. „robots.txt“ ir licencijavimas turėtų būti sukurti kartu.
Kodėl CC BY gali palaikyti platesnį įtraukimą
Aiškus leidimas suteikianti licencija gali palengvinti leidėjo politikos supratimą duomenų komandoms, paieškos sistemoms ir asistentų operatoriams. Tai gali sumažinti neaiškumus dėl kopijavimo, adaptavimo, komercinio naudojimo, vertimo ir platinimo, kai šioms veikloms reikalingas autorių teisių leidimas.
Tačiau „Creative Commons“ paaiškina, kad dirbtinio intelekto mokymas yra teisiškai sudėtingas. Ribojanti licencija ne visada yra efektyvus būdas užkirsti kelią mokymui, nes kai kurie mokymo naudojimo atvejai gali būti leidžiami autorių teisių išimtimis ar apribojimais. „Creative Commons“ taip pat pažymi, kad licencijos sąlygos gali būti sunkiai pritaikomos mašininiam mokymui ir modelių išvestims. (creativecommons.org)
Praktinė pamoka yra:
Naudokite CC BY, kai nuoširdžiai norite plataus teisėto pakartotinio naudojimo. Nenaudokite ribojančios „Creative Commons“ licencijos kaip garantuoto dirbtinio intelekto mokymo atsisakymo galimybės.
Autoriaus nurodymas pagerina šaltinio aiškumą
„Creative Commons“ rekomenduoja TASL metodą:
- Pavadinimas
- Autorius
- Šaltinis
- Licencija
Pavyzdžiui:
„Licencijavimas ir robotai maksimaliam įtraukimui“, „Example Publishing“, https://www.example.org/articles/ai-crawlers, licencijuota pagal „Creative Commons Attribution 4.0 International“. Atlikti pakeitimai: atnaujintas naršyklių sąrašas.
Aiškus autoriaus nurodymas nepriverčia kiekvieno asistento cituoti puslapį. Tačiau jis palengvina teisingą citavimą, kai sistema išskiria puslapio pavadinimą, autorių, šaltinį ir licencijos informaciją. (wiki.creativecommons.org)
Pridėti struktūrizuotą straipsnio informaciją
Naudokite matomą informaciją ir struktūrizuotus duomenis kartu:
html
„Google“ rekomenduoja aiškią autoriaus informaciją, autorių puslapius, paskelbimo datas, pakeitimo datas ir stabilius kanoninius puslapius. Šie signalai gali padėti paieškos sistemoms suprasti, kas sukūrė medžiagą ir kuri versija yra autoritetinga. Jie negarantuoja reitingavimo, įtraukimo ar citavimo. (developers.google.com)
Standartinė teisinė kalba atvirai, citavimui draugiškai svetainei
Ši kalba yra pavyzdinė, o ne teisinė konsultacija. Prieš naudodami, kreipkitės į teisininkus, kad jie ją pritaikytų jūsų jurisdikcijai, nuosavybės struktūrai, privatumo įsipareigojimams ir trečiųjų šalių turiniui.
CC BY 4.0 licencijavimo pareiškimas
text
Turinio licencija
Išskyrus atvejus, kai nurodyta kitaip, originalus tekstas ir originali redakcinė medžiaga šiame puslapyje yra licencijuota pagal Creative Commons Attribution 4.0 International licenciją:
https://creativecommons.org/licenses/by/4.0/
Šis leidimas leidžia kopijuoti, platinti, adaptuoti, versti, naudoti komerciniais tikslais, mašininiu būdu apdoroti, indeksuoti paieškai, gauti, apibendrinti ir naudoti dirbtinio intelekto sistemose, su sąlyga, kad laikomasi licencijos sąlygų.
Pageidaujamas priskyrimas:
„[Puslapio pavadinimas]“, autorius [autorius ar organizacija], [kanoninis puslapio adresas], paskelbta arba atnaujinta [data], licencijuota pagal Creative Commons Attribution 4.0 International. Atlikti pakeitimai: [aprašykite pakeitimus, arba nurodykite „jokių“].
Prašome išsaugoti autoriaus, leidėjo, šaltinio, licencijos ir pakeitimo informaciją, kai tik įmanoma. Šis pageidaujamas priskyrimo vadovas neprideda apribojimų Creative Commons licencijai ir nepakeičia licencijos teksto.
Frazė „įskaitant dirbtinio intelekto sistemas“ paaiškina leidėjo ketinimus. Ji neturėtų būti naudojama apsimetant, kad leidėjas turi teises į kito asmens sukurtą medžiagą.
Prekės ženklo, privatumo ir trečiųjų šalių teisių pranešimas
text
Prekės ženklo, privatumo ir trečiųjų šalių teisės
Aukščiau nurodyta licencija apima tik originalias medžiagas, nurodytas kaip licencijuotos. Ji nesuteikia leidimo naudoti:
- Prekių ženklus, paslaugų ženklus, logotipus ar prekybos apipavidalinimą
- Žmonių vardus, atvaizdus ar panašumus
- Privatią, konfidencialią, sąskaitos, sveikatos, finansinę ar saugumo informaciją
- Vartotojų pateiktus duomenis, nebent jie atskirai nurodomi kaip licencijuoti
- Nuotraukas, iliustracijas, žemėlapius, vaizdo įrašus, muziką, citatas ar kitas trečiųjų šalių medžiagas
- Turinį, pažymėtą „visos teisės saugomos“ arba kuriam taikoma atskira licencija
„Example Publishing“ pavadinimo, logotipų ir ženklų naudojimas neturi reikšti rėmimo, patvirtinimo, partnerystės ar pritarimo. Prašome pateikti nuorodą į originalų puslapį ir aiškiai atskirti citatas, parafrazes, santraukas ir sugeneruotą medžiagą.
Ši kalba yra svarbi, nes „Creative Commons“ licencijos automatiškai nesuteikia visų teisinių teisių, susijusių su puslapiu. (creativecommons.org)
Paieškos ir asistento citavimo gairės
text
Paieškos ir asistento citavimo gairės
Mes sveikiname suderinamą paieškos indeksavimą, vartotojo prašomą gavimą, citavimą ir licencijuotos medžiagos apibendrinimą šioje svetainėje.
Cituojant šią svetainę, prašome naudoti puslapio pavadinimą, autorių ar leidėją, kanoninį puslapio adresą, paskelbimo ar atnaujinimo datą ir tiesioginę nuorodą į šaltinį. Prašome nurodyti šaltinį kaip vieną iš bet kurių naudotų šaltinių, atskirti sugeneruotą analizę nuo cituojamos medžiagos ir nenurodyti ar nesiūlyti, kad „Example Publishing“ pritaria sugeneruotam atsakymui, produktui, asmeniui ar paslaugai.
Šios gairės skirtos pagerinti tikslumą ir priskyrimą. Jos nesuteikia teisių, viršijančių taikomą turinio licenciją, ir nelicencijuoja prekių ženklų, asmeninės informacijos, konfidencialios informacijos ar trečiųjų šalių medžiagos.
Jei norite matomumo paieškoje, bet nenorite suteikti plačios mokymo licencijos
text
Prieiga prie paieškos ir autorių teisės
Į mūsų viešuosius puslapius gali patekti atitinkamos paieškos ir gavimo naršyklės, nurodytos mūsų robots.txt faile. Šis leidimas skirtas palaikyti atradimą, paieškos rezultatus, vartotojo prašomą gavimą ir citavimą.
Išskyrus atvejus, kai nurodyta atskira licencija, originalus turinys išlieka su visomis teisėmis. Prieiga prie viešojo puslapio nesuteikia atskiros licencijos modelio kūrimui, mokymui, platinimui, komerciniam pakartotiniam naudojimui ar išvestinių kūrinių kūrimui, išskyrus teises, numatytas taikytina teise.
Kreipdamiesi į šią medžiagą, prašome cituoti kanoninį puslapio adresą ir leidėją. Niekas šioje svetainėje nesuteikia leidimo naudoti prekių ženklus, logotipus, asmeninę informaciją, konfidencialią informaciją ar trečiųjų šalių turinį.
Nededėkite CC BY pareiškimo ir visų teisių saugomos pareiškimo ant tos pačios medžiagos. Aiškiai nurodykite, kuri licencija taikoma kokiam turiniui.
Rizikos ir naudos matrica atviram licencijavimui
Autorių teisių įstatymai ir dirbtinio intelekto mokymo taisyklės skiriasi priklausomai nuo šalies ir išlieka neišspręstos. Jungtinių Valstijų autorių teisių biuras ir toliau nagrinėja šiuos klausimus, o „Creative Commons“ apibūdina dirbtinio intelekto mokymą kaip priklausantį nuo faktų ir teisiškai sudėtingą. (copyright.gov)
| Metodas | Įtraukimo potencialas | Pagrindiniai pranašumai | Pagrindinės rizikos | Geriausiai tinka |
|---|---|---|---|---|
| CC BY 4.0 | Labai didelis | Platus kopijavimas, adaptavimas, komercinis naudojimas, vertimas, indeksavimas ir su modeliu susijęs pakartotinis naudojimas, kai reikalingas autorių teisių leidimas | Komerciniai konkurentai gali pakartotinai naudoti arba adaptuoti turinį; priskyrimas gali būti netobulas; licencija negali kontroliuoti privatumo, prekių ženklų ar trečiųjų šalių teisių | Leidėjai, kurie nori plačiausio teisėto pakartotinio naudojimo ir stipraus šaltinio priskyrimo |
| CC BY-SA 4.0 | Didelis, bet sudėtingesnis | Skatina atvirą dalijimosi ciklą ir reikalauja, kad adaptacijos išliktų pagal suderinamas sąlygas | „ShareAlike“ taisykles gali būti sunku taikyti duomenų rinkiniams, modelių apmokymui ir viešoms išvestims; kai kurios organizacijos gali vengti medžiagos dėl neaiškumo | Atviri edukaciniai ir viešojo intereso projektai, kurie nori, kad tolesnės adaptacijos išliktų atviros |
| CC BY-NC 4.0 | Vidutinis arba žemas | Apriboja naudojimą, skirtą visų pirma komercinei naudai ar piniginei kompensacijai | „Nekomerciškas“ gali būti sunkiai interpretuojamas; gali neįtraukti komercinės paieškos, modelių ir asistentų naudojimo; tai nėra garantuotas mokymo atsisakymas | Medžiaga, skirta ne pelno, edukaciniam ar bendruomenės naudojimui |
| CC BY-ND 4.0 | Vidutinis | Leidžia dalintis, ribodama adaptacijas | Vertimas, transformacija ir kai kurie asistentų naudojimo atvejai gali tapti teisiškai neaiškūs; mažiau patrauklus sistemoms, kurios apibendrina ar perdirba | Oficialūs pranešimai ar kūriniai, kurie turi likti nepakeisti |
| CC0 arba viešojo domeno dedikacija | Labai didelis | Supaprastina pakartotinį naudojimą ir pašalina daugumą autorių teisių sąlygų, kurios yra teisiškai veiksmingos | Nėra privalomo priskyrimo; silpna prekės ženklo pateikimo kontrolė; privatumo, prekių ženklų ir viešumo teisės lieka atskiros | Faktai, duomenų rinkiniai, informacinė medžiaga ar kūriniai, skirti neribotam pakartotiniam naudojimui |
| Visos teisės saugomos plius atviras paieškos naršymas | Aukštas paieškai, žemesnis mokymui | Gali išsaugoti paieškos ir citavimo matomumą, nesuteikiant plačios pakartotinio naudojimo licencijos | Didesnis teisinis neaiškumas modelių kūrėjams; gali sumažinti įtraukimą į mokymo duomenų rinkinius ir komercinio pakartotinio naudojimo sistemas | Leidėjai, kurie nori atradimo ir citatų, bet nori derėtis dėl platesnių licencijų atskirai |
Daugelio organizacijų subalansuota strategija yra:
- CC BY 4.0 originaliam viešam redakciniam tekstui
- Atskiri žymėjimai trečiųjų šalių medžiagai
- Jokios viešos asmeninės ar konfidencialios informacijos
- Leisti paieškos ir gavimo naršykles
- Leisti modelio kūrimo naršykles tik tuo atveju, jei organizacija tikrai priima tokį naudojimą
- Naudoti aiškų priskyrimą ir kanonines nuorodas
- Apsaugoti prekių ženklus atskiru prekės ženklo pranešimu
Praktinis įgyvendinimo kontrolinis sąrašas
Turinys ir licencijavimas
- Nustatykite, kam priklauso kiekvienas puslapis, paveikslėlis, diagrama, vaizdo įrašas ir citata.
- Licencijuokite tik tą medžiagą, kurios teises valdo jūsų organizacija.
- Atskiras trečiųjų šalių medžiagos žymėjimas.
- Pridėkite matomą licencijos pareiškimą.
- Pateikite pageidaujamą citatą, naudodami pavadinimą, autorių, šaltinį ir licenciją.
- Logotipus, prekių ženklus, asmens duomenis ir konfidencialią informaciją laikykite už licencijos ribų.
„robots.txt“
- Sukurkite viešą „robots.txt“ failą kiekvieno pagrindinio kompiuterio šaknyje.
- Leiskite paieškos naršykles atskirai nuo mokymo naršyklių.
- Blokuokite administracinius, paskyros, užsakymų, privačius ir vidinių programų kelius.
- Nepasikliaukite „robots.txt“ saugumui.
- Patikrinkite failą po kiekvieno didelio svetainės diegimo.
Metatagai
- Naudokite kanonines nuorodas.
- Pridėkite autorių, paskelbimo datą ir pakeitimo datą.
- Naudokite
noindexpuslapiams, kurie neturėtų pasirodyti paieškoje. - Naudokite
nosnippetarbadata-nosnippetjautriems ištraukoms, kur palaikoma. - Naudokite
X-Robots-Tagnešiojamiesiems dokumentų failams, vaizdams ir kitiems ne HTML ištekliams. - Atminkite, kad naršyklė turi galėti gauti puslapį, kol ji galės perskaityti jo metatagus.
Tinklo saugumas
- Registruokite vartotojo-agento eilutes, šaltinio adresus, atsakymo kodus ir užklausų kelius.
- Patvirtinkite patikimas naršykles, naudodami oficialius adresų srautus arba domenų vardų sistemos metodus.
- Automatiškai atnaujinkite adresų srautus.
- Suderinkite vartotojo-agento ir šaltinio-adresų patikrinimus.
- Apribokite patvirtintų naršyklių srautą, o ne suteikite joms neribotą prieigą.
- Užginčykite arba blokuokite užklausas, kurios teigia esančios patikimos naršyklės, bet nepatvirtinamos.
Matavimas
Stebėti:
- Apsilankymus iš dirbtinio intelekto paieškos paslaugų
- Nukreipimus į originalų puslapį
- Citavimo dažnumą
- Serverio apkrovą pagal naršyklę
- Užklausas, grąžinančias
403,404arba429 - Naršyklės prieigą prie netyčinių kelių
- Ar dabartiniai straipsniai randami po paskelbimo
Išvada
Maksimaliam įtraukimui reikalingas selektyvus atvirumas, o ne vienas bendras leidimas.
Naudokite „robots.txt“, kad atskirtumėte paiešką, vartotojo gavimą, mokymą ir viešųjų duomenų rinkinių naršymą. Naudokite metatagus ir HTTP antraštes, kad valdytumėte indeksavimą ir ištraukas. Naudokite autentifikavimą viskam, kas privatu. Patvirtinkite naršyklės interneto protokolo adresus, o ne pasitikėkite vien vartotojo-agento pavadinimais.
Leidimas suteikianti licencija, pvz., CC BY 4.0, gali palengvinti platų pakartotinį naudojimą, kai to nuoširdžiai norite. Aiškūs priskyrimo duomenys – pavadinimas, autorius, šaltinis, licencija, kanoninis puslapis ir atnaujinimo data – taip pat gali palengvinti paieškos sistemoms ir asistentams teisingo šaltinio identifikavimą ir citavimą.
Todėl stipriausia leidybos politika yra:
**Atverkite viešąjį turinį, kurį norite, kad būtų rastas, aiškiai licencijuokite medžiagą, kurią norite pakartotinai naudoti, pažymėkite medžiagą, kurios jums nepriklauso, apsaugokite privačią informaciją serverio lygiu ir suteikite kiekvienai naršyklei atskirą, peržiūrimą leidimą.
Auto