AutoPodAutoPod

Licencijavimas ir robotai maksimaliam įtraukimui: kaip priimti dirbtinio intelekto naršykles

21 min. skaitymo
Audio straipsnis
Licencijavimas ir robotai maksimaliam įtraukimui: kaip priimti dirbtinio intelekto naršykles
0:000:00
Licencijavimas ir robotai maksimaliam įtraukimui: kaip priimti dirbtinio intelekto naršykles

Licencijavimas ir robotai maksimaliam įtraukimui: kaip priimti dirbtinio intelekto naršykles

Atnaujinta 2026 m. rugpjūčio 25 d.

Tinklalapiai dabar turi ne vieną būdą pasiekti auditoriją. Puslapis gali būti rastas per „Google“ paiešką, apibendrintas „ChatGPT“, cituojamas „Perplexity“, naudojamas „Claude“ paieškoje, rodomas per „Apple“ paslaugas arba surenkamas viešajame žiniatinklio archyve.

Šios sistemos ne visos naudoja tą pačią naršyklę ar laikosi tų pačių taisyklių. Tinklalapis, kuris blokuoja GPTBot, vis tiek gali atsirasti „ChatGPT“ paieškoje, jei leidžia OAI-SearchBot. Tinklalapis, kuris leidžia Applebot, gali likti matomas „Apple Search“ sistemoje, blokuodamas Applebot-Extended nuo dirbtinio intelekto modelio mokymo. „Google“ Google-Extended visai nėra įprasta naršyklė; tai yra „robots.txt“ valdymo žetonas.

Geriausia politika todėl nėra tiesiog „leisti dirbtinį intelektą“ arba „blokuoti dirbtinį intelektą“. Ji skirta atskirų leidimų kūrimui:

  1. Paieška ir atradimas
  2. Vartotojo prašomas duomenų gavimas
  3. Modelio kūrimas ir mokymas
  4. Viešieji duomenų rinkiniai
  5. Jautri, privati arba apribota medžiaga

Šiame straipsnyje pateikiamas dabartinis naršyklių sąrašas, „robots.txt“ pavyzdžiai, metatagų gairės, interneto protokolo adresų patvirtinimo metodai, „Creative Commons“ licencijavimo patarimai, standartinė teisinė kalba ir rizikos bei naudos matrica.

Keturios kontrolės priemonės, kurias turėtų suprasti kiekvienas leidėjas

1. „robots.txt“ kontroliuoja prašomą naršymą

robots.txt failas nurodo atitinkamiems automatiniams klientams, kurių puslapių jie gali prašyti. Jis naudingas naršyklių srauto valdymui ir leidėjo pageidavimų išreiškimui.

Tačiau „robots.txt“ nėra prieigos kontrolės sistema. Robotų išskyrimo protokolas teigia, kad jo taisyklės nėra prieigos autorizavimas. „Google“ taip pat perspėja, kad užblokuotas adresas vis tiek gali pasirodyti paieškos rezultatuose, jei kiti puslapiai į jį nukreipia nuorodas. Naudokite slaptažodžius, autentifikavimą arba serverio pusės prieigos kontrolę konfidencialiai informacijai. (rfc-editor.org)

2. Metatagai kontroliuoja indeksavimą ir ištraukas

Robotų metatagai ir X-Robots-Tag atsakymo antraštė gali kontroliuoti, ar puslapis bus indeksuojamas, ar paieškos variklis gali rodyti ištrauką.

Šie kontrolės mechanizmai paprastai matomi tik po to, kai naršyklei leidžiama gauti puslapį. Jei „robots.txt“ pirmiausia blokuoja puslapį, naršyklė gali niekada nematyti metatago. (developers.google.com)

3. Tinklo valdymas patvirtina naršyklę

Vartotojo-agento pavadinimą lengva nukopijuoti. Užpuolikas gali siųsti užklausą, teigdamas esąs GPTBot, Googlebot ar PerplexityBot.

Geresnis požiūris apjungia:

  • Nurodytą vartotojo-agentą
  • Paskelbtą interneto protokolo adresų diapazoną
  • Atvirkštinės domenų vardų sistemos patvirtinimą
  • Tiesioginės domenų vardų sistemos patvirtinimą
  • Duomenų perdavimo greičio limitus ir užklausų stebėjimą

4. Licencija suteikia pakartotinio naudojimo teises

„robots.txt“ nurodo, ką naršyklė prašoma daryti. Licencija nurodo, ką žmonės ar organizacijos gali teisėtai daryti su medžiaga, kai reikalingas autorių teisių leidimas.

Tai yra skirtingi įrankiai. Leidimas suteikianti licencija gali sumažinti teisinį neaiškumą, tačiau ji negarantuoja, kad naršyklė apsilankys puslapyje, kad modelis jį panaudos ar kad asistentas jį pacituos.

Svarbių naršyklių sąrašas

Šis sąrašas buvo patikrintas pagal teikėjo dokumentus, prieinamus 2026 m. rugpjūčio 25 d. Vartotojo-agento pavadinimai, tikslai ir interneto protokolo adresų diapazonai gali keistis, todėl gamybos sistemos turėtų naudoti dabartinius teikėjo dokumentus ir tiesioginius adresų srautus.

TeikėjasNaršyklė arba „robots.txt“ žetonasPagrindinis tikslasSvarbus valdymas
OpenAIOAI-SearchBotRanda ir analizuoja puslapius „ChatGPT“ paieškaiLeiskite jai pagerinti tikimybę, kad puslapiai pasirodys „ChatGPT“ paieškos rezultatuose.
OpenAIGPTBotKolekcionuoja puslapius, kurie gali būti naudojami „OpenAI“ generatyvinių dirbtinio intelekto modelių apmokymuiLeiskite arba uždrauskite atskirai nuo paieškos.
OpenAIChatGPT-UserGauna puslapius po to, kai vartotojas paprašo „ChatGPT“ ar pasirinktinės GPT prieigos prie jųTai vartotojo inicijuotas, o ne automatinis žiniatinklio naršyklė, todėl „robots.txt“ taisyklės gali būti netaikomos.
OpenAIOAI-AdsBotTikrina tinklalapius, pateiktus kaip „ChatGPT“ reklamos tikslaiAktualu daugiausia reklamuotojams. Surinktas turinys nenaudojamas generatyvinių dirbtinio intelekto pagrindinių modelių apmokymui.
GoogleGooglebotPagrindinė „Google“ paieškos naršyklėValdo įprastą „Google“ paieškos naršymą.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-NewsVaizdai, vaizdo įrašai ir „Google News“Šie turi atskirus „robots.txt“ žetonus ir gali būti valdomi nepriklausomai.
GoogleGoogleOtherBendrosios paskirties „Google“ naršymas įvairioms produktų komandoms, įskaitant tyrimus ir plėtrąJis nereprezentuoja vieno konkretaus „Google“ produkto.
GoogleGoogle-ExtendedKontroliuoja, ar „Google“ nuskaitytas turinys gali būti naudojamas „Gemini“ modelių apmokymui ir tam tikroms pagrindinėms sistemomsTai yra „robots.txt“ valdymo žetonas, o ne atskiras užklausos vartotojo-agentas. Jis neturi įtakos įprastam „Google“ paieškos įtraukimui.
AnthropicClaudeBotKolekcionuoja viešąjį žiniatinklio turinį, kuris gali prisidėti prie „Claude“ modelio kūrimoUždrauskite jam signalizuoti, kad ateities medžiaga turėtų būti neįtraukta į „Anthropic“ mokymo duomenų rinkinius.
AnthropicClaude-SearchBotPagerina „Claude“ paieškos rezultatų kokybęLeiskite jam, kad būtų matomas „Claude“ paieškoje.
AnthropicClaude-UserGauna puslapius atsakydamas į vartotojo prašymą „Claude“Atskirai nuo automatinio naršymo.
PerplexityPerplexityBotIndeksuoja puslapius „Perplexity“ paieškos rezultatams„Perplexity“ teigia, kad ši naršyklė nenaudojama turiniui rinkti dirbtinio intelekto pagrindinių modelių apmokymui.
PerplexityPerplexity-UserGauna puslapį po to, kai vartotojas jo paprašo„Perplexity“ dokumentacija teigia, kad ši gavimo sistema paprastai ignoruoja „robots.txt“, nes užklausą inicijavo vartotojas.
AppleApplebotPalaiko „Apple Search“, „Spotlight“, „Siri“, „Safari“ ir kitas „Apple“ patirtisLeiskite jam „Apple“ paieškai.
AppleApplebot-ExtendedKontroliuoja, ar „Applebot“ nuskaitytas turinys gali būti naudojamas „Apple“ pagrindinių modelių apmokymuiJis pats nenaršo puslapių. Tai yra duomenų naudojimo kontrolė.
Common CrawlCCBotKolekcionuoja viešuosius žiniatinklio duomenis „Common Crawl“ atviram žiniatinklio archyvuiTai nėra asistentas, tačiau jo duomenų rinkinius gali naudoti tyrėjai ir dirbtinio intelekto kūrėjai.
MicrosoftBingbotPagrindinė „Bing“ paieškos naršyklėLeiskite jam „Bing“ paieškai ir matomumui.
MicrosoftMicrosoftPreview, BingVideoPreviewPuslapių ir vaizdo įrašų peržiūros „Microsoft“ produktamsŠios gali būti valdomos atskirai nuo „Bingbot“.
AmazonAmzn-SearchBot„Amazon“ paieška ir turinio atradimas„Amazon“ teigia, kad nenaršo turinio generatyvinių dirbtinio intelekto modelių apmokymui.
AmazonAmzn-UserGauna dabartinę informaciją atsakydamas į vartotojo veiksmus, įskaitant „Alexa“ užklausasVartotojo inicijuotas ir atskirtas nuo automatinės paieškos naršymo.

„OpenAI“ dokumentuoja savo paieškos, mokymo, reklamos ir vartotojo inicijuotas naršykles kaip atskiras kontrolės priemones. Jos dokumentacija konkrečiai rekomenduoja leisti OAI-SearchBot „ChatGPT“ paieškai, o GPTBot naudoti atskirai mokymo nuostatoms. (developers.openai.com)

„Google“ panašiai atskiria Googlebot, GoogleOther ir Google-Extended. Google-Extended neturi savo HTTP užklausos vartotojo-agento, o jo blokavimas nepašalina puslapio iš „Google“ paieškos. (developers.google.com)

„Anthropic“ dokumentuoja atskirus vaidmenis „ClaudeBot“, „Claude-SearchBot“ ir „Claude-User“. „Anthropic“ taip pat teigia, kad jos robotai laikosi „robots.txt“ ir palaiko nestandartinę Crawl-delay direktyvą. (support.anthropic.com)

„Perplexity“ skiria automatinį paieškos naršymą nuo vartotojo prašomo gavimo. Jos dabartinė dokumentacija teigia, kad „PerplexityBot“ gerbia „robots.txt“, o „Perplexity-User“ paprastai ne, nes reaguoja į vartotojo užklausą. (docs.perplexity.ai)

„Apple“ dabartinė dokumentacija daro tą patį paieškos ir mokymo skirtumą: „Applebot“ palaiko atradimą, o „Applebot-Extended“ leidžia leidėjams kontroliuoti mokymo naudojimą nepašalinant puslapių iš „Apple Search“. (support.apple.com)

Rekomenduojamos „robots.txt“ konfigūracijos

Įdėkite robots.txt kiekvieno pagrindinio kompiuterio šaknyje, pavyzdžiui:

text https://www.example.org/robots.txt

Taisyklės taikomos konkrečiam pagrindiniam kompiuteriui, protokolui ir prievadui, kuriame failas yra teikiamas. Atskiram subdomenui gali prireikti savo failo. (developers.google.com)

1 konfigūracija: maksimalus įtraukimas

Naudokite tai, kai viešas redakcinis turinys gali būti randamas, apibendrinamas, cituojamas, indeksuojamas ir surenkamas atitinkamų naršyklių.

text

Viešieji puslapiai prieinami atitinkamiems naršykliams.

User-agent: * Allow: /

Saugoti privačius, transakcinius ir administracinius kelius.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Tai leidžia pavadintas naršykles, įskaitant „OpenAI“, „Google“, „Anthropic“, „Perplexity“, „Apple“, „Common Crawl“, „Microsoft“ ir „Amazon“, nebent kita specifinė taisyklė jas blokuoja.

Neįdėkite bendros taisyklės, pvz., User-agent: * Disallow: / po šia konfigūracija. Vėlesnė ar konkretesnė grupė gali pakeisti, kaip naršyklė interpretuoja failą.

2 konfigūracija: leisti paiešką, bet blokuoti modelio kūrimo naršykles

Tai dažnai yra geriausias kompromisas leidėjams, kurie nori citatų ir paieškos srauto, bet nenori duoti leidimo modelio kūrimo duomenų rinkimui.

text

Blokuoti OpenAI modelio kūrimo naršymą.

User-agent: GPTBot Disallow: /

Blokuoti Anthropic modelio kūrimo naršymą.

User-agent: ClaudeBot Disallow: /

Blokuoti Google modelio mokymo ir susijusį pagrindinį naudojimą.

User-agent: Google-Extended Disallow: /

Blokuoti Apple pagrindinių modelių mokymo naudojimą.

User-agent: Applebot-Extended Disallow: /

Neprivaloma: blokuoti Common Crawl duomenų rinkimo funkciją.

User-agent: CCBot

Disallow: /

Leisti įprastą paieškos ir gavimo naršymą, išskyrus jautrius kelius.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Ši konfigūracija palieka OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot ir Applebot padengtus pakaitos simbolių grupe. Ji taip pat atskiria paieškos ir mokymo leidimus.

Dėl „Apple“, Applebot-Extended blokavimas, leidžiant „Applebot“, išsaugo atradimą per „Apple“ paslaugas. Dėl „Google“, Google-Extended blokavimas neblokuoja įprastos „Google“ paieškos. (developers.google.com)

3 konfigūracija: aiškiai leisti pasirinktas paieškos naršykles

Jei esamas „robots.txt“ failas blokuoja visas naršykles, pridėkite atskiras grupes paieškos naršyklėms, kurias norite priimti.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Laikykite visas kitas naršykles lauke.

User-agent: * Disallow: /

Naudodami konkrečias grupes, pakartokite jautrių kelių taisykles kiekvienoje grupėje. Kai kurios naršyklės naudoja konkrečiausią atitinkančią grupę, o ne derina ją su pakaitos simbolių grupe. „Bing“ tiesiogiai dokumentuoja šį elgesį, o „Google“ pateikia atskiras gaires dėl konkrečių naršyklių grupių. (bing.com)

Svarbūs „robots.txt“ apribojimai

  • Naršyklė gali ignoruoti „robots.txt“.
  • Piktybinė naršyklė gali apsimesti patikima naršykle.
  • Užblokuotas puslapis vis tiek gali būti žinomas pagal jo pavadinimą arba žiniatinklio adresą.
  • „robots.txt“ neapsaugo slaptažodžių, privačių failų, klientų įrašų ar konfidencialių programų programavimo sąsajų.
  • Crawl-delay direktyva nėra pagrindinės Robotų išskyrimo protokolo dalis ir nepalaikoma kiekvienos naršyklės. „Anthropic“ ir „Bing“ dokumentuoja palaikymą, o „Apple“ teigia, kad „Applebot“ nesilaiko crawl-delay. (rfc-editor.org)

Metatagai ir HTTP antraštės

Viešojo puslapio pavyzdys

Viešam straipsniui naudokite aiškų pavadinimą, autorių, kanoninį žiniatinklio adresą, paskelbimo datą ir pakeitimo datą.

html

max-snippet direktyva daugiausia dokumentuojama „Google“. Negalima manyti, kad kiekviena dirbtinio intelekto naršyklė palaiko kiekvieną metadirektyvą.

Privataus arba jautraus puslapio pavyzdys

html

Naudokite tai puslapiams, kurie neturėtų pasirodyti paieškos rezultatuose. Puslapis turi išlikti naršomas pakankamai ilgai, kad naršyklė galėtų perskaityti direktyvą. Jei puslapis turi išlikti visiškai privatus, naudokite autentifikavimą arba slaptažodžio apsaugą. (developers.google.com)

Paslėpti tik jautrias sekcijas iš paieškos ištraukų

„Google“ palaiko data-nosnippet konkrečioms HTML puslapio dalims:

html

Ši pastraipa gali būti rodoma paieškos rezultatuose.

Čia įrašomi asmeniniai telefono numeriai, privatūs el. pašto adresai arba vidinės pastabos.

Tai naudinga kontaktiniams duomenims, vidinėms pastaboms ar vartotojų sugeneruotai informacijai. Tai nėra universali instrukcija kiekvienai dirbtinio intelekto sistemai. (developers.google.com)

Naudoti X-Robots-Tag antraštę failams

Metatagai negali būti įterpiami į nešiojamojo dokumento, vaizdo ar vaizdo įrašo failą. Vietoj to naudokite HTTP atsakymo antraštę:

text X-Robots-Tag: noindex, nosnippet

Jei puslapis turėtų likti ieškomas, bet neturėtų teikti teksto ištraukoms ar dirbtinio intelekto atsakymams, naudokite:

text X-Robots-Tag: nosnippet

„Google“ dokumentuoja X-Robots-Tag ne HTML ištekliams, o „Apple“ taip pat palaiko tai „Applebot“. (developers.google.com)

„Apple“ specifinės kontrolės priemonės

„Apple“ palaiko:

html

„Apple“ teigia, kad nosnippet neleidžia puslapiui būti naudojamam kaip papildomam kontekstui ir dabartiniam turiniui, kai „Apple“ modeliai generuoja išvestį. Puslapis vis tiek gali išlikti atrandamas per „Apple Search“, „Spotlight“, „Siri“ ir „Safari“. (support.apple.com)

Dėl mokamų puslapių, „Apple“ taip pat palaiko struktūrizuotus duomenis naudodama:

{ "@context": "https://schema.org", "isAccessibleForFree": false }

„Apple“ teigia, kad tokie puslapiai gali likti tinkami paieškos rezultatams, tačiau nebus naudojami kaip papildomas kontekstas dirbtinio intelekto atsakymams. (support.apple.com)

Kaip patvirtinti naršyklės interneto protokolo adresus

Kodėl vartotojo-agento atitikimas nepakanka

Taisyklė, pavyzdžiui, ši, yra silpna:

text if User-Agent contains "GPTBot": allow

Bet kas gali atsiųsti tą tekstą. Geresnė taisyklė yra:

text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block

Nepasitikėkite X-Forwarded-For antrašte, nebent ji gaunama iš tarpinio serverio (proxy) ar turinio pristatymo tinklo (CDN), kurį jūsų organizacija valdo.

Teikėjo patvirtinimo metodai

TeikėjasRekomenduojamas patvirtinimo metodas
OpenAINaudokite tiesioginius interneto protokolo adresų srautus, paskelbtus „OpenAI“ naršyklių dokumentacijoje, skirtoje „OAI-SearchBot“, „GPTBot“ ir „OAI-AdsBot“. Atnaujinkite juos automatiškai, o ne kopijuodami fiksuotus diapazonus į užkardą.
GoogleNaudokite „Google“ paskelbtus naršyklių diapazonus arba atlikite atvirkštinius ir tiesioginius domenų vardų sistemos patikrinimus. Tikra „Google“ naršyklė turėtų išspręsti į patvirtintą „Google“ pagrindinio kompiuterio pavadinimą ir grįžti prie originalaus adreso.
AnthropicNaudokite dabartinį paskelbtą naršyklės adresų srautą kaip antrinį tinklo patikrinimą. „Anthropic“ pagrindinis atsisakymo metodas išlieka „robots.txt“.
PerplexitySuderinkite vartotojo-agentą su dabartiniu „PerplexityBot“ arba „Perplexity-User“ adresų srautu. „Perplexity“ konkrečiai rekomenduoja derinti abi sąlygas žiniatinklio programų užkardos taisyklėje.
AppleNaudokite atvirkštinės domenų vardų sistemos patvirtinimą pagal applebot.apple.com, tada atlikite tiesioginę paiešką. „Apple“ taip pat skelbia dabartinius adresų diapazonus JSON sraute.
Common CrawlNaudokite atvirkštinės domenų vardų sistemos patvirtinimą pagal crawl.commoncrawl.org ir dabartinį „CCBot“ adresų srautą. „Common Crawl“ pažymi, kad atvirkštinis patvirtinimas dar negalimas kai kuriems IPv6 srautams.
MicrosoftNaudokite oficialų „Verify Bingbot“ įrankį arba „Microsoft“ dokumentuotus atvirkštinės ir tiesioginės paieškos metodus.
AmazonNaudokite „Amazon“ paskelbtus naršyklių adresų sąrašus ir suderinkite juos su atitinkamu „Amazon“ vartotojo-agentu.

„Google“, „Apple“, „Common Crawl“, „OpenAI“, „Anthropic“ ir „Perplexity“ visos skelbia konkrečias teikėjų metodikas arba adresų srautus. Šie sąrašai gali keistis, todėl suplanuotas atnaujinimo procesas yra saugesnis nei nuolatinis rankiniu būdu kopijuotas sąrašas. (developers.google.com)

Paprasčiausia užkardos konstrukcija galėtų atrodyti taip:

text leisti OAI-SearchBot tik tada, kai šaltinio adresas yra dabartiniame OpenAI paieškos diapazone leisti GPTBot tik tada, kai šaltinio adresas yra dabartiniame OpenAI mokymo diapazone leisti PerplexityBot tik tada, kai šaltinio adresas yra dabartiniame PerplexityBot diapazone leisti Applebot tik tada, kai atvirkštinės ir tiesioginės DNS patvirtinimas sėkmingas leisti CCBot tik tada, kai atvirkštinės DNS ir dabartinio Common Crawl diapazono atitikimas

apriboti visų patvirtintų naršyklių srautą blokuoti arba užginčyti nepatvirtintas užklausas, teigiančias esančios patikimos naršyklės

Netaikykite plačios leidimo taisyklės visam debesų paslaugų teikėjui. Teisėta naršyklė gali naudoti debesies infrastruktūrą, tačiau didžioji dalis srauto iš to debesų paslaugų teikėjo nebūtinai yra naršyklė.

Kaip atviras licencijavimas veikia įtraukimą

CC BY 4.0 paprasta kalba

„Creative Commons Attribution 4.0 International“ licencija, paprastai vadinama CC BY 4.0, leidžia žmonėms:

  • Kopijuoti ir platinti kūrinį
  • Adaptuoti, versti, perdirbti ir kurti remiantis juo
  • Naudoti komerciniais tikslais

Pagrindinės sąlygos yra šios:

  • Tinkamai nurodyti autorystę
  • Pateikti nuorodą į licenciją
  • Nurodyti, ar buvo atlikti pakeitimai
  • Nesiūlyti, kad originalus kūrėjas pritaria pakartotiniam naudojimui
  • Nepridėti teisinių ar techninių apribojimų, kurie trukdo licencijos leidžiamam naudojimui

„Creative Commons“ taip pat perspėja, kad licencija gali neapimti privatumo teisių, viešumo teisių, moralinių teisių, prekių ženklų teisių, patentų teisių ar trečiųjų šalių medžiagos. (creativecommons.org)

Licencija pati savaime nėra naršyklės kvietimas

Uždėjus „CC BY 4.0“ ant puslapio, negarantuojama, kad organizacija jį nuskaitys. Naršyklė vis tiek gali būti užblokuota dėl:

  • „robots.txt“
  • Turinio pristatymo tinklo (CDN)
  • Žiniatinklio programų užkardos (WAF)
  • Duomenų perdavimo greičio apribojimo
  • „JavaScript“ iššūkio
  • Prisijungimo sienos
  • Prasto serverio atsako
  • Neprieinamo svetainės žemėlapio

Priešingai, leidimas naršyklei automatiškai nesuteikia visų autorių teisių leidimų, reikalingų kiekvienam vėlesniam naudojimui. „robots.txt“ ir licencijavimas turėtų būti sukurti kartu.

Kodėl CC BY gali palaikyti platesnį įtraukimą

Aiškus leidimas suteikianti licencija gali palengvinti leidėjo politikos supratimą duomenų komandoms, paieškos sistemoms ir asistentų operatoriams. Tai gali sumažinti neaiškumus dėl kopijavimo, adaptavimo, komercinio naudojimo, vertimo ir platinimo, kai šioms veikloms reikalingas autorių teisių leidimas.

Tačiau „Creative Commons“ paaiškina, kad dirbtinio intelekto mokymas yra teisiškai sudėtingas. Ribojanti licencija ne visada yra efektyvus būdas užkirsti kelią mokymui, nes kai kurie mokymo naudojimo atvejai gali būti leidžiami autorių teisių išimtimis ar apribojimais. „Creative Commons“ taip pat pažymi, kad licencijos sąlygos gali būti sunkiai pritaikomos mašininiam mokymui ir modelių išvestims. (creativecommons.org)

Praktinė pamoka yra:

Naudokite CC BY, kai nuoširdžiai norite plataus teisėto pakartotinio naudojimo. Nenaudokite ribojančios „Creative Commons“ licencijos kaip garantuoto dirbtinio intelekto mokymo atsisakymo galimybės.

Autoriaus nurodymas pagerina šaltinio aiškumą

„Creative Commons“ rekomenduoja TASL metodą:

  • Pavadinimas
  • Autorius
  • Šaltinis
  • Licencija

Pavyzdžiui:

„Licencijavimas ir robotai maksimaliam įtraukimui“, „Example Publishing“, https://www.example.org/articles/ai-crawlers, licencijuota pagal „Creative Commons Attribution 4.0 International“. Atlikti pakeitimai: atnaujintas naršyklių sąrašas.

Aiškus autoriaus nurodymas nepriverčia kiekvieno asistento cituoti puslapį. Tačiau jis palengvina teisingą citavimą, kai sistema išskiria puslapio pavadinimą, autorių, šaltinį ir licencijos informaciją. (wiki.creativecommons.org)

Pridėti struktūrizuotą straipsnio informaciją

Naudokite matomą informaciją ir struktūrizuotus duomenis kartu:

html

„Google“ rekomenduoja aiškią autoriaus informaciją, autorių puslapius, paskelbimo datas, pakeitimo datas ir stabilius kanoninius puslapius. Šie signalai gali padėti paieškos sistemoms suprasti, kas sukūrė medžiagą ir kuri versija yra autoritetinga. Jie negarantuoja reitingavimo, įtraukimo ar citavimo. (developers.google.com)

Standartinė teisinė kalba atvirai, citavimui draugiškai svetainei

Ši kalba yra pavyzdinė, o ne teisinė konsultacija. Prieš naudodami, kreipkitės į teisininkus, kad jie ją pritaikytų jūsų jurisdikcijai, nuosavybės struktūrai, privatumo įsipareigojimams ir trečiųjų šalių turiniui.

CC BY 4.0 licencijavimo pareiškimas

text

Turinio licencija

Išskyrus atvejus, kai nurodyta kitaip, originalus tekstas ir originali redakcinė medžiaga šiame puslapyje yra licencijuota pagal Creative Commons Attribution 4.0 International licenciją:

https://creativecommons.org/licenses/by/4.0/

Šis leidimas leidžia kopijuoti, platinti, adaptuoti, versti, naudoti komerciniais tikslais, mašininiu būdu apdoroti, indeksuoti paieškai, gauti, apibendrinti ir naudoti dirbtinio intelekto sistemose, su sąlyga, kad laikomasi licencijos sąlygų.

Pageidaujamas priskyrimas:

„[Puslapio pavadinimas]“, autorius [autorius ar organizacija], [kanoninis puslapio adresas], paskelbta arba atnaujinta [data], licencijuota pagal Creative Commons Attribution 4.0 International. Atlikti pakeitimai: [aprašykite pakeitimus, arba nurodykite „jokių“].

Prašome išsaugoti autoriaus, leidėjo, šaltinio, licencijos ir pakeitimo informaciją, kai tik įmanoma. Šis pageidaujamas priskyrimo vadovas neprideda apribojimų Creative Commons licencijai ir nepakeičia licencijos teksto.

Frazė „įskaitant dirbtinio intelekto sistemas“ paaiškina leidėjo ketinimus. Ji neturėtų būti naudojama apsimetant, kad leidėjas turi teises į kito asmens sukurtą medžiagą.

Prekės ženklo, privatumo ir trečiųjų šalių teisių pranešimas

text

Prekės ženklo, privatumo ir trečiųjų šalių teisės

Aukščiau nurodyta licencija apima tik originalias medžiagas, nurodytas kaip licencijuotos. Ji nesuteikia leidimo naudoti:

  • Prekių ženklus, paslaugų ženklus, logotipus ar prekybos apipavidalinimą
  • Žmonių vardus, atvaizdus ar panašumus
  • Privatią, konfidencialią, sąskaitos, sveikatos, finansinę ar saugumo informaciją
  • Vartotojų pateiktus duomenis, nebent jie atskirai nurodomi kaip licencijuoti
  • Nuotraukas, iliustracijas, žemėlapius, vaizdo įrašus, muziką, citatas ar kitas trečiųjų šalių medžiagas
  • Turinį, pažymėtą „visos teisės saugomos“ arba kuriam taikoma atskira licencija

„Example Publishing“ pavadinimo, logotipų ir ženklų naudojimas neturi reikšti rėmimo, patvirtinimo, partnerystės ar pritarimo. Prašome pateikti nuorodą į originalų puslapį ir aiškiai atskirti citatas, parafrazes, santraukas ir sugeneruotą medžiagą.

Ši kalba yra svarbi, nes „Creative Commons“ licencijos automatiškai nesuteikia visų teisinių teisių, susijusių su puslapiu. (creativecommons.org)

Paieškos ir asistento citavimo gairės

text

Paieškos ir asistento citavimo gairės

Mes sveikiname suderinamą paieškos indeksavimą, vartotojo prašomą gavimą, citavimą ir licencijuotos medžiagos apibendrinimą šioje svetainėje.

Cituojant šią svetainę, prašome naudoti puslapio pavadinimą, autorių ar leidėją, kanoninį puslapio adresą, paskelbimo ar atnaujinimo datą ir tiesioginę nuorodą į šaltinį. Prašome nurodyti šaltinį kaip vieną iš bet kurių naudotų šaltinių, atskirti sugeneruotą analizę nuo cituojamos medžiagos ir nenurodyti ar nesiūlyti, kad „Example Publishing“ pritaria sugeneruotam atsakymui, produktui, asmeniui ar paslaugai.

Šios gairės skirtos pagerinti tikslumą ir priskyrimą. Jos nesuteikia teisių, viršijančių taikomą turinio licenciją, ir nelicencijuoja prekių ženklų, asmeninės informacijos, konfidencialios informacijos ar trečiųjų šalių medžiagos.

Jei norite matomumo paieškoje, bet nenorite suteikti plačios mokymo licencijos

text

Prieiga prie paieškos ir autorių teisės

Į mūsų viešuosius puslapius gali patekti atitinkamos paieškos ir gavimo naršyklės, nurodytos mūsų robots.txt faile. Šis leidimas skirtas palaikyti atradimą, paieškos rezultatus, vartotojo prašomą gavimą ir citavimą.

Išskyrus atvejus, kai nurodyta atskira licencija, originalus turinys išlieka su visomis teisėmis. Prieiga prie viešojo puslapio nesuteikia atskiros licencijos modelio kūrimui, mokymui, platinimui, komerciniam pakartotiniam naudojimui ar išvestinių kūrinių kūrimui, išskyrus teises, numatytas taikytina teise.

Kreipdamiesi į šią medžiagą, prašome cituoti kanoninį puslapio adresą ir leidėją. Niekas šioje svetainėje nesuteikia leidimo naudoti prekių ženklus, logotipus, asmeninę informaciją, konfidencialią informaciją ar trečiųjų šalių turinį.

Nededėkite CC BY pareiškimo ir visų teisių saugomos pareiškimo ant tos pačios medžiagos. Aiškiai nurodykite, kuri licencija taikoma kokiam turiniui.

Rizikos ir naudos matrica atviram licencijavimui

Autorių teisių įstatymai ir dirbtinio intelekto mokymo taisyklės skiriasi priklausomai nuo šalies ir išlieka neišspręstos. Jungtinių Valstijų autorių teisių biuras ir toliau nagrinėja šiuos klausimus, o „Creative Commons“ apibūdina dirbtinio intelekto mokymą kaip priklausantį nuo faktų ir teisiškai sudėtingą. (copyright.gov)

MetodasĮtraukimo potencialasPagrindiniai pranašumaiPagrindinės rizikosGeriausiai tinka
CC BY 4.0Labai didelisPlatus kopijavimas, adaptavimas, komercinis naudojimas, vertimas, indeksavimas ir su modeliu susijęs pakartotinis naudojimas, kai reikalingas autorių teisių leidimasKomerciniai konkurentai gali pakartotinai naudoti arba adaptuoti turinį; priskyrimas gali būti netobulas; licencija negali kontroliuoti privatumo, prekių ženklų ar trečiųjų šalių teisiųLeidėjai, kurie nori plačiausio teisėto pakartotinio naudojimo ir stipraus šaltinio priskyrimo
CC BY-SA 4.0Didelis, bet sudėtingesnisSkatina atvirą dalijimosi ciklą ir reikalauja, kad adaptacijos išliktų pagal suderinamas sąlygas„ShareAlike“ taisykles gali būti sunku taikyti duomenų rinkiniams, modelių apmokymui ir viešoms išvestims; kai kurios organizacijos gali vengti medžiagos dėl neaiškumoAtviri edukaciniai ir viešojo intereso projektai, kurie nori, kad tolesnės adaptacijos išliktų atviros
CC BY-NC 4.0Vidutinis arba žemasApriboja naudojimą, skirtą visų pirma komercinei naudai ar piniginei kompensacijai„Nekomerciškas“ gali būti sunkiai interpretuojamas; gali neįtraukti komercinės paieškos, modelių ir asistentų naudojimo; tai nėra garantuotas mokymo atsisakymasMedžiaga, skirta ne pelno, edukaciniam ar bendruomenės naudojimui
CC BY-ND 4.0VidutinisLeidžia dalintis, ribodama adaptacijasVertimas, transformacija ir kai kurie asistentų naudojimo atvejai gali tapti teisiškai neaiškūs; mažiau patrauklus sistemoms, kurios apibendrina ar perdirbaOficialūs pranešimai ar kūriniai, kurie turi likti nepakeisti
CC0 arba viešojo domeno dedikacijaLabai didelisSupaprastina pakartotinį naudojimą ir pašalina daugumą autorių teisių sąlygų, kurios yra teisiškai veiksmingosNėra privalomo priskyrimo; silpna prekės ženklo pateikimo kontrolė; privatumo, prekių ženklų ir viešumo teisės lieka atskirosFaktai, duomenų rinkiniai, informacinė medžiaga ar kūriniai, skirti neribotam pakartotiniam naudojimui
Visos teisės saugomos plius atviras paieškos naršymasAukštas paieškai, žemesnis mokymuiGali išsaugoti paieškos ir citavimo matomumą, nesuteikiant plačios pakartotinio naudojimo licencijosDidesnis teisinis neaiškumas modelių kūrėjams; gali sumažinti įtraukimą į mokymo duomenų rinkinius ir komercinio pakartotinio naudojimo sistemasLeidėjai, kurie nori atradimo ir citatų, bet nori derėtis dėl platesnių licencijų atskirai

Daugelio organizacijų subalansuota strategija yra:

  • CC BY 4.0 originaliam viešam redakciniam tekstui
  • Atskiri žymėjimai trečiųjų šalių medžiagai
  • Jokios viešos asmeninės ar konfidencialios informacijos
  • Leisti paieškos ir gavimo naršykles
  • Leisti modelio kūrimo naršykles tik tuo atveju, jei organizacija tikrai priima tokį naudojimą
  • Naudoti aiškų priskyrimą ir kanonines nuorodas
  • Apsaugoti prekių ženklus atskiru prekės ženklo pranešimu

Praktinis įgyvendinimo kontrolinis sąrašas

Turinys ir licencijavimas

  • Nustatykite, kam priklauso kiekvienas puslapis, paveikslėlis, diagrama, vaizdo įrašas ir citata.
  • Licencijuokite tik tą medžiagą, kurios teises valdo jūsų organizacija.
  • Atskiras trečiųjų šalių medžiagos žymėjimas.
  • Pridėkite matomą licencijos pareiškimą.
  • Pateikite pageidaujamą citatą, naudodami pavadinimą, autorių, šaltinį ir licenciją.
  • Logotipus, prekių ženklus, asmens duomenis ir konfidencialią informaciją laikykite už licencijos ribų.

„robots.txt“

  • Sukurkite viešą „robots.txt“ failą kiekvieno pagrindinio kompiuterio šaknyje.
  • Leiskite paieškos naršykles atskirai nuo mokymo naršyklių.
  • Blokuokite administracinius, paskyros, užsakymų, privačius ir vidinių programų kelius.
  • Nepasikliaukite „robots.txt“ saugumui.
  • Patikrinkite failą po kiekvieno didelio svetainės diegimo.

Metatagai

  • Naudokite kanonines nuorodas.
  • Pridėkite autorių, paskelbimo datą ir pakeitimo datą.
  • Naudokite noindex puslapiams, kurie neturėtų pasirodyti paieškoje.
  • Naudokite nosnippet arba data-nosnippet jautriems ištraukoms, kur palaikoma.
  • Naudokite X-Robots-Tag nešiojamiesiems dokumentų failams, vaizdams ir kitiems ne HTML ištekliams.
  • Atminkite, kad naršyklė turi galėti gauti puslapį, kol ji galės perskaityti jo metatagus.

Tinklo saugumas

  • Registruokite vartotojo-agento eilutes, šaltinio adresus, atsakymo kodus ir užklausų kelius.
  • Patvirtinkite patikimas naršykles, naudodami oficialius adresų srautus arba domenų vardų sistemos metodus.
  • Automatiškai atnaujinkite adresų srautus.
  • Suderinkite vartotojo-agento ir šaltinio-adresų patikrinimus.
  • Apribokite patvirtintų naršyklių srautą, o ne suteikite joms neribotą prieigą.
  • Užginčykite arba blokuokite užklausas, kurios teigia esančios patikimos naršyklės, bet nepatvirtinamos.

Matavimas

Stebėti:

  • Apsilankymus iš dirbtinio intelekto paieškos paslaugų
  • Nukreipimus į originalų puslapį
  • Citavimo dažnumą
  • Serverio apkrovą pagal naršyklę
  • Užklausas, grąžinančias 403, 404 arba 429
  • Naršyklės prieigą prie netyčinių kelių
  • Ar dabartiniai straipsniai randami po paskelbimo

Išvada

Maksimaliam įtraukimui reikalingas selektyvus atvirumas, o ne vienas bendras leidimas.

Naudokite „robots.txt“, kad atskirtumėte paiešką, vartotojo gavimą, mokymą ir viešųjų duomenų rinkinių naršymą. Naudokite metatagus ir HTTP antraštes, kad valdytumėte indeksavimą ir ištraukas. Naudokite autentifikavimą viskam, kas privatu. Patvirtinkite naršyklės interneto protokolo adresus, o ne pasitikėkite vien vartotojo-agento pavadinimais.

Leidimas suteikianti licencija, pvz., CC BY 4.0, gali palengvinti platų pakartotinį naudojimą, kai to nuoširdžiai norite. Aiškūs priskyrimo duomenys – pavadinimas, autorius, šaltinis, licencija, kanoninis puslapis ir atnaujinimo data – taip pat gali palengvinti paieškos sistemoms ir asistentams teisingo šaltinio identifikavimą ir citavimą.

Todėl stipriausia leidybos politika yra:

**Atverkite viešąjį turinį, kurį norite, kad būtų rastas, aiškiai licencijuokite medžiagą, kurią norite pakartotinai naudoti, pažymėkite medžiagą, kurios jums nepriklauso, apsaugokite privačią informaciją serverio lygiu ir suteikite kiekvienai naršyklei atskirą, peržiūrimą leidimą.

Susiję straipsniai

Patinka šis turinys?

Prenumeruokite mūsų naujienlaiškį, kad gautumėte naujausias turinio rinkodaros įžvalgas ir augimo vadovus.

Šis straipsnis yra tik informacinio pobūdžio. Turinys ir strategijos gali skirtis priklausomai nuo jūsų specifinių poreikių.
Licencijavimas ir robotai maksimaliam įtraukimui: kaip priimti dirbtinio intelekto naršykles | AutoPod