AutoPodAutoPod

Litsentsimine ja robotid maksimaalse kaasatuse tagamiseks: Kuidas tervitada tehisintellekti roomikprogramme

‱21 min lugemist
Audioartikkel
Litsentsimine ja robotid maksimaalse kaasatuse tagamiseks: Kuidas tervitada tehisintellekti roomikprogramme
0:000:00
Litsentsimine ja robotid maksimaalse kaasatuse tagamiseks: Kuidas tervitada tehisintellekti roomikprogramme

Litsentsimine ja robotid maksimaalse kaasatuse tagamiseks: Kuidas tervitada tehisintellekti roomikprogramme

Uuendatud 25. augustil 2026

Veebisaitidel on nĂŒĂŒd auditooriumini jĂ”udmiseks mitu vĂ”imalust. LehekĂŒlje vĂ”ib leida Google’i otsingu kaudu, selle kokku vĂ”tta ChatGPT, seda tsiteerida Perplexity, kasutada Claude’i otsingus, kuvada Apple’i teenuste kaudu vĂ”i koguda avalik veebiarhiiv.

KĂ”ik need sĂŒsteemid ei kasuta sama roomikprogrammi ega jĂ€rgi samu reegleid. Veebisait, mis blokeerib GPTBoti, vĂ”ib siiski ilmuda ChatGPT otsingus, kui see lubab OAI-SearchBoti. Veebisait, mis lubab Appleboti, vĂ”ib jÀÀda Apple’i otsingus nĂ€htavaks, blokeerides samal ajal Applebot-Extendedi tehisintellekti mudelite treenimisest. Google’i Google-Extended ei ole ĂŒldse tavaline roomikprogramm; see on robots.txt kontrolltoken.

Parim poliitika ei ole seega lihtsalt „luba tehisintellekt“ vĂ”i „blokeeri tehisintellekt“. See on eraldi lubade loomine jĂ€rgmiste jaoks:

  1. Otsing ja avastamine
  2. Kasutaja soovitud pÀringud
  3. Mudeli arendus ja treenimine
  4. Avalikud andmekogumid
  5. Tundlik, privaatne vÔi piiratud materjal

KĂ€esolev artikkel pakub ĂŒlevaate roomikprogrammidest, robots.txt nĂ€iteid, metatagide juhiseid, Interneti-protokolli aadressi kontrollimise meetodeid, Creative Commonsi litsentsimise nĂ”uandeid, juriidilist pĂ”hjateksti ja riski-kasu maatriksit.

Neli kontrolli, mida iga kirjastaja peaks mÔistma

1. robots.txt kontrollib soovitud roomamist

robots.txt fail annab nĂ”uetele vastavatele automatiseeritud klientidele teada, milliseid lehti nad vĂ”ivad kĂŒsida. See on kasulik roomikprogrammide liikluse haldamiseks ja kirjastaja eelistuste vĂ€ljendamiseks.

Kuid robots.txt ei ole ligipÀÀsu kontrollsĂŒsteem. Robots Exclusion Protocol sĂ€testab, et selle reeglid ei ole ligipÀÀsu autoriseerimine. Google hoiatab ka, et blokeeritud aadress vĂ”ib endiselt ilmuda otsingutulemustes, kui teised lehed sellele viitavad. Konfidentsiaalse teabe jaoks kasutage paroole, autentimist vĂ”i serveripoolseid juurdepÀÀsukontrolle. (rfc-editor.org)

2. Metatagid kontrollivad indekseerimist ja kokkuvÔtteid

Robots metatagid ja X-Robots-Tag vastusepÀis saavad kontrollida, kas lehte indekseeritakse vÔi kas otsingumootor vÔib nÀidata kokkuvÔtet.

Need kontrollid on tavaliselt nÀhtavad alles pÀrast seda, kui roomikprogrammile on lubatud leht alla laadida. Kui robots.txt lehe esmalt blokeerib, ei pruugi roomikprogramm metatagi kunagi nÀha. (developers.google.com)

3. VÔrgukontrollid kinnitavad roomikprogrammi

Kasutajaagendi nime on lihtne kopeerida. RĂŒndaja vĂ”ib saata pĂ€ringu, vĂ€ites end olevat GPTBot, Googlebot vĂ”i PerplexityBot.

Tugevam lĂ€henemine ĂŒhendab:

  • VĂ€idetava kasutajaagendi
  • Avaldatud Interneti-protokolli aadressivahemiku
  • Vastupidine domeeninimesĂŒsteemi (DNS) kontrollimine
  • Edasine domeeninimesĂŒsteemi (DNS) kontrollimine
  • Kiirusepiirangud ja pĂ€ringute jĂ€lgimine

4. Litsents annab taaskasutusÔigused

Robots.txt ĂŒtleb, mida roomikprogrammil palutakse teha. Litsents ĂŒtleb, mida inimesed vĂ”i organisatsioonid vĂ”ivad materjaliga seaduslikult teha, kui autoriĂ”iguse luba on vajalik.

Need on erinevad tööriistad. Luba andev litsents vĂ”ib vĂ€hendada juriidilist ebakindlust, kuid see ei garanteeri, et roomikprogramm lehte kĂŒlastab, et mudel seda kasutab vĂ”i et assistent seda tsiteerib.

Oluliste roomikprogrammide loetelu

JĂ€rgmine loetelu kontrolliti teenusepakkuja dokumentatsiooni alusel, mis oli kĂ€ttesaadav 25. augustil 2026. Kasutajaagendi nimed, otstarbed ja Interneti-protokolli aadressivahemikud vĂ”ivad muutuda, seega peaksid tootmissĂŒsteemid kasutama teenusepakkuja praegust dokumentatsiooni ja reaalajas aadressivooge.

TeenusepakkujaRoomikprogramm vÔi robots.txt tokenPeamine otstarveOluline kontroll
OpenAIOAI-SearchBotLeiab ja analĂŒĂŒsib lehti ChatGPT otsingu jaoksLubage see, et parandada lehtede ilmumise tĂ”enĂ€osust ChatGPT otsingutulemustes.
OpenAIGPTBotKogub lehti, mida vÔidakse kasutada OpenAI generatiivse tehisintellekti mudelite treenimiseksLuba vÔi keela otsingust eraldi.
OpenAIChatGPT-UserLaadib lehti alla pÀrast seda, kui kasutaja palub ChatGPT-l vÔi kohandatud GPT-l neile ligi pÀÀsedaSee on kasutaja algatatud, mitte automaatne veebiroomikprogramm, seega robots.txt reeglid ei pruugi kehtida.
OpenAIOAI-AdsBotKontrollib veebilehti, mis on esitatud ChatGPT reklaami sihtkohtadenaPeamiselt reklaamijate jaoks asjakohane. Kogutud sisu ei kasutata generatiivsete tehisintellekti pÔhimudelite treenimiseks.
GoogleGooglebotPeamine Google’i otsingu roomikprogrammKontrollib tavalist Google’i otsingu roomamist.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-NewsPildid, videod ja Google NewsNeil on eraldi robots.txt tokenid ja neid saab iseseisvalt kontrollida.
GoogleGoogleOtherÜldotstarbeline Google’i roomamine erinevate tooterĂŒhmade jaoks, sealhulgas uurimis- ja arendustegevusSee ei esinda ĂŒhte konkreetset Google’i toodet.
GoogleGoogle-ExtendedKontrollib, kas Google’i roomatud sisu vĂ”ib kasutada Gemini mudeli treenimiseks ja teatud alussĂŒsteemide jaoksSee on robots.txt kontrolltoken, mitte eraldi pĂ€ringu kasutajaagent. See ei mĂ”juta tavalist Google’i otsingu kaasatust.
AnthropicClaudeBotKogub avalikku veebisisu, mis vĂ”ib panustada Claude’i mudeli arendusseKeelake see, et anda mĂ€rku, et tulevane materjal tuleks Anthropicu treeningu andmekogumitest vĂ€lja jĂ€tta.
AnthropicClaude-SearchBotParandab Claude’i otsingutulemuste kvaliteetiLubage see Claude’i otsingunĂ€htavuse jaoks.
AnthropicClaude-UserLaadib lehti alla vastusena kasutaja pĂ€ringule Claude’ileAutomaatsest roomamisest eraldiseisev.
PerplexityPerplexityBotIndekseerib lehti Perplexity otsingutulemuste jaoksPerplexity ĂŒtleb, et seda roomikprogrammi ei kasutata sisu kogumiseks tehisintellekti pĂ”himudelite treenimiseks.
PerplexityPerplexity-UserLaadib lehe alla pĂ€rast seda, kui kasutaja seda palubPerplexity dokumentatsioon ĂŒtleb, et see allalaadija ignoreerib ĂŒldjuhul robots.txt-d, sest pĂ€ringu algatas kasutaja.
AppleApplebotToetab Apple’i otsingut, Spotlighti, Siri, Safari ja muid Apple’i kogemusiLubage see Apple’i avastamiseks.
AppleApplebot-ExtendedKontrollib, kas Appleboti roomatud sisu vĂ”ib kasutada Apple’i pĂ”himudelite treenimiseksSee ei rooma lehti ise. See on andmekasutuse kontroll.
Common CrawlCCBotKogub avalikke veebiandmeid Common Crawli avatud veebiarhiivi jaoksSee ei ole assistent, kuid selle andmekogumeid saavad kasutada teadlased ja tehisintellekti arendajad.
MicrosoftBingbotPeamine Bingi otsingu roomikprogrammLubage see Bingi avastamiseks ja otsingunÀhtavuse jaoks.
MicrosoftMicrosoftPreview, BingVideoPreviewLehe ja video eelvaated Microsofti toodete jaoksNeid saab Bingbotist eraldi kontrollida.
AmazonAmzn-SearchBotAmazoni otsing ja sisu avastamineAmazon ĂŒtleb, et see ei rooma sisu generatiivse tehisintellekti mudeli treenimiseks.
AmazonAmzn-UserLaadib alla ajakohast teavet vastusena kasutaja toimingutele, sealhulgas Alexa pÀringuteleKasutaja algatatud ja automaatsest otsinguroomamisest eraldiseisev.

OpenAI dokumenteerib oma otsingu-, treening-, reklaami- ja kasutaja algatatud roomikprogrammid eraldi kontrollidena. Selle dokumentatsioon soovitab konkreetselt lubada OAI-SearchBoti ChatGPT otsinguks, kasutades samal ajal GPTBoti treeningueelistuste jaoks eraldi. (developers.openai.com)

Google eraldab sarnaselt Googleboti, GoogleOtheri ja Google-Extendedi. Google-Extendedil ei ole oma HTTP-pĂ€ringu kasutajaagenti ja selle blokeerimine ei eemalda lehte Google’i otsingust. (developers.google.com)

Anthropic dokumenteerib eraldi rollid ClaudeBotile, Claude-SearchBotile ja Claude-Userile. Anthropic mÀrgib ka, et selle robotid jÀrgivad robots.txt-d ja toetavad mittestandardset Crawl-delay direktiivi. (support.anthropic.com)

Perplexity eristab automaatse otsinguroomamise ja kasutaja soovitud allalaadimise vahel. Selle praegune dokumentatsioon ĂŒtleb, et PerplexityBot austab robots.txt-d, samas kui Perplexity-User seda ĂŒldjuhul ei tee, sest see vastab kasutaja pĂ€ringule. (docs.perplexity.ai)

Apple’i praegune dokumentatsioon teeb sama otsingu ja treeningu eristuse: Applebot toetab avastamist, samas kui Applebot-Extended vĂ”imaldab kirjastajatel kontrollida treeningkasutust, eemaldamata lehti Apple’i otsingust. (support.apple.com)

Soovitatavad robots.txt konfiguratsioonid

Paigutage robots.txt iga hosti juurkataloogi, nÀiteks:

text https://www.example.org/robots.txt

Reeglid kehtivad konkreetsele hostile, protokollile ja pordile, kus faili teenindatakse. Eraldi alamdomeenil vÔib olla vaja oma faili. (developers.google.com)

Konfiguratsioon 1: Maksimaalne kaasatus

Kasutage seda, kui avalikku toimetuse sisu vÔivad vastavad roomikprogrammid leida, kokku vÔtta, tsiteerida, indekseerida ja koguda.

text

Public pages are available to compliant crawlers.

User-agent: * Allow: /

Keep private, transactional, and administrative paths out.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

See lubab nimetatud roomikprogramme, sealhulgas OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft ja Amazon, vÀlja arvatud juhul, kui mÔni muu spetsiifiline reegel neid blokeerib.

Ärge paigutage selle konfiguratsiooni alla ĂŒldist reeglit nagu User-agent: * Disallow: /. Hilisem vĂ”i spetsiifilisem grupp vĂ”ib muuta seda, kuidas roomikprogramm faili tĂ”lgendab.

Konfiguratsioon 2: Luba otsing, kuid blokeeri mudeli arendamise roomikprogrammid

See on sageli parim kompromiss kirjastajatele, kes soovivad viiteid ja otsinguliiklust, kuid ei soovi anda luba mudeli arendamiseks vajalikuks kogumiseks.

text

Block OpenAI model-development crawling.

User-agent: GPTBot Disallow: /

Block Anthropic model-development crawling.

User-agent: ClaudeBot Disallow: /

Block Google model-training and related grounding use.

User-agent: Google-Extended Disallow: /

Block Apple foundation-model training use.

User-agent: Applebot-Extended Disallow: /

Optional: block Common Crawl dataset collection.

User-agent: CCBot

Disallow: /

Allow ordinary search and retrieval crawling, except for sensitive paths.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

See konfiguratsioon jÀtab OAI-SearchBoti, Claude-SearchBoti, PerplexityBoti, Googleboti ja Appleboti metamÀrgi (wildcard) grupi alla. Samuti hoiab see otsingu- ja treeningload eraldi.

Apple’i puhul sĂ€ilitab Applebot-Extendedi blokeerimine, lubades samal ajal Appleboti, avastamise Apple’i teenuste kaudu. Google’i puhul ei blokeeri Google-Extendedi blokeerimine tavalist Google’i otsingut. (developers.google.com)

Konfiguratsioon 3: Selgelt lubatud valitud otsingurobotid

Kui olemasolev robots.txt fail blokeerib kÔik roomikprogrammid, lisage eraldi grupid otsingurobotitele, mida soovite tervitada.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Keep all other crawlers out.

User-agent: * Disallow: /

Spetsiifiliste gruppide kasutamisel korrake tundliku tee reegleid igas grupis. MÔned roomikprogrammid kasutavad kÔige spetsiifilisemat sobivat gruppi, mitte ei kombineeri seda metamÀrgi grupiga. Bing dokumenteerib seda kÀitumist otseselt ja Google pakub eraldi juhiseid roomikprogrammipÔhiste gruppide kohta. (bing.com)

Olulised robots.txt piirangud

  • Roomikprogramm vĂ”ib ignoreerida robots.txt-d.
  • Pahatahtlik roomikprogramm vĂ”ib teeselda usaldusvÀÀrset roomikprogrammi.
  • Blokeeritud leht vĂ”ib siiski olla teada oma pealkirja vĂ”i veebiaadressi jĂ€rgi.
  • Robots.txt ei kaitse paroole, privaatfaile, kliendiandmeid ega konfidentsiaalseid rakendusliideseid.
  • Crawl-delay direktiiv ei ole Robots Exclusion Protocoli pĂ”hiosa ega toetata kĂ”igi roomikprogrammide poolt. Anthropic ja Bing dokumenteerivad tuge, samas kui Apple ĂŒtleb, et Applebot ei jĂ€rgi crawl-delayd. (rfc-editor.org)

Metatagid ja HTTP-pÀised

Avaliku lehe nÀide

Avaliku artikli puhul kasutage selget pealkirja, autorit, kanoonilist veebiaadressi, avaldamiskuupÀeva ja muutmise kuupÀeva.

html

max-snippet direktiiv on dokumenteeritud peamiselt Google’i jaoks. Ärge eeldage, et iga tehisintellekti roomikprogramm toetab iga meta-direktiivi.

Privaatse vÔi tundliku lehe nÀide

html

Kasutage seda lehtede puhul, mis ei peaks ilmuma otsingutulemustes. Leht peab jÀÀma roomatavaks piisavalt kauaks, et roomikprogramm saaks direktiivi nÀha. Kui leht peab tÔepoolest privaatseks jÀÀma, kasutage autentimist vÔi paroolikaitset. (developers.google.com)

Peida otsingu kokkuvÔtetest ainult tundlikud osad

Google toetab data-nosnippet-i HTML-lehe spetsiifiliste osade jaoks:

html

This paragraph may be shown in a search result.

Personal telephone numbers, private email addresses, or internal notes go here.

See on kasulik kontaktandmete, sisekommunikatsiooni vĂ”i kasutaja loodud teabe jaoks. See ei ole universaalne juhis iga tehisintellekti sĂŒsteemi jaoks. (developers.google.com)

Kasuta failide jaoks X-Robots-Tag pÀist

Metatage ei saa paigutada kaasaskantavasse dokumendifaili, pildifaili ega videofaili. Kasutage selle asemel HTTP vastusepÀist:

text X-Robots-Tag: noindex, nosnippet

Lehe jaoks, mis peaks jÀÀma otsitavaks, kuid ei tohiks anda teksti kokkuvÔteteks ega tehisintellekti vastusteks, kasutage:

text X-Robots-Tag: nosnippet

Google dokumenteerib X-Robots-Tag-i mitte-HTML-ressursside jaoks ja Apple toetab seda ka Appleboti jaoks. (developers.google.com)

Apple’i spetsiifilised kontrollid

Apple toetab:

html

Apple ĂŒtleb, et nosnippet takistab lehe kasutamist lisakontekstina ja praeguse sisuna, kui Apple’i mudelid vĂ€ljundit genereerivad. Leht vĂ”ib endiselt jÀÀda avastatavaks Apple’i otsingu, Spotlighti, Siri ja Safari kaudu. (support.apple.com)

Tasuliste lehtede puhul toetab Apple ka struktureeritud andmeid, kasutades:

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Apple ĂŒtleb, et sellised lehed vĂ”ivad jÀÀda otsingutulemuste jaoks sobilikeks, kuid neid ei kasutata tehisintellekti vastuste lisakontekstina. (support.apple.com)

Kuidas kontrollida roomikprogrammide Interneti-protokolli aadresse

Miks kasutajaagendi sobitamine ei ole piisav

Selline reegel on nÔrk:

text if User-Agent contains "GPTBot": allow

IgaĂŒks saab selle teksti saata. Parem reegel on:

text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block

Ärge usaldage X-Forwarded-For pĂ€ist, vĂ€lja arvatud juhul, kui see tuleb puhverserverist vĂ”i sisu edastusvĂ”rgust, mida teie organisatsioon kontrollib.

Teenusepakkuja kontrollimise meetodid

TeenusepakkujaSoovitatav kontrollimeetod
OpenAIKasutage reaalajas Interneti-protokolli aadressivooge, mis on avaldatud OpenAI roomikprogrammide dokumentatsioonis OAI-SearchBoti, GPTBoti ja OAI-AdsBoti jaoks. VĂ€rskendage neid automaatselt, mitte kopeerides fikseeritud vahemikke tulemĂŒĂŒri.
GoogleKasutage Google’i avaldatud roomikprogrammide vahemikke vĂ”i teostage vastupidine ja edasine domeeninimesĂŒsteemi (DNS) kontroll. Ehtne Google’i roomikprogramm peaks lahenduma heakskiidetud Google’i hostinimeks ja tagasi algsele aadressile.
AnthropicKasutage praegust avaldatud roomikprogrammi aadressivoogu teisejÀrgulise vÔrgukontrollina. Anthropicu peamine loobumismeetod jÀÀb robots.txt.
PerplexityKombineerige kasutajaagent praeguse PerplexityBoti vĂ”i Perplexity-Useri aadressivooga. Perplexity soovitab konkreetselt mĂ”lema tingimuse kombineerimist veebirakenduse tulemĂŒĂŒri reeglis.
AppleKasutage vastupidist domeeninimesĂŒsteemi (DNS) kontrolli applebot.apple.com all, seejĂ€rel tehke edasine pĂ€ring. Apple avaldab ka praegused aadressivahemikud JSON-voos.
Common CrawlKasutage vastupidist domeeninimesĂŒsteemi (DNS) kontrolli crawl.commoncrawl.org all ja praegust CCBoti aadressivoogu. Common Crawl mĂ€rgib, et vastupidine kontroll ei ole veel mĂ”ne IPv6 liikluse jaoks saadaval.
MicrosoftKasutage ametlikku Verify Bingbot tööriista vÔi Microsofti dokumenteeritud vastupidiseid ja edasisi pÀringumeetodeid.
AmazonKasutage Amazoni avaldatud roomikprogrammide aadressiloendeid ja sobitage need vastava Amazoni kasutajaagendiga.

Google, Apple, Common Crawl, OpenAI, Anthropic ja Perplexity avaldavad kĂ”ik teenusepakkuja-spetsiifilisi meetodeid vĂ”i aadressivooge. Need loendid vĂ”ivad muutuda, seega on ajastatud vĂ€rskendamise protsess turvalisem kui pĂŒsiv kĂ€sitsi kopeeritud loend. (developers.google.com)

Lihtne tulemĂŒĂŒri disain vĂ”iks vĂ€lja nĂ€ha jĂ€rgmine:

text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match

rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers

Ärge rakendage laia lubamise reeglit tervele pilveteenuse pakkujale. Seaduslik roomikprogramm vĂ”ib kasutada pilveinfrastruktuuri, kuid enamik sellest pilveteenuse pakkujalt tulevast liiklusest ei pruugi tingimata olla roomikprogramm.

Kuidas avatud litsentsimine mÔjutab kaasatust

CC BY 4.0 lihtsas keeles

Creative Commonsi omistamise 4.0 rahvusvaheline litsents, mida tavaliselt nimetatakse CC BY 4.0, lubab inimestel:

  • Kopeerida ja levitada teost
  • Kohaneda, tĂ”lkida, remiksida ja sellele ehitada
  • Kasutada seda Ă€riliselt

Peamised tingimused on:

  • Andke asjakohane viide
  • Linkige litsentsile
  • MĂ€rkige, kas muudatusi on tehtud
  • Ärge viidake, et algne looja kiidab taaskasutuse heaks
  • Ärge lisage juriidilisi ega tehnilisi piiranguid, mis takistavad litsentsiga lubatud kasutust

Creative Commons hoiatab ka, et litsents ei pruugi katta privaatsusÔigusi, avaldamisÔigusi, moraalseid Ôigusi, kaubamÀrgiÔigusi, patendiÔigusi ega kolmanda osapoole materjali. (creativecommons.org)

Litsents iseenesest ei ole roomikprogrammi kutse

„CC BY 4.0“ paigutamine lehele ei garanteeri, et organisatsioon seda roomab. Roomikprogrammi vĂ”ib siiski blokeerida:

  • robots.txt
  • SisuedastusvĂ”rk
  • Veebirakenduse tulemĂŒĂŒr
  • Kiirusepiirang
  • JavaScripti vĂ€ljakutse
  • Sisselogimissein
  • Halb serverivastus
  • LigipÀÀsmatu saidikaart

Vastupidi, roomikprogrammi lubamine ei anna automaatselt iga autoriÔiguse luba, mida on vaja igaks hilisemaks kasutamiseks. Robots.txt ja litsentsimine tuleks kavandada koos.

Miks CC BY toetab laiemat kaasatust

Selge lubav litsents vĂ”ib muuta kirjastaja poliitika andme meeskondade, otsingusĂŒsteemide ja assistendi operaatorite jaoks lihtsamini mĂ”istetavaks. See vĂ”ib vĂ€hendada ebakindlust kopeerimise, kohandamise, Ă€rilise kasutamise, tĂ”lkimise ja levitamise osas, kui need tegevused nĂ”uavad autoriĂ”iguse luba.

Kuid Creative Commons selgitab, et tehisintellekti treenimine on juriidiliselt keeruline. Piirav litsents ei ole alati tÔhus viis treenimise vÀltimiseks, sest mÔned treeningkasutused vÔivad olla lubatud autoriÔiguse erandite vÔi piirangute alusel. Creative Commons mÀrgib ka, et litsentsitingimusi vÔib olla raske masina treenimisele ja mudelivÀljunditele rakendada. (creativecommons.org)

Praktiline Ôppetund on:

Kasuta CC BY-d, kui soovid tĂ”eliselt laialdast seaduslikku taaskasutust. Ära kasuta piiravat Creative Commonsi litsentsi kui garanteeritud tehisintellekti treeningust loobumise vĂ”imalust.

Viitamine parandab allika selgust

Creative Commons soovitab TASL meetodit:

  • Pealkiri
  • Autor
  • Allikas
  • Litsents

NĂ€iteks:

„Litsentsimine ja robotid maksimaalse kaasatuse tagamiseks,” Example Publishing, https://www.example.org/articles/ai-crawlers, litsentsitud Creative Commons Attribution 4.0 International alusel. Tehtud muudatused: uuendatud roomikprogrammide loetelu.

Selge viitamine ei sunni iga assistenti lehte tsiteerima. KĂŒll aga muudab see Ă”ige viitamise lihtsamaks, kui sĂŒsteem ekstraheerib lehe pealkirja, autori, allika ja litsentsiteabe. (wiki.creativecommons.org)

Lisa struktureeritud artikli teave

Kasutage nÀhtavat teavet ja struktureeritud andmeid koos:

html

Google soovitab selget autori teavet, autori lehti, avaldamiskuupĂ€evi, muutmise kuupĂ€evi ja stabiilseid kanoonilisi lehti. Need signaalid aitavad otsingusĂŒsteemidel mĂ”ista, kes materjali lĂ”i ja milline versioon on autoriteetne. Need ei garanteeri reastust, kaasatust ega viitamist. (developers.google.com)

Juriidiline pÔhjatekst avatud, viitamissÔbraliku saidi jaoks

JÀrgnev on nÀidistekst, mitte juriidiline nÔuanne. Paluge nÔunikul seda kohandada teie jurisdiktsiooni, omandistruktuuri, privaatsuskohustuste ja kolmanda osapoole sisuga.

CC BY 4.0 litsentsi avaldus

text

Content license

Except where otherwise stated, the original text and original editorial materials on this page are licensed under the Creative Commons Attribution 4.0 International license:

https://creativecommons.org/licenses/by/4.0/

This permission allows copying, redistribution, adaptation, translation, commercial use, machine-readable processing, search indexing, retrieval, summarization, and use in artificial intelligence systems, provided that the license terms are followed.

Preferred attribution:

“[Page title],” by [author or organization], [canonical page address], published or updated [date], licensed under Creative Commons Attribution 4.0 International. Changes made: [describe changes, or state ‘none’].

Please preserve the author, publisher, source, license, and modification information whenever reasonably possible. This preferred attribution guide does not add restrictions to the Creative Commons license and does not replace the license text.

VĂ€ljend „sealhulgas tehisintellekti sĂŒsteemid“ selgitab kirjastaja kavatsust. Seda ei tohiks kasutada teeseldaks, et kirjastaja omab Ă”igusi kellegi teise loodud materjalile.

BrÀndi, privaatsuse ja kolmanda osapoole Ôiguste teade

text

Brand, privacy, and third-party rights

The license above covers only the original materials identified as licensed. It does not grant permission to use:

  • Trademarks, service marks, logos, or trade dress
  • Names, images, or likenesses of people
  • Private, confidential, account, health, financial, or security information
  • User submissions unless they are separately identified as licensed
  • Photographs, illustrations, maps, video, music, quotations, or other third-party materials
  • Content identified as “all rights reserved” or subject to a separate license

Use of the Example Publishing name, logos, and marks must not suggest sponsorship, approval, partnership, or endorsement. Please link to the original page and clearly distinguish quotation, paraphrase, summary, and generated material.

See keel on oluline, sest Creative Commonsi litsentsid ei anna automaatselt kÔiki lehega seotud juriidilisi Ôigusi. (creativecommons.org)

Otsingu ja assistendi viitamise juhised

text

Search and assistant citation guidance

We welcome compliant search indexing, user-requested retrieval, citation, and summarization of the licensed material on this site.

When citing this site, please use the page title, author or publisher, canonical page address, publication or update date, and a direct link to the source. Please identify the source as one input among any sources used, distinguish generated analysis from quoted material, and do not state or imply that Example Publishing endorses a generated answer, product, person, or service.

This guidance is intended to improve accuracy and attribution. It does not grant rights beyond the applicable content license and does not license trademarks, personal information, confidential information, or third-party material.

Kui soovite otsingu nÀhtavust, kuid ei soovi anda laiaulatuslikku treeningulitsentsi

text

Search access and copyright

Our public pages may be accessed by compliant search and retrieval crawlers identified in our robots.txt file. This permission is intended to support discovery, search results, user-requested retrieval, and citation.

Except where a separate license is shown, the original content remains all rights reserved. Access to a public page does not grant a separate license for model-development, training, redistribution, commercial reuse, or creation of derivative works beyond rights provided by applicable law.

Please cite the canonical page address and publisher when referring to this material. Nothing on this site grants permission to use trademarks, logos, personal information, confidential information, or third-party content.

Ärge asetage CC BY avaldust ja kĂ”igi Ă”iguste avaldust sama materjali peale. MÀÀratlege selgelt, milline litsents millisele sisule kehtib.

Riski-kasu maatriks avatud litsentsimisel

AutoriĂ”iguse seadused ja tehisintellekti treeningreeglid erinevad riigiti ja on endiselt lahendamata. Ameerika Ühendriikide autoriĂ”iguste amet uurib neid kĂŒsimusi edasi, samas kui Creative Commons kirjeldab tehisintellekti treeningut kui faktipĂ”hist ja juriidiliselt keerukat. (copyright.gov)

LĂ€henemineKaasamise potentsiaalPeamised eelisedPeamised riskidParim sobivus
CC BY 4.0VÀga kÔrgeLai kopeerimine, kohandamine, Àriline kasutamine, tÔlge, indekseerimine ja mudeliga seotud taaskasutus, kui autoriÔiguse luba on vajaKaubanduslikud konkurendid vÔivad sisu taaskasutada vÔi kohandada; viitamine vÔib olla ebatÀiuslik; litsents ei saa kontrollida privaatsust, kaubamÀrki ega kolmanda osapoole ÔigusiKirjastajad, kes soovivad kÔige laiemat seaduslikku taaskasutust ja tugevat allika viitamist
CC BY-SA 4.0KĂ”rge, kuid keerukamSoodustab avatud jagamistsĂŒklit ja nĂ”uab kohanduste ĂŒhilduvate tingimuste alla jÀÀmistShareAlike reegleid vĂ”ib olla raske rakendada andmekogumitele, mudeli treenimisele ja avalikele vĂ€ljunditele; mĂ”ned organisatsioonid vĂ”ivad ebakindluse tĂ”ttu materjali vĂ€ltidaAvatud hariduslikud ja avalikku huvi pakkuvad projektid, mis soovivad, et jĂ€reltulevad kohandused jÀÀksid avatuks
CC BY-NC 4.0Keskmine vĂ”i madalPiirab kasutusi, mis on peamiselt suunatud Ă€rilisele eelisele vĂ”i rahalisele hĂŒvitisele„MitteĂ€riline“ vĂ”ib olla raskesti tĂ”lgendatav; vĂ”ib vĂ€listada Ă€rilised otsingu-, mudeli- ja assistendikasutused; see ei ole garanteeritud treeningust loobumise vĂ”imalusMaterjal, mis on mĂ”eldud mittetulunduslikuks, hariduslikuks vĂ”i kogukondlikuks kasutamiseks
CC BY-ND 4.0KeskmineLubab jagamist, piirates samal ajal kohandusiTĂ”lge, transformatsioon ja mĂ”ned assistendi kasutusjuhtumid vĂ”ivad muutuda juriidiliselt ebakindlaks; vĂ€hem atraktiivne sĂŒsteemidele, mis kokku vĂ”tavad vĂ”i remiksivadAmetlikud teated vĂ”i teosed, mis peavad jÀÀma muutmata
CC0 vĂ”i avaliku domeeni pĂŒhendusVĂ€ga kĂ”rgeLihtsustab taaskasutust ja eemaldab enamiku autoriĂ”iguse tingimustest, kus see on juriidiliselt tĂ”husEi ole nĂ”utavat viitamist; nĂ”rk kontroll brĂ€ndi esitluse ĂŒle; privaatsuse, kaubamĂ€rgi ja avaldamisĂ”igused jÀÀvad eraldiFaktid, andmekogumid, viitematerjal vĂ”i piiramatu taaskasutamiseks mĂ”eldud teosed
KĂ”ik Ă”igused reserveeritud pluss avatud otsinguroomamineKĂ”rge otsingu jaoks, madalam treeningu jaoksSaab sĂ€ilitada otsingu ja viitamise nĂ€htavuse, andmata laialdast taaskasutuse litsentsiSuurem juriidiline ebakindlus mudeli arendajatele; vĂ”ib vĂ€hendada kaasatust treeningu andmekogumitesse ja Ă€rilistesse taaskasutussĂŒsteemidesseKirjastajad, kes soovivad avastamist ja viiteid, kuid eelistavad laiemate litsentside ĂŒle lĂ€birÀÀkimisi eraldi pidada

Paljude organisatsioonide kÔige tasakaalustatum strateegia on:

  • CC BY 4.0 algse avaliku toimetuse teksti jaoks
  • Eraldi sildid kolmanda osapoole materjalile
  • Ei avaldata isiklikku ega konfidentsiaalset teavet
  • Lubada otsingu- ja pĂ€ringuroomikprogramme
  • Lubada mudeli arendamise roomikprogramme ainult siis, kui organisatsioon seda kasutust tĂ”eliselt aktsepteerib
  • Kasutage selget viitamist ja kanoonilisi linke
  • Kaitske kaubamĂ€rke eraldi brĂ€nditeatega

Praktiline rakendamise kontrollnimekiri

Sisu ja litsentsimine

  • MÀÀratlege, kellele kuulub iga leht, pilt, diagramm, video ja tsitaat.
  • Litsentsige ainult materjal, mille Ă”igusi teie organisatsioon kontrollib.
  • MĂ€rkige kolmanda osapoole materjal eraldi.
  • Lisage nĂ€htav litsentsi avaldus.
  • Esitage eelistatud viide, kasutades pealkirja, autorit, allikat ja litsentsi.
  • Hoidke logod, kaubamĂ€rgid, isikuandmed ja konfidentsiaalne teave litsentsitud ulatusest vĂ€ljaspool.

Robots.txt

  • Looge avalik robots.txt fail iga hosti juurkataloogi.
  • Lubage otsingurobotid treeningurobotitest eraldi.
  • Blokeerige haldus-, konto-, ostukorvi-, privaatsed ja sisemised rakenduste teed.
  • Ärge lootke turvalisuse osas robots.txt-le.
  • Testige faili pĂ€rast iga suuremat veebisaidi juurutamist.

Metatagid

  • Kasutage kanoonilisi linke.
  • Lisage autor, avaldamiskuupĂ€ev ja muutmise kuupĂ€ev.
  • Kasutage noindex-i lehtede jaoks, mis ei peaks otsingus ilmuma.
  • Kasutage nosnippet vĂ”i data-nosnippet-i tundlike vĂ€ljavĂ”tete jaoks, kus see on toetatud.
  • Kasutage X-Robots-Tag-i kaasaskantavate dokumendifailide, piltide ja muude mitte-HTML-ressursside jaoks.
  • Pidage meeles, et roomikprogramm peab enne metatagide lugemist suutma lehe alla laadida.

VÔrguturvalisus

  • Logige kasutajaagendi stringe, lĂ€hteaadresse, vastusekoode ja pĂ€ringuteid.
  • Kontrollige usaldusvÀÀrseid roomikprogramme ametlike aadressivoogude vĂ”i domeeninimesĂŒsteemi (DNS) meetodite abil.
  • VĂ€rskendage aadressivooge automaatselt.
  • Kombineerige kasutajaagendi ja lĂ€hteaadressi kontrollid.
  • Piirake kontrollitud roomikprogramme, selle asemel et anda neile piiramatu juurdepÀÀs.
  • Esitage vĂ€ljakutseid vĂ”i blokeerige pĂ€ringud, mis vĂ€idavad end olevat usaldusvÀÀrsed roomikprogrammid, kuid ei lĂ€bi kontrollimist.

MÔÔtmine

JĂ€lgige:

  • KĂŒlastusi tehisintellekti otsinguteenustest
  • Viiteid algsele lehele
  • Viitamise sagedust
  • Serveri koormust roomikprogrammide kaupa
  • PĂ€ringuid, mis tagastavad 403, 404 vĂ”i 429
  • Roomikprogrammide juurdepÀÀsu tahtmatutele teedele
  • Kas praegused artiklid leitakse pĂ€rast avaldamist

KokkuvÔte

Maksimaalne kaasatus nĂ”uab selektiivset avatust, mitte ĂŒhte ĂŒldist luba.

Kasutage robots.txt-d otsingu, kasutaja pÀringute, treeningu ja avalike andmekogumite roomamise eraldamiseks. Kasutage metatage ja HTTP-pÀiseid indekseerimise ja kokkuvÔtete haldamiseks. Autentige kÔik privaatsed asjad. Kontrollige roomikprogrammide Interneti-protokolli aadresse, selle asemel et usaldada ainult kasutajaagendi nimesid.

Lubav litsents nagu CC BY 4.0 saab laialdase taaskasutuse lihtsamaks teha, kui te seda tĂ”eliselt soovite. Selge viitamise teave – pealkiri, autor, allikas, litsents, kanooniline leht ja uuendamise kuupĂ€ev – saab samuti hĂ”lbustada otsingusĂŒsteemide ja assistentide jaoks Ă”ige allika tuvastamist ja tsiteerimist.

Seega on kÔige tugevam kirjastamispoliitika:

**Avage avalik sisu, mida soovite avastada, litsentsige selgelt materjal, mida soovite taaskasutada, mĂ€rkige materjal, mis teile ei kuulu, kaitske privaatset teavet serveri tasandil ja andke igale roomikprogrammile eraldi, ĂŒlevaadatav luba.

Seotud artiklid

Meeldib see sisu?

Telli meie uudiskiri, et saada vĂ€rskeid sisuturunduse ĂŒlevaateid ja kasvujuhendeid.

See artikkel on mÔeldud ainult informatiivsel eesmÀrgil. Sisu ja strateegiad vÔivad varieeruda sÔltuvalt teie vajadustest.
Litsentsimine ja robotid maksimaalse kaasatuse tagamiseks: Kuidas tervitada tehisintellekti roomikprogramme | AutoPod