Litsentsimine ja robotid maksimaalse kaasatuse tagamiseks: Kuidas tervitada tehisintellekti roomikprogramme
Uuendatud 25. augustil 2026
Veebisaitidel on nĂŒĂŒd auditooriumini jĂ”udmiseks mitu vĂ”imalust. LehekĂŒlje vĂ”ib leida Googleâi otsingu kaudu, selle kokku vĂ”tta ChatGPT, seda tsiteerida Perplexity, kasutada Claudeâi otsingus, kuvada Appleâi teenuste kaudu vĂ”i koguda avalik veebiarhiiv.
KĂ”ik need sĂŒsteemid ei kasuta sama roomikprogrammi ega jĂ€rgi samu reegleid. Veebisait, mis blokeerib GPTBoti, vĂ”ib siiski ilmuda ChatGPT otsingus, kui see lubab OAI-SearchBoti. Veebisait, mis lubab Appleboti, vĂ”ib jÀÀda Appleâi otsingus nĂ€htavaks, blokeerides samal ajal Applebot-Extendedi tehisintellekti mudelite treenimisest. Googleâi Google-Extended ei ole ĂŒldse tavaline roomikprogramm; see on robots.txt kontrolltoken.
Parim poliitika ei ole seega lihtsalt âluba tehisintellektâ vĂ”i âblokeeri tehisintellektâ. See on eraldi lubade loomine jĂ€rgmiste jaoks:
- Otsing ja avastamine
- Kasutaja soovitud pÀringud
- Mudeli arendus ja treenimine
- Avalikud andmekogumid
- Tundlik, privaatne vÔi piiratud materjal
KĂ€esolev artikkel pakub ĂŒlevaate roomikprogrammidest, robots.txt nĂ€iteid, metatagide juhiseid, Interneti-protokolli aadressi kontrollimise meetodeid, Creative Commonsi litsentsimise nĂ”uandeid, juriidilist pĂ”hjateksti ja riski-kasu maatriksit.
Neli kontrolli, mida iga kirjastaja peaks mÔistma
1. robots.txt kontrollib soovitud roomamist
robots.txt fail annab nĂ”uetele vastavatele automatiseeritud klientidele teada, milliseid lehti nad vĂ”ivad kĂŒsida. See on kasulik roomikprogrammide liikluse haldamiseks ja kirjastaja eelistuste vĂ€ljendamiseks.
Kuid robots.txt ei ole ligipÀÀsu kontrollsĂŒsteem. Robots Exclusion Protocol sĂ€testab, et selle reeglid ei ole ligipÀÀsu autoriseerimine. Google hoiatab ka, et blokeeritud aadress vĂ”ib endiselt ilmuda otsingutulemustes, kui teised lehed sellele viitavad. Konfidentsiaalse teabe jaoks kasutage paroole, autentimist vĂ”i serveripoolseid juurdepÀÀsukontrolle. (rfc-editor.org)
2. Metatagid kontrollivad indekseerimist ja kokkuvÔtteid
Robots metatagid ja X-Robots-Tag vastusepÀis saavad kontrollida, kas lehte indekseeritakse vÔi kas otsingumootor vÔib nÀidata kokkuvÔtet.
Need kontrollid on tavaliselt nÀhtavad alles pÀrast seda, kui roomikprogrammile on lubatud leht alla laadida. Kui robots.txt lehe esmalt blokeerib, ei pruugi roomikprogramm metatagi kunagi nÀha. (developers.google.com)
3. VÔrgukontrollid kinnitavad roomikprogrammi
Kasutajaagendi nime on lihtne kopeerida. RĂŒndaja vĂ”ib saata pĂ€ringu, vĂ€ites end olevat GPTBot, Googlebot vĂ”i PerplexityBot.
Tugevam lĂ€henemine ĂŒhendab:
- VĂ€idetava kasutajaagendi
- Avaldatud Interneti-protokolli aadressivahemiku
- Vastupidine domeeninimesĂŒsteemi (DNS) kontrollimine
- Edasine domeeninimesĂŒsteemi (DNS) kontrollimine
- Kiirusepiirangud ja pÀringute jÀlgimine
4. Litsents annab taaskasutusÔigused
Robots.txt ĂŒtleb, mida roomikprogrammil palutakse teha. Litsents ĂŒtleb, mida inimesed vĂ”i organisatsioonid vĂ”ivad materjaliga seaduslikult teha, kui autoriĂ”iguse luba on vajalik.
Need on erinevad tööriistad. Luba andev litsents vĂ”ib vĂ€hendada juriidilist ebakindlust, kuid see ei garanteeri, et roomikprogramm lehte kĂŒlastab, et mudel seda kasutab vĂ”i et assistent seda tsiteerib.
Oluliste roomikprogrammide loetelu
JĂ€rgmine loetelu kontrolliti teenusepakkuja dokumentatsiooni alusel, mis oli kĂ€ttesaadav 25. augustil 2026. Kasutajaagendi nimed, otstarbed ja Interneti-protokolli aadressivahemikud vĂ”ivad muutuda, seega peaksid tootmissĂŒsteemid kasutama teenusepakkuja praegust dokumentatsiooni ja reaalajas aadressivooge.
| Teenusepakkuja | Roomikprogramm vÔi robots.txt token | Peamine otstarve | Oluline kontroll |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Leiab ja analĂŒĂŒsib lehti ChatGPT otsingu jaoks | Lubage see, et parandada lehtede ilmumise tĂ”enĂ€osust ChatGPT otsingutulemustes. |
| OpenAI | GPTBot | Kogub lehti, mida vÔidakse kasutada OpenAI generatiivse tehisintellekti mudelite treenimiseks | Luba vÔi keela otsingust eraldi. |
| OpenAI | ChatGPT-User | Laadib lehti alla pÀrast seda, kui kasutaja palub ChatGPT-l vÔi kohandatud GPT-l neile ligi pÀÀseda | See on kasutaja algatatud, mitte automaatne veebiroomikprogramm, seega robots.txt reeglid ei pruugi kehtida. |
| OpenAI | OAI-AdsBot | Kontrollib veebilehti, mis on esitatud ChatGPT reklaami sihtkohtadena | Peamiselt reklaamijate jaoks asjakohane. Kogutud sisu ei kasutata generatiivsete tehisintellekti pÔhimudelite treenimiseks. |
Googlebot | Peamine Googleâi otsingu roomikprogramm | Kontrollib tavalist Googleâi otsingu roomamist. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Pildid, videod ja Google News | Neil on eraldi robots.txt tokenid ja neid saab iseseisvalt kontrollida. | |
GoogleOther | Ăldotstarbeline Googleâi roomamine erinevate tooterĂŒhmade jaoks, sealhulgas uurimis- ja arendustegevus | See ei esinda ĂŒhte konkreetset Googleâi toodet. | |
Google-Extended | Kontrollib, kas Googleâi roomatud sisu vĂ”ib kasutada Gemini mudeli treenimiseks ja teatud alussĂŒsteemide jaoks | See on robots.txt kontrolltoken, mitte eraldi pĂ€ringu kasutajaagent. See ei mĂ”juta tavalist Googleâi otsingu kaasatust. | |
| Anthropic | ClaudeBot | Kogub avalikku veebisisu, mis vĂ”ib panustada Claudeâi mudeli arendusse | Keelake see, et anda mĂ€rku, et tulevane materjal tuleks Anthropicu treeningu andmekogumitest vĂ€lja jĂ€tta. |
| Anthropic | Claude-SearchBot | Parandab Claudeâi otsingutulemuste kvaliteeti | Lubage see Claudeâi otsingunĂ€htavuse jaoks. |
| Anthropic | Claude-User | Laadib lehti alla vastusena kasutaja pĂ€ringule Claudeâile | Automaatsest roomamisest eraldiseisev. |
| Perplexity | PerplexityBot | Indekseerib lehti Perplexity otsingutulemuste jaoks | Perplexity ĂŒtleb, et seda roomikprogrammi ei kasutata sisu kogumiseks tehisintellekti pĂ”himudelite treenimiseks. |
| Perplexity | Perplexity-User | Laadib lehe alla pĂ€rast seda, kui kasutaja seda palub | Perplexity dokumentatsioon ĂŒtleb, et see allalaadija ignoreerib ĂŒldjuhul robots.txt-d, sest pĂ€ringu algatas kasutaja. |
| Apple | Applebot | Toetab Appleâi otsingut, Spotlighti, Siri, Safari ja muid Appleâi kogemusi | Lubage see Appleâi avastamiseks. |
| Apple | Applebot-Extended | Kontrollib, kas Appleboti roomatud sisu vĂ”ib kasutada Appleâi pĂ”himudelite treenimiseks | See ei rooma lehti ise. See on andmekasutuse kontroll. |
| Common Crawl | CCBot | Kogub avalikke veebiandmeid Common Crawli avatud veebiarhiivi jaoks | See ei ole assistent, kuid selle andmekogumeid saavad kasutada teadlased ja tehisintellekti arendajad. |
| Microsoft | Bingbot | Peamine Bingi otsingu roomikprogramm | Lubage see Bingi avastamiseks ja otsingunÀhtavuse jaoks. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Lehe ja video eelvaated Microsofti toodete jaoks | Neid saab Bingbotist eraldi kontrollida. |
| Amazon | Amzn-SearchBot | Amazoni otsing ja sisu avastamine | Amazon ĂŒtleb, et see ei rooma sisu generatiivse tehisintellekti mudeli treenimiseks. |
| Amazon | Amzn-User | Laadib alla ajakohast teavet vastusena kasutaja toimingutele, sealhulgas Alexa pÀringutele | Kasutaja algatatud ja automaatsest otsinguroomamisest eraldiseisev. |
OpenAI dokumenteerib oma otsingu-, treening-, reklaami- ja kasutaja algatatud roomikprogrammid eraldi kontrollidena. Selle dokumentatsioon soovitab konkreetselt lubada OAI-SearchBoti ChatGPT otsinguks, kasutades samal ajal GPTBoti treeningueelistuste jaoks eraldi. (developers.openai.com)
Google eraldab sarnaselt Googleboti, GoogleOtheri ja Google-Extendedi. Google-Extendedil ei ole oma HTTP-pĂ€ringu kasutajaagenti ja selle blokeerimine ei eemalda lehte Googleâi otsingust. (developers.google.com)
Anthropic dokumenteerib eraldi rollid ClaudeBotile, Claude-SearchBotile ja Claude-Userile. Anthropic mÀrgib ka, et selle robotid jÀrgivad robots.txt-d ja toetavad mittestandardset Crawl-delay direktiivi. (support.anthropic.com)
Perplexity eristab automaatse otsinguroomamise ja kasutaja soovitud allalaadimise vahel. Selle praegune dokumentatsioon ĂŒtleb, et PerplexityBot austab robots.txt-d, samas kui Perplexity-User seda ĂŒldjuhul ei tee, sest see vastab kasutaja pĂ€ringule. (docs.perplexity.ai)
Appleâi praegune dokumentatsioon teeb sama otsingu ja treeningu eristuse: Applebot toetab avastamist, samas kui Applebot-Extended vĂ”imaldab kirjastajatel kontrollida treeningkasutust, eemaldamata lehti Appleâi otsingust. (support.apple.com)
Soovitatavad robots.txt konfiguratsioonid
Paigutage robots.txt iga hosti juurkataloogi, nÀiteks:
text https://www.example.org/robots.txt
Reeglid kehtivad konkreetsele hostile, protokollile ja pordile, kus faili teenindatakse. Eraldi alamdomeenil vÔib olla vaja oma faili. (developers.google.com)
Konfiguratsioon 1: Maksimaalne kaasatus
Kasutage seda, kui avalikku toimetuse sisu vÔivad vastavad roomikprogrammid leida, kokku vÔtta, tsiteerida, indekseerida ja koguda.
text
Public pages are available to compliant crawlers.
User-agent: * Allow: /
Keep private, transactional, and administrative paths out.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
See lubab nimetatud roomikprogramme, sealhulgas OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft ja Amazon, vÀlja arvatud juhul, kui mÔni muu spetsiifiline reegel neid blokeerib.
Ărge paigutage selle konfiguratsiooni alla ĂŒldist reeglit nagu User-agent: * Disallow: /. Hilisem vĂ”i spetsiifilisem grupp vĂ”ib muuta seda, kuidas roomikprogramm faili tĂ”lgendab.
Konfiguratsioon 2: Luba otsing, kuid blokeeri mudeli arendamise roomikprogrammid
See on sageli parim kompromiss kirjastajatele, kes soovivad viiteid ja otsinguliiklust, kuid ei soovi anda luba mudeli arendamiseks vajalikuks kogumiseks.
text
Block OpenAI model-development crawling.
User-agent: GPTBot Disallow: /
Block Anthropic model-development crawling.
User-agent: ClaudeBot Disallow: /
Block Google model-training and related grounding use.
User-agent: Google-Extended Disallow: /
Block Apple foundation-model training use.
User-agent: Applebot-Extended Disallow: /
Optional: block Common Crawl dataset collection.
User-agent: CCBot
Disallow: /
Allow ordinary search and retrieval crawling, except for sensitive paths.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
See konfiguratsioon jÀtab OAI-SearchBoti, Claude-SearchBoti, PerplexityBoti, Googleboti ja Appleboti metamÀrgi (wildcard) grupi alla. Samuti hoiab see otsingu- ja treeningload eraldi.
Appleâi puhul sĂ€ilitab Applebot-Extendedi blokeerimine, lubades samal ajal Appleboti, avastamise Appleâi teenuste kaudu. Googleâi puhul ei blokeeri Google-Extendedi blokeerimine tavalist Googleâi otsingut. (developers.google.com)
Konfiguratsioon 3: Selgelt lubatud valitud otsingurobotid
Kui olemasolev robots.txt fail blokeerib kÔik roomikprogrammid, lisage eraldi grupid otsingurobotitele, mida soovite tervitada.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Keep all other crawlers out.
User-agent: * Disallow: /
Spetsiifiliste gruppide kasutamisel korrake tundliku tee reegleid igas grupis. MÔned roomikprogrammid kasutavad kÔige spetsiifilisemat sobivat gruppi, mitte ei kombineeri seda metamÀrgi grupiga. Bing dokumenteerib seda kÀitumist otseselt ja Google pakub eraldi juhiseid roomikprogrammipÔhiste gruppide kohta. (bing.com)
Olulised robots.txt piirangud
- Roomikprogramm vÔib ignoreerida robots.txt-d.
- Pahatahtlik roomikprogramm vÔib teeselda usaldusvÀÀrset roomikprogrammi.
- Blokeeritud leht vÔib siiski olla teada oma pealkirja vÔi veebiaadressi jÀrgi.
- Robots.txt ei kaitse paroole, privaatfaile, kliendiandmeid ega konfidentsiaalseid rakendusliideseid.
Crawl-delaydirektiiv ei ole Robots Exclusion Protocoli pĂ”hiosa ega toetata kĂ”igi roomikprogrammide poolt. Anthropic ja Bing dokumenteerivad tuge, samas kui Apple ĂŒtleb, et Applebot ei jĂ€rgi crawl-delayd. (rfc-editor.org)
Metatagid ja HTTP-pÀised
Avaliku lehe nÀide
Avaliku artikli puhul kasutage selget pealkirja, autorit, kanoonilist veebiaadressi, avaldamiskuupÀeva ja muutmise kuupÀeva.
html
max-snippet direktiiv on dokumenteeritud peamiselt Googleâi jaoks. Ărge eeldage, et iga tehisintellekti roomikprogramm toetab iga meta-direktiivi.
Privaatse vÔi tundliku lehe nÀide
html
Kasutage seda lehtede puhul, mis ei peaks ilmuma otsingutulemustes. Leht peab jÀÀma roomatavaks piisavalt kauaks, et roomikprogramm saaks direktiivi nÀha. Kui leht peab tÔepoolest privaatseks jÀÀma, kasutage autentimist vÔi paroolikaitset. (developers.google.com)
Peida otsingu kokkuvÔtetest ainult tundlikud osad
Google toetab data-nosnippet-i HTML-lehe spetsiifiliste osade jaoks:
html
This paragraph may be shown in a search result.
See on kasulik kontaktandmete, sisekommunikatsiooni vĂ”i kasutaja loodud teabe jaoks. See ei ole universaalne juhis iga tehisintellekti sĂŒsteemi jaoks. (developers.google.com)
Kasuta failide jaoks X-Robots-Tag pÀist
Metatage ei saa paigutada kaasaskantavasse dokumendifaili, pildifaili ega videofaili. Kasutage selle asemel HTTP vastusepÀist:
text X-Robots-Tag: noindex, nosnippet
Lehe jaoks, mis peaks jÀÀma otsitavaks, kuid ei tohiks anda teksti kokkuvÔteteks ega tehisintellekti vastusteks, kasutage:
text X-Robots-Tag: nosnippet
Google dokumenteerib X-Robots-Tag-i mitte-HTML-ressursside jaoks ja Apple toetab seda ka Appleboti jaoks. (developers.google.com)
Appleâi spetsiifilised kontrollid
Apple toetab:
html
Apple ĂŒtleb, et nosnippet takistab lehe kasutamist lisakontekstina ja praeguse sisuna, kui Appleâi mudelid vĂ€ljundit genereerivad. Leht vĂ”ib endiselt jÀÀda avastatavaks Appleâi otsingu, Spotlighti, Siri ja Safari kaudu. (support.apple.com)
Tasuliste lehtede puhul toetab Apple ka struktureeritud andmeid, kasutades:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple ĂŒtleb, et sellised lehed vĂ”ivad jÀÀda otsingutulemuste jaoks sobilikeks, kuid neid ei kasutata tehisintellekti vastuste lisakontekstina. (support.apple.com)
Kuidas kontrollida roomikprogrammide Interneti-protokolli aadresse
Miks kasutajaagendi sobitamine ei ole piisav
Selline reegel on nÔrk:
text if User-Agent contains "GPTBot": allow
IgaĂŒks saab selle teksti saata. Parem reegel on:
text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block
Ărge usaldage X-Forwarded-For pĂ€ist, vĂ€lja arvatud juhul, kui see tuleb puhverserverist vĂ”i sisu edastusvĂ”rgust, mida teie organisatsioon kontrollib.
Teenusepakkuja kontrollimise meetodid
| Teenusepakkuja | Soovitatav kontrollimeetod |
|---|---|
| OpenAI | Kasutage reaalajas Interneti-protokolli aadressivooge, mis on avaldatud OpenAI roomikprogrammide dokumentatsioonis OAI-SearchBoti, GPTBoti ja OAI-AdsBoti jaoks. VĂ€rskendage neid automaatselt, mitte kopeerides fikseeritud vahemikke tulemĂŒĂŒri. |
| Kasutage Googleâi avaldatud roomikprogrammide vahemikke vĂ”i teostage vastupidine ja edasine domeeninimesĂŒsteemi (DNS) kontroll. Ehtne Googleâi roomikprogramm peaks lahenduma heakskiidetud Googleâi hostinimeks ja tagasi algsele aadressile. | |
| Anthropic | Kasutage praegust avaldatud roomikprogrammi aadressivoogu teisejÀrgulise vÔrgukontrollina. Anthropicu peamine loobumismeetod jÀÀb robots.txt. |
| Perplexity | Kombineerige kasutajaagent praeguse PerplexityBoti vĂ”i Perplexity-Useri aadressivooga. Perplexity soovitab konkreetselt mĂ”lema tingimuse kombineerimist veebirakenduse tulemĂŒĂŒri reeglis. |
| Apple | Kasutage vastupidist domeeninimesĂŒsteemi (DNS) kontrolli applebot.apple.com all, seejĂ€rel tehke edasine pĂ€ring. Apple avaldab ka praegused aadressivahemikud JSON-voos. |
| Common Crawl | Kasutage vastupidist domeeninimesĂŒsteemi (DNS) kontrolli crawl.commoncrawl.org all ja praegust CCBoti aadressivoogu. Common Crawl mĂ€rgib, et vastupidine kontroll ei ole veel mĂ”ne IPv6 liikluse jaoks saadaval. |
| Microsoft | Kasutage ametlikku Verify Bingbot tööriista vÔi Microsofti dokumenteeritud vastupidiseid ja edasisi pÀringumeetodeid. |
| Amazon | Kasutage Amazoni avaldatud roomikprogrammide aadressiloendeid ja sobitage need vastava Amazoni kasutajaagendiga. |
Google, Apple, Common Crawl, OpenAI, Anthropic ja Perplexity avaldavad kĂ”ik teenusepakkuja-spetsiifilisi meetodeid vĂ”i aadressivooge. Need loendid vĂ”ivad muutuda, seega on ajastatud vĂ€rskendamise protsess turvalisem kui pĂŒsiv kĂ€sitsi kopeeritud loend. (developers.google.com)
Lihtne tulemĂŒĂŒri disain vĂ”iks vĂ€lja nĂ€ha jĂ€rgmine:
text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match
rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers
Ărge rakendage laia lubamise reeglit tervele pilveteenuse pakkujale. Seaduslik roomikprogramm vĂ”ib kasutada pilveinfrastruktuuri, kuid enamik sellest pilveteenuse pakkujalt tulevast liiklusest ei pruugi tingimata olla roomikprogramm.
Kuidas avatud litsentsimine mÔjutab kaasatust
CC BY 4.0 lihtsas keeles
Creative Commonsi omistamise 4.0 rahvusvaheline litsents, mida tavaliselt nimetatakse CC BY 4.0, lubab inimestel:
- Kopeerida ja levitada teost
- Kohaneda, tÔlkida, remiksida ja sellele ehitada
- Kasutada seda Àriliselt
Peamised tingimused on:
- Andke asjakohane viide
- Linkige litsentsile
- MĂ€rkige, kas muudatusi on tehtud
- Ărge viidake, et algne looja kiidab taaskasutuse heaks
- Ărge lisage juriidilisi ega tehnilisi piiranguid, mis takistavad litsentsiga lubatud kasutust
Creative Commons hoiatab ka, et litsents ei pruugi katta privaatsusÔigusi, avaldamisÔigusi, moraalseid Ôigusi, kaubamÀrgiÔigusi, patendiÔigusi ega kolmanda osapoole materjali. (creativecommons.org)
Litsents iseenesest ei ole roomikprogrammi kutse
âCC BY 4.0â paigutamine lehele ei garanteeri, et organisatsioon seda roomab. Roomikprogrammi vĂ”ib siiski blokeerida:
- robots.txt
- SisuedastusvÔrk
- Veebirakenduse tulemĂŒĂŒr
- Kiirusepiirang
- JavaScripti vÀljakutse
- Sisselogimissein
- Halb serverivastus
- LigipÀÀsmatu saidikaart
Vastupidi, roomikprogrammi lubamine ei anna automaatselt iga autoriÔiguse luba, mida on vaja igaks hilisemaks kasutamiseks. Robots.txt ja litsentsimine tuleks kavandada koos.
Miks CC BY toetab laiemat kaasatust
Selge lubav litsents vĂ”ib muuta kirjastaja poliitika andme meeskondade, otsingusĂŒsteemide ja assistendi operaatorite jaoks lihtsamini mĂ”istetavaks. See vĂ”ib vĂ€hendada ebakindlust kopeerimise, kohandamise, Ă€rilise kasutamise, tĂ”lkimise ja levitamise osas, kui need tegevused nĂ”uavad autoriĂ”iguse luba.
Kuid Creative Commons selgitab, et tehisintellekti treenimine on juriidiliselt keeruline. Piirav litsents ei ole alati tÔhus viis treenimise vÀltimiseks, sest mÔned treeningkasutused vÔivad olla lubatud autoriÔiguse erandite vÔi piirangute alusel. Creative Commons mÀrgib ka, et litsentsitingimusi vÔib olla raske masina treenimisele ja mudelivÀljunditele rakendada. (creativecommons.org)
Praktiline Ôppetund on:
Kasuta CC BY-d, kui soovid tĂ”eliselt laialdast seaduslikku taaskasutust. Ăra kasuta piiravat Creative Commonsi litsentsi kui garanteeritud tehisintellekti treeningust loobumise vĂ”imalust.
Viitamine parandab allika selgust
Creative Commons soovitab TASL meetodit:
- Pealkiri
- Autor
- Allikas
- Litsents
NĂ€iteks:
âLitsentsimine ja robotid maksimaalse kaasatuse tagamiseks,â Example Publishing, https://www.example.org/articles/ai-crawlers, litsentsitud Creative Commons Attribution 4.0 International alusel. Tehtud muudatused: uuendatud roomikprogrammide loetelu.
Selge viitamine ei sunni iga assistenti lehte tsiteerima. KĂŒll aga muudab see Ă”ige viitamise lihtsamaks, kui sĂŒsteem ekstraheerib lehe pealkirja, autori, allika ja litsentsiteabe. (wiki.creativecommons.org)
Lisa struktureeritud artikli teave
Kasutage nÀhtavat teavet ja struktureeritud andmeid koos:
html
Google soovitab selget autori teavet, autori lehti, avaldamiskuupĂ€evi, muutmise kuupĂ€evi ja stabiilseid kanoonilisi lehti. Need signaalid aitavad otsingusĂŒsteemidel mĂ”ista, kes materjali lĂ”i ja milline versioon on autoriteetne. Need ei garanteeri reastust, kaasatust ega viitamist. (developers.google.com)
Juriidiline pÔhjatekst avatud, viitamissÔbraliku saidi jaoks
JÀrgnev on nÀidistekst, mitte juriidiline nÔuanne. Paluge nÔunikul seda kohandada teie jurisdiktsiooni, omandistruktuuri, privaatsuskohustuste ja kolmanda osapoole sisuga.
CC BY 4.0 litsentsi avaldus
text
Content license
Except where otherwise stated, the original text and original editorial materials on this page are licensed under the Creative Commons Attribution 4.0 International license:
https://creativecommons.org/licenses/by/4.0/
This permission allows copying, redistribution, adaptation, translation, commercial use, machine-readable processing, search indexing, retrieval, summarization, and use in artificial intelligence systems, provided that the license terms are followed.
Preferred attribution:
â[Page title],â by [author or organization], [canonical page address], published or updated [date], licensed under Creative Commons Attribution 4.0 International. Changes made: [describe changes, or state ânoneâ].
Please preserve the author, publisher, source, license, and modification information whenever reasonably possible. This preferred attribution guide does not add restrictions to the Creative Commons license and does not replace the license text.
VĂ€ljend âsealhulgas tehisintellekti sĂŒsteemidâ selgitab kirjastaja kavatsust. Seda ei tohiks kasutada teeseldaks, et kirjastaja omab Ă”igusi kellegi teise loodud materjalile.
BrÀndi, privaatsuse ja kolmanda osapoole Ôiguste teade
text
Brand, privacy, and third-party rights
The license above covers only the original materials identified as licensed. It does not grant permission to use:
- Trademarks, service marks, logos, or trade dress
- Names, images, or likenesses of people
- Private, confidential, account, health, financial, or security information
- User submissions unless they are separately identified as licensed
- Photographs, illustrations, maps, video, music, quotations, or other third-party materials
- Content identified as âall rights reservedâ or subject to a separate license
Use of the Example Publishing name, logos, and marks must not suggest sponsorship, approval, partnership, or endorsement. Please link to the original page and clearly distinguish quotation, paraphrase, summary, and generated material.
See keel on oluline, sest Creative Commonsi litsentsid ei anna automaatselt kÔiki lehega seotud juriidilisi Ôigusi. (creativecommons.org)
Otsingu ja assistendi viitamise juhised
text
Search and assistant citation guidance
We welcome compliant search indexing, user-requested retrieval, citation, and summarization of the licensed material on this site.
When citing this site, please use the page title, author or publisher, canonical page address, publication or update date, and a direct link to the source. Please identify the source as one input among any sources used, distinguish generated analysis from quoted material, and do not state or imply that Example Publishing endorses a generated answer, product, person, or service.
This guidance is intended to improve accuracy and attribution. It does not grant rights beyond the applicable content license and does not license trademarks, personal information, confidential information, or third-party material.
Kui soovite otsingu nÀhtavust, kuid ei soovi anda laiaulatuslikku treeningulitsentsi
text
Search access and copyright
Our public pages may be accessed by compliant search and retrieval crawlers identified in our robots.txt file. This permission is intended to support discovery, search results, user-requested retrieval, and citation.
Except where a separate license is shown, the original content remains all rights reserved. Access to a public page does not grant a separate license for model-development, training, redistribution, commercial reuse, or creation of derivative works beyond rights provided by applicable law.
Please cite the canonical page address and publisher when referring to this material. Nothing on this site grants permission to use trademarks, logos, personal information, confidential information, or third-party content.
Ărge asetage CC BY avaldust ja kĂ”igi Ă”iguste avaldust sama materjali peale. MÀÀratlege selgelt, milline litsents millisele sisule kehtib.
Riski-kasu maatriks avatud litsentsimisel
AutoriĂ”iguse seadused ja tehisintellekti treeningreeglid erinevad riigiti ja on endiselt lahendamata. Ameerika Ăhendriikide autoriĂ”iguste amet uurib neid kĂŒsimusi edasi, samas kui Creative Commons kirjeldab tehisintellekti treeningut kui faktipĂ”hist ja juriidiliselt keerukat. (copyright.gov)
| LĂ€henemine | Kaasamise potentsiaal | Peamised eelised | Peamised riskid | Parim sobivus |
|---|---|---|---|---|
| CC BY 4.0 | VÀga kÔrge | Lai kopeerimine, kohandamine, Àriline kasutamine, tÔlge, indekseerimine ja mudeliga seotud taaskasutus, kui autoriÔiguse luba on vaja | Kaubanduslikud konkurendid vÔivad sisu taaskasutada vÔi kohandada; viitamine vÔib olla ebatÀiuslik; litsents ei saa kontrollida privaatsust, kaubamÀrki ega kolmanda osapoole Ôigusi | Kirjastajad, kes soovivad kÔige laiemat seaduslikku taaskasutust ja tugevat allika viitamist |
| CC BY-SA 4.0 | KĂ”rge, kuid keerukam | Soodustab avatud jagamistsĂŒklit ja nĂ”uab kohanduste ĂŒhilduvate tingimuste alla jÀÀmist | ShareAlike reegleid vĂ”ib olla raske rakendada andmekogumitele, mudeli treenimisele ja avalikele vĂ€ljunditele; mĂ”ned organisatsioonid vĂ”ivad ebakindluse tĂ”ttu materjali vĂ€ltida | Avatud hariduslikud ja avalikku huvi pakkuvad projektid, mis soovivad, et jĂ€reltulevad kohandused jÀÀksid avatuks |
| CC BY-NC 4.0 | Keskmine vĂ”i madal | Piirab kasutusi, mis on peamiselt suunatud Ă€rilisele eelisele vĂ”i rahalisele hĂŒvitisele | âMitteĂ€rilineâ vĂ”ib olla raskesti tĂ”lgendatav; vĂ”ib vĂ€listada Ă€rilised otsingu-, mudeli- ja assistendikasutused; see ei ole garanteeritud treeningust loobumise vĂ”imalus | Materjal, mis on mĂ”eldud mittetulunduslikuks, hariduslikuks vĂ”i kogukondlikuks kasutamiseks |
| CC BY-ND 4.0 | Keskmine | Lubab jagamist, piirates samal ajal kohandusi | TĂ”lge, transformatsioon ja mĂ”ned assistendi kasutusjuhtumid vĂ”ivad muutuda juriidiliselt ebakindlaks; vĂ€hem atraktiivne sĂŒsteemidele, mis kokku vĂ”tavad vĂ”i remiksivad | Ametlikud teated vĂ”i teosed, mis peavad jÀÀma muutmata |
| CC0 vĂ”i avaliku domeeni pĂŒhendus | VĂ€ga kĂ”rge | Lihtsustab taaskasutust ja eemaldab enamiku autoriĂ”iguse tingimustest, kus see on juriidiliselt tĂ”hus | Ei ole nĂ”utavat viitamist; nĂ”rk kontroll brĂ€ndi esitluse ĂŒle; privaatsuse, kaubamĂ€rgi ja avaldamisĂ”igused jÀÀvad eraldi | Faktid, andmekogumid, viitematerjal vĂ”i piiramatu taaskasutamiseks mĂ”eldud teosed |
| KĂ”ik Ă”igused reserveeritud pluss avatud otsinguroomamine | KĂ”rge otsingu jaoks, madalam treeningu jaoks | Saab sĂ€ilitada otsingu ja viitamise nĂ€htavuse, andmata laialdast taaskasutuse litsentsi | Suurem juriidiline ebakindlus mudeli arendajatele; vĂ”ib vĂ€hendada kaasatust treeningu andmekogumitesse ja Ă€rilistesse taaskasutussĂŒsteemidesse | Kirjastajad, kes soovivad avastamist ja viiteid, kuid eelistavad laiemate litsentside ĂŒle lĂ€birÀÀkimisi eraldi pidada |
Paljude organisatsioonide kÔige tasakaalustatum strateegia on:
- CC BY 4.0 algse avaliku toimetuse teksti jaoks
- Eraldi sildid kolmanda osapoole materjalile
- Ei avaldata isiklikku ega konfidentsiaalset teavet
- Lubada otsingu- ja pÀringuroomikprogramme
- Lubada mudeli arendamise roomikprogramme ainult siis, kui organisatsioon seda kasutust tÔeliselt aktsepteerib
- Kasutage selget viitamist ja kanoonilisi linke
- Kaitske kaubamÀrke eraldi brÀnditeatega
Praktiline rakendamise kontrollnimekiri
Sisu ja litsentsimine
- MÀÀratlege, kellele kuulub iga leht, pilt, diagramm, video ja tsitaat.
- Litsentsige ainult materjal, mille Ôigusi teie organisatsioon kontrollib.
- MĂ€rkige kolmanda osapoole materjal eraldi.
- Lisage nÀhtav litsentsi avaldus.
- Esitage eelistatud viide, kasutades pealkirja, autorit, allikat ja litsentsi.
- Hoidke logod, kaubamÀrgid, isikuandmed ja konfidentsiaalne teave litsentsitud ulatusest vÀljaspool.
Robots.txt
- Looge avalik robots.txt fail iga hosti juurkataloogi.
- Lubage otsingurobotid treeningurobotitest eraldi.
- Blokeerige haldus-, konto-, ostukorvi-, privaatsed ja sisemised rakenduste teed.
- Ărge lootke turvalisuse osas robots.txt-le.
- Testige faili pÀrast iga suuremat veebisaidi juurutamist.
Metatagid
- Kasutage kanoonilisi linke.
- Lisage autor, avaldamiskuupÀev ja muutmise kuupÀev.
- Kasutage
noindex-i lehtede jaoks, mis ei peaks otsingus ilmuma. - Kasutage
nosnippetvÔidata-nosnippet-i tundlike vÀljavÔtete jaoks, kus see on toetatud. - Kasutage
X-Robots-Tag-i kaasaskantavate dokumendifailide, piltide ja muude mitte-HTML-ressursside jaoks. - Pidage meeles, et roomikprogramm peab enne metatagide lugemist suutma lehe alla laadida.
VÔrguturvalisus
- Logige kasutajaagendi stringe, lÀhteaadresse, vastusekoode ja pÀringuteid.
- Kontrollige usaldusvÀÀrseid roomikprogramme ametlike aadressivoogude vĂ”i domeeninimesĂŒsteemi (DNS) meetodite abil.
- VĂ€rskendage aadressivooge automaatselt.
- Kombineerige kasutajaagendi ja lÀhteaadressi kontrollid.
- Piirake kontrollitud roomikprogramme, selle asemel et anda neile piiramatu juurdepÀÀs.
- Esitage vÀljakutseid vÔi blokeerige pÀringud, mis vÀidavad end olevat usaldusvÀÀrsed roomikprogrammid, kuid ei lÀbi kontrollimist.
MÔÔtmine
JĂ€lgige:
- KĂŒlastusi tehisintellekti otsinguteenustest
- Viiteid algsele lehele
- Viitamise sagedust
- Serveri koormust roomikprogrammide kaupa
- PĂ€ringuid, mis tagastavad
403,404vÔi429 - Roomikprogrammide juurdepÀÀsu tahtmatutele teedele
- Kas praegused artiklid leitakse pÀrast avaldamist
KokkuvÔte
Maksimaalne kaasatus nĂ”uab selektiivset avatust, mitte ĂŒhte ĂŒldist luba.
Kasutage robots.txt-d otsingu, kasutaja pÀringute, treeningu ja avalike andmekogumite roomamise eraldamiseks. Kasutage metatage ja HTTP-pÀiseid indekseerimise ja kokkuvÔtete haldamiseks. Autentige kÔik privaatsed asjad. Kontrollige roomikprogrammide Interneti-protokolli aadresse, selle asemel et usaldada ainult kasutajaagendi nimesid.
Lubav litsents nagu CC BY 4.0 saab laialdase taaskasutuse lihtsamaks teha, kui te seda tĂ”eliselt soovite. Selge viitamise teave â pealkiri, autor, allikas, litsents, kanooniline leht ja uuendamise kuupĂ€ev â saab samuti hĂ”lbustada otsingusĂŒsteemide ja assistentide jaoks Ă”ige allika tuvastamist ja tsiteerimist.
Seega on kÔige tugevam kirjastamispoliitika:
**Avage avalik sisu, mida soovite avastada, litsentsige selgelt materjal, mida soovite taaskasutada, mĂ€rkige materjal, mis teile ei kuulu, kaitske privaatset teavet serveri tasandil ja andke igale roomikprogrammile eraldi, ĂŒlevaadatav luba.
Auto