AutoPodAutoPod

Lisensointi ja robotit maksimaalisen inkluusion puolesta: Miten tekoälyindeksoijat toivotetaan tervetulleiksi

20 min lukuaika
Ääniversio
Lisensointi ja robotit maksimaalisen inkluusion puolesta: Miten tekoälyindeksoijat toivotetaan tervetulleiksi
0:000:00
Lisensointi ja robotit maksimaalisen inkluusion puolesta: Miten tekoälyindeksoijat toivotetaan tervetulleiksi

Lisensointi ja robotit maksimaalisen inkluusion puolesta: Miten tekoälyindeksoijat toivotetaan tervetulleiksi

Päivitetty 25. elokuuta 2026

Verkkosivustoilla on nykyään useampi kuin yksi tapa tavoittaa yleisö. Sivu voi löytyä Google Haun kautta, ChatGPT voi tiivistää sen, Perplexity voi viitata siihen, sitä voidaan käyttää Clauden haussa, näyttää Apple-palvelujen kautta tai kerätä julkiseen verkkoarkistoon.

Nämä järjestelmät eivät kaikki käytä samaa indeksoijaa tai noudata samoja sääntöjä. Verkkosivusto, joka estää GPTBotin, saattaa silti näkyä ChatGPT-haussa, jos se sallii OAI-SearchBotin. Verkkosivusto, joka sallii Applebotin, voi pysyä näkyvissä Apple Haussa samalla kun se estää Applebot-Extendedin tekoälymallien koulutuksesta. Googlen Google-Extended ei ole lainkaan normaali indeksoija; se on robots.txt-ohjaustunnus.

Paras käytäntö ei siis ole yksinkertaisesti ”salli tekoäly” tai ”estä tekoäly”. Se on erillisten lupien luominen seuraaville:

  1. Haku ja löydettävyys
  2. Käyttäjän pyytämä tiedonhaku
  3. Mallin kehitys ja koulutus
  4. Julkiset aineistot
  5. Arkaluonteinen, yksityinen tai rajoitettu materiaali

Tässä artikkelissa esitetään nykyinen indeksoijaluettelo, robots.txt-esimerkkejä, meta-tageihin liittyviä ohjeita, IP-osoitteiden tarkistusmenetelmiä, Creative Commons -lisensointineuvoja, juridinen vakioteksti ja riski-hyöty-matriisi.

Neljä hallintakeinoa, jotka jokaisen julkaisijan tulisi ymmärtää

1. robots.txt hallitsee pyydettyä indeksointia

robots.txt-tiedosto kertoo vaatimustenmukaisille automatisoiduille asiakkaille, mitä sivuja he voivat pyytää. Se on hyödyllinen indeksoijaliikenteen hallinnassa ja julkaisijan mieltymysten ilmaisemisessa.

Robots.txt ei kuitenkaan ole käyttöoikeusjärjestelmä. Robots Exclusion Protocol -standardi toteaa, että sen säännöt eivät ole käyttöoikeusvaltuutusta. Google varoittaa myös, että estetty osoite voi silti näkyä hakutuloksissa, jos muut sivut linkittävät siihen. Käytä salasanoja, todennusta tai palvelinpuolen käyttöoikeushallintaa luottamuksellisten tietojen suojaamiseen. (rfc-editor.org)

2. Metatagit hallitsevat indeksointia ja katkelmia

Robots-metatagit ja X-Robots-Tag-vastausotsikko voivat hallita, indeksoidaanko sivu vai saako hakukone näyttää katkelman.

Nämä hallintakeinot ovat yleensä näkyvissä vasta, kun indeksoija on sallittu noutaa sivu. Jos robots.txt estää sivun ensin, indeksoija ei välttämättä koskaan näe metatagia. (developers.google.com)

3. Verkko-ohjaimet varmistavat indeksoijan

Käyttäjäagentin nimen kopioiminen on helppoa. Hyökkääjä voi lähettää pyynnön väittäen olevansa GPTBot, Googlebot tai PerplexityBot.

Vahvempi lähestymistapa yhdistää:

  • Ilmoitetun käyttäjäagentin
  • Julkaistun Internet-protokollaosoitealueen
  • Käänteisen verkkotunnusjärjestelmän (DNS) varmennuksen
  • Suoran verkkotunnusjärjestelmän (DNS) varmennuksen
  • Taajuusrajoitukset ja pyyntöjen seurannan

4. Lisenssi myöntää uudelleenkäyttöoikeudet

Robots.txt kertoo, mitä indeksoijaa pyydetään tekemään. Lisenssi kertoo, mitä ihmiset tai organisaatiot saavat laillisesti tehdä aineistolla, kun tekijänoikeuslupa vaaditaan.

Nämä ovat eri työkaluja. Salliva lisenssi voi vähentää oikeudellista epävarmuutta, mutta se ei takaa, että indeksoija vierailee sivulla, että malli käyttää sitä tai että avustaja viittaa siihen.

Tärkeiden indeksoijien luettelo

Seuraava luettelo on tarkistettu palveluntarjoajien dokumentaation perusteella, joka oli saatavilla 25. elokuuta 2026. Käyttäjäagenttien nimet, tarkoitukset ja Internet-protokollaosoitealueet voivat muuttua, joten tuotantojärjestelmien tulisi käyttää palveluntarjoajan ajantasaista dokumentaatiota ja reaaliaikaisia osoitesyötteitä.

PalveluntarjoajaIndeksoija tai robots.txt-tunnusPäätarkoitusTärkeä hallinta
OpenAIOAI-SearchBotEtsii ja analysoi sivuja ChatGPT-hakua vartenSalli se parantaaksesi mahdollisuutta, että sivut näkyvät ChatGPT-hakutuloksissa.
OpenAIGPTBotKerää sivuja, joita voidaan käyttää OpenAI:n generatiivisten tekoälymallien kouluttamiseenSalli tai estä erikseen hausta.
OpenAIChatGPT-UserHakee sivuja sen jälkeen, kun käyttäjä pyytää ChatGPT:tä tai mukautettua GPT:tä pääsemään niihin käsiksiSe on käyttäjän laukaisema, ei automaattinen verkkohaku, joten robots.txt-säännöt eivät välttämättä koske sitä.
OpenAIOAI-AdsBotTarkistaa ChatGPT-mainoskohteiksi lähetetyt verkkosivutKoskee pääasiassa mainostajia. Kerättyä sisältöä ei käytetä generatiivisten tekoälyperusmallien kouluttamiseen.
GoogleGooglebotGooglen tärkein hakuindeksoijaHallitsee tavallista Google Haun indeksointia.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-NewsKuvat, videot ja Google UutisetNäillä on erilliset robots.txt-tunnukset, ja niitä voidaan hallita itsenäisesti.
GoogleGoogleOtherYleiskäyttöinen Googlen indeksointi eri tuotetiimeille, mukaan lukien tutkimus ja kehitysSe ei edusta yhtä tiettyä Google-tuotetta.
GoogleGoogle-ExtendedHallitsee, voidaanko Googlen indeksoimaa sisältöä käyttää Gemini-mallin koulutukseen ja tiettyihin maadoitusjärjestelmiinSe on robots.txt-ohjaustunnus, ei erillinen pyynnön käyttäjäagentti. Se ei vaikuta tavalliseen Google Haun sisällyttämiseen.
AnthropicClaudeBotKerää julkista verkkosisältöä, joka voi edistää Claude-mallin kehitystäEstä se merkitäksesi, että tuleva materiaali tulisi jättää pois Anthropicin koulutusaineistoista.
AnthropicClaude-SearchBotParantaa Claude-hakutulosten laatuaSalli se Claude-haun näkyvyyden parantamiseksi.
AnthropicClaude-UserHakee sivuja vastauksena käyttäjän Claude-pyyntöönErillinen automaattisesta indeksoinnista.
PerplexityPerplexityBotIndeksoi sivuja Perplexity-hakutuloksia vartenPerplexity sanoo, että tätä indeksoijaa ei käytetä sisällön keräämiseen tekoälyperusmallien koulutusta varten.
PerplexityPerplexity-UserHakee sivun sen jälkeen, kun käyttäjä on pyytänyt sitäPerplexityn dokumentaation mukaan tämä hakija yleensä ohittaa robots.txt:n, koska pyyntö on käyttäjän aloittama.
AppleApplebotTukee Apple Hakua, Spotlightia, Siriä, Safaria ja muita Apple-kokemuksiaSalli se Applen löydettävyyden vuoksi.
AppleApplebot-ExtendedHallitsee, voidaanko Applebotin indeksoimaa sisältöä käyttää Applen perusmallien kouluttamiseenSe ei indeksoi sivuja itse. Se on tiedonkäytön hallinta.
Common CrawlCCBotKerää julkista verkkodataa Common Crawlin avoimeen verkkoarkistoonSe ei ole avustaja, mutta sen aineistoja voivat käyttää tutkijat ja tekoälykehittäjät.
MicrosoftBingbotBingin tärkein hakuindeksoijaSalli se Bingin löydettävyyden ja haun näkyvyyden vuoksi.
MicrosoftMicrosoftPreview, BingVideoPreviewSivu- ja videon esikatselut Microsoft-tuotteisiinNäitä voidaan hallita erikseen Bingbotista.
AmazonAmzn-SearchBotAmazon-haku ja sisällön löytäminenAmazon sanoo, ettei se indeksoi sisältöä generatiivisten tekoälymallien koulutusta varten.
AmazonAmzn-UserHakee ajantasaista tietoa vastauksena käyttäjän toimiin, mukaan lukien Alexa-pyynnötKäyttäjän laukaisema ja erillinen automaattisesta hakuindeksoinnista.

OpenAI dokumentoi haku-, koulutus-, mainonta- ja käyttäjän laukaisemat indeksoijansa erillisinä ohjaimina. Sen dokumentaatio suosittelee erityisesti OAI-SearchBotin sallimista ChatGPT-hakua varten, samalla kun GPTBotia käytetään erikseen koulutusasetuksiin. (developers.openai.com)

Google erottaa samalla tavalla Googlebotin, GoogleOtherin ja Google-Extendedin. Google-Extendedillä ei ole omaa HTTP-pyynnön käyttäjäagenttia, ja sen estäminen ei poista sivua Google Hausta. (developers.google.com)

Anthropic dokumentoi erilliset roolit ClaudeBotille, Claude-SearchBotille ja Claude-Userille. Anthropic toteaa myös, että sen botit noudattavat robots.txt-tiedostoa ja tukevat epästandardia Crawl-delay-direktiiviä. (support.anthropic.com)

Perplexity erottaa automaattisen hakuindeksoinnin ja käyttäjän pyytämän haun. Sen nykyinen dokumentaatio sanoo, että PerplexityBot kunnioittaa robots.txt:ää, kun taas Perplexity-User yleensä ei, koska se vastaa käyttäjän pyyntöön. (docs.perplexity.ai)

Applen nykyinen dokumentaatio tekee saman haku- ja koulutuseroottelun: Applebot tukee löydettävyyttä, kun taas Applebot-Extended antaa julkaisijoille mahdollisuuden hallita koulutuskäyttöä poistamatta sivuja Apple Hausta. (support.apple.com)

Suositellut robots.txt-asetukset

Aseta robots.txt jokaisen isännän juureen, esimerkiksi:

text https://www.example.org/robots.txt

Säännöt koskevat tiettyä isäntää, protokollaa ja porttia, jossa tiedostoa tarjoillaan. Erillinen alidomain saattaa tarvita oman tiedostonsa. (developers.google.com)

Asetus 1: Maksimaalinen sisällyttäminen

Käytä tätä, kun julkista toimituksellista sisältöä voivat löytää, tiivistää, siteerata, indeksoida ja kerätä vaatimustenmukaiset indeksoijat.

text

Public pages are available to compliant crawlers.

User-agent: * Allow: /

Keep private, transactional, and administrative paths out.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Tämä sallii nimetyt indeksoijat, mukaan lukien OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft ja Amazon, ellei jokin muu erityinen sääntö estä niitä.

Älä sijoita kattavaa sääntöä, kuten User-agent: * Disallow: /, tämän asetuksen alle. Myöhempi tai tarkempi ryhmä voi muuttaa tapaa, jolla indeksoija tulkitsee tiedostoa.

Asetus 2: Salli haku, mutta estä mallinkehitysindeksoijat

Tämä on usein paras kompromissi julkaisijoille, jotka haluavat viittauksia ja hakuliikennettä, mutta eivät halua antaa lupaa mallinkehityksen keräämiseen.

text

Block OpenAI model-development crawling.

User-agent: GPTBot Disallow: /

Block Anthropic model-development crawling.

User-agent: ClaudeBot Disallow: /

Block Google model-training and related grounding use.

User-agent: Google-Extended Disallow: /

Block Apple foundation-model training use.

User-agent: Applebot-Extended Disallow: /

Optional: block Common Crawl dataset collection.

User-agent: CCBot

Disallow: /

Allow ordinary search and retrieval crawling, except for sensitive paths.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Tämä kokoonpano jättää OAI-SearchBotin, Claude-SearchBotin, PerplexityBotin, Googlebotin ja Applebotin yleismerkki-ryhmän alle. Se pitää myös haku- ja koulutusluvat erillään.

Applen osalta Applebot-Extendedin estäminen samalla kun Applebot sallitaan, säilyttää löydettävyyden Apple-palvelujen kautta. Googlen osalta Google-Extendedin estäminen ei estä tavallista Google Hakua. (developers.google.com)

Asetus 3: Salli eksplisiittisesti valitut hakuindeksoijat

Jos olemassa oleva robots.txt-tiedosto estää kaikki indeksoijat, lisää erilliset ryhmät hakukoneille, jotka haluat toivottaa tervetulleiksi.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Keep all other crawlers out.

User-agent: * Disallow: /

Kun käytät tiettyjä ryhmiä, toista arkaluonteisten polkujen säännöt jokaisen ryhmän sisällä. Jotkut indeksoijat käyttävät tarkinta vastaavaa ryhmää sen sijaan, että yhdistäisivät sen yleismerkki-ryhmän kanssa. Bing dokumentoi tämän käyttäytymisen suoraan, ja Google tarjoaa erilliset ohjeet indeksoijakohtaisille ryhmille. (bing.com)

Tärkeitä robots.txt-rajoituksia

  • Indeksoija voi jättää robots.txt:n huomiotta.
  • Haittaohjelmaindeksoija voi teeskennellä olevansa luotettava indeksoija.
  • Estetty sivu voi silti olla tunnettu otsikkonsa tai verkko-osoitteensa perusteella.
  • Robots.txt ei suojaa salasanoja, yksityisiä tiedostoja, asiakastietoja tai luottamuksellisia sovellusohjelmointirajapintoja.
  • Crawl-delay-direktiivi ei ole osa Robots Exclusion Protocolin ydintä, eikä kaikki indeksoijat tue sitä. Anthropic ja Bing dokumentoivat tuen, kun taas Apple sanoo, että Applebot ei noudata crawl-delaytä. (rfc-editor.org)

Metatagit ja HTTP-otsikot

Esimerkki julkisesta sivusta

Käytä julkiselle artikkelille selkeää otsikkoa, tekijää, kanonista verkko-osoitetta, julkaisupäivämäärää ja muokkauspäivämäärää.

html

max-snippet-direktiivi on dokumentoitu ensisijaisesti Googlelle. Älä oleta, että jokainen tekoälyindeksoija tukee jokaista metadirektiiviä.

Esimerkki yksityisestä tai arkaluonteisesta sivusta

html

Käytä tätä sivuille, jotka eivät saisi näkyä hakutuloksissa. Sivun on pysyttävä indeksoitavissa riittävän kauan, jotta indeksoija näkee direktiivin. Jos sivun on todella pysyttävä yksityisenä, käytä sen sijaan todennusta tai salasanasuojausta. (developers.google.com)

Piilota vain arkaluonteiset osiot hakutulosten katkelmista

Google tukee data-nosnippet-attribuuttia tietyille HTML-sivun osille:

html

This paragraph may be shown in a search result.

Personal telephone numbers, private email addresses, or internal notes go here.

Tämä on hyödyllistä yhteystiedoille, sisäisille muistiinpanoille tai käyttäjän luomille tiedoille. Se ei ole yleinen ohje jokaiselle tekoälyjärjestelmälle. (developers.google.com)

Käytä X-Robots-Tag-otsikkoa tiedostoille

Metatageja ei voida sijoittaa kannettavan dokumentin tiedostoon, kuvaan tai videotiedostoon. Käytä sen sijaan HTTP-vastausotsikkoa:

text X-Robots-Tag: noindex, nosnippet

Sivulle, jonka tulee pysyä haettavissa, mutta joka ei saa toimittaa tekstiä katkelmiin tai tekoälyvastauksiin, käytä:

text X-Robots-Tag: nosnippet

Google dokumentoi X-Robots-Tagin muille kuin HTML-resursseille, ja Apple tukee sitä myös Applebotille. (developers.google.com)

Apple-kohtaiset ohjaimet

Apple tukee:

html

Apple sanoo, että nosnippet estää sivua käyttämästä lisäkontekstina ja ajankohtaisena sisältönä, kun Applen mallit luovat tuloksia. Sivu voi silti pysyä löydettävissä Apple Haun, Spotlightin, Sirin ja Safarin kautta. (support.apple.com)

Maksumuurin takana oleville sivuille Apple tukee myös jäsenneltyä dataa käyttäen:

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Apple sanoo, että tällaiset sivut voivat pysyä kelvollisina hakutuloksiin, mutta niitä ei käytetä lisäkontekstina tekoälyvastauksiin. (support.apple.com)

Kuinka tarkistaa indeksoijan Internet-protokollaosoitteet

Miksi käyttäjäagentin vastaavuus ei riitä

Tällainen sääntö on heikko:

text if User-Agent contains "GPTBot": allow

Kuka tahansa voi lähettää tuon tekstin. Parempi sääntö on:

text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block

Älä luota X-Forwarded-For-otsakkeeseen, ellei se tule välityspalvelimelta tai sisällönjakeluverkosta, jota organisaatiosi hallitsee.

Palveluntarjoajan varmennusmenetelmät

PalveluntarjoajaSuositeltu varmennusmenetelmä
OpenAIKäytä OpenAI:n indeksoijan dokumentaatiossa julkaistuja reaaliaikaisia Internet-protokollaosoitesyötteitä OAI-SearchBotille, GPTBotille ja OAI-AdsBotille. Päivitä ne automaattisesti sen sijaan, että kopioisit kiinteitä alueita palomuuriin.
GoogleKäytä Googlen julkaistuja indeksoija-alueita tai suorita käänteisiä ja suoria verkkotunnusjärjestelmän (DNS) tarkistuksia. Aito Google-indeksoija tulisi tunnistaa hyväksyttyyn Googlen isäntänimeen ja palata takaisin alkuperäiseen osoitteeseen.
AnthropicKäytä ajantasaista julkaistua indeksoijaosoitesyötettä toissijaisena verkkotarkistuksena. Anthropicin ensisijainen kieltäytymismenetelmä on robots.txt.
PerplexityYhdistä käyttäjäagentti ajantasaiseen PerplexityBot- tai Perplexity-User-osoitesyötteeseen. Perplexity suosittelee erityisesti molempien ehtojen yhdistämistä verkkosovelluspalomuurin (WAF) sääntöön.
AppleKäytä käänteistä verkkotunnusjärjestelmän (DNS) varmennusta applebot.apple.com-osoitteen alla ja suorita sitten suora haku. Apple julkaisee myös ajantasaiset osoitealueet JSON-syötteessä.
Common CrawlKäytä käänteistä verkkotunnusjärjestelmän (DNS) varmennusta crawl.commoncrawl.org-osoitteen alla ja ajantasaista CCBot-osoitesyötettä. Common Crawl huomauttaa, että käänteinen varmennus ei ole vielä saatavilla osalle IPv6-liikenteestä.
MicrosoftKäytä virallista Verify Bingbot -työkalua tai Microsoftin dokumentoituja käänteisiä ja suoria hakumenetelmiä.
AmazonKäytä Amazonin julkaistuja indeksoijaosoiteluetteloita ja yhdistä ne sopivaan Amazonin käyttäjäagenttiin.

Google, Apple, Common Crawl, OpenAI, Anthropic ja Perplexity julkaisevat kaikki palveluntarjoajakohtaisia menetelmiä tai osoitesyötteitä. Nämä luettelot voivat muuttua, joten ajoitettu päivitysprosessi on turvallisempi kuin pysyvä manuaalisesti kopioitu luettelo. (developers.google.com)

Yksinkertainen palomuurisuunnittelu voisi näyttää tältä:

text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match

rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers

Älä käytä laajaa sallimissääntöä koko pilvipalveluntarjoajalle. Laillinen indeksoija voi käyttää pilvi-infrastruktuuria, mutta suurin osa kyseisen pilvipalveluntarjoajan liikenteestä ei välttämättä ole indeksoijaa.

Miten avoin lisensointi vaikuttaa sisällyttämiseen

CC BY 4.0 selkokielellä

Creative Commons Nimeä 4.0 Kansainvälinen -lisenssi, jota yleisesti kutsutaan CC BY 4.0:ksi, sallii ihmisten tehdä seuraavaa:

  • Kopioida ja jakaa työtä uudelleen
  • Muokata, kääntää, miksata ja rakentaa sen pohjalle
  • Käyttää sitä kaupallisesti

Pääehdot ovat:

  • Mainitse lähde asianmukaisesti
  • Linkitä lisenssiin
  • Ilmoita, onko muutoksia tehty
  • Älä anna ymmärtää, että alkuperäinen luoja tukee uudelleenkäyttöä
  • Älä lisää oikeudellisia tai teknisiä rajoituksia, jotka estävät lisenssin sallimia käyttötarkoituksia

Creative Commons varoittaa myös, että lisenssi ei välttämättä kata yksityisyyden, julkisuuden, moraalioikeuksia, tavaramerkkioikeuksia, patenttioikeuksia tai kolmannen osapuolen materiaalia. (creativecommons.org)

Lisenssi ei itsessään ole indeksoijakutsu

”CC BY 4.0” -merkinnän lisääminen sivulle ei takaa, että organisaatio indeksoi sen. Indeksoija voi silti olla estetty seuraavilla tavoilla:

  • robots.txt
  • Sisällönjakeluverkko (CDN)
  • Verkkosovelluspalomuuri (WAF)
  • Taajuusrajoitus
  • JavaScript-haaste
  • Sisäänkirjautumisrajoitus
  • Huono palvelinvastaus
  • Saavuttamaton sivukartta

Toisaalta indeksoijan salliminen ei automaattisesti myönnä kaikkia tekijänoikeuslupia, joita tarvitaan myöhempää käyttöä varten. Robots.txt ja lisensointi tulisi suunnitella yhdessä.

Miksi CC BY voi tukea laajempaa sisällyttämistä

Selkeä salliva lisenssi voi helpottaa julkaisijan käytäntöjen ymmärtämistä datatiimien, hakujärjestelmien ja avustajaoperaattoreiden toimesta. Se voi vähentää epävarmuutta kopioinnista, muokkaamisesta, kaupallisesta käytöstä, kääntämisestä ja uudelleenjakelusta, kun nämä toimet edellyttävät tekijänoikeuslupaa.

Creative Commons selittää kuitenkin, että tekoälykoulutus on oikeudellisesti monimutkaista. Rajoittava lisenssi ei aina ole tehokas tapa estää koulutusta, koska joitakin koulutuskäyttötarkoituksia voivat sallia tekijänoikeuspoikkeukset tai -rajoitukset. Creative Commons huomauttaa myös, että lisenssiehtoja voi olla vaikea soveltaa konekoulutukseen ja mallien tuloksiin. (creativecommons.org)

Käytännön opetus on:

Käytä CC BY -lisenssiä, kun todella haluat laajan laillisen uudelleenkäytön. Älä käytä rajoittavaa Creative Commons -lisenssiä taattuna tekoälykoulutuksesta kieltäytymisenä.

Nimeäminen parantaa lähteen selkeyttä

Creative Commons suosittelee TASL-menetelmää:

  • Otsikko (Title)
  • Tekijä (Author)
  • Lähde (Source)
  • Lisenssi (License)

Esimerkiksi:

”Lisensointi ja robotit maksimaalisen inkluusion puolesta,” Example Publishing, https://www.example.org/articles/ai-crawlers, lisensoitu Creative Commons Nimeä 4.0 Kansainvälinen -lisenssillä. Tehdyt muutokset: päivitetty indeksoijaluettelo.

Selkeä nimeäminen ei pakota jokaista avustajaa viittaamaan sivuun. Se kuitenkin helpottaa oikeaa viittausta, kun järjestelmä poimii sivun otsikon, tekijän, lähteen ja lisensointitiedot. (wiki.creativecommons.org)

Lisää jäsenneltyjä artikkelitietoja

Käytä näkyviä tietoja ja jäsenneltyä dataa yhdessä:

html

Google suosittelee selkeitä tekijätietoja, tekijäsivuja, julkaisupäivämääriä, muokkauspäivämääriä ja vakaita kanonisia sivuja. Nämä signaalit voivat auttaa hakujärjestelmiä ymmärtämään, kuka materiaalin on luonut ja mikä versio on auktoritatiivinen. Ne eivät takaa sijoitusta, sisällyttämistä tai viittausta. (developers.google.com)

Juridinen vakioteksti avoimelle, viittausystävälliselle sivustolle

Seuraava on esimerkkikieltä, ei oikeudellista neuvontaa. Pyydä lakimiestäsi mukauttamaan se oikeudenkäyttöalueeseesi, omistusrakenteeseesi, yksityisyydensuojavelvoitteisiisi ja kolmannen osapuolen sisältöön.

CC BY 4.0 -lisensointilausunto

text

Content license

Except where otherwise stated, the original text and original editorial materials on this page are licensed under the Creative Commons Attribution 4.0 International license:

https://creativecommons.org/licenses/by/4.0/

This permission allows copying, redistribution, adaptation, translation, commercial use, machine-readable processing, search indexing, retrieval, summarization, and use in artificial intelligence systems, provided that the license terms are followed.

Preferred attribution:

“[Page title],” by [author or organization], [canonical page address], published or updated [date], licensed under Creative Commons Attribution 4.0 International. Changes made: [describe changes, or state ‘none’].

Please preserve the author, publisher, source, license, and modification information whenever reasonably possible. This preferred attribution guide does not add restrictions to the Creative Commons license and does not replace the license text.

Lause ”mukaan lukien tekoälyjärjestelmät” selventää julkaisijan tarkoitusta. Sitä ei tulisi käyttää teeskentelemään, että julkaisija omistaa oikeudet jonkun muun luomaan materiaaliin.

Brändi-, yksityisyys- ja kolmannen osapuolen oikeuksien ilmoitus

text

Brand, privacy, and third-party rights

The license above covers only the original materials identified as licensed. It does not grant permission to use:

  • Trademarks, service marks, logos, or trade dress
  • Names, images, or likenesses of people
  • Private, confidential, account, health, financial, or security information
  • User submissions unless they are separately identified as licensed
  • Photographs, illustrations, maps, video, music, quotations, or other third-party materials
  • Content identified as “all rights reserved” or subject to a separate license

Use of the Example Publishing name, logos, and marks must not suggest sponsorship, approval, partnership, or endorsement. Please link to the original page and clearly distinguish quotation, paraphrase, summary, and generated material.

Tämä kieli on tärkeää, koska Creative Commons -lisenssit eivät automaattisesti myönnä kaikkia sivustoon liittyviä oikeudellisia oikeuksia. (creativecommons.org)

Haku- ja avustajaviittausohjeet

text

Search and assistant citation guidance

We welcome compliant search indexing, user-requested retrieval, citation, and summarization of the licensed material on this site.

When citing this site, please use the page title, author or publisher, canonical page address, publication or update date, and a direct link to the source. Please identify the source as one input among any sources used, distinguish generated analysis from quoted material, and do not state or imply that Example Publishing endorses a generated answer, product, person, or service.

This guidance is intended to improve accuracy and attribution. It does not grant rights beyond the applicable content license and does not license trademarks, personal information, confidential information, or third-party material.

Jos haluat haun näkyvyyttä, mutta et halua myöntää laajaa koulutuslisenssiä

text

Search access and copyright

Our public pages may be accessed by compliant search and retrieval crawlers identified in our robots.txt file. This permission is intended to support discovery, search results, user-requested retrieval, and citation.

Except where a separate license is shown, the original content remains all rights reserved. Access to a public page does not grant a separate license for model-development, training, redistribution, commercial reuse, or creation of derivative works beyond rights provided by applicable law.

Please cite the canonical page address and publisher when referring to this material. Nothing on this site grants permission to use trademarks, logos, personal information, confidential information, or third-party content.

Älä sijoita CC BY -lausuntoa ja kaikki oikeudet pidätetään -lausuntoa samaan materiaaliin. Ilmaise selkeästi, mikä lisenssi koskee mitäkin sisältöä.

Riski-hyöty-matriisi avoimelle lisensoinnille

Tekijänoikeuslaki ja tekoälykoulutussäännöt eroavat maittain ja ovat edelleen ratkaisemattomia. Yhdysvaltain tekijänoikeusvirasto (United States Copyright Office) jatkaa näiden asioiden tutkimista, kun taas Creative Commons kuvaa tekoälykoulutusta faktaspesifiksinä ja oikeudellisesti monimutkaisena. (copyright.gov)

LähestymistapaSisällyttämispotentiaaliPäähyödytPääriskitParas soveltuvuus
CC BY 4.0Erittäin korkeaLaaja kopiointi, muokkaus, kaupallinen käyttö, kääntäminen, indeksointi ja malliin liittyvä uudelleenkäyttö, kun tekijänoikeuslupa tarvitaanKaupalliset kilpailijat voivat uudelleenkäyttää tai muokata sisältöä; nimeäminen voi olla epätäydellistä; lisenssi ei voi hallita yksityisyyden, tavaramerkkien tai kolmannen osapuolen oikeuksiaJulkaisijat, jotka haluavat laajimman laillisen uudelleenkäytön ja vahvan lähdemerkinnän
CC BY-SA 4.0Korkea, mutta monimutkaisempiKannustaa avoimeen jakelukiertoon ja vaatii, että muokkauksia tehdään yhteensopivilla ehdoillaJaa samoin -sääntöjä voi olla vaikea soveltaa aineistoihin, mallien koulutukseen ja julkisiin tulosteisiin; jotkut organisaatiot voivat välttää materiaalia epävarmuuden vuoksiAvoimet koulutus- ja yleishyödylliset projektit, jotka haluavat alavirran mukautusten pysyvän avoimina
CC BY-NC 4.0Keskitaso tai matalaRajoittaa käyttöä, joka on ensisijaisesti tarkoitettu kaupalliseen hyötyyn tai taloudelliseen korvaukseen”Ei-kaupallinen” voi olla vaikea tulkita; voi sulkea pois kaupallisen haun, mallin ja avustajakäytöt; se ei ole taattu koulutuksesta kieltäytymisen mahdollisuusMateriaali, joka on tarkoitettu voittoa tavoittelemattomaan, koulutukseen tai yhteisökäyttöön
CC BY-ND 4.0KeskitasoSallii jakelun rajoittaen muokkauksiaKääntäminen, muuntaminen ja jotkut avustajien käyttötapaukset voivat tulla oikeudellisesti epävarmoiksi; vähemmän houkutteleva järjestelmille, jotka tiivistävät tai miksaavatViralliset ilmoitukset tai teokset, joiden on pysyttävä muuttumattomina
CC0 tai julkisen omaisuuden omistusErittäin korkeaYksinkertaistaa uudelleenkäyttöä ja poistaa suurimman osan tekijänoikeusehdoista, kun se on oikeudellisesti tehokasEi vaadittua lähdemerkintää; heikko brändin esittelyn hallinta; yksityisyyden, tavaramerkkien ja julkisuuden oikeudet pysyvät erillisinäFakta-aineistot, tietosetit, viitemateriaali tai teokset, jotka on tarkoitettu rajoittamattomaan uudelleenkäyttöön
Kaikki oikeudet pidätetään plus avoin hakuindeksointiKorkea haun kannalta, matalampi koulutuksen kannaltaVoi säilyttää haun ja viittausten näkyvyyden myöntämättä laajaa uudelleenkäyttölisenssiäLisää oikeudellista epävarmuutta mallikehittäjille; voi vähentää sisällyttämistä koulutusaineistoihin ja kaupallisiin uudelleenkäyttöjärjestelmiinJulkaisijat, jotka haluavat löydettävyyttä ja viittauksia, mutta haluavat neuvotella laajemmat lisenssit erikseen

Monille organisaatioille tasapainoisin strategia on:

  • CC BY 4.0 alkuperäiselle julkiselle toimitukselliselle tekstille
  • Erilliset merkinnät kolmannen osapuolen materiaalille
  • Ei julkista henkilökohtaista tai luottamuksellista tietoa
  • Salli haku- ja tiedonhakuindeksoijat
  • Salli mallinkehitysindeksoijat vain, jos organisaatio todella hyväksyy sen käytön
  • Käytä selkeitä lähdemerkintöjä ja kanonisia linkkejä
  • Suojaa tavaramerkit erillisellä brändi-ilmoituksella

Käytännön toteutuksen tarkistuslista

Sisältö ja lisensointi

  • Tunnista, kuka omistaa kunkin sivun, kuvan, kaavion, videon ja lainauksen.
  • Lisensoi vain materiaali, johon organisaatiosi hallitsee oikeuksia.
  • Merkitse kolmannen osapuolen materiaali erikseen.
  • Lisää näkyvä lisenssilausunto.
  • Tarjoa suositeltu viittaus käyttäen otsikkoa, tekijää, lähdettä ja lisenssiä.
  • Pidä logot, tavaramerkit, henkilötiedot ja luottamukselliset tiedot lisensoidun soveltamisalan ulkopuolella.

Robots.txt

  • Luo julkinen robots.txt-tiedosto jokaisen isännän juureen.
  • Salli hakuindeksoijat erikseen koulutusindeksoijista.
  • Estä hallinnolliset, tili-, kassa-, yksityiset ja sisäiset sovelluspolut.
  • Älä luota robots.txt:ään turvallisuudessa.
  • Testaa tiedosto jokaisen merkittävän verkkosivuston käyttöönoton jälkeen.

Metatagit

  • Käytä kanonisia linkkejä.
  • Lisää tekijä, julkaisupäivämäärä ja muokkauspäivämäärä.
  • Käytä noindex -tagia sivuille, jotka eivät saisi näkyä haussa.
  • Käytä nosnippet tai data-nosnippet arkaluonteisille katkelmille, jos tuettu.
  • Käytä X-Robots-Tag-otsikkoa kannettaville dokumenttitiedostoille, kuville ja muille kuin HTML-resursseille.
  • Muista, että indeksoijan on kyettävä noutamaan sivu, ennen kuin se voi lukea sen metatageja.

Verkon tietoturva

  • Kirjaa käyttäjäagenttimerkkijonot, lähdeosoitteet, vastauskoodit ja pyyntöpolut.
  • Varmenna luotetut indeksoijat virallisilla osoitesyötteillä tai verkkotunnusjärjestelmä (DNS) -menetelmillä.
  • Päivitä osoitesyötteet automaattisesti.
  • Yhdistä käyttäjäagentti- ja lähdeosoitetarkistukset.
  • Rajoita varmennettujen indeksoijien nopeutta sen sijaan, että antaisit niille rajoittamattoman pääsyn.
  • Haasta tai estä pyynnöt, jotka väittävät olevansa luotettavia indeksoijia mutta eivät läpäise varmennusta.

Mittaus

Seuraa:

  • Tekoälyhakupalvelujen käyntejä
  • Viittauksia alkuperäiselle sivulle
  • Viittaustiheyttä
  • Palvelimen kuormitusta indeksoijan mukaan
  • Pyyntöjä, jotka palauttavat 403, 404 tai 429
  • Indeksoijan pääsyä tarkoituksettomiin polkuihin
  • Löytyvätkö nykyiset artikkelit julkaisun jälkeen

Johtopäätös

Maksimaalinen sisällyttäminen edellyttää valikoivaa avoimuutta, ei yhtä yleistä lupaa.

Käytä robots.txt-tiedostoa erottaaksesi haku-, käyttäjän tiedonhaku-, koulutus- ja julkisten aineistojen indeksoinnin. Käytä metatageja ja HTTP-otsikoita indeksoinnin ja katkelmien hallintaan. Käytä todennusta kaikkeen yksityiseen. Varmenna indeksoijan IP-osoitteet sen sijaan, että luottaisit pelkästään käyttäjäagenttien nimiin.

Salliva lisenssi, kuten CC BY 4.0, voi helpottaa laajaa uudelleenkäyttöä, jos todella haluat sitä. Selkeät lähdemerkintätiedot – otsikko, tekijä, lähde, lisenssi, kanoninen sivu ja päivityspäivämäärä – voivat myös helpottaa hakujärjestelmien ja avustajien tunnistamaan ja viittaamaan oikeaan lähteeseen.

Vahvin julkaisukäytäntö on siis:

**Avaa julkinen sisältö, jonka haluat löydettävän, lisensoi selkeästi materiaali, jonka haluat uudelleenkäytettävän, merkitse materiaali, jota et omista, suojaa yksityiset tiedot palvelintasolla ja anna jokaiselle indeksoijalle erillinen, tarkistettava lupa.

Aiheeseen liittyvät artikkelit

Pidätkö tästä sisällöstä?

Tilaa uutiskirjeemme saadaksesi uusimmat sisältömarkkinoinnin näkemykset ja kasvuoppaat.

Tämä artikkeli on tarkoitettu vain tiedoksi. Sisältö ja strategiat voivat vaihdella tarpeidesi mukaan.
Lisensointi ja robotit maksimaalisen inkluusion puolesta: Miten tekoälyindeksoijat toivotetaan tervetulleiksi | AutoPod