Lisensointi ja robotit maksimaalisen inkluusion puolesta: Miten tekoälyindeksoijat toivotetaan tervetulleiksi
Päivitetty 25. elokuuta 2026
Verkkosivustoilla on nykyään useampi kuin yksi tapa tavoittaa yleisö. Sivu voi löytyä Google Haun kautta, ChatGPT voi tiivistää sen, Perplexity voi viitata siihen, sitä voidaan käyttää Clauden haussa, näyttää Apple-palvelujen kautta tai kerätä julkiseen verkkoarkistoon.
Nämä järjestelmät eivät kaikki käytä samaa indeksoijaa tai noudata samoja sääntöjä. Verkkosivusto, joka estää GPTBotin, saattaa silti näkyä ChatGPT-haussa, jos se sallii OAI-SearchBotin. Verkkosivusto, joka sallii Applebotin, voi pysyä näkyvissä Apple Haussa samalla kun se estää Applebot-Extendedin tekoälymallien koulutuksesta. Googlen Google-Extended ei ole lainkaan normaali indeksoija; se on robots.txt-ohjaustunnus.
Paras käytäntö ei siis ole yksinkertaisesti ”salli tekoäly” tai ”estä tekoäly”. Se on erillisten lupien luominen seuraaville:
- Haku ja löydettävyys
- Käyttäjän pyytämä tiedonhaku
- Mallin kehitys ja koulutus
- Julkiset aineistot
- Arkaluonteinen, yksityinen tai rajoitettu materiaali
Tässä artikkelissa esitetään nykyinen indeksoijaluettelo, robots.txt-esimerkkejä, meta-tageihin liittyviä ohjeita, IP-osoitteiden tarkistusmenetelmiä, Creative Commons -lisensointineuvoja, juridinen vakioteksti ja riski-hyöty-matriisi.
Neljä hallintakeinoa, jotka jokaisen julkaisijan tulisi ymmärtää
1. robots.txt hallitsee pyydettyä indeksointia
robots.txt-tiedosto kertoo vaatimustenmukaisille automatisoiduille asiakkaille, mitä sivuja he voivat pyytää. Se on hyödyllinen indeksoijaliikenteen hallinnassa ja julkaisijan mieltymysten ilmaisemisessa.
Robots.txt ei kuitenkaan ole käyttöoikeusjärjestelmä. Robots Exclusion Protocol -standardi toteaa, että sen säännöt eivät ole käyttöoikeusvaltuutusta. Google varoittaa myös, että estetty osoite voi silti näkyä hakutuloksissa, jos muut sivut linkittävät siihen. Käytä salasanoja, todennusta tai palvelinpuolen käyttöoikeushallintaa luottamuksellisten tietojen suojaamiseen. (rfc-editor.org)
2. Metatagit hallitsevat indeksointia ja katkelmia
Robots-metatagit ja X-Robots-Tag-vastausotsikko voivat hallita, indeksoidaanko sivu vai saako hakukone näyttää katkelman.
Nämä hallintakeinot ovat yleensä näkyvissä vasta, kun indeksoija on sallittu noutaa sivu. Jos robots.txt estää sivun ensin, indeksoija ei välttämättä koskaan näe metatagia. (developers.google.com)
3. Verkko-ohjaimet varmistavat indeksoijan
Käyttäjäagentin nimen kopioiminen on helppoa. Hyökkääjä voi lähettää pyynnön väittäen olevansa GPTBot, Googlebot tai PerplexityBot.
Vahvempi lähestymistapa yhdistää:
- Ilmoitetun käyttäjäagentin
- Julkaistun Internet-protokollaosoitealueen
- Käänteisen verkkotunnusjärjestelmän (DNS) varmennuksen
- Suoran verkkotunnusjärjestelmän (DNS) varmennuksen
- Taajuusrajoitukset ja pyyntöjen seurannan
4. Lisenssi myöntää uudelleenkäyttöoikeudet
Robots.txt kertoo, mitä indeksoijaa pyydetään tekemään. Lisenssi kertoo, mitä ihmiset tai organisaatiot saavat laillisesti tehdä aineistolla, kun tekijänoikeuslupa vaaditaan.
Nämä ovat eri työkaluja. Salliva lisenssi voi vähentää oikeudellista epävarmuutta, mutta se ei takaa, että indeksoija vierailee sivulla, että malli käyttää sitä tai että avustaja viittaa siihen.
Tärkeiden indeksoijien luettelo
Seuraava luettelo on tarkistettu palveluntarjoajien dokumentaation perusteella, joka oli saatavilla 25. elokuuta 2026. Käyttäjäagenttien nimet, tarkoitukset ja Internet-protokollaosoitealueet voivat muuttua, joten tuotantojärjestelmien tulisi käyttää palveluntarjoajan ajantasaista dokumentaatiota ja reaaliaikaisia osoitesyötteitä.
| Palveluntarjoaja | Indeksoija tai robots.txt-tunnus | Päätarkoitus | Tärkeä hallinta |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Etsii ja analysoi sivuja ChatGPT-hakua varten | Salli se parantaaksesi mahdollisuutta, että sivut näkyvät ChatGPT-hakutuloksissa. |
| OpenAI | GPTBot | Kerää sivuja, joita voidaan käyttää OpenAI:n generatiivisten tekoälymallien kouluttamiseen | Salli tai estä erikseen hausta. |
| OpenAI | ChatGPT-User | Hakee sivuja sen jälkeen, kun käyttäjä pyytää ChatGPT:tä tai mukautettua GPT:tä pääsemään niihin käsiksi | Se on käyttäjän laukaisema, ei automaattinen verkkohaku, joten robots.txt-säännöt eivät välttämättä koske sitä. |
| OpenAI | OAI-AdsBot | Tarkistaa ChatGPT-mainoskohteiksi lähetetyt verkkosivut | Koskee pääasiassa mainostajia. Kerättyä sisältöä ei käytetä generatiivisten tekoälyperusmallien kouluttamiseen. |
Googlebot | Googlen tärkein hakuindeksoija | Hallitsee tavallista Google Haun indeksointia. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Kuvat, videot ja Google Uutiset | Näillä on erilliset robots.txt-tunnukset, ja niitä voidaan hallita itsenäisesti. | |
GoogleOther | Yleiskäyttöinen Googlen indeksointi eri tuotetiimeille, mukaan lukien tutkimus ja kehitys | Se ei edusta yhtä tiettyä Google-tuotetta. | |
Google-Extended | Hallitsee, voidaanko Googlen indeksoimaa sisältöä käyttää Gemini-mallin koulutukseen ja tiettyihin maadoitusjärjestelmiin | Se on robots.txt-ohjaustunnus, ei erillinen pyynnön käyttäjäagentti. Se ei vaikuta tavalliseen Google Haun sisällyttämiseen. | |
| Anthropic | ClaudeBot | Kerää julkista verkkosisältöä, joka voi edistää Claude-mallin kehitystä | Estä se merkitäksesi, että tuleva materiaali tulisi jättää pois Anthropicin koulutusaineistoista. |
| Anthropic | Claude-SearchBot | Parantaa Claude-hakutulosten laatua | Salli se Claude-haun näkyvyyden parantamiseksi. |
| Anthropic | Claude-User | Hakee sivuja vastauksena käyttäjän Claude-pyyntöön | Erillinen automaattisesta indeksoinnista. |
| Perplexity | PerplexityBot | Indeksoi sivuja Perplexity-hakutuloksia varten | Perplexity sanoo, että tätä indeksoijaa ei käytetä sisällön keräämiseen tekoälyperusmallien koulutusta varten. |
| Perplexity | Perplexity-User | Hakee sivun sen jälkeen, kun käyttäjä on pyytänyt sitä | Perplexityn dokumentaation mukaan tämä hakija yleensä ohittaa robots.txt:n, koska pyyntö on käyttäjän aloittama. |
| Apple | Applebot | Tukee Apple Hakua, Spotlightia, Siriä, Safaria ja muita Apple-kokemuksia | Salli se Applen löydettävyyden vuoksi. |
| Apple | Applebot-Extended | Hallitsee, voidaanko Applebotin indeksoimaa sisältöä käyttää Applen perusmallien kouluttamiseen | Se ei indeksoi sivuja itse. Se on tiedonkäytön hallinta. |
| Common Crawl | CCBot | Kerää julkista verkkodataa Common Crawlin avoimeen verkkoarkistoon | Se ei ole avustaja, mutta sen aineistoja voivat käyttää tutkijat ja tekoälykehittäjät. |
| Microsoft | Bingbot | Bingin tärkein hakuindeksoija | Salli se Bingin löydettävyyden ja haun näkyvyyden vuoksi. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Sivu- ja videon esikatselut Microsoft-tuotteisiin | Näitä voidaan hallita erikseen Bingbotista. |
| Amazon | Amzn-SearchBot | Amazon-haku ja sisällön löytäminen | Amazon sanoo, ettei se indeksoi sisältöä generatiivisten tekoälymallien koulutusta varten. |
| Amazon | Amzn-User | Hakee ajantasaista tietoa vastauksena käyttäjän toimiin, mukaan lukien Alexa-pyynnöt | Käyttäjän laukaisema ja erillinen automaattisesta hakuindeksoinnista. |
OpenAI dokumentoi haku-, koulutus-, mainonta- ja käyttäjän laukaisemat indeksoijansa erillisinä ohjaimina. Sen dokumentaatio suosittelee erityisesti OAI-SearchBotin sallimista ChatGPT-hakua varten, samalla kun GPTBotia käytetään erikseen koulutusasetuksiin. (developers.openai.com)
Google erottaa samalla tavalla Googlebotin, GoogleOtherin ja Google-Extendedin. Google-Extendedillä ei ole omaa HTTP-pyynnön käyttäjäagenttia, ja sen estäminen ei poista sivua Google Hausta. (developers.google.com)
Anthropic dokumentoi erilliset roolit ClaudeBotille, Claude-SearchBotille ja Claude-Userille. Anthropic toteaa myös, että sen botit noudattavat robots.txt-tiedostoa ja tukevat epästandardia Crawl-delay-direktiiviä. (support.anthropic.com)
Perplexity erottaa automaattisen hakuindeksoinnin ja käyttäjän pyytämän haun. Sen nykyinen dokumentaatio sanoo, että PerplexityBot kunnioittaa robots.txt:ää, kun taas Perplexity-User yleensä ei, koska se vastaa käyttäjän pyyntöön. (docs.perplexity.ai)
Applen nykyinen dokumentaatio tekee saman haku- ja koulutuseroottelun: Applebot tukee löydettävyyttä, kun taas Applebot-Extended antaa julkaisijoille mahdollisuuden hallita koulutuskäyttöä poistamatta sivuja Apple Hausta. (support.apple.com)
Suositellut robots.txt-asetukset
Aseta robots.txt jokaisen isännän juureen, esimerkiksi:
text https://www.example.org/robots.txt
Säännöt koskevat tiettyä isäntää, protokollaa ja porttia, jossa tiedostoa tarjoillaan. Erillinen alidomain saattaa tarvita oman tiedostonsa. (developers.google.com)
Asetus 1: Maksimaalinen sisällyttäminen
Käytä tätä, kun julkista toimituksellista sisältöä voivat löytää, tiivistää, siteerata, indeksoida ja kerätä vaatimustenmukaiset indeksoijat.
text
Public pages are available to compliant crawlers.
User-agent: * Allow: /
Keep private, transactional, and administrative paths out.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Tämä sallii nimetyt indeksoijat, mukaan lukien OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft ja Amazon, ellei jokin muu erityinen sääntö estä niitä.
Älä sijoita kattavaa sääntöä, kuten User-agent: * Disallow: /, tämän asetuksen alle. Myöhempi tai tarkempi ryhmä voi muuttaa tapaa, jolla indeksoija tulkitsee tiedostoa.
Asetus 2: Salli haku, mutta estä mallinkehitysindeksoijat
Tämä on usein paras kompromissi julkaisijoille, jotka haluavat viittauksia ja hakuliikennettä, mutta eivät halua antaa lupaa mallinkehityksen keräämiseen.
text
Block OpenAI model-development crawling.
User-agent: GPTBot Disallow: /
Block Anthropic model-development crawling.
User-agent: ClaudeBot Disallow: /
Block Google model-training and related grounding use.
User-agent: Google-Extended Disallow: /
Block Apple foundation-model training use.
User-agent: Applebot-Extended Disallow: /
Optional: block Common Crawl dataset collection.
User-agent: CCBot
Disallow: /
Allow ordinary search and retrieval crawling, except for sensitive paths.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Tämä kokoonpano jättää OAI-SearchBotin, Claude-SearchBotin, PerplexityBotin, Googlebotin ja Applebotin yleismerkki-ryhmän alle. Se pitää myös haku- ja koulutusluvat erillään.
Applen osalta Applebot-Extendedin estäminen samalla kun Applebot sallitaan, säilyttää löydettävyyden Apple-palvelujen kautta. Googlen osalta Google-Extendedin estäminen ei estä tavallista Google Hakua. (developers.google.com)
Asetus 3: Salli eksplisiittisesti valitut hakuindeksoijat
Jos olemassa oleva robots.txt-tiedosto estää kaikki indeksoijat, lisää erilliset ryhmät hakukoneille, jotka haluat toivottaa tervetulleiksi.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Keep all other crawlers out.
User-agent: * Disallow: /
Kun käytät tiettyjä ryhmiä, toista arkaluonteisten polkujen säännöt jokaisen ryhmän sisällä. Jotkut indeksoijat käyttävät tarkinta vastaavaa ryhmää sen sijaan, että yhdistäisivät sen yleismerkki-ryhmän kanssa. Bing dokumentoi tämän käyttäytymisen suoraan, ja Google tarjoaa erilliset ohjeet indeksoijakohtaisille ryhmille. (bing.com)
Tärkeitä robots.txt-rajoituksia
- Indeksoija voi jättää robots.txt:n huomiotta.
- Haittaohjelmaindeksoija voi teeskennellä olevansa luotettava indeksoija.
- Estetty sivu voi silti olla tunnettu otsikkonsa tai verkko-osoitteensa perusteella.
- Robots.txt ei suojaa salasanoja, yksityisiä tiedostoja, asiakastietoja tai luottamuksellisia sovellusohjelmointirajapintoja.
Crawl-delay-direktiivi ei ole osa Robots Exclusion Protocolin ydintä, eikä kaikki indeksoijat tue sitä. Anthropic ja Bing dokumentoivat tuen, kun taas Apple sanoo, että Applebot ei noudata crawl-delaytä. (rfc-editor.org)
Metatagit ja HTTP-otsikot
Esimerkki julkisesta sivusta
Käytä julkiselle artikkelille selkeää otsikkoa, tekijää, kanonista verkko-osoitetta, julkaisupäivämäärää ja muokkauspäivämäärää.
html
max-snippet-direktiivi on dokumentoitu ensisijaisesti Googlelle. Älä oleta, että jokainen tekoälyindeksoija tukee jokaista metadirektiiviä.
Esimerkki yksityisestä tai arkaluonteisesta sivusta
html
Käytä tätä sivuille, jotka eivät saisi näkyä hakutuloksissa. Sivun on pysyttävä indeksoitavissa riittävän kauan, jotta indeksoija näkee direktiivin. Jos sivun on todella pysyttävä yksityisenä, käytä sen sijaan todennusta tai salasanasuojausta. (developers.google.com)
Piilota vain arkaluonteiset osiot hakutulosten katkelmista
Google tukee data-nosnippet-attribuuttia tietyille HTML-sivun osille:
html
This paragraph may be shown in a search result.
Tämä on hyödyllistä yhteystiedoille, sisäisille muistiinpanoille tai käyttäjän luomille tiedoille. Se ei ole yleinen ohje jokaiselle tekoälyjärjestelmälle. (developers.google.com)
Käytä X-Robots-Tag-otsikkoa tiedostoille
Metatageja ei voida sijoittaa kannettavan dokumentin tiedostoon, kuvaan tai videotiedostoon. Käytä sen sijaan HTTP-vastausotsikkoa:
text X-Robots-Tag: noindex, nosnippet
Sivulle, jonka tulee pysyä haettavissa, mutta joka ei saa toimittaa tekstiä katkelmiin tai tekoälyvastauksiin, käytä:
text X-Robots-Tag: nosnippet
Google dokumentoi X-Robots-Tagin muille kuin HTML-resursseille, ja Apple tukee sitä myös Applebotille. (developers.google.com)
Apple-kohtaiset ohjaimet
Apple tukee:
html
Apple sanoo, että nosnippet estää sivua käyttämästä lisäkontekstina ja ajankohtaisena sisältönä, kun Applen mallit luovat tuloksia. Sivu voi silti pysyä löydettävissä Apple Haun, Spotlightin, Sirin ja Safarin kautta. (support.apple.com)
Maksumuurin takana oleville sivuille Apple tukee myös jäsenneltyä dataa käyttäen:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple sanoo, että tällaiset sivut voivat pysyä kelvollisina hakutuloksiin, mutta niitä ei käytetä lisäkontekstina tekoälyvastauksiin. (support.apple.com)
Kuinka tarkistaa indeksoijan Internet-protokollaosoitteet
Miksi käyttäjäagentin vastaavuus ei riitä
Tällainen sääntö on heikko:
text if User-Agent contains "GPTBot": allow
Kuka tahansa voi lähettää tuon tekstin. Parempi sääntö on:
text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block
Älä luota X-Forwarded-For-otsakkeeseen, ellei se tule välityspalvelimelta tai sisällönjakeluverkosta, jota organisaatiosi hallitsee.
Palveluntarjoajan varmennusmenetelmät
| Palveluntarjoaja | Suositeltu varmennusmenetelmä |
|---|---|
| OpenAI | Käytä OpenAI:n indeksoijan dokumentaatiossa julkaistuja reaaliaikaisia Internet-protokollaosoitesyötteitä OAI-SearchBotille, GPTBotille ja OAI-AdsBotille. Päivitä ne automaattisesti sen sijaan, että kopioisit kiinteitä alueita palomuuriin. |
| Käytä Googlen julkaistuja indeksoija-alueita tai suorita käänteisiä ja suoria verkkotunnusjärjestelmän (DNS) tarkistuksia. Aito Google-indeksoija tulisi tunnistaa hyväksyttyyn Googlen isäntänimeen ja palata takaisin alkuperäiseen osoitteeseen. | |
| Anthropic | Käytä ajantasaista julkaistua indeksoijaosoitesyötettä toissijaisena verkkotarkistuksena. Anthropicin ensisijainen kieltäytymismenetelmä on robots.txt. |
| Perplexity | Yhdistä käyttäjäagentti ajantasaiseen PerplexityBot- tai Perplexity-User-osoitesyötteeseen. Perplexity suosittelee erityisesti molempien ehtojen yhdistämistä verkkosovelluspalomuurin (WAF) sääntöön. |
| Apple | Käytä käänteistä verkkotunnusjärjestelmän (DNS) varmennusta applebot.apple.com-osoitteen alla ja suorita sitten suora haku. Apple julkaisee myös ajantasaiset osoitealueet JSON-syötteessä. |
| Common Crawl | Käytä käänteistä verkkotunnusjärjestelmän (DNS) varmennusta crawl.commoncrawl.org-osoitteen alla ja ajantasaista CCBot-osoitesyötettä. Common Crawl huomauttaa, että käänteinen varmennus ei ole vielä saatavilla osalle IPv6-liikenteestä. |
| Microsoft | Käytä virallista Verify Bingbot -työkalua tai Microsoftin dokumentoituja käänteisiä ja suoria hakumenetelmiä. |
| Amazon | Käytä Amazonin julkaistuja indeksoijaosoiteluetteloita ja yhdistä ne sopivaan Amazonin käyttäjäagenttiin. |
Google, Apple, Common Crawl, OpenAI, Anthropic ja Perplexity julkaisevat kaikki palveluntarjoajakohtaisia menetelmiä tai osoitesyötteitä. Nämä luettelot voivat muuttua, joten ajoitettu päivitysprosessi on turvallisempi kuin pysyvä manuaalisesti kopioitu luettelo. (developers.google.com)
Yksinkertainen palomuurisuunnittelu voisi näyttää tältä:
text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match
rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers
Älä käytä laajaa sallimissääntöä koko pilvipalveluntarjoajalle. Laillinen indeksoija voi käyttää pilvi-infrastruktuuria, mutta suurin osa kyseisen pilvipalveluntarjoajan liikenteestä ei välttämättä ole indeksoijaa.
Miten avoin lisensointi vaikuttaa sisällyttämiseen
CC BY 4.0 selkokielellä
Creative Commons Nimeä 4.0 Kansainvälinen -lisenssi, jota yleisesti kutsutaan CC BY 4.0:ksi, sallii ihmisten tehdä seuraavaa:
- Kopioida ja jakaa työtä uudelleen
- Muokata, kääntää, miksata ja rakentaa sen pohjalle
- Käyttää sitä kaupallisesti
Pääehdot ovat:
- Mainitse lähde asianmukaisesti
- Linkitä lisenssiin
- Ilmoita, onko muutoksia tehty
- Älä anna ymmärtää, että alkuperäinen luoja tukee uudelleenkäyttöä
- Älä lisää oikeudellisia tai teknisiä rajoituksia, jotka estävät lisenssin sallimia käyttötarkoituksia
Creative Commons varoittaa myös, että lisenssi ei välttämättä kata yksityisyyden, julkisuuden, moraalioikeuksia, tavaramerkkioikeuksia, patenttioikeuksia tai kolmannen osapuolen materiaalia. (creativecommons.org)
Lisenssi ei itsessään ole indeksoijakutsu
”CC BY 4.0” -merkinnän lisääminen sivulle ei takaa, että organisaatio indeksoi sen. Indeksoija voi silti olla estetty seuraavilla tavoilla:
- robots.txt
- Sisällönjakeluverkko (CDN)
- Verkkosovelluspalomuuri (WAF)
- Taajuusrajoitus
- JavaScript-haaste
- Sisäänkirjautumisrajoitus
- Huono palvelinvastaus
- Saavuttamaton sivukartta
Toisaalta indeksoijan salliminen ei automaattisesti myönnä kaikkia tekijänoikeuslupia, joita tarvitaan myöhempää käyttöä varten. Robots.txt ja lisensointi tulisi suunnitella yhdessä.
Miksi CC BY voi tukea laajempaa sisällyttämistä
Selkeä salliva lisenssi voi helpottaa julkaisijan käytäntöjen ymmärtämistä datatiimien, hakujärjestelmien ja avustajaoperaattoreiden toimesta. Se voi vähentää epävarmuutta kopioinnista, muokkaamisesta, kaupallisesta käytöstä, kääntämisestä ja uudelleenjakelusta, kun nämä toimet edellyttävät tekijänoikeuslupaa.
Creative Commons selittää kuitenkin, että tekoälykoulutus on oikeudellisesti monimutkaista. Rajoittava lisenssi ei aina ole tehokas tapa estää koulutusta, koska joitakin koulutuskäyttötarkoituksia voivat sallia tekijänoikeuspoikkeukset tai -rajoitukset. Creative Commons huomauttaa myös, että lisenssiehtoja voi olla vaikea soveltaa konekoulutukseen ja mallien tuloksiin. (creativecommons.org)
Käytännön opetus on:
Käytä CC BY -lisenssiä, kun todella haluat laajan laillisen uudelleenkäytön. Älä käytä rajoittavaa Creative Commons -lisenssiä taattuna tekoälykoulutuksesta kieltäytymisenä.
Nimeäminen parantaa lähteen selkeyttä
Creative Commons suosittelee TASL-menetelmää:
- Otsikko (Title)
- Tekijä (Author)
- Lähde (Source)
- Lisenssi (License)
Esimerkiksi:
”Lisensointi ja robotit maksimaalisen inkluusion puolesta,” Example Publishing, https://www.example.org/articles/ai-crawlers, lisensoitu Creative Commons Nimeä 4.0 Kansainvälinen -lisenssillä. Tehdyt muutokset: päivitetty indeksoijaluettelo.
Selkeä nimeäminen ei pakota jokaista avustajaa viittaamaan sivuun. Se kuitenkin helpottaa oikeaa viittausta, kun järjestelmä poimii sivun otsikon, tekijän, lähteen ja lisensointitiedot. (wiki.creativecommons.org)
Lisää jäsenneltyjä artikkelitietoja
Käytä näkyviä tietoja ja jäsenneltyä dataa yhdessä:
html
Google suosittelee selkeitä tekijätietoja, tekijäsivuja, julkaisupäivämääriä, muokkauspäivämääriä ja vakaita kanonisia sivuja. Nämä signaalit voivat auttaa hakujärjestelmiä ymmärtämään, kuka materiaalin on luonut ja mikä versio on auktoritatiivinen. Ne eivät takaa sijoitusta, sisällyttämistä tai viittausta. (developers.google.com)
Juridinen vakioteksti avoimelle, viittausystävälliselle sivustolle
Seuraava on esimerkkikieltä, ei oikeudellista neuvontaa. Pyydä lakimiestäsi mukauttamaan se oikeudenkäyttöalueeseesi, omistusrakenteeseesi, yksityisyydensuojavelvoitteisiisi ja kolmannen osapuolen sisältöön.
CC BY 4.0 -lisensointilausunto
text
Content license
Except where otherwise stated, the original text and original editorial materials on this page are licensed under the Creative Commons Attribution 4.0 International license:
https://creativecommons.org/licenses/by/4.0/
This permission allows copying, redistribution, adaptation, translation, commercial use, machine-readable processing, search indexing, retrieval, summarization, and use in artificial intelligence systems, provided that the license terms are followed.
Preferred attribution:
“[Page title],” by [author or organization], [canonical page address], published or updated [date], licensed under Creative Commons Attribution 4.0 International. Changes made: [describe changes, or state ‘none’].
Please preserve the author, publisher, source, license, and modification information whenever reasonably possible. This preferred attribution guide does not add restrictions to the Creative Commons license and does not replace the license text.
Lause ”mukaan lukien tekoälyjärjestelmät” selventää julkaisijan tarkoitusta. Sitä ei tulisi käyttää teeskentelemään, että julkaisija omistaa oikeudet jonkun muun luomaan materiaaliin.
Brändi-, yksityisyys- ja kolmannen osapuolen oikeuksien ilmoitus
text
Brand, privacy, and third-party rights
The license above covers only the original materials identified as licensed. It does not grant permission to use:
- Trademarks, service marks, logos, or trade dress
- Names, images, or likenesses of people
- Private, confidential, account, health, financial, or security information
- User submissions unless they are separately identified as licensed
- Photographs, illustrations, maps, video, music, quotations, or other third-party materials
- Content identified as “all rights reserved” or subject to a separate license
Use of the Example Publishing name, logos, and marks must not suggest sponsorship, approval, partnership, or endorsement. Please link to the original page and clearly distinguish quotation, paraphrase, summary, and generated material.
Tämä kieli on tärkeää, koska Creative Commons -lisenssit eivät automaattisesti myönnä kaikkia sivustoon liittyviä oikeudellisia oikeuksia. (creativecommons.org)
Haku- ja avustajaviittausohjeet
text
Search and assistant citation guidance
We welcome compliant search indexing, user-requested retrieval, citation, and summarization of the licensed material on this site.
When citing this site, please use the page title, author or publisher, canonical page address, publication or update date, and a direct link to the source. Please identify the source as one input among any sources used, distinguish generated analysis from quoted material, and do not state or imply that Example Publishing endorses a generated answer, product, person, or service.
This guidance is intended to improve accuracy and attribution. It does not grant rights beyond the applicable content license and does not license trademarks, personal information, confidential information, or third-party material.
Jos haluat haun näkyvyyttä, mutta et halua myöntää laajaa koulutuslisenssiä
text
Search access and copyright
Our public pages may be accessed by compliant search and retrieval crawlers identified in our robots.txt file. This permission is intended to support discovery, search results, user-requested retrieval, and citation.
Except where a separate license is shown, the original content remains all rights reserved. Access to a public page does not grant a separate license for model-development, training, redistribution, commercial reuse, or creation of derivative works beyond rights provided by applicable law.
Please cite the canonical page address and publisher when referring to this material. Nothing on this site grants permission to use trademarks, logos, personal information, confidential information, or third-party content.
Älä sijoita CC BY -lausuntoa ja kaikki oikeudet pidätetään -lausuntoa samaan materiaaliin. Ilmaise selkeästi, mikä lisenssi koskee mitäkin sisältöä.
Riski-hyöty-matriisi avoimelle lisensoinnille
Tekijänoikeuslaki ja tekoälykoulutussäännöt eroavat maittain ja ovat edelleen ratkaisemattomia. Yhdysvaltain tekijänoikeusvirasto (United States Copyright Office) jatkaa näiden asioiden tutkimista, kun taas Creative Commons kuvaa tekoälykoulutusta faktaspesifiksinä ja oikeudellisesti monimutkaisena. (copyright.gov)
| Lähestymistapa | Sisällyttämispotentiaali | Päähyödyt | Pääriskit | Paras soveltuvuus |
|---|---|---|---|---|
| CC BY 4.0 | Erittäin korkea | Laaja kopiointi, muokkaus, kaupallinen käyttö, kääntäminen, indeksointi ja malliin liittyvä uudelleenkäyttö, kun tekijänoikeuslupa tarvitaan | Kaupalliset kilpailijat voivat uudelleenkäyttää tai muokata sisältöä; nimeäminen voi olla epätäydellistä; lisenssi ei voi hallita yksityisyyden, tavaramerkkien tai kolmannen osapuolen oikeuksia | Julkaisijat, jotka haluavat laajimman laillisen uudelleenkäytön ja vahvan lähdemerkinnän |
| CC BY-SA 4.0 | Korkea, mutta monimutkaisempi | Kannustaa avoimeen jakelukiertoon ja vaatii, että muokkauksia tehdään yhteensopivilla ehdoilla | Jaa samoin -sääntöjä voi olla vaikea soveltaa aineistoihin, mallien koulutukseen ja julkisiin tulosteisiin; jotkut organisaatiot voivat välttää materiaalia epävarmuuden vuoksi | Avoimet koulutus- ja yleishyödylliset projektit, jotka haluavat alavirran mukautusten pysyvän avoimina |
| CC BY-NC 4.0 | Keskitaso tai matala | Rajoittaa käyttöä, joka on ensisijaisesti tarkoitettu kaupalliseen hyötyyn tai taloudelliseen korvaukseen | ”Ei-kaupallinen” voi olla vaikea tulkita; voi sulkea pois kaupallisen haun, mallin ja avustajakäytöt; se ei ole taattu koulutuksesta kieltäytymisen mahdollisuus | Materiaali, joka on tarkoitettu voittoa tavoittelemattomaan, koulutukseen tai yhteisökäyttöön |
| CC BY-ND 4.0 | Keskitaso | Sallii jakelun rajoittaen muokkauksia | Kääntäminen, muuntaminen ja jotkut avustajien käyttötapaukset voivat tulla oikeudellisesti epävarmoiksi; vähemmän houkutteleva järjestelmille, jotka tiivistävät tai miksaavat | Viralliset ilmoitukset tai teokset, joiden on pysyttävä muuttumattomina |
| CC0 tai julkisen omaisuuden omistus | Erittäin korkea | Yksinkertaistaa uudelleenkäyttöä ja poistaa suurimman osan tekijänoikeusehdoista, kun se on oikeudellisesti tehokas | Ei vaadittua lähdemerkintää; heikko brändin esittelyn hallinta; yksityisyyden, tavaramerkkien ja julkisuuden oikeudet pysyvät erillisinä | Fakta-aineistot, tietosetit, viitemateriaali tai teokset, jotka on tarkoitettu rajoittamattomaan uudelleenkäyttöön |
| Kaikki oikeudet pidätetään plus avoin hakuindeksointi | Korkea haun kannalta, matalampi koulutuksen kannalta | Voi säilyttää haun ja viittausten näkyvyyden myöntämättä laajaa uudelleenkäyttölisenssiä | Lisää oikeudellista epävarmuutta mallikehittäjille; voi vähentää sisällyttämistä koulutusaineistoihin ja kaupallisiin uudelleenkäyttöjärjestelmiin | Julkaisijat, jotka haluavat löydettävyyttä ja viittauksia, mutta haluavat neuvotella laajemmat lisenssit erikseen |
Monille organisaatioille tasapainoisin strategia on:
- CC BY 4.0 alkuperäiselle julkiselle toimitukselliselle tekstille
- Erilliset merkinnät kolmannen osapuolen materiaalille
- Ei julkista henkilökohtaista tai luottamuksellista tietoa
- Salli haku- ja tiedonhakuindeksoijat
- Salli mallinkehitysindeksoijat vain, jos organisaatio todella hyväksyy sen käytön
- Käytä selkeitä lähdemerkintöjä ja kanonisia linkkejä
- Suojaa tavaramerkit erillisellä brändi-ilmoituksella
Käytännön toteutuksen tarkistuslista
Sisältö ja lisensointi
- Tunnista, kuka omistaa kunkin sivun, kuvan, kaavion, videon ja lainauksen.
- Lisensoi vain materiaali, johon organisaatiosi hallitsee oikeuksia.
- Merkitse kolmannen osapuolen materiaali erikseen.
- Lisää näkyvä lisenssilausunto.
- Tarjoa suositeltu viittaus käyttäen otsikkoa, tekijää, lähdettä ja lisenssiä.
- Pidä logot, tavaramerkit, henkilötiedot ja luottamukselliset tiedot lisensoidun soveltamisalan ulkopuolella.
Robots.txt
- Luo julkinen robots.txt-tiedosto jokaisen isännän juureen.
- Salli hakuindeksoijat erikseen koulutusindeksoijista.
- Estä hallinnolliset, tili-, kassa-, yksityiset ja sisäiset sovelluspolut.
- Älä luota robots.txt:ään turvallisuudessa.
- Testaa tiedosto jokaisen merkittävän verkkosivuston käyttöönoton jälkeen.
Metatagit
- Käytä kanonisia linkkejä.
- Lisää tekijä, julkaisupäivämäärä ja muokkauspäivämäärä.
- Käytä
noindex-tagia sivuille, jotka eivät saisi näkyä haussa. - Käytä
nosnippettaidata-nosnippetarkaluonteisille katkelmille, jos tuettu. - Käytä
X-Robots-Tag-otsikkoa kannettaville dokumenttitiedostoille, kuville ja muille kuin HTML-resursseille. - Muista, että indeksoijan on kyettävä noutamaan sivu, ennen kuin se voi lukea sen metatageja.
Verkon tietoturva
- Kirjaa käyttäjäagenttimerkkijonot, lähdeosoitteet, vastauskoodit ja pyyntöpolut.
- Varmenna luotetut indeksoijat virallisilla osoitesyötteillä tai verkkotunnusjärjestelmä (DNS) -menetelmillä.
- Päivitä osoitesyötteet automaattisesti.
- Yhdistä käyttäjäagentti- ja lähdeosoitetarkistukset.
- Rajoita varmennettujen indeksoijien nopeutta sen sijaan, että antaisit niille rajoittamattoman pääsyn.
- Haasta tai estä pyynnöt, jotka väittävät olevansa luotettavia indeksoijia mutta eivät läpäise varmennusta.
Mittaus
Seuraa:
- Tekoälyhakupalvelujen käyntejä
- Viittauksia alkuperäiselle sivulle
- Viittaustiheyttä
- Palvelimen kuormitusta indeksoijan mukaan
- Pyyntöjä, jotka palauttavat
403,404tai429 - Indeksoijan pääsyä tarkoituksettomiin polkuihin
- Löytyvätkö nykyiset artikkelit julkaisun jälkeen
Johtopäätös
Maksimaalinen sisällyttäminen edellyttää valikoivaa avoimuutta, ei yhtä yleistä lupaa.
Käytä robots.txt-tiedostoa erottaaksesi haku-, käyttäjän tiedonhaku-, koulutus- ja julkisten aineistojen indeksoinnin. Käytä metatageja ja HTTP-otsikoita indeksoinnin ja katkelmien hallintaan. Käytä todennusta kaikkeen yksityiseen. Varmenna indeksoijan IP-osoitteet sen sijaan, että luottaisit pelkästään käyttäjäagenttien nimiin.
Salliva lisenssi, kuten CC BY 4.0, voi helpottaa laajaa uudelleenkäyttöä, jos todella haluat sitä. Selkeät lähdemerkintätiedot – otsikko, tekijä, lähde, lisenssi, kanoninen sivu ja päivityspäivämäärä – voivat myös helpottaa hakujärjestelmien ja avustajien tunnistamaan ja viittaamaan oikeaan lähteeseen.
Vahvin julkaisukäytäntö on siis:
**Avaa julkinen sisältö, jonka haluat löydettävän, lisensoi selkeästi materiaali, jonka haluat uudelleenkäytettävän, merkitse materiaali, jota et omista, suojaa yksityiset tiedot palvelintasolla ja anna jokaiselle indeksoijalle erillinen, tarkistettava lupa.
Auto