Lisensiering og roboter for maksimal inkludering: Hvordan ønske kunstig intelligens-roboter velkommen
Oppdatert 25. august 2026
Nettsteder har nå mer enn én måte å nå et publikum på. En side kan finnes via Google Søk, oppsummeres av ChatGPT, siteres av Perplexity, brukes i Claude-søk, vises via Apple-tjenester, eller samles inn av et offentlig nettarkiv.
Disse systemene bruker ikke alle samme robot eller følger de samme reglene. Et nettsted som blokkerer GPTBot kan fortsatt vises i ChatGPT-søk hvis det tillater OAI-SearchBot. Et nettsted som tillater Applebot kan forbli synlig i Apple Søk samtidig som det blokkerer Applebot-Extended fra trening av kunstig intelligens-modeller. Googles Google-Extended er ikke en normal robot i det hele tatt; det er et robots.txt-kontrolltoken.
Den beste politikken er derfor ikke bare «tillat kunstig intelligens» eller «blokker kunstig intelligens». Det er å opprette separate tillatelser for:
- Søk og oppdagelse
- Brukerforespurt henting
- Modellutvikling og trening
- Offentlige datasett
- Sensitivt, privat eller begrenset materiale
Denne artikkelen gir en oppdatert oversikt over roboter, robots.txt-eksempler, veiledning for metatagger, metoder for verifisering av IP-adresser, råd om Creative Commons-lisensiering, juridisk standardtekst, og en risiko-nytte-matrise.
De fire kontrollene enhver utgiver bør forstå
1. robots.txt kontrollerer forespurt gjennomsøking
En robots.txt-fil forteller kompatible automatiserte klienter hvilke sider de kan be om. Den er nyttig for å administrere robot-trafikk og uttrykke en utgivers preferanser.
Robots.txt er imidlertid ikke et tilgangskontrollsystem. Robots Exclusion Protocol sier at reglene ikke er tilgangsautorisasjon. Google advarer også om at en blokkert adresse fortsatt kan vises i søkeresultater hvis andre sider lenker til den. Bruk passord, autentisering eller server-side tilgangskontroller for konfidensiell informasjon. (rfc-editor.org)
2. Metatagger kontrollerer indeksering og utdrag
Robots metatagger og X-Robots-Tag responsheaderen kan kontrollere om en side indekseres, eller om en søkemotor kan vise et utdrag (snippet).
Disse kontrollene er normalt kun synlige etter at en robot har fått lov til å hente siden. Hvis robots.txt blokkerer siden først, vil roboten kanskje aldri se metataggen. (developers.google.com)
3. Nettverkskontroller verifiserer roboten
Et user-agent-navn er lett å kopiere. En angriper kan sende en forespørsel som hevder å være GPTBot, Googlebot eller PerplexityBot.
En sterkere tilnærming kombinerer:
- Det hevdede user-agent-navnet
- Et publisert IP-adresseområde (Internet Protocol-adresseområde)
- Omvendt DNS-verifisering (Reverse Domain Name System)
- Fremover DNS-verifisering (Forward Domain Name System)
- Hastighetsbegrensninger og forespørselsovervåking
4. En lisens gir gjenbruksrettigheter
Robots.txt sier hva en robot blir bedt om å gjøre. En lisens sier hva enkeltpersoner eller organisasjoner lovlig kan gjøre med materiale når opphavsrettslig tillatelse er påkrevd.
Dette er forskjellige verktøy. En tillatende lisens kan redusere juridisk usikkerhet, men den garanterer ikke at en robot vil besøke siden, at en modell vil bruke den, eller at en assistent vil sitere den.
Oversikt over viktige roboter
Følgende oversikt ble sjekket mot leverandørdokumentasjon tilgjengelig 25. august 2026. User-agent-navn, formål og IP-adresseområder (Internet Protocol) kan endres, så produksjonssystemer bør bruke leverandørens gjeldende dokumentasjon og live-adressefeeder.
| Leverandør | Robot eller robots.txt-token | Hovedformål | Viktig kontroll |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Finner og analyserer sider for ChatGPT-søk | Tillat den for å øke sjansen for at sider vises i ChatGPT-søkeresultater. |
| OpenAI | GPTBot | Samler inn sider som kan brukes til å trene OpenAIs generative kunstig intelligens-modeller | Tillat eller nekt separat fra søk. |
| OpenAI | ChatGPT-User | Henter sider etter at en bruker ber ChatGPT eller en tilpasset GPT om å få tilgang til dem | Den er bruker-utløst snarere enn en automatisk webrobot, så robots.txt-regler gjelder kanskje ikke. |
| OpenAI | OAI-AdsBot | Sjekker nettsider som er sendt inn som ChatGPT-annonse-destinasjoner | Hovedsakelig relevant for annonsører. Det innsamlede innholdet brukes ikke til å trene generative kunstig intelligens grunnmodeller. |
Googlebot | Hovedrobot for Google Søk | Kontrollerer vanlig indeksering for Google Søk. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Bilder, videoer og Google Nyheter | Disse har separate robots.txt-token og kan kontrolleres uavhengig. | |
GoogleOther | Google-indeksering for generelle formål for ulike produktteam, inkludert forskning og utvikling | Den representerer ikke ett spesifikt Google-produkt. | |
Google-Extended | Kontrollerer om Google-indeksert innhold kan brukes til Gemini-modelltrening og visse jordingssystemer | Det er et robots.txt-kontrolltoken, ikke en separat user-agent for forespørsler. Det påvirker ikke vanlig inkludering i Google Søk. | |
| Anthropic | ClaudeBot | Samler inn offentlig webinnhold som kan bidra til Claude-modellutvikling | Nekter den for å signalisere at fremtidig materiale bør utelukkes fra Anthropic-treningsdatasett. |
| Anthropic | Claude-SearchBot | Forbedrer Claude-søkeresultatkvaliteten | Tillat den for Claude-søksynlighet. |
| Anthropic | Claude-User | Henter sider som svar på en brukers forespørsel til Claude | Separat fra automatisk gjennomsøking. |
| Perplexity | PerplexityBot | Indekserer sider for Perplexity-søkeresultater | Perplexity sier at denne roboten ikke brukes til å samle inn innhold for trening av kunstig intelligens grunnmodeller. |
| Perplexity | Perplexity-User | Henter en side etter at en bruker ber om det | Perplexitys dokumentasjon sier at denne henteren generelt ignorerer robots.txt fordi forespørselen ble initiert av en bruker. |
| Apple | Applebot | Støtter Apple Søk, Spotlight, Siri, Safari og andre Apple-opplevelser | Tillat den for Apple-oppdagelse. |
| Apple | Applebot-Extended | Kontrollerer om Applebot-indeksert innhold kan brukes til å trene Apples grunnmodeller | Den indekserer ikke sider selv. Det er en databrukskontroll. |
| Common Crawl | CCBot | Samler inn offentlige webdata for Common Crawls åpne webarkiv | Det er ikke en assistent, men datasettene kan brukes av forskere og utviklere innen kunstig intelligens. |
| Microsoft | Bingbot | Hovedrobot for Bing Søk | Tillat den for Bing-oppdagelse og søkesynlighet. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Side- og video-forhåndsvisninger for Microsoft-produkter | Disse kan kontrolleres separat fra Bingbot. |
| Amazon | Amzn-SearchBot | Amazon-søk og innholdsoppdagelse | Amazon sier at den ikke indekserer innhold for generative kunstig intelligens-modeller. |
| Amazon | Amzn-User | Henter aktuell informasjon som svar på brukerhandlinger, inkludert Alexa-forespørsler | Bruker-utløst og separat fra automatisk søkeindeksering. |
OpenAI dokumenterer sine søke-, trenings-, annonserings- og bruker-utløste roboter som separate kontroller. Dokumentasjonen anbefaler spesifikt å tillate OAI-SearchBot for ChatGPT-søk, mens GPTBot brukes separat for treningspreferanser. (developers.openai.com)
Google skiller på samme måte mellom Googlebot, GoogleOther og Google-Extended. Google-Extended har ingen egen HTTP-forespørsel user-agent, og blokkering av den fjerner ikke en side fra Google Søk. (developers.google.com)
Anthropic dokumenterer separate roller for ClaudeBot, Claude-SearchBot og Claude-User. Anthropic opplyser også at deres roboter følger robots.txt og støtter den ikke-standardiserte Crawl-delay-direktivet. (support.anthropic.com)
Perplexity skiller mellom automatisk søkeindeksering og brukerforespurt henting. Deres nåværende dokumentasjon sier at PerplexityBot respekterer robots.txt, mens Perplexity-User generelt ikke gjør det fordi den svarer på en brukerforespørsel. (docs.perplexity.ai)
Apples nåværende dokumentasjon gjør det samme skillet mellom søk og trening: Applebot støtter oppdagelse, mens Applebot-Extended lar utgivere kontrollere treningsbruk uten å fjerne sider fra Apple Søk. (support.apple.com)
Anbefalte robots.txt-konfigurasjoner
Plasser robots.txt i roten av hver vert, for eksempel:
text https://www.example.org/robots.txt
Regler gjelder for den spesifikke verten, protokollen og porten der filen serveres. Et separat underdomene kan trenge sin egen fil. (developers.google.com)
Konfigurasjon 1: Maksimal inkludering
Bruk dette når offentlig redaksjonelt innhold kan finnes, oppsummeres, siteres, indekseres og samles inn av kompatible roboter.
text
Offentlige sider er tilgjengelige for kompatible roboter.
User-agent: * Allow: /
Hold private, transaksjonelle og administrative stier ute.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Dette tillater navngitte roboter, inkludert OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft og Amazon, med mindre en annen spesifikk regel blokkerer dem.
Ikke plasser en generell regel som User-agent: * Disallow: / under denne konfigurasjonen. En senere eller mer spesifikk gruppe kan endre hvordan en robot tolker filen.
Konfigurasjon 2: Tillat søk, men blokker roboter for modellutvikling
Dette er ofte det beste kompromisset for utgivere som ønsker sitater og søketrafikk, men ikke ønsker å signalisere tillatelse for innsamling til modellutvikling.
text
Blokker OpenAI-roboter for modellutvikling.
User-agent: GPTBot Disallow: /
Blokker Anthropic-roboter for modellutvikling.
User-agent: ClaudeBot Disallow: /
Blokker Google-modelltrening og relatert jordingsbruk.
User-agent: Google-Extended Disallow: /
Blokker Apple-grunnmodelltrening.
User-agent: Applebot-Extended Disallow: /
Valgfritt: blokker Common Crawl-datasettinnsamling.
User-agent: CCBot
Disallow: /
Tillat vanlig søke- og hentingsindeksering, unntatt for sensitive stier.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Denne konfigurasjonen lar OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot og Applebot dekkes av jokertegn-gruppen. Den holder også søke- og treningstillatelser separate.
For Apple, blokkering av Applebot-Extended samtidig som Applebot tillates, bevarer oppdagelse via Apple-tjenester. For Google blokkerer ikke blokkering av Google-Extended vanlig Google Søk. (developers.google.com)
Konfigurasjon 3: Tillat eksplisitt utvalgte søkeroboter
Hvis en eksisterende robots.txt-fil blokkerer alle roboter, legg til separate grupper for søkerobotene du ønsker å ønske velkommen.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Hold alle andre roboter ute.
User-agent: * Disallow: /
Når du bruker spesifikke grupper, gjenta reglene for sensitive stier inne i hver gruppe. Noen roboter bruker den mest spesifikke matchende gruppen i stedet for å kombinere den med jokertegn-gruppen. Bing dokumenterer denne oppførselen direkte, og Google gir separat veiledning om robot-spesifikke grupper. (bing.com)
Viktige begrensninger for robots.txt
- En robot kan ignorere robots.txt.
- En ondsinnet robot kan utgi seg for å være en klarert robot.
- En blokkert side kan fortsatt være kjent via tittel eller nettadresse.
- Robots.txt beskytter ikke passord, private filer, kunderegister eller konfidensielle applikasjonsprogrammeringsgrensesnitt (API-er).
- Et
Crawl-delay-direktiv er ikke en del av kjerneprotokollen for Robots Exclusion Protocol og støttes ikke av alle roboter. Anthropic og Bing dokumenterer støtte, mens Apple sier at Applebot ikke følger crawl-delay. (rfc-editor.org)
Metatagger og HTTP-headere
Eksempel på offentlig side
For en offentlig artikkel, bruk en tydelig tittel, forfatter, kanonisk nettadresse, publiseringsdato og endringsdato.
html
Direktivet max-snippet er primært dokumentert for Google. Ikke anta at hver robot for kunstig intelligens støtter alle metadirektiver.
Eksempel på privat eller sensitiv side
html
Bruk dette for sider som ikke skal vises i søkeresultater. Siden må forbli gjennomsøkbar lenge nok til at roboten kan se direktivet. Hvis siden virkelig må forbli privat, bruk autentisering eller passordbeskyttelse i stedet. (developers.google.com)
Skjul kun sensitive seksjoner fra søkeutdrag
Google støtter data-nosnippet for spesifikke deler av en HTML-side:
html
This paragraph may be shown in a search result.
Dette er nyttig for kontaktdetaljer, interne notater eller brukergenerert informasjon. Det er ikke en universell instruksjon for hvert system for kunstig intelligens. (developers.google.com)
Bruk X-Robots-Tag-headeren for filer
Metatagger kan ikke plasseres inne i en bærbar dokumentfil, bilde- eller videofil. Bruk en HTTP-responsheader i stedet:
text X-Robots-Tag: noindex, nosnippet
For en side som skal forbli søkbar, men ikke skal gi tekst for utdrag eller kunstig intelligens-svar, bruk:
text X-Robots-Tag: nosnippet
Google dokumenterer X-Robots-Tag for ikke-HTML-ressurser, og Apple støtter det også for Applebot. (developers.google.com)
Apple-spesifikke kontroller
Apple støtter:
html
Apple sier at nosnippet forhindrer at siden brukes som ytterligere kontekst og aktuelt innhold når Apple-modeller genererer utdata. Siden kan fortsatt forbli oppdagbar via Apple Søk, Spotlight, Siri og Safari. (support.apple.com)
For sider med betalingsmur støtter Apple også strukturert data ved å bruke:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple sier at slike sider kan forbli kvalifisert for søkeresultater, men vil ikke bli brukt som ytterligere kontekst for kunstig intelligens-svar. (support.apple.com)
Hvordan verifisere roboters IP-adresser (Internet Protocol-adresser)
Hvorfor user-agent-matching ikke er nok
En regel som denne er svak:
text if User-Agent contains "GPTBot": allow
Hvem som helst kan sende den teksten. En bedre regel er:
text hvis User-Agent er en kjent robot OG kilde Internet Protocol-adresse er innenfor leverandørens offisielle område: tillat eller hastighetsbegrens ELLERS: utfordre, hastighetsbegrens, eller blokker
Stol ikke på en X-Forwarded-For-header med mindre den kommer fra en proxy eller et innholdsleveringsnettverk (CDN) som organisasjonen din kontrollerer.
Leverandørverifiseringsmetoder
| Leverandør | Anbefalt verifiseringsmetode |
|---|---|
| OpenAI | Bruk live IP-adresse-feeder (Internet Protocol) publisert i OpenAIs robotdokumentasjon for OAI-SearchBot, GPTBot og OAI-AdsBot. Oppdater dem automatisk i stedet for å kopiere faste områder inn i en brannmur. |
| Bruk Googles publiserte robotområder eller utfør omvendt og fremover DNS-sjekk (Domain Name System). En ekte Google-robot skal løses til et godkjent Google-vertsnavn og løses tilbake til den opprinnelige adressen. | |
| Anthropic | Bruk den aktuelle publiserte robotadressefeeden som en sekundær nettverkssjekk. Anthropic sin primære avmeldingsmetode forblir robots.txt. |
| Perplexity | Kombiner user-agent med den aktuelle PerplexityBot- eller Perplexity-User-adressefeeden. Perplexity anbefaler spesifikt å kombinere begge betingelsene i en brannmurregel for nettapplikasjoner (Web Application Firewall). |
| Apple | Bruk omvendt DNS-verifisering (Domain Name System) under applebot.apple.com, og utfør deretter et fremoveroppslag. Apple publiserer også aktuelle adresseområder i en JSON-feed. |
| Common Crawl | Bruk omvendt DNS-verifisering (Domain Name System) under crawl.commoncrawl.org og den aktuelle CCBot-adressefeeden. Common Crawl bemerker at omvendt verifisering ennå ikke er tilgjengelig for noe IPv6-trafikk. |
| Microsoft | Bruk det offisielle Verify Bingbot-verktøyet eller Microsofts dokumenterte metoder for omvendt og fremoveroppslag. |
| Amazon | Bruk Amazons publiserte robotadresselister og match dem med riktig Amazon user-agent. |
Google, Apple, Common Crawl, OpenAI, Anthropic og Perplexity publiserer alle leverandørspesifikke metoder eller adressefeeder. Disse listene kan endres, så en planlagt oppdateringsprosess er tryggere enn en permanent, manuelt kopiert liste. (developers.google.com)
Et enkelt brannmurdesign kan se slik ut:
text tillat OAI-SearchBot kun når kildeadressen er i det nåværende OpenAI søkeområdet tillat GPTBot kun når kildeadressen er i det nåværende OpenAI treningsområdet tillat PerplexityBot kun når kildeadressen er i det nåværende PerplexityBot-området tillat Applebot kun når omvendt og fremover DNS-verifisering lykkes tillat CCBot kun når omvendt DNS og det nåværende Common Crawl-området stemmer overens
hastighetsbegrens alle verifiserte roboter blokker eller utfordre uverifiserte forespørsler som hevder å være klarerte roboter
Ikke bruk en bred tillatelsesregel på en hel skyleverandør. En legitim robot kan bruke skyinfrastruktur, men det meste av trafikken fra den skyleverandøren er ikke nødvendigvis roboten.
Hvordan åpen lisensiering påvirker inkludering
CC BY 4.0 i klartekst
Creative Commons Attribution 4.0 International-lisensen, vanligvis kalt CC BY 4.0, lar folk:
- Kopiere og videredistribuere verket
- Tilpasse, oversette, remixe og bygge videre på det
- Bruke det kommersielt
Hovedbetingelsene er:
- Gi passende kreditt
- Lenke til lisensen
- Indiker om endringer er gjort
- Ikke antyd at den opprinnelige skaperen støtter gjenbruken
- Ikke legg til juridiske eller tekniske begrensninger som hindrer bruksområder tillatt av lisensen
Creative Commons advarer også om at lisensen kanskje ikke dekker personvernrettigheter, publisitetsrettigheter, moralske rettigheter, varemerkerettigheter, patentrettigheter eller tredjepartsmateriale. (creativecommons.org)
En lisens er ikke en robotinvitasjon i seg selv
Å sette «CC BY 4.0» på en side garanterer ikke at en organisasjon vil gjennomsøke den. En robot kan fortsatt blokkeres av:
- robots.txt
- Et innholdsleveringsnettverk (Content Delivery Network – CDN)
- En brannmur for nettapplikasjoner (Web Application Firewall – WAF)
- Hastighetsbegrensning
- En JavaScript-utfordring
- En påloggingsmur
- En dårlig serverrespons
- Et utilgjengelig sitemap
Motsatt gir det å tillate en robot ikke automatisk alle opphavsrettslige tillatelser som trengs for enhver senere bruk. Robots.txt og lisensiering bør utformes sammen.
Hvorfor CC BY kan støtte bredere inkludering
En klar tillatende lisens kan gjøre en utgivers retningslinjer enklere for datateam, søkesystemer og assistentoperatører å forstå. Det kan redusere usikkerheten rundt kopiering, tilpasning, kommersiell bruk, oversettelse og videredistribusjon når disse aktivitetene krever opphavsrettslig tillatelse.
Imidlertid forklarer Creative Commons at trening av kunstig intelligens er juridisk komplekst. En restriktiv lisens er ikke alltid en effektiv måte å forhindre trening på, fordi enkelte treningsbruk kan være tillatt av opphavsrettslige unntak eller begrensninger. Creative Commons bemerker også at lisensvilkår kan være vanskelige å anvende på maskintrening og modellutdata. (creativecommons.org)
Den praktiske lærdommen er:
Bruk CC BY når du genuint ønsker bred lovlig gjenbruk. Ikke bruk en restriktiv Creative Commons-lisens som en garantert kunstig intelligens-trenings-opt-out.
Kildehenvisning forbedrer kildeklarheten
Creative Commons anbefaler TASL-metoden:
- Tittel
- Forfatter
- Kilde
- Lisens
For eksempel:
«Lisensiering og roboter for maksimal inkludering,» Eksempel Forlag, https://www.example.org/articles/ai-crawlers, lisensiert under Creative Commons Attribution 4.0 International. Endringer gjort: oppdatert robot-oversikt.
Tydelig kildehenvisning tvinger ikke hver assistent til å sitere en side. Det gjør det imidlertid lettere å sitere korrekt når et system trekker ut sidens tittel, forfatter, kilde og lisensinformasjon. (wiki.creativecommons.org)
Legg til strukturert artikkelinformasjon
Bruk synlig informasjon og strukturerte data sammen:
html
Google anbefaler tydelig forfatterinformasjon, forfattersider, publiseringsdatoer, endringsdatoer og stabile kanoniske sider. Disse signalene kan hjelpe søkesystemer med å forstå hvem som opprettet materialet og hvilken versjon som er autoritativ. De garanterer ikke en rangering, inkludering eller sitering. (developers.google.com)
Juridisk standardtekst for et åpent, siteringsvennlig nettsted
Følgende er eksempeltekst, ikke juridisk rådgivning. Få advokat til å tilpasse den til din jurisdiksjon, eierstruktur, personvernforpliktelser og tredjepartsinnhold.
CC BY 4.0 lisenserklæring
text
Innholdslisens
Med mindre annet er angitt, er den originale teksten og det originale redaksjonelle materialet på denne siden lisensiert under Creative Commons Attribution 4.0 International-lisensen:
https://creativecommons.org/licenses/by/4.0/
Denne tillatelsen tillater kopiering, videredistribusjon, tilpasning, oversettelse, kommersiell bruk, maskinlesbar behandling, søkeindeksering, henting, oppsummering og bruk i kunstig intelligens-systemer, forutsatt at lisensvilkårene følges.
Foretrukket kildehenvisning:
«[Sidetittel],» av [forfatter eller organisasjon], [kanonisk sideadresse], publisert eller oppdatert [dato], lisensiert under Creative Commons Attribution 4.0 International. Gjorte endringer: [beskriv endringer, eller oppgi «ingen»].
Vennligst bevar forfatter-, utgiver-, kilde-, lisens- og endringsinformasjon der det er rimelig mulig. Denne veiledningen for foretrukket kildehenvisning legger ikke til begrensninger i Creative Commons-lisensen og erstatter ikke lisensens tekst.
Frasen «inkludert kunstig intelligens-systemer» tydeliggjør utgiverens intensjon. Den skal ikke brukes til å late som om utgiveren eier rettigheter til materiale skapt av noen andre.
Merkevare, personvern og tredjepartsrettigheter – varsel
text
Merkevare, personvern og tredjepartsrettigheter
Lisensen ovenfor dekker kun det originale materialet som er identifisert som lisensiert. Den gir ikke tillatelse til å bruke:
- Varemerker, tjenestemerker, logoer eller trade dress
- Navn, bilder eller lignende av personer
- Privat, konfidensiell, konto-, helse-, finans- eller sikkerhetsinformasjon
- Brukerbidrag med mindre de er separat identifisert som lisensiert
- Fotografier, illustrasjoner, kart, video, musikk, sitater eller annet tredjepartsmateriale
- Innhold identifisert som «alle rettigheter forbeholdt» eller underlagt en separat lisens
Bruk av Example Publishing-navnet, -logoene og -merkene må ikke antyde sponsing, godkjenning, partnerskap eller anbefaling. Vennligst lenke til den originale siden og skille tydelig mellom sitat, parafrase, oppsummering og generert materiale.
Dette språket er viktig fordi Creative Commons-lisenser ikke automatisk gir alle typer juridiske rettigheter knyttet til en side. (creativecommons.org)
Veiledning for sitering i søk og assistenter
text
Veiledning for sitering i søk og assistenter
Vi ønsker velkommen kompatibel søkeindeksering, brukerforespurt henting, sitering og oppsummering av det lisensierte materialet på dette nettstedet.
Når du siterer dette nettstedet, vennligst bruk sidetittelen, forfatter eller utgiver, kanonisk sideadresse, publiserings- eller oppdateringsdato, og en direkte lenke til kilden. Vennligst identifiser kilden som ett bidrag blant eventuelle brukte kilder, skille generert analyse fra sitert materiale, og ikke hevde eller antyde at Example Publishing støtter et generert svar, produkt, person eller tjeneste.
Denne veiledningen er ment å forbedre nøyaktighet og kildehenvisning. Den gir ikke rettigheter utover den gjeldende innholdslisensen og lisensierer ikke varemerker, personlig informasjon, konfidensiell informasjon eller tredjepartsmateriale.
Hvis du ønsker synlighet i søk, men ikke ønsker å gi en bred treningslisens
text
Søketilgang og opphavsrett
Våre offentlige sider kan nås av kompatible søke- og hentingsroboter identifisert i vår robots.txt-fil. Denne tillatelsen er ment å støtte oppdagelse, søkeresultater, brukerforespurt henting og sitering.
Med mindre en separat lisens er vist, forblir det originale innholdet «alle rettigheter forbeholdt». Tilgang til en offentlig side gir ikke en separat lisens for modellutvikling, trening, videredistribusjon, kommersiell gjenbruk eller opprettelse av avledede verk utover rettigheter gitt av gjeldende lov.
Vennligst siter den kanoniske sideadressen og utgiveren når du refererer til dette materialet. Ingenting på dette nettstedet gir tillatelse til å bruke varemerker, logoer, personlig informasjon, konfidensiell informasjon eller tredjepartsinnhold.
Ikke plasser CC BY-erklæringen og «alle rettigheter forbeholdt»-erklæringen over samme materiale. Identifiser tydelig hvilken lisens som gjelder for hvilket innhold.
Risiko- og nytte-matrise for åpen lisensiering
Opphavsrettslovgivning og regler for trening av kunstig intelligens varierer etter land og er fortsatt uavklart. Det amerikanske opphavsrettskontoret fortsetter å undersøke disse spørsmålene, mens Creative Commons beskriver trening av kunstig intelligens som faktabasert og juridisk komplekst. (copyright.gov)
| Tilnærming | Inkluderingspotensial | Hovedfordeler | Hovedrisikoer | Best egnet |
|---|---|---|---|---|
| CC BY 4.0 | Veldig høy | Bred kopiering, tilpasning, kommersiell bruk, oversettelse, indeksering og modellrelatert gjenbruk når opphavsrettslig tillatelse er nødvendig | Kommersielle konkurrenter kan gjenbruke eller tilpasse innholdet; kildehenvisning kan være ufullkommen; lisensen kan ikke kontrollere personvern, varemerke eller tredjepartsrettigheter | Utgivere som ønsker den bredeste lovlige gjenbruken og sterk kildehenvisning |
| CC BY-SA 4.0 | Høy, men mer kompleks | Oppfordrer til en åpen delingssyklus og krever at tilpasninger forblir under kompatible vilkår | ShareAlike-regler kan være vanskelige å anvende på datasett, modelltrening og offentlige utdata; noen organisasjoner kan unngå materialet på grunn av usikkerhet | Åpne utdannings- og allmennnyttige prosjekter som ønsker at nedstrøms tilpasninger skal forbli åpne |
| CC BY-NC 4.0 | Middels eller lav | Begrenser bruksområder primært ment for kommersiell fordel eller pengekompensasjon | «Ikke-kommersiell» kan være vanskelig å tolke; kan ekskludere kommersielle søke-, modell- og assistentbruksområder; det er ikke en garantert trenings-opt-out | Materiale ment for ideell, utdannings- eller samfunnsbruk |
| CC BY-ND 4.0 | Middels | Tillater deling samtidig som tilpasninger begrenses | Oversettelse, transformasjon og enkelte assistentbruksområder kan bli juridisk usikre; mindre attraktivt for systemer som oppsummerer eller remikser | Offisielle varsler eller verk som må forbli uendret |
| CC0 eller offentlig domene-dedikasjon | Veldig høy | Forenkler gjenbruk og fjerner de fleste opphavsrettslige betingelser der det er juridisk effektivt | Ingen påkrevd kildehenvisning; svak kontroll over merkevarepresentasjon; personvern, varemerke og publisitetsrettigheter forblir separate | Fakta, datasett, referansemateriale eller verk ment for ubegrenset gjenbruk |
| Alle rettigheter forbeholdt pluss åpen søkeindeksering | Høy for søk, lavere for trening | Kan bevare søke- og siteringssynlighet uten å gi en bred gjenbrukslisens | Mer juridisk usikkerhet for modellutviklere; kan redusere inkludering i treningsdatasett og kommersielle gjenbrukssystemer | Utgivere som ønsker oppdagelse og sitater, men foretrekker å forhandle bredere lisenser separat |
Den mest balanserte strategien for mange organisasjoner er:
- CC BY 4.0 for original offentlig redaksjonell tekst
- Separate merker for tredjepartsmateriale
- Ingen offentlig personlig eller konfidensiell informasjon
- Tillat søke- og hentingsroboter
- Tillat roboter for modellutvikling kun hvis organisasjonen genuint aksepterer den bruken
- Bruk tydelig kildehenvisning og kanoniske lenker
- Beskytt varemerker gjennom et separat merkevarevarsel
En praktisk sjekkliste for implementering
Innhold og lisensiering
- Identifiser hvem som eier hver side, bilde, diagram, video og sitat.
- Lisensier kun materiale som organisasjonen din kontrollerer rettighetene til.
- Merk tredjepartsmateriale separat.
- Legg til en synlig lisenserklæring.
- Gi en foretrukket kildehenvisning med tittel, forfatter, kilde og lisens.
- Hold logoer, varemerker, personopplysninger og konfidensiell informasjon utenfor det lisensierte omfanget.
Robots.txt
- Opprett en offentlig robots.txt-fil i roten av hver vert.
- Tillat søkeroboter separat fra treningsroboter.
- Blokker administrative, konto-, kasse-, private og interne applikasjonsstier.
- Ikke stol på robots.txt for sikkerhet.
- Test filen etter hver store nettstedutrulling.
Metatagger
- Bruk kanoniske lenker.
- Legg til forfatter, publiseringsdato og endringsdato.
- Bruk
noindexfor sider som ikke skal vises i søk. - Bruk
nosnippetellerdata-nosnippetfor sensitive utdrag der det støttes. - Bruk
X-Robots-Tagfor bærbare dokumentfiler, bilder og andre ikke-HTML-ressurser. - Husk at en robot må kunne hente en side før den kan lese metataggene.
Nettverkssikkerhet
- Loggfør user-agent-strenger, kildeadresser, responskoder og forespørselsstier.
- Verifiser klarerte roboter ved å bruke offisielle adressefeeder eller DNS-metoder (Domain Name System).
- Oppdater adressefeeder automatisk.
- Kombiner user-agent- og kildeadresse-sjekker.
- Hastighetsbegrens verifiserte roboter i stedet for å gi dem ubegrenset tilgang.
- Utfordre eller blokker forespørsler som hevder å være klarerte roboter, men som feiler verifisering.
Måling
Spor:
- Besøk fra søketjenester for kunstig intelligens
- Henvisninger til den originale siden
- Siteringsfrekvens
- Serverbelastning per robot
- Forespørsler som returnerer
403,404eller429 - Robot-tilgang til utilsiktede stier
- Om aktuelle artikler blir funnet etter publisering
Konklusjon
Maksimal inkludering krever selektiv åpenhet, ikke en enkelt generell tillatelse.
Bruk robots.txt for å skille søk, brukerhenting, trening og gjennomsøking av offentlige datasett. Bruk metatagger og HTTP-headere for å administrere indeksering og utdrag. Bruk autentisering for alt privat. Verifiser roboters IP-adresser (Internet Protocol) i stedet for å stole kun på user-agent-navn.
En tillatende lisens som CC BY 4.0 kan gjøre bred gjenbruk enklere når du genuint ønsker det. Tydelig kildehenvisningsinformasjon – tittel, forfatter, kilde, lisens, kanonisk side og oppdateringsdato – kan også gjøre det lettere for søkesystemer og assistenter å identifisere og sitere den korrekte kilden.
Den sterkeste publiseringspolitikken er derfor:
**Åpne det offentlige innholdet du ønsker skal oppdages, lisensier tydelig materialet du ønsker skal gjenbrukes, merk materialet du ikke eier, beskytt privat informasjon på servernivå, og gi hver robot en separat, kontrollerbar tillatelse.
Auto