Licensering og robotter for maksimal inklusion: Sådan byder du kunstig intelligens-crawlere velkommen
Opdateret 25. august 2026
Websites har nu mere end én måde at nå et publikum på. En side kan findes via Google Søgning, opsummeres af ChatGPT, citeres af Perplexity, bruges i Claude-søgning, vises via Apple-tjenester eller indsamles af et offentligt webarkiv.
Disse systemer bruger ikke alle den samme crawler eller følger de samme regler. Et website, der blokerer GPTBot, kan stadig vises i ChatGPT-søgning, hvis det tillader OAI-SearchBot. Et website, der tillader Applebot, kan forblive synligt i Apple Søgning, samtidig med at det blokerer Applebot-Extended fra træning af kunstig intelligens-modeller. Googles Google-Extended er slet ikke en normal crawler; det er et robots.txt-kontroltoken.
Den bedste politik er derfor ikke blot “tillad kunstig intelligens” eller “bloker kunstig intelligens.” Det er at oprette separate tilladelser for:
- Søgning og opdagelse
- Brugeranmodet hentning
- Modeludvikling og træning
- Offentlige datasæt
- Følsomt, privat eller begrænset materiale
Denne artikel giver en aktuel oversigt over crawlere, robots.txt-eksempler, vejledning til metatags, metoder til verifikation af Internet Protocol-adresser, rådgivning om Creative Commons-licensering, juridisk standardskrift og en risiko-gevinst-matrix.
De fire kontroller enhver udgiver bør forstå
1. robots.txt styrer anmodet crawling
En robots.txt-fil fortæller kompatible automatiserede klienter, hvilke sider de må anmode om. Den er nyttig til at styre crawler-trafik og udtrykke en udgivers præferencer.
Robots.txt er dog ikke et adgangskontrolsystem. Robots Exclusion Protocol angiver, at dets regler ikke er adgangstilladelse. Google advarer også om, at en blokeret adresse stadig kan vises i søgeresultater, hvis andre sider linker til den. Brug adgangskoder, autentifikation eller server-side adgangskontroller til fortrolige oplysninger. (rfc-editor.org)
2. Metatags styrer indeksering og snippets
Robots-metatags og X-Robots-Tag-responshovedet kan styre, om en side indekseres, eller om en søgemaskine må vise et snippet.
Disse kontroller er normalt kun synlige, efter at en crawler har fået lov til at hente siden. Hvis robots.txt blokerer siden først, ser crawleren måske aldrig metatagget. (developers.google.com)
3. Netværkskontrol verificerer crawleren
Et user-agent-navn er let at kopiere. En angriber kan sende en anmodning, der hævder at være GPTBot, Googlebot eller PerplexityBot.
En stærkere tilgang kombinerer:
- Den hævdede user-agent
- Et udgivet IP-adresseområde
- Reverse Domain Name System-verifikation
- Forward Domain Name System-verifikation
- Hastighedsbegrænsninger og anmodningsovervågning
4. En licens giver genbrugsrettigheder
Robots.txt fortæller, hvad en crawler anmodes om at gøre. En licens fortæller, hvad personer eller organisationer lovligt må gøre med materiale, når der kræves ophavsretlig tilladelse.
Disse er forskellige værktøjer. En tilladelig licens kan reducere juridisk usikkerhed, men den garanterer ikke, at en crawler vil besøge siden, at en model vil bruge den, eller at en assistent vil citere den.
Oversigt over vigtige crawlere
Den følgende oversigt blev kontrolleret mod udbyderdokumentation tilgængelig den 25. august 2026. User-agent-navne, formål og Internet Protocol-adresseområder kan ændre sig, så produktionssystemer bør bruge udbyderens aktuelle dokumentation og live adressefeeds.
| Udbyder | Crawler eller robots.txt token | Hovedformål | Vigtig kontrol |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Finder og analyserer sider til ChatGPT-søgning | Tillad den for at øge chancen for, at sider vises i ChatGPT-søgeresultater. |
| OpenAI | GPTBot | Indsamler sider, der kan bruges til træning af OpenAIs generative kunstig intelligens-modeller | Tillad eller nægt separat fra søgning. |
| OpenAI | ChatGPT-User | Henter sider, efter at en bruger beder ChatGPT eller en brugerdefineret GPT om at få adgang til dem | Det er brugertriggeret snarere end en automatisk web-crawler, så robots.txt-regler gælder muligvis ikke. |
| OpenAI | OAI-AdsBot | Kontrollerer websider, der er indsendt som ChatGPT-annoncemål | Relevant primært for annoncører. Det indsamlede indhold bruges ikke til at træne generative kunstig intelligens-grundmodeller. |
Googlebot | Googles primære søgecrawler | Styrer almindelig Google Søgning-crawling. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Billeder, videoer og Google Nyheder | Disse har separate robots.txt-tokens og kan styres uafhængigt. | |
GoogleOther | Google-crawling til generelle formål for forskellige produktteams, herunder forskning og udvikling | Den repræsenterer ikke ét specifikt Google-produkt. | |
Google-Extended | Styrer, om Google-crawlet indhold må bruges til Gemini-modeltræning og visse grounding-systemer | Det er et robots.txt-kontroltoken, ikke en separat anmodnings-user-agent. Det påvirker ikke almindelig Google Søgning-inklusion. | |
| Anthropic | ClaudeBot | Indsamler offentligt webindhold, der kan bidrage til Claude-modeludvikling | Bloker den for at signalere, at fremtidigt materiale skal udelukkes fra Anthropic-træningsdatasæt. |
| Anthropic | Claude-SearchBot | Forbedrer Claude-søgeresultatkvaliteten | Tillad den for Claude-søgesynlighed. |
| Anthropic | Claude-User | Henter sider som svar på en brugers anmodning til Claude | Separat fra automatisk crawling. |
| Perplexity | PerplexityBot | Indekserer sider til Perplexity-søgeresultater | Perplexity siger, at denne crawler ikke bruges til at indsamle indhold til træning af kunstig intelligens-grundmodeller. |
| Perplexity | Perplexity-User | Henter en side, efter at en bruger anmoder om den | Perplexitys dokumentation siger, at denne henter generelt ignorerer robots.txt, fordi anmodningen blev initieret af en bruger. |
| Apple | Applebot | Understøtter Apple Search, Spotlight, Siri, Safari og andre Apple-oplevelser | Tillad den for Apple-opdagelse. |
| Apple | Applebot-Extended | Styrer, om Applebot-crawlet indhold må bruges til at træne Apples grundmodeller | Den crawler ikke selv sider. Det er en databrugskontrol. |
| Common Crawl | CCBot | Indsamler offentlige webdata til Common Crawls åbne webarkiv | Det er ikke en assistent, men dens datasæt kan bruges af forskere og udviklere af kunstig intelligens. |
| Microsoft | Bingbot | Bings primære søgecrawler | Tillad den for Bing-opdagelse og søgesynlighed. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Side- og videopræsentationer for Microsoft-produkter | Disse kan styres separat fra Bingbot. |
| Amazon | Amzn-SearchBot | Amazon-søgning og indholdsopdagelse | Amazon siger, at det ikke crawler indhold til træning af generative kunstig intelligens-modeller. |
| Amazon | Amzn-User | Henter aktuelle oplysninger som svar på brugerhandlinger, herunder Alexa-anmodninger | Brugertriggeret og separat fra automatisk søge-crawling. |
OpenAI dokumenterer sine søge-, trænings-, annonce- og brugertriggerede crawlere som separate kontroller. Deres dokumentation anbefaler specifikt at tillade OAI-SearchBot for ChatGPT-søgning, mens GPTBot bruges separat til træningspræferencer. (developers.openai.com)
Google adskiller på lignende vis Googlebot, GoogleOther og Google-Extended. Google-Extended har ikke sin egen HTTP-anmodnings-user-agent, og blokering af den fjerner ikke en side fra Google Søgning. (developers.google.com)
Anthropic dokumenterer separate roller for ClaudeBot, Claude-SearchBot og Claude-User. Anthropic angiver også, at deres bots følger robots.txt og understøtter den ikke-standardiserede Crawl-delay-direktiv. (support.anthropic.com)
Perplexity skelner mellem automatisk søge-crawling og brugeranmodet hentning. Deres nuværende dokumentation siger, at PerplexityBot respekterer robots.txt, mens Perplexity-User generelt ikke gør, fordi den reagerer på en brugeranmodning. (docs.perplexity.ai)
Apples nuværende dokumentation laver den samme skelnen mellem søgning og træning: Applebot understøtter opdagelse, mens Applebot-Extended lader udgivere styre træningsbrug uden at fjerne sider fra Apple Søgning. (support.apple.com)
Anbefalede robots.txt-konfigurationer
Placer robots.txt i roden af hver vært, såsom:
text https://www.example.org/robots.txt
Regler gælder for den specifikke vært, protokol og port, hvor filen serves. Et separat subdomæne kan have brug for sin egen fil. (developers.google.com)
Konfiguration 1: Maksimal inklusion
Brug denne, når offentligt redaktionelt indhold må findes, opsummeres, citeres, indekseres og indsamles af kompatible crawlere.
text
Offentlige sider er tilgængelige for kompatible crawlere.
User-agent: * Allow: /
Hold private, transaktionelle og administrative stier ude.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Dette tillader navngivne crawlere, herunder OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft og Amazon, medmindre en anden specifik regel blokerer dem.
Placer ikke en generel regel som User-agent: * Disallow: / under denne konfiguration. En senere eller mere specifik gruppe kan ændre, hvordan en crawler fortolker filen.
Konfiguration 2: Tillad søgning, men bloker modeludviklingscrawlere
Dette er ofte det bedste kompromis for udgivere, der ønsker citater og søgetrafik, men ikke ønsker at signalere tilladelse til indsamling til modeludvikling.
text
Bloker OpenAI modeludviklings-crawling.
User-agent: GPTBot Disallow: /
Bloker Anthropic modeludviklings-crawling.
User-agent: ClaudeBot Disallow: /
Bloker Googles modeltræning og relaterede grounding-brug.
User-agent: Google-Extended Disallow: /
Bloker Apples brug til træning af grundmodeller.
User-agent: Applebot-Extended Disallow: /
Valgfrit: bloker Common Crawl datasæt-indsamling.
User-agent: CCBot
Disallow: /
Tillad almindelig søgning og hentning via crawling, undtagen for følsomme stier.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Denne konfiguration lader OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot og Applebot være dækket af wildcard-gruppen. Den holder også søge- og træningstilladelser adskilt.
For Apple bevarer blokering af Applebot-Extended samtidig med at Applebot tillades, opdagelse via Apple-tjenester. For Google blokerer blokering af Google-Extended ikke almindelig Google Søgning. (developers.google.com)
Konfiguration 3: Tillad udvalgte søgecrawlere eksplicit
Hvis en eksisterende robots.txt-fil blokerer alle crawlere, skal du tilføje separate grupper for de søgecrawlere, du ønsker at byde velkommen.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Hold alle andre crawlere ude.
User-agent: * Disallow: /
Når du bruger specifikke grupper, skal du gentage reglerne for følsomme stier inden for hver gruppe. Nogle crawlere bruger den mest specifikke matchende gruppe i stedet for at kombinere den med wildcard-gruppen. Bing dokumenterer denne adfærd direkte, og Google giver separat vejledning om crawler-specifikke grupper. (bing.com)
Vigtige robots.txt-begrænsninger
- En crawler kan ignorere robots.txt.
- En ondsindet crawler kan udgive sig for at være en betroet crawler.
- En blokeret side kan stadig være kendt ved sin titel eller webadresse.
- Robots.txt beskytter ikke adgangskoder, private filer, kunderegistre eller fortrolige programmeringsgrænseflader (API'er).
- En
Crawl-delay-direktiv er ikke en del af kernen i Robots Exclusion Protocol og understøttes ikke af alle crawlere. Anthropic og Bing dokumenterer understøttelse, mens Apple siger, at Applebot ikke følger crawl-delay. (rfc-editor.org)
Metatags og HTTP-headere
Eksempel på offentlig side
For en offentlig artikel skal du bruge en klar titel, forfatter, kanonisk webadresse, udgivelsesdato og ændringsdato.
html
max-snippet-direktivet er primært dokumenteret for Google. Forvent ikke, at enhver kunstig intelligens-crawler understøtter ethvert metadirektiv.
Eksempel på privat eller følsom side
html
Brug dette for sider, der ikke skal vises i søgeresultater. Siden skal forblive crawlbar længe nok til, at crawleren kan se direktivet. Hvis siden virkelig skal forblive privat, skal du i stedet bruge autentifikation eller adgangskodebeskyttelse. (developers.google.com)
Skjul kun følsomme sektioner fra søge-snippets
Google understøtter data-nosnippet for specifikke dele af en HTML-side:
html
Dette afsnit kan vises i et søgeresultat.
Dette er nyttigt for kontaktoplysninger, interne noter eller brugergenereret information. Det er ikke en universel instruktion for ethvert kunstig intelligens-system. (developers.google.com)
Brug X-Robots-Tag-headeren til filer
Metatags kan ikke placeres inde i en bærbar dokumentfil, et billede eller en videofil. Brug i stedet en HTTP-responshovede:
text X-Robots-Tag: noindex, nosnippet
For en side, der skal forblive søgbar, men som ikke skal levere tekst til snippets eller kunstig intelligens-svar, brug:
text X-Robots-Tag: nosnippet
Google dokumenterer X-Robots-Tag for ikke-HTML-ressourcer, og Apple understøtter den også for Applebot. (developers.google.com)
Apple-specifikke kontroller
Apple understøtter:
html
Apple siger, at nosnippet forhindrer siden i at blive brugt som yderligere kontekst og aktuelt indhold, når Apple-modeller genererer output. Siden kan stadig forblive opdagelig via Apple Search, Spotlight, Siri og Safari. (support.apple.com)
For betalingsmursider understøtter Apple også struktureret data ved hjælp af:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple siger, at sådanne sider kan forblive kvalificerede til søgeresultater, men vil ikke blive brugt som yderligere kontekst for kunstig intelligens-svar. (support.apple.com)
Sådan verificerer du crawler-Internet Protocol-adresser
Hvorfor user-agent-matching ikke er nok
En regel som denne er svag:
text if User-Agent indeholder "GPTBot": tillad
Enhver kan sende den tekst. En bedre regel er:
text if User-Agent er en kendt crawler og kilde-Internet Protocol-adresse er inden for udbyderens officielle område: tillad eller hastighedsbegræns else: udfordre, hastighedsbegræns eller bloker
Stol ikke på en X-Forwarded-For-header, medmindre den kommer fra en proxy eller et Content Delivery Network (CDN), som din organisation kontrollerer.
Udbyderverifikationsmetoder
| Udbyder | Anbefalet verifikationsmetode |
|---|---|
| OpenAI | Brug de live Internet Protocol-adressefeeds, der er udgivet i OpenAI-crawlerdokumentationen for OAI-SearchBot, GPTBot og OAI-AdsBot. Opdater dem automatisk i stedet for at kopiere faste områder til en firewall. |
| Brug Googles udgivne crawler-områder eller udfør reverse og forward Domain Name System-tjek. En ægte Google-crawler skal løse til et godkendt Google-værtsnavn og løse tilbage til den originale adresse. | |
| Anthropic | Brug det aktuelle udgivne crawler-adressefeed som en sekundær netværkskontrol. Anthropics primære frameldelsesmetode forbliver robots.txt. |
| Perplexity | Kombiner user-agenten med det aktuelle PerplexityBot- eller Perplexity-User-adressefeed. Perplexity anbefaler specifikt at kombinere begge betingelser i en Web Application Firewall-regel. |
| Apple | Brug reverse Domain Name System-verifikation under applebot.apple.com, og udfør derefter et forward-opslag. Apple udgiver også aktuelle adresseområder i et JSON-feed. |
| Common Crawl | Brug reverse Domain Name System-verifikation under crawl.commoncrawl.org og det aktuelle CCBot-adressefeed. Common Crawl bemærker, at reverse-verifikation endnu ikke er tilgængelig for noget IPv6-trafik. |
| Microsoft | Brug det officielle Verify Bingbot-værktøj eller Microsofts dokumenterede reverse og forward lookup-metoder. |
| Amazon | Brug Amazons udgivne crawler-adresselister og match dem med den passende Amazon user-agent. |
Google, Apple, Common Crawl, OpenAI, Anthropic og Perplexity udgiver alle udbyderspecifikke metoder eller adressefeeds. Disse lister kan ændre sig, så en planlagt opdateringsproces er sikrere end en permanent manuelt kopieret liste. (developers.google.com)
Et simpelt firewall-design kunne se sådan ud:
text tillad OAI-SearchBot kun når kildeadressen er inden for det aktuelle OpenAI søgeområde tillad GPTBot kun når kildeadressen er inden for det aktuelle OpenAI træningsområde tillad PerplexityBot kun når kildeadressen er inden for det aktuelle PerplexityBot område tillad Applebot kun når reverse og forward DNS-verifikation lykkes tillad CCBot kun når reverse DNS og det aktuelle Common Crawl område matcher
hastighedsbegræns alle verificerede crawlere bloker eller udfordr uverificerede anmodninger, der hævder at være betroede crawlere
Anvend ikke en bred tilladelsesregel for en hel cloud-udbyder. En legitim crawler kan bruge cloud-infrastruktur, men det meste trafik fra den cloud-udbyder er ikke nødvendigvis crawleren.
Hvordan åben licensering påvirker inklusion
CC BY 4.0 i almindeligt sprog
Creative Commons Attribution 4.0 International-licensen, ofte kaldet CC BY 4.0, giver folk lov til at:
- Kopiere og videredistribuere værket
- Tilpasse, oversætte, remixe og bygge videre på det
- Bruge det kommercielt
Hovedbetingelserne er:
- Giv passende kredit
- Link til licensen
- Angiv, om der er foretaget ændringer
- Undgå at antyde, at den originale skaber støtter genbrugen
- Tilføj ikke juridiske eller tekniske begrænsninger, der forhindrer anvendelser tilladt af licensen
Creative Commons advarer også om, at licensen muligvis ikke dækker privatlivsrettigheder, publicitetsrettigheder, moralske rettigheder, varemærkerettigheder, patentrettigheder eller tredjepartsmateriale. (creativecommons.org)
En licens er ikke en crawler-invitation i sig selv
At sætte “CC BY 4.0” på en side garanterer ikke, at en organisation vil crawle den. En crawler kan stadig blive blokeret af:
- robots.txt
- Et Content Delivery Network
- En Web Application Firewall
- Hastighedsbegrænsning
- En JavaScript-udfordring
- En login-mur
- En dårlig serverrespons
- Et utilgængeligt sitemap
Omvendt giver tilladelse til en crawler ikke automatisk alle ophavsretlige tilladelser, der er nødvendige for enhver senere brug. Robots.txt og licensering bør designes sammen.
Hvorfor CC BY kan understøtte bredere inklusion
En klar tilladelig licens kan gøre en udgivers politik lettere at forstå for datateams, søgesystemer og assistentoperatører. Den kan reducere usikkerhed om kopiering, tilpasning, kommerciel brug, oversættelse og videredistribution, når disse aktiviteter kræver ophavsretlig tilladelse.
Men Creative Commons forklarer, at træning af kunstig intelligens er juridisk kompleks. En restriktiv licens er ikke altid en effektiv måde at forhindre træning på, fordi nogle træningsanvendelser kan være tilladt af undtagelser eller begrænsninger i ophavsretten. Creative Commons bemærker også, at licensbetingelser kan være vanskelige at anvende på maskintræning og model-output. (creativecommons.org)
Den praktiske lektion er:
Brug CC BY, når du oprigtigt ønsker bred lovlig genbrug. Brug ikke en restriktiv Creative Commons-licens som en garanteret frameldelse fra træning af kunstig intelligens.
Attribuerring forbedrer kildeklarhed
Creative Commons anbefaler TASL-metoden:
- Titel
- Forfatter
- Kilde
- Licens
For eksempel:
“Licensering og robotter for maksimal inklusion,” Eksempeludgiveri, https://www.example.org/articles/ai-crawlers, licenseret under Creative Commons Attribution 4.0 International. Foretagne ændringer: opdateret crawler-oversigt.
Klar attribuerring tvinger ikke enhver assistent til at citere en side. Det gør det lettere at citere korrekt, når et system udtrækker sidens titel, forfatter, kilde og licensoplysninger. (wiki.creativecommons.org)
Tilføj struktureret artikelinformation
Brug synlige oplysninger og strukturerede data sammen:
html
Google anbefaler klare forfatteroplysninger, forfattersider, udgivelsesdatoer, ændringsdatoer og stabile kanoniske sider. Disse signaler kan hjælpe søgesystemer med at forstå, hvem der har oprettet materialet, og hvilken version der er autoritativ. De garanterer ikke en placering, inklusion eller citation. (developers.google.com)
Juridisk standardtekst for et åbent, citationsvenligt site
Det følgende er eksempelssprog, ikke juridisk rådgivning. Få rådgiver til at tilpasse det til din jurisdiktion, ejerstruktur, privatlivsforpligtelser og tredjepartsindhold.
CC BY 4.0 licenseringserklæring
text
Indholdslicens
Medmindre andet er angivet, er den originale tekst og det originale redaktionelle materiale på denne side licenseret under Creative Commons Attribution 4.0 International-licensen:
https://creativecommons.org/licenses/by/4.0/
Denne tilladelse giver mulighed for kopiering, videredistribution, tilpasning, oversættelse, kommerciel brug, maskinlæsbar behandling, søgeindeksering, hentning, opsummering og brug i kunstig intelligens-systemer, forudsat at licensbetingelserne overholdes.
Foretrukken attribuerring:
“[Sidetitel],” af [forfatter eller organisation], [kanonisk sideadresse], udgivet eller opdateret [dato], licenseret under Creative Commons Attribution 4.0 International. Foretagne ændringer: [beskriv ændringer, eller angiv 'ingen'].
Bevar venligst forfatter, udgiver, kilde, licens og ændringsinformation, når det er rimeligt muligt. Denne foretrukne attribueringsvejledning tilføjer ikke begrænsninger til Creative Commons-licensen og erstatter ikke licensteksten.
Udtrykket “herunder kunstig intelligens-systemer” præciserer udgiverens hensigt. Det bør ikke bruges til at foregive, at udgiveren ejer rettigheder til materiale skabt af en anden.
Meddelelse om brand, privatliv og tredjepartsrettigheder
text
Brand-, privatlivs- og tredjepartsrettigheder
Ovenstående licens dækker kun det originale materiale identificeret som licenseret. Den giver ikke tilladelse til at bruge:
- Varemærker, servicemærker, logoer eller trade dress
- Navne, billeder eller ligheder af personer
- Private, fortrolige, konto-, sundheds-, finansielle eller sikkerhedsoplysninger
- Brugerindsendelser, medmindre de er separat identificeret som licenserede
- Fotografier, illustrationer, kort, video, musik, citater eller andet tredjepartsmateriale
- Indhold identificeret som “alle rettigheder forbeholdt” eller underlagt en separat licens
Brug af Eksempeludgiveris navn, logoer og mærker må ikke antyde sponsorering, godkendelse, partnerskab eller anbefaling. Link venligst til den originale side og skeln tydeligt mellem citat, parafrase, opsummering og genereret materiale.
Dette sprog er vigtigt, fordi Creative Commons-licenser ikke automatisk giver enhver type juridisk ret forbundet med en side. (creativecommons.org)
Vejledning om søge- og assistentcitation
text
Vejledning om søge- og assistentcitation
Vi glæder os over kompatibel søgeindeksering, brugeranmodet hentning, citation og opsummering af det licenserede materiale på dette site.
Når du citerer dette site, bedes du bruge sidetitlen, forfatteren eller udgiveren, den kanoniske sideadresse, udgivelses- eller opdateringsdatoen og et direkte link til kilden. Identificer venligst kilden som én input blandt alle anvendte kilder, skeln genereret analyse fra citeret materiale, og angiv eller antyd ikke, at Eksempeludgiveri støtter et genereret svar, produkt, person eller service.
Denne vejledning er beregnet til at forbedre nøjagtigheden og attribuerringen. Den giver ikke rettigheder ud over den gældende indholdslicens og licenserer ikke varemærker, personlige oplysninger, fortrolige oplysninger eller tredjepartsindhold.
Hvis du ønsker søgesynlighed, men ikke ønsker at give en bred træningslicens
text
Søgeadgang og ophavsret
Vores offentlige sider kan tilgås af kompatible søge- og hentningscrawlere, der er identificeret i vores robots.txt-fil. Denne tilladelse er beregnet til at understøtte opdagelse, søgeresultater, brugeranmodet hentning og citation.
Medmindre en separat licens er vist, forbliver det originale indhold alle rettigheder forbeholdt. Adgang til en offentlig side giver ikke en separat licens for modeludvikling, træning, videredistribution, kommerciel genbrug eller oprettelse af afledte værker ud over de rettigheder, der er fastsat i gældende lov.
Citer venligst den kanoniske sideadresse og udgiver, når du henviser til dette materiale. Intet på dette site giver tilladelse til at bruge varemærker, logoer, personlige oplysninger, fortrolige oplysninger eller tredjepartsindhold.
Placer ikke CC BY-erklæringen og erklæringen om alle rettigheder forbeholdt over det samme materiale. Identificer tydeligt, hvilken licens der gælder for hvilket indhold.
Risiko-gevinst-matrix for åben licensering
Ophavsretlig lovgivning og regler for træning af kunstig intelligens varierer efter land og er stadig uafklaret. United States Copyright Office fortsætter med at undersøge disse spørgsmål, mens Creative Commons beskriver træning af kunstig intelligens som faktabaseret og juridisk kompleks. (copyright.gov)
| Tilgang | Inklusionspotentiale | Hovedfordele | Hovedrisici | Bedste match |
|---|---|---|---|---|
| CC BY 4.0 | Meget høj | Bred kopiering, tilpasning, kommerciel brug, oversættelse, indeksering og modelrelateret genbrug, når ophavsretlig tilladelse er nødvendig | Kommercielle konkurrenter kan genbruge eller tilpasse indholdet; attribuerring kan være ufuldkommen; licens kan ikke kontrollere privatlivs-, varemærke- eller tredjepartsrettigheder | Udgivere, der ønsker den bredeste lovlige genbrug og stærk kildeattribuerring |
| CC BY-SA 4.0 | Høj, men mere kompleks | Tilskynder en åben delingscyklus og kræver, at tilpasninger forbliver under kompatible vilkår | ShareAlike-regler kan være svære at anvende på datasæt, modeltræning og offentlige outputs; nogle organisationer kan undgå materialet på grund af usikkerhed | Åbne uddannelses- og public interest-projekter, der ønsker, at downstream-tilpasninger forbliver åbne |
| CC BY-NC 4.0 | Medium eller lav | Begrænser anvendelser primært beregnet til kommerciel fordel eller monetær kompensation | “Ikke-kommerciel” kan være svær at fortolke; kan udelukke kommerciel søgning, model- og assistentanvendelser; det er ikke en garanteret frameldelse fra træning | Materiale beregnet til nonprofit-, uddannelsesmæssig eller fællesskabsbrug |
| CC BY-ND 4.0 | Medium | Tillader deling, samtidig med at tilpasninger begrænses | Oversættelse, transformation og nogle assistentanvendelsestilfælde kan blive juridisk usikre; mindre attraktivt for systemer, der opsummerer eller remikser | Officielle meddelelser eller værker, der skal forblive uændrede |
| CC0 eller offentlig domæne-dedikation | Meget høj | Forenkler genbrug og fjerner de fleste ophavsretlige betingelser, hvor det er juridisk effektivt | Ingen påkrævet attribuerring; svag kontrol over brandpræsentation; privatlivs-, varemærke- og publicitetsrettigheder forbliver separate | Fakta, datasæt, referencemateriale eller værker beregnet til ubegrænset genbrug |
| Alle rettigheder forbeholdt plus åben søge-crawling | Høj for søgning, lavere for træning | Kan bevare søge- og citationssynlighed uden at give en bred genbrugslicens | Mere juridisk usikkerhed for modeludviklere; kan reducere inklusion i træningsdatasæt og kommercielle genbrugssystemer | Udgivere, der ønsker opdagelse og citater, men foretrækker at forhandle bredere licenser separat |
Den mest afbalancerede strategi for mange organisationer er:
- CC BY 4.0 for original offentlig redaktionel tekst
- Separate etiketter for tredjepartsmateriale
- Ingen offentlige personlige eller fortrolige oplysninger
- Tillad søge- og hentningscrawlere
- Tillad modeludviklingscrawlere kun hvis organisationen virkelig accepterer den brug
- Brug klar attribuerring og kanoniske links
- Beskyt varemærker gennem en separat brandmeddelelse
En praktisk implementerings-tjekliste
Indhold og licensering
- Identificer hvem der ejer hver side, billede, diagram, video og citat.
- Licensér kun materiale, hvor din organisation kontrollerer rettighederne.
- Mærk tredjepartsmateriale separat.
- Tilføj en synlig licenseringserklæring.
- Angiv en foretrukken citation ved brug af titel, forfatter, kilde og licens.
- Hold logoer, varemærker, persondata og fortrolige oplysninger uden for det licenserede omfang.
Robots.txt
- Opret en offentlig robots.txt-fil i roden af hver vært.
- Tillad søgecrawlere separat fra træningscrawlere.
- Bloker administrative, konto-, checkout-, private og interne applikationsstier.
- Stol ikke på robots.txt for sikkerhed.
- Test filen efter hver større websiteudrulning.
Metatags
- Brug kanoniske links.
- Tilføj forfatter, udgivelsesdato og ændringsdato.
- Brug
noindexfor sider, der ikke skal vises i søgninger. - Brug
nosnippetellerdata-nosnippetfor følsomme uddrag, hvor det understøttes. - Brug
X-Robots-Tagfor bærbare dokumentfiler, billeder og andre ikke-HTML-ressourcer. - Husk, at en crawler skal kunne hente en side, før den kan læse dens metatags.
Netværkssikkerhed
- Log user-agent-strenge, kildeadresser, responskoder og anmodningsstier.
- Verificer betroede crawlere ved hjælp af officielle adressefeeds eller Domain Name System-metoder.
- Opdater adressefeeds automatisk.
- Kombiner user-agent- og kildeadresse-tjek.
- Hastighedsbegræns verificerede crawlere i stedet for at give dem ubegrænset adgang.
- Udfordr eller bloker anmodninger, der hævder at være betroede crawlere, men som fejler verifikation.
Måling
Spor:
- Besøg fra kunstig intelligens-søgetjenester
- Henvisninger til den originale side
- Citationsfrekvens
- Serverbelastning pr. crawler
- Anmodninger, der returnerer
403,404eller429 - Crawler-adgang til utilsigtet stier
- Om aktuelle artikler bliver fundet efter udgivelse
Konklusion
Maksimal inklusion kræver selektiv åbenhed, ikke en enkelt generel tilladelse.
Brug robots.txt til at adskille søgning, brugerhentning, træning og offentlig datasæt-crawling. Brug metatags og HTTP-headere til at styre indeksering og snippets. Brug autentifikation til alt privat. Verificer crawler-IP-adresser i stedet for kun at stole på user-agent-navne.
En tilladelig licens som CC BY 4.0 kan gøre bred genbrug lettere, når du oprigtigt ønsker det. Klare attribueringsoplysninger – titel, forfatter, kilde, licens, kanonisk side og opdateringsdato – kan også gøre det lettere for søgesystemer og assistenter at identificere og citere den korrekte kilde.
Den stærkeste udgiverpolitik er derfor:
**Åbn det offentlige indhold, du ønsker skal opdages, licensér tydeligt det materiale, du ønsker genbrugt, marker det materiale, du ikke ejer, beskyt private oplysninger på serverniveau, og giv hver crawler en separat, gennemgåelig tilladelse.
Auto