AutoPodAutoPod

Licensering og robotter for maksimal inklusion: Sådan byder du AI-crawlere velkommen

22 min. læsning
Lydartikel
Licensering og robotter for maksimal inklusion: Sådan byder du AI-crawlere velkommen
0:000:00
Licensering og robotter for maksimal inklusion: Sådan byder du AI-crawlere velkommen

Licensering og robotter for maksimal inklusion: Sådan byder du kunstig intelligens-crawlere velkommen

Opdateret 25. august 2026

Websites har nu mere end én måde at nå et publikum på. En side kan findes via Google Søgning, opsummeres af ChatGPT, citeres af Perplexity, bruges i Claude-søgning, vises via Apple-tjenester eller indsamles af et offentligt webarkiv.

Disse systemer bruger ikke alle den samme crawler eller følger de samme regler. Et website, der blokerer GPTBot, kan stadig vises i ChatGPT-søgning, hvis det tillader OAI-SearchBot. Et website, der tillader Applebot, kan forblive synligt i Apple Søgning, samtidig med at det blokerer Applebot-Extended fra træning af kunstig intelligens-modeller. Googles Google-Extended er slet ikke en normal crawler; det er et robots.txt-kontroltoken.

Den bedste politik er derfor ikke blot “tillad kunstig intelligens” eller “bloker kunstig intelligens.” Det er at oprette separate tilladelser for:

  1. Søgning og opdagelse
  2. Brugeranmodet hentning
  3. Modeludvikling og træning
  4. Offentlige datasæt
  5. Følsomt, privat eller begrænset materiale

Denne artikel giver en aktuel oversigt over crawlere, robots.txt-eksempler, vejledning til metatags, metoder til verifikation af Internet Protocol-adresser, rådgivning om Creative Commons-licensering, juridisk standardskrift og en risiko-gevinst-matrix.

De fire kontroller enhver udgiver bør forstå

1. robots.txt styrer anmodet crawling

En robots.txt-fil fortæller kompatible automatiserede klienter, hvilke sider de må anmode om. Den er nyttig til at styre crawler-trafik og udtrykke en udgivers præferencer.

Robots.txt er dog ikke et adgangskontrolsystem. Robots Exclusion Protocol angiver, at dets regler ikke er adgangstilladelse. Google advarer også om, at en blokeret adresse stadig kan vises i søgeresultater, hvis andre sider linker til den. Brug adgangskoder, autentifikation eller server-side adgangskontroller til fortrolige oplysninger. (rfc-editor.org)

2. Metatags styrer indeksering og snippets

Robots-metatags og X-Robots-Tag-responshovedet kan styre, om en side indekseres, eller om en søgemaskine må vise et snippet.

Disse kontroller er normalt kun synlige, efter at en crawler har fået lov til at hente siden. Hvis robots.txt blokerer siden først, ser crawleren måske aldrig metatagget. (developers.google.com)

3. Netværkskontrol verificerer crawleren

Et user-agent-navn er let at kopiere. En angriber kan sende en anmodning, der hævder at være GPTBot, Googlebot eller PerplexityBot.

En stærkere tilgang kombinerer:

  • Den hævdede user-agent
  • Et udgivet IP-adresseområde
  • Reverse Domain Name System-verifikation
  • Forward Domain Name System-verifikation
  • Hastighedsbegrænsninger og anmodningsovervågning

4. En licens giver genbrugsrettigheder

Robots.txt fortæller, hvad en crawler anmodes om at gøre. En licens fortæller, hvad personer eller organisationer lovligt må gøre med materiale, når der kræves ophavsretlig tilladelse.

Disse er forskellige værktøjer. En tilladelig licens kan reducere juridisk usikkerhed, men den garanterer ikke, at en crawler vil besøge siden, at en model vil bruge den, eller at en assistent vil citere den.

Oversigt over vigtige crawlere

Den følgende oversigt blev kontrolleret mod udbyderdokumentation tilgængelig den 25. august 2026. User-agent-navne, formål og Internet Protocol-adresseområder kan ændre sig, så produktionssystemer bør bruge udbyderens aktuelle dokumentation og live adressefeeds.

UdbyderCrawler eller robots.txt tokenHovedformålVigtig kontrol
OpenAIOAI-SearchBotFinder og analyserer sider til ChatGPT-søgningTillad den for at øge chancen for, at sider vises i ChatGPT-søgeresultater.
OpenAIGPTBotIndsamler sider, der kan bruges til træning af OpenAIs generative kunstig intelligens-modellerTillad eller nægt separat fra søgning.
OpenAIChatGPT-UserHenter sider, efter at en bruger beder ChatGPT eller en brugerdefineret GPT om at få adgang til demDet er brugertriggeret snarere end en automatisk web-crawler, så robots.txt-regler gælder muligvis ikke.
OpenAIOAI-AdsBotKontrollerer websider, der er indsendt som ChatGPT-annoncemålRelevant primært for annoncører. Det indsamlede indhold bruges ikke til at træne generative kunstig intelligens-grundmodeller.
GoogleGooglebotGoogles primære søgecrawlerStyrer almindelig Google Søgning-crawling.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-NewsBilleder, videoer og Google NyhederDisse har separate robots.txt-tokens og kan styres uafhængigt.
GoogleGoogleOtherGoogle-crawling til generelle formål for forskellige produktteams, herunder forskning og udviklingDen repræsenterer ikke ét specifikt Google-produkt.
GoogleGoogle-ExtendedStyrer, om Google-crawlet indhold må bruges til Gemini-modeltræning og visse grounding-systemerDet er et robots.txt-kontroltoken, ikke en separat anmodnings-user-agent. Det påvirker ikke almindelig Google Søgning-inklusion.
AnthropicClaudeBotIndsamler offentligt webindhold, der kan bidrage til Claude-modeludviklingBloker den for at signalere, at fremtidigt materiale skal udelukkes fra Anthropic-træningsdatasæt.
AnthropicClaude-SearchBotForbedrer Claude-søgeresultatkvalitetenTillad den for Claude-søgesynlighed.
AnthropicClaude-UserHenter sider som svar på en brugers anmodning til ClaudeSeparat fra automatisk crawling.
PerplexityPerplexityBotIndekserer sider til Perplexity-søgeresultaterPerplexity siger, at denne crawler ikke bruges til at indsamle indhold til træning af kunstig intelligens-grundmodeller.
PerplexityPerplexity-UserHenter en side, efter at en bruger anmoder om denPerplexitys dokumentation siger, at denne henter generelt ignorerer robots.txt, fordi anmodningen blev initieret af en bruger.
AppleApplebotUnderstøtter Apple Search, Spotlight, Siri, Safari og andre Apple-oplevelserTillad den for Apple-opdagelse.
AppleApplebot-ExtendedStyrer, om Applebot-crawlet indhold må bruges til at træne Apples grundmodellerDen crawler ikke selv sider. Det er en databrugskontrol.
Common CrawlCCBotIndsamler offentlige webdata til Common Crawls åbne webarkivDet er ikke en assistent, men dens datasæt kan bruges af forskere og udviklere af kunstig intelligens.
MicrosoftBingbotBings primære søgecrawlerTillad den for Bing-opdagelse og søgesynlighed.
MicrosoftMicrosoftPreview, BingVideoPreviewSide- og videopræsentationer for Microsoft-produkterDisse kan styres separat fra Bingbot.
AmazonAmzn-SearchBotAmazon-søgning og indholdsopdagelseAmazon siger, at det ikke crawler indhold til træning af generative kunstig intelligens-modeller.
AmazonAmzn-UserHenter aktuelle oplysninger som svar på brugerhandlinger, herunder Alexa-anmodningerBrugertriggeret og separat fra automatisk søge-crawling.

OpenAI dokumenterer sine søge-, trænings-, annonce- og brugertriggerede crawlere som separate kontroller. Deres dokumentation anbefaler specifikt at tillade OAI-SearchBot for ChatGPT-søgning, mens GPTBot bruges separat til træningspræferencer. (developers.openai.com)

Google adskiller på lignende vis Googlebot, GoogleOther og Google-Extended. Google-Extended har ikke sin egen HTTP-anmodnings-user-agent, og blokering af den fjerner ikke en side fra Google Søgning. (developers.google.com)

Anthropic dokumenterer separate roller for ClaudeBot, Claude-SearchBot og Claude-User. Anthropic angiver også, at deres bots følger robots.txt og understøtter den ikke-standardiserede Crawl-delay-direktiv. (support.anthropic.com)

Perplexity skelner mellem automatisk søge-crawling og brugeranmodet hentning. Deres nuværende dokumentation siger, at PerplexityBot respekterer robots.txt, mens Perplexity-User generelt ikke gør, fordi den reagerer på en brugeranmodning. (docs.perplexity.ai)

Apples nuværende dokumentation laver den samme skelnen mellem søgning og træning: Applebot understøtter opdagelse, mens Applebot-Extended lader udgivere styre træningsbrug uden at fjerne sider fra Apple Søgning. (support.apple.com)

Anbefalede robots.txt-konfigurationer

Placer robots.txt i roden af hver vært, såsom:

text https://www.example.org/robots.txt

Regler gælder for den specifikke vært, protokol og port, hvor filen serves. Et separat subdomæne kan have brug for sin egen fil. (developers.google.com)

Konfiguration 1: Maksimal inklusion

Brug denne, når offentligt redaktionelt indhold må findes, opsummeres, citeres, indekseres og indsamles af kompatible crawlere.

text

Offentlige sider er tilgængelige for kompatible crawlere.

User-agent: * Allow: /

Hold private, transaktionelle og administrative stier ude.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Dette tillader navngivne crawlere, herunder OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft og Amazon, medmindre en anden specifik regel blokerer dem.

Placer ikke en generel regel som User-agent: * Disallow: / under denne konfiguration. En senere eller mere specifik gruppe kan ændre, hvordan en crawler fortolker filen.

Konfiguration 2: Tillad søgning, men bloker modeludviklingscrawlere

Dette er ofte det bedste kompromis for udgivere, der ønsker citater og søgetrafik, men ikke ønsker at signalere tilladelse til indsamling til modeludvikling.

text

Bloker OpenAI modeludviklings-crawling.

User-agent: GPTBot Disallow: /

Bloker Anthropic modeludviklings-crawling.

User-agent: ClaudeBot Disallow: /

Bloker Googles modeltræning og relaterede grounding-brug.

User-agent: Google-Extended Disallow: /

Bloker Apples brug til træning af grundmodeller.

User-agent: Applebot-Extended Disallow: /

Valgfrit: bloker Common Crawl datasæt-indsamling.

User-agent: CCBot

Disallow: /

Tillad almindelig søgning og hentning via crawling, undtagen for følsomme stier.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Denne konfiguration lader OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot og Applebot være dækket af wildcard-gruppen. Den holder også søge- og træningstilladelser adskilt.

For Apple bevarer blokering af Applebot-Extended samtidig med at Applebot tillades, opdagelse via Apple-tjenester. For Google blokerer blokering af Google-Extended ikke almindelig Google Søgning. (developers.google.com)

Konfiguration 3: Tillad udvalgte søgecrawlere eksplicit

Hvis en eksisterende robots.txt-fil blokerer alle crawlere, skal du tilføje separate grupper for de søgecrawlere, du ønsker at byde velkommen.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Hold alle andre crawlere ude.

User-agent: * Disallow: /

Når du bruger specifikke grupper, skal du gentage reglerne for følsomme stier inden for hver gruppe. Nogle crawlere bruger den mest specifikke matchende gruppe i stedet for at kombinere den med wildcard-gruppen. Bing dokumenterer denne adfærd direkte, og Google giver separat vejledning om crawler-specifikke grupper. (bing.com)

Vigtige robots.txt-begrænsninger

  • En crawler kan ignorere robots.txt.
  • En ondsindet crawler kan udgive sig for at være en betroet crawler.
  • En blokeret side kan stadig være kendt ved sin titel eller webadresse.
  • Robots.txt beskytter ikke adgangskoder, private filer, kunderegistre eller fortrolige programmeringsgrænseflader (API'er).
  • En Crawl-delay-direktiv er ikke en del af kernen i Robots Exclusion Protocol og understøttes ikke af alle crawlere. Anthropic og Bing dokumenterer understøttelse, mens Apple siger, at Applebot ikke følger crawl-delay. (rfc-editor.org)

Metatags og HTTP-headere

Eksempel på offentlig side

For en offentlig artikel skal du bruge en klar titel, forfatter, kanonisk webadresse, udgivelsesdato og ændringsdato.

html

max-snippet-direktivet er primært dokumenteret for Google. Forvent ikke, at enhver kunstig intelligens-crawler understøtter ethvert metadirektiv.

Eksempel på privat eller følsom side

html

Brug dette for sider, der ikke skal vises i søgeresultater. Siden skal forblive crawlbar længe nok til, at crawleren kan se direktivet. Hvis siden virkelig skal forblive privat, skal du i stedet bruge autentifikation eller adgangskodebeskyttelse. (developers.google.com)

Skjul kun følsomme sektioner fra søge-snippets

Google understøtter data-nosnippet for specifikke dele af en HTML-side:

html

Dette afsnit kan vises i et søgeresultat.

Personlige telefonnumre, private e-mailadresser eller interne noter anbringes her.

Dette er nyttigt for kontaktoplysninger, interne noter eller brugergenereret information. Det er ikke en universel instruktion for ethvert kunstig intelligens-system. (developers.google.com)

Brug X-Robots-Tag-headeren til filer

Metatags kan ikke placeres inde i en bærbar dokumentfil, et billede eller en videofil. Brug i stedet en HTTP-responshovede:

text X-Robots-Tag: noindex, nosnippet

For en side, der skal forblive søgbar, men som ikke skal levere tekst til snippets eller kunstig intelligens-svar, brug:

text X-Robots-Tag: nosnippet

Google dokumenterer X-Robots-Tag for ikke-HTML-ressourcer, og Apple understøtter den også for Applebot. (developers.google.com)

Apple-specifikke kontroller

Apple understøtter:

html

Apple siger, at nosnippet forhindrer siden i at blive brugt som yderligere kontekst og aktuelt indhold, når Apple-modeller genererer output. Siden kan stadig forblive opdagelig via Apple Search, Spotlight, Siri og Safari. (support.apple.com)

For betalingsmursider understøtter Apple også struktureret data ved hjælp af:

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Apple siger, at sådanne sider kan forblive kvalificerede til søgeresultater, men vil ikke blive brugt som yderligere kontekst for kunstig intelligens-svar. (support.apple.com)

Sådan verificerer du crawler-Internet Protocol-adresser

Hvorfor user-agent-matching ikke er nok

En regel som denne er svag:

text if User-Agent indeholder "GPTBot": tillad

Enhver kan sende den tekst. En bedre regel er:

text if User-Agent er en kendt crawler og kilde-Internet Protocol-adresse er inden for udbyderens officielle område: tillad eller hastighedsbegræns else: udfordre, hastighedsbegræns eller bloker

Stol ikke på en X-Forwarded-For-header, medmindre den kommer fra en proxy eller et Content Delivery Network (CDN), som din organisation kontrollerer.

Udbyderverifikationsmetoder

UdbyderAnbefalet verifikationsmetode
OpenAIBrug de live Internet Protocol-adressefeeds, der er udgivet i OpenAI-crawlerdokumentationen for OAI-SearchBot, GPTBot og OAI-AdsBot. Opdater dem automatisk i stedet for at kopiere faste områder til en firewall.
GoogleBrug Googles udgivne crawler-områder eller udfør reverse og forward Domain Name System-tjek. En ægte Google-crawler skal løse til et godkendt Google-værtsnavn og løse tilbage til den originale adresse.
AnthropicBrug det aktuelle udgivne crawler-adressefeed som en sekundær netværkskontrol. Anthropics primære frameldelsesmetode forbliver robots.txt.
PerplexityKombiner user-agenten med det aktuelle PerplexityBot- eller Perplexity-User-adressefeed. Perplexity anbefaler specifikt at kombinere begge betingelser i en Web Application Firewall-regel.
AppleBrug reverse Domain Name System-verifikation under applebot.apple.com, og udfør derefter et forward-opslag. Apple udgiver også aktuelle adresseområder i et JSON-feed.
Common CrawlBrug reverse Domain Name System-verifikation under crawl.commoncrawl.org og det aktuelle CCBot-adressefeed. Common Crawl bemærker, at reverse-verifikation endnu ikke er tilgængelig for noget IPv6-trafik.
MicrosoftBrug det officielle Verify Bingbot-værktøj eller Microsofts dokumenterede reverse og forward lookup-metoder.
AmazonBrug Amazons udgivne crawler-adresselister og match dem med den passende Amazon user-agent.

Google, Apple, Common Crawl, OpenAI, Anthropic og Perplexity udgiver alle udbyderspecifikke metoder eller adressefeeds. Disse lister kan ændre sig, så en planlagt opdateringsproces er sikrere end en permanent manuelt kopieret liste. (developers.google.com)

Et simpelt firewall-design kunne se sådan ud:

text tillad OAI-SearchBot kun når kildeadressen er inden for det aktuelle OpenAI søgeområde tillad GPTBot kun når kildeadressen er inden for det aktuelle OpenAI træningsområde tillad PerplexityBot kun når kildeadressen er inden for det aktuelle PerplexityBot område tillad Applebot kun når reverse og forward DNS-verifikation lykkes tillad CCBot kun når reverse DNS og det aktuelle Common Crawl område matcher

hastighedsbegræns alle verificerede crawlere bloker eller udfordr uverificerede anmodninger, der hævder at være betroede crawlere

Anvend ikke en bred tilladelsesregel for en hel cloud-udbyder. En legitim crawler kan bruge cloud-infrastruktur, men det meste trafik fra den cloud-udbyder er ikke nødvendigvis crawleren.

Hvordan åben licensering påvirker inklusion

CC BY 4.0 i almindeligt sprog

Creative Commons Attribution 4.0 International-licensen, ofte kaldet CC BY 4.0, giver folk lov til at:

  • Kopiere og videredistribuere værket
  • Tilpasse, oversætte, remixe og bygge videre på det
  • Bruge det kommercielt

Hovedbetingelserne er:

  • Giv passende kredit
  • Link til licensen
  • Angiv, om der er foretaget ændringer
  • Undgå at antyde, at den originale skaber støtter genbrugen
  • Tilføj ikke juridiske eller tekniske begrænsninger, der forhindrer anvendelser tilladt af licensen

Creative Commons advarer også om, at licensen muligvis ikke dækker privatlivsrettigheder, publicitetsrettigheder, moralske rettigheder, varemærkerettigheder, patentrettigheder eller tredjepartsmateriale. (creativecommons.org)

En licens er ikke en crawler-invitation i sig selv

At sætte “CC BY 4.0” på en side garanterer ikke, at en organisation vil crawle den. En crawler kan stadig blive blokeret af:

  • robots.txt
  • Et Content Delivery Network
  • En Web Application Firewall
  • Hastighedsbegrænsning
  • En JavaScript-udfordring
  • En login-mur
  • En dårlig serverrespons
  • Et utilgængeligt sitemap

Omvendt giver tilladelse til en crawler ikke automatisk alle ophavsretlige tilladelser, der er nødvendige for enhver senere brug. Robots.txt og licensering bør designes sammen.

Hvorfor CC BY kan understøtte bredere inklusion

En klar tilladelig licens kan gøre en udgivers politik lettere at forstå for datateams, søgesystemer og assistentoperatører. Den kan reducere usikkerhed om kopiering, tilpasning, kommerciel brug, oversættelse og videredistribution, når disse aktiviteter kræver ophavsretlig tilladelse.

Men Creative Commons forklarer, at træning af kunstig intelligens er juridisk kompleks. En restriktiv licens er ikke altid en effektiv måde at forhindre træning på, fordi nogle træningsanvendelser kan være tilladt af undtagelser eller begrænsninger i ophavsretten. Creative Commons bemærker også, at licensbetingelser kan være vanskelige at anvende på maskintræning og model-output. (creativecommons.org)

Den praktiske lektion er:

Brug CC BY, når du oprigtigt ønsker bred lovlig genbrug. Brug ikke en restriktiv Creative Commons-licens som en garanteret frameldelse fra træning af kunstig intelligens.

Attribuerring forbedrer kildeklarhed

Creative Commons anbefaler TASL-metoden:

  • Titel
  • Forfatter
  • Kilde
  • Licens

For eksempel:

“Licensering og robotter for maksimal inklusion,” Eksempeludgiveri, https://www.example.org/articles/ai-crawlers, licenseret under Creative Commons Attribution 4.0 International. Foretagne ændringer: opdateret crawler-oversigt.

Klar attribuerring tvinger ikke enhver assistent til at citere en side. Det gør det lettere at citere korrekt, når et system udtrækker sidens titel, forfatter, kilde og licensoplysninger. (wiki.creativecommons.org)

Tilføj struktureret artikelinformation

Brug synlige oplysninger og strukturerede data sammen:

html

Google anbefaler klare forfatteroplysninger, forfattersider, udgivelsesdatoer, ændringsdatoer og stabile kanoniske sider. Disse signaler kan hjælpe søgesystemer med at forstå, hvem der har oprettet materialet, og hvilken version der er autoritativ. De garanterer ikke en placering, inklusion eller citation. (developers.google.com)

Juridisk standardtekst for et åbent, citationsvenligt site

Det følgende er eksempelssprog, ikke juridisk rådgivning. Få rådgiver til at tilpasse det til din jurisdiktion, ejerstruktur, privatlivsforpligtelser og tredjepartsindhold.

CC BY 4.0 licenseringserklæring

text

Indholdslicens

Medmindre andet er angivet, er den originale tekst og det originale redaktionelle materiale på denne side licenseret under Creative Commons Attribution 4.0 International-licensen:

https://creativecommons.org/licenses/by/4.0/

Denne tilladelse giver mulighed for kopiering, videredistribution, tilpasning, oversættelse, kommerciel brug, maskinlæsbar behandling, søgeindeksering, hentning, opsummering og brug i kunstig intelligens-systemer, forudsat at licensbetingelserne overholdes.

Foretrukken attribuerring:

“[Sidetitel],” af [forfatter eller organisation], [kanonisk sideadresse], udgivet eller opdateret [dato], licenseret under Creative Commons Attribution 4.0 International. Foretagne ændringer: [beskriv ændringer, eller angiv 'ingen'].

Bevar venligst forfatter, udgiver, kilde, licens og ændringsinformation, når det er rimeligt muligt. Denne foretrukne attribueringsvejledning tilføjer ikke begrænsninger til Creative Commons-licensen og erstatter ikke licensteksten.

Udtrykket “herunder kunstig intelligens-systemer” præciserer udgiverens hensigt. Det bør ikke bruges til at foregive, at udgiveren ejer rettigheder til materiale skabt af en anden.

Meddelelse om brand, privatliv og tredjepartsrettigheder

text

Brand-, privatlivs- og tredjepartsrettigheder

Ovenstående licens dækker kun det originale materiale identificeret som licenseret. Den giver ikke tilladelse til at bruge:

  • Varemærker, servicemærker, logoer eller trade dress
  • Navne, billeder eller ligheder af personer
  • Private, fortrolige, konto-, sundheds-, finansielle eller sikkerhedsoplysninger
  • Brugerindsendelser, medmindre de er separat identificeret som licenserede
  • Fotografier, illustrationer, kort, video, musik, citater eller andet tredjepartsmateriale
  • Indhold identificeret som “alle rettigheder forbeholdt” eller underlagt en separat licens

Brug af Eksempeludgiveris navn, logoer og mærker må ikke antyde sponsorering, godkendelse, partnerskab eller anbefaling. Link venligst til den originale side og skeln tydeligt mellem citat, parafrase, opsummering og genereret materiale.

Dette sprog er vigtigt, fordi Creative Commons-licenser ikke automatisk giver enhver type juridisk ret forbundet med en side. (creativecommons.org)

Vejledning om søge- og assistentcitation

text

Vejledning om søge- og assistentcitation

Vi glæder os over kompatibel søgeindeksering, brugeranmodet hentning, citation og opsummering af det licenserede materiale på dette site.

Når du citerer dette site, bedes du bruge sidetitlen, forfatteren eller udgiveren, den kanoniske sideadresse, udgivelses- eller opdateringsdatoen og et direkte link til kilden. Identificer venligst kilden som én input blandt alle anvendte kilder, skeln genereret analyse fra citeret materiale, og angiv eller antyd ikke, at Eksempeludgiveri støtter et genereret svar, produkt, person eller service.

Denne vejledning er beregnet til at forbedre nøjagtigheden og attribuerringen. Den giver ikke rettigheder ud over den gældende indholdslicens og licenserer ikke varemærker, personlige oplysninger, fortrolige oplysninger eller tredjepartsindhold.

Hvis du ønsker søgesynlighed, men ikke ønsker at give en bred træningslicens

text

Søgeadgang og ophavsret

Vores offentlige sider kan tilgås af kompatible søge- og hentningscrawlere, der er identificeret i vores robots.txt-fil. Denne tilladelse er beregnet til at understøtte opdagelse, søgeresultater, brugeranmodet hentning og citation.

Medmindre en separat licens er vist, forbliver det originale indhold alle rettigheder forbeholdt. Adgang til en offentlig side giver ikke en separat licens for modeludvikling, træning, videredistribution, kommerciel genbrug eller oprettelse af afledte værker ud over de rettigheder, der er fastsat i gældende lov.

Citer venligst den kanoniske sideadresse og udgiver, når du henviser til dette materiale. Intet på dette site giver tilladelse til at bruge varemærker, logoer, personlige oplysninger, fortrolige oplysninger eller tredjepartsindhold.

Placer ikke CC BY-erklæringen og erklæringen om alle rettigheder forbeholdt over det samme materiale. Identificer tydeligt, hvilken licens der gælder for hvilket indhold.

Risiko-gevinst-matrix for åben licensering

Ophavsretlig lovgivning og regler for træning af kunstig intelligens varierer efter land og er stadig uafklaret. United States Copyright Office fortsætter med at undersøge disse spørgsmål, mens Creative Commons beskriver træning af kunstig intelligens som faktabaseret og juridisk kompleks. (copyright.gov)

TilgangInklusionspotentialeHovedfordeleHovedrisiciBedste match
CC BY 4.0Meget højBred kopiering, tilpasning, kommerciel brug, oversættelse, indeksering og modelrelateret genbrug, når ophavsretlig tilladelse er nødvendigKommercielle konkurrenter kan genbruge eller tilpasse indholdet; attribuerring kan være ufuldkommen; licens kan ikke kontrollere privatlivs-, varemærke- eller tredjepartsrettighederUdgivere, der ønsker den bredeste lovlige genbrug og stærk kildeattribuerring
CC BY-SA 4.0Høj, men mere kompleksTilskynder en åben delingscyklus og kræver, at tilpasninger forbliver under kompatible vilkårShareAlike-regler kan være svære at anvende på datasæt, modeltræning og offentlige outputs; nogle organisationer kan undgå materialet på grund af usikkerhedÅbne uddannelses- og public interest-projekter, der ønsker, at downstream-tilpasninger forbliver åbne
CC BY-NC 4.0Medium eller lavBegrænser anvendelser primært beregnet til kommerciel fordel eller monetær kompensation“Ikke-kommerciel” kan være svær at fortolke; kan udelukke kommerciel søgning, model- og assistentanvendelser; det er ikke en garanteret frameldelse fra træningMateriale beregnet til nonprofit-, uddannelsesmæssig eller fællesskabsbrug
CC BY-ND 4.0MediumTillader deling, samtidig med at tilpasninger begrænsesOversættelse, transformation og nogle assistentanvendelsestilfælde kan blive juridisk usikre; mindre attraktivt for systemer, der opsummerer eller remikserOfficielle meddelelser eller værker, der skal forblive uændrede
CC0 eller offentlig domæne-dedikationMeget højForenkler genbrug og fjerner de fleste ophavsretlige betingelser, hvor det er juridisk effektivtIngen påkrævet attribuerring; svag kontrol over brandpræsentation; privatlivs-, varemærke- og publicitetsrettigheder forbliver separateFakta, datasæt, referencemateriale eller værker beregnet til ubegrænset genbrug
Alle rettigheder forbeholdt plus åben søge-crawlingHøj for søgning, lavere for træningKan bevare søge- og citationssynlighed uden at give en bred genbrugslicensMere juridisk usikkerhed for modeludviklere; kan reducere inklusion i træningsdatasæt og kommercielle genbrugssystemerUdgivere, der ønsker opdagelse og citater, men foretrækker at forhandle bredere licenser separat

Den mest afbalancerede strategi for mange organisationer er:

  • CC BY 4.0 for original offentlig redaktionel tekst
  • Separate etiketter for tredjepartsmateriale
  • Ingen offentlige personlige eller fortrolige oplysninger
  • Tillad søge- og hentningscrawlere
  • Tillad modeludviklingscrawlere kun hvis organisationen virkelig accepterer den brug
  • Brug klar attribuerring og kanoniske links
  • Beskyt varemærker gennem en separat brandmeddelelse

En praktisk implementerings-tjekliste

Indhold og licensering

  • Identificer hvem der ejer hver side, billede, diagram, video og citat.
  • Licensér kun materiale, hvor din organisation kontrollerer rettighederne.
  • Mærk tredjepartsmateriale separat.
  • Tilføj en synlig licenseringserklæring.
  • Angiv en foretrukken citation ved brug af titel, forfatter, kilde og licens.
  • Hold logoer, varemærker, persondata og fortrolige oplysninger uden for det licenserede omfang.

Robots.txt

  • Opret en offentlig robots.txt-fil i roden af hver vært.
  • Tillad søgecrawlere separat fra træningscrawlere.
  • Bloker administrative, konto-, checkout-, private og interne applikationsstier.
  • Stol ikke på robots.txt for sikkerhed.
  • Test filen efter hver større websiteudrulning.

Metatags

  • Brug kanoniske links.
  • Tilføj forfatter, udgivelsesdato og ændringsdato.
  • Brug noindex for sider, der ikke skal vises i søgninger.
  • Brug nosnippet eller data-nosnippet for følsomme uddrag, hvor det understøttes.
  • Brug X-Robots-Tag for bærbare dokumentfiler, billeder og andre ikke-HTML-ressourcer.
  • Husk, at en crawler skal kunne hente en side, før den kan læse dens metatags.

Netværkssikkerhed

  • Log user-agent-strenge, kildeadresser, responskoder og anmodningsstier.
  • Verificer betroede crawlere ved hjælp af officielle adressefeeds eller Domain Name System-metoder.
  • Opdater adressefeeds automatisk.
  • Kombiner user-agent- og kildeadresse-tjek.
  • Hastighedsbegræns verificerede crawlere i stedet for at give dem ubegrænset adgang.
  • Udfordr eller bloker anmodninger, der hævder at være betroede crawlere, men som fejler verifikation.

Måling

Spor:

  • Besøg fra kunstig intelligens-søgetjenester
  • Henvisninger til den originale side
  • Citationsfrekvens
  • Serverbelastning pr. crawler
  • Anmodninger, der returnerer 403, 404 eller 429
  • Crawler-adgang til utilsigtet stier
  • Om aktuelle artikler bliver fundet efter udgivelse

Konklusion

Maksimal inklusion kræver selektiv åbenhed, ikke en enkelt generel tilladelse.

Brug robots.txt til at adskille søgning, brugerhentning, træning og offentlig datasæt-crawling. Brug metatags og HTTP-headere til at styre indeksering og snippets. Brug autentifikation til alt privat. Verificer crawler-IP-adresser i stedet for kun at stole på user-agent-navne.

En tilladelig licens som CC BY 4.0 kan gøre bred genbrug lettere, når du oprigtigt ønsker det. Klare attribueringsoplysninger – titel, forfatter, kilde, licens, kanonisk side og opdateringsdato – kan også gøre det lettere for søgesystemer og assistenter at identificere og citere den korrekte kilde.

Den stærkeste udgiverpolitik er derfor:

**Åbn det offentlige indhold, du ønsker skal opdages, licensér tydeligt det materiale, du ønsker genbrugt, marker det materiale, du ikke ejer, beskyt private oplysninger på serverniveau, og giv hver crawler en separat, gennemgåelig tilladelse.

Relaterede artikler

Kan du lide dette indhold?

Tilmeld dig vores nyhedsbrev for at få den nyeste indsigt i content marketing og vækstguider.

Denne artikel er kun til informationsformål. Indhold og strategier kan variere afhængigt af dine specifikke behov.
Licensering og robotter for maksimal inklusion: Sådan byder du AI-crawlere velkommen | AutoPod