AutoPodAutoPod

Licensiering och Robots för Maximal Inkludering: Hur Man Välkomnar AI-crawlers

22 min läsning
Ljudartikel
Licensiering och Robots för Maximal Inkludering: Hur Man Välkomnar AI-crawlers
0:000:00
Licensiering och Robots för Maximal Inkludering: Hur Man Välkomnar AI-crawlers

Licensiering och Robots för Maximal Inkludering: Hur Man Välkomnar Artificiell Intelligens-crawlers

Uppdaterad 25 augusti 2026

Webbplatser har nu mer än ett sätt att nå en publik. En sida kan hittas via Google Sök, sammanfattas av ChatGPT, citeras av Perplexity, användas i Claude-sökningar, visas via Apple-tjänster, eller samlas in av ett offentligt webbarkiv.

Dessa system använder inte alla samma crawler eller följer samma regler. En webbplats som blockerar GPTBot kan fortfarande visas i ChatGPT-sökningar om den tillåter OAI-SearchBot. En webbplats som tillåter Applebot kan förbli synlig i Apple Sök samtidigt som den blockerar Applebot-Extended från träning av artificiell intelligens-modeller. Googles Google-Extended är inte en vanlig crawler överhuvudtaget; det är en kontrolltoken för robots.txt.

Den bästa policyn är därför inte bara ”tillåt artificiell intelligens” eller ”blockera artificiell intelligens”. Det är att skapa separata behörigheter för:

  1. Sök och upptäckt
  2. Användarinitierad hämtning
  3. Modellutveckling och träning
  4. Offentliga datamängder
  5. Känsligt, privat eller begränsat material

Denna artikel ger en aktuell crawler-inventering, robots.txt-exempel, vägledning för meta-taggar, metoder för verifiering av IP-adresser, råd om Creative Commons-licensiering, juridisk standardtext och en risk-nytta-matris.

De Fyra Kontroller Varje Publicist Bör Förstå

1. robots.txt kontrollerar begärd crawling

En robots.txt-fil talar om för kompatibla automatiserade klienter vilka sidor de får begära. Den är användbar för att hantera crawler-trafik och uttrycka en publicists preferenser.

robots.txt är dock inte ett åtkomstkontrollsystem. Robot Exclusion Protocol säger att dess regler inte är åtkomstbehörigheter. Google varnar också för att en blockerad adress fortfarande kan visas i sökresultat om andra sidor länkar till den. Använd lösenord, autentisering eller serverbaserade åtkomstkontroller för konfidentiell information. (rfc-editor.org)

2. Meta-taggar kontrollerar indexering och utdrag

Robots meta-taggar och svarshuvudet X-Robots-Tag kan kontrollera om en sida indexeras eller om en sökmotor får visa ett utdrag.

Dessa kontroller är normalt endast synliga efter att en crawler har fått hämta sidan. Om robots.txt blockerar sidan först, kanske crawlern aldrig ser meta-taggen. (developers.google.com)

3. Nätverkskontroller verifierar crawlern

Ett user-agent-namn är lätt att kopiera. En angripare kan skicka en begäran och utge sig för att vara GPTBot, Googlebot eller PerplexityBot.

En starkare strategi kombinerar:

  • Den påstådda user-agenten
  • Ett publicerat IP-adressintervall
  • Omvänd Domännamnssystem-verifiering (Reverse DNS)
  • Direkt Domännamnssystem-verifiering (Forward DNS)
  • Hastighetsbegränsningar och begäranövervakning

4. En licens beviljar återanvändningsrättigheter

Robots.txt säger vad en crawler ombeds att göra. En licens säger vad människor eller organisationer lagligen får göra med material när upphovsrättsligt tillstånd krävs.

Dessa är olika verktyg. En tillåtande licens kan minska juridisk osäkerhet, men den garanterar inte att en crawler kommer att besöka sidan, att en modell kommer att använda den, eller att en assistent kommer att citera den.

Inventering av Viktiga Crawlers

Följande inventering kontrollerades mot leverantörsdokumentation tillgänglig den 25 augusti 2026. User-agent-namn, syften och IP-adressintervall kan ändras, så produktionssystem bör använda leverantörens aktuella dokumentation och live-adressflöden.

LeverantörCrawler eller robots.txt-tokenHuvudsyfteViktig kontroll
OpenAIOAI-SearchBotHittar och analyserar sidor för ChatGPT-sökningTillåt den för att förbättra chansen att sidor visas i ChatGPT-sökresultat.
OpenAIGPTBotSamlar in sidor som kan användas för att träna OpenAIs generativa AI-modellerTillåt eller neka separat från sökning.
OpenAIChatGPT-UserHämtar sidor efter att en användare bett ChatGPT eller en anpassad GPT att komma åt demDet är användarutlöst snarare än en automatisk webb-crawler, så robots.txt-regler kanske inte gäller.
OpenAIOAI-AdsBotKontrollerar webbsidor som skickats in som ChatGPT-annonsdestinationerFrämst relevant för annonsörer. Det insamlade innehållet används inte för att träna generativa AI-grundmodeller.
GoogleGooglebotGoogles huvudsök-crawlerKontrollerar vanlig Google Sök-crawling.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-NewsBilder, videor och Google NyheterDessa har separata robots.txt-token och kan kontrolleras oberoende.
GoogleGoogleOtherAllmänt Google-crawling för olika produktteam, inklusive forskning och utvecklingDen representerar inte en specifik Google-produkt.
GoogleGoogle-ExtendedKontrollerar om Google-crawlat innehåll får användas för träning av Gemini-modeller och vissa grundsystemDet är en robots.txt-kontrolltoken, inte en separat user-agent för förfrågningar. Det påverkar inte vanlig Google Sök-inkludering.
AnthropicClaudeBotSamlar in offentligt webbinnehåll som kan bidra till utvecklingen av Claude-modellenNeka den för att signalera att framtida material ska exkluderas från Anthropic-träningsdata.
AnthropicClaude-SearchBotFörbättrar kvaliteten på Claude-sökresultatTillåt den för synlighet i Claude-sökning.
AnthropicClaude-UserHämtar sidor som svar på en användares förfrågan till ClaudeSeparat från automatisk crawling.
PerplexityPerplexityBotIndexerar sidor för Perplexity-sökresultatPerplexity säger att denna crawler inte används för att samla in innehåll för träning av AI-grundmodeller.
PerplexityPerplexity-UserHämtar en sida efter att en användare har begärt denPerplexitys dokumentation säger att denna hämtare generellt ignorerar robots.txt eftersom begäran initierades av en användare.
AppleApplebotStöder Apple Sök, Spotlight, Siri, Safari och andra Apple-upplevelserTillåt den för upptäckt via Apple.
AppleApplebot-ExtendedKontrollerar om Applebot-crawlat innehåll får användas för att träna Apples grundmodellerDen crawlar inte sidor själv. Det är en kontroll för dataanvändning.
Common CrawlCCBotSamlar in offentlig webbdata för Common Crawls öppna webbarkivDet är inte en assistent, men dess datamängder kan användas av forskare och AI-utvecklare.
MicrosoftBingbotHuvudsök-crawler för BingTillåt den för Bing-upptäckt och sök-synlighet.
MicrosoftMicrosoftPreview, BingVideoPreviewSida- och videoförhandsvisningar för Microsoft-produkterDessa kan kontrolleras separat från Bingbot.
AmazonAmzn-SearchBotAmazon-sökning och innehållsupptäcktAmazon säger att de inte crawlar innehåll för träning av generativa AI-modeller.
AmazonAmzn-UserHämtar aktuell information som svar på användaråtgärder, inklusive Alexa-förfrågningarAnvändarutlöst och separat från automatisk söknings-crawling.

OpenAI dokumenterar sina sök-, tränings-, annons- och användarutlösta crawlers som separata kontroller. Deras dokumentation rekommenderar specifikt att tillåta OAI-SearchBot för ChatGPT-sökning samtidigt som GPTBot används separat för träningspreferenser. (developers.openai.com)

Google separerar på liknande sätt Googlebot, GoogleOther och Google-Extended. Google-Extended har inte sin egen HTTP-förfrågan user-agent, och att blockera den tar inte bort en sida från Google Sök. (developers.google.com)

Anthropic dokumenterar separata roller för ClaudeBot, Claude-SearchBot och Claude-User. Anthropic anger också att dess botar följer robots.txt och stöder den icke-standardiserade Crawl-delay-direktivet. (support.anthropic.com)

Perplexity skiljer mellan automatisk sök-crawling och användarinitierad hämtning. Deras nuvarande dokumentation säger att PerplexityBot respekterar robots.txt, medan Perplexity-User generellt inte gör det eftersom den svarar på en användarbegäran. (docs.perplexity.ai)

Apples nuvarande dokumentation gör samma distinktion mellan sökning och träning: Applebot stöder upptäckt, medan Applebot-Extended låter publicister kontrollera träningsanvändning utan att ta bort sidor från Apple Sök. (support.apple.com)

Rekommenderade robots.txt-konfigurationer

Placera robots.txt i roten av varje värd, till exempel:

text https://www.example.org/robots.txt

Reglerna gäller för den specifika värden, protokollet och porten där filen serveras. En separat underdomän kan behöva sin egen fil. (developers.google.com)

Konfiguration 1: Maximal inkludering

Använd detta när offentligt redaktionellt innehåll får hittas, sammanfattas, citeras, indexeras och samlas in av kompatibla crawlers.

text

Offentliga sidor är tillgängliga för kompatibla crawlers.

User-agent: * Allow: /

Håll privata, transaktionella och administrativa sökvägar utanför.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Detta tillåter namngivna crawlers, inklusive OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft och Amazon, såvida inte en annan specifik regel blockerar dem.

Placera inte en generell regel som User-agent: * Disallow: / under denna konfiguration. En senare eller mer specifik grupp kan ändra hur en crawler tolkar filen.

Konfiguration 2: Tillåt sökning men blockera modellerings-crawlers

Detta är ofta den bästa kompromissen för publicister som vill ha citat och söktrafik men inte vill signalera tillstånd för insamling till modellutveckling.

text

Blockera OpenAI-modellutvecklingscrawling.

User-agent: GPTBot Disallow: /

Blockera Anthropic-modellutvecklingscrawling.

User-agent: ClaudeBot Disallow: /

Blockera Google-modellträning och relaterad förankringsanvändning.

User-agent: Google-Extended Disallow: /

Blockera Apples användning för träning av grundmodeller.

User-agent: Applebot-Extended Disallow: /

Valfritt: blockera Common Crawl-datauppsättningsinsamling.

User-agent: CCBot

Disallow: /

Tillåt vanlig sök- och hämtningscrawling, förutom för känsliga sökvägar.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Denna konfiguration lämnar OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot och Applebot täckta av jokerteckengruppen. Den håller också sök- och träningsbehörigheter separerade.

För Apple bevarar blockering av Applebot-Extended samtidigt som Applebot tillåts upptäckt via Apple-tjänster. För Google blockerar blockering av Google-Extended inte vanlig Google Sök. (developers.google.com)

Konfiguration 3: Tillåt uttryckligen valda sök-crawlers

Om en befintlig robots.txt-fil blockerar alla crawlers, lägg till separata grupper för de sök-crawlers du vill välkomna.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Håll alla andra crawlers utanför.

User-agent: * Disallow: /

När du använder specifika grupper, upprepa reglerna för känsliga sökvägar inom varje grupp. Vissa crawlers använder den mest specifika matchande gruppen snarare än att kombinera den med jokerteckengruppen. Bing dokumenterar detta beteende direkt, och Google ger separat vägledning om crawlerspecifika grupper. (bing.com)

Viktiga begränsningar för robots.txt

  • En crawler kan ignorera robots.txt.
  • En skadlig crawler kan låtsas vara en betrodd crawler.
  • En blockerad sida kan fortfarande vara känd genom sin titel eller webbadress.
  • Robots.txt skyddar inte lösenord, privata filer, kunduppgifter eller konfidentiella API:er (Application Programming Interfaces).
  • Ett Crawl-delay-direktiv är inte en del av kärnan i Robots Exclusion Protocol och stöds inte av alla crawlers. Anthropic och Bing dokumenterar stöd, medan Apple säger att Applebot inte följer crawl-delay. (rfc-editor.org)

Meta-taggar och HTTP-huvuden

Exempel på offentlig sida

För en offentlig artikel, använd en tydlig titel, författare, kanonisk webbadress, publikationsdatum och ändringsdatum.

html

Direktivet max-snippet är primärt dokumenterat för Google. Anta inte att varje AI-crawler stöder varje meta-direktiv.

Exempel på privat eller känslig sida

html

Använd detta för sidor som inte ska visas i sökresultat. Sidan måste förbli crawlbar tillräckligt länge för att crawlern ska se direktivet. Om sidan verkligen måste förbli privat, använd autentisering eller lösenordsskydd istället. (developers.google.com)

Dölj endast känsliga avsnitt från sökutdrag

Google stöder data-nosnippet för specifika delar av en HTML-sida:

html

Detta stycke kan visas i ett sökresultat.

Personliga telefonnummer, privata e-postadresser eller interna anteckningar finns här.

Detta är användbart för kontaktuppgifter, interna anteckningar eller användargenererad information. Det är inte en universell instruktion för varje AI-system. (developers.google.com)

Använd X-Robots-Tag-huvudet för filer

Meta-taggar kan inte placeras inuti en bärbar dokumentfil, bildfil eller videofil. Använd istället ett HTTP-svarshuvud:

text X-Robots-Tag: noindex, nosnippet

För en sida som ska förbli sökbar men inte ska tillhandahålla text för utdrag eller AI-svar, använd:

text X-Robots-Tag: nosnippet

Google dokumenterar X-Robots-Tag för icke-HTML-resurser, och Apple stöder det även för Applebot. (developers.google.com)

Apple-specifika kontroller

Apple stöder:

html

Apple säger att nosnippet förhindrar att sidan används som ytterligare kontext och aktuellt innehåll när Apple-modeller genererar utdata. Sidan kan fortfarande förbli upptäckbar via Apple Sök, Spotlight, Siri och Safari. (support.apple.com)

För sidor bakom betalväggar stöder Apple även strukturerad data med hjälp av:

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Apple säger att sådana sidor kan förbli berättigade till sökresultat men kommer inte att användas som ytterligare kontext för AI-svar. (support.apple.com)

Hur Man Verifierar Crawler-IP-adresser

Varför matchning av user-agent inte räcker

En regel som denna är svag:

text if User-Agent contains "GPTBot": allow

Vem som helst kan skicka den texten. En bättre regel är:

text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block

Lita inte på ett X-Forwarded-For-huvud om det inte kommer från en proxy eller ett innehållsleveransnätverk som din organisation kontrollerar.

Leverantörsverifieringsmetoder

LeverantörRekommenderad verifieringsmetod
OpenAIAnvänd de live-IP-adressflöden som publiceras i OpenAIs crawler-dokumentation för OAI-SearchBot, GPTBot och OAI-AdsBot. Uppdatera dem automatiskt istället för att kopiera fasta intervall till en brandvägg.
GoogleAnvänd Googles publicerade crawler-intervall eller utför omvända och direkta Domännamnssystem-kontroller (DNS-kontroller). En äkta Google-crawler ska matcha ett godkänt Google-värdnamn och matcha tillbaka till den ursprungliga adressen.
AnthropicAnvänd det aktuella publicerade crawler-adressflödet som en sekundär nätverkskontroll. Anthropic primära bortvalningsmetod är fortfarande robots.txt.
PerplexityKombinera user-agenten med det aktuella PerplexityBot- eller Perplexity-User-adressflödet. Perplexity rekommenderar specifikt att kombinera båda villkoren i en regel för en webbapplikationsbrandvägg (WAF).
AppleAnvänd omvänd Domännamnssystem-verifiering (Reverse DNS) under applebot.apple.com, utför sedan en direkt uppslagning (Forward Lookup). Apple publicerar också aktuella adressintervall i ett JSON-flöde.
Common CrawlAnvänd omvänd Domännamnssystem-verifiering (Reverse DNS) under crawl.commoncrawl.org och det aktuella CCBot-adressflödet. Common Crawl noterar att omvänd verifiering ännu inte är tillgänglig för viss IPv6-trafik.
MicrosoftAnvänd det officiella verktyget Verify Bingbot eller Microsofts dokumenterade metoder för omvänd och direkt uppslagning.
AmazonAnvänd Amazons publicerade crawler-adresslistor och matcha dem med lämplig Amazon user-agent.

Google, Apple, Common Crawl, OpenAI, Anthropic och Perplexity publicerar alla leverantörsspecifika metoder eller adressflöden. Dessa listor kan ändras, så en schemalagd uppdateringsprocess är säkrare än en permanent manuellt kopierad lista. (developers.google.com)

En enkel brandväggsdesign kan se ut så här:

text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match

rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers

Tillämpa inte en bred tillåt-regel på en hel molnleverantör. En legitim crawler kan använda molninfrastruktur, men det mesta av trafiken från den molnleverantören är inte nödvändigtvis crawlern.

Hur Öppen Licensiering Påverkar Inkludering

CC BY 4.0 i klarspråk

Creative Commons Erkännande 4.0 Internationell licens, vanligen kallad CC BY 4.0, tillåter människor att:

  • Kopiera och omfördela verket
  • Bearbeta, översätta, remixa och bygga vidare på det
  • Använda det kommersiellt

Huvudvillkoren är:

  • Ge lämplig kredit
  • Länka till licensen
  • Ange om ändringar gjorts
  • Inte antyda att den ursprungliga skaparen godkänner återanvändningen
  • Inte lägga till juridiska eller tekniska begränsningar som förhindrar användning som tillåts av licensen

Creative Commons varnar också för att licensen kanske inte täcker integritetsrättigheter, rätt till publicitet, ideella rättigheter, varumärkesrättigheter, patenträttigheter eller material från tredje part. (creativecommons.org)

En licens är inte en crawler-inbjudan i sig

Att sätta ”CC BY 4.0” på en sida garanterar inte att en organisation kommer att crawla den. En crawler kan fortfarande blockeras av:

  • robots.txt
  • Ett innehållsleveransnätverk (CDN)
  • En webbapplikationsbrandvägg (WAF)
  • Hastighetsbegränsning
  • En JavaScript-utmaning
  • En inloggningsvägg
  • Ett dåligt server svar
  • En otillgänglig sitemap

Omvänt beviljar inte tillåtande av en crawler automatiskt varje upphovsrättsligt tillstånd som behövs för varje senare användning. Robots.txt och licensiering bör utformas tillsammans.

Varför CC BY kan stödja bredare inkludering

En tydlig tillåtande licens kan göra en publicists policy lättare att förstå för datateam, söksystem och assistentoperatörer. Det kan minska osäkerheten kring kopiering, bearbetning, kommersiell användning, översättning och omfördelning när dessa aktiviteter kräver upphovsrättsligt tillstånd.

Creative Commons förklarar dock att AI-träning är juridiskt komplext. En restriktiv licens är inte alltid ett effektivt sätt att förhindra träning, eftersom vissa träningsanvändningar kan vara tillåtna enligt upphovsrättens undantag eller begränsningar. Creative Commons noterar också att licensvillkor kan vara svåra att tillämpa på maskinträning och modellutdata. (creativecommons.org)

Den praktiska lärdomen är:

Använd CC BY när du verkligen vill ha bred laglig återanvändning. Använd inte en restriktiv Creative Commons-licens som en garanterad bortvalningsmöjlighet för AI-träning.

Erkännande förbättrar källans tydlighet

Creative Commons rekommenderar TASL-metoden:

  • Titel
  • Författare
  • Källa
  • Licens

Till exempel:

”Licensiering och Robots för Maximal Inkludering,” Example Publishing, https://www.example.org/articles/ai-crawlers, licensierad under Creative Commons Erkännande 4.0 Internationell. Ändringar gjorda: uppdaterad crawler-inventering.

Tydligt erkännande tvingar inte varje assistent att citera en sida. Det gör det lättare att citera korrekt när ett system extraherar sidans titel, författare, källa och licensinformation. (wiki.creativecommons.org)

Lägg till strukturerad artikelinformation

Använd synlig information och strukturerad data tillsammans:

html

Google rekommenderar tydlig författarinformation, författarsidor, publikationsdatum, ändringsdatum och stabila kanoniska sidor. Dessa signaler kan hjälpa söksystem att förstå vem som skapade materialet och vilken version som är auktoritativ. De garanterar ingen ranking, inkludering eller citering. (developers.google.com)

Juridisk Standardtext för en Öppen, Citeringsvänlig Webbplats

Följande är exempel på formuleringar, inte juridisk rådgivning. Låt juridisk expertis anpassa den till din jurisdiktion, ägarstruktur, integritetsåtaganden och innehåll från tredje part.

CC BY 4.0 licensieringsuttalande

text

Innehållslicens

Förutom där annat anges, är den ursprungliga texten och det ursprungliga redaktionella materialet på denna sida licensierat under Creative Commons Erkännande 4.0 Internationell licens:

https://creativecommons.org/licenses/by/4.0/

Detta tillstånd tillåter kopiering, omfördelning, anpassning, översättning, kommersiell användning, maskinläsbar bearbetning, sökindexering, hämtning, sammanfattning och användning i artificiell intelligens-system, förutsatt att licensvillkoren följs.

Föredragen attribuering:

”[Sidtitel],” av [författare eller organisation], [kanonisk sidadress], publicerad eller uppdaterad [datum], licensierad under Creative Commons Erkännande 4.0 Internationell. Ändringar gjorda: [beskriv ändringar, eller ange ’inga’].

Vänligen bevara författar-, publicist-, käll-, licens- och modifieringsinformation närhelst det är rimligt möjligt. Denna föredragna attributionsguide lägger inte till begränsningar till Creative Commons-licensen och ersätter inte licenstexten.

Frasen ”inklusive artificiell intelligens-system” klargör publicistens avsikt. Den ska inte användas för att låtsas att publicisten äger rättigheter till material skapat av någon annan.

Meddelande om varumärke, integritet och tredjepartsrättigheter

text

Varumärke, integritet och tredjepartsrättigheter

Ovanstående licens täcker endast det ursprungliga materialet som identifierats som licensierat. Den beviljar inte tillstånd att använda:

  • Varumärken, servicemärken, logotyper eller produktdesign (trade dress)
  • Namn, bilder eller likheter av personer
  • Privat, konfidentiell information, konto-, hälso-, finansiell information eller säkerhetsinformation
  • Användarinlägg om de inte separat identifieras som licensierade
  • Fotografier, illustrationer, kartor, video, musik, citat eller annat tredjepartsmaterial
  • Innehåll identifierat som ”alla rättigheter förbehållna” eller föremål för en separat licens

Användning av namnet Example Publishing, logotyper och märken får inte antyda sponsring, godkännande, partnerskap eller stöd. Vänligen länka till den ursprungliga sidan och särskilj tydligt citat, parafrasering, sammanfattning och genererat material.

Denna formulering är viktig eftersom Creative Commons-licenser inte automatiskt beviljar alla typer av lagliga rättigheter kopplade till en sida. (creativecommons.org)

Vägledning för citering i sök och assistenter

text

Vägledning för citering i sök och assistenter

Vi välkomnar kompatibel sökindexering, användarinitierad hämtning, citering och sammanfattning av det licensierade materialet på denna webbplats.

När du citerar denna webbplats, vänligen använd sidans titel, författare eller utgivare, kanonisk sidadress, publicerings- eller uppdateringsdatum och en direktlänk till källan. Vänligen identifiera källan som en input bland alla använda källor, särskilj genererad analys från citerat material, och uppge eller antyd inte att Example Publishing godkänner ett genererat svar, produkt, person eller tjänst.

Denna vägledning är avsedd att förbättra noggrannhet och attribuering. Den beviljar inte rättigheter utöver den tillämpliga innehållslicensen och licensierar inte varumärken, personlig information, konfidentiell information eller tredjepartsmaterial.

Om du vill ha sökbarhet men inte vill bevilja en bred träningslicens

text

Sökåtkomst och upphovsrätt

Våra offentliga sidor får nås av kompatibla sök- och hämtnings-crawlers som identifieras i vår robots.txt-fil. Detta tillstånd är avsett att stödja upptäckt, sökresultat, användarinitierad hämtning och citering.

Förutom där en separat licens visas, förblir det ursprungliga innehållet ”alla rättigheter förbehållna”. Åtkomst till en offentlig sida beviljar inte en separat licens för modellutveckling, träning, omfördelning, kommersiell återanvändning eller skapande av derivata verk utöver rättigheter som tillhandahålls av tillämplig lag.

Vänligen citera den kanoniska sidadressen och utgivaren när du refererar till detta material. Inget på denna webbplats beviljar tillstånd att använda varumärken, logotyper, personlig information, konfidentiell information eller tredjepartsinnehåll.

Placera inte CC BY-uttalandet och uttalandet ”alla rättigheter förbehållna” över samma material. Identifiera tydligt vilken licens som gäller för vilket innehåll.

Risk-Nytta-Matris för Öppen Licensiering

Upphovsrättslagar och regler för AI-träning skiljer sig åt mellan länder och är fortfarande osäkra. United States Copyright Office fortsätter att undersöka dessa frågor, medan Creative Commons beskriver AI-träning som faktabaserad och juridiskt komplex. (copyright.gov)

TillvägagångssättInkluderingspotentialHuvudfördelarHuvudriskerBästa passform
CC BY 4.0Mycket högBred kopiering, anpassning, kommersiell användning, översättning, indexering och modellrelaterad återanvändning när upphovsrättsligt tillstånd behövsKommersiella konkurrenter kan återanvända eller anpassa innehållet; attribueringen kan vara ofullständig; licensen kan inte kontrollera integritets-, varumärkes- eller tredjepartsrättigheterPublicister som vill ha den bredaste lagliga återanvändningen och stark källattribuering
CC BY-SA 4.0Hög, men mer komplexUppmuntra en öppen delningscykel och kräver att anpassningar förblir under kompatibla villkorShareAlike-regler kan vara svåra att tillämpa på datamängder, modellträning och offentliga utdata; vissa organisationer kan undvika materialet på grund av osäkerhetÖppna utbildnings- och allmännyttiga projekt som vill att efterföljande anpassningar förblir öppna
CC BY-NC 4.0Medel eller lågBegränsar användningar som primärt är avsedda för kommersiell fördel eller monetär ersättning”Icke-kommersiell” kan vara svårt att tolka; kan exkludera kommersiell sökning, modell- och assistent-användning; det är ingen garanterad bortval för träningMaterial avsett för ideellt, pedagogiskt eller samhällsnyttigt bruk
CC BY-ND 4.0MedelTillåter delning samtidigt som anpassningar begränsasÖversättning, transformation och vissa assistent-användningsfall kan bli juridiskt osäkra; mindre attraktivt för system som sammanfattar eller remixarOfficiella meddelanden eller verk som måste förbli oförändrade
CC0 eller dedikation till allmän egendomMycket högFörenklar återanvändning och tar bort de flesta upphovsrättsliga villkor där det är juridiskt effektivtIngen obligatorisk attribuering; svag kontroll över varumärkespresentation; integritets-, varumärkes- och publiceringsrättigheter förblir separataFakta, datamängder, referensmaterial eller verk avsedda för obegränsad återanvändning
Alla rättigheter förbehållna plus öppen sökmotorcrawlingHög för sök, lägre för träningKan bevara sök- och citeringssynlighet utan att bevilja en bred återanvändningslicensMer juridisk osäkerhet för modellutvecklare; kan minska inkluderingen i träningsdatamängder och kommersiella återanvändningssystemPublicister som vill ha upptäckt och citeringar men föredrar att förhandla om bredare licenser separat

Den mest balanserade strategin för många organisationer är:

  • CC BY 4.0 för original offentlig redaktionell text
  • Separata etiketter för tredjepartsmaterial
  • Ingen offentlig personlig eller konfidentiell information
  • Tillåt sök- och hämtnings-crawlers
  • Tillåt modellerings-crawlers endast om organisationen verkligen accepterar den användningen
  • Använd tydlig attribuering och kanoniska länkar
  • Skydda varumärken genom ett separat varumärkesmeddelande

En Praktisk Checklista för Implementering

Innehåll och licensiering

  • Identifiera vem som äger varje sida, bild, diagram, video och citat.
  • Licensiera endast material för vilket din organisation kontrollerar rättigheterna.
  • Markera tredjepartsmaterial separat.
  • Lägg till ett synligt licensuttalande.
  • Tillhandahåll en föredragen citering med titel, författare, källa och licens.
  • Håll logotyper, varumärken, personuppgifter och konfidentiell information utanför det licensierade omfånget.

Robots.txt

  • Skapa en offentlig robots.txt-fil i roten av varje värd.
  • Tillåt sök-crawlers separat från tränings-crawlers.
  • Blockera administrativa, konto-, kassa-, privata och interna applikationsvägar.
  • Förlita dig inte på robots.txt för säkerhet.
  • Testa filen efter varje större webbplatsutveckling.

Meta-taggar

  • Använd kanoniska länkar.
  • Lägg till författare, publikationsdatum och ändringsdatum.
  • Använd noindex för sidor som inte ska visas i sökningen.
  • Använd nosnippet eller data-nosnippet för känsliga utdrag där det stöds.
  • Använd X-Robots-Tag för bärbara dokumentfiler, bilder och andra icke-HTML-resurser.
  • Kom ihåg att en crawler måste kunna hämta en sida innan den kan läsa dess meta-taggar.

Nätverkssäkerhet

  • Logga user-agent-strängar, källadresser, svarskoder och förfrågningsvägar.
  • Verifiera betrodda crawlers med hjälp av officiella adressflöden eller Domännamnssystem-metoder.
  • Uppdatera adressflöden automatiskt.
  • Kombinera user-agent- och källadresskontroller.
  • Hastighetsbegränsa verifierade crawlers istället för att ge dem obegränsad åtkomst.
  • Utmana eller blockera förfrågningar som utger sig för att vara betrodda crawlers men misslyckas med verifieringen.

Mätning

Spåra:

  • Besök från AI-söktjänster
  • Hänvisningar till den ursprungliga sidan
  • Citeringsfrekvens
  • Serverbelastning per crawler
  • Förfrågningar som returnerar 403, 404 eller 429
  • Crawler-åtkomst till oavsedda sökvägar
  • Om aktuella artiklar hittas efter publicering

Slutsats

Maximal inkludering kräver selektiv öppenhet, inte ett enda generellt tillstånd.

Använd robots.txt för att separera sökning, användarhämntning, träning och offentlig datamängdscrawling. Använd meta-taggar och HTTP-huvuden för att hantera indexering och utdrag. Använd autentisering för allt privat. Verifiera crawler-IP-adresser snarare än att bara lita på user-agent-namn.

En tillåtande licens som CC BY 4.0 kan göra bred återanvändning enklare när du verkligen vill det. Tydlig attributionsinformation – titel, författare, källa, licens, kanonisk sida och uppdateringsdatum – kan också göra det lättare för söksystem och assistenter att identifiera och citera rätt källa.

Den starkaste publiceringspolicyn är därför:

**Öppna det offentliga innehåll du vill ska upptäckas, licensiera tydligt det material du vill ska återanvändas, märk material du inte äger, skydda privat information på servernivå, och ge varje crawler ett separat, granskningsbart tillstånd.

Relaterade artiklar

Gillar du detta innehåll?

Prenumerera på vårt nyhetsbrev för de senaste insikterna om innehållsmarknadsföring och tillväxtguider.

Denna artikel är endast i informationssyfte. Innehåll och strategier kan variera beroende på dina specifika behov.
Licensiering och Robots för Maximal Inkludering: Hur Man Välkomnar AI-crawlers | AutoPod