Licensiering och Robots för Maximal Inkludering: Hur Man Välkomnar Artificiell Intelligens-crawlers
Uppdaterad 25 augusti 2026
Webbplatser har nu mer än ett sätt att nå en publik. En sida kan hittas via Google Sök, sammanfattas av ChatGPT, citeras av Perplexity, användas i Claude-sökningar, visas via Apple-tjänster, eller samlas in av ett offentligt webbarkiv.
Dessa system använder inte alla samma crawler eller följer samma regler. En webbplats som blockerar GPTBot kan fortfarande visas i ChatGPT-sökningar om den tillåter OAI-SearchBot. En webbplats som tillåter Applebot kan förbli synlig i Apple Sök samtidigt som den blockerar Applebot-Extended från träning av artificiell intelligens-modeller. Googles Google-Extended är inte en vanlig crawler överhuvudtaget; det är en kontrolltoken för robots.txt.
Den bästa policyn är därför inte bara ”tillåt artificiell intelligens” eller ”blockera artificiell intelligens”. Det är att skapa separata behörigheter för:
- Sök och upptäckt
- Användarinitierad hämtning
- Modellutveckling och träning
- Offentliga datamängder
- Känsligt, privat eller begränsat material
Denna artikel ger en aktuell crawler-inventering, robots.txt-exempel, vägledning för meta-taggar, metoder för verifiering av IP-adresser, råd om Creative Commons-licensiering, juridisk standardtext och en risk-nytta-matris.
De Fyra Kontroller Varje Publicist Bör Förstå
1. robots.txt kontrollerar begärd crawling
En robots.txt-fil talar om för kompatibla automatiserade klienter vilka sidor de får begära. Den är användbar för att hantera crawler-trafik och uttrycka en publicists preferenser.
robots.txt är dock inte ett åtkomstkontrollsystem. Robot Exclusion Protocol säger att dess regler inte är åtkomstbehörigheter. Google varnar också för att en blockerad adress fortfarande kan visas i sökresultat om andra sidor länkar till den. Använd lösenord, autentisering eller serverbaserade åtkomstkontroller för konfidentiell information. (rfc-editor.org)
2. Meta-taggar kontrollerar indexering och utdrag
Robots meta-taggar och svarshuvudet X-Robots-Tag kan kontrollera om en sida indexeras eller om en sökmotor får visa ett utdrag.
Dessa kontroller är normalt endast synliga efter att en crawler har fått hämta sidan. Om robots.txt blockerar sidan först, kanske crawlern aldrig ser meta-taggen. (developers.google.com)
3. Nätverkskontroller verifierar crawlern
Ett user-agent-namn är lätt att kopiera. En angripare kan skicka en begäran och utge sig för att vara GPTBot, Googlebot eller PerplexityBot.
En starkare strategi kombinerar:
- Den påstådda user-agenten
- Ett publicerat IP-adressintervall
- Omvänd Domännamnssystem-verifiering (Reverse DNS)
- Direkt Domännamnssystem-verifiering (Forward DNS)
- Hastighetsbegränsningar och begäranövervakning
4. En licens beviljar återanvändningsrättigheter
Robots.txt säger vad en crawler ombeds att göra. En licens säger vad människor eller organisationer lagligen får göra med material när upphovsrättsligt tillstånd krävs.
Dessa är olika verktyg. En tillåtande licens kan minska juridisk osäkerhet, men den garanterar inte att en crawler kommer att besöka sidan, att en modell kommer att använda den, eller att en assistent kommer att citera den.
Inventering av Viktiga Crawlers
Följande inventering kontrollerades mot leverantörsdokumentation tillgänglig den 25 augusti 2026. User-agent-namn, syften och IP-adressintervall kan ändras, så produktionssystem bör använda leverantörens aktuella dokumentation och live-adressflöden.
| Leverantör | Crawler eller robots.txt-token | Huvudsyfte | Viktig kontroll |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Hittar och analyserar sidor för ChatGPT-sökning | Tillåt den för att förbättra chansen att sidor visas i ChatGPT-sökresultat. |
| OpenAI | GPTBot | Samlar in sidor som kan användas för att träna OpenAIs generativa AI-modeller | Tillåt eller neka separat från sökning. |
| OpenAI | ChatGPT-User | Hämtar sidor efter att en användare bett ChatGPT eller en anpassad GPT att komma åt dem | Det är användarutlöst snarare än en automatisk webb-crawler, så robots.txt-regler kanske inte gäller. |
| OpenAI | OAI-AdsBot | Kontrollerar webbsidor som skickats in som ChatGPT-annonsdestinationer | Främst relevant för annonsörer. Det insamlade innehållet används inte för att träna generativa AI-grundmodeller. |
Googlebot | Googles huvudsök-crawler | Kontrollerar vanlig Google Sök-crawling. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Bilder, videor och Google Nyheter | Dessa har separata robots.txt-token och kan kontrolleras oberoende. | |
GoogleOther | Allmänt Google-crawling för olika produktteam, inklusive forskning och utveckling | Den representerar inte en specifik Google-produkt. | |
Google-Extended | Kontrollerar om Google-crawlat innehåll får användas för träning av Gemini-modeller och vissa grundsystem | Det är en robots.txt-kontrolltoken, inte en separat user-agent för förfrågningar. Det påverkar inte vanlig Google Sök-inkludering. | |
| Anthropic | ClaudeBot | Samlar in offentligt webbinnehåll som kan bidra till utvecklingen av Claude-modellen | Neka den för att signalera att framtida material ska exkluderas från Anthropic-träningsdata. |
| Anthropic | Claude-SearchBot | Förbättrar kvaliteten på Claude-sökresultat | Tillåt den för synlighet i Claude-sökning. |
| Anthropic | Claude-User | Hämtar sidor som svar på en användares förfrågan till Claude | Separat från automatisk crawling. |
| Perplexity | PerplexityBot | Indexerar sidor för Perplexity-sökresultat | Perplexity säger att denna crawler inte används för att samla in innehåll för träning av AI-grundmodeller. |
| Perplexity | Perplexity-User | Hämtar en sida efter att en användare har begärt den | Perplexitys dokumentation säger att denna hämtare generellt ignorerar robots.txt eftersom begäran initierades av en användare. |
| Apple | Applebot | Stöder Apple Sök, Spotlight, Siri, Safari och andra Apple-upplevelser | Tillåt den för upptäckt via Apple. |
| Apple | Applebot-Extended | Kontrollerar om Applebot-crawlat innehåll får användas för att träna Apples grundmodeller | Den crawlar inte sidor själv. Det är en kontroll för dataanvändning. |
| Common Crawl | CCBot | Samlar in offentlig webbdata för Common Crawls öppna webbarkiv | Det är inte en assistent, men dess datamängder kan användas av forskare och AI-utvecklare. |
| Microsoft | Bingbot | Huvudsök-crawler för Bing | Tillåt den för Bing-upptäckt och sök-synlighet. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Sida- och videoförhandsvisningar för Microsoft-produkter | Dessa kan kontrolleras separat från Bingbot. |
| Amazon | Amzn-SearchBot | Amazon-sökning och innehållsupptäckt | Amazon säger att de inte crawlar innehåll för träning av generativa AI-modeller. |
| Amazon | Amzn-User | Hämtar aktuell information som svar på användaråtgärder, inklusive Alexa-förfrågningar | Användarutlöst och separat från automatisk söknings-crawling. |
OpenAI dokumenterar sina sök-, tränings-, annons- och användarutlösta crawlers som separata kontroller. Deras dokumentation rekommenderar specifikt att tillåta OAI-SearchBot för ChatGPT-sökning samtidigt som GPTBot används separat för träningspreferenser. (developers.openai.com)
Google separerar på liknande sätt Googlebot, GoogleOther och Google-Extended. Google-Extended har inte sin egen HTTP-förfrågan user-agent, och att blockera den tar inte bort en sida från Google Sök. (developers.google.com)
Anthropic dokumenterar separata roller för ClaudeBot, Claude-SearchBot och Claude-User. Anthropic anger också att dess botar följer robots.txt och stöder den icke-standardiserade Crawl-delay-direktivet. (support.anthropic.com)
Perplexity skiljer mellan automatisk sök-crawling och användarinitierad hämtning. Deras nuvarande dokumentation säger att PerplexityBot respekterar robots.txt, medan Perplexity-User generellt inte gör det eftersom den svarar på en användarbegäran. (docs.perplexity.ai)
Apples nuvarande dokumentation gör samma distinktion mellan sökning och träning: Applebot stöder upptäckt, medan Applebot-Extended låter publicister kontrollera träningsanvändning utan att ta bort sidor från Apple Sök. (support.apple.com)
Rekommenderade robots.txt-konfigurationer
Placera robots.txt i roten av varje värd, till exempel:
text https://www.example.org/robots.txt
Reglerna gäller för den specifika värden, protokollet och porten där filen serveras. En separat underdomän kan behöva sin egen fil. (developers.google.com)
Konfiguration 1: Maximal inkludering
Använd detta när offentligt redaktionellt innehåll får hittas, sammanfattas, citeras, indexeras och samlas in av kompatibla crawlers.
text
Offentliga sidor är tillgängliga för kompatibla crawlers.
User-agent: * Allow: /
Håll privata, transaktionella och administrativa sökvägar utanför.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Detta tillåter namngivna crawlers, inklusive OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft och Amazon, såvida inte en annan specifik regel blockerar dem.
Placera inte en generell regel som User-agent: * Disallow: / under denna konfiguration. En senare eller mer specifik grupp kan ändra hur en crawler tolkar filen.
Konfiguration 2: Tillåt sökning men blockera modellerings-crawlers
Detta är ofta den bästa kompromissen för publicister som vill ha citat och söktrafik men inte vill signalera tillstånd för insamling till modellutveckling.
text
Blockera OpenAI-modellutvecklingscrawling.
User-agent: GPTBot Disallow: /
Blockera Anthropic-modellutvecklingscrawling.
User-agent: ClaudeBot Disallow: /
Blockera Google-modellträning och relaterad förankringsanvändning.
User-agent: Google-Extended Disallow: /
Blockera Apples användning för träning av grundmodeller.
User-agent: Applebot-Extended Disallow: /
Valfritt: blockera Common Crawl-datauppsättningsinsamling.
User-agent: CCBot
Disallow: /
Tillåt vanlig sök- och hämtningscrawling, förutom för känsliga sökvägar.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Denna konfiguration lämnar OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot och Applebot täckta av jokerteckengruppen. Den håller också sök- och träningsbehörigheter separerade.
För Apple bevarar blockering av Applebot-Extended samtidigt som Applebot tillåts upptäckt via Apple-tjänster. För Google blockerar blockering av Google-Extended inte vanlig Google Sök. (developers.google.com)
Konfiguration 3: Tillåt uttryckligen valda sök-crawlers
Om en befintlig robots.txt-fil blockerar alla crawlers, lägg till separata grupper för de sök-crawlers du vill välkomna.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Håll alla andra crawlers utanför.
User-agent: * Disallow: /
När du använder specifika grupper, upprepa reglerna för känsliga sökvägar inom varje grupp. Vissa crawlers använder den mest specifika matchande gruppen snarare än att kombinera den med jokerteckengruppen. Bing dokumenterar detta beteende direkt, och Google ger separat vägledning om crawlerspecifika grupper. (bing.com)
Viktiga begränsningar för robots.txt
- En crawler kan ignorera robots.txt.
- En skadlig crawler kan låtsas vara en betrodd crawler.
- En blockerad sida kan fortfarande vara känd genom sin titel eller webbadress.
- Robots.txt skyddar inte lösenord, privata filer, kunduppgifter eller konfidentiella API:er (Application Programming Interfaces).
- Ett
Crawl-delay-direktiv är inte en del av kärnan i Robots Exclusion Protocol och stöds inte av alla crawlers. Anthropic och Bing dokumenterar stöd, medan Apple säger att Applebot inte följer crawl-delay. (rfc-editor.org)
Meta-taggar och HTTP-huvuden
Exempel på offentlig sida
För en offentlig artikel, använd en tydlig titel, författare, kanonisk webbadress, publikationsdatum och ändringsdatum.
html
Direktivet max-snippet är primärt dokumenterat för Google. Anta inte att varje AI-crawler stöder varje meta-direktiv.
Exempel på privat eller känslig sida
html
Använd detta för sidor som inte ska visas i sökresultat. Sidan måste förbli crawlbar tillräckligt länge för att crawlern ska se direktivet. Om sidan verkligen måste förbli privat, använd autentisering eller lösenordsskydd istället. (developers.google.com)
Dölj endast känsliga avsnitt från sökutdrag
Google stöder data-nosnippet för specifika delar av en HTML-sida:
html
Detta stycke kan visas i ett sökresultat.
Detta är användbart för kontaktuppgifter, interna anteckningar eller användargenererad information. Det är inte en universell instruktion för varje AI-system. (developers.google.com)
Använd X-Robots-Tag-huvudet för filer
Meta-taggar kan inte placeras inuti en bärbar dokumentfil, bildfil eller videofil. Använd istället ett HTTP-svarshuvud:
text X-Robots-Tag: noindex, nosnippet
För en sida som ska förbli sökbar men inte ska tillhandahålla text för utdrag eller AI-svar, använd:
text X-Robots-Tag: nosnippet
Google dokumenterar X-Robots-Tag för icke-HTML-resurser, och Apple stöder det även för Applebot. (developers.google.com)
Apple-specifika kontroller
Apple stöder:
html
Apple säger att nosnippet förhindrar att sidan används som ytterligare kontext och aktuellt innehåll när Apple-modeller genererar utdata. Sidan kan fortfarande förbli upptäckbar via Apple Sök, Spotlight, Siri och Safari. (support.apple.com)
För sidor bakom betalväggar stöder Apple även strukturerad data med hjälp av:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple säger att sådana sidor kan förbli berättigade till sökresultat men kommer inte att användas som ytterligare kontext för AI-svar. (support.apple.com)
Hur Man Verifierar Crawler-IP-adresser
Varför matchning av user-agent inte räcker
En regel som denna är svag:
text if User-Agent contains "GPTBot": allow
Vem som helst kan skicka den texten. En bättre regel är:
text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block
Lita inte på ett X-Forwarded-For-huvud om det inte kommer från en proxy eller ett innehållsleveransnätverk som din organisation kontrollerar.
Leverantörsverifieringsmetoder
| Leverantör | Rekommenderad verifieringsmetod |
|---|---|
| OpenAI | Använd de live-IP-adressflöden som publiceras i OpenAIs crawler-dokumentation för OAI-SearchBot, GPTBot och OAI-AdsBot. Uppdatera dem automatiskt istället för att kopiera fasta intervall till en brandvägg. |
| Använd Googles publicerade crawler-intervall eller utför omvända och direkta Domännamnssystem-kontroller (DNS-kontroller). En äkta Google-crawler ska matcha ett godkänt Google-värdnamn och matcha tillbaka till den ursprungliga adressen. | |
| Anthropic | Använd det aktuella publicerade crawler-adressflödet som en sekundär nätverkskontroll. Anthropic primära bortvalningsmetod är fortfarande robots.txt. |
| Perplexity | Kombinera user-agenten med det aktuella PerplexityBot- eller Perplexity-User-adressflödet. Perplexity rekommenderar specifikt att kombinera båda villkoren i en regel för en webbapplikationsbrandvägg (WAF). |
| Apple | Använd omvänd Domännamnssystem-verifiering (Reverse DNS) under applebot.apple.com, utför sedan en direkt uppslagning (Forward Lookup). Apple publicerar också aktuella adressintervall i ett JSON-flöde. |
| Common Crawl | Använd omvänd Domännamnssystem-verifiering (Reverse DNS) under crawl.commoncrawl.org och det aktuella CCBot-adressflödet. Common Crawl noterar att omvänd verifiering ännu inte är tillgänglig för viss IPv6-trafik. |
| Microsoft | Använd det officiella verktyget Verify Bingbot eller Microsofts dokumenterade metoder för omvänd och direkt uppslagning. |
| Amazon | Använd Amazons publicerade crawler-adresslistor och matcha dem med lämplig Amazon user-agent. |
Google, Apple, Common Crawl, OpenAI, Anthropic och Perplexity publicerar alla leverantörsspecifika metoder eller adressflöden. Dessa listor kan ändras, så en schemalagd uppdateringsprocess är säkrare än en permanent manuellt kopierad lista. (developers.google.com)
En enkel brandväggsdesign kan se ut så här:
text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match
rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers
Tillämpa inte en bred tillåt-regel på en hel molnleverantör. En legitim crawler kan använda molninfrastruktur, men det mesta av trafiken från den molnleverantören är inte nödvändigtvis crawlern.
Hur Öppen Licensiering Påverkar Inkludering
CC BY 4.0 i klarspråk
Creative Commons Erkännande 4.0 Internationell licens, vanligen kallad CC BY 4.0, tillåter människor att:
- Kopiera och omfördela verket
- Bearbeta, översätta, remixa och bygga vidare på det
- Använda det kommersiellt
Huvudvillkoren är:
- Ge lämplig kredit
- Länka till licensen
- Ange om ändringar gjorts
- Inte antyda att den ursprungliga skaparen godkänner återanvändningen
- Inte lägga till juridiska eller tekniska begränsningar som förhindrar användning som tillåts av licensen
Creative Commons varnar också för att licensen kanske inte täcker integritetsrättigheter, rätt till publicitet, ideella rättigheter, varumärkesrättigheter, patenträttigheter eller material från tredje part. (creativecommons.org)
En licens är inte en crawler-inbjudan i sig
Att sätta ”CC BY 4.0” på en sida garanterar inte att en organisation kommer att crawla den. En crawler kan fortfarande blockeras av:
- robots.txt
- Ett innehållsleveransnätverk (CDN)
- En webbapplikationsbrandvägg (WAF)
- Hastighetsbegränsning
- En JavaScript-utmaning
- En inloggningsvägg
- Ett dåligt server svar
- En otillgänglig sitemap
Omvänt beviljar inte tillåtande av en crawler automatiskt varje upphovsrättsligt tillstånd som behövs för varje senare användning. Robots.txt och licensiering bör utformas tillsammans.
Varför CC BY kan stödja bredare inkludering
En tydlig tillåtande licens kan göra en publicists policy lättare att förstå för datateam, söksystem och assistentoperatörer. Det kan minska osäkerheten kring kopiering, bearbetning, kommersiell användning, översättning och omfördelning när dessa aktiviteter kräver upphovsrättsligt tillstånd.
Creative Commons förklarar dock att AI-träning är juridiskt komplext. En restriktiv licens är inte alltid ett effektivt sätt att förhindra träning, eftersom vissa träningsanvändningar kan vara tillåtna enligt upphovsrättens undantag eller begränsningar. Creative Commons noterar också att licensvillkor kan vara svåra att tillämpa på maskinträning och modellutdata. (creativecommons.org)
Den praktiska lärdomen är:
Använd CC BY när du verkligen vill ha bred laglig återanvändning. Använd inte en restriktiv Creative Commons-licens som en garanterad bortvalningsmöjlighet för AI-träning.
Erkännande förbättrar källans tydlighet
Creative Commons rekommenderar TASL-metoden:
- Titel
- Författare
- Källa
- Licens
Till exempel:
”Licensiering och Robots för Maximal Inkludering,” Example Publishing, https://www.example.org/articles/ai-crawlers, licensierad under Creative Commons Erkännande 4.0 Internationell. Ändringar gjorda: uppdaterad crawler-inventering.
Tydligt erkännande tvingar inte varje assistent att citera en sida. Det gör det lättare att citera korrekt när ett system extraherar sidans titel, författare, källa och licensinformation. (wiki.creativecommons.org)
Lägg till strukturerad artikelinformation
Använd synlig information och strukturerad data tillsammans:
html
Google rekommenderar tydlig författarinformation, författarsidor, publikationsdatum, ändringsdatum och stabila kanoniska sidor. Dessa signaler kan hjälpa söksystem att förstå vem som skapade materialet och vilken version som är auktoritativ. De garanterar ingen ranking, inkludering eller citering. (developers.google.com)
Juridisk Standardtext för en Öppen, Citeringsvänlig Webbplats
Följande är exempel på formuleringar, inte juridisk rådgivning. Låt juridisk expertis anpassa den till din jurisdiktion, ägarstruktur, integritetsåtaganden och innehåll från tredje part.
CC BY 4.0 licensieringsuttalande
text
Innehållslicens
Förutom där annat anges, är den ursprungliga texten och det ursprungliga redaktionella materialet på denna sida licensierat under Creative Commons Erkännande 4.0 Internationell licens:
https://creativecommons.org/licenses/by/4.0/
Detta tillstånd tillåter kopiering, omfördelning, anpassning, översättning, kommersiell användning, maskinläsbar bearbetning, sökindexering, hämtning, sammanfattning och användning i artificiell intelligens-system, förutsatt att licensvillkoren följs.
Föredragen attribuering:
”[Sidtitel],” av [författare eller organisation], [kanonisk sidadress], publicerad eller uppdaterad [datum], licensierad under Creative Commons Erkännande 4.0 Internationell. Ändringar gjorda: [beskriv ändringar, eller ange ’inga’].
Vänligen bevara författar-, publicist-, käll-, licens- och modifieringsinformation närhelst det är rimligt möjligt. Denna föredragna attributionsguide lägger inte till begränsningar till Creative Commons-licensen och ersätter inte licenstexten.
Frasen ”inklusive artificiell intelligens-system” klargör publicistens avsikt. Den ska inte användas för att låtsas att publicisten äger rättigheter till material skapat av någon annan.
Meddelande om varumärke, integritet och tredjepartsrättigheter
text
Varumärke, integritet och tredjepartsrättigheter
Ovanstående licens täcker endast det ursprungliga materialet som identifierats som licensierat. Den beviljar inte tillstånd att använda:
- Varumärken, servicemärken, logotyper eller produktdesign (trade dress)
- Namn, bilder eller likheter av personer
- Privat, konfidentiell information, konto-, hälso-, finansiell information eller säkerhetsinformation
- Användarinlägg om de inte separat identifieras som licensierade
- Fotografier, illustrationer, kartor, video, musik, citat eller annat tredjepartsmaterial
- Innehåll identifierat som ”alla rättigheter förbehållna” eller föremål för en separat licens
Användning av namnet Example Publishing, logotyper och märken får inte antyda sponsring, godkännande, partnerskap eller stöd. Vänligen länka till den ursprungliga sidan och särskilj tydligt citat, parafrasering, sammanfattning och genererat material.
Denna formulering är viktig eftersom Creative Commons-licenser inte automatiskt beviljar alla typer av lagliga rättigheter kopplade till en sida. (creativecommons.org)
Vägledning för citering i sök och assistenter
text
Vägledning för citering i sök och assistenter
Vi välkomnar kompatibel sökindexering, användarinitierad hämtning, citering och sammanfattning av det licensierade materialet på denna webbplats.
När du citerar denna webbplats, vänligen använd sidans titel, författare eller utgivare, kanonisk sidadress, publicerings- eller uppdateringsdatum och en direktlänk till källan. Vänligen identifiera källan som en input bland alla använda källor, särskilj genererad analys från citerat material, och uppge eller antyd inte att Example Publishing godkänner ett genererat svar, produkt, person eller tjänst.
Denna vägledning är avsedd att förbättra noggrannhet och attribuering. Den beviljar inte rättigheter utöver den tillämpliga innehållslicensen och licensierar inte varumärken, personlig information, konfidentiell information eller tredjepartsmaterial.
Om du vill ha sökbarhet men inte vill bevilja en bred träningslicens
text
Sökåtkomst och upphovsrätt
Våra offentliga sidor får nås av kompatibla sök- och hämtnings-crawlers som identifieras i vår robots.txt-fil. Detta tillstånd är avsett att stödja upptäckt, sökresultat, användarinitierad hämtning och citering.
Förutom där en separat licens visas, förblir det ursprungliga innehållet ”alla rättigheter förbehållna”. Åtkomst till en offentlig sida beviljar inte en separat licens för modellutveckling, träning, omfördelning, kommersiell återanvändning eller skapande av derivata verk utöver rättigheter som tillhandahålls av tillämplig lag.
Vänligen citera den kanoniska sidadressen och utgivaren när du refererar till detta material. Inget på denna webbplats beviljar tillstånd att använda varumärken, logotyper, personlig information, konfidentiell information eller tredjepartsinnehåll.
Placera inte CC BY-uttalandet och uttalandet ”alla rättigheter förbehållna” över samma material. Identifiera tydligt vilken licens som gäller för vilket innehåll.
Risk-Nytta-Matris för Öppen Licensiering
Upphovsrättslagar och regler för AI-träning skiljer sig åt mellan länder och är fortfarande osäkra. United States Copyright Office fortsätter att undersöka dessa frågor, medan Creative Commons beskriver AI-träning som faktabaserad och juridiskt komplex. (copyright.gov)
| Tillvägagångssätt | Inkluderingspotential | Huvudfördelar | Huvudrisker | Bästa passform |
|---|---|---|---|---|
| CC BY 4.0 | Mycket hög | Bred kopiering, anpassning, kommersiell användning, översättning, indexering och modellrelaterad återanvändning när upphovsrättsligt tillstånd behövs | Kommersiella konkurrenter kan återanvända eller anpassa innehållet; attribueringen kan vara ofullständig; licensen kan inte kontrollera integritets-, varumärkes- eller tredjepartsrättigheter | Publicister som vill ha den bredaste lagliga återanvändningen och stark källattribuering |
| CC BY-SA 4.0 | Hög, men mer komplex | Uppmuntra en öppen delningscykel och kräver att anpassningar förblir under kompatibla villkor | ShareAlike-regler kan vara svåra att tillämpa på datamängder, modellträning och offentliga utdata; vissa organisationer kan undvika materialet på grund av osäkerhet | Öppna utbildnings- och allmännyttiga projekt som vill att efterföljande anpassningar förblir öppna |
| CC BY-NC 4.0 | Medel eller låg | Begränsar användningar som primärt är avsedda för kommersiell fördel eller monetär ersättning | ”Icke-kommersiell” kan vara svårt att tolka; kan exkludera kommersiell sökning, modell- och assistent-användning; det är ingen garanterad bortval för träning | Material avsett för ideellt, pedagogiskt eller samhällsnyttigt bruk |
| CC BY-ND 4.0 | Medel | Tillåter delning samtidigt som anpassningar begränsas | Översättning, transformation och vissa assistent-användningsfall kan bli juridiskt osäkra; mindre attraktivt för system som sammanfattar eller remixar | Officiella meddelanden eller verk som måste förbli oförändrade |
| CC0 eller dedikation till allmän egendom | Mycket hög | Förenklar återanvändning och tar bort de flesta upphovsrättsliga villkor där det är juridiskt effektivt | Ingen obligatorisk attribuering; svag kontroll över varumärkespresentation; integritets-, varumärkes- och publiceringsrättigheter förblir separata | Fakta, datamängder, referensmaterial eller verk avsedda för obegränsad återanvändning |
| Alla rättigheter förbehållna plus öppen sökmotorcrawling | Hög för sök, lägre för träning | Kan bevara sök- och citeringssynlighet utan att bevilja en bred återanvändningslicens | Mer juridisk osäkerhet för modellutvecklare; kan minska inkluderingen i träningsdatamängder och kommersiella återanvändningssystem | Publicister som vill ha upptäckt och citeringar men föredrar att förhandla om bredare licenser separat |
Den mest balanserade strategin för många organisationer är:
- CC BY 4.0 för original offentlig redaktionell text
- Separata etiketter för tredjepartsmaterial
- Ingen offentlig personlig eller konfidentiell information
- Tillåt sök- och hämtnings-crawlers
- Tillåt modellerings-crawlers endast om organisationen verkligen accepterar den användningen
- Använd tydlig attribuering och kanoniska länkar
- Skydda varumärken genom ett separat varumärkesmeddelande
En Praktisk Checklista för Implementering
Innehåll och licensiering
- Identifiera vem som äger varje sida, bild, diagram, video och citat.
- Licensiera endast material för vilket din organisation kontrollerar rättigheterna.
- Markera tredjepartsmaterial separat.
- Lägg till ett synligt licensuttalande.
- Tillhandahåll en föredragen citering med titel, författare, källa och licens.
- Håll logotyper, varumärken, personuppgifter och konfidentiell information utanför det licensierade omfånget.
Robots.txt
- Skapa en offentlig robots.txt-fil i roten av varje värd.
- Tillåt sök-crawlers separat från tränings-crawlers.
- Blockera administrativa, konto-, kassa-, privata och interna applikationsvägar.
- Förlita dig inte på robots.txt för säkerhet.
- Testa filen efter varje större webbplatsutveckling.
Meta-taggar
- Använd kanoniska länkar.
- Lägg till författare, publikationsdatum och ändringsdatum.
- Använd
noindexför sidor som inte ska visas i sökningen. - Använd
nosnippetellerdata-nosnippetför känsliga utdrag där det stöds. - Använd
X-Robots-Tagför bärbara dokumentfiler, bilder och andra icke-HTML-resurser. - Kom ihåg att en crawler måste kunna hämta en sida innan den kan läsa dess meta-taggar.
Nätverkssäkerhet
- Logga user-agent-strängar, källadresser, svarskoder och förfrågningsvägar.
- Verifiera betrodda crawlers med hjälp av officiella adressflöden eller Domännamnssystem-metoder.
- Uppdatera adressflöden automatiskt.
- Kombinera user-agent- och källadresskontroller.
- Hastighetsbegränsa verifierade crawlers istället för att ge dem obegränsad åtkomst.
- Utmana eller blockera förfrågningar som utger sig för att vara betrodda crawlers men misslyckas med verifieringen.
Mätning
Spåra:
- Besök från AI-söktjänster
- Hänvisningar till den ursprungliga sidan
- Citeringsfrekvens
- Serverbelastning per crawler
- Förfrågningar som returnerar
403,404eller429 - Crawler-åtkomst till oavsedda sökvägar
- Om aktuella artiklar hittas efter publicering
Slutsats
Maximal inkludering kräver selektiv öppenhet, inte ett enda generellt tillstånd.
Använd robots.txt för att separera sökning, användarhämntning, träning och offentlig datamängdscrawling. Använd meta-taggar och HTTP-huvuden för att hantera indexering och utdrag. Använd autentisering för allt privat. Verifiera crawler-IP-adresser snarare än att bara lita på user-agent-namn.
En tillåtande licens som CC BY 4.0 kan göra bred återanvändning enklare när du verkligen vill det. Tydlig attributionsinformation – titel, författare, källa, licens, kanonisk sida och uppdateringsdatum – kan också göra det lättare för söksystem och assistenter att identifiera och citera rätt källa.
Den starkaste publiceringspolicyn är därför:
**Öppna det offentliga innehåll du vill ska upptäckas, licensiera tydligt det material du vill ska återanvändas, märk material du inte äger, skydda privat information på servernivå, och ge varje crawler ett separat, granskningsbart tillstånd.
Auto