Licenties en Robots voor Maximale Inclusie: Hoe Kunstmatige Intelligentie Crawlers te Verwelkomen
Laatst bijgewerkt op 25 augustus 2026
Websites hebben nu meer dan één manier om een publiek te bereiken. Een pagina kan gevonden worden via Google Zoeken, samengevat worden door ChatGPT, geciteerd worden door Perplexity, gebruikt worden in Claude-zoekopdrachten, weergegeven worden via Apple-diensten, of verzameld worden door een openbaar webarchief.
Deze systemen gebruiken niet allemaal dezelfde crawler of volgen niet dezelfde regels. Een website die GPTBot blokkeert, kan nog steeds verschijnen in de ChatGPT-zoekresultaten als deze OAI-SearchBot toestaat. Een website die Applebot toestaat, kan zichtbaar blijven in Apple Search terwijl Applebot-Extended wordt geblokkeerd voor het trainen van kunstmatige intelligentiemodellen. Google's Google-Extended is helemaal geen normale crawler; het is een robots.txt-besturingstoken.
Het beste beleid is daarom niet simpelweg “kunstmatige intelligentie toestaan” of “kunstmatige intelligentie blokkeren.” Het is om aparte machtigingen te creëren voor:
- Zoeken en ontdekken
- Door de gebruiker aangevraagde ophalen
- Modelontwikkeling en -training
- Openbare datasets
- Gevoelig, privé of beperkt materiaal
Dit artikel biedt een actuele crawler-inventaris, robots.txt-voorbeelden, richtlijnen voor metatags, methoden voor Internet Protocol-adresverificatie, advies over Creative Commons-licenties, juridische standaardtekst en een risico-batenmatrix.
De Vier Besturingselementen Die Elke Uitgever Moet Begrijpen
1. robots.txt regelt aangevraagde crawling
Een robots.txt-bestand vertelt conforme geautomatiseerde clients welke pagina's zij mogen opvragen. Het is nuttig voor het beheren van crawlerverkeer en het uiten van de voorkeuren van een uitgever.
Robots.txt is echter geen toegangscontrolesysteem. Het Robots Exclusion Protocol stelt dat de regels ervan geen toegangsmachtiging zijn. Google waarschuwt ook dat een geblokkeerd adres nog steeds in zoekresultaten kan verschijnen als andere pagina's ernaar linken. Gebruik wachtwoorden, authenticatie of server-side toegangscontroles voor vertrouwelijke informatie. (rfc-editor.org)
2. Metatags regelen indexering en fragmenten
Robots-metatags en de X-Robots-Tag-antwoordheader kunnen bepalen of een pagina wordt geïndexeerd of dat een zoekmachine een fragment mag tonen.
Deze besturingselementen zijn normaal gesproken pas zichtbaar nadat een crawler de pagina mocht ophalen. Als robots.txt de pagina eerst blokkeert, ziet de crawler de metatag mogelijk nooit. (developers.google.com)
3. Netwerkcontroles verifiëren de crawler
Een user-agentnaam is gemakkelijk te kopiëren. Een aanvaller kan een verzoek sturen waarin hij beweert GPTBot, Googlebot of PerplexityBot te zijn.
Een sterkere aanpak combineert:
- De geclaimde user-agent
- Een gepubliceerd Internet Protocol-adresbereik
- Reverse Domain Name System-verificatie
- Forward Domain Name System-verificatie
- Snelheidslimieten en verzoekbewaking
4. Een licentie verleent hergebruiksrechten
Robots.txt zegt wat een crawler wordt gevraagd te doen. Een licentie zegt wat mensen of organisaties wettelijk mogen doen met materiaal wanneer auteursrechtelijke toestemming vereist is.
Dit zijn verschillende hulpmiddelen. Een permissieve licentie kan juridische onzekerheid verminderen, maar garandeert niet dat een crawler de pagina zal bezoeken, dat een model deze zal gebruiken, of dat een assistent ernaar zal verwijzen.
Inventaris van Belangrijke Crawlers
De volgende inventaris is gecontroleerd aan de hand van de documentatie van de providers die beschikbaar was op 25 augustus 2026. User-agentnamen, doelen en Internet Protocol-adresbereiken kunnen veranderen, dus productiesystemen moeten de actuele documentatie en live adresfeeds van de provider gebruiken.
| Provider | Crawler of robots.txt-token | Hoofddoel | Belangrijke controle |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Vindt en analyseert pagina's voor ChatGPT-zoekopdrachten | Sta het toe om de kans te vergroten dat pagina's verschijnen in ChatGPT-zoekresultaten. |
| OpenAI | GPTBot | Verzamelt pagina's die kunnen worden gebruikt voor het trainen van OpenAI's generatieve kunstmatige intelligentiemodellen | Apart toestaan of weigeren van zoeken. |
| OpenAI | ChatGPT-User | Haalt pagina's op nadat een gebruiker ChatGPT of een aangepaste GPT vraagt deze te openen | Het wordt door de gebruiker geactiveerd in plaats van een automatische webcrawler, dus robots.txt-regels zijn mogelijk niet van toepassing. |
| OpenAI | OAI-AdsBot | Controleert webpagina's die zijn ingediend als ChatGPT-advertentiebestemmingen | Voornamelijk relevant voor adverteerders. De verzamelde inhoud wordt niet gebruikt om generatieve kunstmatige intelligentie-grondmodellen te trainen. |
Googlebot | Belangrijkste Google Zoeken-crawler | Regelt het gewone Google Zoeken-crawlen. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Afbeeldingen, video's en Google Nieuws | Deze hebben aparte robots.txt-tokens en kunnen onafhankelijk worden beheerd. | |
GoogleOther | Algemene Google-crawling voor verschillende productteams, inclusief onderzoek en ontwikkeling | Het vertegenwoordigt geen specifiek Google-product. | |
Google-Extended | Regelt of door Google gecrawlde inhoud mag worden gebruikt voor Gemini-modeltraining en bepaalde grounding-systemen | Het is een robots.txt-besturingstoken, geen aparte user-agent voor verzoeken. Het heeft geen invloed op de gewone opname in Google Zoeken. | |
| Anthropic | ClaudeBot | Verzamelt openbare webinhoud die kan bijdragen aan de ontwikkeling van het Claude-model | Weiger het om aan te geven dat toekomstig materiaal moet worden uitgesloten van Anthropic-trainingsdatasets. |
| Anthropic | Claude-SearchBot | Verbetert de kwaliteit van Claude-zoekresultaten | Sta het toe voor zichtbaarheid in Claude-zoekopdrachten. |
| Anthropic | Claude-User | Haalt pagina's op als reactie op een gebruikersverzoek aan Claude | Gescheiden van automatisch crawlen. |
| Perplexity | PerplexityBot | Indexeert pagina's voor Perplexity-zoekresultaten | Perplexity zegt dat deze crawler niet wordt gebruikt om inhoud te verzamelen voor het trainen van grondmodellen van kunstmatige intelligentie. |
| Perplexity | Perplexity-User | Haalt een pagina op nadat een gebruiker deze heeft aangevraagd | De documentatie van Perplexity zegt dat deze fetcher robots.txt over het algemeen negeert omdat het verzoek door een gebruiker is geïnitieerd. |
| Apple | Applebot | Ondersteunt Apple Search, Spotlight, Siri, Safari en andere Apple-ervaringen | Sta het toe voor Apple-ontdekking. |
| Apple | Applebot-Extended | Regelt of door Applebot gecrawlde inhoud mag worden gebruikt om Apple-grondmodellen te trainen | Het crawlt zelf geen pagina's. Het is een gegevensgebruikscontrole. |
| Common Crawl | CCBot | Verzamelt openbare webdata voor het openbare webarchief van Common Crawl | Het is geen assistent, maar de datasets kunnen worden gebruikt door onderzoekers en ontwikkelaars van kunstmatige intelligentie. |
| Microsoft | Bingbot | Belangrijkste Bing-zoekcrawler | Sta het toe voor Bing-ontdekking en zoekzichtbaarheid. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Pagina- en videovoorbeelden voor Microsoft-producten | Deze kunnen afzonderlijk van Bingbot worden beheerd. |
| Amazon | Amzn-SearchBot | Amazon zoeken en content discovery | Amazon zegt dat het geen content crawlt voor generatieve kunstmatige intelligentiemodel training. |
| Amazon | Amzn-User | Haalt actuele informatie op als reactie op gebruikersacties, inclusief Alexa-verzoeken | Door de gebruiker geactiveerd en gescheiden van automatisch zoekcrawlen. |
OpenAI documenteert zijn zoek-, trainings-, advertentie- en door de gebruiker geactiveerde crawlers als afzonderlijke besturingselementen. De documentatie beveelt specifiek aan OAI-SearchBot toe te staan voor ChatGPT-zoekopdrachten, terwijl GPTBot afzonderlijk wordt gebruikt voor trainingsvoorkeuren. (developers.openai.com)
Google scheidt op vergelijkbare wijze Googlebot, GoogleOther en Google-Extended. Google-Extended heeft geen eigen HTTP-verzoek user-agent, en het blokkeren ervan verwijdert een pagina niet uit Google Zoeken. (developers.google.com)
Anthropic documenteert afzonderlijke rollen voor ClaudeBot, Claude-SearchBot en Claude-User. Anthropic stelt ook dat zijn bots robots.txt volgen en de niet-standaard Crawl-delay-richtlijn ondersteunen. (support.anthropic.com)
Perplexity onderscheidt automatisch zoekcrawlen en door de gebruiker aangevraagde fetching. De huidige documentatie stelt dat PerplexityBot robots.txt respecteert, terwijl Perplexity-User dit over het algemeen niet doet omdat het reageert op een gebruikersverzoek. (docs.perplexity.ai)
De huidige documentatie van Apple maakt hetzelfde onderscheid tussen zoeken en training: Applebot ondersteunt ontdekking, terwijl Applebot-Extended uitgevers in staat stelt het trainingsgebruik te controleren zonder pagina's uit Apple Search te verwijderen. (support.apple.com)
Aanbevolen robots.txt-configuraties
Plaats robots.txt in de root van elke host, zoals:
text https://www.example.org/robots.txt
Regels gelden voor de specifieke host, het protocol en de poort waarop het bestand wordt aangeboden. Een apart subdomein heeft mogelijk een eigen bestand nodig. (developers.google.com)
Configuratie 1: Maximale inclusie
Gebruik dit wanneer openbare redactionele inhoud mag worden gevonden, samengevat, geciteerd, geïndexeerd en verzameld door conforme crawlers.
text
Openbare pagina's zijn beschikbaar voor conforme crawlers.
User-agent: * Allow: /
Houd privé, transactionele en administratieve paden buiten beschouwing.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Dit staat benoemde crawlers toe, inclusief OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft en Amazon, tenzij een andere specifieke regel ze blokkeert.
Plaats geen algemene regel zoals User-agent: * Disallow: / onder deze configuratie. Een latere of specifiekere groep kan de manier waarop een crawler het bestand interpreteert, veranderen.
Configuratie 2: Zoeken toestaan, maar crawlers voor modelontwikkeling blokkeren
Dit is vaak het beste compromis voor uitgevers die citaten en zoekverkeer willen, maar geen toestemming willen geven voor het verzamelen voor modelontwikkeling.
text
Blokkeer OpenAI-crawling voor modelontwikkeling.
User-agent: GPTBot Disallow: /
Blokkeer Anthropic-crawling voor modelontwikkeling.
User-agent: ClaudeBot Disallow: /
Blokkeer Google-modeltraining en gerelateerd grounding-gebruik.
User-agent: Google-Extended Disallow: /
Blokkeer het gebruik voor Apple-grondmodeltraining.
User-agent: Applebot-Extended Disallow: /
Optioneel: blokkeer Common Crawl datasetverzameling.
User-agent: CCBot
Disallow: /
Sta gewoon zoeken en ophalen toe, behalve voor gevoelige paden.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Deze configuratie laat OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot en Applebot vallen onder de wildcard-groep. Het houdt ook zoek- en trainingsmachtigingen gescheiden.
Voor Apple behoudt het blokkeren van Applebot-Extended terwijl Applebot wordt toegestaan, de vindbaarheid via Apple-diensten. Voor Google blokkeert het blokkeren van Google-Extended het gewone Google Zoeken niet. (developers.google.com)
Configuratie 3: Expliciet geselecteerde zoekcrawlers toestaan
Als een bestaand robots.txt-bestand alle crawlers blokkeert, voeg dan aparte groepen toe voor de zoekcrawlers die u wilt verwelkomen.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Houd alle andere crawlers buiten.
User-agent: * Disallow: /
Bij het gebruik van specifieke groepen, herhaal de regels voor gevoelige paden binnen elke groep. Sommige crawlers gebruiken de meest specifieke overeenkomende groep in plaats van deze te combineren met de wildcard-groep. Bing documenteert dit gedrag direct, en Google geeft aparte richtlijnen voor crawler-specifieke groepen. (bing.com)
Belangrijke robots.txt-beperkingen
- Een crawler kan robots.txt negeren.
- Een kwaadaardige crawler kan zich voordoen als een vertrouwde crawler.
- Een geblokkeerde pagina kan nog steeds bekend zijn via de titel of het webadres.
- Robots.txt beschermt geen wachtwoorden, privébestanden, klantgegevens of vertrouwelijke API's (Application Programming Interfaces).
- Een
Crawl-delay-richtlijn is geen onderdeel van het Robots Exclusion Protocol en wordt niet door elke crawler ondersteund. Anthropic en Bing documenteren ondersteuning, terwijl Apple aangeeft dat Applebotcrawl-delayniet volgt. (rfc-editor.org)
Metatags en HTTP-headers
Voorbeeld openbare pagina
Voor een openbaar artikel, gebruik een duidelijke titel, auteur, canoniek webadres, publicatiedatum en wijzigingsdatum.
html
De max-snippet-richtlijn is voornamelijk gedocumenteerd voor Google. Ga er niet van uit dat elke kunstmatige intelligentie-crawler elke meta-richtlijn ondersteunt.
Voorbeeld privé- of gevoelige pagina
html
Gebruik dit voor pagina's die niet in zoekresultaten mogen verschijnen. De pagina moet lang genoeg crawlbaar blijven om de crawler de richtlijn te laten zien. Als de pagina echt privé moet blijven, gebruik dan authenticatie of wachtwoordbeveiliging. (developers.google.com)
Verberg alleen gevoelige secties voor zoekfragmenten
Google ondersteunt data-nosnippet voor specifieke delen van een HTML-pagina:
html
Deze paragraaf kan worden getoond in een zoekresultaat.
Dit is nuttig voor contactgegevens, interne notities of door gebruikers gegenereerde informatie. Het is geen universele instructie voor elk kunstmatige intelligentiesysteem. (developers.google.com)
Gebruik de X-Robots-Tag header voor bestanden
Metatags kunnen niet worden geplaatst in een draagbaar documentbestand, afbeelding of videobestand. Gebruik in plaats daarvan een HTTP-antwoordheader:
text X-Robots-Tag: noindex, nosnippet
Voor een pagina die zoekbaar moet blijven maar geen tekst moet leveren voor fragmenten of kunstmatige intelligentie-antwoorden, gebruik:
text X-Robots-Tag: nosnippet
Google documenteert X-Robots-Tag voor niet-HTML-bronnen, en Apple ondersteunt het ook voor Applebot. (developers.google.com)
Apple-specifieke controles
Apple ondersteunt:
html
Apple stelt dat nosnippet voorkomt dat de pagina wordt gebruikt als aanvullende context en huidige inhoud wanneer Apple-modellen uitvoer genereren. De pagina kan nog steeds vindbaar blijven via Apple Search, Spotlight, Siri en Safari. (support.apple.com)
Voor pagina's met een betaalmuur ondersteunt Apple ook gestructureerde data via:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple stelt dat dergelijke pagina's in aanmerking kunnen blijven komen voor zoekresultaten, maar niet zullen worden gebruikt als aanvullende context voor kunstmatige intelligentie-antwoorden. (support.apple.com)
Hoe Internet Protocol-adressen van Crawlers te Verifiëren
Waarom user-agent matching niet voldoende is
Een regel als deze is zwak:
text als User-Agent "GPTBot" bevat: toestaan
Iedereen kan die tekst sturen. Een betere regel is:
text als User-Agent een bekende crawler is en bron Internet Protocol-adres binnen het officiële bereik van de provider valt: toestaan of snelheidsbeperking toepassen anders: uitdagen, snelheidsbeperking toepassen of blokkeren
Vertrouw niet op een X-Forwarded-For-header, tenzij deze afkomstig is van een proxy of content delivery network dat uw organisatie beheert.
Verificatiemethoden voor providers
| Provider | Aanbevolen verificatiemethode |
|---|---|
| OpenAI | Gebruik de live Internet Protocol-adresfeeds die zijn gepubliceerd in de OpenAI-crawlerdocumentatie voor OAI-SearchBot, GPTBot en OAI-AdsBot. Ververs ze automatisch in plaats van vaste bereiken in een firewall te kopiëren. |
| Gebruik de gepubliceerde crawlerbereiken van Google of voer reverse en forward Domain Name System-controles uit. Een echte Google-crawler zou moeten oplossen naar een goedgekeurde Google-hostname en terug moeten oplossen naar het originele adres. | |
| Anthropic | Gebruik de actuele gepubliceerde crawler-adresfeed als een secundaire netwerkcontrole. De primaire opt-out methode van Anthropic blijft robots.txt. |
| Perplexity | Combineer de user-agent met de huidige PerplexityBot- of Perplexity-User-adresfeed. Perplexity beveelt specifiek aan om beide voorwaarden te combineren in een Web Application Firewall-regel. |
| Apple | Gebruik reverse Domain Name System-verificatie onder applebot.apple.com, en voer vervolgens een forward lookup uit. Apple publiceert ook actuele adresbereiken in een JSON-feed. |
| Common Crawl | Gebruik reverse Domain Name System-verificatie onder crawl.commoncrawl.org en de huidige CCBot-adresfeed. Common Crawl merkt op dat reverse-verificatie nog niet beschikbaar is voor sommige IPv6-verkeer. |
| Microsoft | Gebruik de officiële Verify Bingbot-tool of de gedocumenteerde reverse en forward lookup-methoden van Microsoft. |
| Amazon | Gebruik de gepubliceerde crawler-adreslijsten van Amazon en match deze met de juiste Amazon user-agent. |
Google, Apple, Common Crawl, OpenAI, Anthropic en Perplexity publiceren allemaal providerspecifieke methoden of adresfeeds. Deze lijsten kunnen veranderen, dus een gepland updateproces is veiliger dan een permanente handmatig gekopieerde lijst. (developers.google.com)
Een eenvoudig firewall-ontwerp zou er als volgt uit kunnen zien:
text sta OAI-SearchBot alleen toe wanneer het bronadres zich in het huidige OpenAI-zoekbereik bevindt sta GPTBot alleen toe wanneer het bronadres zich in het huidige OpenAI-trainingsbereik bevindt sta PerplexityBot alleen toe wanneer het bronadres zich in het huidige PerplexityBot-bereik bevindt sta Applebot alleen toe wanneer omgekeerde en voorwaartse DNS-verificatie slaagt sta CCBot alleen toe wanneer omgekeerde DNS en het huidige Common Crawl-bereik overeenkomen
beperk de snelheid van alle geverifieerde crawlers blokkeer of daag niet-geverifieerde verzoeken uit die beweren vertrouwde crawlers te zijn
Pas geen brede toestemmingsregel toe op een hele cloudprovider. Een legitieme crawler kan cloudinfrastructuur gebruiken, maar het grootste deel van het verkeer van die cloudprovider is niet noodzakelijkerwijs de crawler.
Hoe Open Licenties Inclusie Beïnvloeden
CC BY 4.0 in duidelijke taal
De Creative Commons Naamsvermelding 4.0 Internationaal-licentie, algemeen bekend als CC BY 4.0, stelt mensen in staat om:
- Het werk te kopiëren en te verspreiden
- Het aan te passen, te vertalen, te remixen en erop voort te bouwen
- Het commercieel te gebruiken
De belangrijkste voorwaarden zijn:
- De juiste naamsvermelding te geven
- Naar de licentie te linken
- Aan te geven of er wijzigingen zijn aangebracht
- Niet te suggereren dat de oorspronkelijke maker het hergebruik goedkeurt
- Geen juridische of technische beperkingen toe te voegen die door de licentie toegestane gebruiken verhinderen
Creative Commons waarschuwt ook dat de licentie mogelijk geen privacyrechten, publiciteitsrechten, morele rechten, merkrechten, octrooirechten of materiaal van derden dekt. (creativecommons.org)
Een licentie is op zich geen uitnodiging voor een crawler
Het plaatsen van “CC BY 4.0” op een pagina garandeert niet dat een organisatie deze zal crawlen. Een crawler kan nog steeds worden geblokkeerd door:
- robots.txt
- Een content delivery network
- Een Web Application Firewall
- Snelheidsbeperking
- Een JavaScript-uitdaging
- Een login-muur
- Een slechte serverrespons
- Een ontoegankelijke sitemap
Omgekeerd verleent het toestaan van een crawler niet automatisch elke auteursrechtelijke toestemming die nodig is voor elk later gebruik. Robots.txt en licenties moeten samen worden ontworpen.
Waarom CC BY bredere inclusie kan ondersteunen
Een duidelijke permissieve licentie kan het beleid van een uitgever gemakkelijker te begrijpen maken voor datateams, zoeksystemen en assistent-operators. Het kan de onzekerheid verminderen over kopiëren, aanpassen, commercieel gebruik, vertalen en herdistribueren wanneer deze activiteiten auteursrechtelijke toestemming vereisen.
Creative Commons legt echter uit dat het trainen van kunstmatige intelligentie juridisch complex is. Een restrictieve licentie is niet altijd een effectieve manier om training te voorkomen, omdat sommige trainingsgebruiken zijn toegestaan door auteursrechtelijke uitzonderingen of beperkingen. Creative Commons merkt ook op dat licentievoorwaarden moeilijk toe te passen kunnen zijn op machinetraining en modeloutputs. (creativecommons.org)
De praktische les is:
Gebruik CC BY wanneer u oprecht breed, rechtmatig hergebruik wilt. Gebruik geen restrictieve Creative Commons-licentie als een gegarandeerde opt-out voor het trainen van kunstmatige intelligentie.
Naamsvermelding verbetert de duidelijkheid van de bron
Creative Commons beveelt de TASL-methode aan:
- Titel
- Auteur
- Bron
- Licentie
Bijvoorbeeld:
“Licenties en Robots voor Maximale Inclusie,” Voorbeeld Uitgeverij, https://www.example.org/articles/ai-crawlers, gelicentieerd onder Creative Commons Naamsvermelding 4.0 Internationaal. Aangebrachte wijzigingen: bijgewerkte crawler-inventaris.
Duidelijke naamsvermelding dwingt niet elke assistent om naar een pagina te verwijzen. Het maakt correct citeren wel gemakkelijker wanneer een systeem de titel, auteur, bron en licentie-informatie van de pagina extraheert. (wiki.creativecommons.org)
Gestructureerde artikelinformatie toevoegen
Gebruik zichtbare informatie en gestructureerde data samen:
html
Google beveelt duidelijke auteurinformatie, auteurspagina's, publicatiedatums, wijzigingsdatums en stabiele canonieke pagina's aan. Deze signalen kunnen zoeksystemen helpen te begrijpen wie het materiaal heeft gemaakt en welke versie gezaghebbend is. Ze garanderen geen ranking, inclusie of citatie. (developers.google.com)
Juridische Standaardtekst voor een Open, Citatievriendelijke Site
Het volgende is voorbeeldtaal, geen juridisch advies. Laat een advocaat het aanpassen aan uw jurisdictie, eigendomsstructuur, privacyverplichtingen en inhoud van derden.
CC BY 4.0 licentieverklaring
text
Inhoudslicentie
Tenzij anders vermeld, zijn de originele tekst en de originele redactionele materialen op deze pagina gelicentieerd onder de Creative Commons Naamsvermelding 4.0 Internationaal-licentie:
https://creativecommons.org/licenses/by/4.0/
Deze toestemming staat kopiëren, herdistribueren, aanpassen, vertalen, commercieel gebruik, machinaal leesbare verwerking, zoekindexering, ophalen, samenvatten en gebruik in kunstmatige intelligentiesystemen toe, mits de licentievoorwaarden worden gevolgd.
Voorkeur naamsvermelding:
“[Paginatitel],” door [auteur of organisatie], [canoniek pagina-adres], gepubliceerd of bijgewerkt op [datum], gelicentieerd onder Creative Commons Naamsvermelding 4.0 Internationaal. Aangebrachte wijzigingen: [beschrijf wijzigingen, of vermeld ‘geen’].
Gelieve de auteur, uitgever, bron, licentie en wijzigingsinformatie zoveel mogelijk te bewaren. Deze leidraad voor voorkeur naamsvermelding voegt geen beperkingen toe aan de Creative Commons-licentie en vervangt de licentietekst niet.
De zin “inclusief kunstmatige intelligentiesystemen” verduidelijkt de intentie van de uitgever. Het mag niet worden gebruikt om te doen alsof de uitgever rechten bezit op materiaal dat door iemand anders is gemaakt.
Kennisgeving over merk, privacy en rechten van derden
text
Merk, privacy en rechten van derden
Bovenstaande licentie dekt alleen de originele materialen die als gelicentieerd zijn geïdentificeerd. Het verleent geen toestemming voor het gebruik van:
- Handelsmerken, dienstmerken, logo's of handelsuitrusting
- Namen, afbeeldingen of gelijkenissen van personen
- Privé-, vertrouwelijke, account-, gezondheids-, financiële of beveiligingsinformatie
- Gebruikersinzendingen, tenzij deze afzonderlijk als gelicentieerd zijn geïdentificeerd
- Foto's, illustraties, kaarten, video, muziek, citaten of ander materiaal van derden
- Inhoud die is geïdentificeerd als “alle rechten voorbehouden” of onderworpen is aan een aparte licentie
Het gebruik van de naam, logo's en merken van Voorbeeld Uitgeverij mag geen sponsoring, goedkeuring, partnerschap of onderschrijving suggereren. Gelieve naar de originele pagina te linken en citaten, parafrases, samenvattingen en gegenereerd materiaal duidelijk te onderscheiden.
Deze taal is belangrijk omdat Creative Commons-licenties niet automatisch elk type wettelijk recht verlenen dat aan een pagina is verbonden. (creativecommons.org)
Richtlijnen voor citatie door zoekmachines en assistenten
text
Richtlijnen voor citatie door zoekmachines en assistenten
Wij verwelkomen conforme zoekindexering, door de gebruiker aangevraagde ophalen, citatie en samenvatting van het gelicentieerde materiaal op deze site.
Gebruik bij het citeren van deze site de paginatitel, auteur of uitgever, canoniek pagina-adres, publicatie- of update-datum en een directe link naar de bron. Identificeer de bron als één input onder alle gebruikte bronnen, onderscheid gegenereerde analyse van geciteerd materiaal, en vermeld of impliceer niet dat Voorbeeld Uitgeverij een gegenereerd antwoord, product, persoon of dienst onderschrijft.
Deze richtlijn is bedoeld om de nauwkeurigheid en naamsvermelding te verbeteren. Het verleent geen rechten die verder gaan dan de toepasselijke inhoudslicentie en licentieert geen handelsmerken, persoonlijke informatie, vertrouwelijke informatie of materiaal van derden.
Als u zoekzichtbaarheid wilt, maar geen brede trainingslicentie wilt verlenen
text
Zoektoegang en auteursrecht
Onze openbare pagina's kunnen worden geraadpleegd door conforme zoek- en ophaal crawlers die zijn geïdentificeerd in ons robots.txt-bestand. Deze toestemming is bedoeld om ontdekking, zoekresultaten, door de gebruiker aangevraagde ophalen en citatie te ondersteunen.
Tenzij een aparte licentie wordt getoond, blijft de originele inhoud alle rechten voorbehouden. Toegang tot een openbare pagina verleent geen aparte licentie voor modelontwikkeling, training, herdistributie, commercieel hergebruik of het creëren van afgeleide werken buiten de rechten die door de toepasselijke wetgeving worden geboden.
Gelieve het canonieke pagina-adres en de uitgever te vermelden wanneer u naar dit materiaal verwijst. Niets op deze site verleent toestemming om handelsmerken, logo's, persoonlijke informatie, vertrouwelijke informatie of inhoud van derden te gebruiken.
Plaats de CC BY-verklaring en de verklaring 'alle rechten voorbehouden' niet over hetzelfde materiaal. Identificeer duidelijk welke licentie van toepassing is op welke inhoud.
Risico-batenmatrix voor Open Licenties
Auteursrechtwetgeving en regels voor het trainen van kunstmatige intelligentie verschillen per land en zijn nog onbeslist. Het Amerikaanse Copyright Office blijft deze kwesties onderzoeken, terwijl Creative Commons het trainen van kunstmatige intelligentie beschrijft als feitelijk-specifiek en juridisch complex. (copyright.gov)
| Aanpak | Inclusiepotentieel | Belangrijkste voordelen | Belangrijkste risico's | Beste match |
|---|---|---|---|---|
| CC BY 4.0 | Zeer hoog | Breed kopiëren, aanpassen, commercieel gebruik, vertalen, indexeren en modelgerelateerd hergebruik wanneer auteursrechtelijke toestemming nodig is | Commerciële concurrenten kunnen de inhoud hergebruiken of aanpassen; naamsvermelding kan onvolmaakt zijn; licentie kan privacy, handelsmerk- of rechten van derden niet controleren | Uitgevers die het breedste rechtmatige hergebruik en sterke bronvermelding willen |
| CC BY-SA 4.0 | Hoog, maar complexer | Moedigt een open deelcyclus aan en vereist dat aanpassingen onder compatibele voorwaarden blijven | ShareAlike-regels kunnen moeilijk toe te passen zijn op datasets, modeltraining en publieke outputs; sommige organisaties vermijden het materiaal vanwege onzekerheid | Open onderwijs- en algemeen belangprojecten die willen dat afgeleide aanpassingen open blijven |
| CC BY-NC 4.0 | Gemiddeld of laag | Beperkt gebruik dat voornamelijk bedoeld is voor commercieel voordeel of geldelijke vergoeding | "Niet-commercieel" kan moeilijk te interpreteren zijn; kan commercieel zoeken, model- en assistentgebruik uitsluiten; het is geen gegarandeerde opt-out voor training | Materiaal bedoeld voor non-profit, educatief of gemeenschappelijk gebruik |
| CC BY-ND 4.0 | Gemiddeld | Staat delen toe terwijl aanpassingen worden beperkt | Vertaling, transformatie en sommige assistent-gebruiksscenario's kunnen juridisch onzeker worden; minder aantrekkelijk voor systemen die samenvatten of remixen | Officiële mededelingen of werken die ongewijzigd moeten blijven |
| CC0 of publiek domein-toewijding | Zeer hoog | Vereenvoudigt hergebruik en verwijdert de meeste auteursrechtelijke voorwaarden waar wettelijk effectief | Geen vereiste naamsvermelding; zwakke controle over merkimago; privacy-, handelsmerk- en publiciteitsrechten blijven gescheiden | Feiten, datasets, referentiemateriaal of werken bedoeld voor onbeperkt hergebruik |
| Alle rechten voorbehouden plus open zoekcrawlen | Hoog voor zoeken, lager voor training | Kan zoek- en citatiezichtbaarheid behouden zonder een brede hergebruikslicentie te verlenen | Meer juridische onzekerheid voor modelontwikkelaars; kan inclusie in trainingsdatasets en commerciële hergebruiksystemen verminderen | Uitgevers die ontdekking en citaties willen, maar bredere licenties liever afzonderlijk onderhandelen |
De meest evenwichtige strategie voor veel organisaties is:
- CC BY 4.0 voor originele openbare redactionele tekst
- Aparte labels voor materiaal van derden
- Geen openbare persoonlijke of vertrouwelijke informatie
- Zoek- en ophaal crawlers toestaan
- Crawlers voor modelontwikkeling alleen toestaan als de organisatie dit gebruik echt accepteert
- Gebruik duidelijke naamsvermelding en canonieke links
- Bescherm handelsmerken via een aparte merkaanduiding
Een Praktische Implementatiechecklist
Inhoud en licenties
- Identificeer wie eigenaar is van elke pagina, afbeelding, grafiek, video en citaat.
- Licentieer alleen materiaal waarvoor uw organisatie de rechten beheert.
- Markeer materiaal van derden afzonderlijk.
- Voeg een zichtbare licentieverklaring toe.
- Geef een voorkeurscitatie met titel, auteur, bron en licentie.
- Houd logo's, handelsmerken, persoonlijke gegevens en vertrouwelijke informatie buiten de gelicentieerde reikwijdte.
Robots.txt
- Maak een openbaar robots.txt-bestand aan in de root van elke host.
- Sta zoekcrawlers afzonderlijk toe van trainingscrawlers.
- Blokkeer administratieve, account-, checkout-, privé- en interne applicatiepaden.
- Vertrouw niet op robots.txt voor beveiliging.
- Test het bestand na elke grote website-implementatie.
Metatags
- Gebruik canonieke links.
- Voeg auteur, publicatiedatum en wijzigingsdatum toe.
- Gebruik
noindexvoor pagina's die niet in zoekresultaten mogen verschijnen. - Gebruik
nosnippetofdata-nosnippetvoor gevoelige fragmenten waar ondersteund. - Gebruik
X-Robots-Tagvoor draagbare documentbestanden, afbeeldingen en andere niet-HTML-bronnen. - Onthoud dat een crawler een pagina moet kunnen ophalen voordat deze de metatags kan lezen.
Netwerkbeveiliging
- Log user-agent-strings, bronadressen, responscodes en verzoekpaden.
- Verifieer vertrouwde crawlers met behulp van officiële adresfeeds of Domain Name System-methoden.
- Ververs adresfeeds automatisch.
- Combineer user-agent- en bronadrescontroles.
- Beperk de snelheid van geverifieerde crawlers in plaats van ze onbeperkte toegang te geven.
- Daag verzoeken uit of blokkeer deze die beweren vertrouwde crawlers te zijn, maar de verificatie niet doorstaan.
Meting
Volg:
- Bezoeken van zoekdiensten van kunstmatige intelligentie
- Verwijzingen naar de originele pagina
- Citatiefrequentie
- Serverbelasting per crawler
- Verzoeken die
403,404of429retourneren - Crawler-toegang tot onbedoelde paden
- Of actuele artikelen worden gevonden na publicatie
Conclusie
Maximale inclusie vereist selectieve openheid, geen enkele algemene toestemming.
Gebruik robots.txt om zoeken, gebruiker retrieval, training en openbare dataset-crawling te scheiden. Gebruik metatags en HTTP-headers om indexering en fragmenten te beheren. Gebruik authenticatie voor alles wat privé is. Verifieer Internet Protocol-adressen van crawlers in plaats van alleen op user-agentnamen te vertrouwen.
Een permissieve licentie zoals CC BY 4.0 kan breed hergebruik gemakkelijker maken wanneer u dit oprecht wilt. Duidelijke naamsvermelding—titel, auteur, bron, licentie, canonieke pagina en update-datum—kan het ook gemakkelijker maken voor zoeksystemen en assistenten om de juiste bron te identificeren en te citeren.
Het sterkste publicatiebeleid is daarom:
**Open de openbare inhoud die u wilt laten ontdekken, licentieer duidelijk het materiaal dat u wilt hergebruiken, markeer het materiaal dat u niet bezit, bescherm privé-informatie op serverniveau en geef elke crawler een aparte, controleerbare toestemming.
Auto