Lizenzierung und Robots für maximale Inklusion: Wie man Künstliche Intelligenz-Crawler willkommen heißt
Aktualisiert am 25. August 2026
Websites haben heute mehr als eine Möglichkeit, ein Publikum zu erreichen. Eine Seite kann über die Google-Suche gefunden, von ChatGPT zusammengefasst, von Perplexity zitiert, in der Claude-Suche verwendet, über Apple-Dienste angezeigt oder von einem öffentlichen Webarchiv gesammelt werden.
Diese Systeme verwenden nicht alle denselben Crawler oder folgen denselben Regeln. Eine Website, die GPTBot blockiert, kann dennoch in der ChatGPT-Suche erscheinen, wenn sie OAI-SearchBot zulässt. Eine Website, die Applebot zulässt, kann in der Apple-Suche sichtbar bleiben, während Applebot-Extended vom Training von Modellen künstlicher Intelligenz ausgeschlossen wird. Googles Google-Extended ist überhaupt kein normaler Crawler; es ist ein robots.txt-Kontrolltoken.
Die beste Strategie ist daher nicht einfach „Künstliche Intelligenz zulassen“ oder „Künstliche Intelligenz blockieren“. Vielmehr geht es darum, separate Berechtigungen zu erstellen für:
- Suche und Entdeckung
- Vom Benutzer angeforderte Abrufe
- Modellentwicklung und -training
- Öffentliche Datensätze
- Sensible, private oder eingeschränkte Materialien
Dieser Artikel bietet eine aktuelle Crawler-Bestandsaufnahme, robots.txt-Beispiele, Meta-Tag-Anleitungen, Methoden zur Überprüfung von Internet-Protokoll-Adressen, Ratschläge zur Creative Commons-Lizenzierung, juristische Standardformulierungen und eine Risiko-Nutzen-Matrix.
Die vier Kontrollen, die jeder Publisher verstehen sollte
1. robots.txt steuert angefordertes Crawling
Eine robots.txt-Datei teilt konformen automatisierten Clients mit, welche Seiten sie anfordern dürfen. Sie ist nützlich für die Verwaltung des Crawler-Traffics und zur Äußerung der Präferenzen eines Publishers.
Robots.txt ist jedoch kein Zugriffskontrollsystem. Das Robots Exclusion Protocol besagt, dass seine Regeln keine Zugriffsberechtigung darstellen. Google warnt auch davor, dass eine blockierte Adresse immer noch in den Suchergebnissen erscheinen kann, wenn andere Seiten darauf verlinken. Verwenden Sie Passwörter, Authentifizierung oder serverseitige Zugriffskontrollen für vertrauliche Informationen. (rfc-editor.org)
2. Meta-Tags steuern Indexierung und Snippets
Robots-Meta-Tags und der X-Robots-Tag-Antwort-Header können steuern, ob eine Seite indexiert wird oder ob eine Suchmaschine ein Snippet anzeigen darf.
Diese Kontrollen sind normalerweise erst sichtbar, nachdem ein Crawler die Seite abrufen durfte. Wenn robots.txt die Seite zuerst blockiert, sieht der Crawler den Meta-Tag möglicherweise nie. (developers.google.com)
3. Netzwerkkontrollen verifizieren den Crawler
Ein User-Agent-Name lässt sich leicht kopieren. Ein Angreifer kann eine Anfrage senden, die vorgibt, GPTBot, Googlebot oder PerplexityBot zu sein.
Ein stärkerer Ansatz kombiniert:
- Der angegebene User-Agent
- Ein veröffentlichter Internet-Protokoll-Adressbereich
- Reverse Domain Name System (DNS)-Verifizierung
- Forward Domain Name System (DNS)-Verifizierung
- Ratenbegrenzungen und Anfragenüberwachung
4. Eine Lizenz gewährt Wiederverwendungsrechte
Robots.txt gibt an, was ein Crawler tun soll. Eine Lizenz gibt an, was Personen oder Organisationen rechtlich mit Material tun dürfen, wenn eine Urheberrechtserlaubnis erforderlich ist.
Dies sind unterschiedliche Werkzeuge. Eine permissive Lizenz kann die rechtliche Unsicherheit verringern, garantiert aber nicht, dass ein Crawler die Seite besucht, dass ein Modell sie verwendet oder dass ein Assistent sie zitiert.
Inventar wichtiger Crawler
Das folgende Inventar wurde anhand der am 25. August 2026 verfügbaren Anbieterdokumentation überprüft. User-Agent-Namen, Zwecke und Internet-Protokoll-Adressbereiche können sich ändern, daher sollten Produktionssysteme die aktuelle Dokumentation und Live-Adress-Feeds des Anbieters verwenden.
| Anbieter | Crawler oder robots.txt-Token | Hauptzweck | Wichtige Kontrolle |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Findet und analysiert Seiten für die ChatGPT-Suche | Erlauben Sie es, um die Wahrscheinlichkeit zu erhöhen, dass Seiten in den ChatGPT-Suchergebnissen erscheinen. |
| OpenAI | GPTBot | Sammelt Seiten, die zum Training von OpenAIs generativen Modellen künstlicher Intelligenz verwendet werden können | Erlauben oder verbieten Sie dies getrennt von der Suche. |
| OpenAI | ChatGPT-User | Ruft Seiten ab, nachdem ein Benutzer ChatGPT oder einen benutzerdefinierten GPT gebeten hat, darauf zuzugreifen | Es wird vom Benutzer ausgelöst und ist kein automatischer Webcrawler, daher gelten robots.txt-Regeln möglicherweise nicht. |
| OpenAI | OAI-AdsBot | Überprüft Webseiten, die als ChatGPT-Werbeziele eingereicht wurden | Hauptsächlich für Werbetreibende relevant. Der gesammelte Inhalt wird nicht zum Training generativer KI-Grundlagenmodelle verwendet. |
Googlebot | Haupt-Google-Such-Crawler | Steuert das normale Google-Such-Crawling. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Bilder, Videos und Google News | Diese haben separate robots.txt-Token und können unabhängig gesteuert werden. | |
GoogleOther | Allgemeines Google-Crawling für verschiedene Produktteams, einschließlich Forschung und Entwicklung | Es repräsentiert kein spezifisches Google-Produkt. | |
Google-Extended | Steuert, ob von Google gecrawlte Inhalte für das Gemini-Modelltraining und bestimmte Grounding-Systeme verwendet werden dürfen | Es ist ein robots.txt-Kontrolltoken, kein separater Request User-Agent. Es beeinflusst nicht die normale Aufnahme in die Google-Suche. | |
| Anthropic | ClaudeBot | Sammelt öffentliche Webinhalte, die zur Entwicklung von Claude-Modellen beitragen können | Verbieten Sie es, um zu signalisieren, dass zukünftiges Material aus den Anthropic-Trainingsdatensätzen ausgeschlossen werden sollte. |
| Anthropic | Claude-SearchBot | Verbessert die Qualität der Claude-Suchergebnisse | Erlauben Sie es für die Sichtbarkeit in der Claude-Suche. |
| Anthropic | Claude-User | Ruft Seiten als Reaktion auf eine Benutzeranfrage an Claude ab | Getrennt vom automatischen Crawling. |
| Perplexity | PerplexityBot | Indexiert Seiten für Perplexity-Suchergebnisse | Perplexity gibt an, dass dieser Crawler nicht zum Sammeln von Inhalten für das Training von KI-Grundlagenmodellen verwendet wird. |
| Perplexity | Perplexity-User | Ruft eine Seite ab, nachdem ein Benutzer sie angefordert hat | Die Dokumentation von Perplexity besagt, dass dieser Fetcher robots.txt im Allgemeinen ignoriert, da die Anfrage von einem Benutzer initiiert wurde. |
| Apple | Applebot | Unterstützt Apple Search, Spotlight, Siri, Safari und andere Apple-Erlebnisse | Erlauben Sie es für die Apple-Entdeckung. |
| Apple | Applebot-Extended | Steuert, ob von Applebot gecrawlte Inhalte zum Training von Apple-Grundlagenmodellen verwendet werden dürfen | Es crawlt selbst keine Seiten. Es ist eine Datenverwendungskontrolle. |
| Common Crawl | CCBot | Sammelt öffentliche Webdaten für Common Crawls offenes Webarchiv | Es ist kein Assistent, aber seine Datensätze können von Forschern und KI-Entwicklern genutzt werden. |
| Microsoft | Bingbot | Haupt-Bing-Such-Crawler | Erlauben Sie es für die Bing-Entdeckung und Suchsichtbarkeit. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Seiten- und Videovorschauen für Microsoft-Produkte | Diese können getrennt von Bingbot gesteuert werden. |
| Amazon | Amzn-SearchBot | Amazon-Suche und Content-Entdeckung | Amazon gibt an, keine Inhalte für das Training generativer KI-Modelle zu crawlen. |
| Amazon | Amzn-User | Ruft aktuelle Informationen als Reaktion auf Benutzeraktionen ab, einschließlich Alexa-Anfragen | Benutzergesteuert und getrennt vom automatischen Such-Crawling. |
OpenAI dokumentiert seine Such-, Trainings-, Werbe- und benutzergesteuerten Crawler als separate Kontrollen. Die Dokumentation empfiehlt ausdrücklich, OAI-SearchBot für die ChatGPT-Suche zuzulassen, während GPTBot separat für Trainingspräferenzen verwendet wird. (developers.openai.com)
Google trennt ebenfalls Googlebot, GoogleOther und Google-Extended. Google-Extended hat keinen eigenen HTTP-Anfrage-User-Agent, und das Blockieren entfernt eine Seite nicht aus der Google-Suche. (developers.google.com)
Anthropic dokumentiert separate Rollen für ClaudeBot, Claude-SearchBot und Claude-User. Anthropic gibt auch an, dass seine Bots robots.txt befolgen und die nicht-standardisierte Crawl-delay-Direktive unterstützen. (support.anthropic.com)
Perplexity unterscheidet zwischen automatischem Such-Crawling und benutzerangefordertem Abruf. Die aktuelle Dokumentation besagt, dass PerplexityBot robots.txt respektiert, während Perplexity-User dies im Allgemeinen nicht tut, da es auf eine Benutzeranfrage reagiert. (docs.perplexity.ai)
Apples aktuelle Dokumentation macht dieselbe Unterscheidung zwischen Suche und Training: Applebot unterstützt die Entdeckung, während Applebot-Extended es Publishern ermöglicht, die Trainingsnutzung zu kontrollieren, ohne Seiten aus der Apple-Suche zu entfernen. (support.apple.com)
Empfohlene robots.txt-Konfigurationen
Platzieren Sie robots.txt im Stammverzeichnis jedes Hosts, zum Beispiel:
text https://www.example.org/robots.txt
Regeln gelten für den spezifischen Host, das Protokoll und den Port, unter dem die Datei bereitgestellt wird. Eine separate Subdomain benötigt möglicherweise eine eigene Datei. (developers.google.com)
Konfiguration 1: Maximale Inklusion
Verwenden Sie dies, wenn öffentliche redaktionelle Inhalte von konformen Crawlern gefunden, zusammengefasst, zitiert, indexiert und gesammelt werden dürfen.
text
Public pages are available to compliant crawlers.
User-agent: * Allow: /
Keep private, transactional, and administrative paths out.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Dies erlaubt benannten Crawlern, einschließlich OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft und Amazon, es sei denn, eine andere spezifische Regel blockiert sie.
Platzieren Sie keine pauschale Regel wie User-agent: * Disallow: / unterhalb dieser Konfiguration. Eine spätere oder spezifischere Gruppe kann die Interpretation der Datei durch einen Crawler ändern.
Konfiguration 2: Suche zulassen, aber Crawler für die Modellentwicklung blockieren
Dies ist oft der beste Kompromiss für Publisher, die Zitate und Suchtraffic wünschen, aber keine Erlaubnis für die Sammlung zur Modellentwicklung signalisieren möchten.
text
Block OpenAI model-development crawling.
User-agent: GPTBot Disallow: /
Block Anthropic model-development crawling.
User-agent: ClaudeBot Disallow: /
Block Google model-training and related grounding use.
User-agent: Google-Extended Disallow: /
Block Apple foundation-model training use.
User-agent: Applebot-Extended Disallow: /
Optional: block Common Crawl dataset collection.
User-agent: CCBot
Disallow: /
Allow ordinary search and retrieval crawling, except for sensitive paths.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Diese Konfiguration lässt OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot und Applebot von der Wildcard-Gruppe abdecken. Sie hält auch Such- und Trainingsberechtigungen getrennt.
Für Apple bewahrt das Blockieren von Applebot-Extended bei gleichzeitiger Zulassung von Applebot die Auffindbarkeit über Apple-Dienste. Für Google blockiert das Blockieren von Google-Extended die normale Google-Suche nicht. (developers.google.com)
Konfiguration 3: Ausgewählte Such-Crawler explizit zulassen
Wenn eine bestehende robots.txt-Datei alle Crawler blockiert, fügen Sie separate Gruppen für die Such-Crawler hinzu, die Sie willkommen heißen möchten.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Keep all other crawlers out.
User-agent: * Disallow: /
Bei der Verwendung spezifischer Gruppen wiederholen Sie die Regeln für sensible Pfade innerhalb jeder Gruppe. Einige Crawler verwenden die spezifischste übereinstimmende Gruppe, anstatt sie mit der Wildcard-Gruppe zu kombinieren. Bing dokumentiert dieses Verhalten direkt, und Google bietet separate Anleitungen für crawler-spezifische Gruppen. (bing.com)
Wichtige robots.txt-Einschränkungen
- Ein Crawler kann robots.txt ignorieren.
- Ein bösartiger Crawler kann vorgeben, ein vertrauenswürdiger Crawler zu sein.
- Eine blockierte Seite kann immer noch durch ihren Titel oder ihre Webadresse bekannt sein.
- Robots.txt schützt keine Passwörter, privaten Dateien, Kundendaten oder vertraulichen Anwendungsprogrammierschnittstellen.
- Eine
Crawl-delay-Direktive ist nicht Teil des Kerns des Robots Exclusion Protocol und wird nicht von jedem Crawler unterstützt. Anthropic und Bing dokumentieren die Unterstützung, während Apple angibt, dass ApplebotCrawl-delaynicht befolgt. (rfc-editor.org)
Meta-Tags und HTTP-Header
Beispiel für eine öffentliche Seite
Verwenden Sie für einen öffentlichen Artikel einen klaren Titel, Autor, eine kanonische Webadresse, das Veröffentlichungsdatum und das Änderungsdatum.
html
Die max-snippet-Direktive ist primär für Google dokumentiert. Gehen Sie nicht davon aus, dass jeder KI-Crawler jede Meta-Direktive unterstützt.
Beispiel für eine private oder sensible Seite
html
Verwenden Sie dies für Seiten, die nicht in den Suchergebnissen erscheinen sollen. Die Seite muss lange genug crawlbar bleiben, damit der Crawler die Direktive sehen kann. Wenn die Seite wirklich privat bleiben muss, verwenden Sie stattdessen Authentifizierung oder Passwortschutz. (developers.google.com)
Nur sensible Abschnitte aus Such-Snippets ausblenden
Google unterstützt data-nosnippet für bestimmte Teile einer HTML-Seite:
html
This paragraph may be shown in a search result.
Dies ist nützlich für Kontaktdaten, interne Notizen oder benutzergenerierte Informationen. Es ist keine universelle Anweisung für jedes System künstlicher Intelligenz. (developers.google.com)
Verwenden Sie den X-Robots-Tag-Header für Dateien
Meta-Tags können nicht in einer Portable Document File, einem Bild oder einer Videodatei platziert werden. Verwenden Sie stattdessen einen HTTP-Antwort-Header:
text X-Robots-Tag: noindex, nosnippet
Für eine Seite, die durchsuchbar bleiben, aber keinen Text für Snippets oder KI-Antworten liefern soll, verwenden Sie:
text X-Robots-Tag: nosnippet
Google dokumentiert X-Robots-Tag für Nicht-HTML-Ressourcen, und Apple unterstützt es auch für Applebot. (developers.google.com)
Apple-spezifische Kontrollen
Apple unterstützt:
html
Apple gibt an, dass nosnippet verhindert, dass die Seite als zusätzlicher Kontext und aktueller Inhalt verwendet wird, wenn Apple-Modelle Ausgaben generieren. Die Seite kann weiterhin über Apple Search, Spotlight, Siri und Safari auffindbar bleiben. (support.apple.com)
Für Paywall-Seiten unterstützt Apple auch strukturierte Daten mit:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple gibt an, dass solche Seiten weiterhin für Suchergebnisse in Frage kommen können, aber nicht als zusätzlicher Kontext für KI-Antworten verwendet werden. (support.apple.com)
So überprüfen Sie die Internet-Protokoll-Adressen von Crawlern
Warum User-Agent-Matching nicht ausreicht
Eine Regel wie diese ist schwach:
text if User-Agent contains "GPTBot": allow
Jeder kann diesen Text senden. Eine bessere Regel lautet:
text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block
Vertrauen Sie einem X-Forwarded-For-Header nicht, es sei denn, er stammt von einem Proxy oder Content Delivery Network, das Ihre Organisation kontrolliert.
Anbieter-Verifizierungsmethoden
| Anbieter | Empfohlene Verifizierungsmethode |
|---|---|
| OpenAI | Verwenden Sie die in der OpenAI-Crawler-Dokumentation für OAI-SearchBot, GPTBot und OAI-AdsBot veröffentlichten Live-IP-Adressen-Feeds. Aktualisieren Sie diese automatisch, anstatt feste Bereiche in eine Firewall zu kopieren. |
| Verwenden Sie Googles veröffentlichte Crawler-Bereiche oder führen Sie Reverse- und Forward-Domain-Name-System (DNS)-Prüfungen durch. Ein echter Google-Crawler sollte zu einem genehmigten Google-Hostnamen auflösen und wieder zur ursprünglichen Adresse zurückauflösen. | |
| Anthropic | Verwenden Sie den aktuell veröffentlichten Crawler-Adress-Feed als sekundäre Netzwerkprüfung. Anthropic’s primäre Opt-out-Methode bleibt robots.txt. |
| Perplexity | Kombinieren Sie den User-Agent mit dem aktuellen PerplexityBot- oder Perplexity-User-Adress-Feed. Perplexity empfiehlt ausdrücklich, beide Bedingungen in einer Web Application Firewall-Regel zu kombinieren. |
| Apple | Verwenden Sie die Reverse Domain Name System (DNS)-Verifizierung unter applebot.apple.com und führen Sie dann eine Forward-Abfrage durch. Apple veröffentlicht auch aktuelle Adressbereiche in einem JSON-Feed. |
| Common Crawl | Verwenden Sie die Reverse Domain Name System (DNS)-Verifizierung unter crawl.commoncrawl.org und den aktuellen CCBot-Adress-Feed. Common Crawl merkt an, dass die Reverse-Verifizierung für einen Teil des IPv6-Traffics noch nicht verfügbar ist. |
| Microsoft | Verwenden Sie das offizielle Verify Bingbot-Tool oder Microsofts dokumentierte Reverse- und Forward-Lookup-Methoden. |
| Amazon | Verwenden Sie Amazons veröffentlichte Crawler-Adresslisten und gleichen Sie sie mit dem entsprechenden Amazon-User-Agent ab. |
Google, Apple, Common Crawl, OpenAI, Anthropic und Perplexity veröffentlichen alle anbieterspezifische Methoden oder Adress-Feeds. Diese Listen können sich ändern, daher ist ein geplanter Aktualisierungsprozess sicherer als eine permanent manuell kopierte Liste. (developers.google.com)
Ein einfaches Firewall-Design könnte so aussehen:
text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match
rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers
Wenden Sie keine pauschale Erlaubnisregel auf einen gesamten Cloud-Anbieter an. Ein legitimer Crawler kann Cloud-Infrastruktur nutzen, aber der größte Teil des Traffics von diesem Cloud-Anbieter ist nicht unbedingt der Crawler.
Wie offene Lizenzierung die Inklusion beeinflusst
CC BY 4.0 in einfacher Sprache
Die Creative Commons Attribution 4.0 International Lizenz, gemeinhin als CC BY 4.0 bezeichnet, erlaubt es Personen, zu:
- das Werk zu kopieren und weiterzuverbreiten
- es anzupassen, zu übersetzen, zu remixen und darauf aufzubauen
- es kommerziell zu nutzen
Die Hauptbedingungen sind:
- Angemessene Namensnennung
- Auf die Lizenz verlinken
- Angeben, ob Änderungen vorgenommen wurden
- Nicht suggerieren, dass der ursprüngliche Urheber die Wiederverwendung befürwortet
- Keine rechtlichen oder technischen Beschränkungen hinzufügen, die durch die Lizenz erlaubte Nutzungen verhindern
Creative Commons warnt auch davor, dass die Lizenz möglicherweise keine Datenschutzrechte, Persönlichkeitsrechte, Urheberpersönlichkeitsrechte, Markenrechte, Patentrechte oder Materialien Dritter abdeckt. (creativecommons.org)
Eine Lizenz ist keine Crawler-Einladung an sich
Das Anbringen von „CC BY 4.0“ auf einer Seite garantiert nicht, dass eine Organisation diese crawlen wird. Ein Crawler kann weiterhin blockiert werden durch:
- robots.txt
- Ein Content Delivery Network
- Eine Web Application Firewall
- Ratenbegrenzung
- Eine JavaScript-Challenge
- Eine Login-Wall
- Eine schlechte Serverantwort
- Eine unzugängliche Sitemap
Umgekehrt gewährt das Zulassen eines Crawlers nicht automatisch jede für jede spätere Nutzung erforderliche Urheberrechtserlaubnis. Robots.txt und Lizenzierung sollten gemeinsam gestaltet werden.
Warum CC BY eine breitere Inklusion unterstützen kann
Eine klare permissive Lizenz kann die Richtlinien eines Publishers für Datenteams, Suchsysteme und Assistentenbetreiber leichter verständlich machen. Sie kann die Unsicherheit in Bezug auf das Kopieren, Anpassen, die kommerzielle Nutzung, die Übersetzung und die Weiterverbreitung verringern, wenn diese Aktivitäten eine urheberrechtliche Genehmigung erfordern.
Creative Commons erklärt jedoch, dass das Training künstlicher Intelligenz rechtlich komplex ist. Eine restriktive Lizenz ist nicht immer ein effektiver Weg, um das Training zu verhindern, da einige Trainingsnutzungen durch Urheberrechtsausnahmen oder -beschränkungen zulässig sein können. Creative Commons weist auch darauf hin, dass Lizenzbedingungen schwierig auf maschinelles Training und Modellausgaben anzuwenden sein können. (creativecommons.org)
Die praktische Lehre ist:
Verwenden Sie CC BY, wenn Sie tatsächlich eine breite rechtmäßige Wiederverwendung wünschen. Verwenden Sie keine restriktive Creative Commons-Lizenz als garantierten Opt-out für das Training künstlicher Intelligenz.
Attribution verbessert die Quellenklarheit
Creative Commons empfiehlt die TASL-Methode:
- Titel
- Autor
- Quelle
- Lizenz
Zum Beispiel:
„Lizenzierung und Robots für maximale Inklusion“, Beispiel Verlag, https://www.example.org/articles/ai-crawlers, lizenziert unter Creative Commons Attribution 4.0 International. Vorgenommene Änderungen: Crawler-Inventar aktualisiert.
Eine klare Namensnennung zwingt nicht jeden Assistenten, eine Seite zu zitieren. Sie erleichtert jedoch die korrekte Zitierung, wenn ein System den Titel, den Autor, die Quelle und die Lizenzinformationen der Seite extrahiert. (wiki.creativecommons.org)
Strukturierte Artikelinformationen hinzufügen
Verwenden Sie sichtbare Informationen und strukturierte Daten zusammen:
html
Google empfiehlt klare Autoreninformationen, Autorenseiten, Veröffentlichungsdaten, Änderungsdaten und stabile kanonische Seiten. Diese Signale können Suchsystemen helfen zu verstehen, wer das Material erstellt hat und welche Version maßgebend ist. Sie garantieren keine Platzierung, Aufnahme oder Zitierung. (developers.google.com)
Rechtliche Standardformulierungen für eine offene, zitierfreundliche Website
Das Folgende ist ein Beispieltext, keine Rechtsberatung. Lassen Sie es von einem Anwalt an Ihre Gerichtsbarkeit, Eigentümerstruktur, Datenschutzpflichten und Inhalte Dritter anpassen.
CC BY 4.0 Lizenzhinweis
text
Inhaltslizenz
Sofern nicht anders angegeben, sind der Originaltext und die originalen redaktionellen Materialien auf dieser Seite unter der Creative Commons Attribution 4.0 International Lizenz lizenziert:
https://creativecommons.org/licenses/by/4.0/
Diese Erlaubnis gestattet das Kopieren, die Weiterverbreitung, Anpassung, Übersetzung, kommerzielle Nutzung, maschinenlesbare Verarbeitung, Suchindexierung, den Abruf, die Zusammenfassung und die Verwendung in Systemen künstlicher Intelligenz, sofern die Lizenzbedingungen eingehalten werden.
Bevorzugte Namensnennung:
„[Seitentitel]“, von [Autor oder Organisation], [kanonische Seitenadresse], veröffentlicht oder aktualisiert am [Datum], lizenziert unter Creative Commons Attribution 4.0 International. Vorgenommene Änderungen: [Änderungen beschreiben, oder „keine“ angeben].
Bitte bewahren Sie die Informationen zu Autor, Publisher, Quelle, Lizenz und Änderungen nach Möglichkeit auf. Dieser bevorzugte Leitfaden zur Namensnennung fügt der Creative Commons-Lizenz keine Einschränkungen hinzu und ersetzt den Lizenztext nicht.
Der Satz „einschließlich Systemen künstlicher Intelligenz“ verdeutlicht die Absicht des Publishers. Er sollte nicht verwendet werden, um vorzugeben, dass der Publisher Rechte an Material besitzt, das von jemand anderem erstellt wurde.
Hinweis zu Marke, Datenschutz und Rechten Dritter
text
Marke, Datenschutz und Rechte Dritter
Die oben genannte Lizenz deckt nur die als lizenziert gekennzeichneten Originalmaterialien ab. Sie gewährt keine Genehmigung zur Nutzung von:
- Marken, Dienstleistungsmarken, Logos oder Handelsaufmachung
- Namen, Bildern oder Abbildungen von Personen
- Privaten, vertraulichen, Konto-, Gesundheits-, Finanz- oder Sicherheitsinformationen
- Benutzereingaben, es sei denn, sie sind separat als lizenziert gekennzeichnet
- Fotografien, Illustrationen, Karten, Videos, Musik, Zitaten oder anderen Materialien Dritter
- Inhalten, die als „alle Rechte vorbehalten“ gekennzeichnet oder einer separaten Lizenz unterliegen
Die Verwendung des Namens, der Logos und Marken des Beispiel Verlags darf keine Förderung, Genehmigung, Partnerschaft oder Unterstützung suggerieren. Bitte verlinken Sie auf die Originalseite und unterscheiden Sie deutlich Zitate, Paraphrasen, Zusammenfassungen und generiertes Material.
Diese Formulierung ist wichtig, da Creative Commons-Lizenzen nicht automatisch jede Art von rechtlichem Recht gewähren, das mit einer Seite verbunden ist. (creativecommons.org)
Leitlinien für Such- und Assistenten-Zitierung
text
Leitlinien für Such- und Assistenten-Zitierung
Wir begrüßen die konforme Suchindexierung, den benutzerangeforderten Abruf, die Zitierung und die Zusammenfassung des lizenzierten Materials auf dieser Website.
Wenn Sie diese Website zitieren, verwenden Sie bitte den Seitentitel, den Autor oder Publisher, die kanonische Seitenadresse, das Veröffentlichungs- oder Aktualisierungsdatum und einen direkten Link zur Quelle. Bitte identifizieren Sie die Quelle als eine Eingabe unter allen verwendeten Quellen, unterscheiden Sie generierte Analysen von zitiertem Material und geben Sie nicht an oder implizieren Sie, dass der Beispiel Verlag eine generierte Antwort, ein Produkt, eine Person oder einen Dienst befürwortet.
Diese Richtlinie soll die Genauigkeit und Attribution verbessern. Sie gewährt keine Rechte über die anwendbare Inhaltslizenz hinaus und lizenziert keine Marken, persönlichen Informationen, vertraulichen Informationen oder Materialien Dritter.
Wenn Sie Suchsichtbarkeit wünschen, aber keine breite Trainingslizenz gewähren möchten
text
Suchzugriff und Urheberrecht
Unsere öffentlichen Seiten können von konformen Such- und Abruf-Crawlern, die in unserer robots.txt-Datei aufgeführt sind, aufgerufen werden. Diese Erlaubnis soll die Entdeckung, Suchergebnisse, benutzerangeforderten Abruf und Zitierung unterstützen.
Sofern keine separate Lizenz angegeben ist, bleibt der Originalinhalt „alle Rechte vorbehalten“. Der Zugriff auf eine öffentliche Seite gewährt keine separate Lizenz für Modellentwicklung, Training, Weiterverbreitung, kommerzielle Wiederverwendung oder die Erstellung abgeleiteter Werke über die durch anwendbares Recht gewährten Rechte hinaus.
Bitte zitieren Sie die kanonische Seitenadresse und den Publisher, wenn Sie auf dieses Material verweisen. Nichts auf dieser Website gewährt die Erlaubnis zur Nutzung von Marken, Logos, persönlichen Informationen, vertraulichen Informationen oder Inhalten Dritter.
Platzieren Sie die CC BY-Erklärung und die „alle Rechte vorbehalten“-Erklärung nicht über dasselbe Material. Identifizieren Sie klar, welche Lizenz für welchen Inhalt gilt.
Risiko-Nutzen-Matrix für offene Lizenzierung
Das Urheberrecht und die Regeln für das Training künstlicher Intelligenz unterscheiden sich je nach Land und sind weiterhin ungeklärt. Das US-amerikanische Copyright Office untersucht diese Fragen weiterhin, während Creative Commons das Training künstlicher Intelligenz als fallspezifisch und rechtlich komplex beschreibt. (copyright.gov)
| Ansatz | Inklusionspotenzial | Hauptvorteile | Hauptrisiken | Am besten geeignet |
|---|---|---|---|---|
| CC BY 4.0 | Sehr hoch | Breites Kopieren, Anpassen, kommerzielle Nutzung, Übersetzung, Indexierung und modellbezogene Wiederverwendung, wenn Urheberrechtserlaubnis erforderlich ist | Kommerzielle Wettbewerber können den Inhalt wiederverwenden oder anpassen; die Namensnennung kann unvollkommen sein; die Lizenz kann Datenschutz-, Marken- oder Drittrechte nicht kontrollieren | Publisher, die die weiteste rechtmäßige Wiederverwendung und starke Quellenattribution wünschen |
| CC BY-SA 4.0 | Hoch, aber komplexer | Fördert einen offenen Teilungszyklus und erfordert, dass Anpassungen unter kompatiblen Bedingungen bleiben | ShareAlike-Regeln können schwierig auf Datensätze, Modelltraining und öffentliche Ausgaben anzuwenden sein; einige Organisationen meiden das Material möglicherweise aufgrund von Unsicherheit | Offene Bildungs- und Gemeinwohlprojekte, die möchten, dass nachgelagerte Anpassungen offen bleiben |
| CC BY-NC 4.0 | Mittel oder niedrig | Beschränkt Nutzungen, die primär auf kommerziellen Vorteil oder monetäre Vergütung abzielen | „Nicht-kommerziell“ kann schwierig zu interpretieren sein; kann kommerzielle Such-, Modell- und Assistenten-Nutzungen ausschließen; es ist kein garantierter Trainings-Opt-out | Material, das für gemeinnützige, Bildungs- oder Gemeinschaftszwecke bestimmt ist |
| CC BY-ND 4.0 | Mittel | Ermöglicht die Weitergabe, während Anpassungen eingeschränkt werden | Übersetzung, Transformation und einige Assistenten-Anwendungsfälle können rechtlich unsicher werden; weniger attraktiv für Systeme, die zusammenfassen oder remixen | Offizielle Mitteilungen oder Werke, die unverändert bleiben müssen |
| CC0 oder Widmung an die Gemeinfreiheit | Sehr hoch | Vereinfacht die Wiederverwendung und entfernt die meisten Urheberrechtsbedingungen, wo rechtlich wirksam | Keine erforderliche Namensnennung; schwache Kontrolle über die Markenpräsentation; Datenschutz-, Marken- und Persönlichkeitsrechte bleiben getrennt | Fakten, Datensätze, Referenzmaterial oder Werke, die für eine uneingeschränkte Wiederverwendung bestimmt sind |
| Alle Rechte vorbehalten plus offenes Such-Crawling | Hoch für die Suche, niedriger für das Training | Kann Such- und Zitationssichtbarkeit bewahren, ohne eine breite Wiederverwendungslizenz zu gewähren | Mehr rechtliche Unsicherheit für Modellentwickler; kann die Aufnahme in Trainingsdatensätze und kommerzielle Wiederverwendungssysteme reduzieren | Publisher, die Entdeckung und Zitate wünschen, aber breitere Lizenzen lieber separat verhandeln |
Die ausgewogenste Strategie für viele Organisationen ist:
- CC BY 4.0 für originalen öffentlichen redaktionellen Text
- Separate Kennzeichnungen für Materialien Dritter
- Keine öffentlichen persönlichen oder vertraulichen Informationen
- Such- und Abruf-Crawler zulassen
- Crawler für die Modellentwicklung nur zulassen, wenn die Organisation diese Nutzung wirklich akzeptiert
- Klare Namensnennung und kanonische Links verwenden
- Marken durch einen separaten Markenhinweis schützen
Eine praktische Implementierungscheckliste
Inhalt und Lizenzierung
- Identifizieren Sie, wem jede Seite, jedes Bild, Diagramm, Video und Zitat gehört.
- Lizenzieren Sie nur Material, für das Ihre Organisation die Rechte kontrolliert.
- Markieren Sie Material Dritter separat.
- Fügen Sie einen sichtbaren Lizenzhinweis hinzu.
- Geben Sie eine bevorzugte Zitierung mit Titel, Autor, Quelle und Lizenz an.
- Halten Sie Logos, Marken, persönliche Daten und vertrauliche Informationen außerhalb des Lizenzumfangs.
Robots.txt
- Erstellen Sie eine öffentliche robots.txt-Datei im Stammverzeichnis jedes Hosts.
- Erlauben Sie Such-Crawler getrennt von Trainings-Crawlern.
- Blockieren Sie administrative, Konto-, Checkout-, private und interne Anwendungspfade.
- Verlassen Sie sich bei der Sicherheit nicht auf robots.txt.
- Testen Sie die Datei nach jeder größeren Website-Bereitstellung.
Meta-Tags
- Verwenden Sie kanonische Links.
- Fügen Sie Autor, Veröffentlichungsdatum und Änderungsdatum hinzu.
- Verwenden Sie
noindexfür Seiten, die nicht in der Suche erscheinen sollen. - Verwenden Sie
nosnippetoderdata-nosnippetfür sensible Auszüge, wo unterstützt. - Verwenden Sie
X-Robots-Tagfür Portable Document Files, Bilder und andere Nicht-HTML-Ressourcen. - Denken Sie daran, dass ein Crawler eine Seite abrufen können muss, bevor er ihre Meta-Tags lesen kann.
Netzwerksicherheit
- Protokollieren Sie User-Agent-Strings, Quelladressen, Antwortcodes und Anforderungspfade.
- Verifizieren Sie vertrauenswürdige Crawler mithilfe offizieller Adress-Feeds oder Domain Name System (DNS)-Methoden.
- Aktualisieren Sie Adress-Feeds automatisch.
- Kombinieren Sie User-Agent- und Quelladressenprüfungen.
- Begrenzen Sie die Rate verifizierter Crawler, anstatt ihnen uneingeschränkten Zugriff zu gewähren.
- Fordern Sie Anfragen heraus oder blockieren Sie diese, wenn sie vorgeben, vertrauenswürdige Crawler zu sein, die Verifizierung aber fehlschlägt.
Messung
Verfolgen Sie:
- Besuche von KI-Suchdiensten
- Verweise auf die Originalseite
- Zitationshäufigkeit
- Serverlast pro Crawler
- Anfragen, die
403,404oder429zurückgeben - Crawler-Zugriff auf unbeabsichtigte Pfade
- Ob aktuelle Artikel nach der Veröffentlichung gefunden werden
Fazit
Maximale Inklusion erfordert selektive Offenheit, nicht eine einzige pauschale Genehmigung.
Verwenden Sie robots.txt, um die Suche, den Benutzerabruf, das Training und das Crawling öffentlicher Datensätze zu trennen. Verwenden Sie Meta-Tags und HTTP-Header, um die Indexierung und Snippets zu verwalten. Verwenden Sie Authentifizierung für alles Private. Überprüfen Sie die Internet-Protokoll-Adressen von Crawlern, anstatt sich allein auf User-Agent-Namen zu verlassen.
Eine permissive Lizenz wie CC BY 4.0 kann die breite Wiederverwendung erleichtern, wenn Sie dies wirklich wünschen. Klare Attributionsinformationen – Titel, Autor, Quelle, Lizenz, kanonische Seite und Aktualisierungsdatum – können Suchsystemen und Assistenten auch erleichtern, die korrekte Quelle zu identifizieren und zu zitieren.
Die stärkste Veröffentlichungsstrategie ist daher:
**Öffnen Sie die öffentlichen Inhalte, die Sie entdeckt wissen möchten, lizenzieren Sie klar das Material, das Sie wiederverwenden möchten, kennzeichnen Sie das Material, das Ihnen nicht gehört, schützen Sie private Informationen auf Serverebene und geben Sie jedem Crawler eine separate, überprüfbare Genehmigung.
Auto