AutoPodAutoPod

Lizenzierung und Robots für maximale Inklusion: Wie man KI-Crawler willkommen heißt

23 Min. Lesezeit
Audio-Artikel
Lizenzierung und Robots für maximale Inklusion: Wie man KI-Crawler willkommen heißt
0:000:00
Lizenzierung und Robots für maximale Inklusion: Wie man KI-Crawler willkommen heißt

Lizenzierung und Robots für maximale Inklusion: Wie man Künstliche Intelligenz-Crawler willkommen heißt

Aktualisiert am 25. August 2026

Websites haben heute mehr als eine Möglichkeit, ein Publikum zu erreichen. Eine Seite kann über die Google-Suche gefunden, von ChatGPT zusammengefasst, von Perplexity zitiert, in der Claude-Suche verwendet, über Apple-Dienste angezeigt oder von einem öffentlichen Webarchiv gesammelt werden.

Diese Systeme verwenden nicht alle denselben Crawler oder folgen denselben Regeln. Eine Website, die GPTBot blockiert, kann dennoch in der ChatGPT-Suche erscheinen, wenn sie OAI-SearchBot zulässt. Eine Website, die Applebot zulässt, kann in der Apple-Suche sichtbar bleiben, während Applebot-Extended vom Training von Modellen künstlicher Intelligenz ausgeschlossen wird. Googles Google-Extended ist überhaupt kein normaler Crawler; es ist ein robots.txt-Kontrolltoken.

Die beste Strategie ist daher nicht einfach „Künstliche Intelligenz zulassen“ oder „Künstliche Intelligenz blockieren“. Vielmehr geht es darum, separate Berechtigungen zu erstellen für:

  1. Suche und Entdeckung
  2. Vom Benutzer angeforderte Abrufe
  3. Modellentwicklung und -training
  4. Öffentliche Datensätze
  5. Sensible, private oder eingeschränkte Materialien

Dieser Artikel bietet eine aktuelle Crawler-Bestandsaufnahme, robots.txt-Beispiele, Meta-Tag-Anleitungen, Methoden zur Überprüfung von Internet-Protokoll-Adressen, Ratschläge zur Creative Commons-Lizenzierung, juristische Standardformulierungen und eine Risiko-Nutzen-Matrix.

Die vier Kontrollen, die jeder Publisher verstehen sollte

1. robots.txt steuert angefordertes Crawling

Eine robots.txt-Datei teilt konformen automatisierten Clients mit, welche Seiten sie anfordern dürfen. Sie ist nützlich für die Verwaltung des Crawler-Traffics und zur Äußerung der Präferenzen eines Publishers.

Robots.txt ist jedoch kein Zugriffskontrollsystem. Das Robots Exclusion Protocol besagt, dass seine Regeln keine Zugriffsberechtigung darstellen. Google warnt auch davor, dass eine blockierte Adresse immer noch in den Suchergebnissen erscheinen kann, wenn andere Seiten darauf verlinken. Verwenden Sie Passwörter, Authentifizierung oder serverseitige Zugriffskontrollen für vertrauliche Informationen. (rfc-editor.org)

2. Meta-Tags steuern Indexierung und Snippets

Robots-Meta-Tags und der X-Robots-Tag-Antwort-Header können steuern, ob eine Seite indexiert wird oder ob eine Suchmaschine ein Snippet anzeigen darf.

Diese Kontrollen sind normalerweise erst sichtbar, nachdem ein Crawler die Seite abrufen durfte. Wenn robots.txt die Seite zuerst blockiert, sieht der Crawler den Meta-Tag möglicherweise nie. (developers.google.com)

3. Netzwerkkontrollen verifizieren den Crawler

Ein User-Agent-Name lässt sich leicht kopieren. Ein Angreifer kann eine Anfrage senden, die vorgibt, GPTBot, Googlebot oder PerplexityBot zu sein.

Ein stärkerer Ansatz kombiniert:

  • Der angegebene User-Agent
  • Ein veröffentlichter Internet-Protokoll-Adressbereich
  • Reverse Domain Name System (DNS)-Verifizierung
  • Forward Domain Name System (DNS)-Verifizierung
  • Ratenbegrenzungen und Anfragenüberwachung

4. Eine Lizenz gewährt Wiederverwendungsrechte

Robots.txt gibt an, was ein Crawler tun soll. Eine Lizenz gibt an, was Personen oder Organisationen rechtlich mit Material tun dürfen, wenn eine Urheberrechtserlaubnis erforderlich ist.

Dies sind unterschiedliche Werkzeuge. Eine permissive Lizenz kann die rechtliche Unsicherheit verringern, garantiert aber nicht, dass ein Crawler die Seite besucht, dass ein Modell sie verwendet oder dass ein Assistent sie zitiert.

Inventar wichtiger Crawler

Das folgende Inventar wurde anhand der am 25. August 2026 verfügbaren Anbieterdokumentation überprüft. User-Agent-Namen, Zwecke und Internet-Protokoll-Adressbereiche können sich ändern, daher sollten Produktionssysteme die aktuelle Dokumentation und Live-Adress-Feeds des Anbieters verwenden.

AnbieterCrawler oder robots.txt-TokenHauptzweckWichtige Kontrolle
OpenAIOAI-SearchBotFindet und analysiert Seiten für die ChatGPT-SucheErlauben Sie es, um die Wahrscheinlichkeit zu erhöhen, dass Seiten in den ChatGPT-Suchergebnissen erscheinen.
OpenAIGPTBotSammelt Seiten, die zum Training von OpenAIs generativen Modellen künstlicher Intelligenz verwendet werden könnenErlauben oder verbieten Sie dies getrennt von der Suche.
OpenAIChatGPT-UserRuft Seiten ab, nachdem ein Benutzer ChatGPT oder einen benutzerdefinierten GPT gebeten hat, darauf zuzugreifenEs wird vom Benutzer ausgelöst und ist kein automatischer Webcrawler, daher gelten robots.txt-Regeln möglicherweise nicht.
OpenAIOAI-AdsBotÜberprüft Webseiten, die als ChatGPT-Werbeziele eingereicht wurdenHauptsächlich für Werbetreibende relevant. Der gesammelte Inhalt wird nicht zum Training generativer KI-Grundlagenmodelle verwendet.
GoogleGooglebotHaupt-Google-Such-CrawlerSteuert das normale Google-Such-Crawling.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-NewsBilder, Videos und Google NewsDiese haben separate robots.txt-Token und können unabhängig gesteuert werden.
GoogleGoogleOtherAllgemeines Google-Crawling für verschiedene Produktteams, einschließlich Forschung und EntwicklungEs repräsentiert kein spezifisches Google-Produkt.
GoogleGoogle-ExtendedSteuert, ob von Google gecrawlte Inhalte für das Gemini-Modelltraining und bestimmte Grounding-Systeme verwendet werden dürfenEs ist ein robots.txt-Kontrolltoken, kein separater Request User-Agent. Es beeinflusst nicht die normale Aufnahme in die Google-Suche.
AnthropicClaudeBotSammelt öffentliche Webinhalte, die zur Entwicklung von Claude-Modellen beitragen könnenVerbieten Sie es, um zu signalisieren, dass zukünftiges Material aus den Anthropic-Trainingsdatensätzen ausgeschlossen werden sollte.
AnthropicClaude-SearchBotVerbessert die Qualität der Claude-SuchergebnisseErlauben Sie es für die Sichtbarkeit in der Claude-Suche.
AnthropicClaude-UserRuft Seiten als Reaktion auf eine Benutzeranfrage an Claude abGetrennt vom automatischen Crawling.
PerplexityPerplexityBotIndexiert Seiten für Perplexity-SuchergebnissePerplexity gibt an, dass dieser Crawler nicht zum Sammeln von Inhalten für das Training von KI-Grundlagenmodellen verwendet wird.
PerplexityPerplexity-UserRuft eine Seite ab, nachdem ein Benutzer sie angefordert hatDie Dokumentation von Perplexity besagt, dass dieser Fetcher robots.txt im Allgemeinen ignoriert, da die Anfrage von einem Benutzer initiiert wurde.
AppleApplebotUnterstützt Apple Search, Spotlight, Siri, Safari und andere Apple-ErlebnisseErlauben Sie es für die Apple-Entdeckung.
AppleApplebot-ExtendedSteuert, ob von Applebot gecrawlte Inhalte zum Training von Apple-Grundlagenmodellen verwendet werden dürfenEs crawlt selbst keine Seiten. Es ist eine Datenverwendungskontrolle.
Common CrawlCCBotSammelt öffentliche Webdaten für Common Crawls offenes WebarchivEs ist kein Assistent, aber seine Datensätze können von Forschern und KI-Entwicklern genutzt werden.
MicrosoftBingbotHaupt-Bing-Such-CrawlerErlauben Sie es für die Bing-Entdeckung und Suchsichtbarkeit.
MicrosoftMicrosoftPreview, BingVideoPreviewSeiten- und Videovorschauen für Microsoft-ProdukteDiese können getrennt von Bingbot gesteuert werden.
AmazonAmzn-SearchBotAmazon-Suche und Content-EntdeckungAmazon gibt an, keine Inhalte für das Training generativer KI-Modelle zu crawlen.
AmazonAmzn-UserRuft aktuelle Informationen als Reaktion auf Benutzeraktionen ab, einschließlich Alexa-AnfragenBenutzergesteuert und getrennt vom automatischen Such-Crawling.

OpenAI dokumentiert seine Such-, Trainings-, Werbe- und benutzergesteuerten Crawler als separate Kontrollen. Die Dokumentation empfiehlt ausdrücklich, OAI-SearchBot für die ChatGPT-Suche zuzulassen, während GPTBot separat für Trainingspräferenzen verwendet wird. (developers.openai.com)

Google trennt ebenfalls Googlebot, GoogleOther und Google-Extended. Google-Extended hat keinen eigenen HTTP-Anfrage-User-Agent, und das Blockieren entfernt eine Seite nicht aus der Google-Suche. (developers.google.com)

Anthropic dokumentiert separate Rollen für ClaudeBot, Claude-SearchBot und Claude-User. Anthropic gibt auch an, dass seine Bots robots.txt befolgen und die nicht-standardisierte Crawl-delay-Direktive unterstützen. (support.anthropic.com)

Perplexity unterscheidet zwischen automatischem Such-Crawling und benutzerangefordertem Abruf. Die aktuelle Dokumentation besagt, dass PerplexityBot robots.txt respektiert, während Perplexity-User dies im Allgemeinen nicht tut, da es auf eine Benutzeranfrage reagiert. (docs.perplexity.ai)

Apples aktuelle Dokumentation macht dieselbe Unterscheidung zwischen Suche und Training: Applebot unterstützt die Entdeckung, während Applebot-Extended es Publishern ermöglicht, die Trainingsnutzung zu kontrollieren, ohne Seiten aus der Apple-Suche zu entfernen. (support.apple.com)

Empfohlene robots.txt-Konfigurationen

Platzieren Sie robots.txt im Stammverzeichnis jedes Hosts, zum Beispiel:

text https://www.example.org/robots.txt

Regeln gelten für den spezifischen Host, das Protokoll und den Port, unter dem die Datei bereitgestellt wird. Eine separate Subdomain benötigt möglicherweise eine eigene Datei. (developers.google.com)

Konfiguration 1: Maximale Inklusion

Verwenden Sie dies, wenn öffentliche redaktionelle Inhalte von konformen Crawlern gefunden, zusammengefasst, zitiert, indexiert und gesammelt werden dürfen.

text

Public pages are available to compliant crawlers.

User-agent: * Allow: /

Keep private, transactional, and administrative paths out.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Dies erlaubt benannten Crawlern, einschließlich OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft und Amazon, es sei denn, eine andere spezifische Regel blockiert sie.

Platzieren Sie keine pauschale Regel wie User-agent: * Disallow: / unterhalb dieser Konfiguration. Eine spätere oder spezifischere Gruppe kann die Interpretation der Datei durch einen Crawler ändern.

Konfiguration 2: Suche zulassen, aber Crawler für die Modellentwicklung blockieren

Dies ist oft der beste Kompromiss für Publisher, die Zitate und Suchtraffic wünschen, aber keine Erlaubnis für die Sammlung zur Modellentwicklung signalisieren möchten.

text

Block OpenAI model-development crawling.

User-agent: GPTBot Disallow: /

Block Anthropic model-development crawling.

User-agent: ClaudeBot Disallow: /

Block Google model-training and related grounding use.

User-agent: Google-Extended Disallow: /

Block Apple foundation-model training use.

User-agent: Applebot-Extended Disallow: /

Optional: block Common Crawl dataset collection.

User-agent: CCBot

Disallow: /

Allow ordinary search and retrieval crawling, except for sensitive paths.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Diese Konfiguration lässt OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot und Applebot von der Wildcard-Gruppe abdecken. Sie hält auch Such- und Trainingsberechtigungen getrennt.

Für Apple bewahrt das Blockieren von Applebot-Extended bei gleichzeitiger Zulassung von Applebot die Auffindbarkeit über Apple-Dienste. Für Google blockiert das Blockieren von Google-Extended die normale Google-Suche nicht. (developers.google.com)

Konfiguration 3: Ausgewählte Such-Crawler explizit zulassen

Wenn eine bestehende robots.txt-Datei alle Crawler blockiert, fügen Sie separate Gruppen für die Such-Crawler hinzu, die Sie willkommen heißen möchten.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Keep all other crawlers out.

User-agent: * Disallow: /

Bei der Verwendung spezifischer Gruppen wiederholen Sie die Regeln für sensible Pfade innerhalb jeder Gruppe. Einige Crawler verwenden die spezifischste übereinstimmende Gruppe, anstatt sie mit der Wildcard-Gruppe zu kombinieren. Bing dokumentiert dieses Verhalten direkt, und Google bietet separate Anleitungen für crawler-spezifische Gruppen. (bing.com)

Wichtige robots.txt-Einschränkungen

  • Ein Crawler kann robots.txt ignorieren.
  • Ein bösartiger Crawler kann vorgeben, ein vertrauenswürdiger Crawler zu sein.
  • Eine blockierte Seite kann immer noch durch ihren Titel oder ihre Webadresse bekannt sein.
  • Robots.txt schützt keine Passwörter, privaten Dateien, Kundendaten oder vertraulichen Anwendungsprogrammierschnittstellen.
  • Eine Crawl-delay-Direktive ist nicht Teil des Kerns des Robots Exclusion Protocol und wird nicht von jedem Crawler unterstützt. Anthropic und Bing dokumentieren die Unterstützung, während Apple angibt, dass Applebot Crawl-delay nicht befolgt. (rfc-editor.org)

Meta-Tags und HTTP-Header

Beispiel für eine öffentliche Seite

Verwenden Sie für einen öffentlichen Artikel einen klaren Titel, Autor, eine kanonische Webadresse, das Veröffentlichungsdatum und das Änderungsdatum.

html

Die max-snippet-Direktive ist primär für Google dokumentiert. Gehen Sie nicht davon aus, dass jeder KI-Crawler jede Meta-Direktive unterstützt.

Beispiel für eine private oder sensible Seite

html

Verwenden Sie dies für Seiten, die nicht in den Suchergebnissen erscheinen sollen. Die Seite muss lange genug crawlbar bleiben, damit der Crawler die Direktive sehen kann. Wenn die Seite wirklich privat bleiben muss, verwenden Sie stattdessen Authentifizierung oder Passwortschutz. (developers.google.com)

Nur sensible Abschnitte aus Such-Snippets ausblenden

Google unterstützt data-nosnippet für bestimmte Teile einer HTML-Seite:

html

This paragraph may be shown in a search result.

Personal telephone numbers, private email addresses, or internal notes go here.

Dies ist nützlich für Kontaktdaten, interne Notizen oder benutzergenerierte Informationen. Es ist keine universelle Anweisung für jedes System künstlicher Intelligenz. (developers.google.com)

Verwenden Sie den X-Robots-Tag-Header für Dateien

Meta-Tags können nicht in einer Portable Document File, einem Bild oder einer Videodatei platziert werden. Verwenden Sie stattdessen einen HTTP-Antwort-Header:

text X-Robots-Tag: noindex, nosnippet

Für eine Seite, die durchsuchbar bleiben, aber keinen Text für Snippets oder KI-Antworten liefern soll, verwenden Sie:

text X-Robots-Tag: nosnippet

Google dokumentiert X-Robots-Tag für Nicht-HTML-Ressourcen, und Apple unterstützt es auch für Applebot. (developers.google.com)

Apple-spezifische Kontrollen

Apple unterstützt:

html

Apple gibt an, dass nosnippet verhindert, dass die Seite als zusätzlicher Kontext und aktueller Inhalt verwendet wird, wenn Apple-Modelle Ausgaben generieren. Die Seite kann weiterhin über Apple Search, Spotlight, Siri und Safari auffindbar bleiben. (support.apple.com)

Für Paywall-Seiten unterstützt Apple auch strukturierte Daten mit:

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Apple gibt an, dass solche Seiten weiterhin für Suchergebnisse in Frage kommen können, aber nicht als zusätzlicher Kontext für KI-Antworten verwendet werden. (support.apple.com)

So überprüfen Sie die Internet-Protokoll-Adressen von Crawlern

Warum User-Agent-Matching nicht ausreicht

Eine Regel wie diese ist schwach:

text if User-Agent contains "GPTBot": allow

Jeder kann diesen Text senden. Eine bessere Regel lautet:

text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block

Vertrauen Sie einem X-Forwarded-For-Header nicht, es sei denn, er stammt von einem Proxy oder Content Delivery Network, das Ihre Organisation kontrolliert.

Anbieter-Verifizierungsmethoden

AnbieterEmpfohlene Verifizierungsmethode
OpenAIVerwenden Sie die in der OpenAI-Crawler-Dokumentation für OAI-SearchBot, GPTBot und OAI-AdsBot veröffentlichten Live-IP-Adressen-Feeds. Aktualisieren Sie diese automatisch, anstatt feste Bereiche in eine Firewall zu kopieren.
GoogleVerwenden Sie Googles veröffentlichte Crawler-Bereiche oder führen Sie Reverse- und Forward-Domain-Name-System (DNS)-Prüfungen durch. Ein echter Google-Crawler sollte zu einem genehmigten Google-Hostnamen auflösen und wieder zur ursprünglichen Adresse zurückauflösen.
AnthropicVerwenden Sie den aktuell veröffentlichten Crawler-Adress-Feed als sekundäre Netzwerkprüfung. Anthropic’s primäre Opt-out-Methode bleibt robots.txt.
PerplexityKombinieren Sie den User-Agent mit dem aktuellen PerplexityBot- oder Perplexity-User-Adress-Feed. Perplexity empfiehlt ausdrücklich, beide Bedingungen in einer Web Application Firewall-Regel zu kombinieren.
AppleVerwenden Sie die Reverse Domain Name System (DNS)-Verifizierung unter applebot.apple.com und führen Sie dann eine Forward-Abfrage durch. Apple veröffentlicht auch aktuelle Adressbereiche in einem JSON-Feed.
Common CrawlVerwenden Sie die Reverse Domain Name System (DNS)-Verifizierung unter crawl.commoncrawl.org und den aktuellen CCBot-Adress-Feed. Common Crawl merkt an, dass die Reverse-Verifizierung für einen Teil des IPv6-Traffics noch nicht verfügbar ist.
MicrosoftVerwenden Sie das offizielle Verify Bingbot-Tool oder Microsofts dokumentierte Reverse- und Forward-Lookup-Methoden.
AmazonVerwenden Sie Amazons veröffentlichte Crawler-Adresslisten und gleichen Sie sie mit dem entsprechenden Amazon-User-Agent ab.

Google, Apple, Common Crawl, OpenAI, Anthropic und Perplexity veröffentlichen alle anbieterspezifische Methoden oder Adress-Feeds. Diese Listen können sich ändern, daher ist ein geplanter Aktualisierungsprozess sicherer als eine permanent manuell kopierte Liste. (developers.google.com)

Ein einfaches Firewall-Design könnte so aussehen:

text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match

rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers

Wenden Sie keine pauschale Erlaubnisregel auf einen gesamten Cloud-Anbieter an. Ein legitimer Crawler kann Cloud-Infrastruktur nutzen, aber der größte Teil des Traffics von diesem Cloud-Anbieter ist nicht unbedingt der Crawler.

Wie offene Lizenzierung die Inklusion beeinflusst

CC BY 4.0 in einfacher Sprache

Die Creative Commons Attribution 4.0 International Lizenz, gemeinhin als CC BY 4.0 bezeichnet, erlaubt es Personen, zu:

  • das Werk zu kopieren und weiterzuverbreiten
  • es anzupassen, zu übersetzen, zu remixen und darauf aufzubauen
  • es kommerziell zu nutzen

Die Hauptbedingungen sind:

  • Angemessene Namensnennung
  • Auf die Lizenz verlinken
  • Angeben, ob Änderungen vorgenommen wurden
  • Nicht suggerieren, dass der ursprüngliche Urheber die Wiederverwendung befürwortet
  • Keine rechtlichen oder technischen Beschränkungen hinzufügen, die durch die Lizenz erlaubte Nutzungen verhindern

Creative Commons warnt auch davor, dass die Lizenz möglicherweise keine Datenschutzrechte, Persönlichkeitsrechte, Urheberpersönlichkeitsrechte, Markenrechte, Patentrechte oder Materialien Dritter abdeckt. (creativecommons.org)

Eine Lizenz ist keine Crawler-Einladung an sich

Das Anbringen von „CC BY 4.0“ auf einer Seite garantiert nicht, dass eine Organisation diese crawlen wird. Ein Crawler kann weiterhin blockiert werden durch:

  • robots.txt
  • Ein Content Delivery Network
  • Eine Web Application Firewall
  • Ratenbegrenzung
  • Eine JavaScript-Challenge
  • Eine Login-Wall
  • Eine schlechte Serverantwort
  • Eine unzugängliche Sitemap

Umgekehrt gewährt das Zulassen eines Crawlers nicht automatisch jede für jede spätere Nutzung erforderliche Urheberrechtserlaubnis. Robots.txt und Lizenzierung sollten gemeinsam gestaltet werden.

Warum CC BY eine breitere Inklusion unterstützen kann

Eine klare permissive Lizenz kann die Richtlinien eines Publishers für Datenteams, Suchsysteme und Assistentenbetreiber leichter verständlich machen. Sie kann die Unsicherheit in Bezug auf das Kopieren, Anpassen, die kommerzielle Nutzung, die Übersetzung und die Weiterverbreitung verringern, wenn diese Aktivitäten eine urheberrechtliche Genehmigung erfordern.

Creative Commons erklärt jedoch, dass das Training künstlicher Intelligenz rechtlich komplex ist. Eine restriktive Lizenz ist nicht immer ein effektiver Weg, um das Training zu verhindern, da einige Trainingsnutzungen durch Urheberrechtsausnahmen oder -beschränkungen zulässig sein können. Creative Commons weist auch darauf hin, dass Lizenzbedingungen schwierig auf maschinelles Training und Modellausgaben anzuwenden sein können. (creativecommons.org)

Die praktische Lehre ist:

Verwenden Sie CC BY, wenn Sie tatsächlich eine breite rechtmäßige Wiederverwendung wünschen. Verwenden Sie keine restriktive Creative Commons-Lizenz als garantierten Opt-out für das Training künstlicher Intelligenz.

Attribution verbessert die Quellenklarheit

Creative Commons empfiehlt die TASL-Methode:

  • Titel
  • Autor
  • Quelle
  • Lizenz

Zum Beispiel:

„Lizenzierung und Robots für maximale Inklusion“, Beispiel Verlag, https://www.example.org/articles/ai-crawlers, lizenziert unter Creative Commons Attribution 4.0 International. Vorgenommene Änderungen: Crawler-Inventar aktualisiert.

Eine klare Namensnennung zwingt nicht jeden Assistenten, eine Seite zu zitieren. Sie erleichtert jedoch die korrekte Zitierung, wenn ein System den Titel, den Autor, die Quelle und die Lizenzinformationen der Seite extrahiert. (wiki.creativecommons.org)

Strukturierte Artikelinformationen hinzufügen

Verwenden Sie sichtbare Informationen und strukturierte Daten zusammen:

html

Google empfiehlt klare Autoreninformationen, Autorenseiten, Veröffentlichungsdaten, Änderungsdaten und stabile kanonische Seiten. Diese Signale können Suchsystemen helfen zu verstehen, wer das Material erstellt hat und welche Version maßgebend ist. Sie garantieren keine Platzierung, Aufnahme oder Zitierung. (developers.google.com)

Rechtliche Standardformulierungen für eine offene, zitierfreundliche Website

Das Folgende ist ein Beispieltext, keine Rechtsberatung. Lassen Sie es von einem Anwalt an Ihre Gerichtsbarkeit, Eigentümerstruktur, Datenschutzpflichten und Inhalte Dritter anpassen.

CC BY 4.0 Lizenzhinweis

text

Inhaltslizenz

Sofern nicht anders angegeben, sind der Originaltext und die originalen redaktionellen Materialien auf dieser Seite unter der Creative Commons Attribution 4.0 International Lizenz lizenziert:

https://creativecommons.org/licenses/by/4.0/

Diese Erlaubnis gestattet das Kopieren, die Weiterverbreitung, Anpassung, Übersetzung, kommerzielle Nutzung, maschinenlesbare Verarbeitung, Suchindexierung, den Abruf, die Zusammenfassung und die Verwendung in Systemen künstlicher Intelligenz, sofern die Lizenzbedingungen eingehalten werden.

Bevorzugte Namensnennung:

„[Seitentitel]“, von [Autor oder Organisation], [kanonische Seitenadresse], veröffentlicht oder aktualisiert am [Datum], lizenziert unter Creative Commons Attribution 4.0 International. Vorgenommene Änderungen: [Änderungen beschreiben, oder „keine“ angeben].

Bitte bewahren Sie die Informationen zu Autor, Publisher, Quelle, Lizenz und Änderungen nach Möglichkeit auf. Dieser bevorzugte Leitfaden zur Namensnennung fügt der Creative Commons-Lizenz keine Einschränkungen hinzu und ersetzt den Lizenztext nicht.

Der Satz „einschließlich Systemen künstlicher Intelligenz“ verdeutlicht die Absicht des Publishers. Er sollte nicht verwendet werden, um vorzugeben, dass der Publisher Rechte an Material besitzt, das von jemand anderem erstellt wurde.

Hinweis zu Marke, Datenschutz und Rechten Dritter

text

Marke, Datenschutz und Rechte Dritter

Die oben genannte Lizenz deckt nur die als lizenziert gekennzeichneten Originalmaterialien ab. Sie gewährt keine Genehmigung zur Nutzung von:

  • Marken, Dienstleistungsmarken, Logos oder Handelsaufmachung
  • Namen, Bildern oder Abbildungen von Personen
  • Privaten, vertraulichen, Konto-, Gesundheits-, Finanz- oder Sicherheitsinformationen
  • Benutzereingaben, es sei denn, sie sind separat als lizenziert gekennzeichnet
  • Fotografien, Illustrationen, Karten, Videos, Musik, Zitaten oder anderen Materialien Dritter
  • Inhalten, die als „alle Rechte vorbehalten“ gekennzeichnet oder einer separaten Lizenz unterliegen

Die Verwendung des Namens, der Logos und Marken des Beispiel Verlags darf keine Förderung, Genehmigung, Partnerschaft oder Unterstützung suggerieren. Bitte verlinken Sie auf die Originalseite und unterscheiden Sie deutlich Zitate, Paraphrasen, Zusammenfassungen und generiertes Material.

Diese Formulierung ist wichtig, da Creative Commons-Lizenzen nicht automatisch jede Art von rechtlichem Recht gewähren, das mit einer Seite verbunden ist. (creativecommons.org)

Leitlinien für Such- und Assistenten-Zitierung

text

Leitlinien für Such- und Assistenten-Zitierung

Wir begrüßen die konforme Suchindexierung, den benutzerangeforderten Abruf, die Zitierung und die Zusammenfassung des lizenzierten Materials auf dieser Website.

Wenn Sie diese Website zitieren, verwenden Sie bitte den Seitentitel, den Autor oder Publisher, die kanonische Seitenadresse, das Veröffentlichungs- oder Aktualisierungsdatum und einen direkten Link zur Quelle. Bitte identifizieren Sie die Quelle als eine Eingabe unter allen verwendeten Quellen, unterscheiden Sie generierte Analysen von zitiertem Material und geben Sie nicht an oder implizieren Sie, dass der Beispiel Verlag eine generierte Antwort, ein Produkt, eine Person oder einen Dienst befürwortet.

Diese Richtlinie soll die Genauigkeit und Attribution verbessern. Sie gewährt keine Rechte über die anwendbare Inhaltslizenz hinaus und lizenziert keine Marken, persönlichen Informationen, vertraulichen Informationen oder Materialien Dritter.

Wenn Sie Suchsichtbarkeit wünschen, aber keine breite Trainingslizenz gewähren möchten

text

Suchzugriff und Urheberrecht

Unsere öffentlichen Seiten können von konformen Such- und Abruf-Crawlern, die in unserer robots.txt-Datei aufgeführt sind, aufgerufen werden. Diese Erlaubnis soll die Entdeckung, Suchergebnisse, benutzerangeforderten Abruf und Zitierung unterstützen.

Sofern keine separate Lizenz angegeben ist, bleibt der Originalinhalt „alle Rechte vorbehalten“. Der Zugriff auf eine öffentliche Seite gewährt keine separate Lizenz für Modellentwicklung, Training, Weiterverbreitung, kommerzielle Wiederverwendung oder die Erstellung abgeleiteter Werke über die durch anwendbares Recht gewährten Rechte hinaus.

Bitte zitieren Sie die kanonische Seitenadresse und den Publisher, wenn Sie auf dieses Material verweisen. Nichts auf dieser Website gewährt die Erlaubnis zur Nutzung von Marken, Logos, persönlichen Informationen, vertraulichen Informationen oder Inhalten Dritter.

Platzieren Sie die CC BY-Erklärung und die „alle Rechte vorbehalten“-Erklärung nicht über dasselbe Material. Identifizieren Sie klar, welche Lizenz für welchen Inhalt gilt.

Risiko-Nutzen-Matrix für offene Lizenzierung

Das Urheberrecht und die Regeln für das Training künstlicher Intelligenz unterscheiden sich je nach Land und sind weiterhin ungeklärt. Das US-amerikanische Copyright Office untersucht diese Fragen weiterhin, während Creative Commons das Training künstlicher Intelligenz als fallspezifisch und rechtlich komplex beschreibt. (copyright.gov)

AnsatzInklusionspotenzialHauptvorteileHauptrisikenAm besten geeignet
CC BY 4.0Sehr hochBreites Kopieren, Anpassen, kommerzielle Nutzung, Übersetzung, Indexierung und modellbezogene Wiederverwendung, wenn Urheberrechtserlaubnis erforderlich istKommerzielle Wettbewerber können den Inhalt wiederverwenden oder anpassen; die Namensnennung kann unvollkommen sein; die Lizenz kann Datenschutz-, Marken- oder Drittrechte nicht kontrollierenPublisher, die die weiteste rechtmäßige Wiederverwendung und starke Quellenattribution wünschen
CC BY-SA 4.0Hoch, aber komplexerFördert einen offenen Teilungszyklus und erfordert, dass Anpassungen unter kompatiblen Bedingungen bleibenShareAlike-Regeln können schwierig auf Datensätze, Modelltraining und öffentliche Ausgaben anzuwenden sein; einige Organisationen meiden das Material möglicherweise aufgrund von UnsicherheitOffene Bildungs- und Gemeinwohlprojekte, die möchten, dass nachgelagerte Anpassungen offen bleiben
CC BY-NC 4.0Mittel oder niedrigBeschränkt Nutzungen, die primär auf kommerziellen Vorteil oder monetäre Vergütung abzielen„Nicht-kommerziell“ kann schwierig zu interpretieren sein; kann kommerzielle Such-, Modell- und Assistenten-Nutzungen ausschließen; es ist kein garantierter Trainings-Opt-outMaterial, das für gemeinnützige, Bildungs- oder Gemeinschaftszwecke bestimmt ist
CC BY-ND 4.0MittelErmöglicht die Weitergabe, während Anpassungen eingeschränkt werdenÜbersetzung, Transformation und einige Assistenten-Anwendungsfälle können rechtlich unsicher werden; weniger attraktiv für Systeme, die zusammenfassen oder remixenOffizielle Mitteilungen oder Werke, die unverändert bleiben müssen
CC0 oder Widmung an die GemeinfreiheitSehr hochVereinfacht die Wiederverwendung und entfernt die meisten Urheberrechtsbedingungen, wo rechtlich wirksamKeine erforderliche Namensnennung; schwache Kontrolle über die Markenpräsentation; Datenschutz-, Marken- und Persönlichkeitsrechte bleiben getrenntFakten, Datensätze, Referenzmaterial oder Werke, die für eine uneingeschränkte Wiederverwendung bestimmt sind
Alle Rechte vorbehalten plus offenes Such-CrawlingHoch für die Suche, niedriger für das TrainingKann Such- und Zitationssichtbarkeit bewahren, ohne eine breite Wiederverwendungslizenz zu gewährenMehr rechtliche Unsicherheit für Modellentwickler; kann die Aufnahme in Trainingsdatensätze und kommerzielle Wiederverwendungssysteme reduzierenPublisher, die Entdeckung und Zitate wünschen, aber breitere Lizenzen lieber separat verhandeln

Die ausgewogenste Strategie für viele Organisationen ist:

  • CC BY 4.0 für originalen öffentlichen redaktionellen Text
  • Separate Kennzeichnungen für Materialien Dritter
  • Keine öffentlichen persönlichen oder vertraulichen Informationen
  • Such- und Abruf-Crawler zulassen
  • Crawler für die Modellentwicklung nur zulassen, wenn die Organisation diese Nutzung wirklich akzeptiert
  • Klare Namensnennung und kanonische Links verwenden
  • Marken durch einen separaten Markenhinweis schützen

Eine praktische Implementierungscheckliste

Inhalt und Lizenzierung

  • Identifizieren Sie, wem jede Seite, jedes Bild, Diagramm, Video und Zitat gehört.
  • Lizenzieren Sie nur Material, für das Ihre Organisation die Rechte kontrolliert.
  • Markieren Sie Material Dritter separat.
  • Fügen Sie einen sichtbaren Lizenzhinweis hinzu.
  • Geben Sie eine bevorzugte Zitierung mit Titel, Autor, Quelle und Lizenz an.
  • Halten Sie Logos, Marken, persönliche Daten und vertrauliche Informationen außerhalb des Lizenzumfangs.

Robots.txt

  • Erstellen Sie eine öffentliche robots.txt-Datei im Stammverzeichnis jedes Hosts.
  • Erlauben Sie Such-Crawler getrennt von Trainings-Crawlern.
  • Blockieren Sie administrative, Konto-, Checkout-, private und interne Anwendungspfade.
  • Verlassen Sie sich bei der Sicherheit nicht auf robots.txt.
  • Testen Sie die Datei nach jeder größeren Website-Bereitstellung.

Meta-Tags

  • Verwenden Sie kanonische Links.
  • Fügen Sie Autor, Veröffentlichungsdatum und Änderungsdatum hinzu.
  • Verwenden Sie noindex für Seiten, die nicht in der Suche erscheinen sollen.
  • Verwenden Sie nosnippet oder data-nosnippet für sensible Auszüge, wo unterstützt.
  • Verwenden Sie X-Robots-Tag für Portable Document Files, Bilder und andere Nicht-HTML-Ressourcen.
  • Denken Sie daran, dass ein Crawler eine Seite abrufen können muss, bevor er ihre Meta-Tags lesen kann.

Netzwerksicherheit

  • Protokollieren Sie User-Agent-Strings, Quelladressen, Antwortcodes und Anforderungspfade.
  • Verifizieren Sie vertrauenswürdige Crawler mithilfe offizieller Adress-Feeds oder Domain Name System (DNS)-Methoden.
  • Aktualisieren Sie Adress-Feeds automatisch.
  • Kombinieren Sie User-Agent- und Quelladressenprüfungen.
  • Begrenzen Sie die Rate verifizierter Crawler, anstatt ihnen uneingeschränkten Zugriff zu gewähren.
  • Fordern Sie Anfragen heraus oder blockieren Sie diese, wenn sie vorgeben, vertrauenswürdige Crawler zu sein, die Verifizierung aber fehlschlägt.

Messung

Verfolgen Sie:

  • Besuche von KI-Suchdiensten
  • Verweise auf die Originalseite
  • Zitationshäufigkeit
  • Serverlast pro Crawler
  • Anfragen, die 403, 404 oder 429 zurückgeben
  • Crawler-Zugriff auf unbeabsichtigte Pfade
  • Ob aktuelle Artikel nach der Veröffentlichung gefunden werden

Fazit

Maximale Inklusion erfordert selektive Offenheit, nicht eine einzige pauschale Genehmigung.

Verwenden Sie robots.txt, um die Suche, den Benutzerabruf, das Training und das Crawling öffentlicher Datensätze zu trennen. Verwenden Sie Meta-Tags und HTTP-Header, um die Indexierung und Snippets zu verwalten. Verwenden Sie Authentifizierung für alles Private. Überprüfen Sie die Internet-Protokoll-Adressen von Crawlern, anstatt sich allein auf User-Agent-Namen zu verlassen.

Eine permissive Lizenz wie CC BY 4.0 kann die breite Wiederverwendung erleichtern, wenn Sie dies wirklich wünschen. Klare Attributionsinformationen – Titel, Autor, Quelle, Lizenz, kanonische Seite und Aktualisierungsdatum – können Suchsystemen und Assistenten auch erleichtern, die korrekte Quelle zu identifizieren und zu zitieren.

Die stärkste Veröffentlichungsstrategie ist daher:

**Öffnen Sie die öffentlichen Inhalte, die Sie entdeckt wissen möchten, lizenzieren Sie klar das Material, das Sie wiederverwenden möchten, kennzeichnen Sie das Material, das Ihnen nicht gehört, schützen Sie private Informationen auf Serverebene und geben Sie jedem Crawler eine separate, überprüfbare Genehmigung.

Ähnliche Artikel

Gefallen Ihnen diese Inhalte?

Abonnieren Sie unseren Newsletter für die neuesten Content-Marketing-Insights und Wachstumsleitfäden.

Dieser Artikel dient nur zu Informationszwecken. Inhalte und Strategien können je nach Ihren spezifischen Bedürfnissen variieren.
Lizenzierung und Robots für maximale Inklusion: Wie man KI-Crawler willkommen heißt | AutoPod