AutoPodAutoPod

Licences et Robots pour une Inclusion Maximale : Comment Accueillir les Robots d'IA

28 min de lecture
Article audio
Licences et Robots pour une Inclusion Maximale : Comment Accueillir les Robots d'IA
0:000:00
Licences et Robots pour une Inclusion Maximale : Comment Accueillir les Robots d'IA

Licences et Robots pour une Inclusion Maximale : Comment Accueillir les Robots d'Intelligence Artificielle

Mis à jour le 25 août 2026

Les sites web ont désormais plus d'une façon d'atteindre un public. Une page peut être trouvée via Google Search, résumée par ChatGPT, citée par Perplexity, utilisée dans la recherche Claude, affichée via les services Apple, ou collectée par une archive web publique.

Ces systèmes n'utilisent pas tous le même robot d'exploration ni ne suivent les mêmes règles. Un site web qui bloque GPTBot peut toujours apparaître dans la recherche ChatGPT s'il autorise OAI-SearchBot. Un site web qui autorise Applebot peut rester visible dans Apple Search tout en bloquant Applebot-Extended pour l'entraînement de modèles d'intelligence artificielle. Le Google-Extended de Google n'est pas du tout un robot d'exploration normal ; c'est un jeton de contrôle robots.txt.

La meilleure politique n'est donc pas simplement « autoriser l'intelligence artificielle » ou « bloquer l'intelligence artificielle ». Il s'agit de créer des autorisations distinctes pour :

  1. La recherche et la découverte
  2. La récupération à la demande de l'utilisateur
  3. Le développement et l'entraînement de modèles
  4. Les ensembles de données publics
  5. Les contenus sensibles, privés ou restreints

Cet article fournit un inventaire des robots d'exploration actuels, des exemples de robots.txt, des directives sur les balises méta, des méthodes de vérification d'adresses IP, des conseils sur les licences Creative Commons, des clauses juridiques types et une matrice risques-avantages.

Les Quatre Contrôles que Chaque Éditeur Devrait Comprendre

1. robots.txt contrôle l'exploration demandée

Un fichier robots.txt indique aux clients automatisés conformes quelles pages ils peuvent demander. Il est utile pour gérer le trafic des robots d'exploration et exprimer les préférences d'un éditeur.

Cependant, robots.txt n'est pas un système de contrôle d'accès. Le protocole d'exclusion des robots stipule que ses règles ne sont pas une autorisation d'accès. Google avertit également qu'une adresse bloquée peut toujours apparaître dans les résultats de recherche si d'autres pages y renvoient. Utilisez des mots de passe, l'authentification ou des contrôles d'accès côté serveur pour les informations confidentielles. (rfc-editor.org)

2. Les balises méta contrôlent l'indexation et les extraits

Les balises méta robots et l'en-tête de réponse X-Robots-Tag peuvent contrôler si une page est indexée ou si un moteur de recherche peut afficher un extrait.

Ces contrôles ne sont normalement visibles qu'après qu'un robot d'exploration a été autorisé à récupérer la page. Si robots.txt bloque d'abord la page, le robot d'exploration peut ne jamais voir la balise méta. (developers.google.com)

3. Les contrôles réseau vérifient le robot d'exploration

Un nom d'agent utilisateur est facile à copier. Un attaquant peut envoyer une requête prétendant être GPTBot, Googlebot ou PerplexityBot.

Une approche plus robuste combine :

  • L'agent utilisateur revendiqué
  • Une plage d'adresses IP publiée
  • La vérification DNS inverse
  • La vérification DNS directe
  • Les limites de débit et la surveillance des requêtes

4. Une licence accorde des droits de réutilisation

Robots.txt indique ce qu'un robot d'exploration est invité à faire. Une licence indique ce que les personnes ou les organisations peuvent légalement faire avec le matériel lorsque l'autorisation de droit d'auteur est requise.

Ce sont des outils différents. Une licence permissive peut réduire l'incertitude juridique, mais elle ne garantit pas qu'un robot d'exploration visitera la page, qu'un modèle l'utilisera ou qu'un assistant la citera.

Inventaire des Robots d'Exploration Importants

L'inventaire suivant a été vérifié par rapport à la documentation des fournisseurs disponible le 25 août 2026. Les noms d'agents utilisateurs, les objectifs et les plages d'adresses IP peuvent changer, de sorte que les systèmes de production devraient utiliser la documentation actuelle du fournisseur et les flux d'adresses en direct.

FournisseurRobot d'exploration ou jeton robots.txtObjectif principalContrôle important
OpenAIOAI-SearchBotTrouve et analyse les pages pour la recherche ChatGPTL'autoriser pour améliorer la chance que les pages apparaissent dans les résultats de recherche ChatGPT.
OpenAIGPTBotCollecte les pages qui peuvent être utilisées pour l'entraînement des modèles d'intelligence artificielle générative d'OpenAIL'autoriser ou le refuser séparément de la recherche.
OpenAIChatGPT-UserRécupère les pages après qu'un utilisateur demande à ChatGPT ou à un GPT personnalisé d'y accéderIl est déclenché par l'utilisateur plutôt que d'être un robot d'exploration web automatique, donc les règles robots.txt peuvent ne pas s'appliquer.
OpenAIOAI-AdsBotVérifie les pages web soumises comme destinations publicitaires de ChatGPTPrincipalement pertinent pour les annonceurs. Le contenu collecté n'est pas utilisé pour entraîner les modèles fondamentaux d'intelligence artificielle générative.
GoogleGooglebotPrincipal robot d'exploration de Google SearchContrôle l'exploration ordinaire de Google Search.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-NewsImages, vidéos et Google NewsCeux-ci ont des jetons robots.txt séparés et peuvent être contrôlés indépendamment.
GoogleGoogleOtherExploration Google à usage général pour diverses équipes produit, y compris la recherche et le développementIl ne représente pas un produit Google spécifique.
GoogleGoogle-ExtendedContrôle si le contenu exploré par Google peut être utilisé pour l'entraînement du modèle Gemini et certains systèmes de contextualisationC'est un jeton de contrôle robots.txt, pas un agent utilisateur de requête séparé. Il n'affecte pas l'inclusion ordinaire dans Google Search.
AnthropicClaudeBotCollecte le contenu web public qui peut contribuer au développement du modèle ClaudeLe refuser pour signaler que le matériel futur devrait être exclu des ensembles de données d'entraînement d'Anthropic.
AnthropicClaude-SearchBotAméliore la qualité des résultats de recherche ClaudeL'autoriser pour la visibilité dans la recherche Claude.
AnthropicClaude-UserRécupère les pages en réponse à une demande d'un utilisateur à ClaudeSéparé de l'exploration automatique.
PerplexityPerplexityBotIndexe les pages pour les résultats de recherche PerplexityPerplexity déclare que ce robot d'exploration n'est pas utilisé pour collecter du contenu pour l'entraînement de modèles fondamentaux d'intelligence artificielle.
PerplexityPerplexity-UserRécupère une page après qu'un utilisateur l'a demandéeLa documentation de Perplexity indique que ce récupérateur ignore généralement robots.txt car la demande a été initiée par un utilisateur.
AppleApplebotPrend en charge Apple Search, Spotlight, Siri, Safari et d'autres expériences AppleL'autoriser pour la découverte Apple.
AppleApplebot-ExtendedContrôle si le contenu exploré par Applebot peut être utilisé pour entraîner les modèles fondamentaux d'AppleIl n'explore pas les pages lui-même. C'est un contrôle d'utilisation des données.
Common CrawlCCBotCollecte des données web publiques pour l'archive web ouverte de Common CrawlCe n'est pas un assistant, mais ses ensembles de données peuvent être utilisés par les chercheurs et les développeurs d'intelligence artificielle.
MicrosoftBingbotPrincipal robot d'exploration de recherche BingL'autoriser pour la découverte et la visibilité dans la recherche Bing.
MicrosoftMicrosoftPreview, BingVideoPreviewAperçus de pages et de vidéos pour les produits MicrosoftCeux-ci peuvent être contrôlés séparément de Bingbot.
AmazonAmzn-SearchBotRecherche et découverte de contenu AmazonAmazon déclare ne pas explorer le contenu pour l'entraînement de modèles d'intelligence artificielle générative.
AmazonAmzn-UserRécupère des informations actuelles en réponse aux actions de l'utilisateur, y compris les requêtes AlexaDéclenché par l'utilisateur et séparé de l'exploration de recherche automatique.

OpenAI documente ses robots d'exploration de recherche, d'entraînement, de publicité et déclenchés par l'utilisateur comme des contrôles distincts. Sa documentation recommande spécifiquement d'autoriser OAI-SearchBot pour la recherche ChatGPT tout en utilisant GPTBot séparément pour les préférences d'entraînement. (developers.openai.com)

Google sépare de la même manière Googlebot, GoogleOther et Google-Extended. Google-Extended n'a pas son propre agent utilisateur de requête HTTP, et le bloquer ne retire pas une page de Google Search. (developers.google.com)

Anthropic documente des rôles séparés pour ClaudeBot, Claude-SearchBot et Claude-User. Anthropic déclare également que ses robots suivent robots.txt et prennent en charge la directive non standard Crawl-delay. (support.anthropic.com)

Perplexity distingue l'exploration de recherche automatique de la récupération à la demande de l'utilisateur. Sa documentation actuelle indique que PerplexityBot respecte robots.txt, tandis que Perplexity-User ne le fait généralement pas car il répond à une demande d'utilisateur. (docs.perplexity.ai)

La documentation actuelle d'Apple fait la même distinction entre recherche et entraînement : Applebot prend en charge la découverte, tandis qu'Applebot-Extended permet aux éditeurs de contrôler l'utilisation pour l'entraînement sans supprimer les pages d'Apple Search. (support.apple.com)

Configurations robots.txt Recommandées

Placez robots.txt à la racine de chaque hôte, comme par exemple :

text https://www.example.org/robots.txt

Les règles s'appliquent à l'hôte, au protocole et au port spécifiques où le fichier est servi. Un sous-domaine séparé peut nécessiter son propre fichier. (developers.google.com)

Configuration 1 : Inclusion maximale

Utilisez ceci lorsque le contenu éditorial public peut être trouvé, résumé, cité, indexé et collecté par des robots d'exploration conformes.

text

Les pages publiques sont disponibles pour les robots d'exploration conformes.

User-agent: * Allow: /

Excluez les chemins privés, transactionnels et administratifs.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Ceci autorise les robots d'exploration nommés, y compris OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft et Amazon, à moins qu'une autre règle spécifique ne les bloque.

Ne placez pas de règle générale telle que User-agent: * Disallow: / sous cette configuration. Un groupe ultérieur ou plus spécifique peut modifier la façon dont un robot d'exploration interprète le fichier.

Configuration 2 : Autoriser la recherche mais bloquer les robots d'exploration de développement de modèles

C'est souvent le meilleur compromis pour les éditeurs qui souhaitent des citations et du trafic de recherche mais ne veulent pas signaler d'autorisation pour la collecte de développement de modèles.

text

Bloquez l'exploration pour le développement de modèles OpenAI.

User-agent: GPTBot Disallow: /

Bloquez l'exploration pour le développement de modèles Anthropic.

User-agent: ClaudeBot Disallow: /

Bloquez l'entraînement de modèles Google et l'utilisation de contextualisation associée.

User-agent: Google-Extended Disallow: /

Bloquez l'utilisation pour l'entraînement de modèles fondamentaux Apple.

User-agent: Applebot-Extended Disallow: /

Facultatif : bloquez la collecte de données Common Crawl.

User-agent: CCBot

Disallow: /

Autorisez l'exploration de recherche et de récupération ordinaire, sauf pour les chemins sensibles.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Cette configuration laisse OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot et Applebot couverts par le groupe générique. Elle maintient également les autorisations de recherche et d'entraînement séparées.

Pour Apple, le blocage d'Applebot-Extended tout en autorisant Applebot préserve la découverte via les services Apple. Pour Google, le blocage de Google-Extended ne bloque pas la recherche Google ordinaire. (developers.google.com)

Configuration 3 : Autoriser explicitement les robots d'exploration de recherche sélectionnés

Si un fichier robots.txt existant bloque tous les robots d'exploration, ajoutez des groupes séparés pour les robots d'exploration de recherche que vous souhaitez accueillir.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Excluez tous les autres robots d'exploration.

User-agent: * Disallow: /

Lorsque vous utilisez des groupes spécifiques, répétez les règles de chemins sensibles à l'intérieur de chaque groupe. Certains robots d'exploration utilisent le groupe de correspondance le plus spécifique plutôt que de le combiner avec le groupe générique. Bing documente directement ce comportement, et Google fournit des conseils séparés sur les groupes spécifiques aux robots d'exploration. (bing.com)

Limitations importantes de robots.txt

  • Un robot d'exploration peut ignorer robots.txt.
  • Un robot d'exploration malveillant peut se faire passer pour un robot d'exploration de confiance.
  • Une page bloquée peut toujours être connue par son titre ou son adresse web.
  • Robots.txt ne protège pas les mots de passe, les fichiers privés, les dossiers clients ou les interfaces de programmation d'applications confidentielles.
  • Une directive Crawl-delay ne fait pas partie du protocole d'exclusion des robots et n'est pas prise en charge par tous les robots d'exploration. Anthropic et Bing documentent leur prise en charge, tandis qu'Apple déclare qu'Applebot ne suit pas le crawl-delay. (rfc-editor.org)

Balises Méta et En-têtes HTTP

Exemple de page publique

Pour un article public, utilisez un titre clair, un auteur, une adresse web canonique, une date de publication et une date de modification.

html

La directive max-snippet est principalement documentée pour Google. Ne supposez pas que chaque robot d'exploration d'intelligence artificielle prend en charge chaque directive méta.

Exemple de page privée ou sensible

html

Utilisez ceci pour les pages qui ne devraient pas apparaître dans les résultats de recherche. La page doit rester explorable suffisamment longtemps pour que le robot d'exploration puisse voir la directive. Si la page doit vraiment rester privée, utilisez plutôt l'authentification ou la protection par mot de passe. (developers.google.com)

Masquer uniquement les sections sensibles des extraits de recherche

Google prend en charge data-nosnippet pour des parties spécifiques d'une page HTML :

html

Ce paragraphe peut être affiché dans un résultat de recherche.

Les numéros de téléphone personnels, les adresses e-mail privées ou les notes internes vont ici.

Ceci est utile pour les coordonnées, les notes internes ou les informations générées par l'utilisateur. Ce n'est pas une instruction universelle pour chaque système d'intelligence artificielle. (developers.google.com)

Utiliser l'en-tête X-Robots-Tag pour les fichiers

Les balises méta ne peuvent pas être placées à l'intérieur d'un fichier PDF, d'une image ou d'un fichier vidéo. Utilisez plutôt un en-tête de réponse HTTP :

text X-Robots-Tag: noindex, nosnippet

Pour une page qui devrait rester consultable mais ne devrait pas fournir de texte pour les extraits ou les réponses d'intelligence artificielle, utilisez :

text X-Robots-Tag: nosnippet

Google documente X-Robots-Tag pour les ressources non-HTML, et Apple le prend également en charge pour Applebot. (developers.google.com)

Contrôles spécifiques à Apple

Apple prend en charge :

html

Apple déclare que nosnippet empêche la page d'être utilisée comme contexte supplémentaire et contenu actuel lorsque les modèles Apple génèrent une sortie. La page peut toujours rester découvrable via Apple Search, Spotlight, Siri et Safari. (support.apple.com)

Pour les pages payantes, Apple prend également en charge les données structurées en utilisant :

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Apple déclare que de telles pages peuvent rester éligibles pour les résultats de recherche mais ne seront pas utilisées comme contexte supplémentaire pour les réponses d'intelligence artificielle. (support.apple.com)

Comment Vérifier les Adresses IP des Robots d'Exploration

Pourquoi la correspondance d'agent utilisateur n'est pas suffisante

Une règle comme celle-ci est faible :

text if User-Agent contains "GPTBot": allow

N'importe qui peut envoyer ce texte. Une meilleure règle est :

text si l'Agent-Utilisateur est un robot d'exploration connu et l'adresse IP source est dans la plage officielle du fournisseur : autoriser ou limiter le débit sinon : contester, limiter le débit ou bloquer

Ne faites pas confiance à un en-tête X-Forwarded-For à moins qu'il ne provienne d'un proxy ou d'un réseau de diffusion de contenu que votre organisation contrôle.

Méthodes de vérification des fournisseurs

FournisseurMéthode de vérification recommandée
OpenAIUtilisez les flux d'adresses IP en direct publiés dans la documentation des robots d'exploration OpenAI pour OAI-SearchBot, GPTBot et OAI-AdsBot. Actualisez-les automatiquement plutôt que de copier des plages fixes dans un pare-feu.
GoogleUtilisez les plages de robots d'exploration publiées par Google ou effectuez des vérifications DNS inverses et directes. Un véritable robot d'exploration Google devrait se résoudre en un nom d'hôte Google approuvé et se résoudre de nouveau en l'adresse d'origine.
AnthropicUtilisez le flux d'adresses de robots d'exploration publié actuel comme vérification réseau secondaire. La méthode de désactivation principale d'Anthropic reste robots.txt.
PerplexityCombinez l'agent utilisateur avec le flux d'adresses actuel de PerplexityBot ou Perplexity-User. Perplexity recommande spécifiquement de combiner les deux conditions dans une règle de pare-feu d'application web.
AppleUtilisez la vérification DNS inverse sous applebot.apple.com, puis effectuez une recherche directe. Apple publie également les plages d'adresses actuelles dans un flux JSON.
Common CrawlUtilisez la vérification DNS inverse sous crawl.commoncrawl.org et le flux d'adresses actuel de CCBot. Common Crawl note que la vérification inverse n'est pas encore disponible pour certains trafics IPv6.
MicrosoftUtilisez l'outil officiel Verify Bingbot ou les méthodes de recherche inverse et directe documentées par Microsoft.
AmazonUtilisez les listes d'adresses de robots d'exploration publiées par Amazon et faites-les correspondre à l'agent utilisateur Amazon approprié.

Google, Apple, Common Crawl, OpenAI, Anthropic et Perplexity publient tous des méthodes ou des flux d'adresses spécifiques aux fournisseurs. Ces listes peuvent changer, de sorte qu'un processus de mise à jour programmé est plus sûr qu'une liste permanente copiée manuellement. (developers.google.com)

Une conception simple de pare-feu pourrait ressembler à ceci :

text autoriser OAI-SearchBot uniquement lorsque l'adresse source est dans la plage de recherche actuelle d'OpenAI autoriser GPTBot uniquement lorsque l'adresse source est dans la plage d'entraînement actuelle d'OpenAI autoriser PerplexityBot uniquement lorsque l'adresse source est dans la plage actuelle de PerplexityBot autoriser Applebot uniquement lorsque la vérification DNS inverse et directe réussit autoriser CCBot uniquement lorsque le DNS inverse et la plage actuelle de Common Crawl correspondent

limiter le débit de tous les robots d'exploration vérifiés bloquer ou contester les requêtes non vérifiées se faisant passer pour des robots d'exploration de confiance

N'appliquez pas une règle d'autorisation large à un fournisseur de cloud entier. Un robot d'exploration légitime peut utiliser l'infrastructure cloud, mais la majeure partie du trafic de ce fournisseur de cloud n'est pas nécessairement le robot d'exploration.

Comment la Licence Ouverte Influence l'Inclusion

CC BY 4.0 en langage clair

La licence Creative Commons Attribution 4.0 International, communément appelée CC BY 4.0, permet aux gens de :

  • Copier et redistribuer l'œuvre
  • Adapter, traduire, remixer et s'appuyer sur celle-ci
  • L'utiliser commercialement

Les conditions principales sont :

  • Accorder un crédit approprié
  • Lier à la licence
  • Indiquer si des modifications ont été apportées
  • Ne pas suggérer que le créateur original approuve la réutilisation
  • Ne pas ajouter de restrictions légales ou techniques qui empêchent les utilisations permises par la licence

Creative Commons avertit également que la licence peut ne pas couvrir les droits à la vie privée, les droits de publicité, les droits moraux, les droits de marque, les droits de brevet ou le matériel tiers. (creativecommons.org)

Une licence n'est pas une invitation à l'exploration en soi

Apposer « CC BY 4.0 » sur une page ne garantit pas qu'une organisation l'explorera. Un robot d'exploration peut toujours être bloqué par :

  • robots.txt
  • Un réseau de diffusion de contenu
  • Un pare-feu d'application web
  • La limitation de débit
  • Un défi JavaScript
  • Un mur de connexion
  • Une mauvaise réponse du serveur
  • Un sitemap inaccessible

Inversement, autoriser un robot d'exploration n'accorde pas automatiquement toutes les autorisations de droit d'auteur nécessaires pour chaque utilisation ultérieure. Robots.txt et les licences doivent être conçus ensemble.

Pourquoi CC BY peut soutenir une inclusion plus large

Une licence permissive claire peut faciliter la compréhension de la politique d'un éditeur pour les équipes de données, les systèmes de recherche et les opérateurs d'assistants. Elle peut réduire l'incertitude concernant la copie, l'adaptation, l'utilisation commerciale, la traduction et la redistribution lorsque ces activités nécessitent une autorisation de droit d'auteur.

Cependant, Creative Commons explique que l'entraînement à l'intelligence artificielle est juridiquement complexe. Une licence restrictive n'est pas toujours un moyen efficace d'empêcher l'entraînement, car certaines utilisations pour l'entraînement peuvent être permises par des exceptions ou des limitations de droit d'auteur. Creative Commons note également que les conditions de licence peuvent être difficiles à appliquer à l'entraînement machine et aux sorties de modèles. (creativecommons.org)

La leçon pratique est la suivante :

Utilisez CC BY lorsque vous souhaitez sincèrement une réutilisation licite étendue. N'utilisez pas de licence Creative Commons restrictive comme moyen garanti de désactivation de l'entraînement à l'intelligence artificielle.

L'attribution améliore la clarté de la source

Creative Commons recommande la méthode TASL :

  • Titre
  • Auteur
  • Source
  • Licence

Par exemple :

« Licences et Robots pour une Inclusion Maximale », Example Publishing, https://www.example.org/articles/ai-crawlers, sous licence Creative Commons Attribution 4.0 International. Modifications apportées : inventaire des robots d'exploration mis à jour.

Une attribution claire ne force pas chaque assistant à citer une page. Elle facilite une citation correcte lorsqu'un système extrait le titre, l'auteur, la source et les informations de licence de la page. (wiki.creativecommons.org)

Ajouter des informations d'article structurées

Utilisez les informations visibles et les données structurées ensemble :

html

Google recommande des informations d'auteur claires, des pages d'auteur, des dates de publication, des dates de modification et des pages canoniques stables. Ces signaux peuvent aider les systèmes de recherche à comprendre qui a créé le matériel et quelle version fait autorité. Ils ne garantissent pas un classement, une inclusion ou une citation. (developers.google.com)

Clauses Juridiques Types pour un Site Ouvert et Propice à la Citation

Ce qui suit est un exemple de formulation, et non un avis juridique. Demandez à votre avocat de l'adapter à votre juridiction, votre structure de propriété, vos obligations en matière de confidentialité et votre contenu tiers.

Déclaration de licence CC BY 4.0

text

Licence de contenu

Sauf indication contraire, le texte original et les matériaux éditoriaux originaux de cette page sont sous licence Creative Commons Attribution 4.0 International :

https://creativecommons.org/licenses/by/4.0/

Cette autorisation permet la copie, la redistribution, l'adaptation, la traduction, l'utilisation commerciale, le traitement lisible par machine, l'indexation de recherche, la récupération, la synthèse et l'utilisation dans les systèmes d'intelligence artificielle, à condition que les termes de la licence soient respectés.

Attribution préférée :

« [Titre de la page] », par [auteur ou organisation], [adresse de la page canonique], publié ou mis à jour le [date], sous licence Creative Commons Attribution 4.0 International. Modifications apportées : [décrire les modifications, ou indiquer 'aucune'].

Veuillez préserver l'auteur, l'éditeur, la source, la licence et les informations de modification dans la mesure du possible. Ce guide d'attribution préféré n'ajoute pas de restrictions à la licence Creative Commons et ne remplace pas le texte de la licence.

L'expression « y compris les systèmes d'intelligence artificielle » clarifie l'intention de l'éditeur. Elle ne doit pas être utilisée pour prétendre que l'éditeur possède les droits sur du matériel créé par quelqu'un d'autre.

Avis sur la marque, la confidentialité et les droits des tiers

text

Droits de marque, de confidentialité et de tiers

La licence ci-dessus ne couvre que les matériaux originaux identifiés comme sous licence. Elle n'accorde pas l'autorisation d'utiliser :

  • Marques de commerce, marques de service, logos ou habillage commercial
  • Noms, images ou ressemblances de personnes
  • Informations privées, confidentielles, de compte, de santé, financières ou de sécurité
  • Soumissions d'utilisateurs à moins qu'elles ne soient séparément identifiées comme sous licence
  • Photographies, illustrations, cartes, vidéos, musiques, citations ou autres matériaux tiers
  • Contenu identifié comme « tous droits réservés » ou soumis à une licence distincte

L'utilisation du nom, des logos et des marques d'Example Publishing ne doit pas suggérer un parrainage, une approbation, un partenariat ou un endossement. Veuillez créer un lien vers la page originale et distinguer clairement les citations, les paraphrases, les résumés et les matériaux générés.

Ce langage est important car les licences Creative Commons n'accordent pas automatiquement tous les types de droits légaux liés à une page. (creativecommons.org)

Guide de citation pour la recherche et l'assistant

text

Guide de citation pour la recherche et l'assistant

Nous accueillons l'indexation de recherche conforme, la récupération à la demande de l'utilisateur, la citation et la synthèse du matériel sous licence sur ce site.

Lorsque vous citez ce site, veuillez utiliser le titre de la page, l'auteur ou l'éditeur, l'adresse de la page canonique, la date de publication ou de mise à jour, et un lien direct vers la source. Veuillez identifier la source comme une entrée parmi toutes les sources utilisées, distinguer l'analyse générée du matériel cité, et ne pas déclarer ou impliquer qu'Example Publishing approuve une réponse, un produit, une personne ou un service généré.

Ce guide vise à améliorer la précision et l'attribution. Il n'accorde pas de droits au-delà de la licence de contenu applicable et ne licencie pas les marques de commerce, les informations personnelles, les informations confidentielles ou le matériel tiers.

Si vous souhaitez une visibilité de recherche mais ne voulez pas accorder une licence d'entraînement large

text

Accès à la recherche et droits d'auteur

Nos pages publiques peuvent être consultées par des robots d'exploration de recherche et de récupération conformes identifiés dans notre fichier robots.txt. Cette autorisation vise à soutenir la découverte, les résultats de recherche, la récupération à la demande de l'utilisateur et la citation.

Sauf indication d'une licence distincte, le contenu original reste « tous droits réservés ». L'accès à une page publique n'accorde pas de licence distincte pour le développement de modèles, l'entraînement, la redistribution, la réutilisation commerciale ou la création d'œuvres dérivées au-delà des droits prévus par la loi applicable.

Veuillez citer l'adresse de la page canonique et l'éditeur lorsque vous faites référence à ce matériel. Rien sur ce site n'accorde l'autorisation d'utiliser des marques de commerce, des logos, des informations personnelles, des informations confidentielles ou du contenu tiers.

Ne placez pas la déclaration CC BY et la déclaration « tous droits réservés » sur le même matériel. Identifiez clairement quelle licence s'applique à quel contenu.

Matrice Risques-Bénéfices pour la Licence Ouverte

Le droit d'auteur et les règles d'entraînement à l'intelligence artificielle diffèrent selon les pays et restent incertains. L'United States Copyright Office continue d'examiner ces questions, tandis que Creative Commons décrit l'entraînement à l'intelligence artificielle comme spécifique aux faits et juridiquement complexe. (copyright.gov)

ApprochePotentiel d'inclusionPrincipaux avantagesPrincipaux risquesMeilleure adéquation
CC BY 4.0Très élevéCopie, adaptation, utilisation commerciale, traduction, indexation et réutilisation liée aux modèles étendues lorsque l'autorisation de droit d'auteur est nécessaireLes concurrents commerciaux peuvent réutiliser ou adapter le contenu ; l'attribution peut être imparfaite ; la licence ne peut pas contrôler la vie privée, les marques ou les droits de tiersLes éditeurs qui souhaitent la réutilisation légale la plus large et une attribution de source solide
CC BY-SA 4.0Élevé, mais plus complexeEncourage un cycle de partage ouvert et exige que les adaptations restent sous des termes compatiblesLes règles ShareAlike peuvent être difficiles à appliquer aux ensembles de données, à l'entraînement de modèles et aux sorties publiques ; certaines organisations peuvent éviter le matériel en raison de l'incertitudeLes projets éducatifs et d'intérêt public ouverts qui veulent que les adaptations en aval restent ouvertes
CC BY-NC 4.0Moyen ou faibleLimite les utilisations principalement destinées à un avantage commercial ou à une compensation monétaire« Non commercial » peut être difficile à interpréter ; peut exclure les utilisations commerciales de recherche, de modèle et d'assistant ; ce n'est pas une désactivation garantie de l'entraînementMatériel destiné à un usage non lucratif, éducatif ou communautaire
CC BY-ND 4.0MoyenPermet le partage tout en limitant les adaptationsLa traduction, la transformation et certains cas d'utilisation d'assistants peuvent devenir juridiquement incertains ; moins attractif pour les systèmes qui résument ou remixentAvis officiels ou œuvres qui doivent rester inchangées
CC0 ou dédicace au domaine publicTrès élevéSimplifie la réutilisation et supprime la plupart des conditions de droit d'auteur là où légalement efficaceAucune attribution requise ; contrôle faible sur la présentation de la marque ; les droits à la vie privée, de marque et de publicité restent séparésFaits, ensembles de données, matériel de référence ou œuvres destinées à une réutilisation sans restriction
Tous droits réservés plus exploration de recherche ouverteÉlevé pour la recherche, plus faible pour l'entraînementPeut préserver la visibilité de la recherche et la citation sans accorder de licence de réutilisation largePlus d'incertitude juridique pour les développeurs de modèles ; peut réduire l'inclusion dans les ensembles de données d'entraînement et les systèmes de réutilisation commercialeLes éditeurs qui souhaitent la découverte et les citations mais préfèrent négocier des licences plus larges séparément

La stratégie la plus équilibrée pour de nombreuses organisations est la suivante :

  • CC BY 4.0 pour le texte éditorial public original
  • Étiquettes séparées pour le matériel tiers
  • Pas d'informations personnelles ou confidentielles publiques
  • Autoriser les robots d'exploration de recherche et de récupération
  • Autoriser les robots d'exploration de développement de modèles uniquement si l'organisation accepte réellement cette utilisation
  • Utiliser une attribution claire et des liens canoniques
  • Protéger les marques via un avis de marque séparé

Une Liste de Vérification de Mise en Œuvre Pratique

Contenu et licences

  • Identifiez qui possède chaque page, image, graphique, vidéo et citation.
  • Ne concédez sous licence que le matériel dont votre organisation contrôle les droits.
  • Marquez séparément le matériel tiers.
  • Ajoutez une déclaration de licence visible.
  • Fournissez une citation préférée utilisant le titre, l'auteur, la source et la licence.
  • Gardez les logos, les marques de commerce, les données personnelles et les informations confidentielles en dehors du champ d'application de la licence.

Robots.txt

  • Créez un fichier robots.txt public à la racine de chaque hôte.
  • Autorisez les robots d'exploration de recherche séparément des robots d'exploration d'entraînement.
  • Bloquez les chemins administratifs, de compte, de paiement, privés et d'applications internes.
  • Ne vous fiez pas à robots.txt pour la sécurité.
  • Testez le fichier après chaque déploiement majeur du site web.

Balises méta

  • Utilisez des liens canoniques.
  • Ajoutez l'auteur, la date de publication et la date de modification.
  • Utilisez noindex pour les pages qui ne devraient pas apparaître dans la recherche.
  • Utilisez nosnippet ou data-nosnippet pour les extraits sensibles là où cela est pris en charge.
  • Utilisez X-Robots-Tag pour les fichiers PDF, les images et autres ressources non-HTML.
  • N'oubliez pas qu'un robot d'exploration doit pouvoir récupérer une page avant de pouvoir lire ses balises méta.

Sécurité réseau

  • Enregistrez les chaînes d'agent utilisateur, les adresses sources, les codes de réponse et les chemins de requête.
  • Vérifiez les robots d'exploration de confiance à l'aide de flux d'adresses officiels ou de méthodes DNS.
  • Actualisez automatiquement les flux d'adresses.
  • Combinez les vérifications d'agent utilisateur et d'adresse source.
  • Limitez le débit des robots d'exploration vérifiés plutôt que de leur accorder un accès illimité.
  • Contestez ou bloquez les requêtes qui prétendent être des robots d'exploration de confiance mais échouent à la vérification.

Mesure

Suivez :

  • Les visites des services de recherche d'intelligence artificielle
  • Les références à la page originale
  • La fréquence des citations
  • La charge du serveur par robot d'exploration
  • Les requêtes renvoyant 403, 404 ou 429
  • L'accès des robots d'exploration à des chemins non intentionnels
  • Si les articles actuels sont trouvés après publication

Conclusion

L'inclusion maximale nécessite une ouverture sélective, et non une permission globale unique.

Utilisez robots.txt pour séparer l'exploration de recherche, la récupération utilisateur, l'entraînement et l'exploration de jeux de données publics. Utilisez les balises méta et les en-têtes HTTP pour gérer l'indexation et les extraits. Utilisez l'authentification pour tout ce qui est privé. Vérifiez les adresses IP des robots d'exploration plutôt que de faire confiance uniquement aux noms d'agents utilisateurs.

Une licence permissive comme CC BY 4.0 peut faciliter une réutilisation étendue lorsque vous le souhaitez sincèrement. Des informations d'attribution claires – titre, auteur, source, licence, page canonique et date de mise à jour – peuvent également faciliter l'identification et la citation de la source correcte par les systèmes de recherche et les assistants.

La politique de publication la plus solide est donc :

**Ouvrez le contenu public que vous souhaitez voir découvert, licencez clairement le matériel que vous souhaitez réutiliser, marquez le matériel que vous ne possédez pas, protégez les informations privées au niveau du serveur, et donnez à chaque robot d'exploration une permission séparée et révisable.

Articles connexes

Vous aimez ce contenu ?

Abonnez-vous à notre newsletter pour les dernières analyses en marketing de contenu et guides de croissance.

Cet article est fourni à titre informatif uniquement. Les contenus et stratégies peuvent varier selon vos besoins spécifiques.
Licences et Robots pour une Inclusion Maximale : Comment Accueillir les Robots d'IA | AutoPod