Licences et Robots pour une Inclusion Maximale : Comment Accueillir les Robots d'Intelligence Artificielle
Mis à jour le 25 août 2026
Les sites web ont désormais plus d'une façon d'atteindre un public. Une page peut être trouvée via Google Search, résumée par ChatGPT, citée par Perplexity, utilisée dans la recherche Claude, affichée via les services Apple, ou collectée par une archive web publique.
Ces systèmes n'utilisent pas tous le même robot d'exploration ni ne suivent les mêmes règles. Un site web qui bloque GPTBot peut toujours apparaître dans la recherche ChatGPT s'il autorise OAI-SearchBot. Un site web qui autorise Applebot peut rester visible dans Apple Search tout en bloquant Applebot-Extended pour l'entraînement de modèles d'intelligence artificielle. Le Google-Extended de Google n'est pas du tout un robot d'exploration normal ; c'est un jeton de contrôle robots.txt.
La meilleure politique n'est donc pas simplement « autoriser l'intelligence artificielle » ou « bloquer l'intelligence artificielle ». Il s'agit de créer des autorisations distinctes pour :
- La recherche et la découverte
- La récupération à la demande de l'utilisateur
- Le développement et l'entraînement de modèles
- Les ensembles de données publics
- Les contenus sensibles, privés ou restreints
Cet article fournit un inventaire des robots d'exploration actuels, des exemples de robots.txt, des directives sur les balises méta, des méthodes de vérification d'adresses IP, des conseils sur les licences Creative Commons, des clauses juridiques types et une matrice risques-avantages.
Les Quatre Contrôles que Chaque Éditeur Devrait Comprendre
1. robots.txt contrôle l'exploration demandée
Un fichier robots.txt indique aux clients automatisés conformes quelles pages ils peuvent demander. Il est utile pour gérer le trafic des robots d'exploration et exprimer les préférences d'un éditeur.
Cependant, robots.txt n'est pas un système de contrôle d'accès. Le protocole d'exclusion des robots stipule que ses règles ne sont pas une autorisation d'accès. Google avertit également qu'une adresse bloquée peut toujours apparaître dans les résultats de recherche si d'autres pages y renvoient. Utilisez des mots de passe, l'authentification ou des contrôles d'accès côté serveur pour les informations confidentielles. (rfc-editor.org)
2. Les balises méta contrôlent l'indexation et les extraits
Les balises méta robots et l'en-tête de réponse X-Robots-Tag peuvent contrôler si une page est indexée ou si un moteur de recherche peut afficher un extrait.
Ces contrôles ne sont normalement visibles qu'après qu'un robot d'exploration a été autorisé à récupérer la page. Si robots.txt bloque d'abord la page, le robot d'exploration peut ne jamais voir la balise méta. (developers.google.com)
3. Les contrôles réseau vérifient le robot d'exploration
Un nom d'agent utilisateur est facile à copier. Un attaquant peut envoyer une requête prétendant être GPTBot, Googlebot ou PerplexityBot.
Une approche plus robuste combine :
- L'agent utilisateur revendiqué
- Une plage d'adresses IP publiée
- La vérification DNS inverse
- La vérification DNS directe
- Les limites de débit et la surveillance des requêtes
4. Une licence accorde des droits de réutilisation
Robots.txt indique ce qu'un robot d'exploration est invité à faire. Une licence indique ce que les personnes ou les organisations peuvent légalement faire avec le matériel lorsque l'autorisation de droit d'auteur est requise.
Ce sont des outils différents. Une licence permissive peut réduire l'incertitude juridique, mais elle ne garantit pas qu'un robot d'exploration visitera la page, qu'un modèle l'utilisera ou qu'un assistant la citera.
Inventaire des Robots d'Exploration Importants
L'inventaire suivant a été vérifié par rapport à la documentation des fournisseurs disponible le 25 août 2026. Les noms d'agents utilisateurs, les objectifs et les plages d'adresses IP peuvent changer, de sorte que les systèmes de production devraient utiliser la documentation actuelle du fournisseur et les flux d'adresses en direct.
| Fournisseur | Robot d'exploration ou jeton robots.txt | Objectif principal | Contrôle important |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Trouve et analyse les pages pour la recherche ChatGPT | L'autoriser pour améliorer la chance que les pages apparaissent dans les résultats de recherche ChatGPT. |
| OpenAI | GPTBot | Collecte les pages qui peuvent être utilisées pour l'entraînement des modèles d'intelligence artificielle générative d'OpenAI | L'autoriser ou le refuser séparément de la recherche. |
| OpenAI | ChatGPT-User | Récupère les pages après qu'un utilisateur demande à ChatGPT ou à un GPT personnalisé d'y accéder | Il est déclenché par l'utilisateur plutôt que d'être un robot d'exploration web automatique, donc les règles robots.txt peuvent ne pas s'appliquer. |
| OpenAI | OAI-AdsBot | Vérifie les pages web soumises comme destinations publicitaires de ChatGPT | Principalement pertinent pour les annonceurs. Le contenu collecté n'est pas utilisé pour entraîner les modèles fondamentaux d'intelligence artificielle générative. |
Googlebot | Principal robot d'exploration de Google Search | Contrôle l'exploration ordinaire de Google Search. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Images, vidéos et Google News | Ceux-ci ont des jetons robots.txt séparés et peuvent être contrôlés indépendamment. | |
GoogleOther | Exploration Google à usage général pour diverses équipes produit, y compris la recherche et le développement | Il ne représente pas un produit Google spécifique. | |
Google-Extended | Contrôle si le contenu exploré par Google peut être utilisé pour l'entraînement du modèle Gemini et certains systèmes de contextualisation | C'est un jeton de contrôle robots.txt, pas un agent utilisateur de requête séparé. Il n'affecte pas l'inclusion ordinaire dans Google Search. | |
| Anthropic | ClaudeBot | Collecte le contenu web public qui peut contribuer au développement du modèle Claude | Le refuser pour signaler que le matériel futur devrait être exclu des ensembles de données d'entraînement d'Anthropic. |
| Anthropic | Claude-SearchBot | Améliore la qualité des résultats de recherche Claude | L'autoriser pour la visibilité dans la recherche Claude. |
| Anthropic | Claude-User | Récupère les pages en réponse à une demande d'un utilisateur à Claude | Séparé de l'exploration automatique. |
| Perplexity | PerplexityBot | Indexe les pages pour les résultats de recherche Perplexity | Perplexity déclare que ce robot d'exploration n'est pas utilisé pour collecter du contenu pour l'entraînement de modèles fondamentaux d'intelligence artificielle. |
| Perplexity | Perplexity-User | Récupère une page après qu'un utilisateur l'a demandée | La documentation de Perplexity indique que ce récupérateur ignore généralement robots.txt car la demande a été initiée par un utilisateur. |
| Apple | Applebot | Prend en charge Apple Search, Spotlight, Siri, Safari et d'autres expériences Apple | L'autoriser pour la découverte Apple. |
| Apple | Applebot-Extended | Contrôle si le contenu exploré par Applebot peut être utilisé pour entraîner les modèles fondamentaux d'Apple | Il n'explore pas les pages lui-même. C'est un contrôle d'utilisation des données. |
| Common Crawl | CCBot | Collecte des données web publiques pour l'archive web ouverte de Common Crawl | Ce n'est pas un assistant, mais ses ensembles de données peuvent être utilisés par les chercheurs et les développeurs d'intelligence artificielle. |
| Microsoft | Bingbot | Principal robot d'exploration de recherche Bing | L'autoriser pour la découverte et la visibilité dans la recherche Bing. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Aperçus de pages et de vidéos pour les produits Microsoft | Ceux-ci peuvent être contrôlés séparément de Bingbot. |
| Amazon | Amzn-SearchBot | Recherche et découverte de contenu Amazon | Amazon déclare ne pas explorer le contenu pour l'entraînement de modèles d'intelligence artificielle générative. |
| Amazon | Amzn-User | Récupère des informations actuelles en réponse aux actions de l'utilisateur, y compris les requêtes Alexa | Déclenché par l'utilisateur et séparé de l'exploration de recherche automatique. |
OpenAI documente ses robots d'exploration de recherche, d'entraînement, de publicité et déclenchés par l'utilisateur comme des contrôles distincts. Sa documentation recommande spécifiquement d'autoriser OAI-SearchBot pour la recherche ChatGPT tout en utilisant GPTBot séparément pour les préférences d'entraînement. (developers.openai.com)
Google sépare de la même manière Googlebot, GoogleOther et Google-Extended. Google-Extended n'a pas son propre agent utilisateur de requête HTTP, et le bloquer ne retire pas une page de Google Search. (developers.google.com)
Anthropic documente des rôles séparés pour ClaudeBot, Claude-SearchBot et Claude-User. Anthropic déclare également que ses robots suivent robots.txt et prennent en charge la directive non standard Crawl-delay. (support.anthropic.com)
Perplexity distingue l'exploration de recherche automatique de la récupération à la demande de l'utilisateur. Sa documentation actuelle indique que PerplexityBot respecte robots.txt, tandis que Perplexity-User ne le fait généralement pas car il répond à une demande d'utilisateur. (docs.perplexity.ai)
La documentation actuelle d'Apple fait la même distinction entre recherche et entraînement : Applebot prend en charge la découverte, tandis qu'Applebot-Extended permet aux éditeurs de contrôler l'utilisation pour l'entraînement sans supprimer les pages d'Apple Search. (support.apple.com)
Configurations robots.txt Recommandées
Placez robots.txt à la racine de chaque hôte, comme par exemple :
text https://www.example.org/robots.txt
Les règles s'appliquent à l'hôte, au protocole et au port spécifiques où le fichier est servi. Un sous-domaine séparé peut nécessiter son propre fichier. (developers.google.com)
Configuration 1 : Inclusion maximale
Utilisez ceci lorsque le contenu éditorial public peut être trouvé, résumé, cité, indexé et collecté par des robots d'exploration conformes.
text
Les pages publiques sont disponibles pour les robots d'exploration conformes.
User-agent: * Allow: /
Excluez les chemins privés, transactionnels et administratifs.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Ceci autorise les robots d'exploration nommés, y compris OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft et Amazon, à moins qu'une autre règle spécifique ne les bloque.
Ne placez pas de règle générale telle que User-agent: * Disallow: / sous cette configuration. Un groupe ultérieur ou plus spécifique peut modifier la façon dont un robot d'exploration interprète le fichier.
Configuration 2 : Autoriser la recherche mais bloquer les robots d'exploration de développement de modèles
C'est souvent le meilleur compromis pour les éditeurs qui souhaitent des citations et du trafic de recherche mais ne veulent pas signaler d'autorisation pour la collecte de développement de modèles.
text
Bloquez l'exploration pour le développement de modèles OpenAI.
User-agent: GPTBot Disallow: /
Bloquez l'exploration pour le développement de modèles Anthropic.
User-agent: ClaudeBot Disallow: /
Bloquez l'entraînement de modèles Google et l'utilisation de contextualisation associée.
User-agent: Google-Extended Disallow: /
Bloquez l'utilisation pour l'entraînement de modèles fondamentaux Apple.
User-agent: Applebot-Extended Disallow: /
Facultatif : bloquez la collecte de données Common Crawl.
User-agent: CCBot
Disallow: /
Autorisez l'exploration de recherche et de récupération ordinaire, sauf pour les chemins sensibles.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Cette configuration laisse OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot et Applebot couverts par le groupe générique. Elle maintient également les autorisations de recherche et d'entraînement séparées.
Pour Apple, le blocage d'Applebot-Extended tout en autorisant Applebot préserve la découverte via les services Apple. Pour Google, le blocage de Google-Extended ne bloque pas la recherche Google ordinaire. (developers.google.com)
Configuration 3 : Autoriser explicitement les robots d'exploration de recherche sélectionnés
Si un fichier robots.txt existant bloque tous les robots d'exploration, ajoutez des groupes séparés pour les robots d'exploration de recherche que vous souhaitez accueillir.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Excluez tous les autres robots d'exploration.
User-agent: * Disallow: /
Lorsque vous utilisez des groupes spécifiques, répétez les règles de chemins sensibles à l'intérieur de chaque groupe. Certains robots d'exploration utilisent le groupe de correspondance le plus spécifique plutôt que de le combiner avec le groupe générique. Bing documente directement ce comportement, et Google fournit des conseils séparés sur les groupes spécifiques aux robots d'exploration. (bing.com)
Limitations importantes de robots.txt
- Un robot d'exploration peut ignorer robots.txt.
- Un robot d'exploration malveillant peut se faire passer pour un robot d'exploration de confiance.
- Une page bloquée peut toujours être connue par son titre ou son adresse web.
- Robots.txt ne protège pas les mots de passe, les fichiers privés, les dossiers clients ou les interfaces de programmation d'applications confidentielles.
- Une directive
Crawl-delayne fait pas partie du protocole d'exclusion des robots et n'est pas prise en charge par tous les robots d'exploration. Anthropic et Bing documentent leur prise en charge, tandis qu'Apple déclare qu'Applebot ne suit pas le crawl-delay. (rfc-editor.org)
Balises Méta et En-têtes HTTP
Exemple de page publique
Pour un article public, utilisez un titre clair, un auteur, une adresse web canonique, une date de publication et une date de modification.
html
La directive max-snippet est principalement documentée pour Google. Ne supposez pas que chaque robot d'exploration d'intelligence artificielle prend en charge chaque directive méta.
Exemple de page privée ou sensible
html
Utilisez ceci pour les pages qui ne devraient pas apparaître dans les résultats de recherche. La page doit rester explorable suffisamment longtemps pour que le robot d'exploration puisse voir la directive. Si la page doit vraiment rester privée, utilisez plutôt l'authentification ou la protection par mot de passe. (developers.google.com)
Masquer uniquement les sections sensibles des extraits de recherche
Google prend en charge data-nosnippet pour des parties spécifiques d'une page HTML :
html
Ce paragraphe peut être affiché dans un résultat de recherche.
Ceci est utile pour les coordonnées, les notes internes ou les informations générées par l'utilisateur. Ce n'est pas une instruction universelle pour chaque système d'intelligence artificielle. (developers.google.com)
Utiliser l'en-tête X-Robots-Tag pour les fichiers
Les balises méta ne peuvent pas être placées à l'intérieur d'un fichier PDF, d'une image ou d'un fichier vidéo. Utilisez plutôt un en-tête de réponse HTTP :
text X-Robots-Tag: noindex, nosnippet
Pour une page qui devrait rester consultable mais ne devrait pas fournir de texte pour les extraits ou les réponses d'intelligence artificielle, utilisez :
text X-Robots-Tag: nosnippet
Google documente X-Robots-Tag pour les ressources non-HTML, et Apple le prend également en charge pour Applebot. (developers.google.com)
Contrôles spécifiques à Apple
Apple prend en charge :
html
Apple déclare que nosnippet empêche la page d'être utilisée comme contexte supplémentaire et contenu actuel lorsque les modèles Apple génèrent une sortie. La page peut toujours rester découvrable via Apple Search, Spotlight, Siri et Safari. (support.apple.com)
Pour les pages payantes, Apple prend également en charge les données structurées en utilisant :
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple déclare que de telles pages peuvent rester éligibles pour les résultats de recherche mais ne seront pas utilisées comme contexte supplémentaire pour les réponses d'intelligence artificielle. (support.apple.com)
Comment Vérifier les Adresses IP des Robots d'Exploration
Pourquoi la correspondance d'agent utilisateur n'est pas suffisante
Une règle comme celle-ci est faible :
text if User-Agent contains "GPTBot": allow
N'importe qui peut envoyer ce texte. Une meilleure règle est :
text si l'Agent-Utilisateur est un robot d'exploration connu et l'adresse IP source est dans la plage officielle du fournisseur : autoriser ou limiter le débit sinon : contester, limiter le débit ou bloquer
Ne faites pas confiance à un en-tête X-Forwarded-For à moins qu'il ne provienne d'un proxy ou d'un réseau de diffusion de contenu que votre organisation contrôle.
Méthodes de vérification des fournisseurs
| Fournisseur | Méthode de vérification recommandée |
|---|---|
| OpenAI | Utilisez les flux d'adresses IP en direct publiés dans la documentation des robots d'exploration OpenAI pour OAI-SearchBot, GPTBot et OAI-AdsBot. Actualisez-les automatiquement plutôt que de copier des plages fixes dans un pare-feu. |
| Utilisez les plages de robots d'exploration publiées par Google ou effectuez des vérifications DNS inverses et directes. Un véritable robot d'exploration Google devrait se résoudre en un nom d'hôte Google approuvé et se résoudre de nouveau en l'adresse d'origine. | |
| Anthropic | Utilisez le flux d'adresses de robots d'exploration publié actuel comme vérification réseau secondaire. La méthode de désactivation principale d'Anthropic reste robots.txt. |
| Perplexity | Combinez l'agent utilisateur avec le flux d'adresses actuel de PerplexityBot ou Perplexity-User. Perplexity recommande spécifiquement de combiner les deux conditions dans une règle de pare-feu d'application web. |
| Apple | Utilisez la vérification DNS inverse sous applebot.apple.com, puis effectuez une recherche directe. Apple publie également les plages d'adresses actuelles dans un flux JSON. |
| Common Crawl | Utilisez la vérification DNS inverse sous crawl.commoncrawl.org et le flux d'adresses actuel de CCBot. Common Crawl note que la vérification inverse n'est pas encore disponible pour certains trafics IPv6. |
| Microsoft | Utilisez l'outil officiel Verify Bingbot ou les méthodes de recherche inverse et directe documentées par Microsoft. |
| Amazon | Utilisez les listes d'adresses de robots d'exploration publiées par Amazon et faites-les correspondre à l'agent utilisateur Amazon approprié. |
Google, Apple, Common Crawl, OpenAI, Anthropic et Perplexity publient tous des méthodes ou des flux d'adresses spécifiques aux fournisseurs. Ces listes peuvent changer, de sorte qu'un processus de mise à jour programmé est plus sûr qu'une liste permanente copiée manuellement. (developers.google.com)
Une conception simple de pare-feu pourrait ressembler à ceci :
text autoriser OAI-SearchBot uniquement lorsque l'adresse source est dans la plage de recherche actuelle d'OpenAI autoriser GPTBot uniquement lorsque l'adresse source est dans la plage d'entraînement actuelle d'OpenAI autoriser PerplexityBot uniquement lorsque l'adresse source est dans la plage actuelle de PerplexityBot autoriser Applebot uniquement lorsque la vérification DNS inverse et directe réussit autoriser CCBot uniquement lorsque le DNS inverse et la plage actuelle de Common Crawl correspondent
limiter le débit de tous les robots d'exploration vérifiés bloquer ou contester les requêtes non vérifiées se faisant passer pour des robots d'exploration de confiance
N'appliquez pas une règle d'autorisation large à un fournisseur de cloud entier. Un robot d'exploration légitime peut utiliser l'infrastructure cloud, mais la majeure partie du trafic de ce fournisseur de cloud n'est pas nécessairement le robot d'exploration.
Comment la Licence Ouverte Influence l'Inclusion
CC BY 4.0 en langage clair
La licence Creative Commons Attribution 4.0 International, communément appelée CC BY 4.0, permet aux gens de :
- Copier et redistribuer l'œuvre
- Adapter, traduire, remixer et s'appuyer sur celle-ci
- L'utiliser commercialement
Les conditions principales sont :
- Accorder un crédit approprié
- Lier à la licence
- Indiquer si des modifications ont été apportées
- Ne pas suggérer que le créateur original approuve la réutilisation
- Ne pas ajouter de restrictions légales ou techniques qui empêchent les utilisations permises par la licence
Creative Commons avertit également que la licence peut ne pas couvrir les droits à la vie privée, les droits de publicité, les droits moraux, les droits de marque, les droits de brevet ou le matériel tiers. (creativecommons.org)
Une licence n'est pas une invitation à l'exploration en soi
Apposer « CC BY 4.0 » sur une page ne garantit pas qu'une organisation l'explorera. Un robot d'exploration peut toujours être bloqué par :
- robots.txt
- Un réseau de diffusion de contenu
- Un pare-feu d'application web
- La limitation de débit
- Un défi JavaScript
- Un mur de connexion
- Une mauvaise réponse du serveur
- Un sitemap inaccessible
Inversement, autoriser un robot d'exploration n'accorde pas automatiquement toutes les autorisations de droit d'auteur nécessaires pour chaque utilisation ultérieure. Robots.txt et les licences doivent être conçus ensemble.
Pourquoi CC BY peut soutenir une inclusion plus large
Une licence permissive claire peut faciliter la compréhension de la politique d'un éditeur pour les équipes de données, les systèmes de recherche et les opérateurs d'assistants. Elle peut réduire l'incertitude concernant la copie, l'adaptation, l'utilisation commerciale, la traduction et la redistribution lorsque ces activités nécessitent une autorisation de droit d'auteur.
Cependant, Creative Commons explique que l'entraînement à l'intelligence artificielle est juridiquement complexe. Une licence restrictive n'est pas toujours un moyen efficace d'empêcher l'entraînement, car certaines utilisations pour l'entraînement peuvent être permises par des exceptions ou des limitations de droit d'auteur. Creative Commons note également que les conditions de licence peuvent être difficiles à appliquer à l'entraînement machine et aux sorties de modèles. (creativecommons.org)
La leçon pratique est la suivante :
Utilisez CC BY lorsque vous souhaitez sincèrement une réutilisation licite étendue. N'utilisez pas de licence Creative Commons restrictive comme moyen garanti de désactivation de l'entraînement à l'intelligence artificielle.
L'attribution améliore la clarté de la source
Creative Commons recommande la méthode TASL :
- Titre
- Auteur
- Source
- Licence
Par exemple :
« Licences et Robots pour une Inclusion Maximale », Example Publishing, https://www.example.org/articles/ai-crawlers, sous licence Creative Commons Attribution 4.0 International. Modifications apportées : inventaire des robots d'exploration mis à jour.
Une attribution claire ne force pas chaque assistant à citer une page. Elle facilite une citation correcte lorsqu'un système extrait le titre, l'auteur, la source et les informations de licence de la page. (wiki.creativecommons.org)
Ajouter des informations d'article structurées
Utilisez les informations visibles et les données structurées ensemble :
html
Google recommande des informations d'auteur claires, des pages d'auteur, des dates de publication, des dates de modification et des pages canoniques stables. Ces signaux peuvent aider les systèmes de recherche à comprendre qui a créé le matériel et quelle version fait autorité. Ils ne garantissent pas un classement, une inclusion ou une citation. (developers.google.com)
Clauses Juridiques Types pour un Site Ouvert et Propice à la Citation
Ce qui suit est un exemple de formulation, et non un avis juridique. Demandez à votre avocat de l'adapter à votre juridiction, votre structure de propriété, vos obligations en matière de confidentialité et votre contenu tiers.
Déclaration de licence CC BY 4.0
text
Licence de contenu
Sauf indication contraire, le texte original et les matériaux éditoriaux originaux de cette page sont sous licence Creative Commons Attribution 4.0 International :
https://creativecommons.org/licenses/by/4.0/
Cette autorisation permet la copie, la redistribution, l'adaptation, la traduction, l'utilisation commerciale, le traitement lisible par machine, l'indexation de recherche, la récupération, la synthèse et l'utilisation dans les systèmes d'intelligence artificielle, à condition que les termes de la licence soient respectés.
Attribution préférée :
« [Titre de la page] », par [auteur ou organisation], [adresse de la page canonique], publié ou mis à jour le [date], sous licence Creative Commons Attribution 4.0 International. Modifications apportées : [décrire les modifications, ou indiquer 'aucune'].
Veuillez préserver l'auteur, l'éditeur, la source, la licence et les informations de modification dans la mesure du possible. Ce guide d'attribution préféré n'ajoute pas de restrictions à la licence Creative Commons et ne remplace pas le texte de la licence.
L'expression « y compris les systèmes d'intelligence artificielle » clarifie l'intention de l'éditeur. Elle ne doit pas être utilisée pour prétendre que l'éditeur possède les droits sur du matériel créé par quelqu'un d'autre.
Avis sur la marque, la confidentialité et les droits des tiers
text
Droits de marque, de confidentialité et de tiers
La licence ci-dessus ne couvre que les matériaux originaux identifiés comme sous licence. Elle n'accorde pas l'autorisation d'utiliser :
- Marques de commerce, marques de service, logos ou habillage commercial
- Noms, images ou ressemblances de personnes
- Informations privées, confidentielles, de compte, de santé, financières ou de sécurité
- Soumissions d'utilisateurs à moins qu'elles ne soient séparément identifiées comme sous licence
- Photographies, illustrations, cartes, vidéos, musiques, citations ou autres matériaux tiers
- Contenu identifié comme « tous droits réservés » ou soumis à une licence distincte
L'utilisation du nom, des logos et des marques d'Example Publishing ne doit pas suggérer un parrainage, une approbation, un partenariat ou un endossement. Veuillez créer un lien vers la page originale et distinguer clairement les citations, les paraphrases, les résumés et les matériaux générés.
Ce langage est important car les licences Creative Commons n'accordent pas automatiquement tous les types de droits légaux liés à une page. (creativecommons.org)
Guide de citation pour la recherche et l'assistant
text
Guide de citation pour la recherche et l'assistant
Nous accueillons l'indexation de recherche conforme, la récupération à la demande de l'utilisateur, la citation et la synthèse du matériel sous licence sur ce site.
Lorsque vous citez ce site, veuillez utiliser le titre de la page, l'auteur ou l'éditeur, l'adresse de la page canonique, la date de publication ou de mise à jour, et un lien direct vers la source. Veuillez identifier la source comme une entrée parmi toutes les sources utilisées, distinguer l'analyse générée du matériel cité, et ne pas déclarer ou impliquer qu'Example Publishing approuve une réponse, un produit, une personne ou un service généré.
Ce guide vise à améliorer la précision et l'attribution. Il n'accorde pas de droits au-delà de la licence de contenu applicable et ne licencie pas les marques de commerce, les informations personnelles, les informations confidentielles ou le matériel tiers.
Si vous souhaitez une visibilité de recherche mais ne voulez pas accorder une licence d'entraînement large
text
Accès à la recherche et droits d'auteur
Nos pages publiques peuvent être consultées par des robots d'exploration de recherche et de récupération conformes identifiés dans notre fichier robots.txt. Cette autorisation vise à soutenir la découverte, les résultats de recherche, la récupération à la demande de l'utilisateur et la citation.
Sauf indication d'une licence distincte, le contenu original reste « tous droits réservés ». L'accès à une page publique n'accorde pas de licence distincte pour le développement de modèles, l'entraînement, la redistribution, la réutilisation commerciale ou la création d'œuvres dérivées au-delà des droits prévus par la loi applicable.
Veuillez citer l'adresse de la page canonique et l'éditeur lorsque vous faites référence à ce matériel. Rien sur ce site n'accorde l'autorisation d'utiliser des marques de commerce, des logos, des informations personnelles, des informations confidentielles ou du contenu tiers.
Ne placez pas la déclaration CC BY et la déclaration « tous droits réservés » sur le même matériel. Identifiez clairement quelle licence s'applique à quel contenu.
Matrice Risques-Bénéfices pour la Licence Ouverte
Le droit d'auteur et les règles d'entraînement à l'intelligence artificielle diffèrent selon les pays et restent incertains. L'United States Copyright Office continue d'examiner ces questions, tandis que Creative Commons décrit l'entraînement à l'intelligence artificielle comme spécifique aux faits et juridiquement complexe. (copyright.gov)
| Approche | Potentiel d'inclusion | Principaux avantages | Principaux risques | Meilleure adéquation |
|---|---|---|---|---|
| CC BY 4.0 | Très élevé | Copie, adaptation, utilisation commerciale, traduction, indexation et réutilisation liée aux modèles étendues lorsque l'autorisation de droit d'auteur est nécessaire | Les concurrents commerciaux peuvent réutiliser ou adapter le contenu ; l'attribution peut être imparfaite ; la licence ne peut pas contrôler la vie privée, les marques ou les droits de tiers | Les éditeurs qui souhaitent la réutilisation légale la plus large et une attribution de source solide |
| CC BY-SA 4.0 | Élevé, mais plus complexe | Encourage un cycle de partage ouvert et exige que les adaptations restent sous des termes compatibles | Les règles ShareAlike peuvent être difficiles à appliquer aux ensembles de données, à l'entraînement de modèles et aux sorties publiques ; certaines organisations peuvent éviter le matériel en raison de l'incertitude | Les projets éducatifs et d'intérêt public ouverts qui veulent que les adaptations en aval restent ouvertes |
| CC BY-NC 4.0 | Moyen ou faible | Limite les utilisations principalement destinées à un avantage commercial ou à une compensation monétaire | « Non commercial » peut être difficile à interpréter ; peut exclure les utilisations commerciales de recherche, de modèle et d'assistant ; ce n'est pas une désactivation garantie de l'entraînement | Matériel destiné à un usage non lucratif, éducatif ou communautaire |
| CC BY-ND 4.0 | Moyen | Permet le partage tout en limitant les adaptations | La traduction, la transformation et certains cas d'utilisation d'assistants peuvent devenir juridiquement incertains ; moins attractif pour les systèmes qui résument ou remixent | Avis officiels ou œuvres qui doivent rester inchangées |
| CC0 ou dédicace au domaine public | Très élevé | Simplifie la réutilisation et supprime la plupart des conditions de droit d'auteur là où légalement efficace | Aucune attribution requise ; contrôle faible sur la présentation de la marque ; les droits à la vie privée, de marque et de publicité restent séparés | Faits, ensembles de données, matériel de référence ou œuvres destinées à une réutilisation sans restriction |
| Tous droits réservés plus exploration de recherche ouverte | Élevé pour la recherche, plus faible pour l'entraînement | Peut préserver la visibilité de la recherche et la citation sans accorder de licence de réutilisation large | Plus d'incertitude juridique pour les développeurs de modèles ; peut réduire l'inclusion dans les ensembles de données d'entraînement et les systèmes de réutilisation commerciale | Les éditeurs qui souhaitent la découverte et les citations mais préfèrent négocier des licences plus larges séparément |
La stratégie la plus équilibrée pour de nombreuses organisations est la suivante :
- CC BY 4.0 pour le texte éditorial public original
- Étiquettes séparées pour le matériel tiers
- Pas d'informations personnelles ou confidentielles publiques
- Autoriser les robots d'exploration de recherche et de récupération
- Autoriser les robots d'exploration de développement de modèles uniquement si l'organisation accepte réellement cette utilisation
- Utiliser une attribution claire et des liens canoniques
- Protéger les marques via un avis de marque séparé
Une Liste de Vérification de Mise en Œuvre Pratique
Contenu et licences
- Identifiez qui possède chaque page, image, graphique, vidéo et citation.
- Ne concédez sous licence que le matériel dont votre organisation contrôle les droits.
- Marquez séparément le matériel tiers.
- Ajoutez une déclaration de licence visible.
- Fournissez une citation préférée utilisant le titre, l'auteur, la source et la licence.
- Gardez les logos, les marques de commerce, les données personnelles et les informations confidentielles en dehors du champ d'application de la licence.
Robots.txt
- Créez un fichier robots.txt public à la racine de chaque hôte.
- Autorisez les robots d'exploration de recherche séparément des robots d'exploration d'entraînement.
- Bloquez les chemins administratifs, de compte, de paiement, privés et d'applications internes.
- Ne vous fiez pas à robots.txt pour la sécurité.
- Testez le fichier après chaque déploiement majeur du site web.
Balises méta
- Utilisez des liens canoniques.
- Ajoutez l'auteur, la date de publication et la date de modification.
- Utilisez
noindexpour les pages qui ne devraient pas apparaître dans la recherche. - Utilisez
nosnippetoudata-nosnippetpour les extraits sensibles là où cela est pris en charge. - Utilisez
X-Robots-Tagpour les fichiers PDF, les images et autres ressources non-HTML. - N'oubliez pas qu'un robot d'exploration doit pouvoir récupérer une page avant de pouvoir lire ses balises méta.
Sécurité réseau
- Enregistrez les chaînes d'agent utilisateur, les adresses sources, les codes de réponse et les chemins de requête.
- Vérifiez les robots d'exploration de confiance à l'aide de flux d'adresses officiels ou de méthodes DNS.
- Actualisez automatiquement les flux d'adresses.
- Combinez les vérifications d'agent utilisateur et d'adresse source.
- Limitez le débit des robots d'exploration vérifiés plutôt que de leur accorder un accès illimité.
- Contestez ou bloquez les requêtes qui prétendent être des robots d'exploration de confiance mais échouent à la vérification.
Mesure
Suivez :
- Les visites des services de recherche d'intelligence artificielle
- Les références à la page originale
- La fréquence des citations
- La charge du serveur par robot d'exploration
- Les requêtes renvoyant
403,404ou429 - L'accès des robots d'exploration à des chemins non intentionnels
- Si les articles actuels sont trouvés après publication
Conclusion
L'inclusion maximale nécessite une ouverture sélective, et non une permission globale unique.
Utilisez robots.txt pour séparer l'exploration de recherche, la récupération utilisateur, l'entraînement et l'exploration de jeux de données publics. Utilisez les balises méta et les en-têtes HTTP pour gérer l'indexation et les extraits. Utilisez l'authentification pour tout ce qui est privé. Vérifiez les adresses IP des robots d'exploration plutôt que de faire confiance uniquement aux noms d'agents utilisateurs.
Une licence permissive comme CC BY 4.0 peut faciliter une réutilisation étendue lorsque vous le souhaitez sincèrement. Des informations d'attribution claires – titre, auteur, source, licence, page canonique et date de mise à jour – peuvent également faciliter l'identification et la citation de la source correcte par les systèmes de recherche et les assistants.
La politique de publication la plus solide est donc :
**Ouvrez le contenu public que vous souhaitez voir découvert, licencez clairement le matériel que vous souhaitez réutiliser, marquez le matériel que vous ne possédez pas, protégez les informations privées au niveau du serveur, et donnez à chaque robot d'exploration une permission séparée et révisable.
Auto