Licenze e Robot per la Massima Inclusione: Come Accogliere i Crawler di Intelligenza Artificiale
Aggiornato il 25 agosto 2026
I siti web ora hanno più di un modo per raggiungere un pubblico. Una pagina può essere trovata tramite Google Search, riassunta da ChatGPT, citata da Perplexity, utilizzata nella ricerca di Claude, visualizzata tramite i servizi Apple o raccolta da un archivio web pubblico.
Questi sistemi non utilizzano tutti lo stesso crawler o seguono le stesse regole. Un sito web che blocca GPTBot potrebbe comunque apparire nella ricerca di ChatGPT se consente OAI-SearchBot. Un sito web che consente Applebot può rimanere visibile in Apple Search bloccando Applebot-Extended dall'addestramento del modello di intelligenza artificiale. Google-Extended di Google non è affatto un crawler normale; è un token di controllo robots.txt.
La politica migliore non è quindi semplicemente "consentire l'intelligenza artificiale" o "bloccare l'intelligenza artificiale". Si tratta di creare permessi separati per:
- Ricerca e scoperta
- Recupero richiesto dall'utente
- Sviluppo e addestramento del modello
- Dataset pubblici
- Materiale sensibile, privato o riservato
Questo articolo fornisce un inventario aggiornato dei crawler, esempi di robots.txt, linee guida per i meta tag, metodi di verifica degli indirizzi IP, consigli sulle licenze Creative Commons, clausole legali standard e una matrice rischio-beneficio.
I Quattro Controlli che Ogni Editore Dovrebbe Comprendere
1. robots.txt controlla la scansione richiesta
Un file robots.txt indica ai client automatizzati conformi quali pagine possono richiedere. È utile per gestire il traffico dei crawler ed esprimere le preferenze di un editore.
Tuttavia, robots.txt non è un sistema di controllo degli accessi. Il Robots Exclusion Protocol afferma che le sue regole non sono autorizzazioni di accesso. Google avverte anche che un indirizzo bloccato può comunque apparire nei risultati di ricerca se altre pagine si collegano ad esso. Utilizzare password, autenticazione o controlli di accesso lato server per informazioni riservate. (rfc-editor.org)
2. I meta tag controllano l'indicizzazione e gli snippet
I meta tag robots e l'intestazione di risposta X-Robots-Tag possono controllare se una pagina viene indicizzata o se un motore di ricerca può mostrare uno snippet.
Questi controlli sono normalmente visibili solo dopo che a un crawler è stato consentito di recuperare la pagina. Se robots.txt blocca prima la pagina, il crawler potrebbe non vedere mai il meta tag. (developers.google.com)
3. I controlli di rete verificano il crawler
Un nome user-agent è facile da copiare. Un attaccante può inviare una richiesta affermando di essere GPTBot, Googlebot o PerplexityBot.
Un approccio più solido combina:
- Il user-agent dichiarato
- Un intervallo di indirizzi IP pubblicato
- Verifica del Reverse Domain Name System
- Verifica del Forward Domain Name System
- Limiti di frequenza e monitoraggio delle richieste
4. Una licenza concede i diritti di riutilizzo
Robots.txt dice cosa è chiesto a un crawler di fare. Una licenza dice cosa persone o organizzazioni possono fare legalmente con il materiale quando è richiesta l'autorizzazione di copyright.
Sono strumenti diversi. Una licenza permissiva può ridurre l'incertezza legale, ma non garantisce che un crawler visiterà la pagina, che un modello la utilizzerà o che un assistente la citerà.
Inventario dei Crawler Importanti
Il seguente inventario è stato verificato rispetto alla documentazione del provider disponibile il 25 agosto 2026. Nomi user-agent, scopi e intervalli di indirizzi IP possono cambiare, quindi i sistemi di produzione dovrebbero utilizzare la documentazione attuale del provider e i feed di indirizzi in tempo reale.
| Provider | Crawler o token robots.txt | Scopo principale | Controllo importante |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Trova e analizza pagine per la ricerca di ChatGPT | Consentire per migliorare la possibilità che le pagine appaiano nei risultati di ricerca di ChatGPT. |
| OpenAI | GPTBot | Raccoglie pagine che possono essere utilizzate per l'addestramento dei modelli generativi di intelligenza artificiale di OpenAI | Consentire o negare separatamente dalla ricerca. |
| OpenAI | ChatGPT-User | Recupera pagine dopo che un utente chiede a ChatGPT o a un GPT personalizzato di accedervi | È attivato dall'utente anziché essere un crawler web automatico, quindi le regole di robots.txt potrebbero non applicarsi. |
| OpenAI | OAI-AdsBot | Controlla le pagine web inviate come destinazioni pubblicitarie di ChatGPT | Rilevante principalmente per gli inserzionisti. Il contenuto raccolto non viene utilizzato per addestrare modelli fondamentali di intelligenza artificiale generativa. |
Googlebot | Crawler principale di Google Search | Controlla la normale scansione di Google Search. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Immagini, video e Google News | Questi hanno token robots.txt separati e possono essere controllati indipendentemente. | |
GoogleOther | Scansione generica di Google per vari team di prodotto, inclusa ricerca e sviluppo | Non rappresenta un prodotto Google specifico. | |
Google-Extended | Controlla se il contenuto scansionato da Google può essere utilizzato per l'addestramento del modello Gemini e per alcuni sistemi di "grounding" | È un token di controllo robots.txt, non un user-agent di richiesta separato. Non influisce sull'inclusione ordinaria in Google Search. | |
| Anthropic | ClaudeBot | Raccoglie contenuti web pubblici che possono contribuire allo sviluppo del modello Claude | Negare per segnalare che il materiale futuro dovrebbe essere escluso dai dataset di addestramento di Anthropic. |
| Anthropic | Claude-SearchBot | Migliora la qualità dei risultati di ricerca di Claude | Consentire per la visibilità nella ricerca di Claude. |
| Anthropic | Claude-User | Recupera pagine in risposta a una richiesta dell'utente a Claude | Separato dalla scansione automatica. |
| Perplexity | PerplexityBot | Indicizza le pagine per i risultati di ricerca di Perplexity | Perplexity afferma che questo crawler non viene utilizzato per raccogliere contenuti per l'addestramento di modelli fondamentali di intelligenza artificiale. |
| Perplexity | Perplexity-User | Recupera una pagina dopo che un utente l'ha richiesta | La documentazione di Perplexity afferma che questo recuperatore generalmente ignora robots.txt perché la richiesta è stata avviata da un utente. |
| Apple | Applebot | Supporta Apple Search, Spotlight, Siri, Safari e altre esperienze Apple | Consentire per la scoperta tramite Apple. |
| Apple | Applebot-Extended | Controlla se il contenuto scansionato da Applebot può essere utilizzato per addestrare i modelli fondamentali di Apple | Non scansiona le pagine da solo. È un controllo sull'uso dei dati. |
| Common Crawl | CCBot | Raccoglie dati web pubblici per l'archivio web aperto di Common Crawl | Non è un assistente, ma i suoi dataset possono essere utilizzati da ricercatori e sviluppatori di intelligenza artificiale. |
| Microsoft | Bingbot | Crawler principale di Bing Search | Consentire per la scoperta e la visibilità nella ricerca di Bing. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Anteprime di pagine e video per i prodotti Microsoft | Questi possono essere controllati separatamente da Bingbot. |
| Amazon | Amzn-SearchBot | Ricerca Amazon e scoperta di contenuti | Amazon afferma di non scansionare contenuti per l'addestramento di modelli generativi di intelligenza artificiale. |
| Amazon | Amzn-User | Recupera informazioni attuali in risposta alle azioni dell'utente, incluse le richieste Alexa | Attivato dall'utente e separato dalla scansione automatica di ricerca. |
OpenAI documenta i suoi crawler di ricerca, addestramento, pubblicità e attivati dall'utente come controlli separati. La sua documentazione raccomanda specificamente di consentire OAI-SearchBot per la ricerca di ChatGPT utilizzando GPTBot separatamente per le preferenze di addestramento. (developers.openai.com)
Google separa in modo simile Googlebot, GoogleOther e Google-Extended. Google-Extended non ha un proprio user-agent di richiesta HTTP, e bloccarlo non rimuove una pagina da Google Search. (developers.google.com)
Anthropic documenta ruoli separati per ClaudeBot, Claude-SearchBot e Claude-User. Anthropic afferma anche che i suoi bot seguono robots.txt e supportano la direttiva non standard Crawl-delay. (support.anthropic.com)
Perplexity distingue tra la scansione automatica di ricerca e il recupero richiesto dall'utente. La sua documentazione attuale afferma che PerplexityBot rispetta robots.txt, mentre Perplexity-User generalmente non lo fa perché risponde a una richiesta dell'utente. (docs.perplexity.ai)
La documentazione attuale di Apple fa la stessa distinzione tra ricerca e addestramento: Applebot supporta la scoperta, mentre Applebot-Extended consente agli editori di controllare l'uso per l'addestramento senza rimuovere le pagine da Apple Search. (support.apple.com)
Configurazioni robots.txt Consigliate
Posizionare robots.txt alla radice di ogni host, come ad esempio:
text https://www.example.org/robots.txt
Le regole si applicano all'host, al protocollo e alla porta specifici in cui viene servito il file. Un sottodominio separato potrebbe aver bisogno del proprio file. (developers.google.com)
Configurazione 1: Massima inclusione
Utilizzare questa configurazione quando i contenuti editoriali pubblici possono essere trovati, riassunti, citati, indicizzati e raccolti da crawler conformi.
text
Le pagine pubbliche sono disponibili per i crawler conformi.
User-agent: * Allow: /
Escludere i percorsi privati, transazionali e amministrativi.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Questo consente i crawler nominati, inclusi OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft e Amazon, a meno che un'altra regola specifica non li blocchi.
Non inserire una regola generica come User-agent: * Disallow: / sotto questa configurazione. Un gruppo successivo o più specifico potrebbe modificare il modo in cui un crawler interpreta il file.
Configurazione 2: Consentire la ricerca ma bloccare i crawler di sviluppo del modello
Questo è spesso il miglior compromesso per gli editori che desiderano citazioni e traffico di ricerca ma non vogliono segnalare il permesso per la raccolta per lo sviluppo di modelli.
text
Blocca la scansione per lo sviluppo di modelli OpenAI.
User-agent: GPTBot Disallow: /
Blocca la scansione per lo sviluppo di modelli Anthropic.
User-agent: ClaudeBot Disallow: /
Blocca l'addestramento dei modelli Google e l'uso correlato per il "grounding".
User-agent: Google-Extended Disallow: /
Blocca l'uso per l'addestramento dei modelli fondamentali Apple.
User-agent: Applebot-Extended Disallow: /
Opzionale: blocca la raccolta di dataset di Common Crawl.
User-agent: CCBot
Disallow: /
Consenti la normale scansione per la ricerca e il recupero, eccetto per i percorsi sensibili.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Questa configurazione lascia OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot e Applebot coperti dal gruppo wildcard. Mantiene anche i permessi di ricerca e di addestramento separati.
Per Apple, bloccare Applebot-Extended pur consentendo Applebot preserva la scoperta tramite i servizi Apple. Per Google, bloccare Google-Extended non blocca la normale ricerca Google. (developers.google.com)
Configurazione 3: Consentire esplicitamente i crawler di ricerca selezionati
Se un file robots.txt esistente blocca tutti i crawler, aggiungere gruppi separati per i crawler di ricerca che si desidera accogliere.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Mantenere tutti gli altri crawler fuori.
User-agent: * Disallow: /
Quando si utilizzano gruppi specifici, ripetere le regole dei percorsi sensibili all'interno di ciascun gruppo. Alcuni crawler utilizzano il gruppo di corrispondenza più specifico anziché combinarlo con il gruppo wildcard. Bing documenta direttamente questo comportamento e Google fornisce linee guida separate sui gruppi specifici per i crawler. (bing.com)
Importanti limitazioni di robots.txt
- Un crawler può ignorare robots.txt.
- Un crawler malevolo può fingere di essere un crawler affidabile.
- Una pagina bloccata può ancora essere conosciuta per il suo titolo o indirizzo web.
- Robots.txt non protegge password, file privati, registri clienti o interfacce di programmazione di applicazioni riservate.
- Una direttiva
Crawl-delaynon fa parte del Robots Exclusion Protocol di base e non è supportata da tutti i crawler. Anthropic e Bing documentano il supporto, mentre Apple afferma che Applebot non segue crawl-delay. (rfc-editor.org)
Meta Tag e Intestazioni HTTP
Esempio di pagina pubblica
Per un articolo pubblico, utilizzare un titolo chiaro, autore, indirizzo web canonico, data di pubblicazione e data di modifica.
html
La direttiva max-snippet è principalmente documentata per Google. Non dare per scontato che ogni crawler di intelligenza artificiale supporti ogni direttiva meta.
Esempio di pagina privata o sensibile
html
Utilizzare questo per le pagine che non dovrebbero apparire nei risultati di ricerca. La pagina deve rimanere scansionabile abbastanza a lungo affinché il crawler possa vedere la direttiva. Se la pagina deve rimanere veramente privata, utilizzare l'autenticazione o la protezione con password invece. (developers.google.com)
Nascondere solo sezioni sensibili dagli snippet di ricerca
Google supporta data-nosnippet per parti specifiche di una pagina HTML:
html
Questo paragrafo può essere mostrato in un risultato di ricerca.
Questo è utile per i dettagli di contatto, le note interne o le informazioni generate dagli utenti. Non è un'istruzione universale per ogni sistema di intelligenza artificiale. (developers.google.com)
Utilizzare l'intestazione X-Robots-Tag per i file
I meta tag non possono essere inseriti all'interno di un file di documento portatile, immagine o file video. Utilizzare invece un'intestazione di risposta HTTP:
text X-Robots-Tag: noindex, nosnippet
Per una pagina che dovrebbe rimanere ricercabile ma non dovrebbe fornire testo per snippet o risposte di intelligenza artificiale, utilizzare:
text X-Robots-Tag: nosnippet
Google documenta X-Robots-Tag per risorse non HTML, e Apple lo supporta anche per Applebot. (developers.google.com)
Controlli specifici di Apple
Apple supporta:
html
Apple afferma che nosnippet impedisce che la pagina venga utilizzata come contesto aggiuntivo e contenuto attuale quando i modelli Apple generano output. La pagina potrebbe comunque rimanere rilevabile tramite Apple Search, Spotlight, Siri e Safari. (support.apple.com)
Per le pagine a pagamento (paywalled), Apple supporta anche dati strutturati utilizzando:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple afferma che tali pagine possono rimanere idonee per i risultati di ricerca ma non verranno utilizzate come contesto aggiuntivo per le risposte di intelligenza artificiale. (support.apple.com)
Come Verificare gli Indirizzi IP dei Crawler
Perché la corrispondenza dell'user-agent non è sufficiente
Una regola come questa è debole:
text if User-Agent contains "GPTBot": allow
Chiunque può inviare quel testo. Una regola migliore è:
text if User-Agent è un crawler conosciuto e l'indirizzo IP di origine è nell'intervallo ufficiale del provider: consenti o limita la frequenza else: sfida, limita la frequenza o blocca
Non fidarsi di un'intestazione X-Forwarded-For a meno che non provenga da un proxy o da una rete di distribuzione di contenuti controllata dalla propria organizzazione.
Metodi di verifica del provider
| Provider | Metodo di verifica consigliato |
|---|---|
| OpenAI | Utilizzare i feed di indirizzi IP in tempo reale pubblicati nella documentazione del crawler OpenAI per OAI-SearchBot, GPTBot e OAI-AdsBot. Aggiornarli automaticamente anziché copiare intervalli fissi in un firewall. |
| Utilizzare gli intervalli di crawler pubblicati da Google o eseguire controlli Reverse e Forward Domain Name System. Un vero crawler Google dovrebbe risolvere in un hostname Google approvato e risolvere di nuovo all'indirizzo originale. | |
| Anthropic | Utilizzare il feed di indirizzi del crawler pubblicato attualmente come controllo di rete secondario. Il metodo di opt-out primario di Anthropic rimane robots.txt. |
| Perplexity | Combinare l'user-agent con il feed di indirizzi corrente di PerplexityBot o Perplexity-User. Perplexity raccomanda specificamente di combinare entrambe le condizioni in una regola del Web Application Firewall. |
| Apple | Utilizzare la verifica del Reverse Domain Name System sotto applebot.apple.com, quindi eseguire una ricerca Forward. Apple pubblica anche gli intervalli di indirizzi attuali in un feed JSON. |
| Common Crawl | Utilizzare la verifica del Reverse Domain Name System sotto crawl.commoncrawl.org e il feed di indirizzi CCBot corrente. Common Crawl nota che la verifica inversa non è ancora disponibile per parte del traffico IPv6. |
| Microsoft | Utilizzare lo strumento ufficiale Verify Bingbot o i metodi di ricerca inversa e diretta documentati da Microsoft. |
| Amazon | Utilizzare gli elenchi di indirizzi dei crawler pubblicati da Amazon e farli corrispondere al user-agent Amazon appropriato. |
Google, Apple, Common Crawl, OpenAI, Anthropic e Perplexity pubblicano tutti metodi o feed di indirizzi specifici per i provider. Questi elenchi possono cambiare, quindi un processo di aggiornamento programmato è più sicuro di un elenco copiato manualmente e permanente. (developers.google.com)
Un semplice design di firewall potrebbe apparire così:
text consenti OAI-SearchBot solo quando l'indirizzo di origine è nell'intervallo di ricerca OpenAI corrente consenti GPTBot solo quando l'indirizzo di origine è nell'intervallo di addestramento OpenAI corrente consenti PerplexityBot solo quando l'indirizzo di origine è nell'intervallo PerplexityBot corrente consenti Applebot solo quando la verifica DNS inversa e diretta ha successo consenti CCBot solo quando la verifica DNS inversa e l'intervallo Common Crawl corrente corrispondono
limita la frequenza di tutti i crawler verificati blocca o sfida le richieste non verificate che affermano di essere crawler affidabili
Non applicare una regola di "consenti" ampia a un intero provider cloud. Un crawler legittimo può utilizzare l'infrastruttura cloud, ma la maggior parte del traffico da quel provider cloud non è necessariamente il crawler.
Come la Licenza Aperta Influisce sull'Inclusione
CC BY 4.0 in linguaggio semplice
La licenza Creative Commons Attribuzione 4.0 Internazionale, comunemente chiamata CC BY 4.0, consente alle persone di:
- Copiare e ridistribuire l'opera
- Adattare, tradurre, remixare e sviluppare su di essa
- Usarla commercialmente
Le condizioni principali sono:
- Dare credito appropriato
- Collegarsi alla licenza
- Indicare se sono state apportate modifiche
- Non suggerire che il creatore originale approvi il riutilizzo
- Non aggiungere restrizioni legali o tecniche che impediscano gli usi consentiti dalla licenza
Creative Commons avverte anche che la licenza potrebbe non coprire i diritti alla privacy, i diritti di pubblicità, i diritti morali, i diritti di marchio, i diritti di brevetto o il materiale di terze parti. (creativecommons.org)
Una licenza non è di per sé un invito per un crawler
Mettere "CC BY 4.0" su una pagina non garantisce che un'organizzazione la scansionerà. Un crawler può comunque essere bloccato da:
- robots.txt
- Una rete di distribuzione di contenuti
- Un Web Application Firewall
- Limitazione di frequenza
- Una sfida JavaScript
- Una barriera di accesso (login wall)
- Una scarsa risposta del server
- Una sitemap inaccessibile
Al contrario, consentire un crawler non concede automaticamente ogni permesso di copyright necessario per ogni uso successivo. Robots.txt e le licenze dovrebbero essere progettati insieme.
Perché CC BY può supportare un'inclusione più ampia
Una licenza permissiva chiara può rendere più facile la comprensione della politica di un editore per i team di dati, i sistemi di ricerca e gli operatori di assistenti. Può ridurre l'incertezza sulla copia, l'adattamento, l'uso commerciale, la traduzione e la ridistribuzione quando tali attività richiedono il permesso di copyright.
Tuttavia, Creative Commons spiega che l'addestramento dell'intelligenza artificiale è legalmente complesso. Una licenza restrittiva non è sempre un modo efficace per prevenire l'addestramento, perché alcuni usi per l'addestramento possono essere consentiti da eccezioni o limitazioni di copyright. Creative Commons nota anche che le condizioni di licenza possono essere difficili da applicare all'addestramento delle macchine e agli output dei modelli. (creativecommons.org)
La lezione pratica è:
Utilizzare CC BY quando si desidera sinceramente un ampio riutilizzo legale. Non utilizzare una licenza Creative Commons restrittiva come un garantito opt-out dall'addestramento dell'intelligenza artificiale.
L'attribuzione migliora la chiarezza della fonte
Creative Commons raccomanda il metodo TASL:
- Titolo
- Autore
- Fonte
- Licenza
Per esempio:
"Licenze e Robot per la Massima Inclusione," Example Publishing, https://www.example.org/articles/ai-crawlers, con licenza Creative Commons Attribuzione 4.0 Internazionale. Modifiche apportate: inventario dei crawler aggiornato.
Un'attribuzione chiara non costringe ogni assistente a citare una pagina. Rende più facile la citazione corretta quando un sistema estrae il titolo, l'autore, la fonte e le informazioni sulla licenza della pagina. (wiki.creativecommons.org)
Aggiungere informazioni strutturate sull'articolo
Utilizzare informazioni visibili e dati strutturati insieme:
html
Google raccomanda informazioni chiare sull'autore, pagine dell'autore, date di pubblicazione, date di modifica e pagine canoniche stabili. Questi segnali possono aiutare i sistemi di ricerca a capire chi ha creato il materiale e quale versione è autorevole. Non garantiscono un ranking, un'inclusione o una citazione. (developers.google.com)
Clausole Legali Standard per un Sito Aperto e Favorevole alle Citazioni
Quanto segue è un linguaggio di esempio, non consulenza legale. Chiedere al proprio consulente di adattarlo alla propria giurisdizione, struttura di proprietà, obblighi di privacy e contenuti di terze parti.
Dichiarazione di licenza CC BY 4.0
text
Licenza del contenuto
Salvo dove diversamente indicato, il testo originale e i materiali editoriali originali di questa pagina sono concessi in licenza Creative Commons Attribuzione 4.0 Internazionale:
https://creativecommons.org/licenses/by/4.0/
Questo permesso consente la copia, la ridistribuzione, l'adattamento, la traduzione, l'uso commerciale, l'elaborazione leggibile da macchine, l'indicizzazione per la ricerca, il recupero, la riassunzione e l'uso in sistemi di intelligenza artificiale, a condizione che i termini della licenza siano rispettati.
Attribuzione preferita:
"[Titolo della pagina]," di [autore o organizzazione], [indirizzo pagina canonico], pubblicato o aggiornato il [data], con licenza Creative Commons Attribuzione 4.0 Internazionale. Modifiche apportate: [descrivere le modifiche, o indicare 'nessuna'].
Si prega di preservare le informazioni sull'autore, l'editore, la fonte, la licenza e la modifica, quando ragionevolmente possibile. Questa guida all'attribuzione preferita non aggiunge restrizioni alla licenza Creative Commons e non sostituisce il testo della licenza.
La frase "inclusi i sistemi di intelligenza artificiale" chiarisce l'intento dell'editore. Non dovrebbe essere usata per fingere che l'editore possieda i diritti su materiale creato da qualcun altro.
Avviso sui diritti di marchio, privacy e terze parti
text
Diritti di marchio, privacy e terze parti
La licenza di cui sopra copre solo i materiali originali identificati come licenziati. Non concede il permesso di utilizzare:
- Marchi commerciali, marchi di servizio, loghi o "trade dress"
- Nomi, immagini o sembianze di persone
- Informazioni private, riservate, di account, sanitarie, finanziarie o di sicurezza
- Contributi degli utenti a meno che non siano separatamente identificati come licenziati
- Fotografie, illustrazioni, mappe, video, musica, citazioni o altri materiali di terze parti
- Contenuti identificati come "tutti i diritti riservati" o soggetti a una licenza separata
L'uso del nome, dei loghi e dei marchi di Example Publishing non deve suggerire sponsorizzazione, approvazione, partnership o endorsement. Si prega di collegarsi alla pagina originale e distinguere chiaramente citazioni, parafrasi, riassunti e materiale generato.
Questo linguaggio è importante perché le licenze Creative Commons non concedono automaticamente ogni tipo di diritto legale collegato a una pagina. (creativecommons.org)
Guida alla citazione per ricerca e assistenti
text
Guida alla citazione per ricerca e assistenti
Accogliamo con favore l'indicizzazione di ricerca conforme, il recupero richiesto dall'utente, la citazione e la riassunzione del materiale concesso in licenza su questo sito.
Quando si cita questo sito, si prega di utilizzare il titolo della pagina, l'autore o l'editore, l'indirizzo canonico della pagina, la data di pubblicazione o aggiornamento e un collegamento diretto alla fonte. Si prega di identificare la fonte come un input tra le fonti utilizzate, distinguere l'analisi generata dal materiale citato e non dichiarare o implicare che Example Publishing approvi una risposta generata, un prodotto, una persona o un servizio.
Questa guida ha lo scopo di migliorare l'accuratezza e l'attribuzione. Non concede diritti oltre la licenza di contenuto applicabile e non concede in licenza marchi, informazioni personali, informazioni riservate o materiale di terze parti.
Se si desidera visibilità di ricerca ma non si vuole concedere una licenza di addestramento ampia
text
Accesso alla ricerca e copyright
Le nostre pagine pubbliche possono essere accedute da crawler di ricerca e recupero conformi identificati nel nostro file robots.txt. Questo permesso è inteso a supportare la scoperta, i risultati di ricerca, il recupero richiesto dall'utente e la citazione.
Salvo dove è mostrata una licenza separata, il contenuto originale rimane con tutti i diritti riservati. L'accesso a una pagina pubblica non concede una licenza separata per lo sviluppo del modello, l'addestramento, la ridistribuzione, il riutilizzo commerciale o la creazione di opere derivate oltre i diritti previsti dalla legge applicabile.
Si prega di citare l'indirizzo canonico della pagina e l'editore quando si fa riferimento a questo materiale. Nulla su questo sito concede il permesso di utilizzare marchi, loghi, informazioni personali, informazioni riservate o contenuti di terze parti.
Non posizionare la dichiarazione CC BY e la dichiarazione "tutti i diritti riservati" sullo stesso materiale. Identificare chiaramente quale licenza si applica a quale contenuto.
Matrice Rischio-Beneficio per la Licenza Aperta
Le leggi sul copyright e le regole sull'addestramento dell'intelligenza artificiale differiscono per paese e rimangono instabili. L'Ufficio del Copyright degli Stati Uniti continua ad esaminare queste questioni, mentre Creative Commons descrive l'addestramento dell'intelligenza artificiale come specifico per i fatti e legalmente complesso. (copyright.gov)
| Approccio | Potenziale di inclusione | Principali vantaggi | Principali rischi | Migliore adattamento |
|---|---|---|---|---|
| CC BY 4.0 | Molto alto | Ampia copia, adattamento, uso commerciale, traduzione, indicizzazione e riutilizzo correlato al modello quando è necessario il permesso di copyright | I concorrenti commerciali possono riutilizzare o adattare il contenuto; l'attribuzione potrebbe essere imperfetta; la licenza non può controllare la privacy, i marchi o i diritti di terzi | Editori che desiderano il più ampio riutilizzo legale e una forte attribuzione della fonte |
| CC BY-SA 4.0 | Alto, ma più complesso | Incoraggia un ciclo di condivisione aperta e richiede che gli adattamenti rimangano sotto termini compatibili | Le regole ShareAlike possono essere difficili da applicare a dataset, addestramento di modelli e output pubblici; alcune organizzazioni potrebbero evitare il materiale a causa dell'incertezza | Progetti educativi e di interesse pubblico aperti che desiderano che gli adattamenti a valle rimangano aperti |
| CC BY-NC 4.0 | Medio o basso | Limita gli usi principalmente intesi per vantaggio commerciale o compensazione monetaria | "Non commerciale" può essere difficile da interpretare; può escludere usi commerciali di ricerca, modelli e assistenti; non è un opt-out garantito dall'addestramento | Materiale destinato a uso senza scopo di lucro, educativo o comunitario |
| CC BY-ND 4.0 | Medio | Consente la condivisione limitando gli adattamenti | La traduzione, la trasformazione e alcuni casi d'uso degli assistenti potrebbero diventare legalmente incerti; meno attraente per i sistemi che riassumono o remixano | Avvisi ufficiali o opere che devono rimanere invariate |
| CC0 o Dedica al Pubblico Dominio | Molto alto | Semplifica il riutilizzo e rimuove la maggior parte delle condizioni di copyright dove legalmente efficace | Nessuna attribuzione richiesta; scarso controllo sulla presentazione del marchio; i diritti alla privacy, al marchio e alla pubblicità rimangono separati | Fatti, dataset, materiale di riferimento o opere destinate al riutilizzo illimitato |
| Tutti i diritti riservati più scansione di ricerca aperta | Alto per la ricerca, inferiore per l'addestramento | Può preservare la visibilità di ricerca e citazione senza concedere una licenza di riutilizzo ampia | Maggiore incertezza legale per gli sviluppatori di modelli; può ridurre l'inclusione in dataset di addestramento e sistemi di riutilizzo commerciale | Editori che desiderano scoperta e citazioni ma preferiscono negoziare licenze più ampie separatamente |
La strategia più equilibrata per molte organizzazioni è:
- CC BY 4.0 per il testo editoriale pubblico originale
- Etichette separate per il materiale di terze parti
- Nessuna informazione personale o riservata pubblica
- Consentire i crawler di ricerca e recupero
- Consentire i crawler per lo sviluppo di modelli solo se l'organizzazione accetta veramente tale uso
- Utilizzare attribuzioni chiare e link canonici
- Proteggere i marchi tramite un avviso di marchio separato
Una Lista di Controllo Pratica per l'Implementazione
Contenuto e licenze
- Identificare chi possiede ogni pagina, immagine, grafico, video e citazione.
- Concedere in licenza solo il materiale per il quale la propria organizzazione controlla i diritti.
- Contrassegnare separatamente il materiale di terze parti.
- Aggiungere una dichiarazione di licenza visibile.
- Fornire una citazione preferita utilizzando titolo, autore, fonte e licenza.
- Mantenere loghi, marchi, dati personali e informazioni riservate al di fuori dell'ambito della licenza.
Robots.txt
- Creare un file robots.txt pubblico alla radice di ogni host.
- Consentire i crawler di ricerca separatamente dai crawler di addestramento.
- Bloccare i percorsi amministrativi, di account, di checkout, privati e delle applicazioni interne.
- Non affidarsi a robots.txt per la sicurezza.
- Testare il file dopo ogni importante implementazione del sito web.
Meta tag
- Utilizzare link canonici.
- Aggiungere autore, data di pubblicazione e data di modifica.
- Utilizzare
noindexper le pagine che non dovrebbero apparire nella ricerca. - Utilizzare
nosnippetodata-nosnippetper estratti sensibili dove supportato. - Utilizzare
X-Robots-Tagper file di documenti portatili, immagini e altre risorse non HTML. - Ricordare che un crawler deve essere in grado di recuperare una pagina prima di poter leggere i suoi meta tag.
Sicurezza della rete
- Registrare stringhe user-agent, indirizzi di origine, codici di risposta e percorsi di richiesta.
- Verificare i crawler affidabili utilizzando feed di indirizzi ufficiali o metodi Domain Name System.
- Aggiornare automaticamente i feed di indirizzi.
- Combinare controlli user-agent e indirizzo di origine.
- Limitare la frequenza dei crawler verificati anziché concedere loro accesso illimitato.
- Sfidare o bloccare le richieste che affermano di essere crawler affidabili ma falliscono la verifica.
Misurazione
Tracciare:
- Visite dai servizi di ricerca di intelligenza artificiale
- Riferimenti alla pagina originale
- Frequenza delle citazioni
- Carico del server per crawler
- Richieste che restituiscono
403,404o429 - Accesso dei crawler a percorsi non intenzionali
- Se gli articoli attuali vengono trovati dopo la pubblicazione
Conclusione
La massima inclusione richiede apertura selettiva, non un singolo permesso generico.
Utilizzare robots.txt per separare la scansione per la ricerca, il recupero da parte dell'utente, l'addestramento e i dataset pubblici. Utilizzare meta tag e intestazioni HTTP per gestire l'indicizzazione e gli snippet. Utilizzare l'autenticazione per tutto ciò che è privato. Verificare gli indirizzi IP dei crawler anziché fidarsi solo dei nomi user-agent.
Una licenza permissiva come CC BY 4.0 può facilitare un ampio riutilizzo quando lo si desidera sinceramente. Informazioni chiare sull'attribuzione — titolo, autore, fonte, licenza, pagina canonica e data di aggiornamento — possono anche rendere più facile per i sistemi di ricerca e gli assistenti identificare e citare la fonte corretta.
La politica di pubblicazione più forte è quindi:
**Aprire il contenuto pubblico che si desidera far scoprire, licenziare chiaramente il materiale che si desidera riutilizzare, contrassegnare il materiale che non si possiede, proteggere le informazioni private a livello di server e concedere a ogni crawler un permesso separato e verificabile.
Auto