AutoPodAutoPod

Licenze e Robot per la Massima Inclusione: Come Accogliere i Crawler di Intelligenza Artificiale

26 min di lettura
Articolo audio
Licenze e Robot per la Massima Inclusione: Come Accogliere i Crawler di Intelligenza Artificiale
0:000:00
Licenze e Robot per la Massima Inclusione: Come Accogliere i Crawler di Intelligenza Artificiale

Licenze e Robot per la Massima Inclusione: Come Accogliere i Crawler di Intelligenza Artificiale

Aggiornato il 25 agosto 2026

I siti web ora hanno più di un modo per raggiungere un pubblico. Una pagina può essere trovata tramite Google Search, riassunta da ChatGPT, citata da Perplexity, utilizzata nella ricerca di Claude, visualizzata tramite i servizi Apple o raccolta da un archivio web pubblico.

Questi sistemi non utilizzano tutti lo stesso crawler o seguono le stesse regole. Un sito web che blocca GPTBot potrebbe comunque apparire nella ricerca di ChatGPT se consente OAI-SearchBot. Un sito web che consente Applebot può rimanere visibile in Apple Search bloccando Applebot-Extended dall'addestramento del modello di intelligenza artificiale. Google-Extended di Google non è affatto un crawler normale; è un token di controllo robots.txt.

La politica migliore non è quindi semplicemente "consentire l'intelligenza artificiale" o "bloccare l'intelligenza artificiale". Si tratta di creare permessi separati per:

  1. Ricerca e scoperta
  2. Recupero richiesto dall'utente
  3. Sviluppo e addestramento del modello
  4. Dataset pubblici
  5. Materiale sensibile, privato o riservato

Questo articolo fornisce un inventario aggiornato dei crawler, esempi di robots.txt, linee guida per i meta tag, metodi di verifica degli indirizzi IP, consigli sulle licenze Creative Commons, clausole legali standard e una matrice rischio-beneficio.

I Quattro Controlli che Ogni Editore Dovrebbe Comprendere

1. robots.txt controlla la scansione richiesta

Un file robots.txt indica ai client automatizzati conformi quali pagine possono richiedere. È utile per gestire il traffico dei crawler ed esprimere le preferenze di un editore.

Tuttavia, robots.txt non è un sistema di controllo degli accessi. Il Robots Exclusion Protocol afferma che le sue regole non sono autorizzazioni di accesso. Google avverte anche che un indirizzo bloccato può comunque apparire nei risultati di ricerca se altre pagine si collegano ad esso. Utilizzare password, autenticazione o controlli di accesso lato server per informazioni riservate. (rfc-editor.org)

2. I meta tag controllano l'indicizzazione e gli snippet

I meta tag robots e l'intestazione di risposta X-Robots-Tag possono controllare se una pagina viene indicizzata o se un motore di ricerca può mostrare uno snippet.

Questi controlli sono normalmente visibili solo dopo che a un crawler è stato consentito di recuperare la pagina. Se robots.txt blocca prima la pagina, il crawler potrebbe non vedere mai il meta tag. (developers.google.com)

3. I controlli di rete verificano il crawler

Un nome user-agent è facile da copiare. Un attaccante può inviare una richiesta affermando di essere GPTBot, Googlebot o PerplexityBot.

Un approccio più solido combina:

  • Il user-agent dichiarato
  • Un intervallo di indirizzi IP pubblicato
  • Verifica del Reverse Domain Name System
  • Verifica del Forward Domain Name System
  • Limiti di frequenza e monitoraggio delle richieste

4. Una licenza concede i diritti di riutilizzo

Robots.txt dice cosa è chiesto a un crawler di fare. Una licenza dice cosa persone o organizzazioni possono fare legalmente con il materiale quando è richiesta l'autorizzazione di copyright.

Sono strumenti diversi. Una licenza permissiva può ridurre l'incertezza legale, ma non garantisce che un crawler visiterà la pagina, che un modello la utilizzerà o che un assistente la citerà.

Inventario dei Crawler Importanti

Il seguente inventario è stato verificato rispetto alla documentazione del provider disponibile il 25 agosto 2026. Nomi user-agent, scopi e intervalli di indirizzi IP possono cambiare, quindi i sistemi di produzione dovrebbero utilizzare la documentazione attuale del provider e i feed di indirizzi in tempo reale.

ProviderCrawler o token robots.txtScopo principaleControllo importante
OpenAIOAI-SearchBotTrova e analizza pagine per la ricerca di ChatGPTConsentire per migliorare la possibilità che le pagine appaiano nei risultati di ricerca di ChatGPT.
OpenAIGPTBotRaccoglie pagine che possono essere utilizzate per l'addestramento dei modelli generativi di intelligenza artificiale di OpenAIConsentire o negare separatamente dalla ricerca.
OpenAIChatGPT-UserRecupera pagine dopo che un utente chiede a ChatGPT o a un GPT personalizzato di accederviÈ attivato dall'utente anziché essere un crawler web automatico, quindi le regole di robots.txt potrebbero non applicarsi.
OpenAIOAI-AdsBotControlla le pagine web inviate come destinazioni pubblicitarie di ChatGPTRilevante principalmente per gli inserzionisti. Il contenuto raccolto non viene utilizzato per addestrare modelli fondamentali di intelligenza artificiale generativa.
GoogleGooglebotCrawler principale di Google SearchControlla la normale scansione di Google Search.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-NewsImmagini, video e Google NewsQuesti hanno token robots.txt separati e possono essere controllati indipendentemente.
GoogleGoogleOtherScansione generica di Google per vari team di prodotto, inclusa ricerca e sviluppoNon rappresenta un prodotto Google specifico.
GoogleGoogle-ExtendedControlla se il contenuto scansionato da Google può essere utilizzato per l'addestramento del modello Gemini e per alcuni sistemi di "grounding"È un token di controllo robots.txt, non un user-agent di richiesta separato. Non influisce sull'inclusione ordinaria in Google Search.
AnthropicClaudeBotRaccoglie contenuti web pubblici che possono contribuire allo sviluppo del modello ClaudeNegare per segnalare che il materiale futuro dovrebbe essere escluso dai dataset di addestramento di Anthropic.
AnthropicClaude-SearchBotMigliora la qualità dei risultati di ricerca di ClaudeConsentire per la visibilità nella ricerca di Claude.
AnthropicClaude-UserRecupera pagine in risposta a una richiesta dell'utente a ClaudeSeparato dalla scansione automatica.
PerplexityPerplexityBotIndicizza le pagine per i risultati di ricerca di PerplexityPerplexity afferma che questo crawler non viene utilizzato per raccogliere contenuti per l'addestramento di modelli fondamentali di intelligenza artificiale.
PerplexityPerplexity-UserRecupera una pagina dopo che un utente l'ha richiestaLa documentazione di Perplexity afferma che questo recuperatore generalmente ignora robots.txt perché la richiesta è stata avviata da un utente.
AppleApplebotSupporta Apple Search, Spotlight, Siri, Safari e altre esperienze AppleConsentire per la scoperta tramite Apple.
AppleApplebot-ExtendedControlla se il contenuto scansionato da Applebot può essere utilizzato per addestrare i modelli fondamentali di AppleNon scansiona le pagine da solo. È un controllo sull'uso dei dati.
Common CrawlCCBotRaccoglie dati web pubblici per l'archivio web aperto di Common CrawlNon è un assistente, ma i suoi dataset possono essere utilizzati da ricercatori e sviluppatori di intelligenza artificiale.
MicrosoftBingbotCrawler principale di Bing SearchConsentire per la scoperta e la visibilità nella ricerca di Bing.
MicrosoftMicrosoftPreview, BingVideoPreviewAnteprime di pagine e video per i prodotti MicrosoftQuesti possono essere controllati separatamente da Bingbot.
AmazonAmzn-SearchBotRicerca Amazon e scoperta di contenutiAmazon afferma di non scansionare contenuti per l'addestramento di modelli generativi di intelligenza artificiale.
AmazonAmzn-UserRecupera informazioni attuali in risposta alle azioni dell'utente, incluse le richieste AlexaAttivato dall'utente e separato dalla scansione automatica di ricerca.

OpenAI documenta i suoi crawler di ricerca, addestramento, pubblicità e attivati dall'utente come controlli separati. La sua documentazione raccomanda specificamente di consentire OAI-SearchBot per la ricerca di ChatGPT utilizzando GPTBot separatamente per le preferenze di addestramento. (developers.openai.com)

Google separa in modo simile Googlebot, GoogleOther e Google-Extended. Google-Extended non ha un proprio user-agent di richiesta HTTP, e bloccarlo non rimuove una pagina da Google Search. (developers.google.com)

Anthropic documenta ruoli separati per ClaudeBot, Claude-SearchBot e Claude-User. Anthropic afferma anche che i suoi bot seguono robots.txt e supportano la direttiva non standard Crawl-delay. (support.anthropic.com)

Perplexity distingue tra la scansione automatica di ricerca e il recupero richiesto dall'utente. La sua documentazione attuale afferma che PerplexityBot rispetta robots.txt, mentre Perplexity-User generalmente non lo fa perché risponde a una richiesta dell'utente. (docs.perplexity.ai)

La documentazione attuale di Apple fa la stessa distinzione tra ricerca e addestramento: Applebot supporta la scoperta, mentre Applebot-Extended consente agli editori di controllare l'uso per l'addestramento senza rimuovere le pagine da Apple Search. (support.apple.com)

Configurazioni robots.txt Consigliate

Posizionare robots.txt alla radice di ogni host, come ad esempio:

text https://www.example.org/robots.txt

Le regole si applicano all'host, al protocollo e alla porta specifici in cui viene servito il file. Un sottodominio separato potrebbe aver bisogno del proprio file. (developers.google.com)

Configurazione 1: Massima inclusione

Utilizzare questa configurazione quando i contenuti editoriali pubblici possono essere trovati, riassunti, citati, indicizzati e raccolti da crawler conformi.

text

Le pagine pubbliche sono disponibili per i crawler conformi.

User-agent: * Allow: /

Escludere i percorsi privati, transazionali e amministrativi.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Questo consente i crawler nominati, inclusi OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft e Amazon, a meno che un'altra regola specifica non li blocchi.

Non inserire una regola generica come User-agent: * Disallow: / sotto questa configurazione. Un gruppo successivo o più specifico potrebbe modificare il modo in cui un crawler interpreta il file.

Configurazione 2: Consentire la ricerca ma bloccare i crawler di sviluppo del modello

Questo è spesso il miglior compromesso per gli editori che desiderano citazioni e traffico di ricerca ma non vogliono segnalare il permesso per la raccolta per lo sviluppo di modelli.

text

Blocca la scansione per lo sviluppo di modelli OpenAI.

User-agent: GPTBot Disallow: /

Blocca la scansione per lo sviluppo di modelli Anthropic.

User-agent: ClaudeBot Disallow: /

Blocca l'addestramento dei modelli Google e l'uso correlato per il "grounding".

User-agent: Google-Extended Disallow: /

Blocca l'uso per l'addestramento dei modelli fondamentali Apple.

User-agent: Applebot-Extended Disallow: /

Opzionale: blocca la raccolta di dataset di Common Crawl.

User-agent: CCBot

Disallow: /

Consenti la normale scansione per la ricerca e il recupero, eccetto per i percorsi sensibili.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Questa configurazione lascia OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot e Applebot coperti dal gruppo wildcard. Mantiene anche i permessi di ricerca e di addestramento separati.

Per Apple, bloccare Applebot-Extended pur consentendo Applebot preserva la scoperta tramite i servizi Apple. Per Google, bloccare Google-Extended non blocca la normale ricerca Google. (developers.google.com)

Configurazione 3: Consentire esplicitamente i crawler di ricerca selezionati

Se un file robots.txt esistente blocca tutti i crawler, aggiungere gruppi separati per i crawler di ricerca che si desidera accogliere.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Mantenere tutti gli altri crawler fuori.

User-agent: * Disallow: /

Quando si utilizzano gruppi specifici, ripetere le regole dei percorsi sensibili all'interno di ciascun gruppo. Alcuni crawler utilizzano il gruppo di corrispondenza più specifico anziché combinarlo con il gruppo wildcard. Bing documenta direttamente questo comportamento e Google fornisce linee guida separate sui gruppi specifici per i crawler. (bing.com)

Importanti limitazioni di robots.txt

  • Un crawler può ignorare robots.txt.
  • Un crawler malevolo può fingere di essere un crawler affidabile.
  • Una pagina bloccata può ancora essere conosciuta per il suo titolo o indirizzo web.
  • Robots.txt non protegge password, file privati, registri clienti o interfacce di programmazione di applicazioni riservate.
  • Una direttiva Crawl-delay non fa parte del Robots Exclusion Protocol di base e non è supportata da tutti i crawler. Anthropic e Bing documentano il supporto, mentre Apple afferma che Applebot non segue crawl-delay. (rfc-editor.org)

Meta Tag e Intestazioni HTTP

Esempio di pagina pubblica

Per un articolo pubblico, utilizzare un titolo chiaro, autore, indirizzo web canonico, data di pubblicazione e data di modifica.

html

La direttiva max-snippet è principalmente documentata per Google. Non dare per scontato che ogni crawler di intelligenza artificiale supporti ogni direttiva meta.

Esempio di pagina privata o sensibile

html

Utilizzare questo per le pagine che non dovrebbero apparire nei risultati di ricerca. La pagina deve rimanere scansionabile abbastanza a lungo affinché il crawler possa vedere la direttiva. Se la pagina deve rimanere veramente privata, utilizzare l'autenticazione o la protezione con password invece. (developers.google.com)

Nascondere solo sezioni sensibili dagli snippet di ricerca

Google supporta data-nosnippet per parti specifiche di una pagina HTML:

html

Questo paragrafo può essere mostrato in un risultato di ricerca.

Qui vanno numeri di telefono personali, indirizzi email privati o note interne.

Questo è utile per i dettagli di contatto, le note interne o le informazioni generate dagli utenti. Non è un'istruzione universale per ogni sistema di intelligenza artificiale. (developers.google.com)

Utilizzare l'intestazione X-Robots-Tag per i file

I meta tag non possono essere inseriti all'interno di un file di documento portatile, immagine o file video. Utilizzare invece un'intestazione di risposta HTTP:

text X-Robots-Tag: noindex, nosnippet

Per una pagina che dovrebbe rimanere ricercabile ma non dovrebbe fornire testo per snippet o risposte di intelligenza artificiale, utilizzare:

text X-Robots-Tag: nosnippet

Google documenta X-Robots-Tag per risorse non HTML, e Apple lo supporta anche per Applebot. (developers.google.com)

Controlli specifici di Apple

Apple supporta:

html

Apple afferma che nosnippet impedisce che la pagina venga utilizzata come contesto aggiuntivo e contenuto attuale quando i modelli Apple generano output. La pagina potrebbe comunque rimanere rilevabile tramite Apple Search, Spotlight, Siri e Safari. (support.apple.com)

Per le pagine a pagamento (paywalled), Apple supporta anche dati strutturati utilizzando:

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Apple afferma che tali pagine possono rimanere idonee per i risultati di ricerca ma non verranno utilizzate come contesto aggiuntivo per le risposte di intelligenza artificiale. (support.apple.com)

Come Verificare gli Indirizzi IP dei Crawler

Perché la corrispondenza dell'user-agent non è sufficiente

Una regola come questa è debole:

text if User-Agent contains "GPTBot": allow

Chiunque può inviare quel testo. Una regola migliore è:

text if User-Agent è un crawler conosciuto e l'indirizzo IP di origine è nell'intervallo ufficiale del provider: consenti o limita la frequenza else: sfida, limita la frequenza o blocca

Non fidarsi di un'intestazione X-Forwarded-For a meno che non provenga da un proxy o da una rete di distribuzione di contenuti controllata dalla propria organizzazione.

Metodi di verifica del provider

ProviderMetodo di verifica consigliato
OpenAIUtilizzare i feed di indirizzi IP in tempo reale pubblicati nella documentazione del crawler OpenAI per OAI-SearchBot, GPTBot e OAI-AdsBot. Aggiornarli automaticamente anziché copiare intervalli fissi in un firewall.
GoogleUtilizzare gli intervalli di crawler pubblicati da Google o eseguire controlli Reverse e Forward Domain Name System. Un vero crawler Google dovrebbe risolvere in un hostname Google approvato e risolvere di nuovo all'indirizzo originale.
AnthropicUtilizzare il feed di indirizzi del crawler pubblicato attualmente come controllo di rete secondario. Il metodo di opt-out primario di Anthropic rimane robots.txt.
PerplexityCombinare l'user-agent con il feed di indirizzi corrente di PerplexityBot o Perplexity-User. Perplexity raccomanda specificamente di combinare entrambe le condizioni in una regola del Web Application Firewall.
AppleUtilizzare la verifica del Reverse Domain Name System sotto applebot.apple.com, quindi eseguire una ricerca Forward. Apple pubblica anche gli intervalli di indirizzi attuali in un feed JSON.
Common CrawlUtilizzare la verifica del Reverse Domain Name System sotto crawl.commoncrawl.org e il feed di indirizzi CCBot corrente. Common Crawl nota che la verifica inversa non è ancora disponibile per parte del traffico IPv6.
MicrosoftUtilizzare lo strumento ufficiale Verify Bingbot o i metodi di ricerca inversa e diretta documentati da Microsoft.
AmazonUtilizzare gli elenchi di indirizzi dei crawler pubblicati da Amazon e farli corrispondere al user-agent Amazon appropriato.

Google, Apple, Common Crawl, OpenAI, Anthropic e Perplexity pubblicano tutti metodi o feed di indirizzi specifici per i provider. Questi elenchi possono cambiare, quindi un processo di aggiornamento programmato è più sicuro di un elenco copiato manualmente e permanente. (developers.google.com)

Un semplice design di firewall potrebbe apparire così:

text consenti OAI-SearchBot solo quando l'indirizzo di origine è nell'intervallo di ricerca OpenAI corrente consenti GPTBot solo quando l'indirizzo di origine è nell'intervallo di addestramento OpenAI corrente consenti PerplexityBot solo quando l'indirizzo di origine è nell'intervallo PerplexityBot corrente consenti Applebot solo quando la verifica DNS inversa e diretta ha successo consenti CCBot solo quando la verifica DNS inversa e l'intervallo Common Crawl corrente corrispondono

limita la frequenza di tutti i crawler verificati blocca o sfida le richieste non verificate che affermano di essere crawler affidabili

Non applicare una regola di "consenti" ampia a un intero provider cloud. Un crawler legittimo può utilizzare l'infrastruttura cloud, ma la maggior parte del traffico da quel provider cloud non è necessariamente il crawler.

Come la Licenza Aperta Influisce sull'Inclusione

CC BY 4.0 in linguaggio semplice

La licenza Creative Commons Attribuzione 4.0 Internazionale, comunemente chiamata CC BY 4.0, consente alle persone di:

  • Copiare e ridistribuire l'opera
  • Adattare, tradurre, remixare e sviluppare su di essa
  • Usarla commercialmente

Le condizioni principali sono:

  • Dare credito appropriato
  • Collegarsi alla licenza
  • Indicare se sono state apportate modifiche
  • Non suggerire che il creatore originale approvi il riutilizzo
  • Non aggiungere restrizioni legali o tecniche che impediscano gli usi consentiti dalla licenza

Creative Commons avverte anche che la licenza potrebbe non coprire i diritti alla privacy, i diritti di pubblicità, i diritti morali, i diritti di marchio, i diritti di brevetto o il materiale di terze parti. (creativecommons.org)

Una licenza non è di per sé un invito per un crawler

Mettere "CC BY 4.0" su una pagina non garantisce che un'organizzazione la scansionerà. Un crawler può comunque essere bloccato da:

  • robots.txt
  • Una rete di distribuzione di contenuti
  • Un Web Application Firewall
  • Limitazione di frequenza
  • Una sfida JavaScript
  • Una barriera di accesso (login wall)
  • Una scarsa risposta del server
  • Una sitemap inaccessibile

Al contrario, consentire un crawler non concede automaticamente ogni permesso di copyright necessario per ogni uso successivo. Robots.txt e le licenze dovrebbero essere progettati insieme.

Perché CC BY può supportare un'inclusione più ampia

Una licenza permissiva chiara può rendere più facile la comprensione della politica di un editore per i team di dati, i sistemi di ricerca e gli operatori di assistenti. Può ridurre l'incertezza sulla copia, l'adattamento, l'uso commerciale, la traduzione e la ridistribuzione quando tali attività richiedono il permesso di copyright.

Tuttavia, Creative Commons spiega che l'addestramento dell'intelligenza artificiale è legalmente complesso. Una licenza restrittiva non è sempre un modo efficace per prevenire l'addestramento, perché alcuni usi per l'addestramento possono essere consentiti da eccezioni o limitazioni di copyright. Creative Commons nota anche che le condizioni di licenza possono essere difficili da applicare all'addestramento delle macchine e agli output dei modelli. (creativecommons.org)

La lezione pratica è:

Utilizzare CC BY quando si desidera sinceramente un ampio riutilizzo legale. Non utilizzare una licenza Creative Commons restrittiva come un garantito opt-out dall'addestramento dell'intelligenza artificiale.

L'attribuzione migliora la chiarezza della fonte

Creative Commons raccomanda il metodo TASL:

  • Titolo
  • Autore
  • Fonte
  • Licenza

Per esempio:

"Licenze e Robot per la Massima Inclusione," Example Publishing, https://www.example.org/articles/ai-crawlers, con licenza Creative Commons Attribuzione 4.0 Internazionale. Modifiche apportate: inventario dei crawler aggiornato.

Un'attribuzione chiara non costringe ogni assistente a citare una pagina. Rende più facile la citazione corretta quando un sistema estrae il titolo, l'autore, la fonte e le informazioni sulla licenza della pagina. (wiki.creativecommons.org)

Aggiungere informazioni strutturate sull'articolo

Utilizzare informazioni visibili e dati strutturati insieme:

html

Google raccomanda informazioni chiare sull'autore, pagine dell'autore, date di pubblicazione, date di modifica e pagine canoniche stabili. Questi segnali possono aiutare i sistemi di ricerca a capire chi ha creato il materiale e quale versione è autorevole. Non garantiscono un ranking, un'inclusione o una citazione. (developers.google.com)

Clausole Legali Standard per un Sito Aperto e Favorevole alle Citazioni

Quanto segue è un linguaggio di esempio, non consulenza legale. Chiedere al proprio consulente di adattarlo alla propria giurisdizione, struttura di proprietà, obblighi di privacy e contenuti di terze parti.

Dichiarazione di licenza CC BY 4.0

text

Licenza del contenuto

Salvo dove diversamente indicato, il testo originale e i materiali editoriali originali di questa pagina sono concessi in licenza Creative Commons Attribuzione 4.0 Internazionale:

https://creativecommons.org/licenses/by/4.0/

Questo permesso consente la copia, la ridistribuzione, l'adattamento, la traduzione, l'uso commerciale, l'elaborazione leggibile da macchine, l'indicizzazione per la ricerca, il recupero, la riassunzione e l'uso in sistemi di intelligenza artificiale, a condizione che i termini della licenza siano rispettati.

Attribuzione preferita:

"[Titolo della pagina]," di [autore o organizzazione], [indirizzo pagina canonico], pubblicato o aggiornato il [data], con licenza Creative Commons Attribuzione 4.0 Internazionale. Modifiche apportate: [descrivere le modifiche, o indicare 'nessuna'].

Si prega di preservare le informazioni sull'autore, l'editore, la fonte, la licenza e la modifica, quando ragionevolmente possibile. Questa guida all'attribuzione preferita non aggiunge restrizioni alla licenza Creative Commons e non sostituisce il testo della licenza.

La frase "inclusi i sistemi di intelligenza artificiale" chiarisce l'intento dell'editore. Non dovrebbe essere usata per fingere che l'editore possieda i diritti su materiale creato da qualcun altro.

Avviso sui diritti di marchio, privacy e terze parti

text

Diritti di marchio, privacy e terze parti

La licenza di cui sopra copre solo i materiali originali identificati come licenziati. Non concede il permesso di utilizzare:

  • Marchi commerciali, marchi di servizio, loghi o "trade dress"
  • Nomi, immagini o sembianze di persone
  • Informazioni private, riservate, di account, sanitarie, finanziarie o di sicurezza
  • Contributi degli utenti a meno che non siano separatamente identificati come licenziati
  • Fotografie, illustrazioni, mappe, video, musica, citazioni o altri materiali di terze parti
  • Contenuti identificati come "tutti i diritti riservati" o soggetti a una licenza separata

L'uso del nome, dei loghi e dei marchi di Example Publishing non deve suggerire sponsorizzazione, approvazione, partnership o endorsement. Si prega di collegarsi alla pagina originale e distinguere chiaramente citazioni, parafrasi, riassunti e materiale generato.

Questo linguaggio è importante perché le licenze Creative Commons non concedono automaticamente ogni tipo di diritto legale collegato a una pagina. (creativecommons.org)

Guida alla citazione per ricerca e assistenti

text

Guida alla citazione per ricerca e assistenti

Accogliamo con favore l'indicizzazione di ricerca conforme, il recupero richiesto dall'utente, la citazione e la riassunzione del materiale concesso in licenza su questo sito.

Quando si cita questo sito, si prega di utilizzare il titolo della pagina, l'autore o l'editore, l'indirizzo canonico della pagina, la data di pubblicazione o aggiornamento e un collegamento diretto alla fonte. Si prega di identificare la fonte come un input tra le fonti utilizzate, distinguere l'analisi generata dal materiale citato e non dichiarare o implicare che Example Publishing approvi una risposta generata, un prodotto, una persona o un servizio.

Questa guida ha lo scopo di migliorare l'accuratezza e l'attribuzione. Non concede diritti oltre la licenza di contenuto applicabile e non concede in licenza marchi, informazioni personali, informazioni riservate o materiale di terze parti.

Se si desidera visibilità di ricerca ma non si vuole concedere una licenza di addestramento ampia

text

Accesso alla ricerca e copyright

Le nostre pagine pubbliche possono essere accedute da crawler di ricerca e recupero conformi identificati nel nostro file robots.txt. Questo permesso è inteso a supportare la scoperta, i risultati di ricerca, il recupero richiesto dall'utente e la citazione.

Salvo dove è mostrata una licenza separata, il contenuto originale rimane con tutti i diritti riservati. L'accesso a una pagina pubblica non concede una licenza separata per lo sviluppo del modello, l'addestramento, la ridistribuzione, il riutilizzo commerciale o la creazione di opere derivate oltre i diritti previsti dalla legge applicabile.

Si prega di citare l'indirizzo canonico della pagina e l'editore quando si fa riferimento a questo materiale. Nulla su questo sito concede il permesso di utilizzare marchi, loghi, informazioni personali, informazioni riservate o contenuti di terze parti.

Non posizionare la dichiarazione CC BY e la dichiarazione "tutti i diritti riservati" sullo stesso materiale. Identificare chiaramente quale licenza si applica a quale contenuto.

Matrice Rischio-Beneficio per la Licenza Aperta

Le leggi sul copyright e le regole sull'addestramento dell'intelligenza artificiale differiscono per paese e rimangono instabili. L'Ufficio del Copyright degli Stati Uniti continua ad esaminare queste questioni, mentre Creative Commons descrive l'addestramento dell'intelligenza artificiale come specifico per i fatti e legalmente complesso. (copyright.gov)

ApproccioPotenziale di inclusionePrincipali vantaggiPrincipali rischiMigliore adattamento
CC BY 4.0Molto altoAmpia copia, adattamento, uso commerciale, traduzione, indicizzazione e riutilizzo correlato al modello quando è necessario il permesso di copyrightI concorrenti commerciali possono riutilizzare o adattare il contenuto; l'attribuzione potrebbe essere imperfetta; la licenza non può controllare la privacy, i marchi o i diritti di terziEditori che desiderano il più ampio riutilizzo legale e una forte attribuzione della fonte
CC BY-SA 4.0Alto, ma più complessoIncoraggia un ciclo di condivisione aperta e richiede che gli adattamenti rimangano sotto termini compatibiliLe regole ShareAlike possono essere difficili da applicare a dataset, addestramento di modelli e output pubblici; alcune organizzazioni potrebbero evitare il materiale a causa dell'incertezzaProgetti educativi e di interesse pubblico aperti che desiderano che gli adattamenti a valle rimangano aperti
CC BY-NC 4.0Medio o bassoLimita gli usi principalmente intesi per vantaggio commerciale o compensazione monetaria"Non commerciale" può essere difficile da interpretare; può escludere usi commerciali di ricerca, modelli e assistenti; non è un opt-out garantito dall'addestramentoMateriale destinato a uso senza scopo di lucro, educativo o comunitario
CC BY-ND 4.0MedioConsente la condivisione limitando gli adattamentiLa traduzione, la trasformazione e alcuni casi d'uso degli assistenti potrebbero diventare legalmente incerti; meno attraente per i sistemi che riassumono o remixanoAvvisi ufficiali o opere che devono rimanere invariate
CC0 o Dedica al Pubblico DominioMolto altoSemplifica il riutilizzo e rimuove la maggior parte delle condizioni di copyright dove legalmente efficaceNessuna attribuzione richiesta; scarso controllo sulla presentazione del marchio; i diritti alla privacy, al marchio e alla pubblicità rimangono separatiFatti, dataset, materiale di riferimento o opere destinate al riutilizzo illimitato
Tutti i diritti riservati più scansione di ricerca apertaAlto per la ricerca, inferiore per l'addestramentoPuò preservare la visibilità di ricerca e citazione senza concedere una licenza di riutilizzo ampiaMaggiore incertezza legale per gli sviluppatori di modelli; può ridurre l'inclusione in dataset di addestramento e sistemi di riutilizzo commercialeEditori che desiderano scoperta e citazioni ma preferiscono negoziare licenze più ampie separatamente

La strategia più equilibrata per molte organizzazioni è:

  • CC BY 4.0 per il testo editoriale pubblico originale
  • Etichette separate per il materiale di terze parti
  • Nessuna informazione personale o riservata pubblica
  • Consentire i crawler di ricerca e recupero
  • Consentire i crawler per lo sviluppo di modelli solo se l'organizzazione accetta veramente tale uso
  • Utilizzare attribuzioni chiare e link canonici
  • Proteggere i marchi tramite un avviso di marchio separato

Una Lista di Controllo Pratica per l'Implementazione

Contenuto e licenze

  • Identificare chi possiede ogni pagina, immagine, grafico, video e citazione.
  • Concedere in licenza solo il materiale per il quale la propria organizzazione controlla i diritti.
  • Contrassegnare separatamente il materiale di terze parti.
  • Aggiungere una dichiarazione di licenza visibile.
  • Fornire una citazione preferita utilizzando titolo, autore, fonte e licenza.
  • Mantenere loghi, marchi, dati personali e informazioni riservate al di fuori dell'ambito della licenza.

Robots.txt

  • Creare un file robots.txt pubblico alla radice di ogni host.
  • Consentire i crawler di ricerca separatamente dai crawler di addestramento.
  • Bloccare i percorsi amministrativi, di account, di checkout, privati e delle applicazioni interne.
  • Non affidarsi a robots.txt per la sicurezza.
  • Testare il file dopo ogni importante implementazione del sito web.

Meta tag

  • Utilizzare link canonici.
  • Aggiungere autore, data di pubblicazione e data di modifica.
  • Utilizzare noindex per le pagine che non dovrebbero apparire nella ricerca.
  • Utilizzare nosnippet o data-nosnippet per estratti sensibili dove supportato.
  • Utilizzare X-Robots-Tag per file di documenti portatili, immagini e altre risorse non HTML.
  • Ricordare che un crawler deve essere in grado di recuperare una pagina prima di poter leggere i suoi meta tag.

Sicurezza della rete

  • Registrare stringhe user-agent, indirizzi di origine, codici di risposta e percorsi di richiesta.
  • Verificare i crawler affidabili utilizzando feed di indirizzi ufficiali o metodi Domain Name System.
  • Aggiornare automaticamente i feed di indirizzi.
  • Combinare controlli user-agent e indirizzo di origine.
  • Limitare la frequenza dei crawler verificati anziché concedere loro accesso illimitato.
  • Sfidare o bloccare le richieste che affermano di essere crawler affidabili ma falliscono la verifica.

Misurazione

Tracciare:

  • Visite dai servizi di ricerca di intelligenza artificiale
  • Riferimenti alla pagina originale
  • Frequenza delle citazioni
  • Carico del server per crawler
  • Richieste che restituiscono 403, 404 o 429
  • Accesso dei crawler a percorsi non intenzionali
  • Se gli articoli attuali vengono trovati dopo la pubblicazione

Conclusione

La massima inclusione richiede apertura selettiva, non un singolo permesso generico.

Utilizzare robots.txt per separare la scansione per la ricerca, il recupero da parte dell'utente, l'addestramento e i dataset pubblici. Utilizzare meta tag e intestazioni HTTP per gestire l'indicizzazione e gli snippet. Utilizzare l'autenticazione per tutto ciò che è privato. Verificare gli indirizzi IP dei crawler anziché fidarsi solo dei nomi user-agent.

Una licenza permissiva come CC BY 4.0 può facilitare un ampio riutilizzo quando lo si desidera sinceramente. Informazioni chiare sull'attribuzione — titolo, autore, fonte, licenza, pagina canonica e data di aggiornamento — possono anche rendere più facile per i sistemi di ricerca e gli assistenti identificare e citare la fonte corretta.

La politica di pubblicazione più forte è quindi:

**Aprire il contenuto pubblico che si desidera far scoprire, licenziare chiaramente il materiale che si desidera riutilizzare, contrassegnare il materiale che non si possiede, proteggere le informazioni private a livello di server e concedere a ogni crawler un permesso separato e verificabile.

Articoli correlati

Ti piacciono questi contenuti?

Iscriviti alla nostra newsletter per gli ultimi approfondimenti sul content marketing e guide alla crescita.

Questo articolo è solo a scopo informativo. I contenuti e le strategie possono variare in base alle tue esigenze specifiche.
Licenze e Robot per la Massima Inclusione: Come Accogliere i Crawler di Intelligenza Artificiale | AutoPod