AutoPodAutoPod

Licențiere și Roboți pentru Incluziune Maximă: Cum să Primești Crawlerele de Inteligență Artificială

lectură de 25 min
Articol audio
Licențiere și Roboți pentru Incluziune Maximă: Cum să Primești Crawlerele de Inteligență Artificială
0:000:00
Licențiere și Roboți pentru Incluziune Maximă: Cum să Primești Crawlerele de Inteligență Artificială

Licențiere și Roboți pentru Incluziune Maximă: Cum să Primești Crawlerele de Inteligență Artificială

Actualizat la 25 august 2026

Site-urile web au acum mai mult de o modalitate de a ajunge la public. O pagină poate fi găsită prin Google Search, rezumată de ChatGPT, citată de Perplexity, utilizată în căutările Claude, afișată prin serviciile Apple sau colectată de o arhivă web publică.

Aceste sisteme nu folosesc toate același crawler și nu respectă aceleași reguli. Un site web care blochează GPTBot poate apărea în continuare în căutările ChatGPT dacă permite OAI-SearchBot. Un site web care permite Applebot poate rămâne vizibil în Apple Search, blocând în același timp Applebot-Extended de la antrenarea modelelor de inteligență artificială. Google-Extended de la Google nu este un crawler normal deloc; este un token de control robots.txt.

Cea mai bună politică, prin urmare, nu este pur și simplu „permiteți inteligența artificială” sau „blocați inteligența artificială”. Este să creați permisiuni separate pentru:

  1. Căutare și descoperire
  2. Recuperare la cererea utilizatorului
  3. Dezvoltare și antrenare de modele
  4. Seturi de date publice
  5. Material sensibil, privat sau restricționat

Acest articol oferă un inventar actual al crawlerelor, exemple de robots.txt, ghidare privind meta-tag-urile, metode de verificare a adreselor de Protocol Internet, sfaturi privind licențierea Creative Commons, formulare juridice standard și o matrice risc-beneficiu.

Cele Patru Controale pe care Fiecare Editor ar Trebui să le Înțeleagă

1. robots.txt controlează crawling-ul solicitat

Un fișier robots.txt indică clienților automatizați conformi ce pagini pot solicita. Este util pentru gestionarea traficului crawlerului și pentru exprimarea preferințelor unui editor.

Cu toate acestea, robots.txt nu este un sistem de control al accesului. Protocolul de Excludere a Roboților stipulează că regulile sale nu reprezintă o autorizare de acces. Google avertizează, de asemenea, că o adresă blocată poate apărea în continuare în rezultatele căutării dacă alte pagini fac legătura către ea. Utilizați parole, autentificare sau controale de acces la nivel de server pentru informații confidențiale. (rfc-editor.org)

2. Meta-tag-urile controlează indexarea și fragmentele

Meta-tag-urile pentru roboți și antetul de răspuns X-Robots-Tag pot controla dacă o pagină este indexată sau dacă un motor de căutare poate afișa un fragment.

Aceste controale sunt vizibile în mod normal numai după ce unui crawler i s-a permis să preia pagina. Dacă robots.txt blochează pagina mai întâi, crawlerul s-ar putea să nu vadă niciodată meta-tag-ul. (developers.google.com)

3. Controalele de rețea verifică crawlerul

Un nume de user-agent este ușor de copiat. Un atacator poate trimite o cerere pretinzând a fi GPTBot, Googlebot sau PerplexityBot.

O abordare mai puternică combină:

  • User-agentul pretins
  • Un interval de adrese de Protocol Internet publicat
  • Verificarea Sistemului de Nume de Domeniu invers (Reverse Domain Name System)
  • Verificarea Sistemului de Nume de Domeniu direct (Forward Domain Name System)
  • Limite de rată și monitorizare a cererilor

4. O licență acordă drepturi de reutilizare

Robots.txt spune ce i se cere unui crawler să facă. O licență spune ce pot face legal persoanele sau organizațiile cu materialul atunci când este necesară permisiunea de drepturi de autor.

Acestea sunt instrumente diferite. O licență permisivă poate reduce incertitudinea legală, dar nu garantează că un crawler va vizita pagina, că un model o va folosi sau că un asistent o va cita.

Inventarul Crawlerelor Importante

Următorul inventar a fost verificat conform documentației furnizorilor disponibilă la 25 august 2026. Numele user-agenților, scopurile și intervalele de adrese de Protocol Internet se pot schimba, așa că sistemele de producție ar trebui să utilizeze documentația curentă a furnizorului și fluxurile de adrese în timp real.

FurnizorCrawler sau token robots.txtScop principalControl important
OpenAIOAI-SearchBotGăsește și analizează pagini pentru căutarea ChatGPTPermiteți-i să îmbunătățească șansa ca paginile să apară în rezultatele căutării ChatGPT.
OpenAIGPTBotColectează pagini care pot fi utilizate pentru antrenarea modelelor generative de inteligență artificială ale OpenAIPermiteți sau refuzați separat de căutare.
OpenAIChatGPT-UserPrelucrează pagini după ce un utilizator cere lui ChatGPT sau unui GPT personalizat să le accesezeEste declanșat de utilizator, mai degrabă decât un crawler web automat, deci regulile robots.txt s-ar putea să nu se aplice.
OpenAIOAI-AdsBotVerifică paginile web trimise ca destinații de publicitate ChatGPTRelevant în principal pentru advertiseri. Conținutul colectat nu este folosit pentru a antrena modele fundamentale generative de inteligență artificială.
GoogleGooglebotPrincipalul crawler Google SearchControlează crawling-ul obișnuit al Google Search.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-NewsImagini, videoclipuri și Google NewsAcestea au token-uri robots.txt separate și pot fi controlate independent.
GoogleGoogleOtherCrawling Google de uz general pentru diverse echipe de produse, inclusiv cercetare și dezvoltareNu reprezintă un produs Google specific.
GoogleGoogle-ExtendedControlează dacă conținutul crawled de Google poate fi utilizat pentru antrenarea modelelor Gemini și anumite sisteme de fundamentareEste un token de control robots.txt, nu un user-agent de cerere separat. Nu afectează includerea obișnuită în Google Search.
AnthropicClaudeBotColectează conținut web public care poate contribui la dezvoltarea modelului ClaudeRefuzați-l pentru a semnala că materialele viitoare ar trebui excluse din seturile de date de antrenament Anthropic.
AnthropicClaude-SearchBotÎmbunătățește calitatea rezultatelor căutării ClaudePermiteți-l pentru vizibilitatea în căutările Claude.
AnthropicClaude-UserPrelucrează pagini ca răspuns la o cerere a utilizatorului către ClaudeSeparat de crawling-ul automat.
PerplexityPerplexityBotIndexează pagini pentru rezultatele căutării PerplexityPerplexity afirmă că acest crawler nu este utilizat pentru a colecta conținut pentru antrenarea modelelor fundamentale de inteligență artificială.
PerplexityPerplexity-UserPrelucrează o pagină după ce un utilizator o solicităDocumentația Perplexity spune că acest fetcher ignoră în general robots.txt deoarece cererea a fost inițiată de un utilizator.
AppleApplebotSuportă Apple Search, Spotlight, Siri, Safari și alte experiențe ApplePermiteți-l pentru descoperirea Apple.
AppleApplebot-ExtendedControlează dacă conținutul crawled de Applebot poate fi utilizat pentru antrenarea modelelor fundamentale AppleNu crollează pagini în sine. Este un control al utilizării datelor.
Common CrawlCCBotColectează date web publice pentru arhiva web deschisă Common CrawlNu este un asistent, dar seturile sale de date pot fi utilizate de cercetători și dezvoltatori de inteligență artificială.
MicrosoftBingbotPrincipalul crawler de căutare BingPermiteți-l pentru descoperirea Bing și vizibilitatea în căutări.
MicrosoftMicrosoftPreview, BingVideoPreviewPrevizualizări de pagini și videoclipuri pentru produsele MicrosoftAcestea pot fi controlate separat de Bingbot.
AmazonAmzn-SearchBotCăutare Amazon și descoperirea conținutuluiAmazon spune că nu crollează conținut pentru antrenarea modelelor generative de inteligență artificială.
AmazonAmzn-UserPrelucrează informații curente ca răspuns la acțiunile utilizatorului, inclusiv cererile AlexaDeclansat de utilizator și separat de crawling-ul automat de căutare.

OpenAI documentează crawlerele sale de căutare, antrenament, publicitate și cele declanșate de utilizator ca controale separate. Documentația sa recomandă în mod specific permiterea OAI-SearchBot pentru căutarea ChatGPT, utilizând în același timp GPTBot separat pentru preferințele de antrenament. (developers.openai.com)

Google separă, de asemenea, Googlebot, GoogleOther și Google-Extended. Google-Extended nu are propriul său user-agent de cerere HTTP, iar blocarea sa nu elimină o pagină din Google Search. (developers.google.com)

Anthropic documentează roluri separate pentru ClaudeBot, Claude-SearchBot și Claude-User. Anthropic afirmă, de asemenea, că roboții săi respectă robots.txt și suportă directiva non-standard Crawl-delay. (support.anthropic.com)

Perplexity face distincția între crawling-ul automat de căutare și prelucrarea la cererea utilizatorului. Documentația sa actuală spune că PerplexityBot respectă robots.txt, în timp ce Perplexity-User, în general, nu, deoarece răspunde unei cereri a utilizatorului. (docs.perplexity.ai)

Documentația actuală a Apple face aceeași distincție între căutare și antrenament: Applebot suportă descoperirea, în timp ce Applebot-Extended permite editorilor să controleze utilizarea pentru antrenament fără a elimina paginile din Apple Search. (support.apple.com)

Configurații robots.txt Recomandate

Plasați robots.txt la rădăcina fiecărui host, cum ar fi:

text https://www.example.org/robots.txt

Regulile se aplică hostului, protocolului și portului specifice unde este servit fișierul. Un subdomeniu separat ar putea necesita propriul său fișier. (developers.google.com)

Configurația 1: Incluziune maximă

Utilizați aceasta atunci când conținutul editorial public poate fi găsit, rezumat, citat, indexat și colectat de crawlere conforme.

text

Paginile publice sunt disponibile crawlerelor conforme.

User-agent: * Allow: /

Excludeți căile private, tranzacționale și administrative.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Aceasta permite crawlerelor numite, inclusiv OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft și Amazon, cu excepția cazului în care o altă regulă specifică le blochează.

Nu plasați o regulă generală precum User-agent: * Disallow: / sub această configurație. O grupă ulterioară sau mai specifică poate schimba modul în care un crawler interpretează fișierul.

Configurația 2: Permiteți căutarea, dar blocați crawlerele de dezvoltare a modelelor

Acesta este adesea cel mai bun compromis pentru editorii care doresc citări și trafic din căutări, dar nu doresc să semnaleze permisiunea pentru colectarea destinată dezvoltării modelelor.

text

Blocați crawling-ul OpenAI pentru dezvoltarea modelelor.

User-agent: GPTBot Disallow: /

Blocați crawling-ul Anthropic pentru dezvoltarea modelelor.

User-agent: ClaudeBot Disallow: /

Blocați utilizarea Google pentru antrenarea modelelor și sistemele de fundamentare aferente.

User-agent: Google-Extended Disallow: /

Blocați utilizarea Apple pentru antrenarea modelelor fundamentale.

User-agent: Applebot-Extended Disallow: /

Opțional: blocați colectarea setului de date Common Crawl.

User-agent: CCBot

Disallow: /

Permiteți crawling-ul obișnuit de căutare și recuperare, cu excepția căilor sensibile.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Această configurație lasă OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot și Applebot acoperiți de grupul wildcard. De asemenea, menține permisiunile de căutare și antrenament separate.

Pentru Apple, blocarea Applebot-Extended în timp ce permiteți Applebot, păstrează descoperirea prin serviciile Apple. Pentru Google, blocarea Google-Extended nu blochează căutarea obișnuită Google Search. (developers.google.com)

Configurația 3: Permiteți în mod explicit crawlerele de căutare selectate

Dacă un fișier robots.txt existent blochează toate crawlerele, adăugați grupuri separate pentru crawlerele de căutare pe care doriți să le primiți.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Țineți toți ceilalți crawlere afară.

User-agent: * Disallow: /

Atunci când utilizați grupuri specifice, repetați regulile pentru căile sensibile în cadrul fiecărui grup. Unele crawlere utilizează grupul cel mai specific care se potrivește, mai degrabă decât să-l combine cu grupul wildcard. Bing documentează direct acest comportament, iar Google oferă ghidare separată privind grupurile specifice crawlerelor. (bing.com)

Limitări importante ale robots.txt

  • Un crawler poate ignora robots.txt.
  • Un crawler malițios se poate preface că este un crawler de încredere.
  • O pagină blocată poate fi totuși cunoscută prin titlul sau adresa sa web.
  • Robots.txt nu protejează parolele, fișierele private, înregistrările clienților sau interfețele de programare a aplicațiilor confidențiale.
  • O directivă Crawl-delay nu face parte din Protocolul de Excludere a Roboților și nu este suportată de fiecare crawler. Anthropic și Bing documentează suportul, în timp ce Apple spune că Applebot nu respectă crawl-delay. (rfc-editor.org)

Meta-Tag-uri și Anteturi HTTP

Exemplu de pagină publică

Pentru un articol public, utilizați un titlu clar, autor, adresă web canonică, dată de publicare și dată de modificare.

html

Directiva max-snippet este documentată în principal pentru Google. Nu presupuneți că fiecare crawler de inteligență artificială suportă fiecare directivă meta.

Exemplu de pagină privată sau sensibilă

html

Utilizați aceasta pentru paginile care nu ar trebui să apară în rezultatele căutării. Pagina trebuie să rămână crawlabilă suficient de mult timp pentru ca crawlerul să vadă directiva. Dacă pagina trebuie să rămână cu adevărat privată, utilizați autentificarea sau protecția prin parolă în schimb. (developers.google.com)

Ascundeți doar secțiunile sensibile din fragmentele de căutare

Google suportă data-nosnippet pentru anumite părți ale unei pagini HTML:

html

This paragraph may be shown in a search result.

Personal telephone numbers, private email addresses, or internal notes go here.

Acest lucru este util pentru detalii de contact, note interne sau informații generate de utilizator. Nu este o instrucțiune universală pentru fiecare sistem de inteligență artificială. (developers.google.com)

Utilizați antetul X-Robots-Tag pentru fișiere

Meta-tag-urile nu pot fi plasate într-un fișier PDF, imagine sau fișier video. Utilizați în schimb un antet de răspuns HTTP:

text X-Robots-Tag: noindex, nosnippet

Pentru o pagină care ar trebui să rămână căutabilă, dar nu ar trebui să furnizeze text pentru fragmente sau răspunsuri de inteligență artificială, utilizați:

text X-Robots-Tag: nosnippet

Google documentează X-Robots-Tag pentru resurse non-HTML, iar Apple îl suportă și pentru Applebot. (developers.google.com)

Controale specifice Apple

Apple suportă:

html

Apple afirmă că nosnippet împiedică pagina să fie utilizată ca context suplimentar și conținut curent atunci când modelele Apple generează rezultate. Pagina poate rămâne în continuare descoperibilă prin Apple Search, Spotlight, Siri și Safari. (support.apple.com)

Pentru paginile cu plată, Apple suportă, de asemenea, date structurate utilizând:

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Apple afirmă că astfel de pagini pot rămâne eligibile pentru rezultatele căutării, dar nu vor fi utilizate ca context suplimentar pentru răspunsurile de inteligență artificială. (support.apple.com)

Cum să Verificați Adresele IP ale Crawlerelor

De ce potrivirea user-agentului nu este suficientă

O regulă precum aceasta este slabă:

text dacă User-Agent conține "GPTBot": permiteți

Oricine poate trimite acel text. O regulă mai bună este:

text dacă User-Agent este un crawler cunoscut și adresa IP sursă este în intervalul oficial al furnizorului: permiteți sau limitați rata altfel: contestați, limitați rata sau blocați

Nu vă încredeți într-un antet X-Forwarded-For decât dacă provine de la un proxy sau o rețea de livrare de conținut pe care organizația dvs. o controlează.

Metode de verificare a furnizorului

FurnizorMetodă de verificare recomandată
OpenAIUtilizați fluxurile live de adrese IP publicate în documentația crawlerului OpenAI pentru OAI-SearchBot, GPTBot și OAI-AdsBot. Reîmprospătați-le automat, mai degrabă decât să copiați intervale fixe într-un firewall.
GoogleUtilizați intervalele de crawlere publicate de Google sau efectuați verificări DNS inverse și directe. Un crawler Google autentic ar trebui să se rezolve la un nume de host Google aprobat și să se rezolve înapoi la adresa originală.
AnthropicUtilizați fluxul actual de adrese ale crawlerelor publicat ca o verificare secundară a rețelei. Metoda principală de opt-out a Anthropic rămâne robots.txt.
PerplexityCombinați user-agentul cu fluxul actual de adrese PerplexityBot sau Perplexity-User. Perplexity recomandă în mod specific combinarea ambelor condiții într-o regulă de Web Application Firewall.
AppleUtilizați verificarea DNS inversă sub applebot.apple.com, apoi efectuați o căutare directă. Apple publică, de asemenea, intervale de adrese curente într-un flux JSON.
Common CrawlUtilizați verificarea DNS inversă sub crawl.commoncrawl.org și fluxul actual de adrese CCBot. Common Crawl notează că verificarea inversă nu este încă disponibilă pentru o parte din traficul IPv6.
MicrosoftUtilizați instrumentul oficial Verify Bingbot sau metodele documentate de căutare inversă și directă ale Microsoft.
AmazonUtilizați listele de adrese ale crawlerelor publicate de Amazon și potriviți-le cu user-agentul Amazon corespunzător.

Google, Apple, Common Crawl, OpenAI, Anthropic și Perplexity publică toate metode specifice furnizorilor sau fluxuri de adrese. Aceste liste se pot schimba, deci un proces de actualizare programat este mai sigur decât o listă copiată manual permanent. (developers.google.com)

Un design simplu de firewall ar putea arăta astfel:

text permiteți OAI-SearchBot doar când adresa sursă este în intervalul curent de căutare OpenAI permiteți GPTBot doar când adresa sursă este în intervalul curent de antrenament OpenAI permiteți PerplexityBot doar când adresa sursă este în intervalul curent PerplexityBot permiteți Applebot doar când verificarea DNS inversă și directă reușește permiteți CCBot doar când DNS-ul invers și intervalul curent Common Crawl se potrivesc

limitați rata tuturor crawlerelor verificate blocați sau contestați cererile neverificate care pretind a fi crawlere de încredere

Nu aplicați o regulă largă de permisiune unui întreg furnizor de cloud. Un crawler legitim poate utiliza infrastructura cloud, dar majoritatea traficului de la acel furnizor de cloud nu este neapărat crawlerul.

Cum Influențează Licențierea Deschisă Incluziunea

CC BY 4.0 în limbaj simplu

Licența Creative Commons Atribuire 4.0 Internațional, denumită în mod obișnuit CC BY 4.0, permite oamenilor să:

  • Copieze și să redistribuie lucrarea
  • Adapteze, traducă, remixeze și construiască pe baza ei
  • O utilizeze comercial

Principalele condiții sunt:

  • Acordați credit corespunzător
  • Faceți legătura către licență
  • Indicați dacă au fost efectuate modificări
  • Nu sugerați că creatorul original susține reutilizarea
  • Nu adăugați restricții legale sau tehnice care împiedică utilizările permise de licență

Creative Commons avertizează, de asemenea, că licența s-ar putea să nu acopere drepturile de confidențialitate, drepturile de publicitate, drepturile morale, drepturile de marcă comercială, drepturile de brevet sau materialul terților. (creativecommons.org)

O licență nu este o invitație pentru crawler în sine

Plasarea „CC BY 4.0” pe o pagină nu garantează că o organizație o va crolla. Un crawler poate fi în continuare blocat de:

  • robots.txt
  • O rețea de livrare de conținut (CDN)
  • Un Web Application Firewall (WAF)
  • Limitare de rată
  • O provocare JavaScript
  • Un zid de conectare (login wall)
  • Un răspuns slab al serverului
  • Un sitemap inaccesibil

În schimb, permiterea unui crawler nu acordă automat toate permisiunile de drept de autor necesare pentru fiecare utilizare ulterioară. Robots.txt și licențierea ar trebui concepute împreună.

De ce CC BY poate susține o incluziune mai largă

O licență permisivă clară poate facilita înțelegerea politicii unui editor de către echipele de date, sistemele de căutare și operatorii de asistenți. Poate reduce incertitudinea cu privire la copiere, adaptare, utilizare comercială, traducere și redistribuire atunci când aceste activități necesită permisiunea drepturilor de autor.

Cu toate acestea, Creative Commons explică faptul că antrenarea inteligenței artificiale este complexă din punct de vedere legal. O licență restrictivă nu este întotdeauna o modalitate eficientă de a preveni antrenarea, deoarece unele utilizări pentru antrenament pot fi permise prin excepții sau limitări ale drepturilor de autor. Creative Commons notează, de asemenea, că condițiile licenței pot fi dificil de aplicat antrenamentului mașinilor și rezultatelor modelelor. (creativecommons.org)

Lecția practică este:

Utilizați CC BY atunci când doriți cu adevărat o reutilizare legală largă. Nu utilizați o licență restrictivă Creative Commons ca o garanție de opt-out pentru antrenarea inteligenței artificiale.

Atribuirea îmbunătățește claritatea sursei

Creative Commons recomandă metoda TASL:

  • Titlu
  • Autor
  • Sursă
  • Licență

De exemplu:

„Licențiere și Roboți pentru Incluziune Maximă,” Example Publishing, https://www.example.org/articles/ai-crawlers, licențiată sub Creative Commons Atribuire 4.0 Internațional. Modificări efectuate: inventar actualizat al crawlerelor.

Atribuirea clară nu forțează fiecare asistent să citeze o pagină. Facilitează însă citarea corectă atunci când un sistem extrage titlul, autorul, sursa și informațiile de licențiere ale paginii. (wiki.creativecommons.org)

Adăugați informații structurate despre articol

Utilizați informațiile vizibile și datele structurate împreună:

html

Google recomandă informații clare despre autor, pagini de autor, date de publicare, date de modificare și pagini canonice stabile. Aceste semnale pot ajuta sistemele de căutare să înțeleagă cine a creat materialul și care versiune este autoritară. Nu garantează o clasare, incluziune sau citare. (developers.google.com)

Formular Juridic Standard pentru un Site Deschis, Prietenos cu Citările

Următorul text este un exemplu de limbaj, nu sfat juridic. Solicitați consilierului juridic să-l adapteze la jurisdicția dvs., structura de proprietate, obligațiile de confidențialitate și conținutul terților.

Declarație de licențiere CC BY 4.0

text

Licența conținutului

Cu excepția cazurilor specificate altfel, textul original și materialele editoriale originale de pe această pagină sunt licențiate sub licența Creative Commons Atribuire 4.0 Internațional:

https://creativecommons.org/licenses/by/4.0/

Această permisiune permite copierea, redistribuirea, adaptarea, traducerea, utilizarea comercială, procesarea lizibilă de mașină, indexarea pentru căutare, recuperarea, rezumarea și utilizarea în sistemele de inteligență artificială, cu condiția respectării termenilor licenței.

Atribuirea preferată:

„[Titlul paginii],” de [autor sau organizație], [adresa canonică a paginii], publicat sau actualizat la [data], licențiat sub Creative Commons Atribuire 4.0 Internațional. Modificări efectuate: [descrieți modificările, sau precizați „niciuna”].

Vă rugăm să păstrați informațiile despre autor, editor, sursă, licență și modificări ori de câte ori este rezonabil posibil. Acest ghid de atribuire preferată nu adaugă restricții licenței Creative Commons și nu înlocuiește textul licenței.

Fraza „inclusiv sistemele de inteligență artificială” clarifică intenția editorului. Nu ar trebui utilizată pentru a pretinde că editorul deține drepturile asupra materialului creat de altcineva.

Notificare privind drepturile de brand, confidențialitate și ale terților

text

Drepturi de brand, confidențialitate și ale terților

Licența de mai sus acoperă doar materialele originale identificate ca licențiate. Nu acordă permisiunea de a utiliza:

  • Mărci comerciale, mărci de servicii, logo-uri sau ambalaje comerciale
  • Nume, imagini sau asemănări ale persoanelor
  • Informații private, confidențiale, de cont, de sănătate, financiare sau de securitate
  • Contribuții ale utilizatorilor, cu excepția cazului în care sunt identificate separat ca licențiate
  • Fotografii, ilustrații, hărți, video, muzică, citate sau alte materiale ale terților
  • Conținut identificat ca „toate drepturile rezervate” sau supus unei licențe separate

Utilizarea numelui, logo-urilor și mărcilor Example Publishing nu trebuie să sugereze sponsorizare, aprobare, parteneriat sau susținere. Vă rugăm să faceți legătura către pagina originală și să distingeți clar citatul, parafraza, rezumatul și materialul generat.

Acest limbaj este important deoarece licențele Creative Commons nu acordă automat fiecare tip de drept legal conectat la o pagină. (creativecommons.org)

Ghid de citare pentru căutare și asistenți

text

Ghid de citare pentru căutare și asistenți

Salutăm indexarea conformă pentru căutare, recuperarea la cererea utilizatorului, citarea și rezumarea materialului licențiat de pe acest site.

Când citați acest site, vă rugăm să utilizați titlul paginii, autorul sau editorul, adresa canonică a paginii, data publicării sau actualizării și un link direct către sursă. Vă rugăm să identificați sursa ca una dintre intrările utilizate, să distingeți analiza generată de materialul citat și să nu afirmați sau implicați că Example Publishing susține un răspuns generat, un produs, o persoană sau un serviciu.

Acest ghid are scopul de a îmbunătăți acuratețea și atribuirea. Nu acordă drepturi dincolo de licența de conținut aplicabilă și nu licențiază mărci comerciale, informații personale, informații confidențiale sau material al terților.

Dacă doriți vizibilitate în căutări, dar nu doriți să acordați o licență amplă de antrenament

text

Acces la căutare și drepturi de autor

Paginile noastre publice pot fi accesate de crawlerele de căutare și recuperare conforme identificate în fișierul nostru robots.txt. Această permisiune are scopul de a susține descoperirea, rezultatele căutării, recuperarea la cererea utilizatorului și citarea.

Cu excepția cazului în care este prezentată o licență separată, conținutul original rămâne cu toate drepturile rezervate. Accesul la o pagină publică nu acordă o licență separată pentru dezvoltarea de modele, antrenament, redistribuire, reutilizare comercială sau crearea de opere derivate dincolo de drepturile prevăzute de legea aplicabilă.

Vă rugăm să citați adresa canonică a paginii și editorul atunci când faceți referire la acest material. Nimic de pe acest site nu acordă permisiunea de a utiliza mărci comerciale, logo-uri, informații personale, informații confidențiale sau conținut al terților.

Nu plasați declarația CC BY și declarația „toate drepturile rezervate” peste același material. Identificați clar ce licență se aplică cărui conținut.

Matrice Risc-Beneficiu pentru Licențierea Deschisă

Legislația drepturilor de autor și regulile de antrenare a inteligenței artificiale diferă de la o țară la alta și rămân nereglementate. Oficiul de Drepturi de Autor al Statelor Unite continuă să examineze aceste aspecte, în timp ce Creative Commons descrie antrenarea inteligenței artificiale ca fiind specifică faptelor și complexă din punct de vedere legal. (copyright.gov)

AbordarePotențial de incluziuneBeneficii principaleRiscuri principaleCea mai potrivită pentru
CC BY 4.0Foarte ridicatCopiere amplă, adaptare, utilizare comercială, traducere, indexare și reutilizare legată de modele atunci când este necesară permisiunea drepturilor de autorConcurenții comerciali pot reutiliza sau adapta conținutul; atribuirea poate fi imperfectă; licența nu poate controla confidențialitatea, mărcile comerciale sau drepturile terțilorEditori care doresc cea mai largă reutilizare legală și o atribuire puternică a sursei
CC BY-SA 4.0Ridicată, dar mai complexăÎncurajează un ciclu de partajare deschis și impune ca adaptările să rămână sub termeni compatibiliRegulile ShareAlike pot fi dificil de aplicat seturilor de date, antrenamentului modelelor și rezultatelor publice; unele organizații pot evita materialul din cauza incertitudiniiProiecte educaționale și de interes public deschise care doresc ca adaptările ulterioare să rămână deschise
CC BY-NC 4.0Mediu sau scăzutLimitează utilizările destinate în principal avantajului comercial sau compensației monetare„Noncomercial” poate fi dificil de interpretat; poate exclude utilizările comerciale de căutare, model și asistență; nu este un opt-out garantat pentru antrenamentMateriale destinate utilizării non-profit, educaționale sau comunitare
CC BY-ND 4.0MediuPermite partajarea, limitând în același timp adaptărileTraducerea, transformarea și unele cazuri de utilizare a asistenților pot deveni incerte din punct de vedere legal; mai puțin atractiv pentru sistemele care rezumă sau remixeazăNotificări oficiale sau lucrări care trebuie să rămână neschimbate
CC0 sau dedicare domeniu publicFoarte ridicatSimplifică reutilizarea și elimină majoritatea condițiilor de drept de autor acolo unde sunt eficiente legalNu este necesară atribuirea; control slab asupra prezentării mărcii; drepturile de confidențialitate, marcă comercială și publicitate rămân separateFapte, seturi de date, materiale de referință sau lucrări destinate reutilizării nelimitate
Toate drepturile rezervate plus crawling deschis pentru căutareRidicată pentru căutare, mai scăzută pentru antrenamentPoate păstra vizibilitatea în căutări și citări fără a acorda o licență amplă de reutilizareMai multă incertitudine legală pentru dezvoltatorii de modele; poate reduce incluziunea în seturile de date de antrenament și sistemele de reutilizare comercialăEditori care doresc descoperire și citări, dar preferă să negocieze licențe mai ample separat

Cea mai echilibrată strategie pentru multe organizații este:

  • CC BY 4.0 pentru textul editorial public original
  • Etichete separate pentru materialele terților
  • Fără informații personale sau confidențiale publice
  • Permiteți crawlerele de căutare și recuperare
  • Permiteți crawlerele de dezvoltare a modelelor numai dacă organizația acceptă cu adevărat această utilizare
  • Utilizați atribuiri clare și legături canonice
  • Protejați mărcile comerciale printr-o notificare separată de brand

O Listă de Verificare Practică pentru Implementare

Conținut și licențiere

  • Identificați cine deține fiecare pagină, imagine, diagramă, videoclip și citat.
  • Licențiați doar materialul pentru care organizația dvs. controlează drepturile.
  • Marcați separat materialele terților.
  • Adăugați o declarație de licență vizibilă.
  • Furnizați o citare preferată utilizând titlul, autorul, sursa și licența.
  • Păstrați logo-urile, mărcile comerciale, datele personale și informațiile confidențiale în afara scopului licențiat.

Robots.txt

  • Creați un fișier robots.txt public la rădăcina fiecărui host.
  • Permiteți crawlerele de căutare separat de crawlerele de antrenament.
  • Blocați căile administrative, de cont, de checkout, private și interne ale aplicațiilor.
  • Nu vă bazați pe robots.txt pentru securitate.
  • Testați fișierul după fiecare implementare majoră a site-ului web.

Meta-tag-uri

  • Utilizați legături canonice.
  • Adăugați autorul, data publicării și data modificării.
  • Utilizați noindex pentru paginile care nu ar trebui să apară în căutare.
  • Utilizați nosnippet sau data-nosnippet pentru extrase sensibile acolo unde sunt suportate.
  • Utilizați X-Robots-Tag pentru fișiere PDF, imagini și alte resurse non-HTML.
  • Amintiți-vă că un crawler trebuie să poată prelua o pagină înainte de a-i putea citi meta-tag-urile.

Securitate rețea

  • Înregistrați șirurile user-agent, adresele sursă, codurile de răspuns și căile cererilor.
  • Verificați crawlerele de încredere utilizând fluxuri oficiale de adrese sau metode DNS.
  • Reîmprospătați automat fluxurile de adrese.
  • Combinați verificările user-agentului și ale adresei sursă.
  • Limitați rata crawlerelor verificate, mai degrabă decât să le acordați acces nelimitat.
  • Contestați sau blocați cererile care pretind a fi crawlere de încredere, dar eșuează verificarea.

Măsurare

Monitorizați:

  • Vizitele de la serviciile de căutare bazate pe inteligență artificială
  • Referirile către pagina originală
  • Frecvența citărilor
  • Încărcarea serverului în funcție de crawler
  • Cererile care returnează 403, 404 sau 429
  • Accesul crawlerului la căi neintenționate
  • Dacă articolele curente sunt găsite după publicare

Concluzie

Incluziunea maximă necesită deschidere selectivă, nu o singură permisiune generală.

Utilizați robots.txt pentru a separa crawling-ul pentru căutare, recuperarea la cererea utilizatorului, antrenament și seturi de date publice. Utilizați meta-tag-uri și anteturi HTTP pentru a gestiona indexarea și fragmentele. Utilizați autentificarea pentru orice este privat. Verificați adresele IP ale crawlerelor, mai degrabă decât să vă încredeți doar în numele user-agenților.

O licență permisivă, cum ar fi CC BY 4.0, poate facilita reutilizarea amplă atunci când o doriți cu adevărat. Informațiile clare de atribuire – titlu, autor, sursă, licență, pagină canonică și data actualizării – pot, de asemenea, facilita sistemelor de căutare și asistenților să identifice și să citeze sursa corectă.

Cea mai puternică politică de publicare este, prin urmare:

**Deschideți conținutul public pe care doriți să fie descoperit, licențiați clar materialul pe care doriți să fie reutilizat, marcați materialul pe care nu-l dețineți, protejați informațiile private la nivel de server și acordați fiecărui crawler o permisiune separată, revizuibilă.

Articole similare

Îți place acest conținut?

Abonează-te la newsletter-ul nostru pentru cele mai noi perspective de content marketing și ghiduri de creștere.

Acest articol are doar scop informativ. Conținutul și strategiile pot varia în funcție de nevoile tale specifice.
Licențiere și Roboți pentru Incluziune Maximă: Cum să Primești Crawlerele de Inteligență Artificială | AutoPod