AutoPodAutoPod

Licencēšana un roboti maksimālai iekļaušanai: Kā uzņemt mākslīgā intelekta pārmeklētājus

21 min lasīšanai
Audio raksts
Licencēšana un roboti maksimālai iekļaušanai: Kā uzņemt mākslīgā intelekta pārmeklētājus
0:000:00
Licencēšana un roboti maksimālai iekļaušanai: Kā uzņemt mākslīgā intelekta pārmeklētājus

Licencēšana un roboti maksimālai iekļaušanai: Kā uzņemt mākslīgā intelekta pārmeklētājus

Atjaunināts 2026. gada 25. augustā

Vietnēm tagad ir vairāk nekā viens veids, kā sasniegt auditoriju. Lapa var tikt atrasta, izmantojot Google meklēšanu, apkopota ar ChatGPT, citēta Perplexity, izmantota Claude meklēšanā, parādīta, izmantojot Apple pakalpojumus, vai savākta publiskā tīmekļa arhīvā.

Šīs sistēmas neizmanto visus vienus un tos pašus pārmeklētājus, un tās neievēro vienādus noteikumus. Vietne, kas bloķē GPTBot, joprojām var parādīties ChatGPT meklēšanā, ja tā atļauj OAI-SearchBot. Vietne, kas atļauj Applebot, var palikt redzama Apple meklēšanā, vienlaikus bloķējot Applebot-Extended no mākslīgā intelekta modeļu apmācības. Google Google-Extended vispār nav parasts pārmeklētājs; tas ir robots.txt kontroles marķieris.

Tādējādi labākā politika nav vienkārši “atļaut mākslīgo intelektu” vai “bloķēt mākslīgo intelektu”. Tā ir atsevišķu atļauju izveide šādiem nolūkiem:

  1. Meklēšana un atklāšana
  2. Lietotāja pieprasīta izgūšana
  3. Modeļu izstrāde un apmācība
  4. Publiskas datu kopas
  5. Sensitīvs, privāts vai ierobežots materiāls

Šis raksts sniedz aktuālu pārmeklētāju sarakstu, robots.txt piemērus, meta tagu vadlīnijas, interneta protokola adrešu pārbaudes metodes, Creative Commons licencēšanas padomus, juridisko standartu tekstu un riska-ieguvumu matricu.

Četras kontroles, kas jāzina katram izdevējam

1. robots.txt kontrolē pieprasīto pārmeklēšanu

A robots.txt fails paziņo atbilstošiem automatizētiem klientiem, kuras lapas tie drīkst pieprasīt. Tas ir noderīgs pārmeklētāju datplūsmas pārvaldībai un izdevēja preferenču izteikšanai.

Tomēr robots.txt nav piekļuves kontroles sistēma. Robots izslēgšanas protokols norāda, ka tā noteikumi nav piekļuves autorizācija. Google arī brīdina, ka bloķēta adrese joprojām var parādīties meklēšanas rezultātos, ja uz to ved saites no citām lapām. Konfidenciālas informācijas aizsardzībai izmantojiet paroles, autentifikāciju vai servera puses piekļuves kontroles. (rfc-editor.org)

2. Meta tagi kontrolē indeksēšanu un fragmentus

Robots meta tagi un X-Robots-Tag atbildes galvene var kontrolēt, vai lapa tiek indeksēta vai vai meklētājprogramma drīkst parādīt fragmentu.

Šīs vadības ierīces parasti ir redzamas tikai pēc tam, kad pārmeklētājam ir atļauts ielādēt lapu. Ja robots.txt bloķē lapu pirmais, pārmeklētājs nekad var neredzēt meta tagu. (developers.google.com)

3. Tīkla kontroles pārbauda pārmeklētāju

Lietotāja aģenta nosaukumu ir viegli nokopēt. Uzbrucējs var nosūtīt pieprasījumu, apgalvojot, ka ir GPTBot, Googlebot vai PerplexityBot.

Spēcīgāka pieeja apvieno:

  • Pieprasīto lietotāja aģentu
  • Publicētu interneta protokola adrešu diapazonu
  • Reversā domēna vārdu sistēmas pārbaudi
  • Tiešās domēna vārdu sistēmas pārbaudi
  • Ātruma ierobežojumus un pieprasījumu uzraudzību

4. Licence piešķir atkārtotas izmantošanas tiesības

Robots.txt norāda, ko pārmeklētājam ir lūgts darīt. Licence norāda, ko cilvēki vai organizācijas drīkst likumīgi darīt ar materiālu, ja ir nepieciešama autortiesību atļauja.

Tie ir dažādi rīki. Atļaujoša licence var samazināt juridisko neskaidrību, taču tā negarantē, ka pārmeklētājs apmeklēs lapu, ka modelis to izmantos vai ka asistents to citēs.

Svarīgāko pārmeklētāju saraksts

Šis saraksts tika pārbaudīts, salīdzinot ar pakalpojumu sniedzēju dokumentāciju, kas bija pieejama 2026. gada 25. augustā. Lietotāja aģenta nosaukumi, mērķi un interneta protokola adrešu diapazoni var mainīties, tāpēc ražošanas sistēmām jāizmanto pakalpojumu sniedzēja aktuālā dokumentācija un tiešraides adrešu plūsmas.

Pakalpojumu sniedzējsPārmeklētājs vai robots.txt marķierisGalvenais mērķisSvarīga kontrole
OpenAIOAI-SearchBotAtrod un analizē lapas ChatGPT meklēšanaiAtļaujiet to, lai uzlabotu iespēju, ka lapas parādās ChatGPT meklēšanas rezultātos.
OpenAIGPTBotVāc lapas, kuras var izmantot OpenAI ģeneratīvo mākslīgā intelekta modeļu apmācībaiAtļaujiet vai neatļaujiet atsevišķi no meklēšanas.
OpenAIChatGPT-UserIelādē lapas pēc tam, kad lietotājs ir lūdzis ChatGPT vai pielāgotam GPT piekļūt tāmTas tiek aktivizēts lietotāja pieprasījumā, nevis ir automātisks tīmekļa pārmeklētājs, tāpēc robots.txt noteikumi var netikt piemēroti.
OpenAIOAI-AdsBotPārbauda tīmekļa lapas, kas iesniegtas kā ChatGPT reklāmas galamērķiGalvenokārt attiecas uz reklāmdevējiem. Savāktais saturs netiek izmantots ģeneratīvo mākslīgā intelekta pamatmodeļu apmācībai.
GoogleGooglebotGalvenais Google meklēšanas pārmeklētājsKontrolē parasto Google meklēšanas pārmeklēšanu.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-NewsAttēli, video un Google ZiņasTiem ir atsevišķi robots.txt marķieri, un tos var kontrolēt neatkarīgi.
GoogleGoogleOtherVispārējas nozīmes Google pārmeklēšana dažādām produktu komandām, ieskaitot pētniecību un izstrādiTas nepārstāv vienu konkrētu Google produktu.
GoogleGoogle-ExtendedKontrolē, vai Google pārmeklētais saturs var tikt izmantots Gemini modeļa apmācībai un noteiktām pamatojuma sistēmāmTas ir robots.txt kontroles marķieris, nevis atsevišķs pieprasījuma lietotāja aģents. Tas neietekmē parasto Google meklēšanas iekļaušanu.
AnthropicClaudeBotVāc publisko tīmekļa saturu, kas var veicināt Claude modeļa izstrādiNeatļaujiet to, lai signalizētu, ka turpmākais materiāls ir jāizslēdz no Anthropic apmācības datu kopām.
AnthropicClaude-SearchBotUzlabo Claude meklēšanas rezultātu kvalitātiAtļaujiet to Claude meklēšanas redzamībai.
AnthropicClaude-UserIelādē lapas, reaģējot uz lietotāja pieprasījumu ClaudeAtsevišķi no automātiskās pārmeklēšanas.
PerplexityPerplexityBotIndeksē lapas Perplexity meklēšanas rezultātiemPerplexity norāda, ka šis pārmeklētājs netiek izmantots satura vākšanai mākslīgā intelekta pamatmodeļu apmācībai.
PerplexityPerplexity-UserIelādē lapu pēc lietotāja pieprasījumaPerplexity dokumentācija norāda, ka šis ielādētājs parasti ignorē robots.txt, jo pieprasījumu ierosināja lietotājs.
AppleApplebotAtbalsta Apple Search, Spotlight, Siri, Safari un citas Apple pieredzesAtļaujiet to Apple atklāšanai.
AppleApplebot-ExtendedKontrolē, vai Applebot pārmeklētais saturs var tikt izmantots Apple pamatmodeļu apmācībaiTas pats nepārmeklē lapas. Tā ir datu izmantošanas kontrole.
Common CrawlCCBotVāc publiskos tīmekļa datus Common Crawl atvērtajam tīmekļa arhīvamTas nav asistents, taču tā datu kopas var izmantot pētnieki un mākslīgā intelekta izstrādātāji.
MicrosoftBingbotGalvenais Bing meklēšanas pārmeklētājsAtļaujiet to Bing atklāšanai un meklēšanas redzamībai.
MicrosoftMicrosoftPreview, BingVideoPreviewLapu un video priekšskatījumi Microsoft produktiemTos var kontrolēt atsevišķi no Bingbot.
AmazonAmzn-SearchBotAmazon meklēšana un satura atklāšanaAmazon norāda, ka tā nepārmeklē saturu ģeneratīvo mākslīgā intelekta modeļu apmācībai.
AmazonAmzn-UserIelādē aktuālo informāciju, reaģējot uz lietotāja darbībām, tostarp Alexa pieprasījumiemLietotāja aktivizēts un atsevišķi no automātiskās meklēšanas pārmeklēšanas.

OpenAI dokumentē savus meklēšanas, apmācības, reklāmas un lietotāja aktivizētos pārmeklētājus kā atsevišķas kontroles. Tā dokumentācija īpaši iesaka atļaut OAI-SearchBot ChatGPT meklēšanai, vienlaikus izmantojot GPTBot atsevišķi apmācības preferencēm. (developers.openai.com)

Google līdzīgi atdala Googlebot, GoogleOther un Google-Extended. Google-Extended nav sava HTTP pieprasījuma lietotāja aģenta, un tā bloķēšana nenoņem lapu no Google meklēšanas. (developers.google.com)

Anthropic dokumentē atsevišķas lomas ClaudeBot, Claude-SearchBot un Claude-User. Anthropic arī norāda, ka tā boti ievēro robots.txt un atbalsta nestandarta Crawl-delay direktīvu. (support.anthropic.com)

Perplexity atšķir automātisko meklēšanas pārmeklēšanu un lietotāja pieprasīto ielādi. Tā pašreizējā dokumentācija norāda, ka PerplexityBot ievēro robots.txt, savukārt Perplexity-User parasti to nedara, jo tas reaģē uz lietotāja pieprasījumu. (docs.perplexity.ai)

Apple pašreizējā dokumentācijā tiek veikta tāda pati meklēšanas pret apmācības atšķirība: Applebot atbalsta atklāšanu, savukārt Applebot-Extended ļauj izdevējiem kontrolēt apmācības izmantošanu, nenoņemot lapas no Apple meklēšanas. (support.apple.com)

Ieteicamās robots.txt konfigurācijas

Novietojiet robots.txt katra resursdatora saknes direktorijā, piemēram:

text https://www.example.org/robots.txt

Noteikumi attiecas uz konkrēto resursdatoru, protokolu un portu, kurā fails tiek apkalpots. Atsevišķai apakšdomēnai var būt nepieciešams savs fails. (developers.google.com)

Konfigurācija 1: Maksimāla iekļaušana

Izmantojiet to, ja publisko redakcionālo saturu var atrast, apkopot, citēt, indeksēt un vākt atbilstoši pārmeklētāji.

text

Publiskās lapas ir pieejamas atbilstošiem pārmeklētājiem.

User-agent: * Allow: /

Izslēdziet privātās, transakciju un administratīvās takas.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Tas atļauj nosauktos pārmeklētājus, tostarp OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft un Amazon, ja vien cits konkrēts noteikums tos nebloķē.

Nelieciet vispārīgu noteikumu, piemēram, User-agent: * Disallow: /, zem šīs konfigurācijas. Vēlāka vai specifiskāka grupa var mainīt veidu, kā pārmeklētājs interpretē failu.

Konfigurācija 2: Atļaut meklēšanu, bet bloķēt modeļu izstrādes pārmeklētājus

Tas bieži vien ir labākais kompromiss izdevējiem, kuri vēlas citātus un meklēšanas datplūsmu, bet nevēlas signalizēt atļauju modeļu izstrādes vākšanai.

text

Bloķēt OpenAI modeļu izstrādes pārmeklēšanu.

User-agent: GPTBot Disallow: /

Bloķēt Anthropic modeļu izstrādes pārmeklēšanu.

User-agent: ClaudeBot Disallow: /

Bloķēt Google modeļu apmācību un saistīto pamatojuma izmantošanu.

User-agent: Google-Extended Disallow: /

Bloķēt Apple pamatmodeļu apmācības izmantošanu.

User-agent: Applebot-Extended Disallow: /

Pēc izvēles: bloķēt Common Crawl datu kopu vākšanu.

User-agent: CCBot

Disallow: /

Atļaut parasto meklēšanas un izgūšanas pārmeklēšanu, izņemot sensitīvas takas.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Šī konfigurācija atstāj OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot un Applebot aptvertus ar aizstājējzīmes grupu. Tā arī saglabā meklēšanas un apmācības atļaujas atsevišķi.

Attiecībā uz Apple, Applebot-Extended bloķēšana, vienlaikus atļaujot Applebot, saglabā atklāšanu, izmantojot Apple pakalpojumus. Attiecībā uz Google, Google-Extended bloķēšana nebloķē parasto Google meklēšanu. (developers.google.com)

Konfigurācija 3: Skaidri atļaut atlasītos meklēšanas pārmeklētājus

Ja esošais robots.txt fails bloķē visus pārmeklētājus, pievienojiet atsevišķas grupas tiem meklēšanas pārmeklētājiem, kurus vēlaties uzņemt.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Izslēdziet visus pārējos pārmeklētājus.

User-agent: * Disallow: /

Izmantojot specifiskas grupas, atkārtojiet sensitīvo taku noteikumus katrā grupā. Daži pārmeklētāji izmanto visprecīzāko atbilstošo grupu, nevis apvieno to ar aizstājējzīmes grupu. Bing šo uzvedību dokumentē tieši, un Google sniedz atsevišķas vadlīnijas pārmeklētājiem specifiskām grupām. (bing.com)

Svarīgi robots.txt ierobežojumi

  • Pārmeklētājs var ignorēt robots.txt.
  • Ļaunprātīgs pārmeklētājs var izlikties par uzticamu pārmeklētāju.
  • Bloķēta lapa joprojām var būt zināma pēc tās nosaukuma vai tīmekļa adreses.
  • Robots.txt neaizsargā paroles, privātus failus, klientu ierakstus vai konfidenciālas lietojumprogrammu programmēšanas saskarnes.
  • Crawl-delay direktīva nav daļa no Robots izslēgšanas protokola kodola un to neatbalsta katrs pārmeklētājs. Anthropic un Bing dokumentē atbalstu, savukārt Apple norāda, ka Applebot neievēro pārmeklēšanas aizkavi. (rfc-editor.org)

Meta tagi un HTTP galvenes

Publiskas lapas piemērs

Publiskam rakstam izmantojiet skaidru virsrakstu, autoru, kanonisko tīmekļa adresi, publicēšanas datumu un modifikācijas datumu.

html

max-snippet direktīva galvenokārt ir dokumentēta Google. Neuzņemieties, ka katrs mākslīgā intelekta pārmeklētājs atbalsta katru meta direktīvu.

Privātas vai sensitīvas lapas piemērs

html

Izmantojiet to lapām, kurām nevajadzētu parādīties meklēšanas rezultātos. Lapai jābūt pārmeklējamai pietiekami ilgi, lai pārmeklētājs varētu redzēt direktīvu. Ja lapai patiešām jāpaliek privātai, izmantojiet autentifikāciju vai paroles aizsardzību. (developers.google.com)

Paslēpt tikai sensitīvas sadaļas no meklēšanas fragmentiem

Google atbalsta data-nosnippet konkrētām HTML lapas daļām:

html

Šis rindkopa var tikt parādīta meklēšanas rezultātā.

Šeit ievietoti personīgie tālruņu numuri, privātās e-pasta adreses vai iekšējās piezīmes.

Tas ir noderīgi kontaktinformācijai, iekšējām piezīmēm vai lietotāju ģenerētai informācijai. Tā nav universāla instrukcija katrai mākslīgā intelekta sistēmai. (developers.google.com)

Izmantojiet X-Robots-Tag galveni failiem

Meta tagus nevar ievietot pārnēsājamā dokumenta failā, attēlā vai video failā. Tā vietā izmantojiet HTTP atbildes galveni:

text X-Robots-Tag: noindex, nosnippet

Lapu, kurai jāpaliek meklējamai, bet kurai nevajadzētu sniegt tekstu fragmentiem vai mākslīgā intelekta atbildēm, izmantojiet:

text X-Robots-Tag: nosnippet

Google dokumentē X-Robots-Tag ne-HTML resursiem, un Apple to atbalsta arī Applebot. (developers.google.com)

Apple specifiskās kontroles

Apple atbalsta:

html

Apple norāda, ka nosnippet novērš lapas izmantošanu kā papildu kontekstu un pašreizējo saturu, kad Apple modeļi ģenerē izvadi. Lapa joprojām var būt atrodama, izmantojot Apple Search, Spotlight, Siri un Safari. (support.apple.com)

Maksas lapām Apple atbalsta arī strukturētus datus, izmantojot:

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Apple norāda, ka šādas lapas var palikt piemērotas meklēšanas rezultātiem, taču tās netiks izmantotas kā papildu konteksts mākslīgā intelekta atbildēm. (support.apple.com)

Kā pārbaudīt pārmeklētāja interneta protokola adreses

Kāpēc lietotāja aģenta atbilstība nav pietiekama

Tāds noteikums kā šis ir vājš:

text if User-Agent contains "GPTBot": allow

Ikviens var nosūtīt šo tekstu. Labāks noteikums ir:

text ja lietotāja aģents ir zināms pārmeklētājs un avota interneta protokola adrese ir pakalpojumu sniedzēja oficiālajā diapazonā: atļaut vai ierobežot ātrumu citādi: izvirzīt izaicinājumu, ierobežot ātrumu vai bloķēt

Neuzticieties X-Forwarded-For galvenei, ja vien tā nav no starpniekservera vai satura piegādes tīkla, ko kontrolē jūsu organizācija.

Pakalpojumu sniedzēju pārbaudes metodes

Pakalpojumu sniedzējsIeteicamā pārbaudes metode
OpenAIIzmantojiet tiešraides interneta protokola adrešu plūsmas, kas publicētas OpenAI pārmeklētāju dokumentācijā par OAI-SearchBot, GPTBot un OAI-AdsBot. Atsvaidziniet tās automātiski, nevis kopējiet fiksētus diapazonus ugunsmūrī.
GoogleIzmantojiet Google publicētos pārmeklētāju diapazonus vai veiciet reversās un tiešās domēna vārdu sistēmas pārbaudes. Patiesam Google pārmeklētājam vajadzētu atrisināties uz apstiprinātu Google resursdatora nosaukumu un atrisināties atpakaļ uz sākotnējo adresi.
AnthropicIzmantojiet pašreizējo publicēto pārmeklētāju adrešu plūsmu kā sekundāro tīkla pārbaudi. Anthropic primārā atteikšanās metode joprojām ir robots.txt.
PerplexityApvienojiet lietotāja aģentu ar pašreizējo PerplexityBot vai Perplexity-User adrešu plūsmu. Perplexity īpaši iesaka apvienot abus nosacījumus tīmekļa lietojumprogrammu ugunsmūra noteikumā.
AppleIzmantojiet reversās domēna vārdu sistēmas pārbaudi zem applebot.apple.com, pēc tam veiciet tiešo meklēšanu. Apple arī publicē pašreizējos adrešu diapazonus JSON plūsmā.
Common CrawlIzmantojiet reversās domēna vārdu sistēmas pārbaudi zem crawl.commoncrawl.org un pašreizējo CCBot adrešu plūsmu. Common Crawl norāda, ka reversā pārbaude vēl nav pieejama dažiem IPv6 datplūsmām.
MicrosoftIzmantojiet oficiālo Verify Bingbot rīku vai Microsoft dokumentētās reversās un tiešās meklēšanas metodes.
AmazonIzmantojiet Amazon publicētās pārmeklētāju adrešu sarakstus un saskaņojiet tos ar atbilstošo Amazon lietotāja aģentu.

Google, Apple, Common Crawl, OpenAI, Anthropic un Perplexity visi publicē pakalpojumu sniedzējiem specifiskas metodes vai adrešu plūsmas. Šie saraksti var mainīties, tāpēc plānota atjaunināšanas process ir drošāks nekā pastāvīgs manuāli kopēts saraksts. (developers.google.com)

Vienkārša ugunsmūra konstrukcija varētu izskatīties šādi:

text atļaut OAI-SearchBot tikai tad, ja avota adrese atrodas pašreizējā OpenAI meklēšanas diapazonā atļaut GPTBot tikai tad, ja avota adrese atrodas pašreizējā OpenAI apmācības diapazonā atļaut PerplexityBot tikai tad, ja avota adrese atrodas pašreizējā PerplexityBot diapazonā atļaut Applebot tikai tad, ja reversā un tiešā DNS pārbaude ir veiksmīga atļaut CCBot tikai tad, ja reversā DNS un pašreizējais Common Crawl diapazons sakrīt

ierobežot ātrumu visiem pārbaudītajiem pārmeklētājiem bloķēt vai apstrīdēt nepārbaudītus pieprasījumus, kas apgalvo, ka ir uzticami pārmeklētāji

Neizmantojiet plašu atļaujas noteikumu visam mākoņpakalpojumu sniedzējam. Legitimēts pārmeklētājs var izmantot mākoņinfrastruktūru, taču lielākā daļa datplūsmas no šī mākoņpakalpojumu sniedzēja nav obligāti pārmeklētājs.

Kā atvērtā licencēšana ietekmē iekļaušanu

CC BY 4.0 vienkāršā valodā

Creative Commons Attribution 4.0 International licence, ko parasti sauc par CC BY 4.0, atļauj cilvēkiem:

  • Kopēt un izplatīt darbu
  • Pielāgot, tulkot, remiksēt un veidot uz tā pamata
  • Izmantot to komerciāli

Galvenie nosacījumi ir:

  • Norādīt atbilstošu atsauci
  • Sniegt saiti uz licenci
  • Norādīt, vai tika veiktas izmaiņas
  • Nenorādīt, ka sākotnējais autors atbalsta atkārtotu izmantošanu
  • Nepievienot juridiskus vai tehniskus ierobežojumus, kas novērš licencē atļautu izmantošanu

Creative Commons arī brīdina, ka licence var neattiekties uz privātuma tiesībām, publiskuma tiesībām, morālajām tiesībām, preču zīmju tiesībām, patentu tiesībām vai trešo pušu materiāliem. (creativecommons.org)

Licence pati par sevi nav pārmeklētāja ielūgums

Licences “CC BY 4.0” ievietošana lapā negarantē, ka organizācija to pārmeklēs. Pārmeklētāju joprojām var bloķēt:

  • robots.txt
  • Satura piegādes tīkls
  • Tīmekļa lietojumprogrammu ugunsmūris
  • Ātruma ierobežošana
  • JavaScript izaicinājums
  • Pieteikšanās siena
  • Vāja servera atbilde
  • Neaizsniedzama vietnes karte

Gluži pretēji, pārmeklētāja atļaušana automātiski nepiešķir visas autortiesību atļaujas, kas nepieciešamas katrai turpmākajai izmantošanai. Robots.txt un licencēšana jāizstrādā kopā.

Kāpēc CC BY var atbalstīt plašāku iekļaušanu

Skaidra atļaujoša licence var padarīt izdevēja politiku vieglāk saprotamu datu komandām, meklēšanas sistēmām un asistentu operatoriem. Tā var samazināt neskaidrību par kopēšanu, pielāgošanu, komerciālu izmantošanu, tulkošanu un izplatīšanu, ja šīm darbībām ir nepieciešama autortiesību atļauja.

Tomēr Creative Commons skaidro, ka mākslīgā intelekta apmācība ir juridiski sarežģīta. Ierobežojoša licence ne vienmēr ir efektīvs veids, kā novērst apmācību, jo dažas apmācības izmantošanas var būt atļautas ar autortiesību izņēmumiem vai ierobežojumiem. Creative Commons arī atzīmē, ka licences nosacījumus var būt grūti piemērot mašīnapmācībai un modeļu izvadiem. (creativecommons.org)

Praktiskā mācība ir:

Izmantojiet CC BY, ja patiešām vēlaties plašu likumīgu atkārtotu izmantošanu. Neizmantojiet ierobežojošu Creative Commons licenci kā garantētu mākslīgā intelekta apmācības atteikšanos.

Atruna uzlabo avota skaidrību

Creative Commons iesaka TASL metodi:

  • Virsraksts
  • Autors
  • Avots
  • Licence

Piemēram:

“Licencēšana un roboti maksimālai iekļaušanai,” Example Publishing, https://www.example.org/articles/ai-crawlers, licencēts saskaņā ar Creative Commons Attribution 4.0 International. Veiktās izmaiņas: atjaunināts pārmeklētāju saraksts.

Skaidra atsauce neliek katram asistentam citēt lapu. Tā atvieglo pareizu citēšanu, ja sistēma izvelk lapas virsrakstu, autoru, avotu un licencēšanas informāciju. (wiki.creativecommons.org)

Pievienot strukturētu raksta informāciju

Izmantojiet redzamu informāciju un strukturētus datus kopā:

html

Google iesaka skaidru informāciju par autoru, autoru lapām, publicēšanas datumiem, modifikācijas datumiem un stabilām kanoniskām lapām. Šie signāli var palīdzēt meklēšanas sistēmām saprast, kas izveidoja materiālu un kura versija ir autoritatīva. Tie negarantē ranžēšanu, iekļaušanu vai citēšanu. (developers.google.com)

Juridiskais standarts atvērtai, citātu draudzīgai vietnei

Turpmāk sniegtais teksts ir piemērs, nevis juridiska konsultācija. Lūdziet juristu pielāgot to jūsu jurisdikcijai, īpašumtiesību struktūrai, privātuma saistībām un trešo pušu saturam.

CC BY 4.0 licencēšanas paziņojums

text

Satura licence

Izņemot gadījumus, kad norādīts citādi, sākotnējais teksts un oriģinālie redakcionālie materiāli šajā lapā ir licencēti saskaņā ar Creative Commons Attribution 4.0 International licenci:

https://creativecommons.org/licenses/by/4.0/

Šī atļauja ļauj kopēt, izplatīt, pielāgot, tulkot, komerciāli izmantot, mašīnlasāmi apstrādāt, veikt meklēšanas indeksēšanu, izgūt, apkopot un izmantot mākslīgā intelekta sistēmās, ja tiek ievēroti licences noteikumi.

Vēlamā atsauce:

“[Lapas virsraksts],” autors [autors vai organizācija], [kanoniskā lapas adrese], publicēts vai atjaunināts [datums], licencēts saskaņā ar Creative Commons Attribution 4.0 International. Veiktās izmaiņas: [aprakstiet izmaiņas vai norādiet “nav”].

Lūdzu, saglabājiet autora, izdevēja, avota, licences un modifikācijas informāciju, kad vien tas ir saprātīgi iespējams. Šīs vēlamās atsauces vadlīnijas nepievieno ierobežojumus Creative Commons licencei un neaizstāj licences tekstu.

Frāze “ieskaitot mākslīgā intelekta sistēmas” precizē izdevēja nodomu. To nevajadzētu izmantot, lai izliktos, ka izdevējam pieder tiesības uz materiālu, ko radījis kāds cits.

Zīmola, privātuma un trešo pušu tiesību paziņojums

text

Zīmola, privātuma un trešo pušu tiesības

Iepriekš minētā licence attiecas tikai uz oriģinālajiem materiāliem, kas identificēti kā licencēti. Tā nedod atļauju izmantot:

  • Preču zīmes, pakalpojumu zīmes, logotipus vai tirdzniecības apvalkus
  • Cilvēku vārdus, attēlus vai līdzības
  • Privātu, konfidenciālu, konta, veselības, finanšu vai drošības informāciju
  • Lietotāju iesniegumus, ja vien tie nav atsevišķi identificēti kā licencēti
  • Fotogrāfijas, ilustrācijas, kartes, video, mūziku, citātus vai citus trešo pušu materiālus
  • Satura, kas identificēts kā “visas tiesības aizsargātas” vai kam piemērojama atsevišķa licence

Example Publishing nosaukuma, logotipu un zīmolu izmantošana nedrīkst liecināt par sponsorēšanu, apstiprinājumu, partnerību vai atbalstu. Lūdzu, ievietojiet saiti uz oriģinālo lapu un skaidri atšķiriet citātus, parafrāzes, kopsavilkumus un ģenerētu materiālu.

Šī valoda ir svarīga, jo Creative Commons licences automātiski nepiešķir visu veidu juridiskās tiesības, kas saistītas ar lapu. (creativecommons.org)

Meklēšanas un asistentu citēšanas vadlīnijas

text

Meklēšanas un asistentu citēšanas vadlīnijas

Mēs atzinīgi vērtējam atbilstošu meklēšanas indeksēšanu, lietotāja pieprasītu izgūšanu, citēšanu un licencētā materiāla kopsavilkumu šajā vietnē.

Citējot šo vietni, lūdzu, izmantojiet lapas virsrakstu, autoru vai izdevēju, kanonisko lapas adresi, publicēšanas vai atjaunināšanas datumu un tiešu saiti uz avotu. Lūdzu, norādiet avotu kā vienu no izmantotajiem avotiem, atšķiriet ģenerētu analīzi no citēta materiāla un nenorādiet vai netieši nenorādiet, ka Example Publishing atbalsta ģenerētu atbildi, produktu, personu vai pakalpojumu.

Šo vadlīniju mērķis ir uzlabot precizitāti un atsauci. Tā nepiešķir tiesības, kas pārsniedz piemērojamo satura licenci, un nelicencē preču zīmes, personisko informāciju, konfidenciālu informāciju vai trešo pušu materiālus.

Ja vēlaties meklēšanas redzamību, bet nevēlaties piešķirt plašu apmācības licenci

text

Meklēšanas piekļuve un autortiesības

Mūsu publiskajām lapām var piekļūt atbilstoši meklēšanas un izgūšanas pārmeklētāji, kas identificēti mūsu robots.txt failā. Šī atļauja ir paredzēta atklāšanas, meklēšanas rezultātu, lietotāja pieprasītas izgūšanas un citēšanas atbalstam.

Izņemot gadījumus, kad ir norādīta atsevišķa licence, oriģinālais saturs paliek ar visām tiesībām aizsargāts. Piekļuve publiskai lapai nepiešķir atsevišķu licenci modeļu izstrādei, apmācībai, izplatīšanai, komerciālai atkārtotai izmantošanai vai atvasinātu darbu radīšanai, kas pārsniedz piemērojamajos tiesību aktos paredzētās tiesības.

Lūdzu, citējiet kanonisko lapas adresi un izdevēju, atsaucoties uz šo materiālu. Nekas šajā vietnē nedod atļauju izmantot preču zīmes, logotipus, personisko informāciju, konfidenciālu informāciju vai trešo pušu saturu.

Nenovietojiet CC BY paziņojumu un visu tiesību aizsargāto paziņojumu virs viena un tā paša materiāla. Skaidri norādiet, kura licence attiecas uz kuru saturu.

Atvērtās licencēšanas riska-ieguvumu matrica

Autortiesību likumi un mākslīgā intelekta apmācības noteikumi atšķiras atkarībā no valsts un joprojām ir neatrisināti. Amerikas Savienoto Valstu Autortiesību birojs turpina pētīt šos jautājumus, savukārt Creative Commons apraksta mākslīgā intelekta apmācību kā uz faktiem balstītu un juridiski sarežģītu. (copyright.gov)

PieejaIekļaušanas potenciālsGalvenie ieguvumiGalvenie riskiLabākā piemērotība
CC BY 4.0Ļoti augstsPlaša kopēšana, pielāgošana, komerciāla izmantošana, tulkošana, indeksēšana un ar modeļiem saistīta atkārtota izmantošana, ja nepieciešama autortiesību atļaujaKomerciālie konkurenti var atkārtoti izmantot vai pielāgot saturu; atsauce var būt nepilnīga; licence nevar kontrolēt privātuma, preču zīmju vai trešo pušu tiesībasIzdevēji, kas vēlas plašāko likumīgo atkārtotu izmantošanu un spēcīgu avota atsauci
CC BY-SA 4.0Augsts, bet sarežģītāksRosina atvērtu koplietošanas ciklu un prasa pielāgojumus, lai tie paliktu saderīgos noteikumosShareAlike noteikumus var būt grūti piemērot datu kopām, modeļu apmācībai un publiskajām izvadiem; dažas organizācijas var izvairīties no materiāla neskaidrību dēļAtvērti izglītības un sabiedrības interešu projekti, kas vēlas, lai turpmākās adaptācijas paliktu atvērtas
CC BY-NC 4.0Vidējs vai zemsIerobežo lietojumus, kas galvenokārt paredzēti komerciālām priekšrocībām vai finansiālai kompensācijai“Nekomerciāls” var būt grūti interpretējams; var izslēgt komerciālu meklēšanu, modeļu un asistentu lietojumus; tas nav garantēts apmācības atteikumsMateriāls, kas paredzēts bezpeļņas, izglītības vai kopienas lietošanai
CC BY-ND 4.0VidējsAtļauj kopīgošanu, vienlaikus ierobežojot pielāgojumusTulkošana, transformācija un daži asistentu lietošanas gadījumi var kļūt juridiski neskaidri; mazāk pievilcīgs sistēmām, kas apkopo vai remiksēOficiāli paziņojumi vai darbi, kuriem jāpaliek nemainīgiem
CC0 vai publiskā domēna veltījumsĻoti augstsVienkāršo atkārtotu izmantošanu un novērš lielāko daļu autortiesību nosacījumu, ja tie ir juridiski spēkāNav obligātas atsauces; vāja kontrole pār zīmola prezentāciju; privātuma, preču zīmju un publiskuma tiesības paliek atsevišķasFakti, datu kopas, atsauces materiāli vai darbi, kas paredzēti neierobežotai atkārtotai izmantošanai
Visas tiesības aizsargātas plus atvērta meklēšanas pārmeklēšanaAugsts meklēšanai, zemāks apmācībaiVar saglabāt meklēšanas un citēšanas redzamību, nepiešķirot plašu atkārtotas izmantošanas licenciLielāka juridiskā neskaidrība modeļu izstrādātājiem; var samazināt iekļaušanu apmācības datu kopās un komerciālās atkārtotas izmantošanas sistēmāsIzdevēji, kas vēlas atklāšanu un citātus, bet dod priekšroku plašāku licenču sarunām atsevišķi

Vislīdzsvarotākā stratēģija daudzām organizācijām ir:

  • CC BY 4.0 oriģinālajam publiskajam redakcionālajam tekstam
  • Atsevišķas etiķetes trešo pušu materiāliem
  • Nav publiskas personiskās vai konfidenciālās informācijas
  • Atļaut meklēšanas un izgūšanas pārmeklētājus
  • Atļaut modeļu izstrādes pārmeklētājus tikai tad, ja organizācija patiešām pieņem šādu izmantošanu
  • Izmantot skaidru atsauci un kanoniskās saites
  • Aizsargāt preču zīmes, izmantojot atsevišķu zīmola paziņojumu

Praktiska ieviešanas kontrolsaraksts

Saturs un licencēšana

  • Identificēt, kam pieder katra lapa, attēls, diagramma, video un citāts.
  • Licencēt tikai materiālu, kura tiesības kontrolē jūsu organizācija.
  • Trešo pušu materiālus atzīmēt atsevišķi.
  • Pievienot redzamu licences paziņojumu.
  • Nodrošināt vēlamo citātu, izmantojot virsrakstu, autoru, avotu un licenci.
  • Saglabāt logotipus, preču zīmes, personas datus un konfidenciālu informāciju ārpus licencētā darbības jomas.

Robots.txt

  • Izveidot publisku robots.txt failu katra resursdatora saknes direktorijā.
  • Atļaut meklēšanas pārmeklētājus atsevišķi no apmācības pārmeklētājiem.
  • Bloķēt administratīvās, kontu, norēķinu, privātās un iekšējās lietojumprogrammu takas.
  • Neuzticēties robots.txt drošībai.
  • Pārbaudīt failu pēc katras lielas vietnes izvietošanas.

Meta tagi

  • Izmantot kanoniskās saites.
  • Pievienot autoru, publicēšanas datumu un modifikācijas datumu.
  • Izmantot noindex lapām, kurām nevajadzētu parādīties meklēšanā.
  • Izmantot nosnippet vai data-nosnippet sensitīviem izvilkumiem, kur tas tiek atbalstīts.
  • Izmantot X-Robots-Tag pārnēsājamiem dokumentu failiem, attēliem un citiem ne-HTML resursiem.
  • Atcerieties, ka pārmeklētājam jāspēj ielādēt lapu, pirms tas var nolasīt tās meta tagus.

Tīkla drošība

  • Reģistrēt lietotāja aģenta virknes, avota adreses, atbildes kodus un pieprasījumu takas.
  • Pārbaudīt uzticamus pārmeklētājus, izmantojot oficiālās adrešu plūsmas vai domēna vārdu sistēmas metodes.
  • Automātiski atsvaidzināt adrešu plūsmas.
  • Apvienot lietotāja aģenta un avota adreses pārbaudes.
  • Ierobežot pārbaudītu pārmeklētāju ātrumu, nevis piešķirt tiem neierobežotu piekļuvi.
  • Izaicināt vai bloķēt pieprasījumus, kas apgalvo, ka ir uzticami pārmeklētāji, bet nespēj veikt pārbaudi.

Mērījumi

Izsekot:

  • Mākslīgā intelekta meklēšanas pakalpojumu apmeklējumi
  • Novirzīšana uz oriģinālo lapu
  • Citēšanas biežums
  • Servera slodze pēc pārmeklētāja
  • Pieprasījumi, kas atgriež 403, 404 vai 429
  • Pārmeklētāja piekļuve neparedzētām takām
  • Vai pašreizējie raksti tiek atrasti pēc publicēšanas

Secinājums

Maksimāla iekļaušana prasa selektīvu atvērtību, nevis vienu vispārēju atļauju.

Izmantojiet robots.txt, lai atdalītu meklēšanu, lietotāja izgūšanu, apmācību un publisko datu kopu pārmeklēšanu. Izmantojiet meta tagus un HTTP galvenes, lai pārvaldītu indeksēšanu un fragmentus. Privātiem datiem izmantojiet autentifikāciju. Pārbaudiet pārmeklētāja interneta protokola adreses, nevis uzticieties tikai lietotāja aģenta nosaukumiem.

Atļaujoša licence, piemēram, CC BY 4.0, var atvieglot plašu atkārtotu izmantošanu, ja jūs to patiešām vēlaties. Skaidra atsauces informācija – virsraksts, autors, avots, licence, kanoniskā lapa un atjaunināšanas datums – var arī atvieglot meklēšanas sistēmām un asistentiem pareizā avota identificēšanu un citēšanu.

Tādējādi spēcīgākā publicēšanas politika ir:

**Atveriet publisko saturu, ko vēlaties atklāt, skaidri licencējiet materiālu, ko vēlaties atkārtoti izmantot, atzīmējiet materiālu, kas jums nepieder, aizsargājiet privāto informāciju servera līmenī un piešķiriet katram pārmeklētājam atsevišķu, pārskatāmu atļauju.

Saistītie raksti

Patīk šis saturs?

Abonējiet mūsu biļetenu, lai saņemtu jaunākos satura mārketinga ieskatus un izaugsmes ceļvežus.

Šis raksts ir paredzēts tikai informatīviem nolūkiem. Saturs un stratēģijas var atšķirties atkarībā no jūsu specifiskajām vajadzībām.
Licencēšana un roboti maksimālai iekļaušanai: Kā uzņemt mākslīgā intelekta pārmeklētājus | AutoPod