AutoPodAutoPod

Licencelés és robotok a maximális bevonásért: Hogyan fogadjuk az AI-alapú webbejárókat

23 perc olvasás
Audió cikk
Licencelés és robotok a maximális bevonásért: Hogyan fogadjuk az AI-alapú webbejárókat
0:000:00
Licencelés és robotok a maximális bevonásért: Hogyan fogadjuk az AI-alapú webbejárókat

Licencelés és robotok a maximális bevonásért: Hogyan fogadjuk a mesterséges intelligencia alapú webbejárókat

Frissítve: 2026. augusztus 25.

A weboldalaknak ma már többféle módja is van a közönség elérésére. Egy oldal megtalálható lehet a Google Keresésen keresztül, összefoglalhatja a ChatGPT, hivatkozhat rá a Perplexity, használható a Claude keresésben, megjelenhet az Apple szolgáltatásokon keresztül, vagy gyűjtheti egy nyilvános webarchívum.

Ezen rendszerek nem mind ugyanazt a bejárót használják, és nem is ugyanazokat a szabályokat követik. Egy weboldal, amely blokkolja a GPTBot-ot, továbbra is megjelenhet a ChatGPT keresésében, ha engedélyezi az OAI-SearchBot-ot. Egy weboldal, amely engedélyezi az Applebot-ot, látható maradhat az Apple Keresésben, miközben blokkolja az Applebot-Extended-et a mesterséges intelligencia modellképzésből. A Google Google-Extended-je egyáltalán nem normális bejáró; ez egy robots.txt vezérlő token.

A legjobb stratégia tehát nem egyszerűen az „engedélyezzük a mesterséges intelligenciát” vagy „blokkoljuk a mesterséges intelligenciát”. Hanem külön engedélyek létrehozása a következők számára:

  1. Keresés és felfedezés
  2. Felhasználó által kért lekérdezés
  3. Modellfejlesztés és képzés
  4. Nyilvános adatkészletek
  5. Érzékeny, privát vagy korlátozott anyagok

Ez a cikk aktuális bejárólistát, robots.txt példákat, meta címke útmutatót, Internet Protokoll (IP) cím ellenőrzési módszereket, Creative Commons licencelési tanácsokat, jogi sablont és kockázat-haszon mátrixot tartalmaz.

A négy vezérlő, amelyet minden kiadónak ismernie kell

1. A robots.txt vezérli a kért bejárást

A robots.txt fájl megmondja a szabálykövető automatizált klienseknek, mely oldalakat kérhetik le. Hasznos a bejáró forgalmának kezeléséhez és a kiadó preferenciáinak kifejezéséhez.

Azonban a robots.txt nem hozzáférés-vezérlő rendszer. A Robots Kizárási Protokoll kimondja, hogy szabályai nem hozzáférési engedélyek. A Google arra is figyelmeztet, hogy egy blokkolt cím továbbra is megjelenhet a keresési eredményekben, ha más oldalak hivatkoznak rá. Használjon jelszavakat, hitelesítést vagy szerveroldali hozzáférés-vezérlést a bizalmas információkhoz. (rfc-editor.org)

2. A meta címkék vezérlik az indexelést és a kivonatokat

A robotok meta címkéi és az X-Robots-Tag válaszfejléc szabályozhatja, hogy egy oldal indexelve legyen-e, vagy hogy egy keresőmotor megjeleníthet-e kivonatot.

Ezek a vezérlők általában csak azután láthatóak, miután a bejáró engedélyt kapott az oldal lekérésére. Ha a robots.txt először blokkolja az oldalt, a bejáró soha nem láthatja a meta címkét. (developers.google.com)

3. A hálózati vezérlők ellenőrzik a bejárót

A user-agent név könnyen másolható. Egy támadó küldhet egy kérést, amely azt állítja, hogy GPTBot, Googlebot vagy PerplexityBot.

Egy erősebb megközelítés kombinálja:

  • Az állítólagos user-agent
  • Közzétett Internet Protokoll cím tartomány
  • Fordított Domain Name System (DNS) ellenőrzés
  • Forward Domain Name System (DNS) ellenőrzés
  • Kérelmek sebességkorlátja és monitorozása

4. Egy licenc újrahasználati jogokat biztosít

A Robots.txt megmondja, mit kell tennie egy bejárónak. Egy licenc azt mondja meg, hogy az emberek vagy szervezetek mit tehetnek jogilag az anyaggal, amikor szerzői jogi engedély szükséges.

Ezek különböző eszközök. Egy megengedő licenc csökkentheti a jogi bizonytalanságot, de nem garantálja, hogy egy bejáró meglátogatja az oldalt, hogy egy modell felhasználja, vagy hogy egy asszisztens hivatkozik rá.

Fontos bejárók listája

A következő lista a szolgáltatók 2026. augusztus 25-én elérhető dokumentációja alapján készült. A user-agent nevek, célok és Internet Protokoll (IP) címtartományok változhatnak, ezért a termelési rendszereknek a szolgáltató aktuális dokumentációját és élő címlistáit kell használniuk.

SzolgáltatóBejáró vagy robots.txt tokenFő célFontos vezérlő
OpenAIOAI-SearchBotOldalak felkutatása és elemzése a ChatGPT kereséshezEngedélyezze, hogy növelje az oldalak megjelenési esélyét a ChatGPT keresési eredményeiben.
OpenAIGPTBotOlyan oldalak gyűjtése, amelyek felhasználhatók az OpenAI generatív mesterséges intelligencia modelljeinek képzéséreKülön engedélyezze vagy tiltsa le a kereséstől.
OpenAIChatGPT-UserOldalak lekérése, miután egy felhasználó kéri a ChatGPT-től vagy egy egyedi GPT-től, hogy hozzáférjen hozzájukFelhasználó által kiváltott, nem pedig automatikus webbejáró, ezért a robots.txt szabályai nem feltétlenül érvényesek.
OpenAIOAI-AdsBotA ChatGPT hirdetési célállomásként megadott weboldalak ellenőrzéseFőként hirdetők számára releváns. Az összegyűjtött tartalom nem használható generatív mesterséges intelligencia alapmodellek képzésére.
GoogleGooglebotFő Google Keresés bejáróSzabályozza a szokásos Google Keresés bejárását.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-NewsKépek, videók és Google HírekEzek külön robots.txt tokenekkel rendelkeznek, és függetlenül vezérelhetők.
GoogleGoogleOtherÁltalános célú Google bejárás különböző termékcsapatok, beleértve a kutatás-fejlesztést isNem egy specifikus Google terméket képvisel.
GoogleGoogle-ExtendedSzabályozza, hogy a Google által bejárt tartalom felhasználható-e a Gemini modell képzésére és bizonyos alapozó rendszerekreEz egy robots.txt vezérlő token, nem egy külön kérés user-agent. Nem befolyásolja a szokásos Google Keresésbe való felvételt.
AnthropicClaudeBotNyilvános webes tartalmak gyűjtése, amelyek hozzájárulhatnak a Claude modellfejlesztéséhezTiltsa le, hogy jelezze, a jövőbeni anyagokat ki kell zárni az Anthropic képzési adatkészleteiből.
AnthropicClaude-SearchBotJavítja a Claude keresési eredményeinek minőségétEngedélyezze a Claude keresési láthatóságához.
AnthropicClaude-UserOldalak lekérése a felhasználó Claude-nak címzett kérésére válaszulElkülönül az automatikus bejárástól.
PerplexityPerplexityBotIndexeli az oldalakat a Perplexity keresési eredményeihezA Perplexity szerint ezt a bejárót nem használják tartalomgyűjtésre mesterséges intelligencia alapmodell képzéséhez.
PerplexityPerplexity-UserOldal lekérése, miután a felhasználó kérteA Perplexity dokumentációja szerint ez a lekérő általában figyelmen kívül hagyja a robots.txt-t, mert a kérést egy felhasználó kezdeményezte.
AppleApplebotTámogatja az Apple Keresést, a Spotlightot, a Sirit, a Safarit és más Apple élményeketEngedélyezze az Apple felfedezéséhez.
AppleApplebot-ExtendedSzabályozza, hogy az Applebot által bejárt tartalom felhasználható-e az Apple alapmodelleinek képzéséreNem maga járja be az oldalakat. Adathasználati vezérlő.
Common CrawlCCBotNyilvános webes adatok gyűjtése a Common Crawl nyílt webes archívumáhozNem asszisztens, de adatkészleteit kutatók és mesterséges intelligencia fejlesztők is felhasználhatják.
MicrosoftBingbotFő Bing keresési bejáróEngedélyezze a Bing felfedezéséhez és keresési láthatóságához.
MicrosoftMicrosoftPreview, BingVideoPreviewOldal- és videóelőnézetek a Microsoft termékeihezEzek a Bingbot-tól külön vezérelhetők.
AmazonAmzn-SearchBotAmazon keresés és tartalomfelfedezésAz Amazon szerint nem járja be a tartalmat generatív mesterséges intelligencia modell képzéséhez.
AmazonAmzn-UserAktuális információk lekérése felhasználói műveletekre válaszul, beleértve az Alexa kéréseket isFelhasználó által kiváltott és elkülönül az automatikus keresési bejárástól.

Az OpenAI külön vezérlőkként dokumentálja keresési, képzési, hirdetési és felhasználó által kiváltott bejáróit. Dokumentációja kifejezetten javasolja az OAI-SearchBot engedélyezését a ChatGPT kereséshez, miközben a GPTBot külön használatát a képzési preferenciákhoz. (developers.openai.com)

A Google hasonlóan elkülöníti a Googlebot-ot, a GoogleOther-t és a Google-Extended-et. A Google-Extended-nek nincs saját HTTP kérés user-agent-je, és blokkolása nem távolítja el az oldalt a Google Keresésből. (developers.google.com)

Az Anthropic külön szerepeket dokumentál a ClaudeBot, Claude-SearchBot és Claude-User számára. Az Anthropic azt is kijelenti, hogy botjai követik a robots.txt-t, és támogatják a nem szabványos Crawl-delay direktívát. (support.anthropic.com)

A Perplexity különbséget tesz az automatikus keresési bejárás és a felhasználó által kért lekérés között. Aktuális dokumentációja szerint a PerplexityBot tiszteletben tartja a robots.txt-t, míg a Perplexity-User általában nem, mert egy felhasználói kérésre válaszol. (docs.perplexity.ai)

Az Apple aktuális dokumentációja ugyanazt a keresés-képzés megkülönböztetést teszi: az Applebot támogatja a felfedezést, míg az Applebot-Extended lehetővé teszi a kiadók számára, hogy ellenőrizzék a képzési felhasználást anélkül, hogy eltávolítanák az oldalakat az Apple Keresésből. (support.apple.com)

Ajánlott robots.txt konfigurációk

Helyezze a robots.txt fájlt minden gazdagép gyökerébe, például:

text https://www.example.org/robots.txt

A szabályok arra a specifikus gazdagépre, protokollra és portra vonatkoznak, ahol a fájl elérhető. Egy külön aldoménnek saját fájlra lehet szüksége. (developers.google.com)

1. konfiguráció: Maximális bevonás

Használja ezt, ha a nyilvános szerkesztői tartalom szabálykövető bejárók által megtalálható, összefoglalható, idézhető, indexelhető és gyűjthető.

text

Public pages are available to compliant crawlers.

User-agent: * Allow: /

Keep private, transactional, and administrative paths out.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Ez engedélyezi a megnevezett bejárókat, beleértve az OpenAI-t, a Google-t, az Anthropic-ot, a Perplexity-t, az Apple-t, a Common Crawl-t, a Microsoftot és az Amazont, hacsak egy másik specifikus szabály nem blokkolja őket.

Ne helyezzen el egy általános szabályt, például User-agent: * Disallow: / ezen konfiguráció alá. Egy későbbi vagy specifikusabb csoport megváltoztathatja, hogyan értelmezi a bejáró a fájlt.

2. konfiguráció: Engedélyezze a keresést, de blokkolja a modellfejlesztő bejárókat

Ez gyakran a legjobb kompromisszum azoknak a kiadóknak, akik idézeteket és keresési forgalmat szeretnének, de nem akarnak engedélyt jelezni a modellfejlesztési célú gyűjtéshez.

text

Block OpenAI model-development crawling.

User-agent: GPTBot Disallow: /

Block Anthropic model-development crawling.

User-agent: ClaudeBot Disallow: /

Block Google model-training and related grounding use.

User-agent: Google-Extended Disallow: /

Block Apple foundation-model training use.

User-agent: Applebot-Extended Disallow: /

Optional: block Common Crawl dataset collection.

User-agent: CCBot

Disallow: /

Allow ordinary search and retrieval crawling, except for sensitive paths.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Ez a konfiguráció az OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot és Applebot bejárókat a wildcard csoport alá vonja. Ezenkívül elkülöníti a keresési és képzési engedélyeket.

Az Apple esetében az Applebot-Extended blokkolása, miközben az Applebot engedélyezése, megőrzi a felfedezhetőséget az Apple szolgáltatásokon keresztül. A Google esetében a Google-Extended blokkolása nem blokkolja a szokásos Google Keresést. (developers.google.com)

3. konfiguráció: Kifejezetten engedélyezze a kiválasztott kereső bejárókat

Ha egy meglévő robots.txt fájl blokkolja az összes bejárót, adjon hozzá külön csoportokat azoknak a kereső bejáróknak, amelyeket üdvözölni szeretne.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Keep all other crawlers out.

User-agent: * Disallow: /

Specifikus csoportok használatakor ismételje meg az érzékeny útvonalakra vonatkozó szabályokat minden csoporton belül. Egyes bejárók a legspecifikusabb illeszkedő csoportot használják ahelyett, hogy kombinálnák azt a wildcard csoporttal. A Bing közvetlenül dokumentálja ezt a viselkedést, a Google pedig külön útmutatót ad a bejáró-specifikus csoportokhoz. (bing.com)

Fontos robots.txt korlátozások

  • Egy bejáró figyelmen kívül hagyhatja a robots.txt-t.
  • Egy rosszindulatú bejáró megbízható bejárónak adhatja ki magát.
  • Egy blokkolt oldal továbbra is ismert lehet címe vagy webcíme alapján.
  • A Robots.txt nem védi a jelszavakat, privát fájlokat, ügyfélrekordokat vagy bizalmas alkalmazásprogramozási felületeket.
  • A Crawl-delay direktíva nem része a Robots Kizárási Protokoll magjának, és nem minden bejáró támogatja. Az Anthropic és a Bing dokumentálja a támogatást, míg az Apple szerint az Applebot nem követi a crawl-delay-t. (rfc-editor.org)

Meta címkék és HTTP fejlécek

Nyilvános oldal példa

Egy nyilvános cikkhez használjon világos címet, szerzőt, kanonikus webcímet, közzétételi dátumot és módosítási dátumot.

html

A max-snippet direktíva elsősorban a Google számára van dokumentálva. Ne feltételezze, hogy minden mesterséges intelligencia alapú bejáró támogat minden meta direktívát.

Privát vagy érzékeny oldal példa

html

Ezt olyan oldalakhoz használja, amelyek nem jelenhetnek meg a keresési eredményekben. Az oldalnak elég hosszú ideig bejárhatónak kell maradnia ahhoz, hogy a bejáró lássa a direktívát. Ha az oldalnak valóban privátnak kell maradnia, használjon inkább hitelesítést vagy jelszóvédelmet. (developers.google.com)

Csak az érzékeny részek elrejtése a keresési kivonatokból

A Google támogatja a data-nosnippet direktívát egy HTML oldal specifikus részeinél:

html

This paragraph may be shown in a search result.

Personal telephone numbers, private email addresses, or internal notes go here.

Ez hasznos kapcsolattartási adatok, belső jegyzetek vagy felhasználó által generált információk esetén. Nem univerzális utasítás minden mesterséges intelligencia rendszer számára. (developers.google.com)

Használja az X-Robots-Tag fejlécet fájlokhoz

A meta címkék nem helyezhetők el hordozható dokumentumfájlban, kép- vagy videófájlban. Ehelyett használjon HTTP válaszfejlécet:

text X-Robots-Tag: noindex, nosnippet

Olyan oldalhoz, amelynek kereshetőnek kell maradnia, de nem szolgáltathat szöveget kivonatokhoz vagy mesterséges intelligencia válaszokhoz, használja:

text X-Robots-Tag: nosnippet

A Google dokumentálja az X-Robots-Tag-et nem HTML erőforrásokhoz, és az Apple is támogatja az Applebot számára. (developers.google.com)

Apple-specifikus vezérlők

Az Apple támogatja:

html

Az Apple szerint a nosnippet megakadályozza, hogy az oldal további kontextusként és aktuális tartalomként felhasználható legyen, amikor az Apple modelljei kimenetet generálnak. Az oldal továbbra is felfedezhető maradhat az Apple Keresés, Spotlight, Siri és Safari segítségével. (support.apple.com)

Fizetős oldalak esetén az Apple strukturált adatokat is támogat a következőkkel:

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Az Apple szerint az ilyen oldalak továbbra is megjelenhetnek a keresési eredményekben, de nem használhatók további kontextusként mesterséges intelligencia válaszokhoz. (support.apple.com)

Hogyan ellenőrizzük a bejárók Internet Protokoll (IP) címeit

Miért nem elég a user-agent illesztés

Egy ilyen szabály gyenge:

text if User-Agent contains "GPTBot": allow

Ezt a szöveget bárki elküldheti. Egy jobb szabály a következő:

text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block

Ne bízzon az X-Forwarded-For fejlécben, hacsak nem olyan proxyból vagy tartalomkézbesítő hálózatból származik, amelyet az Ön szervezete ellenőriz.

Szolgáltatói ellenőrzési módszerek

SzolgáltatóAjánlott ellenőrzési módszer
OpenAIHasználja az OpenAI bejáró dokumentációjában közzétett élő Internet Protokoll címcsatornákat az OAI-SearchBot, GPTBot és OAI-AdsBot számára. Frissítse őket automatikusan, ahelyett, hogy rögzített tartományokat másolna be egy tűzfalba.
GoogleHasználja a Google közzétett bejáró tartományait, vagy végezzen fordított és forward Domain Name System (DNS) ellenőrzéseket. Egy valódi Google bejárónak jóváhagyott Google gazdagépnévre kell feloldania, és vissza kell oldania az eredeti címre.
AnthropicHasználja az aktuálisan közzétett bejáró címcsatornát másodlagos hálózati ellenőrzésként. Az Anthropic elsődleges leiratkozási módszere továbbra is a robots.txt.
PerplexityKombinálja a user-agentet az aktuális PerplexityBot vagy Perplexity-User címcsatornával. A Perplexity kifejezetten javasolja mindkét feltétel kombinálását egy Web Alkalmazás Tűzfal (WAF) szabályban.
AppleVégezzen fordított Domain Name System (DNS) ellenőrzést az applebot.apple.com alatt, majd végezzen forward lekérdezést. Az Apple aktuális címtartományokat is közzétesz egy JSON feedben.
Common CrawlVégezzen fordított Domain Name System (DNS) ellenőrzést a crawl.commoncrawl.org alatt és az aktuális CCBot címcsatornával. A Common Crawl megjegyzi, hogy az fordított ellenőrzés még nem érhető el néhány IPv6 forgalom esetén.
MicrosoftHasználja a hivatalos Verify Bingbot eszközt vagy a Microsoft dokumentált fordított és forward lekérdezési módszereit.
AmazonHasználja az Amazon közzétett bejáró címlistáit, és illessze azokat a megfelelő Amazon user-agenthez.

A Google, Apple, Common Crawl, OpenAI, Anthropic és Perplexity mind közzétesz szolgáltató-specifikus módszereket vagy címcsatornákat. Ezek a listák változhatnak, ezért egy ütemezett frissítési folyamat biztonságosabb, mint egy állandó, manuálisan másolt lista. (developers.google.com)

Egy egyszerű tűzfal kialakítása így nézhet ki:

text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match

rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers

Ne alkalmazzon széles körű engedélyezési szabályt egy teljes felhőszolgáltatóra. Egy jogszerű bejáró használhat felhőinfrastruktúrát, de a felhőszolgáltatótól származó forgalom nagy része nem feltétlenül a bejáró.

Hogyan befolyásolja a nyílt licencelés a bevonást

CC BY 4.0 közérthetően

A Creative Commons Nevezd meg! 4.0 Nemzetközi licenc, gyakran CC BY 4.0 néven emlegetve, lehetővé teszi az emberek számára, hogy:

  • Másolják és terjesszék a művet
  • Adaptálják, fordítsák, remixeljék és építsenek rá
  • Kereskedelmi célra használják

A fő feltételek a következők:

  • Megfelelően tüntessék fel a forrást
  • Hivatkozzanak a licencre
  • Jelezzék, ha változtatásokat eszközöltek
  • Ne sugallják, hogy az eredeti alkotó támogatja az újrahasználatot
  • Ne tegyenek jogi vagy technikai korlátozásokat, amelyek megakadályozzák a licenc által engedélyezett felhasználásokat

A Creative Commons arra is figyelmeztet, hogy a licenc nem feltétlenül terjed ki a magánéleti jogokra, a nyilvánossági jogokra, a személyiségi jogokra, a védjegyjogokra, a szabadalmi jogokra vagy harmadik fél anyagainak felhasználására. (creativecommons.org)

Egy licenc önmagában nem bejáró meghívó

A „CC BY 4.0” elhelyezése egy oldalon nem garantálja, hogy egy szervezet bejárja azt. Egy bejárót továbbra is blokkolhat:

  • robots.txt
  • Tartalomkézbesítő hálózat (CDN)
  • Web Alkalmazás Tűzfal (WAF)
  • Sebességkorlátozás
  • JavaScript kihívás
  • Bejelentkezési fal
  • Gyenge szerverválasz
  • Hozzáférhetetlen sitemap

Ezzel szemben, egy bejáró engedélyezése nem biztosít automatikusan minden szerzői jogi engedélyt, amely minden későbbi felhasználáshoz szükséges. A robots.txt-t és a licencelést együtt kell megtervezni.

Miért támogathatja a CC BY a szélesebb körű bevonást

Egy világos, megengedő licenc megkönnyítheti a kiadó politikájának megértését az adatkezelő csapatok, keresőrendszerek és asszisztens operátorok számára. Csökkentheti a bizonytalanságot a másolással, adaptációval, kereskedelmi felhasználással, fordítással és újraterjesztéssel kapcsolatban, amikor ezek a tevékenységek szerzői jogi engedélyt igényelnek.

Azonban a Creative Commons magyarázata szerint a mesterséges intelligencia képzése jogilag összetett. Egy korlátozó licenc nem mindig hatékony módja a képzés megakadályozásának, mert egyes képzési felhasználásokat megengedhetnek a szerzői jogi kivételek vagy korlátozások. A Creative Commons azt is megjegyzi, hogy a licencfeltételeket nehéz lehet alkalmazni a gépi képzésre és a modellkimenetekre. (creativecommons.org)

A gyakorlati tanulság a következő:

Használja a CC BY licencet, ha őszintén széles körű, jogszerű újrahasználatot szeretne. Ne használjon korlátozó Creative Commons licencet garantált mesterséges intelligencia képzési leiratkozásként.

A forrásmegjelölés javítja a forrás egyértelműségét

A Creative Commons a TASL módszert javasolja:

  • Cím
  • Szerző
  • Forrás
  • Licenc

Például:

„Licencelés és robotok a maximális bevonásért,” Example Publishing, https://www.example.org/articles/ai-crawlers, Creative Commons Nevezd meg! 4.0 Nemzetközi licenc alatt. Változtatások: frissített bejárólista.

A világos forrásmegjelölés nem kényszeríti minden asszisztenst egy oldal idézésére. Azonban megkönnyíti a helyes hivatkozást, amikor egy rendszer kinyeri az oldal címét, szerzőjét, forrását és licencinformációit. (wiki.creativecommons.org)

Strukturált cikk információk hozzáadása

Használja együtt a látható információkat és a strukturált adatokat:

html

A Google javasolja a világos szerzői információkat, szerzői oldalakat, közzétételi dátumokat, módosítási dátumokat és stabil kanonikus oldalakat. Ezek a jelek segíthetik a keresőrendszereket abban, hogy megértsék, ki hozta létre az anyagot, és melyik változat a hiteles. Nem garantálják a rangsorolást, a bevonást vagy az idézést. (developers.google.com)

Jogi sablon egy nyílt, idézésbarát webhelyhez

Az alábbiak mintaszövegek, nem jogi tanácsok. Kérje jogász segítségét a saját joghatósága, tulajdonosi struktúrája, adatvédelmi kötelezettségei és harmadik féltől származó tartalma szerinti adaptációhoz.

CC BY 4.0 licencnyilatkozat

text

Content license

Except where otherwise stated, the original text and original editorial materials on this page are licensed under the Creative Commons Attribution 4.0 International license:

https://creativecommons.org/licenses/by/4.0/

This permission allows copying, redistribution, adaptation, translation, commercial use, machine-readable processing, search indexing, retrieval, summarization, and use in artificial intelligence systems, provided that the license terms are followed.

Preferred attribution:

“[Page title],” by [author or organization], [canonical page address], published or updated [date], licensed under Creative Commons Attribution 4.0 International. Changes made: [describe changes, or state ‘none’].

Please preserve the author, publisher, source, license, and modification information whenever reasonably possible. This preferred attribution guide does not add restrictions to the Creative Commons license and does not replace the license text.

A „beleértve a mesterséges intelligencia rendszereket” kifejezés tisztázza a kiadó szándékát. Nem használható arra, hogy azt a látszatot keltse, mintha a kiadó birtokolná a más által létrehozott anyagok jogait.

Márka-, adatvédelmi és harmadik fél jogaira vonatkozó közlemény

text

Brand, privacy, and third-party rights

The license above covers only the original materials identified as licensed. It does not grant permission to use:

  • Trademarks, service marks, logos, or trade dress
  • Names, images, or likenesses of people
  • Private, confidential, account, health, financial, or security information
  • User submissions unless they are separately identified as licensed
  • Photographs, illustrations, maps, video, music, quotations, or other third-party materials
  • Content identified as “all rights reserved” or subject to a separate license

Use of the Example Publishing name, logos, and marks must not suggest sponsorship, approval, partnership, or endorsement. Please link to the original page and clearly distinguish quotation, paraphrase, summary, and generated material.

Ez a szövegezés azért fontos, mert a Creative Commons licencek nem biztosítanak automatikusan minden jogtípust, amely egy oldalhoz kapcsolódik. (creativecommons.org)

Keresési és asszisztens idézési útmutató

text

Search and assistant citation guidance

We welcome compliant search indexing, user-requested retrieval, citation, and summarization of the licensed material on this site.

When citing this site, please use the page title, author or publisher, canonical page address, publication or update date, and a direct link to the source. Please identify the source as one input among any sources used, distinguish generated analysis from quoted material, and do not state or imply that Example Publishing endorses a generated answer, product, person, or service.

This guidance is intended to improve accuracy and attribution. It does not grant rights beyond the applicable content license and does not license trademarks, personal information, confidential information, or third-party material.

Ha keresési láthatóságot szeretne, de nem akar széles körű képzési licencet adni

text

Search access and copyright

Our public pages may be accessed by compliant search and retrieval crawlers identified in our robots.txt file. This permission is intended to support discovery, search results, user-requested retrieval, and citation.

Except where a separate license is shown, the original content remains all rights reserved. Access to a public page does not grant a separate license for model-development, training, redistribution, commercial reuse, or creation of derivative works beyond rights provided by applicable law.

Please cite the canonical page address and publisher when referring to this material. Nothing on this site grants permission to use trademarks, logos, personal information, confidential information, or third-party content.

Ne helyezze a CC BY nyilatkozatot és az összes jog fenntartva nyilatkozatot ugyanarra az anyagra. Világosan azonosítsa, melyik licenc melyik tartalomra vonatkozik.

Kockázat-haszon mátrix nyílt licenceléshez

A szerzői jogi törvények és a mesterséges intelligencia képzési szabályai országonként eltérőek és még rendezetlenek. Az Egyesült Államok Szerzői Jogi Hivatala továbbra is vizsgálja ezeket a kérdéseket, míg a Creative Commons a mesterséges intelligencia képzését tényalapú és jogilag komplexnek írja le. (copyright.gov)

MegközelítésBevonási potenciálFő előnyökFő kockázatokLegjobb illeszkedés
CC BY 4.0Nagyon magasSzéles körű másolás, adaptáció, kereskedelmi felhasználás, fordítás, indexelés és modellhez kapcsolódó újrahasználat, amikor szerzői jogi engedély szükségesKereskedelmi versenytársak újrahasználhatják vagy adaptálhatják a tartalmat; a forrásmegjelölés tökéletlen lehet; a licenc nem tudja ellenőrizni a magánéleti, védjegy- vagy harmadik fél jogaitKiadók, akik a legszélesebb jogszerű újrahasználatot és erős forrásmegjelölést szeretnék
CC BY-SA 4.0Magas, de bonyolultabbÖsztönzi a nyílt megosztási ciklust, és megköveteli, hogy az adaptációk kompatibilis feltételek mellett maradjanakA ShareAlike szabályokat nehéz lehet alkalmazni az adatkészletekre, a modellképzésre és a nyilvános kimenetekre; egyes szervezetek a bizonytalanság miatt elkerülhetik az anyagotNyílt oktatási és közérdekű projektek, amelyek azt szeretnék, hogy a downstream adaptációk nyíltak maradjanak
CC BY-NC 4.0Közepes vagy alacsonyKorlátozza a primarily kereskedelmi előnyre vagy pénzbeli kompenzációra szánt felhasználásokatA „nem kereskedelmi” nehezen értelmezhető; kizárhatja a kereskedelmi keresési, modell- és asszisztens felhasználásokat; nem garantált képzési leiratkozásNonprofit, oktatási vagy közösségi célra szánt anyag
CC BY-ND 4.0KözepesLehetővé teszi a megosztást, miközben korlátozza az adaptációkatA fordítás, átalakítás és egyes asszisztens felhasználási esetek jogilag bizonytalanná válhatnak; kevésbé vonzó az összefoglaló vagy remixelő rendszerek számáraHivatalos közlemények vagy olyan művek, amelyeknek változatlannak kell maradniuk
CC0 vagy közkincs felajánlásNagyon magasEgyszerűsíti az újrahasználatot, és eltávolítja a legtöbb szerzői jogi feltételt, ahol jogilag hatékonyNincs kötelező forrásmegjelölés; gyenge ellenőrzés a márkaprezentáció felett; a magánéleti, védjegy- és nyilvánossági jogok különállók maradnakTények, adatkészletek, referenciaanyagok vagy korlátozás nélküli újrahasználatra szánt művek
Minden jog fenntartva plusz nyílt keresési bejárásMagas a kereséshez, alacsonyabb a képzéshezMegőrizheti a keresési és idézési láthatóságot anélkül, hogy széles körű újrahasználati licencet adnaNagyobb jogi bizonytalanság a modellfejlesztők számára; csökkentheti a képzési adatkészletekbe és a kereskedelmi újrahasználati rendszerekbe való bevonástKiadók, akik felfedezhetőséget és idézeteket szeretnének, de inkább külön tárgyalnak szélesebb licencekről

Sok szervezet számára a legkiegyensúlyozottabb stratégia a következő:

  • CC BY 4.0 az eredeti nyilvános szerkesztőségi szöveghez
  • Külön címkék a harmadik féltől származó anyagokhoz
  • Nincs nyilvános személyes vagy bizalmas információ
  • Engedélyezze a keresési és lekérdezési bejárókat
  • Csak akkor engedélyezze a modellfejlesztési bejárókat, ha a szervezet valóban elfogadja ezt a felhasználást
  • Használjon világos forrásmegjelölést és kanonikus linkeket
  • Védje a védjegyeket külön márkajelzéssel

Egy gyakorlati megvalósítási ellenőrzőlista

Tartalom és licencelés

  • Azonosítsa, ki birtokolja az egyes oldalakat, képeket, diagramokat, videókat és idézeteket.
  • Csak olyan anyagokat licenceljen, amelyekre szervezete rendelkezik a jogokkal.
  • A harmadik féltől származó anyagokat külön jelölje meg.
  • Adjon hozzá egy látható licencnyilatkozatot.
  • Adjon meg egy preferált hivatkozást, amely tartalmazza a címet, szerzőt, forrást és licencet.
  • Tartsa a logókat, védjegyeket, személyes adatokat és bizalmas információkat a licencelt hatókörön kívül.

Robots.txt

  • Hozzon létre egy nyilvános robots.txt fájlt minden gazdagép gyökerében.
  • Engedélyezze a kereső bejárókat külön a képző bejáróktól.
  • Blokkolja az adminisztrációs, fiók-, fizetési, privát és belső alkalmazás útvonalakat.
  • Ne hagyatkozzon a robots.txt-re a biztonság terén.
  • Tesztelje a fájlt minden nagyobb weboldal telepítés után.

Meta címkék

  • Használjon kanonikus linkeket.
  • Adjon hozzá szerzőt, közzétételi dátumot és módosítási dátumot.
  • Használja a noindex direktívát olyan oldalakhoz, amelyek nem jelenhetnek meg a keresésben.
  • Használja a nosnippet vagy data-nosnippet direktívát érzékeny kivonatokhoz, ahol támogatott.
  • Használja az X-Robots-Tag-et hordozható dokumentumfájlokhoz, képekhez és egyéb nem HTML erőforrásokhoz.
  • Ne feledje, hogy egy bejárónak képesnek kell lennie lekérni az oldalt, mielőtt elolvashatja a meta címkéit.

Hálózati biztonság

  • Naplózza a user-agent stringeket, forráscímeket, válaszkódokat és kérés útvonalakat.
  • Ellenőrizze a megbízható bejárókat hivatalos címcsatornák vagy Domain Name System (DNS) módszerek használatával.
  • Frissítse automatikusan a címcsatornákat.
  • Kombinálja a user-agent és forráscím ellenőrzéseket.
  • Korlátozza a hitelesített bejárók sebességét ahelyett, hogy korlátlan hozzáférést biztosítana nekik.
  • Hívja ki vagy blokkolja azokat a kéréseket, amelyek megbízható bejáróknak vallják magukat, de nem felelnek meg az ellenőrzésnek.

Mérés

Kövesse nyomon:

  • A mesterséges intelligencia keresési szolgáltatásokból érkező látogatások
  • Az eredeti oldalra mutató hivatkozások
  • Idézési gyakoriság
  • Szerverterhelés bejárónként
  • 403, 404 vagy 429 választ adó kérések
  • A bejárók hozzáférése nem szándékolt útvonalakhoz
  • Hogy az aktuális cikkek megtalálhatóak-e a közzététel után

Összefoglalás

A maximális bevonás szelektív nyitottságot igényel, nem pedig egyetlen általános engedélyt.

Használja a robots.txt-t a keresés, a felhasználói lekérdezés, a képzés és a nyilvános adatkészletek bejárásának elkülönítésére. Használjon meta címkéket és HTTP fejléceket az indexelés és a kivonatok kezelésére. Használjon hitelesítést minden privát tartalomhoz. Ellenőrizze a bejárók Internet Protokoll címeit, ahelyett, hogy csak a user-agent nevekre hagyatkozna.

Egy megengedő licenc, mint például a CC BY 4.0, megkönnyítheti a széles körű újrahasználatot, ha valóban ezt szeretné. A világos forrásmegjelölési információk – cím, szerző, forrás, licenc, kanonikus oldal és frissítési dátum – szintén megkönnyíthetik a keresőrendszerek és asszisztensek számára a helyes forrás azonosítását és idézését.

A legerősebb kiadói politika tehát a következő:

**Tegye hozzáférhetővé a felfedezni kívánt nyilvános tartalmat, egyértelműen licencelje az újrahasználni kívánt anyagot, jelölje meg azt az anyagot, amelynek nem Ön a tulajdonosa, védje a privát információkat szerver szinten, és adjon minden bejárónak külön, felülvizsgálható engedélyt.

Kapcsolódó cikkek

Tetszik ez a tartalom?

Iratkozzon fel hírlevelünkre a legfrissebb tartalommarketing-betekintésekért és növekedési útmutatókért.

Ez a cikk csak tájékoztató jellegű. A tartalmak és stratégiák az Ön egyedi igényeitől függően változhatnak.
Licencelés és robotok a maximális bevonásért: Hogyan fogadjuk az AI-alapú webbejárókat | AutoPod