Licencelés és robotok a maximális bevonásért: Hogyan fogadjuk a mesterséges intelligencia alapú webbejárókat
Frissítve: 2026. augusztus 25.
A weboldalaknak ma már többféle módja is van a közönség elérésére. Egy oldal megtalálható lehet a Google Keresésen keresztül, összefoglalhatja a ChatGPT, hivatkozhat rá a Perplexity, használható a Claude keresésben, megjelenhet az Apple szolgáltatásokon keresztül, vagy gyűjtheti egy nyilvános webarchívum.
Ezen rendszerek nem mind ugyanazt a bejárót használják, és nem is ugyanazokat a szabályokat követik. Egy weboldal, amely blokkolja a GPTBot-ot, továbbra is megjelenhet a ChatGPT keresésében, ha engedélyezi az OAI-SearchBot-ot. Egy weboldal, amely engedélyezi az Applebot-ot, látható maradhat az Apple Keresésben, miközben blokkolja az Applebot-Extended-et a mesterséges intelligencia modellképzésből. A Google Google-Extended-je egyáltalán nem normális bejáró; ez egy robots.txt vezérlő token.
A legjobb stratégia tehát nem egyszerűen az „engedélyezzük a mesterséges intelligenciát” vagy „blokkoljuk a mesterséges intelligenciát”. Hanem külön engedélyek létrehozása a következők számára:
- Keresés és felfedezés
- Felhasználó által kért lekérdezés
- Modellfejlesztés és képzés
- Nyilvános adatkészletek
- Érzékeny, privát vagy korlátozott anyagok
Ez a cikk aktuális bejárólistát, robots.txt példákat, meta címke útmutatót, Internet Protokoll (IP) cím ellenőrzési módszereket, Creative Commons licencelési tanácsokat, jogi sablont és kockázat-haszon mátrixot tartalmaz.
A négy vezérlő, amelyet minden kiadónak ismernie kell
1. A robots.txt vezérli a kért bejárást
A robots.txt fájl megmondja a szabálykövető automatizált klienseknek, mely oldalakat kérhetik le. Hasznos a bejáró forgalmának kezeléséhez és a kiadó preferenciáinak kifejezéséhez.
Azonban a robots.txt nem hozzáférés-vezérlő rendszer. A Robots Kizárási Protokoll kimondja, hogy szabályai nem hozzáférési engedélyek. A Google arra is figyelmeztet, hogy egy blokkolt cím továbbra is megjelenhet a keresési eredményekben, ha más oldalak hivatkoznak rá. Használjon jelszavakat, hitelesítést vagy szerveroldali hozzáférés-vezérlést a bizalmas információkhoz. (rfc-editor.org)
2. A meta címkék vezérlik az indexelést és a kivonatokat
A robotok meta címkéi és az X-Robots-Tag válaszfejléc szabályozhatja, hogy egy oldal indexelve legyen-e, vagy hogy egy keresőmotor megjeleníthet-e kivonatot.
Ezek a vezérlők általában csak azután láthatóak, miután a bejáró engedélyt kapott az oldal lekérésére. Ha a robots.txt először blokkolja az oldalt, a bejáró soha nem láthatja a meta címkét. (developers.google.com)
3. A hálózati vezérlők ellenőrzik a bejárót
A user-agent név könnyen másolható. Egy támadó küldhet egy kérést, amely azt állítja, hogy GPTBot, Googlebot vagy PerplexityBot.
Egy erősebb megközelítés kombinálja:
- Az állítólagos user-agent
- Közzétett Internet Protokoll cím tartomány
- Fordított Domain Name System (DNS) ellenőrzés
- Forward Domain Name System (DNS) ellenőrzés
- Kérelmek sebességkorlátja és monitorozása
4. Egy licenc újrahasználati jogokat biztosít
A Robots.txt megmondja, mit kell tennie egy bejárónak. Egy licenc azt mondja meg, hogy az emberek vagy szervezetek mit tehetnek jogilag az anyaggal, amikor szerzői jogi engedély szükséges.
Ezek különböző eszközök. Egy megengedő licenc csökkentheti a jogi bizonytalanságot, de nem garantálja, hogy egy bejáró meglátogatja az oldalt, hogy egy modell felhasználja, vagy hogy egy asszisztens hivatkozik rá.
Fontos bejárók listája
A következő lista a szolgáltatók 2026. augusztus 25-én elérhető dokumentációja alapján készült. A user-agent nevek, célok és Internet Protokoll (IP) címtartományok változhatnak, ezért a termelési rendszereknek a szolgáltató aktuális dokumentációját és élő címlistáit kell használniuk.
| Szolgáltató | Bejáró vagy robots.txt token | Fő cél | Fontos vezérlő |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Oldalak felkutatása és elemzése a ChatGPT kereséshez | Engedélyezze, hogy növelje az oldalak megjelenési esélyét a ChatGPT keresési eredményeiben. |
| OpenAI | GPTBot | Olyan oldalak gyűjtése, amelyek felhasználhatók az OpenAI generatív mesterséges intelligencia modelljeinek képzésére | Külön engedélyezze vagy tiltsa le a kereséstől. |
| OpenAI | ChatGPT-User | Oldalak lekérése, miután egy felhasználó kéri a ChatGPT-től vagy egy egyedi GPT-től, hogy hozzáférjen hozzájuk | Felhasználó által kiváltott, nem pedig automatikus webbejáró, ezért a robots.txt szabályai nem feltétlenül érvényesek. |
| OpenAI | OAI-AdsBot | A ChatGPT hirdetési célállomásként megadott weboldalak ellenőrzése | Főként hirdetők számára releváns. Az összegyűjtött tartalom nem használható generatív mesterséges intelligencia alapmodellek képzésére. |
Googlebot | Fő Google Keresés bejáró | Szabályozza a szokásos Google Keresés bejárását. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Képek, videók és Google Hírek | Ezek külön robots.txt tokenekkel rendelkeznek, és függetlenül vezérelhetők. | |
GoogleOther | Általános célú Google bejárás különböző termékcsapatok, beleértve a kutatás-fejlesztést is | Nem egy specifikus Google terméket képvisel. | |
Google-Extended | Szabályozza, hogy a Google által bejárt tartalom felhasználható-e a Gemini modell képzésére és bizonyos alapozó rendszerekre | Ez egy robots.txt vezérlő token, nem egy külön kérés user-agent. Nem befolyásolja a szokásos Google Keresésbe való felvételt. | |
| Anthropic | ClaudeBot | Nyilvános webes tartalmak gyűjtése, amelyek hozzájárulhatnak a Claude modellfejlesztéséhez | Tiltsa le, hogy jelezze, a jövőbeni anyagokat ki kell zárni az Anthropic képzési adatkészleteiből. |
| Anthropic | Claude-SearchBot | Javítja a Claude keresési eredményeinek minőségét | Engedélyezze a Claude keresési láthatóságához. |
| Anthropic | Claude-User | Oldalak lekérése a felhasználó Claude-nak címzett kérésére válaszul | Elkülönül az automatikus bejárástól. |
| Perplexity | PerplexityBot | Indexeli az oldalakat a Perplexity keresési eredményeihez | A Perplexity szerint ezt a bejárót nem használják tartalomgyűjtésre mesterséges intelligencia alapmodell képzéséhez. |
| Perplexity | Perplexity-User | Oldal lekérése, miután a felhasználó kérte | A Perplexity dokumentációja szerint ez a lekérő általában figyelmen kívül hagyja a robots.txt-t, mert a kérést egy felhasználó kezdeményezte. |
| Apple | Applebot | Támogatja az Apple Keresést, a Spotlightot, a Sirit, a Safarit és más Apple élményeket | Engedélyezze az Apple felfedezéséhez. |
| Apple | Applebot-Extended | Szabályozza, hogy az Applebot által bejárt tartalom felhasználható-e az Apple alapmodelleinek képzésére | Nem maga járja be az oldalakat. Adathasználati vezérlő. |
| Common Crawl | CCBot | Nyilvános webes adatok gyűjtése a Common Crawl nyílt webes archívumához | Nem asszisztens, de adatkészleteit kutatók és mesterséges intelligencia fejlesztők is felhasználhatják. |
| Microsoft | Bingbot | Fő Bing keresési bejáró | Engedélyezze a Bing felfedezéséhez és keresési láthatóságához. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Oldal- és videóelőnézetek a Microsoft termékeihez | Ezek a Bingbot-tól külön vezérelhetők. |
| Amazon | Amzn-SearchBot | Amazon keresés és tartalomfelfedezés | Az Amazon szerint nem járja be a tartalmat generatív mesterséges intelligencia modell képzéséhez. |
| Amazon | Amzn-User | Aktuális információk lekérése felhasználói műveletekre válaszul, beleértve az Alexa kéréseket is | Felhasználó által kiváltott és elkülönül az automatikus keresési bejárástól. |
Az OpenAI külön vezérlőkként dokumentálja keresési, képzési, hirdetési és felhasználó által kiváltott bejáróit. Dokumentációja kifejezetten javasolja az OAI-SearchBot engedélyezését a ChatGPT kereséshez, miközben a GPTBot külön használatát a képzési preferenciákhoz. (developers.openai.com)
A Google hasonlóan elkülöníti a Googlebot-ot, a GoogleOther-t és a Google-Extended-et. A Google-Extended-nek nincs saját HTTP kérés user-agent-je, és blokkolása nem távolítja el az oldalt a Google Keresésből. (developers.google.com)
Az Anthropic külön szerepeket dokumentál a ClaudeBot, Claude-SearchBot és Claude-User számára. Az Anthropic azt is kijelenti, hogy botjai követik a robots.txt-t, és támogatják a nem szabványos Crawl-delay direktívát. (support.anthropic.com)
A Perplexity különbséget tesz az automatikus keresési bejárás és a felhasználó által kért lekérés között. Aktuális dokumentációja szerint a PerplexityBot tiszteletben tartja a robots.txt-t, míg a Perplexity-User általában nem, mert egy felhasználói kérésre válaszol. (docs.perplexity.ai)
Az Apple aktuális dokumentációja ugyanazt a keresés-képzés megkülönböztetést teszi: az Applebot támogatja a felfedezést, míg az Applebot-Extended lehetővé teszi a kiadók számára, hogy ellenőrizzék a képzési felhasználást anélkül, hogy eltávolítanák az oldalakat az Apple Keresésből. (support.apple.com)
Ajánlott robots.txt konfigurációk
Helyezze a robots.txt fájlt minden gazdagép gyökerébe, például:
text https://www.example.org/robots.txt
A szabályok arra a specifikus gazdagépre, protokollra és portra vonatkoznak, ahol a fájl elérhető. Egy külön aldoménnek saját fájlra lehet szüksége. (developers.google.com)
1. konfiguráció: Maximális bevonás
Használja ezt, ha a nyilvános szerkesztői tartalom szabálykövető bejárók által megtalálható, összefoglalható, idézhető, indexelhető és gyűjthető.
text
Public pages are available to compliant crawlers.
User-agent: * Allow: /
Keep private, transactional, and administrative paths out.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Ez engedélyezi a megnevezett bejárókat, beleértve az OpenAI-t, a Google-t, az Anthropic-ot, a Perplexity-t, az Apple-t, a Common Crawl-t, a Microsoftot és az Amazont, hacsak egy másik specifikus szabály nem blokkolja őket.
Ne helyezzen el egy általános szabályt, például User-agent: * Disallow: / ezen konfiguráció alá. Egy későbbi vagy specifikusabb csoport megváltoztathatja, hogyan értelmezi a bejáró a fájlt.
2. konfiguráció: Engedélyezze a keresést, de blokkolja a modellfejlesztő bejárókat
Ez gyakran a legjobb kompromisszum azoknak a kiadóknak, akik idézeteket és keresési forgalmat szeretnének, de nem akarnak engedélyt jelezni a modellfejlesztési célú gyűjtéshez.
text
Block OpenAI model-development crawling.
User-agent: GPTBot Disallow: /
Block Anthropic model-development crawling.
User-agent: ClaudeBot Disallow: /
Block Google model-training and related grounding use.
User-agent: Google-Extended Disallow: /
Block Apple foundation-model training use.
User-agent: Applebot-Extended Disallow: /
Optional: block Common Crawl dataset collection.
User-agent: CCBot
Disallow: /
Allow ordinary search and retrieval crawling, except for sensitive paths.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Ez a konfiguráció az OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot és Applebot bejárókat a wildcard csoport alá vonja. Ezenkívül elkülöníti a keresési és képzési engedélyeket.
Az Apple esetében az Applebot-Extended blokkolása, miközben az Applebot engedélyezése, megőrzi a felfedezhetőséget az Apple szolgáltatásokon keresztül. A Google esetében a Google-Extended blokkolása nem blokkolja a szokásos Google Keresést. (developers.google.com)
3. konfiguráció: Kifejezetten engedélyezze a kiválasztott kereső bejárókat
Ha egy meglévő robots.txt fájl blokkolja az összes bejárót, adjon hozzá külön csoportokat azoknak a kereső bejáróknak, amelyeket üdvözölni szeretne.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Keep all other crawlers out.
User-agent: * Disallow: /
Specifikus csoportok használatakor ismételje meg az érzékeny útvonalakra vonatkozó szabályokat minden csoporton belül. Egyes bejárók a legspecifikusabb illeszkedő csoportot használják ahelyett, hogy kombinálnák azt a wildcard csoporttal. A Bing közvetlenül dokumentálja ezt a viselkedést, a Google pedig külön útmutatót ad a bejáró-specifikus csoportokhoz. (bing.com)
Fontos robots.txt korlátozások
- Egy bejáró figyelmen kívül hagyhatja a robots.txt-t.
- Egy rosszindulatú bejáró megbízható bejárónak adhatja ki magát.
- Egy blokkolt oldal továbbra is ismert lehet címe vagy webcíme alapján.
- A Robots.txt nem védi a jelszavakat, privát fájlokat, ügyfélrekordokat vagy bizalmas alkalmazásprogramozási felületeket.
- A
Crawl-delaydirektíva nem része a Robots Kizárási Protokoll magjának, és nem minden bejáró támogatja. Az Anthropic és a Bing dokumentálja a támogatást, míg az Apple szerint az Applebot nem követi a crawl-delay-t. (rfc-editor.org)
Meta címkék és HTTP fejlécek
Nyilvános oldal példa
Egy nyilvános cikkhez használjon világos címet, szerzőt, kanonikus webcímet, közzétételi dátumot és módosítási dátumot.
html
A max-snippet direktíva elsősorban a Google számára van dokumentálva. Ne feltételezze, hogy minden mesterséges intelligencia alapú bejáró támogat minden meta direktívát.
Privát vagy érzékeny oldal példa
html
Ezt olyan oldalakhoz használja, amelyek nem jelenhetnek meg a keresési eredményekben. Az oldalnak elég hosszú ideig bejárhatónak kell maradnia ahhoz, hogy a bejáró lássa a direktívát. Ha az oldalnak valóban privátnak kell maradnia, használjon inkább hitelesítést vagy jelszóvédelmet. (developers.google.com)
Csak az érzékeny részek elrejtése a keresési kivonatokból
A Google támogatja a data-nosnippet direktívát egy HTML oldal specifikus részeinél:
html
This paragraph may be shown in a search result.
Ez hasznos kapcsolattartási adatok, belső jegyzetek vagy felhasználó által generált információk esetén. Nem univerzális utasítás minden mesterséges intelligencia rendszer számára. (developers.google.com)
Használja az X-Robots-Tag fejlécet fájlokhoz
A meta címkék nem helyezhetők el hordozható dokumentumfájlban, kép- vagy videófájlban. Ehelyett használjon HTTP válaszfejlécet:
text X-Robots-Tag: noindex, nosnippet
Olyan oldalhoz, amelynek kereshetőnek kell maradnia, de nem szolgáltathat szöveget kivonatokhoz vagy mesterséges intelligencia válaszokhoz, használja:
text X-Robots-Tag: nosnippet
A Google dokumentálja az X-Robots-Tag-et nem HTML erőforrásokhoz, és az Apple is támogatja az Applebot számára. (developers.google.com)
Apple-specifikus vezérlők
Az Apple támogatja:
html
Az Apple szerint a nosnippet megakadályozza, hogy az oldal további kontextusként és aktuális tartalomként felhasználható legyen, amikor az Apple modelljei kimenetet generálnak. Az oldal továbbra is felfedezhető maradhat az Apple Keresés, Spotlight, Siri és Safari segítségével. (support.apple.com)
Fizetős oldalak esetén az Apple strukturált adatokat is támogat a következőkkel:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Az Apple szerint az ilyen oldalak továbbra is megjelenhetnek a keresési eredményekben, de nem használhatók további kontextusként mesterséges intelligencia válaszokhoz. (support.apple.com)
Hogyan ellenőrizzük a bejárók Internet Protokoll (IP) címeit
Miért nem elég a user-agent illesztés
Egy ilyen szabály gyenge:
text if User-Agent contains "GPTBot": allow
Ezt a szöveget bárki elküldheti. Egy jobb szabály a következő:
text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block
Ne bízzon az X-Forwarded-For fejlécben, hacsak nem olyan proxyból vagy tartalomkézbesítő hálózatból származik, amelyet az Ön szervezete ellenőriz.
Szolgáltatói ellenőrzési módszerek
| Szolgáltató | Ajánlott ellenőrzési módszer |
|---|---|
| OpenAI | Használja az OpenAI bejáró dokumentációjában közzétett élő Internet Protokoll címcsatornákat az OAI-SearchBot, GPTBot és OAI-AdsBot számára. Frissítse őket automatikusan, ahelyett, hogy rögzített tartományokat másolna be egy tűzfalba. |
| Használja a Google közzétett bejáró tartományait, vagy végezzen fordított és forward Domain Name System (DNS) ellenőrzéseket. Egy valódi Google bejárónak jóváhagyott Google gazdagépnévre kell feloldania, és vissza kell oldania az eredeti címre. | |
| Anthropic | Használja az aktuálisan közzétett bejáró címcsatornát másodlagos hálózati ellenőrzésként. Az Anthropic elsődleges leiratkozási módszere továbbra is a robots.txt. |
| Perplexity | Kombinálja a user-agentet az aktuális PerplexityBot vagy Perplexity-User címcsatornával. A Perplexity kifejezetten javasolja mindkét feltétel kombinálását egy Web Alkalmazás Tűzfal (WAF) szabályban. |
| Apple | Végezzen fordított Domain Name System (DNS) ellenőrzést az applebot.apple.com alatt, majd végezzen forward lekérdezést. Az Apple aktuális címtartományokat is közzétesz egy JSON feedben. |
| Common Crawl | Végezzen fordított Domain Name System (DNS) ellenőrzést a crawl.commoncrawl.org alatt és az aktuális CCBot címcsatornával. A Common Crawl megjegyzi, hogy az fordított ellenőrzés még nem érhető el néhány IPv6 forgalom esetén. |
| Microsoft | Használja a hivatalos Verify Bingbot eszközt vagy a Microsoft dokumentált fordított és forward lekérdezési módszereit. |
| Amazon | Használja az Amazon közzétett bejáró címlistáit, és illessze azokat a megfelelő Amazon user-agenthez. |
A Google, Apple, Common Crawl, OpenAI, Anthropic és Perplexity mind közzétesz szolgáltató-specifikus módszereket vagy címcsatornákat. Ezek a listák változhatnak, ezért egy ütemezett frissítési folyamat biztonságosabb, mint egy állandó, manuálisan másolt lista. (developers.google.com)
Egy egyszerű tűzfal kialakítása így nézhet ki:
text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match
rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers
Ne alkalmazzon széles körű engedélyezési szabályt egy teljes felhőszolgáltatóra. Egy jogszerű bejáró használhat felhőinfrastruktúrát, de a felhőszolgáltatótól származó forgalom nagy része nem feltétlenül a bejáró.
Hogyan befolyásolja a nyílt licencelés a bevonást
CC BY 4.0 közérthetően
A Creative Commons Nevezd meg! 4.0 Nemzetközi licenc, gyakran CC BY 4.0 néven emlegetve, lehetővé teszi az emberek számára, hogy:
- Másolják és terjesszék a művet
- Adaptálják, fordítsák, remixeljék és építsenek rá
- Kereskedelmi célra használják
A fő feltételek a következők:
- Megfelelően tüntessék fel a forrást
- Hivatkozzanak a licencre
- Jelezzék, ha változtatásokat eszközöltek
- Ne sugallják, hogy az eredeti alkotó támogatja az újrahasználatot
- Ne tegyenek jogi vagy technikai korlátozásokat, amelyek megakadályozzák a licenc által engedélyezett felhasználásokat
A Creative Commons arra is figyelmeztet, hogy a licenc nem feltétlenül terjed ki a magánéleti jogokra, a nyilvánossági jogokra, a személyiségi jogokra, a védjegyjogokra, a szabadalmi jogokra vagy harmadik fél anyagainak felhasználására. (creativecommons.org)
Egy licenc önmagában nem bejáró meghívó
A „CC BY 4.0” elhelyezése egy oldalon nem garantálja, hogy egy szervezet bejárja azt. Egy bejárót továbbra is blokkolhat:
- robots.txt
- Tartalomkézbesítő hálózat (CDN)
- Web Alkalmazás Tűzfal (WAF)
- Sebességkorlátozás
- JavaScript kihívás
- Bejelentkezési fal
- Gyenge szerverválasz
- Hozzáférhetetlen sitemap
Ezzel szemben, egy bejáró engedélyezése nem biztosít automatikusan minden szerzői jogi engedélyt, amely minden későbbi felhasználáshoz szükséges. A robots.txt-t és a licencelést együtt kell megtervezni.
Miért támogathatja a CC BY a szélesebb körű bevonást
Egy világos, megengedő licenc megkönnyítheti a kiadó politikájának megértését az adatkezelő csapatok, keresőrendszerek és asszisztens operátorok számára. Csökkentheti a bizonytalanságot a másolással, adaptációval, kereskedelmi felhasználással, fordítással és újraterjesztéssel kapcsolatban, amikor ezek a tevékenységek szerzői jogi engedélyt igényelnek.
Azonban a Creative Commons magyarázata szerint a mesterséges intelligencia képzése jogilag összetett. Egy korlátozó licenc nem mindig hatékony módja a képzés megakadályozásának, mert egyes képzési felhasználásokat megengedhetnek a szerzői jogi kivételek vagy korlátozások. A Creative Commons azt is megjegyzi, hogy a licencfeltételeket nehéz lehet alkalmazni a gépi képzésre és a modellkimenetekre. (creativecommons.org)
A gyakorlati tanulság a következő:
Használja a CC BY licencet, ha őszintén széles körű, jogszerű újrahasználatot szeretne. Ne használjon korlátozó Creative Commons licencet garantált mesterséges intelligencia képzési leiratkozásként.
A forrásmegjelölés javítja a forrás egyértelműségét
A Creative Commons a TASL módszert javasolja:
- Cím
- Szerző
- Forrás
- Licenc
Például:
„Licencelés és robotok a maximális bevonásért,” Example Publishing, https://www.example.org/articles/ai-crawlers, Creative Commons Nevezd meg! 4.0 Nemzetközi licenc alatt. Változtatások: frissített bejárólista.
A világos forrásmegjelölés nem kényszeríti minden asszisztenst egy oldal idézésére. Azonban megkönnyíti a helyes hivatkozást, amikor egy rendszer kinyeri az oldal címét, szerzőjét, forrását és licencinformációit. (wiki.creativecommons.org)
Strukturált cikk információk hozzáadása
Használja együtt a látható információkat és a strukturált adatokat:
html
A Google javasolja a világos szerzői információkat, szerzői oldalakat, közzétételi dátumokat, módosítási dátumokat és stabil kanonikus oldalakat. Ezek a jelek segíthetik a keresőrendszereket abban, hogy megértsék, ki hozta létre az anyagot, és melyik változat a hiteles. Nem garantálják a rangsorolást, a bevonást vagy az idézést. (developers.google.com)
Jogi sablon egy nyílt, idézésbarát webhelyhez
Az alábbiak mintaszövegek, nem jogi tanácsok. Kérje jogász segítségét a saját joghatósága, tulajdonosi struktúrája, adatvédelmi kötelezettségei és harmadik féltől származó tartalma szerinti adaptációhoz.
CC BY 4.0 licencnyilatkozat
text
Content license
Except where otherwise stated, the original text and original editorial materials on this page are licensed under the Creative Commons Attribution 4.0 International license:
https://creativecommons.org/licenses/by/4.0/
This permission allows copying, redistribution, adaptation, translation, commercial use, machine-readable processing, search indexing, retrieval, summarization, and use in artificial intelligence systems, provided that the license terms are followed.
Preferred attribution:
“[Page title],” by [author or organization], [canonical page address], published or updated [date], licensed under Creative Commons Attribution 4.0 International. Changes made: [describe changes, or state ‘none’].
Please preserve the author, publisher, source, license, and modification information whenever reasonably possible. This preferred attribution guide does not add restrictions to the Creative Commons license and does not replace the license text.
A „beleértve a mesterséges intelligencia rendszereket” kifejezés tisztázza a kiadó szándékát. Nem használható arra, hogy azt a látszatot keltse, mintha a kiadó birtokolná a más által létrehozott anyagok jogait.
Márka-, adatvédelmi és harmadik fél jogaira vonatkozó közlemény
text
Brand, privacy, and third-party rights
The license above covers only the original materials identified as licensed. It does not grant permission to use:
- Trademarks, service marks, logos, or trade dress
- Names, images, or likenesses of people
- Private, confidential, account, health, financial, or security information
- User submissions unless they are separately identified as licensed
- Photographs, illustrations, maps, video, music, quotations, or other third-party materials
- Content identified as “all rights reserved” or subject to a separate license
Use of the Example Publishing name, logos, and marks must not suggest sponsorship, approval, partnership, or endorsement. Please link to the original page and clearly distinguish quotation, paraphrase, summary, and generated material.
Ez a szövegezés azért fontos, mert a Creative Commons licencek nem biztosítanak automatikusan minden jogtípust, amely egy oldalhoz kapcsolódik. (creativecommons.org)
Keresési és asszisztens idézési útmutató
text
Search and assistant citation guidance
We welcome compliant search indexing, user-requested retrieval, citation, and summarization of the licensed material on this site.
When citing this site, please use the page title, author or publisher, canonical page address, publication or update date, and a direct link to the source. Please identify the source as one input among any sources used, distinguish generated analysis from quoted material, and do not state or imply that Example Publishing endorses a generated answer, product, person, or service.
This guidance is intended to improve accuracy and attribution. It does not grant rights beyond the applicable content license and does not license trademarks, personal information, confidential information, or third-party material.
Ha keresési láthatóságot szeretne, de nem akar széles körű képzési licencet adni
text
Search access and copyright
Our public pages may be accessed by compliant search and retrieval crawlers identified in our robots.txt file. This permission is intended to support discovery, search results, user-requested retrieval, and citation.
Except where a separate license is shown, the original content remains all rights reserved. Access to a public page does not grant a separate license for model-development, training, redistribution, commercial reuse, or creation of derivative works beyond rights provided by applicable law.
Please cite the canonical page address and publisher when referring to this material. Nothing on this site grants permission to use trademarks, logos, personal information, confidential information, or third-party content.
Ne helyezze a CC BY nyilatkozatot és az összes jog fenntartva nyilatkozatot ugyanarra az anyagra. Világosan azonosítsa, melyik licenc melyik tartalomra vonatkozik.
Kockázat-haszon mátrix nyílt licenceléshez
A szerzői jogi törvények és a mesterséges intelligencia képzési szabályai országonként eltérőek és még rendezetlenek. Az Egyesült Államok Szerzői Jogi Hivatala továbbra is vizsgálja ezeket a kérdéseket, míg a Creative Commons a mesterséges intelligencia képzését tényalapú és jogilag komplexnek írja le. (copyright.gov)
| Megközelítés | Bevonási potenciál | Fő előnyök | Fő kockázatok | Legjobb illeszkedés |
|---|---|---|---|---|
| CC BY 4.0 | Nagyon magas | Széles körű másolás, adaptáció, kereskedelmi felhasználás, fordítás, indexelés és modellhez kapcsolódó újrahasználat, amikor szerzői jogi engedély szükséges | Kereskedelmi versenytársak újrahasználhatják vagy adaptálhatják a tartalmat; a forrásmegjelölés tökéletlen lehet; a licenc nem tudja ellenőrizni a magánéleti, védjegy- vagy harmadik fél jogait | Kiadók, akik a legszélesebb jogszerű újrahasználatot és erős forrásmegjelölést szeretnék |
| CC BY-SA 4.0 | Magas, de bonyolultabb | Ösztönzi a nyílt megosztási ciklust, és megköveteli, hogy az adaptációk kompatibilis feltételek mellett maradjanak | A ShareAlike szabályokat nehéz lehet alkalmazni az adatkészletekre, a modellképzésre és a nyilvános kimenetekre; egyes szervezetek a bizonytalanság miatt elkerülhetik az anyagot | Nyílt oktatási és közérdekű projektek, amelyek azt szeretnék, hogy a downstream adaptációk nyíltak maradjanak |
| CC BY-NC 4.0 | Közepes vagy alacsony | Korlátozza a primarily kereskedelmi előnyre vagy pénzbeli kompenzációra szánt felhasználásokat | A „nem kereskedelmi” nehezen értelmezhető; kizárhatja a kereskedelmi keresési, modell- és asszisztens felhasználásokat; nem garantált képzési leiratkozás | Nonprofit, oktatási vagy közösségi célra szánt anyag |
| CC BY-ND 4.0 | Közepes | Lehetővé teszi a megosztást, miközben korlátozza az adaptációkat | A fordítás, átalakítás és egyes asszisztens felhasználási esetek jogilag bizonytalanná válhatnak; kevésbé vonzó az összefoglaló vagy remixelő rendszerek számára | Hivatalos közlemények vagy olyan művek, amelyeknek változatlannak kell maradniuk |
| CC0 vagy közkincs felajánlás | Nagyon magas | Egyszerűsíti az újrahasználatot, és eltávolítja a legtöbb szerzői jogi feltételt, ahol jogilag hatékony | Nincs kötelező forrásmegjelölés; gyenge ellenőrzés a márkaprezentáció felett; a magánéleti, védjegy- és nyilvánossági jogok különállók maradnak | Tények, adatkészletek, referenciaanyagok vagy korlátozás nélküli újrahasználatra szánt művek |
| Minden jog fenntartva plusz nyílt keresési bejárás | Magas a kereséshez, alacsonyabb a képzéshez | Megőrizheti a keresési és idézési láthatóságot anélkül, hogy széles körű újrahasználati licencet adna | Nagyobb jogi bizonytalanság a modellfejlesztők számára; csökkentheti a képzési adatkészletekbe és a kereskedelmi újrahasználati rendszerekbe való bevonást | Kiadók, akik felfedezhetőséget és idézeteket szeretnének, de inkább külön tárgyalnak szélesebb licencekről |
Sok szervezet számára a legkiegyensúlyozottabb stratégia a következő:
- CC BY 4.0 az eredeti nyilvános szerkesztőségi szöveghez
- Külön címkék a harmadik féltől származó anyagokhoz
- Nincs nyilvános személyes vagy bizalmas információ
- Engedélyezze a keresési és lekérdezési bejárókat
- Csak akkor engedélyezze a modellfejlesztési bejárókat, ha a szervezet valóban elfogadja ezt a felhasználást
- Használjon világos forrásmegjelölést és kanonikus linkeket
- Védje a védjegyeket külön márkajelzéssel
Egy gyakorlati megvalósítási ellenőrzőlista
Tartalom és licencelés
- Azonosítsa, ki birtokolja az egyes oldalakat, képeket, diagramokat, videókat és idézeteket.
- Csak olyan anyagokat licenceljen, amelyekre szervezete rendelkezik a jogokkal.
- A harmadik féltől származó anyagokat külön jelölje meg.
- Adjon hozzá egy látható licencnyilatkozatot.
- Adjon meg egy preferált hivatkozást, amely tartalmazza a címet, szerzőt, forrást és licencet.
- Tartsa a logókat, védjegyeket, személyes adatokat és bizalmas információkat a licencelt hatókörön kívül.
Robots.txt
- Hozzon létre egy nyilvános robots.txt fájlt minden gazdagép gyökerében.
- Engedélyezze a kereső bejárókat külön a képző bejáróktól.
- Blokkolja az adminisztrációs, fiók-, fizetési, privát és belső alkalmazás útvonalakat.
- Ne hagyatkozzon a robots.txt-re a biztonság terén.
- Tesztelje a fájlt minden nagyobb weboldal telepítés után.
Meta címkék
- Használjon kanonikus linkeket.
- Adjon hozzá szerzőt, közzétételi dátumot és módosítási dátumot.
- Használja a
noindexdirektívát olyan oldalakhoz, amelyek nem jelenhetnek meg a keresésben. - Használja a
nosnippetvagydata-nosnippetdirektívát érzékeny kivonatokhoz, ahol támogatott. - Használja az
X-Robots-Tag-et hordozható dokumentumfájlokhoz, képekhez és egyéb nem HTML erőforrásokhoz. - Ne feledje, hogy egy bejárónak képesnek kell lennie lekérni az oldalt, mielőtt elolvashatja a meta címkéit.
Hálózati biztonság
- Naplózza a user-agent stringeket, forráscímeket, válaszkódokat és kérés útvonalakat.
- Ellenőrizze a megbízható bejárókat hivatalos címcsatornák vagy Domain Name System (DNS) módszerek használatával.
- Frissítse automatikusan a címcsatornákat.
- Kombinálja a user-agent és forráscím ellenőrzéseket.
- Korlátozza a hitelesített bejárók sebességét ahelyett, hogy korlátlan hozzáférést biztosítana nekik.
- Hívja ki vagy blokkolja azokat a kéréseket, amelyek megbízható bejáróknak vallják magukat, de nem felelnek meg az ellenőrzésnek.
Mérés
Kövesse nyomon:
- A mesterséges intelligencia keresési szolgáltatásokból érkező látogatások
- Az eredeti oldalra mutató hivatkozások
- Idézési gyakoriság
- Szerverterhelés bejárónként
403,404vagy429választ adó kérések- A bejárók hozzáférése nem szándékolt útvonalakhoz
- Hogy az aktuális cikkek megtalálhatóak-e a közzététel után
Összefoglalás
A maximális bevonás szelektív nyitottságot igényel, nem pedig egyetlen általános engedélyt.
Használja a robots.txt-t a keresés, a felhasználói lekérdezés, a képzés és a nyilvános adatkészletek bejárásának elkülönítésére. Használjon meta címkéket és HTTP fejléceket az indexelés és a kivonatok kezelésére. Használjon hitelesítést minden privát tartalomhoz. Ellenőrizze a bejárók Internet Protokoll címeit, ahelyett, hogy csak a user-agent nevekre hagyatkozna.
Egy megengedő licenc, mint például a CC BY 4.0, megkönnyítheti a széles körű újrahasználatot, ha valóban ezt szeretné. A világos forrásmegjelölési információk – cím, szerző, forrás, licenc, kanonikus oldal és frissítési dátum – szintén megkönnyíthetik a keresőrendszerek és asszisztensek számára a helyes forrás azonosítását és idézését.
A legerősebb kiadói politika tehát a következő:
**Tegye hozzáférhetővé a felfedezni kívánt nyilvános tartalmat, egyértelműen licencelje az újrahasználni kívánt anyagot, jelölje meg azt az anyagot, amelynek nem Ön a tulajdonosa, védje a privát információkat szerver szinten, és adjon minden bejárónak külön, felülvizsgálható engedélyt.
Auto