अधिकतम समावेशन के लिए लाइसेंसिंग और रोबोट: आर्टिफिशियल इंटेलिजेंस क्रॉलर का स्वागत कैसे करें
25 अगस्त, 2026 को अपडेट किया गया
वेबसाइटों के पास अब दर्शकों तक पहुँचने के एक से अधिक तरीके हैं। एक पेज Google सर्च के माध्यम से मिल सकता है, ChatGPT द्वारा सारांशित किया जा सकता है, Perplexity द्वारा उद्धृत किया जा सकता है, Claude सर्च में उपयोग किया जा सकता है, Apple सेवाओं के माध्यम से प्रदर्शित किया जा सकता है, या सार्वजनिक वेब संग्रह द्वारा एकत्र किया जा सकता है।
ये सभी सिस्टम एक ही क्रॉलर का उपयोग नहीं करते हैं और न ही समान नियमों का पालन करते हैं। एक वेबसाइट जो GPTBot को ब्लॉक करती है, फिर भी ChatGPT सर्च में दिखाई दे सकती है यदि वह OAI-SearchBot को अनुमति देती है। एक वेबसाइट जो Applebot को अनुमति देती है, वह Apple सर्च में दृश्यमान रह सकती है जबकि Applebot-Extended को आर्टिफिशियल इंटेलिजेंस मॉडल प्रशिक्षण से रोक सकती है। Google का Google-Extended बिलकुल भी सामान्य क्रॉलर नहीं है; यह एक robots.txt नियंत्रण टोकन है।
इसलिए सबसे अच्छी नीति केवल “आर्टिफिशियल इंटेलिजेंस को अनुमति दें” या “आर्टिफिशियल इंटेलिजेंस को ब्लॉक करें” नहीं है। यह इसके लिए अलग-अलग अनुमतियाँ बनाना है:
- खोज और खोज-प्रक्रिया
- उपयोगकर्ता-अनुरोधित पुनर्प्राप्ति
- मॉडल विकास और प्रशिक्षण
- सार्वजनिक डेटासेट
- संवेदनशील, निजी, या प्रतिबंधित सामग्री
यह लेख वर्तमान क्रॉलर इन्वेंट्री, robots.txt उदाहरण, मेटा टैग मार्गदर्शन, इंटरनेट प्रोटोकॉल एड्रेस सत्यापन विधियाँ, क्रिएटिव कॉमन्स लाइसेंसिंग सलाह, कानूनी मानक वाक्यांश, और एक जोखिम-लाभ मैट्रिक्स प्रदान करता है।
प्रत्येक प्रकाशक को चार नियंत्रणों को समझना चाहिए
1. robots.txt अनुरोधित क्रॉलिंग को नियंत्रित करता है
एक robots.txt फ़ाइल अनुपालनकारी स्वचालित क्लाइंट को बताती है कि वे किन पृष्ठों का अनुरोध कर सकते हैं। यह क्रॉलर ट्रैफ़िक के प्रबंधन और प्रकाशक की प्राथमिकताओं को व्यक्त करने के लिए उपयोगी है।
हालांकि, robots.txt एक्सेस-कंट्रोल सिस्टम नहीं है। रोबोट एक्सक्लूजन प्रोटोकॉल बताता है कि इसके नियम एक्सेस प्राधिकरण नहीं हैं। Google यह भी चेतावनी देता है कि एक अवरुद्ध पता अभी भी खोज परिणामों में दिखाई दे सकता है यदि अन्य पृष्ठ उसे लिंक करते हैं। गोपनीय जानकारी के लिए पासवर्ड, प्रमाणीकरण या सर्वर-साइड एक्सेस नियंत्रण का उपयोग करें। (rfc-editor.org)
2. मेटा टैग इंडेक्सिंग और स्निपेट को नियंत्रित करते हैं
रोबोट मेटा टैग और X-Robots-Tag प्रतिक्रिया हेडर यह नियंत्रित कर सकते हैं कि कोई पेज अनुक्रमित है या क्या कोई सर्च इंजन स्निपेट दिखा सकता है।
ये नियंत्रण आमतौर पर तभी दिखाई देते हैं जब क्रॉलर को पेज फ़ेच करने की अनुमति मिल गई हो। यदि robots.txt पहले पेज को ब्लॉक करता है, तो क्रॉलर मेटा टैग को कभी नहीं देख पाएगा। (developers.google.com)
3. नेटवर्क नियंत्रण क्रॉलर को सत्यापित करते हैं
एक यूज़र-एजेंट नाम कॉपी करना आसान है। एक हमलावर GPTBot, Googlebot, या PerplexityBot होने का दावा करते हुए एक अनुरोध भेज सकता है।
एक मजबूत दृष्टिकोण में शामिल हैं:
- दावा किया गया यूज़र-एजेंट
- एक प्रकाशित इंटरनेट प्रोटोकॉल एड्रेस रेंज
- रिवर्स डोमेन नेम सिस्टम सत्यापन
- फ़ॉरवर्ड डोमेन नेम सिस्टम सत्यापन
- दर सीमाएँ और अनुरोध निगरानी
4. एक लाइसेंस पुन: उपयोग अधिकार प्रदान करता है
Robots.txt बताता है कि क्रॉलर से क्या करने को कहा गया है। एक लाइसेंस बताता है कि जब कॉपीराइट अनुमति की आवश्यकता हो तो लोग या संगठन सामग्री के साथ कानूनी रूप से क्या कर सकते हैं।
ये अलग-अलग उपकरण हैं। एक अनुमेय लाइसेंस कानूनी अनिश्चितता को कम कर सकता है, लेकिन यह गारंटी नहीं देता कि क्रॉलर पेज पर जाएगा, कि एक मॉडल इसका उपयोग करेगा, या एक सहायक इसे उद्धृत करेगा।
महत्वपूर्ण क्रॉलर की सूची
निम्नलिखित इन्वेंट्री को 25 अगस्त, 2026 को उपलब्ध प्रदाता दस्तावेज़ों के विरुद्ध जाँच की गई थी। यूज़र-एजेंट नाम, उद्देश्य और इंटरनेट प्रोटोकॉल एड्रेस रेंज बदल सकते हैं, इसलिए उत्पादन प्रणालियों को प्रदाता के वर्तमान दस्तावेज़ और लाइव एड्रेस फ़ीड का उपयोग करना चाहिए।
| प्रदाता | क्रॉलर या robots.txt टोकन | मुख्य उद्देश्य | महत्वपूर्ण नियंत्रण |
|---|---|---|---|
| OpenAI | OAI-SearchBot | ChatGPT सर्च के लिए पेज ढूंढता और उनका विश्लेषण करता है | ChatGPT सर्च परिणामों में पेजों के दिखने की संभावना को बेहतर बनाने के लिए इसे अनुमति दें। |
| OpenAI | GPTBot | OpenAI के जनरेटिव आर्टिफिशियल इंटेलिजेंस मॉडल को प्रशिक्षित करने के लिए उपयोग किए जा सकने वाले पेजों को एकत्र करता है | सर्च से अलग अनुमति दें या अस्वीकार करें। |
| OpenAI | ChatGPT-User | जब कोई उपयोगकर्ता ChatGPT या किसी कस्टम GPT से उन्हें एक्सेस करने के लिए कहता है तो पेज फ़ेच करता है | यह एक स्वचालित वेब क्रॉलर के बजाय उपयोगकर्ता-ट्रिगर होता है, इसलिए robots.txt नियम लागू नहीं हो सकते हैं। |
| OpenAI | OAI-AdsBot | ChatGPT विज्ञापन गंतव्यों के रूप में सबमिट किए गए वेब पेजों की जाँच करता है | मुख्य रूप से विज्ञापनदाताओं के लिए प्रासंगिक। एकत्र की गई सामग्री का उपयोग जनरेटिव आर्टिफिशियल इंटेलिजेंस फाउंडेशन मॉडल को प्रशिक्षित करने के लिए नहीं किया जाता है। |
Googlebot | मुख्य Google सर्च क्रॉलर | सामान्य Google सर्च क्रॉलिंग को नियंत्रित करता है। | |
Googlebot-Image, Googlebot-Video, Googlebot-News | छवियाँ, वीडियो और Google न्यूज़ | इनके अलग robots.txt टोकन होते हैं और इन्हें स्वतंत्र रूप से नियंत्रित किया जा सकता है। | |
GoogleOther | विभिन्न उत्पाद टीमों, अनुसंधान और विकास सहित, के लिए सामान्य-उद्देश्य Google क्रॉलिंग | यह किसी एक विशिष्ट Google उत्पाद का प्रतिनिधित्व नहीं करता है। | |
Google-Extended | नियंत्रित करता है कि Google-क्रॉल्ड सामग्री का उपयोग Gemini मॉडल प्रशिक्षण और कुछ ग्राउंडिंग सिस्टम के लिए किया जा सकता है या नहीं | यह एक robots.txt नियंत्रण टोकन है, न कि एक अलग अनुरोध यूज़र-एजेंट। यह सामान्य Google सर्च समावेशन को प्रभावित नहीं करता है। | |
| Anthropic | ClaudeBot | सार्वजनिक वेब सामग्री एकत्र करता है जो Claude मॉडल के विकास में योगदान कर सकती है | इसे अस्वीकार करें यह संकेत देने के लिए कि भविष्य की सामग्री को Anthropic प्रशिक्षण डेटासेट से बाहर रखा जाना चाहिए। |
| Anthropic | Claude-SearchBot | Claude सर्च परिणाम की गुणवत्ता में सुधार करता है | Claude सर्च दृश्यता के लिए इसे अनुमति दें। |
| Anthropic | Claude-User | Claude के उपयोगकर्ता के अनुरोध के जवाब में पेज फ़ेच करता है | स्वचालित क्रॉलिंग से अलग। |
| Perplexity | PerplexityBot | Perplexity सर्च परिणामों के लिए पेजों को अनुक्रमित करता है | Perplexity का कहना है कि इस क्रॉलर का उपयोग आर्टिफिशियल इंटेलिजेंस फाउंडेशन-मॉडल प्रशिक्षण के लिए सामग्री एकत्र करने के लिए नहीं किया जाता है। |
| Perplexity | Perplexity-User | उपयोगकर्ता द्वारा अनुरोध करने के बाद एक पेज फ़ेच करता है | Perplexity के दस्तावेज़ों का कहना है कि यह फ़ेचर आमतौर पर robots.txt को अनदेखा करता है क्योंकि अनुरोध एक उपयोगकर्ता द्वारा शुरू किया गया था। |
| Apple | Applebot | Apple सर्च, स्पॉटलाइट, सिरी, सफारी और अन्य Apple अनुभवों का समर्थन करता है | Apple खोज के लिए इसे अनुमति दें। |
| Apple | Applebot-Extended | नियंत्रित करता है कि Applebot-क्रॉल्ड सामग्री का उपयोग Apple फाउंडेशन मॉडल को प्रशिक्षित करने के लिए किया जा सकता है या नहीं | यह स्वयं पेज क्रॉल नहीं करता है। यह एक डेटा-उपयोग नियंत्रण है। |
| Common Crawl | CCBot | Common Crawl के ओपन वेब संग्रह के लिए सार्वजनिक वेब डेटा एकत्र करता है | यह एक सहायक नहीं है, लेकिन इसके डेटासेट का उपयोग शोधकर्ताओं और आर्टिफिशियल इंटेलिजेंस डेवलपर्स द्वारा किया जा सकता है। |
| Microsoft | Bingbot | मुख्य Bing सर्च क्रॉलर | Bing खोज और सर्च दृश्यता के लिए इसे अनुमति दें। |
| Microsoft | MicrosoftPreview, BingVideoPreview | Microsoft उत्पादों के लिए पेज और वीडियो पूर्वावलोकन | इन्हें Bingbot से अलग नियंत्रित किया जा सकता है। |
| Amazon | Amzn-SearchBot | Amazon सर्च और सामग्री खोज | Amazon का कहना है कि यह जनरेटिव आर्टिफिशियल इंटेलिजेंस मॉडल प्रशिक्षण के लिए सामग्री क्रॉल नहीं करता है। |
| Amazon | Amzn-User | Alexa अनुरोधों सहित उपयोगकर्ता क्रियाओं के जवाब में वर्तमान जानकारी फ़ेच करता है | उपयोगकर्ता-ट्रिगर और स्वचालित सर्च क्रॉलिंग से अलग। |
OpenAI अपने सर्च, प्रशिक्षण, विज्ञापन और उपयोगकर्ता-ट्रिगर क्रॉलर को अलग-अलग नियंत्रणों के रूप में दस्तावेज़ित करता है। इसके दस्तावेज़ विशेष रूप से OAI-SearchBot को ChatGPT सर्च के लिए अनुमति देने की सलाह देते हैं, जबकि GPTBot का उपयोग प्रशिक्षण प्राथमिकताओं के लिए अलग से करते हैं। (developers.openai.com)
Google भी इसी तरह Googlebot, GoogleOther और Google-Extended को अलग करता है। Google-Extended का अपना कोई HTTP अनुरोध यूज़र-एजेंट नहीं है, और इसे ब्लॉक करने से Google सर्च से कोई पेज नहीं हटता। (developers.google.com)
Anthropic ClaudeBot, Claude-SearchBot और Claude-User के लिए अलग-अलग भूमिकाएँ दस्तावेज़ित करता है। Anthropic यह भी बताता है कि उसके बॉट robots.txt का पालन करते हैं और गैर-मानक Crawl-delay निर्देश का समर्थन करते हैं। (support.anthropic.com)
Perplexity स्वचालित सर्च क्रॉलिंग और उपयोगकर्ता-अनुरोधित फ़ेचिंग के बीच अंतर करता है। इसके वर्तमान दस्तावेज़ों का कहना है कि PerplexityBot robots.txt का सम्मान करता है, जबकि Perplexity-User आमतौर पर ऐसा नहीं करता क्योंकि यह उपयोगकर्ता के अनुरोध का जवाब देता है। (docs.perplexity.ai)
Apple के वर्तमान दस्तावेज़ वही सर्च-बनाम-प्रशिक्षण अंतर करते हैं: Applebot खोज का समर्थन करता है, जबकि Applebot-Extended प्रकाशकों को Apple सर्च से पेजों को हटाए बिना प्रशिक्षण उपयोग को नियंत्रित करने देता है। (support.apple.com)
अनुशंसित robots.txt कॉन्फ़िगरेशन
प्रत्येक होस्ट के रूट पर robots.txt रखें, जैसे:
text https://www.example.org/robots.txt
नियम उस विशिष्ट होस्ट, प्रोटोकॉल और पोर्ट पर लागू होते हैं जहाँ फ़ाइल परोसी जाती है। एक अलग सबडोमेन को अपनी फ़ाइल की आवश्यकता हो सकती है। (developers.google.com)
कॉन्फ़िगरेशन 1: अधिकतम समावेशन
इसका उपयोग तब करें जब सार्वजनिक संपादकीय सामग्री को अनुपालनकारी क्रॉलर द्वारा ढूंढा, सारांशित, उद्धृत, अनुक्रमित और एकत्र किया जा सके।
text
Public pages are available to compliant crawlers.
User-agent: * Allow: /
Keep private, transactional, and administrative paths out.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
यह OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft और Amazon सहित नामित क्रॉलर को अनुमति देता है, जब तक कि कोई अन्य विशिष्ट नियम उन्हें ब्लॉक न करे।
इस कॉन्फ़िगरेशन के नीचे User-agent: * Disallow: / जैसा कोई सामान्य नियम न रखें। एक बाद का या अधिक विशिष्ट समूह यह बदल सकता है कि क्रॉलर फ़ाइल की व्याख्या कैसे करता है।
कॉन्फ़िगरेशन 2: खोज की अनुमति दें लेकिन मॉडल-विकास क्रॉलर को ब्लॉक करें
यह अक्सर उन प्रकाशकों के लिए सबसे अच्छा समझौता होता है जो उद्धरण और सर्च ट्रैफ़िक चाहते हैं लेकिन मॉडल-विकास संग्रह के लिए अनुमति का संकेत नहीं देना चाहते हैं।
text
Block OpenAI model-development crawling.
User-agent: GPTBot Disallow: /
Block Anthropic model-development crawling.
User-agent: ClaudeBot Disallow: /
Block Google model-training and related grounding use.
User-agent: Google-Extended Disallow: /
Block Apple foundation-model training use.
User-agent: Applebot-Extended Disallow: /
Optional: block Common Crawl dataset collection.
User-agent: CCBot
Disallow: /
Allow ordinary search and retrieval crawling, except for sensitive paths.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
यह कॉन्फ़िगरेशन OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot और Applebot को वाइल्डकार्ड समूह के तहत छोड़ देता है। यह खोज और प्रशिक्षण अनुमतियों को भी अलग रखता है।
Apple के लिए, Applebot को अनुमति देते हुए Applebot-Extended को ब्लॉक करने से Apple सेवाओं के माध्यम से खोज बनी रहती है। Google के लिए, Google-Extended को ब्लॉक करने से सामान्य Google सर्च ब्लॉक नहीं होता है। (developers.google.com)
कॉन्फ़िगरेशन 3: स्पष्ट रूप से चयनित खोज क्रॉलर को अनुमति दें
यदि एक मौजूदा robots.txt फ़ाइल सभी क्रॉलर को ब्लॉक करती है, तो उन खोज क्रॉलर के लिए अलग समूह जोड़ें जिनका आप स्वागत करना चाहते हैं।
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Keep all other crawlers out.
User-agent: * Disallow: /
विशिष्ट समूहों का उपयोग करते समय, प्रत्येक समूह के भीतर संवेदनशील-पाथ नियमों को दोहराएं। कुछ क्रॉलर वाइल्डकार्ड समूह के साथ संयोजन करने के बजाय सबसे विशिष्ट मिलान समूह का उपयोग करते हैं। Bing इस व्यवहार को सीधे दस्तावेज़ित करता है, और Google क्रॉलर-विशिष्ट समूहों पर अलग मार्गदर्शन प्रदान करता है। (bing.com)
robots.txt की महत्वपूर्ण सीमाएँ
- एक क्रॉलर robots.txt को अनदेखा कर सकता है।
- एक दुर्भावनापूर्ण क्रॉलर एक विश्वसनीय क्रॉलर होने का दिखावा कर सकता है।
- एक अवरुद्ध पेज अभी भी अपने शीर्षक या वेब पते से जाना जा सकता है।
- Robots.txt पासवर्ड, निजी फ़ाइलों, ग्राहक रिकॉर्ड या गोपनीय एप्लिकेशन प्रोग्रामिंग इंटरफेस की सुरक्षा नहीं करता है।
Crawl-delayनिर्देश मुख्य रोबोट एक्सक्लूजन प्रोटोकॉल का हिस्सा नहीं है और हर क्रॉलर द्वारा समर्थित नहीं है। Anthropic और Bing समर्थन दस्तावेज़ित करते हैं, जबकि Apple का कहना है कि Applebot क्रॉल-विलंब का पालन नहीं करता है। (rfc-editor.org)
मेटा टैग और HTTP हेडर
सार्वजनिक पेज उदाहरण
एक सार्वजनिक लेख के लिए, एक स्पष्ट शीर्षक, लेखक, विहित वेब पता, प्रकाशन तिथि और संशोधन तिथि का उपयोग करें।
html
max-snippet निर्देश मुख्य रूप से Google के लिए दस्तावेज़ित है। यह न मानें कि हर आर्टिफिशियल इंटेलिजेंस क्रॉलर हर मेटा निर्देश का समर्थन करता है।
निजी या संवेदनशील पेज उदाहरण
html
इसका उपयोग उन पेजों के लिए करें जो खोज परिणामों में नहीं दिखने चाहिए। क्रॉलर को निर्देश देखने के लिए पेज को पर्याप्त समय तक क्रॉल करने योग्य रहना चाहिए। यदि पेज को वास्तव में निजी रहना है, तो इसके बजाय प्रमाणीकरण या पासवर्ड सुरक्षा का उपयोग करें। (developers.google.com)
केवल संवेदनशील अनुभागों को खोज स्निपेट से छिपाएँ
Google एक HTML पेज के विशिष्ट भागों के लिए data-nosnippet का समर्थन करता है:
html
This paragraph may be shown in a search result.
यह संपर्क विवरण, आंतरिक नोट्स या उपयोगकर्ता-जनित जानकारी के लिए उपयोगी है। यह हर आर्टिफिशियल इंटेलिजेंस सिस्टम के लिए एक सार्वभौमिक निर्देश नहीं है। (developers.google.com)
फ़ाइलों के लिए X-Robots-Tag हेडर का उपयोग करें
पोर्टेबल डॉक्यूमेंट फ़ाइल, इमेज या वीडियो फ़ाइल के अंदर मेटा टैग नहीं रखे जा सकते। इसके बजाय एक HTTP प्रतिक्रिया हेडर का उपयोग करें:
text X-Robots-Tag: noindex, nosnippet
एक पेज के लिए जो खोज योग्य रहना चाहिए लेकिन स्निपेट या आर्टिफिशियल इंटेलिजेंस उत्तरों के लिए टेक्स्ट प्रदान नहीं करना चाहिए, उपयोग करें:
text X-Robots-Tag: nosnippet
Google गैर-HTML संसाधनों के लिए X-Robots-Tag को दस्तावेज़ित करता है, और Apple भी Applebot के लिए इसका समर्थन करता है। (developers.google.com)
Apple-विशिष्ट नियंत्रण
Apple समर्थन करता है:
html
Apple का कहना है कि nosnippet पेज को अतिरिक्त संदर्भ और वर्तमान सामग्री के रूप में उपयोग होने से रोकता है जब Apple मॉडल आउटपुट उत्पन्न करते हैं। पेज अभी भी Apple सर्च, स्पॉटलाइट, सिरी और सफारी के माध्यम से खोज योग्य रह सकता है। (support.apple.com)
भुगतान-बाधित पेजों के लिए, Apple संरचित डेटा का भी समर्थन करता है:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple का कहना है कि ऐसे पेज खोज परिणामों के लिए पात्र रह सकते हैं लेकिन आर्टिफिशियल इंटेलिजेंस उत्तरों के लिए अतिरिक्त संदर्भ के रूप में उपयोग नहीं किए जाएंगे। (support.apple.com)
क्रॉलर इंटरनेट प्रोटोकॉल एड्रेस को कैसे सत्यापित करें
यूज़र-एजेंट मिलान पर्याप्त क्यों नहीं है
ऐसा नियम कमजोर है:
text if User-Agent contains "GPTBot": allow
कोई भी वह टेक्स्ट भेज सकता है। एक बेहतर नियम है:
text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block
X-Forwarded-For हेडर पर तब तक भरोसा न करें जब तक कि वह किसी ऐसे प्रॉक्सी या कंटेंट डिलीवरी नेटवर्क से न आए जिसे आपका संगठन नियंत्रित करता हो।
प्रदाता सत्यापन विधियाँ
| प्रदाता | अनुशंसित सत्यापन विधि |
|---|---|
| OpenAI | OAI-SearchBot, GPTBot और OAI-AdsBot के लिए OpenAI क्रॉलर दस्तावेज़ों में प्रकाशित लाइव इंटरनेट प्रोटोकॉल एड्रेस फ़ीड का उपयोग करें। फ़ायरवॉल में निश्चित रेंज को कॉपी करने के बजाय उन्हें स्वचालित रूप से ताज़ा करें। |
| Google की प्रकाशित क्रॉलर रेंज का उपयोग करें या रिवर्स और फ़ॉरवर्ड डोमेन नेम सिस्टम जाँच करें। एक वास्तविक Google क्रॉलर को एक अनुमोदित Google होस्टनाम पर हल होना चाहिए और वापस मूल एड्रेस पर हल होना चाहिए। | |
| Anthropic | एक द्वितीयक नेटवर्क जाँच के रूप में वर्तमान प्रकाशित क्रॉलर एड्रेस फ़ीड का उपयोग करें। Anthropic की प्राथमिक ऑप्ट-आउट विधि robots.txt बनी हुई है। |
| Perplexity | यूज़र-एजेंट को वर्तमान PerplexityBot या Perplexity-User एड्रेस फ़ीड के साथ मिलाएं। Perplexity विशेष रूप से वेब एप्लीकेशन फ़ायरवॉल नियम में दोनों शर्तों को संयोजित करने की सलाह देता है। |
| Apple | applebot.apple.com के तहत रिवर्स डोमेन नेम सिस्टम सत्यापन का उपयोग करें, फिर एक फ़ॉरवर्ड लुकअप करें। Apple एक JSON फ़ीड में वर्तमान एड्रेस रेंज भी प्रकाशित करता है। |
| Common Crawl | crawl.commoncrawl.org के तहत रिवर्स डोमेन नेम सिस्टम सत्यापन और वर्तमान CCBot एड्रेस फ़ीड का उपयोग करें। Common Crawl नोट करता है कि कुछ IPv6 ट्रैफ़िक के लिए रिवर्स सत्यापन अभी तक उपलब्ध नहीं है। |
| Microsoft | आधिकारिक Verify Bingbot टूल या Microsoft के दस्तावेज़ित रिवर्स और फ़ॉरवर्ड लुकअप विधियों का उपयोग करें। |
| Amazon | Amazon की प्रकाशित क्रॉलर एड्रेस सूचियों का उपयोग करें और उन्हें उपयुक्त Amazon यूज़र-एजेंट से मिलाएं। |
Google, Apple, Common Crawl, OpenAI, Anthropic और Perplexity सभी प्रदाता-विशिष्ट विधियाँ या एड्रेस फ़ीड प्रकाशित करते हैं। ये सूचियाँ बदल सकती हैं, इसलिए एक स्थायी मैन्युअल रूप से कॉपी की गई सूची की तुलना में एक अनुसूचित अद्यतन प्रक्रिया अधिक सुरक्षित है। (developers.google.com)
एक साधारण फ़ायरवॉल डिज़ाइन ऐसा दिख सकता है:
text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match
rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers
एक संपूर्ण क्लाउड प्रदाता पर एक व्यापक अनुमति नियम लागू न करें। एक वैध क्रॉलर क्लाउड इन्फ्रास्ट्रक्चर का उपयोग कर सकता है, लेकिन उस क्लाउड प्रदाता से अधिकांश ट्रैफ़िक आवश्यक रूप से क्रॉलर नहीं होता है।
ओपन लाइसेंसिंग समावेशन को कैसे प्रभावित करती है
सादी भाषा में CC BY 4.0
क्रिएटिव कॉमन्स एट्रिब्यूशन 4.0 इंटरनेशनल लाइसेंस, जिसे आमतौर पर CC BY 4.0 कहा जाता है, लोगों को इसकी अनुमति देता है:
- कार्य को कॉपी और पुनर्वितरित करें
- इसे अनुकूलित करें, अनुवाद करें, रीमिक्स करें और इसके आधार पर निर्माण करें
- व्यावसायिक रूप से इसका उपयोग करें
मुख्य शर्तें हैं:
- उचित श्रेय दें
- लाइसेंस से लिंक करें
- इंगित करें कि क्या कोई बदलाव किया गया था
- यह सुझाव न दें कि मूल निर्माता पुन: उपयोग का समर्थन करता है
- कानूनी या तकनीकी प्रतिबंध न जोड़ें जो लाइसेंस द्वारा अनुमत उपयोगों को रोकते हैं
क्रिएटिव कॉमन्स यह भी चेतावनी देता है कि लाइसेंस गोपनीयता अधिकारों, प्रचार अधिकारों, नैतिक अधिकारों, ट्रेडमार्क अधिकारों, पेटेंट अधिकारों, या तृतीय-पक्ष सामग्री को कवर नहीं कर सकता है। (creativecommons.org)
एक लाइसेंस अपने आप में क्रॉलर का निमंत्रण नहीं है
एक पेज पर “CC BY 4.0” लगाने से यह गारंटी नहीं मिलती कि कोई संगठन उसे क्रॉल करेगा। एक क्रॉलर अभी भी इसके द्वारा अवरुद्ध किया जा सकता है:
- robots.txt
- एक कंटेंट डिलीवरी नेटवर्क
- एक वेब एप्लीकेशन फ़ायरवॉल
- दर सीमाएँ
- एक जावास्क्रिप्ट चुनौती
- एक लॉगिन वॉल
- एक खराब सर्वर प्रतिक्रिया
- एक दुर्गम साइटमैप
इसके विपरीत, एक क्रॉलर को अनुमति देने से हर बाद के उपयोग के लिए आवश्यक हर कॉपीराइट अनुमति स्वचालित रूप से प्रदान नहीं होती है। robots.txt और लाइसेंसिंग को एक साथ डिज़ाइन किया जाना चाहिए।
CC BY व्यापक समावेशन का समर्थन क्यों कर सकता है
एक स्पष्ट अनुमेय लाइसेंस एक प्रकाशक की नीति को डेटा टीमों, खोज प्रणालियों और सहायक ऑपरेटरों के लिए समझना आसान बना सकता है। यह कॉपी करने, अनुकूलन, व्यावसायिक उपयोग, अनुवाद और पुनर्वितरण के बारे में अनिश्चितता को कम कर सकता है जब उन गतिविधियों के लिए कॉपीराइट अनुमति की आवश्यकता होती है।
हालांकि, क्रिएटिव कॉमन्स बताते हैं कि आर्टिफिशियल इंटेलिजेंस प्रशिक्षण कानूनी रूप से जटिल है। एक प्रतिबंधात्मक लाइसेंस हमेशा प्रशिक्षण को रोकने का एक प्रभावी तरीका नहीं होता है, क्योंकि कुछ प्रशिक्षण उपयोग कॉपीराइट अपवादों या सीमाओं द्वारा अनुमत हो सकते हैं। क्रिएटिव कॉमन्स यह भी नोट करता है कि लाइसेंस की शर्तों को मशीन प्रशिक्षण और मॉडल आउटपुट पर लागू करना मुश्किल हो सकता है। (creativecommons.org)
व्यावहारिक सबक है:
जब आप वास्तव में व्यापक कानूनी पुन: उपयोग चाहते हैं तो CC BY का उपयोग करें। आर्टिफिशियल इंटेलिजेंस प्रशिक्षण से बाहर निकलने के एक गारंटीकृत विकल्प के रूप में एक प्रतिबंधात्मक क्रिएटिव कॉमन्स लाइसेंस का उपयोग न करें।
एट्रिब्यूशन स्रोत की स्पष्टता में सुधार करता है
क्रिएटिव कॉमन्स TASL विधि की सलाह देता है:
- शीर्षक (Title)
- लेखक (Author)
- स्रोत (Source)
- लाइसेंस (License)
उदाहरण के लिए:
“अधिकतम समावेशन के लिए लाइसेंसिंग और रोबोट,” एग्जांपल पब्लिशिंग, https://www.example.org/articles/ai-crawlers, क्रिएटिव कॉमन्स एट्रिब्यूशन 4.0 इंटरनेशनल के तहत लाइसेंस प्राप्त। किए गए बदलाव: क्रॉलर इन्वेंट्री अपडेट की गई।
स्पष्ट श्रेय हर सहायक को एक पेज का हवाला देने के लिए मजबूर नहीं करता है। जब कोई सिस्टम पेज के शीर्षक, लेखक, स्रोत और लाइसेंसिंग जानकारी को निकालता है तो यह सही उद्धरण को आसान बनाता है। (wiki.creativecommons.org)
संरचित लेख जानकारी जोड़ें
दृश्यमान जानकारी और संरचित डेटा का एक साथ उपयोग करें:
html
Google स्पष्ट लेखक जानकारी, लेखक पेज, प्रकाशन तिथि, संशोधन तिथि और स्थिर विहित पेजों की सलाह देता है। ये संकेत खोज प्रणालियों को यह समझने में मदद कर सकते हैं कि सामग्री किसने बनाई और कौन सा संस्करण आधिकारिक है। वे रैंकिंग, समावेशन या उद्धरण की गारंटी नहीं देते हैं। (developers.google.com)
एक ओपन, उद्धरण-अनुकूल साइट के लिए कानूनी मानक वाक्यांश
निम्नलिखित नमूना भाषा है, कानूनी सलाह नहीं। अपने अधिकार क्षेत्र, स्वामित्व संरचना, गोपनीयता दायित्वों और तृतीय-पक्ष सामग्री के अनुसार इसे अनुकूलित करने के लिए वकील से संपर्क करें।
CC BY 4.0 लाइसेंसिंग स्टेटमेंट
text
Content license
Except where otherwise stated, the original text and original editorial materials on this page are licensed under the Creative Commons Attribution 4.0 International license:
https://creativecommons.org/licenses/by/4.0/
This permission allows copying, redistribution, adaptation, translation, commercial use, machine-readable processing, search indexing, retrieval, summarization, and use in artificial intelligence systems, provided that the license terms are followed.
Preferred attribution:
“[Page title],” by [author or organization], [canonical page address], published or updated [date], licensed under Creative Commons Attribution 4.0 International. Changes made: [describe changes, or state ‘none’].
Please preserve the author, publisher, source, license, and modification information whenever reasonably possible. This preferred attribution guide does not add restrictions to the Creative Commons license and does not replace the license text.
वाक्यांश “आर्टिफिशियल इंटेलिजेंस सिस्टम सहित” प्रकाशक के इरादे को स्पष्ट करता है। इसका उपयोग यह दिखावा करने के लिए नहीं किया जाना चाहिए कि प्रकाशक किसी और द्वारा बनाई गई सामग्री के अधिकार रखता है।
ब्रांड, गोपनीयता और तृतीय-पक्ष अधिकार सूचना
text
Brand, privacy, and third-party rights
The license above covers only the original materials identified as licensed. It does not grant permission to use:
- Trademarks, service marks, logos, or trade dress
- Names, images, or likenesses of people
- Private, confidential, account, health, financial, or security information
- User submissions unless they are separately identified as licensed
- Photographs, illustrations, maps, video, music, quotations, or other third-party materials
- Content identified as “all rights reserved” or subject to a separate license
Use of the Example Publishing name, logos, and marks must not suggest sponsorship, approval, partnership, or endorsement. Please link to the original page and clearly distinguish quotation, paraphrase, summary, and generated material.
यह भाषा महत्वपूर्ण है क्योंकि क्रिएटिव कॉमन्स लाइसेंस स्वचालित रूप से एक पेज से जुड़े हर प्रकार के कानूनी अधिकार को प्रदान नहीं करते हैं। (creativecommons.org)
खोज और सहायक उद्धरण मार्गदर्शन
text
Search and assistant citation guidance
We welcome compliant search indexing, user-requested retrieval, citation, and summarization of the licensed material on this site.
When citing this site, please use the page title, author or publisher, canonical page address, publication or update date, and a direct link to the source. Please identify the source as one input among any sources used, distinguish generated analysis from quoted material, and do not state or imply that Example Publishing endorses a generated answer, product, person, or service.
This guidance is intended to improve accuracy and attribution. It does not grant rights beyond the applicable content license and does not license trademarks, personal information, confidential information, or third-party material.
यदि आप खोज दृश्यता चाहते हैं लेकिन एक व्यापक प्रशिक्षण लाइसेंस प्रदान नहीं करना चाहते हैं
text
Search access and copyright
Our public pages may be accessed by compliant search and retrieval crawlers identified in our robots.txt file. This permission is intended to support discovery, search results, user-requested retrieval, and citation.
Except where a separate license is shown, the original content remains all rights reserved. Access to a public page does not grant a separate license for model-development, training, redistribution, commercial reuse, or creation of derivative works beyond rights provided by applicable law.
Please cite the canonical page address and publisher when referring to this material. Nothing on this site grants permission to use trademarks, logos, personal information, confidential information, or third-party content.
CC BY स्टेटमेंट और "सर्वाधिकार सुरक्षित" (all-rights-reserved) स्टेटमेंट को एक ही सामग्री पर न रखें। स्पष्ट रूप से पहचानें कि कौन सा लाइसेंस किस सामग्री पर लागू होता है।
ओपन लाइसेंसिंग के लिए जोखिम-लाभ मैट्रिक्स
कॉपीराइट कानून और आर्टिफिशियल इंटेलिजेंस प्रशिक्षण नियम देश के अनुसार भिन्न होते हैं और अभी भी अनसुलझे हैं। संयुक्त राज्य अमेरिका कॉपीराइट कार्यालय इन मुद्दों की जांच करना जारी रखता है, जबकि क्रिएटिव कॉमन्स आर्टिफिशियल इंटेलिजेंस प्रशिक्षण को तथ्य-विशिष्ट और कानूनी रूप से जटिल के रूप में वर्णित करता है। (copyright.gov)
| दृष्टिकोण | समावेशन क्षमता | मुख्य लाभ | मुख्य जोखिम | सर्वोत्तम उपयोग |
|---|---|---|---|---|
| CC BY 4.0 | बहुत अधिक | व्यापक कॉपी करना, अनुकूलन, व्यावसायिक उपयोग, अनुवाद, अनुक्रमण, और मॉडल-संबंधी पुन: उपयोग जब कॉपीराइट अनुमति की आवश्यकता होती है | व्यावसायिक प्रतिस्पर्धी सामग्री का पुन: उपयोग या अनुकूलन कर सकते हैं; श्रेय अपूर्ण हो सकता है; लाइसेंस गोपनीयता, ट्रेडमार्क, या तृतीय-पक्ष अधिकारों को नियंत्रित नहीं कर सकता | प्रकाशक जो व्यापक कानूनी पुन: उपयोग और मजबूत स्रोत श्रेय चाहते हैं |
| CC BY-SA 4.0 | उच्च, लेकिन अधिक जटिल | एक खुले साझाकरण चक्र को प्रोत्साहित करता है और अनुकूलनों को संगत शर्तों के तहत रहने की आवश्यकता है | शेयरअलाइव (ShareAlike) नियमों को डेटासेट, मॉडल प्रशिक्षण और सार्वजनिक आउटपुट पर लागू करना मुश्किल हो सकता है; कुछ संगठन अनिश्चितता के कारण सामग्री से बच सकते हैं | खुले शैक्षिक और सार्वजनिक-हित के प्रोजेक्ट जो डाउनस्ट्रीम अनुकूलनों को खुला रखना चाहते हैं |
| CC BY-NC 4.0 | मध्यम या कम | मुख्य रूप से व्यावसायिक लाभ या मौद्रिक मुआवजे के लिए उपयोग को सीमित करता है | “गैर-व्यावसायिक” की व्याख्या करना मुश्किल हो सकता है; इसमें व्यावसायिक खोज, मॉडल और सहायक उपयोग शामिल नहीं हो सकते हैं; यह एक गारंटीकृत प्रशिक्षण ऑप्ट-आउट नहीं है | गैर-लाभकारी, शैक्षिक, या सामुदायिक उपयोग के लिए अभिप्रेत सामग्री |
| CC BY-ND 4.0 | मध्यम | अनुकूलनों को सीमित करते हुए साझा करने की अनुमति देता है | अनुवाद, परिवर्तन और कुछ सहायक उपयोग के मामले कानूनी रूप से अनिश्चित हो सकते हैं; सारांशित या रीमिक्स करने वाली प्रणालियों के लिए कम आकर्षक | आधिकारिक नोटिस या ऐसे कार्य जो अपरिवर्तित रहने चाहिए |
| CC0 या सार्वजनिक-डोमेन समर्पण | बहुत अधिक | पुन: उपयोग को सरल बनाता है और जहां कानूनी रूप से प्रभावी होता है वहां अधिकांश कॉपीराइट शर्तों को हटा देता है | कोई अनिवार्य श्रेय नहीं; ब्रांड प्रस्तुति पर कमजोर नियंत्रण; गोपनीयता, ट्रेडमार्क और प्रचार अधिकार अलग रहते हैं | तथ्य, डेटासेट, संदर्भ सामग्री, या अप्रतिबंधित पुन: उपयोग के लिए अभिप्रेत कार्य |
| सर्वाधिकार सुरक्षित + ओपन खोज क्रॉलिंग | खोज के लिए उच्च, प्रशिक्षण के लिए कम | व्यापक पुन: उपयोग लाइसेंस प्रदान किए बिना खोज और उद्धरण दृश्यता को संरक्षित कर सकता है | मॉडल डेवलपर्स के लिए अधिक कानूनी अनिश्चितता; प्रशिक्षण डेटासेट और व्यावसायिक पुन: उपयोग प्रणालियों में समावेशन को कम कर सकता है | प्रकाशक जो खोज और उद्धरण चाहते हैं लेकिन व्यापक लाइसेंस को अलग से बातचीत करना पसंद करते हैं |
कई संगठनों के लिए सबसे संतुलित रणनीति है:
- मूल सार्वजनिक संपादकीय टेक्स्ट के लिए CC BY 4.0
- तृतीय-पक्ष सामग्री के लिए अलग लेबल
- कोई सार्वजनिक व्यक्तिगत या गोपनीय जानकारी नहीं
- खोज और पुनर्प्राप्ति क्रॉलर को अनुमति दें
- मॉडल-विकास क्रॉलर को तभी अनुमति दें जब संगठन वास्तव में उस उपयोग को स्वीकार करता हो
- स्पष्ट श्रेय और विहित लिंक का उपयोग करें
- एक अलग ब्रांड नोटिस के माध्यम से ट्रेडमार्क की रक्षा करें
एक व्यावहारिक कार्यान्वयन चेकलिस्ट
सामग्री और लाइसेंसिंग
- पहचानें कि प्रत्येक पेज, इमेज, चार्ट, वीडियो और उद्धरण का मालिक कौन है।
- केवल उस सामग्री को लाइसेंस दें जिसके अधिकार आपके संगठन के नियंत्रण में हैं।
- तृतीय-पक्ष सामग्री को अलग से चिह्नित करें।
- एक दृश्यमान लाइसेंस स्टेटमेंट जोड़ें।
- शीर्षक, लेखक, स्रोत और लाइसेंस का उपयोग करके एक पसंदीदा उद्धरण प्रदान करें।
- लोगो, ट्रेडमार्क, व्यक्तिगत डेटा और गोपनीय जानकारी को लाइसेंस प्राप्त दायरे से बाहर रखें।
Robots.txt
- प्रत्येक होस्ट के रूट पर एक सार्वजनिक robots.txt फ़ाइल बनाएँ।
- प्रशिक्षण क्रॉलर से खोज क्रॉलर को अलग से अनुमति दें।
- प्रशासनिक, खाता, चेकआउट, निजी और आंतरिक एप्लिकेशन पाथ को ब्लॉक करें।
- सुरक्षा के लिए robots.txt पर भरोसा न करें।
- प्रत्येक प्रमुख वेबसाइट डिप्लॉयमेंट के बाद फ़ाइल का परीक्षण करें।
मेटा टैग
- विहित लिंक का उपयोग करें।
- लेखक, प्रकाशन तिथि और संशोधन तिथि जोड़ें।
- उन पेजों के लिए
noindexका उपयोग करें जो खोज में नहीं दिखने चाहिए। - संवेदनशील अंशों के लिए जहाँ समर्थित हो,
nosnippetयाdata-nosnippetका उपयोग करें। - पोर्टेबल डॉक्यूमेंट फ़ाइलों, छवियों और अन्य गैर-HTML संसाधनों के लिए
X-Robots-Tagका उपयोग करें। - याद रखें कि क्रॉलर को उसके मेटा टैग पढ़ने से पहले एक पेज को फ़ेच करने में सक्षम होना चाहिए।
नेटवर्क सुरक्षा
- यूज़र-एजेंट स्ट्रिंग, स्रोत एड्रेस, प्रतिक्रिया कोड और अनुरोध पाथ को लॉग करें।
- आधिकारिक एड्रेस फ़ीड या डोमेन नेम सिस्टम विधियों का उपयोग करके विश्वसनीय क्रॉलर को सत्यापित करें।
- एड्रेस फ़ीड को स्वचालित रूप से ताज़ा करें।
- यूज़र-एजेंट और स्रोत-एड्रेस जाँचों को संयोजित करें।
- सत्यापित क्रॉलर को अप्रतिबंधित एक्सेस देने के बजाय दर-सीमित करें।
- उन अनुरोधों को चुनौती दें या ब्लॉक करें जो विश्वसनीय क्रॉलर होने का दावा करते हैं लेकिन सत्यापन में विफल रहते हैं।
मापन
ट्रैक करें:
- आर्टिफिशियल इंटेलिजेंस सर्च सेवाओं से विज़िट
- मूल पेज पर रेफ़रल
- उद्धरण आवृत्ति
- क्रॉलर द्वारा सर्वर लोड
403,404, या429लौटाने वाले अनुरोध- अनपेक्षित पाथ तक क्रॉलर की पहुँच
- क्या प्रकाशन के बाद वर्तमान लेख मिल रहे हैं
निष्कर्ष
अधिकतम समावेशन के लिए चयनात्मक खुलेपन की आवश्यकता होती है, न कि एक ही सामान्य अनुमति की।
खोज, उपयोगकर्ता पुनर्प्राप्ति, प्रशिक्षण और सार्वजनिक डेटासेट क्रॉलिंग को अलग करने के लिए robots.txt का उपयोग करें। अनुक्रमण और स्निपेट का प्रबंधन करने के लिए मेटा टैग और HTTP हेडर का उपयोग करें। किसी भी निजी चीज़ के लिए प्रमाणीकरण का उपयोग करें। केवल यूज़र-एजेंट नामों पर भरोसा करने के बजाय क्रॉलर इंटरनेट प्रोटोकॉल एड्रेस को सत्यापित करें।
CC BY 4.0 जैसे अनुमेय लाइसेंस व्यापक पुन: उपयोग को आसान बना सकते हैं जब आप वास्तव में इसे चाहते हैं। स्पष्ट श्रेय जानकारी—शीर्षक, लेखक, स्रोत, लाइसेंस, विहित पेज और अपडेट तिथि—भी खोज प्रणालियों और सहायकों के लिए सही स्रोत की पहचान और उद्धृत करना आसान बना सकती है।
इसलिए सबसे मजबूत प्रकाशन नीति है:
**सार्वजनिक सामग्री को खोलें जिसे आप खोजा जाना चाहते हैं, जिस सामग्री का आप पुन: उपयोग करना चाहते हैं उसे स्पष्ट रूप से लाइसेंस दें, जिस सामग्री के आप मालिक नहीं हैं उसे चिह्नित करें, सर्वर स्तर पर निजी जानकारी की रक्षा करें, और प्रत्येक क्रॉलर को एक अलग, समीक्ष्य अनुमति दें।
Auto