الترخيص والروبوتات لتحقيق أقصى قدر من الشمول: كيفية الترحيب بزواحف الذكاء الاصطناعي
تم التحديث في 25 أغسطس 2026
أصبحت مواقع الويب الآن تملك أكثر من طريقة للوصول إلى الجمهور. قد يتم العثور على صفحة من خلال بحث Google، أو تلخيصها بواسطة ChatGPT، أو الاستشهاد بها بواسطة Perplexity، أو استخدامها في بحث Claude، أو عرضها عبر خدمات Apple، أو جمعها بواسطة أرشيف ويب عام.
لا تستخدم كل هذه الأنظمة نفس الزاحف أو تتبع نفس القواعد. قد يظل موقع الويب الذي يحظر GPTBot يظهر في بحث ChatGPT إذا كان يسمح لـ OAI-SearchBot. يمكن لموقع الويب الذي يسمح لـ Applebot أن يظل مرئيًا في بحث Apple بينما يحظر Applebot-Extended من تدريب نماذج الذكاء الاصطناعي. إن Google-Extended من Google ليس زاحفًا عاديًا على الإطلاق؛ بل هو رمز تحكم في ملف robots.txt.
لذلك، فإن أفضل سياسة ليست ببساطة "السماح بالذكاء الاصطناعي" أو "حظر الذكاء الاصطناعي". بل هي إنشاء أذونات منفصلة لما يلي:
- البحث والاكتشاف
- الاسترجاع بناءً على طلب المستخدم
- تطوير النماذج وتدريبها
- مجموعات البيانات العامة
- المواد الحساسة أو الخاصة أو المقيدة
تقدم هذه المقالة قائمة جرد حالية للزواحف، وأمثلة على ملفات robots.txt، وإرشادات حول علامات الميتا، وطرق التحقق من عنوان بروتوكول الإنترنت، ونصائح حول ترخيص Creative Commons، ونموذجًا قانونيًا جاهزًا، ومصفوفة للمخاطر والفوائد.
الضوابط الأربعة التي يجب على كل ناشر فهمها
1. robots.txt يتحكم في الزحف المطلوب
يخبر ملف robots.txt العملاء الآليين الملتزمين بالصفحات التي يمكنهم طلبها. وهو مفيد لإدارة حركة مرور الزواحف والتعبير عن تفضيلات الناشر.
ومع ذلك، فإن robots.txt ليس نظامًا للتحكم في الوصول. ينص بروتوكول استبعاد الروبوتات على أن قواعده ليست تفويضًا بالوصول. تحذر Google أيضًا من أن العنوان المحظور لا يزال يمكن أن يظهر في نتائج البحث إذا كانت صفحات أخرى ترتبط به. استخدم كلمات المرور أو المصادقة أو ضوابط الوصول من جانب الخادم للمعلومات السرية. (rfc-editor.org)
2. علامات الميتا تتحكم في الفهرسة والمقتطفات
يمكن لعلامات الميتا الخاصة بالروبوتات ورأس الاستجابة X-Robots-Tag التحكم فيما إذا كانت الصفحة مفهرسة أو ما إذا كان محرك البحث يمكنه عرض مقتطف.
تكون هذه الضوابط عادةً مرئية فقط بعد السماح للزاحف بجلب الصفحة. إذا قام robots.txt بحظر الصفحة أولاً، فقد لا يرى الزاحف علامة الميتا أبدًا. (developers.google.com)
3. ضوابط الشبكة تتحقق من الزاحف
من السهل نسخ اسم وكيل المستخدم. يمكن للمهاجم إرسال طلب يدعي أنه GPTBot أو Googlebot أو PerplexityBot.
النهج الأقوى يجمع بين:
- وكيل المستخدم المُدّعى
- نطاق عنوان بروتوكول الإنترنت المنشور
- التحقق من نظام أسماء النطاقات العكسي
- التحقق من نظام أسماء النطاقات الأمامي
- حدود المعدل ومراقبة الطلبات
4. الترخيص يمنح حقوق إعادة الاستخدام
يخبر robots.txt ما يُطلب من الزاحف فعله. ويخبر الترخيص ما يمكن للأشخاص أو المنظمات فعله قانونيًا بالمادة عندما يكون إذن حقوق الطبع والنشر مطلوبًا.
هذه أدوات مختلفة. يمكن أن يقلل الترخيص المتساهل من عدم اليقين القانوني، ولكنه لا يضمن أن يزور الزاحف الصفحة، أو أن يستخدمها نموذج، أو أن يشير إليها مساعد.
قائمة جرد الزواحف الهامة
تم فحص قائمة الجرد التالية مقابل وثائق المزود المتاحة في 25 أغسطس 2026. يمكن أن تتغير أسماء وكلاء المستخدم والأغراض ونطاقات عناوين بروتوكول الإنترنت، لذا يجب أن تستخدم أنظمة الإنتاج وثائق المزود الحالية وتغذيات العناوين المباشرة.
| المزود | الزاحف أو رمز robots.txt | الغرض الرئيسي | تحكم مهم |
|---|---|---|---|
| OpenAI | OAI-SearchBot | يعثر على الصفحات ويحللها لبحث ChatGPT | اسمح به لتحسين فرصة ظهور الصفحات في نتائج بحث ChatGPT. |
| OpenAI | GPTBot | يجمع الصفحات التي قد تستخدم لتدريب نماذج الذكاء الاصطناعي التوليدي من OpenAI | السماح أو عدم السماح به بشكل منفصل عن البحث. |
| OpenAI | ChatGPT-User | يجلب الصفحات بعد أن يطلب المستخدم من ChatGPT أو GPT مخصص الوصول إليها | يتم تشغيله بواسطة المستخدم بدلاً من كونه زاحف ويب تلقائيًا، لذا قد لا تنطبق قواعد robots.txt. |
| OpenAI | OAI-AdsBot | يتحقق من صفحات الويب المقدمة كوجهات إعلانية لـ ChatGPT | ذو صلة بشكل أساسي بالمعلنين. لا يتم استخدام المحتوى المجمع لتدريب نماذج الذكاء الاصطناعي التوليدي الأساسية. |
Googlebot | زاحف بحث Google الرئيسي | يتحكم في زحف بحث Google العادي. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | الصور ومقاطع الفيديو وأخبار Google | لهذه رموز robots.txt منفصلة ويمكن التحكم فيها بشكل مستقل. | |
GoogleOther | زحف Google للأغراض العامة لفرق المنتجات المختلفة، بما في ذلك البحث والتطوير | لا يمثل منتجًا محددًا واحدًا من Google. | |
Google-Extended | يتحكم فيما إذا كان المحتوى الذي تم زحفه بواسطة Google يمكن استخدامه لتدريب نموذج Gemini وأنظمة الإسناد المعينة | إنه رمز تحكم في robots.txt، وليس وكيل مستخدم طلب منفصل. لا يؤثر على تضمين بحث Google العادي. | |
| Anthropic | ClaudeBot | يجمع محتوى الويب العام الذي قد يساهم في تطوير نموذج Claude | قم بحظره للإشارة إلى أن المواد المستقبلية يجب استبعادها من مجموعات بيانات تدريب Anthropic. |
| Anthropic | Claude-SearchBot | يحسن جودة نتائج بحث Claude | اسمح به لرؤية بحث Claude. |
| Anthropic | Claude-User | يجلب الصفحات استجابة لطلب المستخدم إلى Claude | منفصل عن الزحف التلقائي. |
| Perplexity | PerplexityBot | يفهرس الصفحات لنتائج بحث Perplexity | تقول Perplexity إن هذا الزاحف لا يستخدم لجمع المحتوى لتدريب نموذج الذكاء الاصطناعي الأساسي. |
| Perplexity | Perplexity-User | يجلب صفحة بعد أن يطلبها المستخدم | تقول وثائق Perplexity إن هذا الجالب يتجاهل عادةً robots.txt لأن الطلب بدأه المستخدم. |
| Apple | Applebot | يدعم بحث Apple و Spotlight و Siri و Safari وتجارب Apple الأخرى | اسمح به لاكتشاف Apple. |
| Apple | Applebot-Extended | يتحكم فيما إذا كان المحتوى الذي تم زحفه بواسطة Applebot يمكن استخدامه لتدريب نماذج Apple الأساسية | لا يزحف إلى الصفحات بنفسه. إنه تحكم في استخدام البيانات. |
| Common Crawl | CCBot | يجمع بيانات الويب العامة لأرشيف الويب المفتوح لـ Common Crawl | إنه ليس مساعدًا، ولكن يمكن استخدام مجموعات بياناته من قبل الباحثين ومطوري الذكاء الاصطناعي. |
| Microsoft | Bingbot | زاحف بحث Bing الرئيسي | اسمح به لاكتشاف Bing ورؤية البحث. |
| Microsoft | MicrosoftPreview, BingVideoPreview | معاينات الصفحات والفيديو لمنتجات Microsoft | يمكن التحكم في هذه بشكل منفصل عن Bingbot. |
| Amazon | Amzn-SearchBot | بحث Amazon واكتشاف المحتوى | تقول Amazon إنها لا تزحف إلى المحتوى لتدريب نماذج الذكاء الاصطناعي التوليدي. |
| Amazon | Amzn-User | يجلب المعلومات الحالية استجابة لإجراءات المستخدم، بما في ذلك طلبات Alexa | يتم تشغيله بواسطة المستخدم ومنفصل عن زحف البحث التلقائي. |
توثق OpenAI زواحف البحث والتدريب والإعلان والزواحف التي يشغلها المستخدم كضوابط منفصلة. توصي وثائقها صراحة بالسماح لـ OAI-SearchBot لبحث ChatGPT أثناء استخدام GPTBot بشكل منفصل لتفضيلات التدريب. (developers.openai.com)
تفصل Google بالمثل بين Googlebot و GoogleOther و Google-Extended. لا يمتلك Google-Extended وكيل مستخدم خاصًا به لطلب HTTP، وحظره لا يزيل صفحة من بحث Google. (developers.google.com)
توثق Anthropic أدوارًا منفصلة لكل من ClaudeBot و Claude-SearchBot و Claude-User. وتذكر Anthropic أيضًا أن روبوتاتها تتبع robots.txt وتدعم توجيه Crawl-delay غير القياسي. (support.anthropic.com)
تميز Perplexity بين زحف البحث التلقائي والجلب الذي يطلبه المستخدم. وتقول وثائقها الحالية إن PerplexityBot يحترم robots.txt، بينما لا يفعل Perplexity-User ذلك عادةً لأنه يستجيب لطلب المستخدم. (docs.perplexity.ai)
تتبع وثائق Apple الحالية نفس التمييز بين البحث والتدريب: يدعم Applebot الاكتشاف، بينما يسمح Applebot-Extended للناشرين بالتحكم في استخدام التدريب دون إزالة الصفحات من بحث Apple. (support.apple.com)
تكوينات robots.txt الموصى بها
ضع robots.txt في جذر كل مضيف، مثل:
text https://www.example.org/robots.txt
تنطبق القواعد على المضيف والبروتوكول والمنفذ المحدد حيث يتم تقديم الملف. قد يحتاج النطاق الفرعي المنفصل إلى ملف خاص به. (developers.google.com)
التكوين 1: أقصى قدر من الشمول
استخدم هذا عندما يمكن العثور على المحتوى التحريري العام وتلخيصه والاستشهاد به وفهرسته وجمعه بواسطة الزواحف المتوافقة.
text
الصفحات العامة متاحة للزواحف المتوافقة.
User-agent: * Allow: /
ابعد المسارات الخاصة والمعاملاتية والإدارية.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
يسمح هذا لزواحف محددة، بما في ذلك OpenAI و Google و Anthropic و Perplexity و Apple و Common Crawl و Microsoft و Amazon، ما لم تحظرها قاعدة أخرى محددة.
لا تضع قاعدة عامة مثل User-agent: * Disallow: / أسفل هذا التكوين. فقد تغير مجموعة لاحقة أو أكثر تحديدًا كيفية تفسير الزاحف للملف.
التكوين 2: السماح بالبحث ولكن حظر زواحف تطوير النماذج
غالبًا ما يكون هذا هو أفضل حل وسط للناشرين الذين يرغبون في الاستشهادات وحركة مرور البحث ولكن لا يريدون الإشارة إلى الإذن بجمع محتوى لتطوير النماذج.
text
حظر زحف تطوير نموذج OpenAI.
User-agent: GPTBot Disallow: /
حظر زحف تطوير نموذج Anthropic.
User-agent: ClaudeBot Disallow: /
حظر تدريب نماذج Google واستخدامات الإسناد ذات الصلة.
User-agent: Google-Extended Disallow: /
حظر استخدام تدريب نماذج Apple الأساسية.
User-agent: Applebot-Extended Disallow: /
اختياري: حظر جمع مجموعات بيانات Common Crawl.
User-agent: CCBot
Disallow: /
السماح بالبحث العادي وزحف الاسترجاع، باستثناء المسارات الحساسة.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
يترك هذا التكوين OAI-SearchBot و Claude-SearchBot و PerplexityBot و Googlebot و Applebot مغطاة بواسطة المجموعة الشاملة. كما أنه يبقي أذونات البحث والتدريب منفصلة.
بالنسبة لـ Apple، فإن حظر Applebot-Extended مع السماح بـ Applebot يحافظ على الاكتشاف من خلال خدمات Apple. وبالنسبة لـ Google، فإن حظر Google-Extended لا يحظر بحث Google العادي. (developers.google.com)
التكوين 3: السماح صراحةً لزواحف بحث مختارة
إذا كان ملف robots.txt موجودًا يحظر جميع الزواحف، أضف مجموعات منفصلة لزواحف البحث التي ترغب في الترحيب بها.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
ابقِ جميع الزواحف الأخرى خارجًا.
User-agent: * Disallow: /
عند استخدام مجموعات محددة، كرر قواعد المسارات الحساسة داخل كل مجموعة. تستخدم بعض الزواحف المجموعة الأكثر تحديدًا المطابقة بدلاً من دمجها مع المجموعة الشاملة. توثق Bing هذا السلوك مباشرةً، وتقدم Google إرشادات منفصلة حول المجموعات الخاصة بالزواحف. (bing.com)
قيود robots.txt الهامة
- يمكن للزاحف تجاهل robots.txt.
- يمكن للزاحف الضار أن يتظاهر بأنه زاحف موثوق به.
- لا يزال من الممكن معرفة الصفحة المحظورة من خلال عنوانها أو عنوان الويب الخاص بها.
- لا يحمي robots.txt كلمات المرور أو الملفات الخاصة أو سجلات العملاء أو واجهات برمجة التطبيقات السرية.
- توجيه
Crawl-delayليس جزءًا من بروتوكول استبعاد الروبوتات الأساسي ولا تدعمه كل الزواحف. توثق Anthropic و Bing دعمه، بينما تقول Apple إن Applebot لا يتبع تأخير الزحف. (rfc-editor.org)
علامات الميتا ورؤوس HTTP
مثال لصفحة عامة
لمقالة عامة، استخدم عنوانًا واضحًا، ومؤلفًا، وعنوان ويب أساسيًا، وتاريخ نشر، وتاريخ تعديل.
html
يتم توثيق توجيه max-snippet بشكل أساسي لـ Google. لا تفترض أن كل زاحف ذكاء اصطناعي يدعم كل توجيه ميتا.
مثال لصفحة خاصة أو حساسة
html
استخدم هذا للصفحات التي لا يجب أن تظهر في نتائج البحث. يجب أن تظل الصفحة قابلة للزحف لفترة كافية ليتمكن الزاحف من رؤية التوجيه. إذا كان يجب أن تظل الصفحة خاصة حقًا، استخدم المصادقة أو حماية بكلمة مرور بدلاً من ذلك. (developers.google.com)
إخفاء الأقسام الحساسة فقط من مقتطفات البحث
تدعم Google data-nosnippet لأجزاء محددة من صفحة HTML:
html
This paragraph may be shown in a search result.
هذا مفيد لتفاصيل الاتصال أو الملاحظات الداخلية أو المعلومات التي ينشئها المستخدم. إنه ليس تعليمات عالمية لكل نظام ذكاء اصطناعي. (developers.google.com)
استخدم رأس X-Robots-Tag للملفات
لا يمكن وضع علامات الميتا داخل ملف وثيقة محمولة أو صورة أو ملف فيديو. استخدم رأس استجابة HTTP بدلاً من ذلك:
text X-Robots-Tag: noindex, nosnippet
لصفحة يجب أن تظل قابلة للبحث ولكن لا ينبغي أن توفر نصًا للمقتطفات أو إجابات الذكاء الاصطناعي، استخدم:
text X-Robots-Tag: nosnippet
توثق Google X-Robots-Tag للموارد غير HTML، وتدعمه Apple أيضًا لـ Applebot. (developers.google.com)
ضوابط خاصة بـ Apple
تدعم Apple:
html
تقول Apple إن nosnippet يمنع استخدام الصفحة كسياق إضافي ومحتوى حالي عندما تنتج نماذج Apple مخرجات. قد تظل الصفحة قابلة للاكتشاف من خلال بحث Apple و Spotlight و Siri و Safari. (support.apple.com)
بالنسبة للصفحات المدفوعة، تدعم Apple أيضًا البيانات المهيكلة باستخدام:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
تقول Apple إن مثل هذه الصفحات قد تظل مؤهلة لنتائج البحث ولكن لن تستخدم كسياق إضافي لإجابات الذكاء الاصطناعي. (support.apple.com)
كيفية التحقق من عناوين بروتوكول الإنترنت للزواحف
لماذا مطابقة وكيل المستخدم ليست كافية
قاعدة كهذه ضعيفة:
text if User-Agent contains "GPTBot": allow
يمكن لأي شخص إرسال هذا النص. القاعدة الأفضل هي:
text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block
لا تثق برأس X-Forwarded-For ما لم يأتِ من وكيل أو شبكة توصيل محتوى تتحكم فيها مؤسستك.
طرق التحقق من المزود
| المزود | طريقة التحقق الموصى بها |
|---|---|
| OpenAI | استخدم تغذيات عناوين بروتوكول الإنترنت المباشرة المنشورة في وثائق زواحف OpenAI لـ OAI-SearchBot و GPTBot و OAI-AdsBot. قم بتحديثها تلقائيًا بدلاً من نسخ نطاقات ثابتة في جدار حماية. |
| استخدم نطاقات زواحف Google المنشورة أو قم بإجراء عمليات فحص نظام أسماء النطاقات العكسية والأمامية. يجب أن يتم حل زاحف Google الأصلي إلى اسم مضيف Google معتمد وأن يتم حله مرة أخرى إلى العنوان الأصلي. | |
| Anthropic | استخدم تغذية عناوين الزاحف المنشورة حاليًا كفحص شبكة ثانوي. تظل طريقة إلغاء الاشتراك الأساسية لـ Anthropic هي robots.txt. |
| Perplexity | ادمج وكيل المستخدم مع تغذية عناوين PerplexityBot أو Perplexity-User الحالية. توصي Perplexity تحديدًا بدمج كلا الشرطين في قاعدة جدار حماية تطبيقات الويب. |
| Apple | استخدم التحقق من نظام أسماء النطاقات العكسي ضمن applebot.apple.com، ثم قم بإجراء بحث أمامي. تنشر Apple أيضًا نطاقات العناوين الحالية في تغذية JSON. |
| Common Crawl | استخدم التحقق من نظام أسماء النطاقات العكسي ضمن crawl.commoncrawl.org وتغذية عناوين CCBot الحالية. تشير Common Crawl إلى أن التحقق العكسي غير متاح بعد لبعض حركة مرور IPv6. |
| Microsoft | استخدم أداة التحقق من Bingbot الرسمية أو طرق البحث العكسي والأمامي الموثقة من Microsoft. |
| Amazon | استخدم قوائم عناوين زواحف Amazon المنشورة وطابقها مع وكيل المستخدم المناسب من Amazon. |
تنشر Google و Apple و Common Crawl و OpenAI و Anthropic و Perplexity جميعها طرقًا خاصة بالمزود أو تغذيات عناوين. يمكن أن تتغير هذه القوائم، لذا فإن عملية التحديث المجدولة أكثر أمانًا من قائمة منسوخة يدويًا بشكل دائم. (developers.google.com)
قد يبدو تصميم جدار حماية بسيط كما يلي:
text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match
rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers
لا تطبق قاعدة سماح واسعة على مزود سحابي بأكمله. قد يستخدم زاحف شرعي بنية تحتية سحابية، ولكن معظم حركة المرور من هذا المزود السحابي ليست بالضرورة الزاحف.
كيف يؤثر الترخيص المفتوح على الشمول
CC BY 4.0 بلغة بسيطة
ترخيص Creative Commons Attribution 4.0 International، ويسمى عادةً CC BY 4.0، يسمح للأشخاص بما يلي:
- نسخ العمل وإعادة توزيعه
- تعديله وترجمته وإعادة مزجه والبناء عليه
- استخدامه تجاريًا
الشروط الرئيسية هي:
- ذكر المصدر بشكل مناسب
- ربط الترخيص
- الإشارة إلى ما إذا كانت هناك تغييرات قد أجريت
- عدم الإيحاء بأن المبدع الأصلي يؤيد إعادة الاستخدام
- عدم إضافة قيود قانونية أو تقنية تمنع الاستخدامات المسموح بها بموجب الترخيص
تحذر Creative Commons أيضًا من أن الترخيص قد لا يغطي حقوق الخصوصية، وحقوق الدعاية، والحقوق المعنوية، وحقوق العلامات التجارية، وحقوق براءات الاختراع، أو مواد الطرف الثالث. (creativecommons.org)
الترخيص ليس دعوة للزاحف بحد ذاته
وضع "CC BY 4.0" على صفحة لا يضمن أن مؤسسة ما ستزحف إليها. قد يظل الزاحف محظورًا بواسطة:
- robots.txt
- شبكة توصيل المحتوى (CDN)
- جدار حماية تطبيقات الويب (WAF)
- تحديد المعدل (Rate limiting)
- تحدي JavaScript
- جدار تسجيل الدخول
- استجابة خادم ضعيفة
- خريطة موقع غير قابلة للوصول
على العكس من ذلك، فإن السماح للزاحف لا يمنح تلقائيًا كل إذن حقوق طبع ونشر مطلوب لكل استخدام لاحق. يجب تصميم robots.txt والترخيص معًا.
لماذا يمكن أن يدعم CC BY شمولاً أوسع
يمكن أن يجعل الترخيص المتساهل الواضح سياسة الناشر أسهل للفهم من قبل فرق البيانات وأنظمة البحث ومشغلي المساعدين. يمكن أن يقلل من عدم اليقين بشأن النسخ والتكيف والاستخدام التجاري والترجمة وإعادة التوزيع عندما تتطلب هذه الأنشطة إذن حقوق الطبع والنشر.
ومع ذلك، توضح Creative Commons أن تدريب الذكاء الاصطناعي معقد قانونيًا. الترخيص المقيد ليس دائمًا طريقة فعالة لمنع التدريب، لأن بعض استخدامات التدريب قد تكون مسموحًا بها بموجب استثناءات أو قيود حقوق الطبع والنشر. تشير Creative Commons أيضًا إلى أن شروط الترخيص قد يكون من الصعب تطبيقها على تدريب الآلة ومخرجات النموذج. (creativecommons.org)
الدرس العملي هو:
استخدم CC BY عندما ترغب حقًا في إعادة استخدام قانونية واسعة النطاق. لا تستخدم ترخيص Creative Commons مقيدًا كخيار مضمون لعدم تدريب الذكاء الاصطناعي.
الإسناد يحسن وضوح المصدر
توصي Creative Commons بطريقة TASL:
- العنوان (Title)
- المؤلف (Author)
- المصدر (Source)
- الترخيص (License)
على سبيل المثال:
"الترخيص والروبوتات لتحقيق أقصى قدر من الشمول"، Example Publishing، https://www.example.org/articles/ai-crawlers، مرخص بموجب Creative Commons Attribution 4.0 International. التغييرات التي أجريت: تم تحديث قائمة جرد الزواحف.
الإسناد الواضح لا يجبر كل مساعد على الاستشهاد بصفحة. ولكنه يجعل الاستشهاد الصحيح أسهل عندما يستخرج النظام عنوان الصفحة ومؤلفها ومصدرها ومعلومات الترخيص. (wiki.creativecommons.org)
أضف معلومات مقالة مهيكلة
استخدم المعلومات المرئية والبيانات المهيكلة معًا:
html
توصي Google بمعلومات مؤلف واضحة، وصفحات المؤلفين، وتواريخ النشر، وتواريخ التعديل، والصفحات الأساسية المستقرة. يمكن لهذه الإشارات أن تساعد أنظمة البحث على فهم من أنشأ المادة وأي إصدار هو المعتمد. وهي لا تضمن ترتيبًا أو تضمينًا أو استشهادًا. (developers.google.com)
نموذج قانوني جاهز لموقع مفتوح وصديق للاقتباس
ما يلي هو نص نموذجي، وليس استشارة قانونية. اطلب من محامٍ تكييفه مع اختصاصك القضائي وهيكل الملكية والتزامات الخصوصية ومحتوى الطرف الثالث.
بيان ترخيص CC BY 4.0
text
Content license
Except where otherwise stated, the original text and original editorial materials on this page are licensed under the Creative Commons Attribution 4.0 International license:
https://creativecommons.org/licenses/by/4.0/
This permission allows copying, redistribution, adaptation, translation, commercial use, machine-readable processing, search indexing, retrieval, summarization, and use in artificial intelligence systems, provided that the license terms are followed.
Preferred attribution:
“[Page title],” by [author or organization], [canonical page address], published or updated [date], licensed under Creative Commons Attribution 4.0 International. Changes made: [describe changes, or state ‘none’].
Please preserve the author, publisher, source, license, and modification information whenever reasonably possible. This preferred attribution guide does not add restrictions to the Creative Commons license and does not replace the license text.
توضح عبارة "بما في ذلك أنظمة الذكاء الاصطناعي" نية الناشر. ولا ينبغي استخدامها للتظاهر بأن الناشر يمتلك حقوق مواد أنشأها شخص آخر.
إشعار حقوق العلامة التجارية والخصوصية والطرف الثالث
text
Brand, privacy, and third-party rights
The license above covers only the original materials identified as licensed. It does not grant permission to use:
- Trademarks, service marks, logos, or trade dress
- Names, images, or likenesses of people
- Private, confidential, account, health, financial, or security information
- User submissions unless they are separately identified as licensed
- Photographs, illustrations, maps, video, music, quotations, or other third-party materials
- Content identified as “all rights reserved” or subject to a separate license
Use of the Example Publishing name, logos, and marks must not suggest sponsorship, approval, partnership, or endorsement. Please link to the original page and clearly distinguish quotation, paraphrase, summary, and generated material.
هذه اللغة مهمة لأن تراخيص Creative Commons لا تمنح تلقائيًا كل نوع من الحقوق القانونية المتعلقة بصفحة. (creativecommons.org)
إرشادات الاقتباس للبحث والمساعد
text
Search and assistant citation guidance
We welcome compliant search indexing, user-requested retrieval, citation, and summarization of the licensed material on this site.
When citing this site, please use the page title, author or publisher, canonical page address, publication or update date, and a direct link to the source. Please identify the source as one input among any sources used, distinguish generated analysis from quoted material, and do not state or imply that Example Publishing endorses a generated answer, product, person, or service.
This guidance is intended to improve accuracy and attribution. It does not grant rights beyond the applicable content license and does not license trademarks, personal information, confidential information, or third-party material.
إذا كنت ترغب في رؤية البحث ولكن لا ترغب في منح ترخيص تدريب واسع
text
Search access and copyright
Our public pages may be accessed by compliant search and retrieval crawlers identified in our robots.txt file. This permission is intended to support discovery, search results, user-requested retrieval, and citation.
Except where a separate license is shown, the original content remains all rights reserved. Access to a public page does not grant a separate license for model-development, training, redistribution, commercial reuse, or creation of derivative works beyond rights provided by applicable law.
Please cite the canonical page address and publisher when referring to this material. Nothing on this site grants permission to use trademarks, logos, personal information, confidential information, or third-party content.
لا تضع بيان CC BY وبيان "جميع الحقوق محفوظة" على نفس المادة. حدد بوضوح الترخيص الذي ينطبق على أي محتوى.
مصفوفة المخاطر والفوائد للترخيص المفتوح
تختلف قوانين حقوق الطبع والنشر وقواعد تدريب الذكاء الاصطناعي حسب البلد ولا تزال غير مستقرة. يواصل مكتب حقوق الطبع والنشر بالولايات المتحدة فحص هذه القضايا، بينما تصف Creative Commons تدريب الذكاء الاصطناعي بأنه يعتمد على الحقائق ومعقد قانونيًا. (copyright.gov)
| النهج | إمكانية الشمول | الفوائد الرئيسية | المخاطر الرئيسية | الأنسب لـ |
|---|---|---|---|---|
| CC BY 4.0 | عالية جدًا | النسخ الواسع، التكيف، الاستخدام التجاري، الترجمة، الفهرسة، وإعادة الاستخدام المتعلقة بالنموذج عند الحاجة لإذن حقوق الطبع والنشر | قد يعيد المنافسون التجاريون استخدام المحتوى أو تكييفه؛ قد يكون الإسناد غير كامل؛ لا يمكن للترخيص التحكم في الخصوصية أو العلامة التجارية أو حقوق الطرف الثالث | الناشرون الذين يرغبون في أوسع نطاق لإعادة الاستخدام القانوني والإسناد القوي للمصدر |
| CC BY-SA 4.0 | عالية، ولكن أكثر تعقيدًا | تشجع دورة مشاركة مفتوحة وتتطلب أن تظل التعديلات بموجب شروط متوافقة | قد يكون من الصعب تطبيق قواعد ShareAlike على مجموعات البيانات، وتدريب النماذج، والمخرجات العامة؛ قد تتجنب بعض المنظمات المادة بسبب عدم اليقين | المشاريع التعليمية والمصلحة العامة المفتوحة التي ترغب في أن تظل التعديلات اللاحقة مفتوحة |
| CC BY-NC 4.0 | متوسطة أو منخفضة | تحد من الاستخدامات المخصصة بشكل أساسي للمنفعة التجارية أو التعويض النقدي | قد يكون من الصعب تفسير "غير التجاري"؛ قد يستبعد البحث التجاري، واستخدامات النموذج والمساعد؛ إنه ليس خيارًا مضمونًا لعدم تدريب الذكاء الاصطناعي | المواد المخصصة للاستخدام غير الربحي أو التعليمي أو المجتمعي |
| CC BY-ND 4.0 | متوسطة | يسمح بالمشاركة مع تقييد التعديلات | الترجمة والتحويل وبعض حالات استخدام المساعد قد تصبح غير مؤكدة قانونيًا؛ أقل جاذبية للأنظمة التي تلخص أو تعيد مزج | الإشعارات الرسمية أو الأعمال التي يجب أن تظل دون تغيير |
| CC0 أو تخصيص المجال العام | عالية جدًا | يبسط إعادة الاستخدام ويزيل معظم شروط حقوق الطبع والنشر حيث يكون فعالاً قانونيًا | لا يلزم الإسناد؛ تحكم ضعيف في عرض العلامة التجارية؛ تظل حقوق الخصوصية والعلامة التجارية والدعاية منفصلة | الحقائق، مجموعات البيانات، المواد المرجعية، أو الأعمال المخصصة لإعادة الاستخدام غير المقيدة |
| جميع الحقوق محفوظة بالإضافة إلى زحف البحث المفتوح | عالية للبحث، أقل للتدريب | يمكن أن يحافظ على رؤية البحث والاستشهاد دون منح ترخيص إعادة استخدام واسع | عدم يقين قانوني أكبر لمطوري النماذج؛ قد يقلل من التضمين في مجموعات بيانات التدريب وأنظمة إعادة الاستخدام التجارية | الناشرون الذين يرغبون في الاكتشاف والاستشهادات ولكن يفضلون التفاوض على تراخيص أوسع بشكل منفصل |
الاستراتيجية الأكثر توازنًا للعديد من المنظمات هي:
- CC BY 4.0 للنص التحريري العام الأصلي
- ملصقات منفصلة لمواد الطرف الثالث
- لا توجد معلومات شخصية أو سرية عامة
- السماح بزواحف البحث والاسترجاع
- السماح لزواحف تطوير النموذج فقط إذا كانت المنظمة تقبل هذا الاستخدام حقًا
- استخدام إسناد واضح وروابط أساسية
- حماية العلامات التجارية من خلال إشعار علامة تجارية منفصل
قائمة التحقق من التنفيذ العملي
المحتوى والترخيص
- تحديد من يمتلك كل صفحة وصورة ومخطط وفيديو واقتباس.
- ترخيص المواد التي تتحكم مؤسستك في حقوقها فقط.
- وضع علامة على مواد الطرف الثالث بشكل منفصل.
- إضافة بيان ترخيص مرئي.
- توفير اقتباس مفضل باستخدام العنوان والمؤلف والمصدر والترخيص.
- إبقاء الشعارات والعلامات التجارية والبيانات الشخصية والمعلومات السرية خارج نطاق الترخيص.
Robots.txt
- إنشاء ملف robots.txt عام في جذر كل مضيف.
- السماح لزواحف البحث بشكل منفصل عن زواحف التدريب.
- حظر مسارات التطبيقات الإدارية والحساب والخروج والخاصة والداخلية.
- لا تعتمد على robots.txt للأمان.
- اختبار الملف بعد كل عملية نشر رئيسية للموقع.
علامات الميتا
- استخدم الروابط الأساسية.
- أضف المؤلف وتاريخ النشر وتاريخ التعديل.
- استخدم
noindexللصفحات التي لا يجب أن تظهر في البحث. - استخدم
nosnippetأوdata-nosnippetللمقتطفات الحساسة حيثما تدعمها. - استخدم
X-Robots-Tagلملفات الوثائق المحمولة والصور والموارد الأخرى غير HTML. - تذكر أن الزاحف يجب أن يكون قادرًا على جلب صفحة قبل أن يتمكن من قراءة علامات الميتا الخاصة بها.
أمان الشبكة
- تسجيل سلاسل وكلاء المستخدم وعناوين المصدر ورموز الاستجابة ومسارات الطلبات.
- التحقق من الزواحف الموثوقة باستخدام تغذيات العناوين الرسمية أو طرق نظام أسماء النطاقات.
- تحديث تغذيات العناوين تلقائيًا.
- الجمع بين فحوصات وكيل المستخدم وعنوان المصدر.
- تحديد معدل الزواحف المتحقق منها بدلاً من منحها وصولاً غير مقيد.
- تحدي أو حظر الطلبات التي تدعي أنها زواحف موثوقة ولكن تفشل في التحقق.
القياس
تتبع:
- الزيارات من خدمات بحث الذكاء الاصطناعي
- الإحالات إلى الصفحة الأصلية
- تكرار الاقتباس
- حمل الخادم حسب الزاحف
- الطلبات التي تعيد
403أو404أو429 - وصول الزاحف إلى مسارات غير مقصودة
- ما إذا كان يتم العثور على المقالات الحالية بعد النشر
الخلاصة
يتطلب أقصى قدر من الشمول انفتاحًا انتقائيًا، وليس إذنًا شاملاً واحدًا.
استخدم robots.txt لفصل البحث، واسترجاع المستخدم، والتدريب، وزحف مجموعات البيانات العامة. استخدم علامات الميتا ورؤوس HTTP لإدارة الفهرسة والمقتطفات. استخدم المصادقة لأي شيء خاص. تحقق من عناوين بروتوكول الإنترنت للزواحف بدلاً من الثقة بأسماء وكلاء المستخدم وحدها.
يمكن أن يجعل الترخيص المتساهل مثل CC BY 4.0 إعادة الاستخدام الواسع أسهل عندما ترغب في ذلك حقًا. يمكن لمعلومات الإسناد الواضحة - العنوان والمؤلف والمصدر والترخيص والصفحة الأساسية وتاريخ التحديث - أن تجعل من السهل على أنظمة البحث والمساعدين تحديد المصدر الصحيح والاستشهاد به.
لذلك، فإن أقوى سياسة نشر هي:
**افتح المحتوى العام الذي ترغب في اكتشافه، وقم بترخيص المواد التي ترغب في إعادة استخدامها بوضوح، وضع علامة على المواد التي لا تمتلكها، واحمِ المعلومات الخاصة على مستوى الخادم، وامنح كل زاحف إذنًا منفصلاً وقابلاً للمراجعة.
Auto