Αδειοδότηση και Robots για Μέγιστη Συμπερίληψη: Πώς να Υποδεχτείτε τους Ανιχνευτές Τεχνητής Νοημοσύνης
Ενημερώθηκε 25 Αυγούστου 2026
Οι ιστότοποι έχουν πλέον περισσότερους από έναν τρόπους να προσεγγίσουν ένα κοινό. Μια σελίδα μπορεί να βρεθεί μέσω της Αναζήτησης Google, να συνοψιστεί από το ChatGPT, να παρατεθεί από το Perplexity, να χρησιμοποιηθεί στην αναζήτηση Claude, να εμφανιστεί μέσω των υπηρεσιών της Apple, ή να συλλεχθεί από ένα δημόσιο αρχείο ιστού.
Όλα αυτά τα συστήματα δεν χρησιμοποιούν τον ίδιο ανιχνευτή ούτε ακολουθούν τους ίδιους κανόνες. Ένας ιστότοπος που μπλοκάρει το GPTBot μπορεί να εξακολουθεί να εμφανίζεται στην αναζήτηση του ChatGPT εάν επιτρέπει το OAI-SearchBot. Ένας ιστότοπος που επιτρέπει το Applebot μπορεί να παραμείνει ορατός στην Αναζήτηση Apple ενώ μπλοκάρει το Applebot-Extended από την εκπαίδευση μοντέλων τεχνητής νοημοσύνης. Το Google-Extended της Google δεν είναι καθόλου ένας κανονικός ανιχνευτής· είναι ένα διακριτικό ελέγχου robots.txt.
Η καλύτερη πολιτική επομένως δεν είναι απλώς «να επιτρέπεται η τεχνητή νοημοσύνη» ή «να μπλοκάρεται η τεχνητή νοημοσύνη». Είναι η δημιουργία ξεχωριστών δικαιωμάτων για:
- Αναζήτηση και ανακάλυψη
- Ανάκτηση κατόπιν αιτήματος χρήστη
- Ανάπτυξη και εκπαίδευση μοντέλων
- Δημόσια σύνολα δεδομένων
- Ευαίσθητο, ιδιωτικό ή περιορισμένο υλικό
Αυτό το άρθρο παρέχει μια τρέχουσα απογραφή ανιχνευτών, παραδείγματα robots.txt, οδηγίες για μετα-ετικέτες, μεθόδους επαλήθευσης διευθύνσεων Διαδικτυακού Πρωτοκόλλου, συμβουλές αδειοδότησης Creative Commons, νομικό πρότυπο και έναν πίνακα κινδύνου-οφέλους.
Οι Τέσσερις Έλεγχοι που Πρέπει να Κατανοεί Κάθε Εκδότης
1. Το robots.txt ελέγχει την αιτούμενη ανίχνευση
Ένα αρχείο robots.txt ενημερώνει τους συμβατούς αυτοματοποιημένους πελάτες ποιες σελίδες μπορούν να ζητήσουν. Είναι χρήσιμο για τη διαχείριση της κυκλοφορίας των ανιχνευτών και την έκφραση των προτιμήσεων ενός εκδότη.
Ωστόσο, το robots.txt δεν είναι ένα σύστημα ελέγχου πρόσβασης. Το Πρωτόκολλο Αποκλεισμού Robots δηλώνει ότι οι κανόνες του δεν αποτελούν εξουσιοδότηση πρόσβασης. Η Google προειδοποιεί επίσης ότι μια μπλοκαρισμένη διεύθυνση μπορεί να εμφανίζεται ακόμα στα αποτελέσματα αναζήτησης εάν άλλες σελίδες συνδέονται με αυτήν. Χρησιμοποιήστε κωδικούς πρόσβασης, έλεγχο ταυτότητας ή ελέγχους πρόσβασης από την πλευρά του διακομιστή για εμπιστευτικές πληροφορίες. (rfc-editor.org)
2. Οι μετα-ετικέτες ελέγχουν την ευρετηρίαση και τα αποσπάσματα
Οι μετα-ετικέτες robots και η κεφαλίδα απάντησης X-Robots-Tag μπορούν να ελέγξουν αν μια σελίδα ευρετηριάζεται ή αν μια μηχανή αναζήτησης μπορεί να εμφανίσει ένα απόσπασμα.
Αυτοί οι έλεγχοι είναι συνήθως ορατοί μόνο αφού επιτραπεί σε έναν ανιχνευτή να ανακτήσει τη σελίδα. Εάν το robots.txt μπλοκάρει τη σελίδα πρώτα, ο ανιχνευτής μπορεί να μην δει ποτέ τη μετα-ετικέτα. (developers.google.com)
3. Οι έλεγχοι δικτύου επαληθεύουν τον ανιχνευτή
Ένα όνομα user-agent είναι εύκολο να αντιγραφεί. Ένας επιτιθέμενος μπορεί να στείλει ένα αίτημα ισχυριζόμενος ότι είναι GPTBot, Googlebot, ή PerplexityBot.
Μια ισχυρότερη προσέγγιση συνδυάζει:
- Τον ισχυριζόμενο user-agent
- Ένα δημοσιευμένο εύρος διευθύνσεων Διαδικτυακού Πρωτοκόλλου
- Επαλήθευση αντίστροφου Domain Name System
- Επαλήθευση εμπρόσθιου Domain Name System
- Όρια ρυθμού και παρακολούθηση αιτημάτων
4. Μια άδεια παραχωρεί δικαιώματα επανάχρησης
Το Robots.txt δηλώνει τι ζητείται από έναν ανιχνευτή να κάνει. Μια άδεια δηλώνει τι μπορούν νόμιμα να κάνουν άτομα ή οργανισμοί με υλικό όταν απαιτείται άδεια πνευματικών δικαιωμάτων.
Αυτά είναι διαφορετικά εργαλεία. Μια επιτρεπτική άδεια μπορεί να μειώσει τη νομική αβεβαιότητα, αλλά δεν εγγυάται ότι ένας ανιχνευτής θα επισκεφθεί τη σελίδα, ότι ένα μοντέλο θα τη χρησιμοποιήσει ή ότι ένας βοηθός θα την παραθέσει.
Απογραφή Σημαντικών Ανιχνευτών
Η ακόλουθη απογραφή ελέγχθηκε έναντι της τεκμηρίωσης του παρόχου που ήταν διαθέσιμη στις 25 Αυγούστου 2026. Τα ονόματα user-agent, οι σκοποί και τα εύρη διευθύνσεων Διαδικτυακού Πρωτοκόλλου μπορούν να αλλάξουν, οπότε τα συστήματα παραγωγής πρέπει να χρησιμοποιούν την τρέχουσα τεκμηρίωση του παρόχου και τις ζωντανές ροές διευθύνσεων.
| Πάροχος | Ανιχνευτής ή διακριτικό robots.txt | Κύριος σκοπός | Σημαντικός έλεγχος |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Βρίσκει και αναλύει σελίδες για την αναζήτηση ChatGPT | Επιτρέψτε το για να βελτιώσετε την πιθανότητα οι σελίδες να εμφανίζονται στα αποτελέσματα αναζήτησης ChatGPT. |
| OpenAI | GPTBot | Συλλέγει σελίδες που μπορούν να χρησιμοποιηθούν για την εκπαίδευση των γεννητικών μοντέλων τεχνητής νοημοσύνης της OpenAI | Επιτρέψτε ή απαγορεύστε ξεχωριστά από την αναζήτηση. |
| OpenAI | ChatGPT-User | Ανακτά σελίδες αφού ένας χρήστης ζητήσει από το ChatGPT ή ένα προσαρμοσμένο GPT να τις προσπελάσει | Ενεργοποιείται από τον χρήστη και όχι από αυτόματο ανιχνευτή ιστού, οπότε οι κανόνες robots.txt ενδέχεται να μην ισχύουν. |
| OpenAI | OAI-AdsBot | Ελέγχει ιστοσελίδες που υποβάλλονται ως προορισμοί διαφήμισης ChatGPT | Σχετικό κυρίως με τους διαφημιστές. Το συλλεχθέν περιεχόμενο δεν χρησιμοποιείται για την εκπαίδευση θεμελιωδών μοντέλων γεννητικής τεχνητής νοημοσύνης. |
Googlebot | Κύριος ανιχνευτής Αναζήτησης Google | Ελέγχει την κανονική ανίχνευση Αναζήτησης Google. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Εικόνες, βίντεο και Ειδήσεις Google | Αυτοί έχουν ξεχωριστά διακριτικά robots.txt και μπορούν να ελεγχθούν ανεξάρτητα. | |
GoogleOther | Ανίχνευση γενικού σκοπού της Google για διάφορες ομάδες προϊόντων, συμπεριλαμβανομένης της έρευνας και ανάπτυξης | Δεν αντιπροσωπεύει ένα συγκεκριμένο προϊόν της Google. | |
Google-Extended | Ελέγχει αν το περιεχόμενο που ανιχνεύεται από την Google μπορεί να χρησιμοποιηθεί για την εκπαίδευση μοντέλων Gemini και ορισμένα συστήματα θεμελίωσης | Είναι ένα διακριτικό ελέγχου robots.txt, όχι ένας ξεχωριστός user-agent αιτήματος. Δεν επηρεάζει την κανονική συμπερίληψη στην Αναζήτηση Google. | |
| Anthropic | ClaudeBot | Συλλέγει δημόσιο περιεχόμενο ιστού που μπορεί να συμβάλει στην ανάπτυξη μοντέλων Claude | Απαγορεύστε το για να δηλώσετε ότι μελλοντικό υλικό θα πρέπει να εξαιρεθεί από τα σύνολα δεδομένων εκπαίδευσης της Anthropic. |
| Anthropic | Claude-SearchBot | Βελτιώνει την ποιότητα των αποτελεσμάτων αναζήτησης Claude | Επιτρέψτε το για ορατότητα στην αναζήτηση Claude. |
| Anthropic | Claude-User | Ανακτά σελίδες ως απάντηση σε αίτημα χρήστη προς το Claude | Ξεχωριστό από την αυτόματη ανίχνευση. |
| Perplexity | PerplexityBot | Ευρετηριάζει σελίδες για αποτελέσματα αναζήτησης Perplexity | Το Perplexity δηλώνει ότι αυτός ο ανιχνευτής δεν χρησιμοποιείται για τη συλλογή περιεχομένου για την εκπαίδευση θεμελιωδών μοντέλων τεχνητής νοημοσύνης. |
| Perplexity | Perplexity-User | Ανακτά μια σελίδα αφού τη ζητήσει ο χρήστης | Η τεκμηρίωση του Perplexity αναφέρει ότι αυτός ο ανιχνευτής γενικά αγνοεί το robots.txt επειδή το αίτημα ξεκίνησε από χρήστη. |
| Apple | Applebot | Υποστηρίζει την Αναζήτηση Apple, το Spotlight, τη Siri, το Safari και άλλες εμπειρίες της Apple | Επιτρέψτε το για την ανακάλυψη της Apple. |
| Apple | Applebot-Extended | Ελέγχει αν το περιεχόμενο που ανιχνεύεται από το Applebot μπορεί να χρησιμοποιηθεί για την εκπαίδευση θεμελιωδών μοντέλων της Apple | Δεν ανιχνεύει σελίδες από μόνο του. Είναι ένας έλεγχος χρήσης δεδομένων. |
| Common Crawl | CCBot | Συλλέγει δημόσια δεδομένα ιστού για το ανοιχτό αρχείο ιστού του Common Crawl | Δεν είναι βοηθός, αλλά τα σύνολα δεδομένων του μπορούν να χρησιμοποιηθούν από ερευνητές και προγραμματιστές τεχνητής νοημοσύνης. |
| Microsoft | Bingbot | Κύριος ανιχνευτής αναζήτησης Bing | Επιτρέψτε το για την ανακάλυψη και την ορατότητα αναζήτησης Bing. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Προεπισκοπήσεις σελίδων και βίντεο για προϊόντα της Microsoft | Αυτά μπορούν να ελεγχθούν ξεχωριστά από το Bingbot. |
| Amazon | Amzn-SearchBot | Αναζήτηση και ανακάλυψη περιεχομένου Amazon | Η Amazon δηλώνει ότι δεν ανιχνεύει περιεχόμενο για την εκπαίδευση γεννητικών μοντέλων τεχνητής νοημοσύνης. |
| Amazon | Amzn-User | Ανακτά τρέχουσες πληροφορίες ως απάντηση σε ενέργειες χρήστη, συμπεριλαμβανομένων αιτημάτων Alexa | Ενεργοποιείται από τον χρήστη και είναι ξεχωριστό από την αυτόματη ανίχνευση αναζήτησης. |
Η OpenAI τεκμηριώνει τους ανιχνευτές αναζήτησης, εκπαίδευσης, διαφήμισης και ενεργοποίησης από τον χρήστη ως ξεχωριστούς ελέγχους. Η τεκμηρίωσή της συνιστά συγκεκριμένα να επιτρέπεται το OAI-SearchBot για την αναζήτηση ChatGPT ενώ χρησιμοποιείται το GPTBot ξεχωριστά για τις προτιμήσεις εκπαίδευσης. (developers.openai.com)
Η Google ομοίως διαχωρίζει τα Googlebot, GoogleOther και Google-Extended. Το Google-Extended δεν έχει τον δικό του user-agent αιτήματος HTTP και ο αποκλεισμός του δεν αφαιρεί μια σελίδα από την Αναζήτηση Google. (developers.google.com)
Η Anthropic τεκμηριώνει ξεχωριστούς ρόλους για τα ClaudeBot, Claude-SearchBot και Claude-User. Η Anthropic δηλώνει επίσης ότι οι bots της ακολουθούν το robots.txt και υποστηρίζουν την μη τυπική οδηγία Crawl-delay. (support.anthropic.com)
Το Perplexity διακρίνει μεταξύ αυτόματης ανίχνευσης αναζήτησης και ανάκτησης κατόπιν αιτήματος χρήστη. Η τρέχουσα τεκμηρίωσή του αναφέρει ότι το PerplexityBot σέβεται το robots.txt, ενώ το Perplexity-User γενικά δεν το κάνει επειδή ανταποκρίνεται σε αίτημα χρήστη. (docs.perplexity.ai)
Η τρέχουσα τεκμηρίωση της Apple κάνει την ίδια διάκριση αναζήτησης έναντι εκπαίδευσης: Το Applebot υποστηρίζει την ανακάλυψη, ενώ το Applebot-Extended επιτρέπει στους εκδότες να ελέγχουν τη χρήση εκπαίδευσης χωρίς να αφαιρούν σελίδες από την Αναζήτηση Apple. (support.apple.com)
Προτεινόμενες Διαμορφώσεις robots.txt
Τοποθετήστε το robots.txt στη ρίζα κάθε host, όπως:
text https://www.example.org/robots.txt
Οι κανόνες εφαρμόζονται στον συγκεκριμένο host, πρωτόκολλο και θύρα όπου φιλοξενείται το αρχείο. Ένα ξεχωριστό subdomain μπορεί να χρειάζεται το δικό του αρχείο. (developers.google.com)
Διαμόρφωση 1: Μέγιστη συμπερίληψη
Χρησιμοποιήστε αυτό όταν το δημόσιο συντακτικό περιεχόμενο μπορεί να βρεθεί, να συνοψιστεί, να παρατεθεί, να ευρετηριαστεί και να συλλεχθεί από συμβατούς ανιχνευτές.
text
Οι δημόσιες σελίδες είναι διαθέσιμες σε συμβατούς ανιχνευτές.
User-agent: * Allow: /
Κρατήστε εκτός ιδιωτικές, συναλλακτικές και διαχειριστικές διαδρομές.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Αυτό επιτρέπει στους αναφερόμενους ανιχνευτές, συμπεριλαμβανομένων των OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft και Amazon, εκτός εάν κάποιος άλλος συγκεκριμένος κανόνας τους μπλοκάρει.
Μην τοποθετείτε έναν γενικό κανόνα όπως User-agent: * Disallow: / κάτω από αυτήν τη διαμόρφωση. Μια μεταγενέστερη ή πιο συγκεκριμένη ομάδα μπορεί να αλλάξει τον τρόπο ερμηνείας του αρχείου από έναν ανιχνευτή.
Διαμόρφωση 2: Να επιτρέπεται η αναζήτηση αλλά να μπλοκάρονται οι ανιχνευτές ανάπτυξης μοντέλων
Αυτός είναι συχνά ο καλύτερος συμβιβασμός για εκδότες που θέλουν παραπομπές και επισκεψιμότητα από την αναζήτηση, αλλά δεν θέλουν να δηλώσουν άδεια για τη συλλογή δεδομένων για την ανάπτυξη μοντέλων.
text
Αποκλεισμός ανίχνευσης OpenAI για ανάπτυξη μοντέλων.
User-agent: GPTBot Disallow: /
Αποκλεισμός ανίχνευσης Anthropic για ανάπτυξη μοντέλων.
User-agent: ClaudeBot Disallow: /
Αποκλεισμός της χρήσης Google για εκπαίδευση μοντέλων και σχετικές χρήσεις θεμελίωσης.
User-agent: Google-Extended Disallow: /
Αποκλεισμός της χρήσης Apple για εκπαίδευση θεμελιωδών μοντέλων.
User-agent: Applebot-Extended Disallow: /
Προαιρετικό: αποκλεισμός συλλογής συνόλων δεδομένων Common Crawl.
User-agent: CCBot
Disallow: /
Επιτρέψτε την κανονική ανίχνευση αναζήτησης και ανάκτησης, εκτός από ευαίσθητες διαδρομές.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Αυτή η διαμόρφωση αφήνει τα OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot και Applebot να καλύπτονται από την ομάδα wildcard. Επίσης, διατηρεί ξεχωριστά τα δικαιώματα αναζήτησης και εκπαίδευσης.
Για την Apple, ο αποκλεισμός του Applebot-Extended ενώ επιτρέπεται το Applebot διατηρεί την ανακάλυψη μέσω των υπηρεσιών της Apple. Για την Google, ο αποκλεισμός του Google-Extended δεν μπλοκάρει την κανονική Αναζήτηση Google. (developers.google.com)
Διαμόρφωση 3: Να επιτρέπονται ρητά επιλεγμένοι ανιχνευτές αναζήτησης
Εάν ένα υπάρχον αρχείο robots.txt μπλοκάρει όλους τους ανιχνευτές, προσθέστε ξεχωριστές ομάδες για τους ανιχνευτές αναζήτησης που θέλετε να καλωσορίσετε.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Κρατήστε όλους τους άλλους ανιχνευτές εκτός.
User-agent: * Disallow: /
Όταν χρησιμοποιείτε συγκεκριμένες ομάδες, επαναλάβετε τους κανόνες για τις ευαίσθητες διαδρομές μέσα σε κάθε ομάδα. Ορισμένοι ανιχνευτές χρησιμοποιούν την πιο συγκεκριμένη ομάδα αντιστοίχισης αντί να τη συνδυάζουν με την ομάδα wildcard. Η Bing τεκμηριώνει αυτή τη συμπεριφορά άμεσα, και η Google παρέχει ξεχωριστές οδηγίες για ομάδες ειδικών ανιχνευτών. (bing.com)
Σημαντικοί περιορισμοί του robots.txt
- Ένας ανιχνευτής μπορεί να αγνοήσει το robots.txt.
- Ένας κακόβουλος ανιχνευτής μπορεί να προσποιηθεί ότι είναι ένας αξιόπιστος ανιχνευτής.
- Μια μπλοκαρισμένη σελίδα μπορεί να είναι ακόμα γνωστή από τον τίτλο ή τη διεύθυνση ιστού της.
- Το Robots.txt δεν προστατεύει κωδικούς πρόσβασης, ιδιωτικά αρχεία, αρχεία πελατών ή εμπιστευτικά προγραμματιστικά διεπαφές εφαρμογών.
- Μια οδηγία
Crawl-delayδεν αποτελεί μέρος του βασικού Πρωτοκόλλου Αποκλεισμού Robots και δεν υποστηρίζεται από κάθε ανιχνευτή. Η Anthropic και η Bing τεκμηριώνουν την υποστήριξη, ενώ η Apple δηλώνει ότι το Applebot δεν ακολουθεί το crawl-delay. (rfc-editor.org)
Μετα-Ετικέτες και Κεφαλίδες HTTP
Παράδειγμα δημόσιας σελίδας
Για ένα δημόσιο άρθρο, χρησιμοποιήστε σαφή τίτλο, συγγραφέα, κανονική διεύθυνση ιστού, ημερομηνία δημοσίευσης και ημερομηνία τροποποίησης.
html
Η οδηγία max-snippet τεκμηριώνεται κυρίως για την Google. Μην υποθέτετε ότι κάθε ανιχνευτής τεχνητής νοημοσύνης υποστηρίζει κάθε μετα-οδηγία.
Παράδειγμα ιδιωτικής ή ευαίσθητης σελίδας
html
Χρησιμοποιήστε το για σελίδες που δεν πρέπει να εμφανίζονται στα αποτελέσματα αναζήτησης. Η σελίδα πρέπει να παραμείνει ανιχνεύσιμη για αρκετό καιρό ώστε ο ανιχνευτής να δει την οδηγία. Εάν η σελίδα πρέπει πραγματικά να παραμείνει ιδιωτική, χρησιμοποιήστε έλεγχο ταυτότητας ή προστασία με κωδικό πρόσβασης αντ' αυτού. (developers.google.com)
Απόκρυψη μόνο ευαίσθητων τμημάτων από τα αποσπάσματα αναζήτησης
Η Google υποστηρίζει το data-nosnippet για συγκεκριμένα μέρη μιας σελίδας HTML:
html
Αυτή η παράγραφος μπορεί να εμφανιστεί σε ένα αποτέλεσμα αναζήτησης.
Αυτό είναι χρήσιμο για στοιχεία επικοινωνίας, εσωτερικές σημειώσεις ή πληροφορίες που παράγονται από τον χρήστη. Δεν είναι μια καθολική οδηγία για κάθε σύστημα τεχνητής νοημοσύνης. (developers.google.com)
Χρησιμοποιήστε την κεφαλίδα X-Robots-Tag για αρχεία
Οι μετα-ετικέτες δεν μπορούν να τοποθετηθούν μέσα σε ένα αρχείο φορητού εγγράφου, εικόνας ή βίντεο. Χρησιμοποιήστε μια κεφαλίδα απάντησης HTTP αντ' αυτού:
text X-Robots-Tag: noindex, nosnippet
Για μια σελίδα που πρέπει να παραμείνει αναζητήσιμη αλλά δεν πρέπει να παρέχει κείμενο για αποσπάσματα ή απαντήσεις τεχνητής νοημοσύνης, χρησιμοποιήστε:
text X-Robots-Tag: nosnippet
Η Google τεκμηριώνει την X-Robots-Tag για πόρους που δεν είναι HTML, και η Apple την υποστηρίζει επίσης για το Applebot. (developers.google.com)
Ειδικοί έλεγχοι της Apple
Η Apple υποστηρίζει:
html
Η Apple δηλώνει ότι το nosnippet εμποδίζει τη χρήση της σελίδας ως πρόσθετο πλαίσιο και τρέχον περιεχόμενο όταν τα μοντέλα της Apple παράγουν αποτελέσματα. Η σελίδα μπορεί να παραμείνει ανιχνεύσιμη μέσω της Αναζήτησης Apple, του Spotlight, της Siri και του Safari. (support.apple.com)
Για σελίδες με paywall, η Apple υποστηρίζει επίσης δομημένα δεδομένα χρησιμοποιώντας:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Η Apple δηλώνει ότι τέτοιες σελίδες μπορεί να παραμείνουν επιλέξιμες για αποτελέσματα αναζήτησης, αλλά δεν θα χρησιμοποιηθούν ως πρόσθετο πλαίσιο για απαντήσεις τεχνητής νοημοσύνης. (support.apple.com)
Πώς να Επαληθεύσετε τις Διευθύνσεις Internet Protocol των Ανιχνευτών
Γιατί η αντιστοίχιση user-agent δεν είναι αρκετή
Ένας κανόνας όπως αυτός είναι αδύναμος:
text if User-Agent contains "GPTBot": allow
Οποιοσδήποτε μπορεί να στείλει αυτό το κείμενο. Ένας καλύτερος κανόνας είναι:
text αν ο User-Agent είναι γνωστός ανιχνευτής και η διεύθυνση IP προέλευσης βρίσκεται στο επίσημο εύρος του παρόχου: επιτρέψτε ή ορίστε όριο ρυθμού αλλιώς: αμφισβητήστε, ορίστε όριο ρυθμού ή μπλοκάρετε
Μην εμπιστεύεστε μια κεφαλίδα X-Forwarded-For εκτός αν προέρχεται από έναν διακομιστή μεσολάβησης ή δίκτυο παράδοσης περιεχομένου που ελέγχεται από τον οργανισμό σας.
Μέθοδοι επαλήθευσης παρόχου
| Πάροχος | Συνιστώμενη μέθοδος επαλήθευσης |
|---|---|
| OpenAI | Χρησιμοποιήστε τις ζωντανές ροές διευθύνσεων Διαδικτυακού Πρωτοκόλλου που δημοσιεύονται στην τεκμηρίωση ανιχνευτών της OpenAI για OAI-SearchBot, GPTBot και OAI-AdsBot. Ανανεώστε τις αυτόματα αντί να αντιγράφετε σταθερά εύρη σε ένα firewall. |
| Χρησιμοποιήστε τα δημοσιευμένα εύρη ανιχνευτών της Google ή εκτελέστε αντίστροφους και εμπρόσθιους ελέγχους Domain Name System. Ένας γνήσιος ανιχνευτής της Google θα πρέπει να αναλύεται σε ένα εγκεκριμένο όνομα host της Google και να αναλύεται πίσω στην αρχική διεύθυνση. | |
| Anthropic | Χρησιμοποιήστε την τρέχουσα δημοσιευμένη ροή διευθύνσεων ανιχνευτών ως δευτερεύοντα έλεγχο δικτύου. Η κύρια μέθοδος εξαίρεσης της Anthropic παραμένει το robots.txt. |
| Perplexity | Συνδυάστε τον user-agent με την τρέχουσα ροή διευθύνσεων PerplexityBot ή Perplexity-User. Το Perplexity συνιστά συγκεκριμένα τον συνδυασμό και των δύο συνθηκών σε έναν κανόνα τείχους προστασίας εφαρμογών ιστού (Web Application Firewall). |
| Apple | Χρησιμοποιήστε την επαλήθευση αντίστροφου Domain Name System υπό το applebot.apple.com, και στη συνέχεια εκτελέστε μια εμπρόσθια αναζήτηση. Η Apple δημοσιεύει επίσης τρέχοντα εύρη διευθύνσεων σε μια ροή JSON. |
| Common Crawl | Χρησιμοποιήστε την επαλήθευση αντίστροφου Domain Name System υπό το crawl.commoncrawl.org και την τρέχουσα ροή διευθύνσεων CCBot. Το Common Crawl σημειώνει ότι η αντίστροφη επαλήθευση δεν είναι ακόμη διαθέσιμη για κάποια κίνηση IPv6. |
| Microsoft | Χρησιμοποιήστε το επίσημο εργαλείο Verify Bingbot ή τις τεκμηριωμένες μεθόδους αντίστροφης και εμπρόσθιας αναζήτησης της Microsoft. |
| Amazon | Χρησιμοποιήστε τις δημοσιευμένες λίστες διευθύνσεων ανιχνευτών της Amazon και αντιστοιχίστε τις με τον κατάλληλο user-agent της Amazon. |
Οι Google, Apple, Common Crawl, OpenAI, Anthropic και Perplexity δημοσιεύουν όλες συγκεκριμένες μεθόδους ή ροές διευθύνσεων ανά πάροχο. Αυτές οι λίστες μπορούν να αλλάξουν, οπότε μια προγραμματισμένη διαδικασία ενημέρωσης είναι ασφαλέστερη από μια μόνιμη χειροκίνητα αντιγραμμένη λίστα. (developers.google.com)
Ένας απλός σχεδιασμός firewall θα μπορούσε να μοιάζει με αυτόν:
text επιτρέψτε το OAI-SearchBot μόνο όταν η διεύθυνση προέλευσης βρίσκεται στο τρέχον εύρος αναζήτησης της OpenAI επιτρέψτε το GPTBot μόνο όταν η διεύθυνση προέλευσης βρίσκεται στο τρέχον εύρος εκπαίδευσης της OpenAI επιτρέψτε το PerplexityBot μόνο όταν η διεύθυνση προέλευσης βρίσκεται στο τρέχον εύρος PerplexityBot επιτρέψτε το Applebot μόνο όταν η αντίστροφη και εμπρόσθια επαλήθευση DNS είναι επιτυχής επιτρέψτε το CCBot μόνο όταν το αντίστροφο DNS και το τρέχον εύρος Common Crawl ταιριάζουν
θέστε όριο ρυθμού σε όλους τους επαληθευμένους ανιχνευτές μπλοκάρετε ή αμφισβητήστε μη επαληθευμένα αιτήματα που ισχυρίζονται ότι είναι αξιόπιστοι ανιχνευτές
Μην εφαρμόζετε έναν γενικό κανόνα allow σε ολόκληρο έναν πάροχο cloud. Ένας νόμιμος ανιχνευτής μπορεί να χρησιμοποιεί υποδομή cloud, αλλά η περισσότερη κίνηση από αυτόν τον πάροχο cloud δεν είναι απαραίτητα ο ανιχνευτής.
Πώς η Ανοικτή Αδειοδότηση Επηρεάζει τη Συμπερίληψη
CC BY 4.0 σε απλή γλώσσα
Η άδεια Creative Commons Αναφοράς Δημιουργού 4.0 Διεθνής, που συνήθως αναφέρεται ως CC BY 4.0, επιτρέπει στους ανθρώπους να:
- Αντιγράφουν και αναδιανέμουν το έργο
- Προσαρμόζουν, μεταφράζουν, αναμιγνύουν και βασίζονται σε αυτό
- Το χρησιμοποιούν εμπορικά
Οι κύριοι όροι είναι:
- Να αναφέρεται κατάλληλα η πηγή
- Να παρέχεται σύνδεσμος στην άδεια
- Να αναφέρεται αν έγιναν αλλαγές
- Να μην υπονοείται ότι ο αρχικός δημιουργός εγκρίνει την επανάχρηση
- Να μην προστίθενται νομικοί ή τεχνικοί περιορισμοί που εμποδίζουν τις χρήσεις που επιτρέπει η άδεια
Το Creative Commons προειδοποιεί επίσης ότι η άδεια ενδέχεται να μην καλύπτει δικαιώματα ιδιωτικότητας, δικαιώματα δημοσιότητας, ηθικά δικαιώματα, δικαιώματα εμπορικών σημάτων, δικαιώματα ευρεσιτεχνίας ή υλικό τρίτων. (creativecommons.org)
Μια άδεια δεν είναι από μόνη της πρόσκληση για ανιχνευτές
Η τοποθέτηση του “CC BY 4.0” σε μια σελίδα δεν εγγυάται ότι ένας οργανισμός θα την ανιχνεύσει. Ένας ανιχνευτής μπορεί να εξακολουθεί να μπλοκάρεται από:
- robots.txt
- Ένα δίκτυο παράδοσης περιεχομένου (CDN)
- Ένα Web Application Firewall
- Όριο ρυθμού (Rate limiting)
- Μια πρόκληση JavaScript
- Έναν τοίχο σύνδεσης (login wall)
- Μια κακή απάντηση διακομιστή
- Έναν μη προσβάσιμο χάρτη ιστότοπου (sitemap)
Αντίστροφα, η άδεια σε έναν ανιχνευτή δεν παραχωρεί αυτόματα κάθε άδεια πνευματικών δικαιωμάτων που απαιτείται για κάθε μεταγενέστερη χρήση. Το Robots.txt και η αδειοδότηση πρέπει να σχεδιάζονται από κοινού.
Γιατί το CC BY μπορεί να υποστηρίξει ευρύτερη συμπερίληψη
Μια σαφής επιτρεπτική άδεια μπορεί να διευκολύνει την κατανόηση της πολιτικής ενός εκδότη από ομάδες δεδομένων, συστήματα αναζήτησης και χειριστές βοηθών. Μπορεί να μειώσει την αβεβαιότητα σχετικά με την αντιγραφή, την προσαρμογή, την εμπορική χρήση, τη μετάφραση και την αναδιανομή όταν αυτές οι δραστηριότητες απαιτούν άδεια πνευματικών δικαιωμάτων.
Ωστόσο, το Creative Commons εξηγεί ότι η εκπαίδευση τεχνητής νοημοσύνης είναι νομικά πολύπλοκη. Μια περιοριστική άδεια δεν είναι πάντα ένας αποτελεσματικός τρόπος για να αποτραπεί η εκπαίδευση, επειδή ορισμένες χρήσεις εκπαίδευσης μπορεί να επιτρέπονται από εξαιρέσεις ή περιορισμούς πνευματικών δικαιωμάτων. Το Creative Commons σημειώνει επίσης ότι οι όροι άδειας μπορεί να είναι δύσκολο να εφαρμοστούν στην εκπαίδευση μηχανών και στα αποτελέσματα μοντέλων. (creativecommons.org)
Το πρακτικό μάθημα είναι:
Χρησιμοποιήστε το CC BY όταν πραγματικά θέλετε ευρεία νόμιμη επανάχρηση. Μην χρησιμοποιείτε μια περιοριστική άδεια Creative Commons ως εγγυημένη εξαίρεση από την εκπαίδευση τεχνητής νοημοσύνης.
Η αναφορά πηγής βελτιώνει τη σαφήνεια
Το Creative Commons συνιστά τη μέθοδο TASL:
- Τίτλος
- Συγγραφέας
- Πηγή
- Άδεια
Για παράδειγμα:
«Αδειοδότηση και Robots για Μέγιστη Συμπερίληψη», Example Publishing, https://www.example.org/articles/ai-crawlers, αδειοδοτημένο υπό την Creative Commons Αναφοράς Δημιουργού 4.0 Διεθνής. Έγιναν αλλαγές: ενημερώθηκε η απογραφή ανιχνευτών.
Η σαφής αναφορά πηγής δεν αναγκάζει κάθε βοηθό να παραθέσει μια σελίδα. Κάνει όμως ευκολότερη τη σωστή παράθεση όταν ένα σύστημα εξάγει τον τίτλο, τον συγγραφέα, την πηγή και τις πληροφορίες αδειοδότησης της σελίδας. (wiki.creativecommons.org)
Προσθήκη δομημένων πληροφοριών άρθρου
Χρησιμοποιήστε ορατές πληροφορίες και δομημένα δεδομένα μαζί:
html
Η Google συνιστά σαφείς πληροφορίες συγγραφέα, σελίδες συγγραφέα, ημερομηνίες δημοσίευσης, ημερομηνίες τροποποίησης και σταθερές κανονικές σελίδες. Αυτά τα σήματα μπορούν να βοηθήσουν τα συστήματα αναζήτησης να κατανοήσουν ποιος δημιούργησε το υλικό και ποια έκδοση είναι αυθεντική. Δεν εγγυώνται κατάταξη, συμπερίληψη ή παράθεση. (developers.google.com)
Νομικό Πρότυπο για έναν Ανοικτό Ιστότοπο Φιλικό προς την Παράθεση
Το ακόλουθο είναι ένα δείγμα γλώσσας, όχι νομική συμβουλή. Ζητήστε από νομικό σύμβουλο να το προσαρμόσει στη δικαιοδοσία σας, τη δομή ιδιοκτησίας, τις υποχρεώσεις απορρήτου και το περιεχόμενο τρίτων.
Δήλωση αδειοδότησης CC BY 4.0
text
Άδεια περιεχομένου
Εκτός αν αναφέρεται διαφορετικά, το πρωτότυπο κείμενο και το πρωτότυπο συντακτικό υλικό σε αυτή τη σελίδα αδειοδοτούνται υπό την άδεια Creative Commons Αναφοράς Δημιουργού 4.0 Διεθνής:
https://creativecommons.org/licenses/by/4.0/
Αυτή η άδεια επιτρέπει την αντιγραφή, αναδιανομή, προσαρμογή, μετάφραση, εμπορική χρήση, μηχανική επεξεργασία, ευρετηρίαση αναζήτησης, ανάκτηση, σύνοψη και χρήση σε συστήματα τεχνητής νοημοσύνης, υπό την προϋπόθεση ότι τηρούνται οι όροι της άδειας.
Προτιμώμενη αναφορά:
«[Τίτλος σελίδας]», από [συγγραφέας ή οργανισμός], [κανονική διεύθυνση σελίδας], δημοσιεύτηκε ή ενημερώθηκε [ημερομηνία], αδειοδοτημένο υπό την άδεια Creative Commons Αναφοράς Δημιουργού 4.0 Διεθνής. Έγιναν αλλαγές: [περιγράψτε αλλαγές, ή δηλώστε «καμία»].
Παρακαλούμε διατηρήστε τις πληροφορίες συγγραφέα, εκδότη, πηγής, άδειας και τροποποίησης όποτε είναι εύλογα δυνατό. Αυτός ο οδηγός προτιμώμενης αναφοράς δεν προσθέτει περιορισμούς στην άδεια Creative Commons και δεν αντικαθιστά το κείμενο της άδειας.
Η φράση «συμπεριλαμβανομένων των συστημάτων τεχνητής νοημοσύνης» διευκρινίζει την πρόθεση του εκδότη. Δεν πρέπει να χρησιμοποιείται για να προσποιηθεί ότι ο εκδότης κατέχει δικαιώματα σε υλικό που δημιουργήθηκε από κάποιον άλλο.
Σημείωση για μάρκα, ιδιωτικότητα και δικαιώματα τρίτων
text
Μάρκα, ιδιωτικότητα και δικαιώματα τρίτων
Η παραπάνω άδεια καλύπτει μόνο τα πρωτότυπα υλικά που προσδιορίζονται ως αδειοδοτημένα. Δεν παραχωρεί άδεια χρήσης:
- Εμπορικών σημάτων, σημάτων υπηρεσιών, λογοτύπων ή εμπορικής εμφάνισης
- Ονομάτων, εικόνων ή ομοιωμάτων προσώπων
- Ιδιωτικών, εμπιστευτικών, λογαριασμού, υγείας, οικονομικών ή πληροφοριών ασφαλείας
- Υποβολών χρηστών εκτός αν αναγνωρίζονται ξεχωριστά ως αδειοδοτημένες
- Φωτογραφιών, εικονογραφήσεων, χαρτών, βίντεο, μουσικής, παραθέσεων ή άλλων υλικών τρίτων
- Περιεχομένου που χαρακτηρίζεται ως «όλα τα δικαιώματα διατηρημένα» ή υπόκειται σε ξεχωριστή άδεια
Η χρήση του ονόματος, των λογοτύπων και των σημάτων της Example Publishing δεν πρέπει να υποδηλώνει χορηγία, έγκριση, συνεργασία ή υποστήριξη. Παρακαλούμε συνδέστε με την πρωτότυπη σελίδα και διακρίνετε σαφώς την παράθεση, την παράφραση, τη σύνοψη και το παραγόμενο υλικό.
Αυτή η γλώσσα είναι σημαντική επειδή οι άδειες Creative Commons δεν παραχωρούν αυτόματα κάθε τύπο νομικού δικαιώματος που συνδέεται με μια σελίδα. (creativecommons.org)
Οδηγίες αναφοράς για αναζήτηση και βοηθούς
text
Οδηγίες αναφοράς για αναζήτηση και βοηθούς
Καλωσορίζουμε τη συμβατή ευρετηρίαση αναζήτησης, την ανάκτηση που ζητείται από τον χρήστη, την παράθεση και τη σύνοψη του αδειοδοτημένου υλικού σε αυτόν τον ιστότοπο.
Όταν παραθέτετε αυτόν τον ιστότοπο, παρακαλούμε χρησιμοποιήστε τον τίτλο της σελίδας, τον συγγραφέα ή τον εκδότη, την κανονική διεύθυνση της σελίδας, την ημερομηνία δημοσίευσης ή ενημέρωσης, και έναν άμεσο σύνδεσμο προς την πηγή. Παρακαλούμε αναγνωρίστε την πηγή ως μία είσοδο μεταξύ οποιωνδήποτε χρησιμοποιημένων πηγών, διακρίνετε την παραγόμενη ανάλυση από το παρατεθέν υλικό, και μην δηλώνετε ή υπονοείτε ότι η Example Publishing εγκρίνει μια παραγόμενη απάντηση, προϊόν, άτομο ή υπηρεσία.
Αυτές οι οδηγίες αποσκοπούν στη βελτίωση της ακρίβειας και της αναφοράς πηγής. Δεν παραχωρούν δικαιώματα πέραν της ισχύουσας άδειας περιεχομένου και δεν αδειοδοτούν εμπορικά σήματα, προσωπικές πληροφορίες, εμπιστευτικές πληροφορίες ή υλικό τρίτων.
Εάν θέλετε ορατότητα στην αναζήτηση αλλά δεν θέλετε να παραχωρήσετε μια ευρεία άδεια εκπαίδευσης
text
Πρόσβαση στην αναζήτηση και πνευματικά δικαιώματα
Οι δημόσιες σελίδες μας μπορούν να προσπελαστούν από συμβατούς ανιχνευτές αναζήτησης και ανάκτησης που αναγνωρίζονται στο αρχείο robots.txt μας. Αυτή η άδεια προορίζεται για την υποστήριξη της ανακάλυψης, των αποτελεσμάτων αναζήτησης, της ανάκτησης που ζητείται από τον χρήστη και της αναφοράς.
Εκτός αν εμφανίζεται ξεχωριστή άδεια, το πρωτότυπο περιεχόμενο παραμένει με όλα τα δικαιώματα διατηρημένα. Η πρόσβαση σε μια δημόσια σελίδα δεν παραχωρεί ξεχωριστή άδεια για ανάπτυξη μοντέλων, εκπαίδευση, αναδιανομή, εμπορική επανάχρηση ή δημιουργία παράγωγων έργων πέραν των δικαιωμάτων που παρέχονται από την ισχύουσα νομοθεσία.
Παρακαλούμε αναφέρετε την κανονική διεύθυνση της σελίδας και τον εκδότη όταν αναφέρεστε σε αυτό το υλικό. Τίποτα σε αυτόν τον ιστότοπο δεν παραχωρεί άδεια χρήσης εμπορικών σημάτων, λογοτύπων, προσωπικών πληροφοριών, εμπιστευτικών πληροφοριών ή περιεχομένου τρίτων.
Μην τοποθετείτε τη δήλωση CC BY και τη δήλωση «όλα τα δικαιώματα διατηρημένα» στο ίδιο υλικό. Προσδιορίστε σαφώς ποια άδεια ισχύει για ποιο περιεχόμενο.
Πίνακας Κινδύνου-Οφέλους για την Ανοικτή Αδειοδότηση
Ο νόμος περί πνευματικών δικαιωμάτων και οι κανόνες εκπαίδευσης τεχνητής νοημοσύνης διαφέρουν ανά χώρα και παραμένουν αδιευκρίνιστοι. Το Γραφείο Πνευματικών Δικαιωμάτων των Ηνωμένων Πολιτειών συνεχίζει να εξετάζει αυτά τα ζητήματα, ενώ το Creative Commons περιγράφει την εκπαίδευση τεχνητής νοημοσύνης ως ειδική ανά περίπτωση και νομικά πολύπλοκη. (copyright.gov)
| Προσέγγιση | Δυνατότητα συμπερίληψης | Κύρια οφέλη | Κύριοι κίνδυνοι | Καλύτερη εφαρμογή |
|---|---|---|---|---|
| CC BY 4.0 | Πολύ υψηλή | Ευρεία αντιγραφή, προσαρμογή, εμπορική χρήση, μετάφραση, ευρετηρίαση και επανάχρηση σχετική με μοντέλα όταν απαιτείται άδεια πνευματικών δικαιωμάτων | Οι εμπορικοί ανταγωνιστές ενδέχεται να επαναχρησιμοποιήσουν ή να προσαρμόσουν το περιεχόμενο· η αναφορά πηγής μπορεί να είναι ατελής· η άδεια δεν μπορεί να ελέγξει τα δικαιώματα ιδιωτικότητας, εμπορικών σημάτων ή τρίτων | Εκδότες που επιθυμούν την ευρύτερη νόμιμη επανάχρηση και ισχυρή αναφορά πηγής |
| CC BY-SA 4.0 | Υψηλή, αλλά πιο περίπλοκη | Ενθαρρύνει έναν ανοιχτό κύκλο κοινοχρησίας και απαιτεί οι προσαρμογές να παραμένουν υπό συμβατούς όρους | Οι κανόνες ShareAlike μπορεί να είναι δύσκολο να εφαρμοστούν σε σύνολα δεδομένων, εκπαίδευση μοντέλων και δημόσια αποτελέσματα· ορισμένοι οργανισμοί ενδέχεται να αποφύγουν το υλικό λόγω αβεβαιότητας | Ανοιχτά εκπαιδευτικά και έργα δημοσίου συμφέροντος που θέλουν οι μεταγενέστερες προσαρμογές να παραμείνουν ανοιχτές |
| CC BY-NC 4.0 | Μεσαία ή χαμηλή | Περιορίζει τις χρήσεις που προορίζονται κυρίως για εμπορικό πλεονέκτημα ή χρηματική αποζημίωση | Το «μη εμπορικό» μπορεί να είναι δύσκολο να ερμηνευτεί· μπορεί να αποκλείσει εμπορικές χρήσεις αναζήτησης, μοντέλων και βοηθών· δεν είναι εγγυημένη εξαίρεση από την εκπαίδευση | Υλικό που προορίζεται για μη κερδοσκοπική, εκπαιδευτική ή κοινοτική χρήση |
| CC BY-ND 4.0 | Μεσαία | Επιτρέπει την κοινοχρησία ενώ περιορίζει τις προσαρμογές | Η μετάφραση, η μεταμόρφωση και ορισμένες περιπτώσεις χρήσης βοηθών ενδέχεται να γίνουν νομικά αβέβαιες· λιγότερο ελκυστική για συστήματα που συνοψίζουν ή αναμιγνύουν | Επίσημες ανακοινώσεις ή έργα που πρέπει να παραμείνουν αμετάβλητα |
| CC0 ή αφιέρωση σε δημόσιο τομέα | Πολύ υψηλή | Απλοποιεί την επανάχρηση και αφαιρεί τους περισσότερους όρους πνευματικών δικαιωμάτων όπου είναι νομικά αποτελεσματικό | Δεν απαιτείται αναφορά πηγής· αδύναμος έλεγχος της παρουσίασης της μάρκας· τα δικαιώματα ιδιωτικότητας, εμπορικών σημάτων και δημοσιότητας παραμένουν ξεχωριστά | Γεγονότα, σύνολα δεδομένων, υλικό αναφοράς ή έργα που προορίζονται για απεριόριστη επανάχρηση |
| Όλα τα δικαιώματα διατηρημένα συν ανοιχτή ανίχνευση αναζήτησης | Υψηλή για αναζήτηση, χαμηλότερη για εκπαίδευση | Μπορεί να διατηρήσει την ορατότητα αναζήτησης και παράθεσης χωρίς να παραχωρήσει ευρεία άδεια επανάχρησης | Περισσότερη νομική αβεβαιότητα για τους προγραμματιστές μοντέλων· μπορεί να μειώσει τη συμπερίληψη σε σύνολα δεδομένων εκπαίδευσης και συστήματα εμπορικής επανάχρησης | Εκδότες που θέλουν ανακάλυψη και παραπομπές αλλά προτιμούν να διαπραγματευτούν ευρύτερες άδειες ξεχωριστά |
Η πιο ισορροπημένη στρατηγική για πολλούς οργανισμούς είναι:
- CC BY 4.0 για πρωτότυπο δημόσιο συντακτικό κείμενο
- Ξεχωριστές ετικέτες για υλικό τρίτων
- Καμία δημόσια προσωπική ή εμπιστευτική πληροφορία
- Να επιτρέπονται οι ανιχνευτές αναζήτησης και ανάκτησης
- Να επιτρέπονται οι ανιχνευτές ανάπτυξης μοντέλων μόνο εάν ο οργανισμός αποδέχεται πραγματικά αυτή τη χρήση
- Χρησιμοποιήστε σαφή αναφορά πηγής και κανονικούς συνδέσμους
- Προστατέψτε τα εμπορικά σήματα μέσω ξεχωριστής ειδοποίησης για την επωνυμία
Μια Πρακτική Λίστα Ελέγχου Υλοποίησης
Περιεχόμενο και αδειοδότηση
- Προσδιορίστε ποιος είναι ο ιδιοκτήτης κάθε σελίδας, εικόνας, διαγράμματος, βίντεο και παράθεσης.
- Αδειοδοτήστε μόνο υλικό για το οποίο ο οργανισμός σας ελέγχει τα δικαιώματα.
- Σημειώστε ξεχωριστά το υλικό τρίτων.
- Προσθέστε μια ορατή δήλωση άδειας.
- Παρέχετε μια προτιμώμενη αναφορά χρησιμοποιώντας τίτλο, συγγραφέα, πηγή και άδεια.
- Κρατήστε λογότυπα, εμπορικά σήματα, προσωπικά δεδομένα και εμπιστευτικές πληροφορίες εκτός του πεδίου εφαρμογής της άδειας.
Robots.txt
- Δημιουργήστε ένα δημόσιο αρχείο robots.txt στη ρίζα κάθε host.
- Επιτρέψτε τους ανιχνευτές αναζήτησης ξεχωριστά από τους ανιχνευτές εκπαίδευσης.
- Αποκλείστε διαδρομές διαχείρισης, λογαριασμών, ολοκλήρωσης αγοράς, ιδιωτικές και εσωτερικές διαδρομές εφαρμογών.
- Μην βασίζεστε στο robots.txt για ασφάλεια.
- Δοκιμάστε το αρχείο μετά από κάθε μεγάλη ανάπτυξη ιστότοπου.
Μετα-ετικέτες
- Χρησιμοποιήστε κανονικούς συνδέσμους.
- Προσθέστε συγγραφέα, ημερομηνία δημοσίευσης και ημερομηνία τροποποίησης.
- Χρησιμοποιήστε
noindexγια σελίδες που δεν πρέπει να εμφανίζονται στην αναζήτηση. - Χρησιμοποιήστε
nosnippetήdata-nosnippetγια ευαίσθητα αποσπάσματα όπου υποστηρίζεται. - Χρησιμοποιήστε
X-Robots-Tagγια αρχεία φορητών εγγράφων, εικόνες και άλλους πόρους που δεν είναι HTML. - Θυμηθείτε ότι ένας ανιχνευτής πρέπει να μπορεί να ανακτήσει μια σελίδα πριν μπορέσει να διαβάσει τις μετα-ετικέτες της.
Ασφάλεια δικτύου
- Καταγράψτε συμβολοσειρές user-agent, διευθύνσεις προέλευσης, κωδικούς απάντησης και διαδρομές αιτήματος.
- Επαληθεύστε αξιόπιστους ανιχνευτές χρησιμοποιώντας επίσημες ροές διευθύνσεων ή μεθόδους Domain Name System.
- Ανανεώστε τις ροές διευθύνσεων αυτόματα.
- Συνδυάστε τους ελέγχους user-agent και διεύθυνσης προέλευσης.
- Θέστε όριο ρυθμού σε επαληθευμένους ανιχνευτές αντί να τους δίνετε απεριόριστη πρόσβαση.
- Αμφισβητήστε ή μπλοκάρετε αιτήματα που ισχυρίζονται ότι είναι αξιόπιστοι ανιχνευτές αλλά αποτυγχάνουν στην επαλήθευση.
Μέτρηση
Παρακολουθήστε:
- Επισκέψεις από υπηρεσίες αναζήτησης τεχνητής νοημοσύνης
- Παραπομπές στην αρχική σελίδα
- Συχνότητα αναφοράς πηγής
- Φόρτο διακομιστή ανά ανιχνευτή
- Αιτήματα που επιστρέφουν
403,404, ή429 - Πρόσβαση ανιχνευτή σε ανεπιθύμητες διαδρομές
- Αν τα τρέχοντα άρθρα βρίσκονται μετά τη δημοσίευση
Συμπέρασμα
Η μέγιστη συμπερίληψη απαιτεί επιλεκτική διαφάνεια, όχι μια ενιαία γενική άδεια.
Χρησιμοποιήστε το robots.txt για να διαχωρίσετε την ανίχνευση αναζήτησης, ανάκτησης από χρήστη, εκπαίδευσης και δημόσιου συνόλου δεδομένων. Χρησιμοποιήστε μετα-ετικέτες και κεφαλίδες HTTP για να διαχειριστείτε την ευρετηρίαση και τα αποσπάσματα. Χρησιμοποιήστε έλεγχο ταυτότητας για οτιδήποτε ιδιωτικό. Επαληθεύστε τις διευθύνσεις Διαδικτυακού Πρωτοκόλλου των ανιχνευτών αντί να εμπιστεύεστε μόνο τα ονόματα user-agent.
Μια επιτρεπτική άδεια, όπως η CC BY 4.0, μπορεί να διευκολύνει την ευρεία επανάχρηση όταν την επιθυμείτε πραγματικά. Οι σαφείς πληροφορίες αναφοράς πηγής — τίτλος, συγγραφέας, πηγή, άδεια, κανονική σελίδα και ημερομηνία ενημέρωσης — μπορούν επίσης να διευκολύνουν τα συστήματα αναζήτησης και τους βοηθούς να εντοπίζουν και να παραθέτουν τη σωστή πηγή.
Η ισχυρότερη εκδοτική πολιτική είναι επομένως:
**Ανοίξτε το δημόσιο περιεχόμενο που θέλετε να ανακαλυφθεί, αδειοδοτήστε σαφώς το υλικό που θέλετε να επαναχρησιμοποιηθεί, σημειώστε το υλικό που δεν σας ανήκει, προστατέψτε τις ιδιωτικές πληροφορίες σε επίπεδο διακομιστή και δώστε σε κάθε ανιχνευτή ξεχωριστή, αναθεωρήσιμη άδεια.
Auto