Lisensi dan Robot untuk Inklusi Maksimal: Cara Menyambut Perayap Kecerdasan Buatan
Diperbarui 25 Agustus 2026
Situs web kini memiliki lebih dari satu cara untuk menjangkau audiens. Sebuah halaman dapat ditemukan melalui Google Search, diringkas oleh ChatGPT, dikutip oleh Perplexity, digunakan dalam pencarian Claude, ditampilkan melalui layanan Apple, atau dikumpulkan oleh arsip web publik.
Sistem-sistem ini tidak semuanya menggunakan perayap yang sama atau mengikuti aturan yang sama. Sebuah situs web yang memblokir GPTBot mungkin masih muncul dalam pencarian ChatGPT jika mengizinkan OAI-SearchBot. Sebuah situs web yang mengizinkan Applebot dapat tetap terlihat di Apple Search sambil memblokir Applebot-Extended dari pelatihan model kecerdasan buatan. Google-Extended milik Google sama sekali bukan perayap biasa; itu adalah token kontrol robots.txt.
Oleh karena itu, kebijakan terbaik bukanlah sekadar “izinkan kecerdasan buatan” atau “blokir kecerdasan buatan.” Ini adalah tentang membuat izin terpisah untuk:
- Pencarian dan penemuan
- Pengambilan yang diminta pengguna
- Pengembangan dan pelatihan model
- Kumpulan data publik
- Materi sensitif, pribadi, atau terbatas
Artikel ini menyediakan inventaris perayap terkini, contoh robots.txt, panduan meta tag, metode verifikasi alamat Protokol Internet, saran lisensi Creative Commons, boilerplate hukum, dan matriks risiko-manfaat.
Empat Kontrol yang Harus Dipahami Setiap Penerbit
1. robots.txt mengontrol perayapan yang diminta
File robots.txt memberitahu klien otomatis yang patuh halaman mana yang boleh mereka minta. Ini berguna untuk mengelola lalu lintas perayap dan menyatakan preferensi penerbit.
Namun, robots.txt bukan sistem kontrol akses. Protokol Pengecualian Robot menyatakan bahwa aturannya bukanlah otorisasi akses. Google juga memperingatkan bahwa alamat yang diblokir masih dapat muncul di hasil pencarian jika halaman lain menautkannya. Gunakan kata sandi, autentikasi, atau kontrol akses sisi server untuk informasi rahasia. (rfc-editor.org)
2. Meta tag mengontrol pengindeksan dan cuplikan
Meta tag robot dan header respons X-Robots-Tag dapat mengontrol apakah sebuah halaman diindeks atau apakah mesin pencari boleh menampilkan cuplikan.
Kontrol-kontrol ini biasanya hanya terlihat setelah perayap diizinkan mengambil halaman. Jika robots.txt memblokir halaman terlebih dahulu, perayap mungkin tidak akan pernah melihat meta tag tersebut. (developers.google.com)
3. Kontrol jaringan memverifikasi perayap
Nama user-agent mudah disalin. Penyerang dapat mengirim permintaan yang mengaku sebagai GPTBot, Googlebot, atau PerplexityBot.
Pendekatan yang lebih kuat menggabungkan:
- User-agent yang diklaim
- Rentang alamat Protokol Internet yang dipublikasikan
- Verifikasi Sistem Nama Domain Terbalik (Reverse Domain Name System)
- Verifikasi Sistem Nama Domain Maju (Forward Domain Name System)
- Batas laju (rate limits) dan pemantauan permintaan
4. Lisensi memberikan hak pakai ulang
Robots.txt menyatakan apa yang diminta perayap untuk dilakukan. Lisensi menyatakan apa yang secara hukum boleh dilakukan orang atau organisasi dengan materi ketika izin hak cipta diperlukan.
Ini adalah alat yang berbeda. Lisensi permisif dapat mengurangi ketidakpastian hukum, tetapi tidak menjamin bahwa perayap akan mengunjungi halaman, bahwa model akan menggunakannya, atau bahwa asisten akan mengutipnya.
Inventaris Perayap Penting
Inventaris berikut telah diperiksa terhadap dokumentasi penyedia yang tersedia pada 25 Agustus 2026. Nama user-agent, tujuan, dan rentang alamat Protokol Internet dapat berubah, sehingga sistem produksi harus menggunakan dokumentasi terkini dan feed alamat langsung dari penyedia.
| Penyedia | Perayap atau token robots.txt | Tujuan utama | Kontrol penting |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Menemukan dan menganalisis halaman untuk pencarian ChatGPT | Izinkan untuk meningkatkan peluang halaman muncul di hasil pencarian ChatGPT. |
| OpenAI | GPTBot | Mengumpulkan halaman yang dapat digunakan untuk melatih model kecerdasan buatan generatif OpenAI | Izinkan atau tolak secara terpisah dari pencarian. |
| OpenAI | ChatGPT-User | Mengambil halaman setelah pengguna meminta ChatGPT atau GPT kustom untuk mengaksesnya | Ini dipicu oleh pengguna daripada perayap web otomatis, sehingga aturan robots.txt mungkin tidak berlaku. |
| OpenAI | OAI-AdsBot | Memeriksa halaman web yang diajukan sebagai tujuan iklan ChatGPT | Terutama relevan bagi pengiklan. Konten yang dikumpulkan tidak digunakan untuk melatih model dasar kecerdasan buatan generatif. |
Googlebot | Perayap utama Google Search | Mengontrol perayapan Google Search biasa. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Gambar, video, dan Google News | Ini memiliki token robots.txt terpisah dan dapat dikontrol secara independen. | |
GoogleOther | Perayapan Google serbaguna untuk berbagai tim produk, termasuk penelitian dan pengembangan | Ini tidak mewakili satu produk Google tertentu. | |
Google-Extended | Mengontrol apakah konten yang dirayapi Google dapat digunakan untuk pelatihan model Gemini dan sistem grounding tertentu | Ini adalah token kontrol robots.txt, bukan user-agent permintaan terpisah. Ini tidak memengaruhi inklusi Google Search biasa. | |
| Anthropic | ClaudeBot | Mengumpulkan konten web publik yang dapat berkontribusi pada pengembangan model Claude | Tolak untuk memberi sinyal bahwa materi di masa mendatang harus dikecualikan dari kumpulan data pelatihan Anthropic. |
| Anthropic | Claude-SearchBot | Meningkatkan kualitas hasil pencarian Claude | Izinkan untuk visibilitas pencarian Claude. |
| Anthropic | Claude-User | Mengambil halaman sebagai respons terhadap permintaan pengguna ke Claude | Terpisah dari perayapan otomatis. |
| Perplexity | PerplexityBot | Mengindeks halaman untuk hasil pencarian Perplexity | Perplexity mengatakan perayap ini tidak digunakan untuk mengumpulkan konten untuk pelatihan model dasar kecerdasan buatan. |
| Perplexity | Perplexity-User | Mengambil halaman setelah pengguna memintanya | Dokumentasi Perplexity mengatakan fetcher ini umumnya mengabaikan robots.txt karena permintaan dimulai oleh pengguna. |
| Apple | Applebot | Mendukung Apple Search, Spotlight, Siri, Safari, dan pengalaman Apple lainnya | Izinkan untuk penemuan Apple. |
| Apple | Applebot-Extended | Mengontrol apakah konten yang dirayapi Applebot dapat digunakan untuk melatih model dasar Apple | Ini tidak merayapi halaman itu sendiri. Ini adalah kontrol penggunaan data. |
| Common Crawl | CCBot | Mengumpulkan data web publik untuk arsip web terbuka Common Crawl | Ini bukan asisten, tetapi kumpulan datanya dapat digunakan oleh peneliti dan pengembang kecerdasan buatan. |
| Microsoft | Bingbot | Perayap utama pencarian Bing | Izinkan untuk penemuan Bing dan visibilitas pencarian. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Pratinjau halaman dan video untuk produk Microsoft | Ini dapat dikontrol secara terpisah dari Bingbot. |
| Amazon | Amzn-SearchBot | Pencarian Amazon dan penemuan konten | Amazon mengatakan tidak merayapi konten untuk pelatihan model kecerdasan buatan generatif. |
| Amazon | Amzn-User | Mengambil informasi terkini sebagai respons terhadap tindakan pengguna, termasuk permintaan Alexa | Dipicu oleh pengguna dan terpisah dari perayapan pencarian otomatis. |
OpenAI mendokumentasikan perayap pencarian, pelatihan, iklan, dan yang dipicu pengguna sebagai kontrol terpisah. Dokumentasinya secara khusus merekomendasikan untuk mengizinkan OAI-SearchBot untuk pencarian ChatGPT sambil menggunakan GPTBot secara terpisah untuk preferensi pelatihan. (developers.openai.com)
Google juga memisahkan Googlebot, GoogleOther, dan Google-Extended. Google-Extended tidak memiliki user-agent permintaan HTTP sendiri, dan memblokirnya tidak menghapus halaman dari Google Search. (developers.google.com)
Anthropic mendokumentasikan peran terpisah untuk ClaudeBot, Claude-SearchBot, dan Claude-User. Anthropic juga menyatakan bahwa botnya mengikuti robots.txt dan mendukung direktif non-standar Crawl-delay. (support.anthropic.com)
Perplexity membedakan antara perayapan pencarian otomatis dan pengambilan yang diminta pengguna. Dokumentasi terkininya menyatakan bahwa PerplexityBot menghormati robots.txt, sementara Perplexity-User umumnya tidak karena merespons permintaan pengguna. (docs.perplexity.ai)
Dokumentasi terkini Apple membuat perbedaan yang sama antara pencarian dan pelatihan: Applebot mendukung penemuan, sementara Applebot-Extended memungkinkan penerbit mengontrol penggunaan pelatihan tanpa menghapus halaman dari Apple Search. (support.apple.com)
Konfigurasi robots.txt yang Direkomendasikan
Tempatkan robots.txt di akar setiap host, seperti:
text https://www.example.org/robots.txt
Aturan berlaku untuk host, protokol, dan port tertentu tempat file disajikan. Subdomain terpisah mungkin memerlukan filenya sendiri. (developers.google.com)
Konfigurasi 1: Inklusi maksimal
Gunakan ini ketika konten editorial publik dapat ditemukan, diringkas, dikutip, diindeks, dan dikumpulkan oleh perayap yang patuh.
text
Public pages are available to compliant crawlers.
User-agent: * Allow: /
Keep private, transactional, and administrative paths out.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Ini memungkinkan perayap bernama, termasuk OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft, dan Amazon, kecuali ada aturan spesifik lain yang memblokirnya.
Jangan tempatkan aturan umum seperti User-agent: * Disallow: / di bawah konfigurasi ini. Grup yang lebih baru atau lebih spesifik dapat mengubah cara perayap menginterpretasikan file.
Konfigurasi 2: Izinkan pencarian tetapi blokir perayap pengembangan model
Ini seringkali merupakan kompromi terbaik bagi penerbit yang menginginkan kutipan dan lalu lintas pencarian tetapi tidak ingin memberi sinyal izin untuk pengumpulan pengembangan model.
text
Block OpenAI model-development crawling.
User-agent: GPTBot Disallow: /
Block Anthropic model-development crawling.
User-agent: ClaudeBot Disallow: /
Block Google model-training and related grounding use.
User-agent: Google-Extended Disallow: /
Block Apple foundation-model training use.
User-agent: Applebot-Extended Disallow: /
Optional: block Common Crawl dataset collection.
User-agent: CCBot
Disallow: /
Allow ordinary search and retrieval crawling, except for sensitive paths.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Konfigurasi ini membiarkan OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot, dan Applebot tercakup oleh grup wildcard. Ini juga menjaga izin pencarian dan pelatihan terpisah.
Untuk Apple, memblokir Applebot-Extended sambil mengizinkan Applebot mempertahankan penemuan melalui layanan Apple. Untuk Google, memblokir Google-Extended tidak memblokir Google Search biasa. (developers.google.com)
Konfigurasi 3: Secara eksplisit izinkan perayap pencarian terpilih
Jika file robots.txt yang sudah ada memblokir semua perayap, tambahkan grup terpisah untuk perayap pencarian yang ingin Anda sambut.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Keep all other crawlers out.
User-agent: * Disallow: /
Saat menggunakan grup spesifik, ulangi aturan jalur sensitif di dalam setiap grup. Beberapa perayap menggunakan grup pencocokan yang paling spesifik daripada menggabungkannya dengan grup wildcard. Bing mendokumentasikan perilaku ini secara langsung, dan Google memberikan panduan terpisah tentang grup spesifik perayap. (bing.com)
Batasan robots.txt yang penting
- Perayap dapat mengabaikan robots.txt.
- Perayap berbahaya dapat berpura-pura menjadi perayap tepercaya.
- Halaman yang diblokir masih dapat diketahui melalui judul atau alamat webnya.
- Robots.txt tidak melindungi kata sandi, file pribadi, catatan pelanggan, atau antarmuka pemrograman aplikasi rahasia (confidential application programming interfaces).
- Direktif
Crawl-delaybukan bagian dari Protokol Pengecualian Robot inti dan tidak didukung oleh setiap perayap. Anthropic dan Bing mendokumentasikan dukungan, sementara Apple mengatakan Applebot tidak mengikuti crawl-delay. (rfc-editor.org)
Meta Tag dan HTTP Header
Contoh halaman publik
Untuk artikel publik, gunakan judul yang jelas, penulis, alamat web kanonis, tanggal publikasi, dan tanggal modifikasi.
html
Direktif max-snippet didokumentasikan terutama untuk Google. Jangan berasumsi bahwa setiap perayap kecerdasan buatan mendukung setiap direktif meta.
Contoh halaman pribadi atau sensitif
html
Gunakan ini untuk halaman yang seharusnya tidak muncul di hasil pencarian. Halaman tersebut harus tetap dapat dirayapi cukup lama agar perayap dapat melihat direktif. Jika halaman benar-benar harus tetap pribadi, gunakan autentikasi atau perlindungan kata sandi sebagai gantinya. (developers.google.com)
Sembunyikan hanya bagian sensitif dari cuplikan pencarian
Google mendukung data-nosnippet untuk bagian tertentu dari halaman HTML:
html
This paragraph may be shown in a search result.
Ini berguna untuk detail kontak, catatan internal, atau informasi yang dihasilkan pengguna. Ini bukan instruksi universal untuk setiap sistem kecerdasan buatan. (developers.google.com)
Gunakan header X-Robots-Tag untuk file
Meta tag tidak dapat ditempatkan di dalam file dokumen portabel, gambar, atau file video. Gunakan header respons HTTP sebagai gantinya:
text X-Robots-Tag: noindex, nosnippet
Untuk halaman yang harus tetap dapat dicari tetapi tidak boleh memberikan teks untuk cuplikan atau jawaban kecerdasan buatan, gunakan:
text X-Robots-Tag: nosnippet
Google mendokumentasikan X-Robots-Tag untuk sumber daya non-HTML, dan Apple juga mendukungnya untuk Applebot. (developers.google.com)
Kontrol spesifik Apple
Apple mendukung:
html
Apple mengatakan nosnippet mencegah halaman digunakan sebagai konteks tambahan dan konten saat ini ketika model Apple menghasilkan keluaran. Halaman tersebut mungkin masih tetap dapat ditemukan melalui Apple Search, Spotlight, Siri, dan Safari. (support.apple.com)
Untuk halaman berbayar (paywalled pages), Apple juga mendukung data terstruktur menggunakan:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple mengatakan halaman tersebut mungkin tetap memenuhi syarat untuk hasil pencarian tetapi tidak akan digunakan sebagai konteks tambahan untuk jawaban kecerdasan buatan. (support.apple.com)
Cara Memverifikasi Alamat Protokol Internet Perayap
Mengapa pencocokan user-agent tidak cukup
Aturan seperti ini lemah:
text if User-Agent contains "GPTBot": allow
Siapa pun bisa mengirim teks itu. Aturan yang lebih baik adalah:
text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block
Jangan percaya header X-Forwarded-For kecuali itu berasal dari proxy atau jaringan pengiriman konten (content delivery network) yang dikendalikan organisasi Anda.
Metode verifikasi penyedia
| Penyedia | Metode verifikasi yang direkomendasikan |
|---|---|
| OpenAI | Gunakan feed alamat Protokol Internet langsung yang dipublikasikan dalam dokumentasi perayap OpenAI untuk OAI-SearchBot, GPTBot, dan OAI-AdsBot. Perbarui secara otomatis daripada menyalin rentang tetap ke dalam firewall. |
| Gunakan rentang perayap yang dipublikasikan Google atau lakukan pemeriksaan Sistem Nama Domain terbalik dan maju. Perayap Google yang asli harus menyelesaikan ke nama host Google yang disetujui dan kembali ke alamat aslinya. | |
| Anthropic | Gunakan feed alamat perayap yang dipublikasikan saat ini sebagai pemeriksaan jaringan sekunder. Metode opt-out utama Anthropic tetap robots.txt. |
| Perplexity | Gabungkan user-agent dengan feed alamat PerplexityBot atau Perplexity-User saat ini. Perplexity secara khusus merekomendasikan untuk menggabungkan kedua kondisi dalam aturan Web Application Firewall. |
| Apple | Gunakan verifikasi Sistem Nama Domain terbalik di bawah applebot.apple.com, lalu lakukan pencarian maju. Apple juga mempublikasikan rentang alamat saat ini dalam feed JSON. |
| Common Crawl | Gunakan verifikasi Sistem Nama Domain terbalik di bawah crawl.commoncrawl.org dan feed alamat CCBot saat ini. Common Crawl mencatat bahwa verifikasi terbalik belum tersedia untuk beberapa lalu lintas IPv6. |
| Microsoft | Gunakan alat Verify Bingbot resmi atau metode pencarian terbalik dan maju Microsoft yang didokumentasikan. |
| Amazon | Gunakan daftar alamat perayap Amazon yang dipublikasikan dan cocokkan dengan user-agent Amazon yang sesuai. |
Google, Apple, Common Crawl, OpenAI, Anthropic, dan Perplexity semuanya mempublikasikan metode atau feed alamat spesifik penyedia. Daftar ini dapat berubah, sehingga proses pembaruan terjadwal lebih aman daripada daftar yang disalin secara manual secara permanen. (developers.google.com)
Desain firewall sederhana mungkin terlihat seperti ini:
text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match
rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers
Jangan menerapkan aturan izinkan luas ke seluruh penyedia cloud. Perayap yang sah mungkin menggunakan infrastruktur cloud, tetapi sebagian besar lalu lintas dari penyedia cloud itu belum tentu perayap.
Bagaimana Lisensi Terbuka Memengaruhi Inklusi
CC BY 4.0 dalam bahasa sederhana
Lisensi Creative Commons Attribution 4.0 International, yang biasa disebut CC BY 4.0, memungkinkan orang untuk:
- Menyalin dan mendistribusikan ulang karya
- Mengadaptasi, menerjemahkan, me-remix, dan membangun di atasnya
- Menggunakannya secara komersial
Kondisi utamanya adalah:
- Berikan atribusi yang sesuai
- Tautkan ke lisensi
- Tunjukkan apakah ada perubahan yang dilakukan
- Jangan menyarankan bahwa pencipta asli mendukung penggunaan ulang tersebut
- Jangan menambahkan batasan hukum atau teknis yang mencegah penggunaan yang diizinkan oleh lisensi
Creative Commons juga memperingatkan bahwa lisensi tersebut mungkin tidak mencakup hak privasi, hak publisitas, hak moral, hak merek dagang, hak paten, atau materi pihak ketiga. (creativecommons.org)
Lisensi bukan undangan perayap dengan sendirinya
Menempatkan “CC BY 4.0” pada sebuah halaman tidak menjamin bahwa sebuah organisasi akan merayapinya. Perayap mungkin masih diblokir oleh:
- robots.txt
- Jaringan pengiriman konten (Content delivery network)
- Web Application Firewall
- Pembatasan laju (Rate limiting)
- Tantangan JavaScript (JavaScript challenge)
- Dinding masuk (Login wall)
- Respons server yang buruk
- Sitemap yang tidak dapat diakses
Sebaliknya, mengizinkan perayap tidak secara otomatis memberikan setiap izin hak cipta yang diperlukan untuk setiap penggunaan selanjutnya. Robots.txt dan lisensi harus dirancang bersama.
Mengapa CC BY dapat mendukung inklusi yang lebih luas
Lisensi permisif yang jelas dapat membuat kebijakan penerbit lebih mudah dipahami oleh tim data, sistem pencarian, dan operator asisten. Ini dapat mengurangi ketidakpastian tentang penyalinan, adaptasi, penggunaan komersial, terjemahan, dan redistribusi ketika aktivitas tersebut memerlukan izin hak cipta.
Namun, Creative Commons menjelaskan bahwa pelatihan kecerdasan buatan secara hukum kompleks. Lisensi yang membatasi tidak selalu merupakan cara yang efektif untuk mencegah pelatihan, karena beberapa penggunaan pelatihan mungkin diizinkan oleh pengecualian atau batasan hak cipta. Creative Commons juga mencatat bahwa kondisi lisensi dapat sulit diterapkan pada pelatihan mesin dan keluaran model. (creativecommons.org)
Pelajaran praktisnya adalah:
Gunakan CC BY ketika Anda benar-benar menginginkan penggunaan ulang yang luas secara sah. Jangan gunakan lisensi Creative Commons yang membatasi sebagai opt-out pelatihan kecerdasan buatan yang dijamin.
Atribusi meningkatkan kejelasan sumber
Creative Commons merekomendasikan metode TASL:
- Title (Judul)
- Author (Penulis)
- Source (Sumber)
- License (Lisensi)
Misalnya:
“Lisensi dan Robot untuk Inklusi Maksimal,” Example Publishing, https://www.example.org/articles/ai-crawlers, dilisensikan di bawah Creative Commons Attribution 4.0 International. Perubahan yang dilakukan: inventaris perayap diperbarui.
Atribusi yang jelas tidak memaksa setiap asisten untuk mengutip sebuah halaman. Itu membuat kutipan yang benar lebih mudah ketika sebuah sistem mengekstrak judul, penulis, sumber, dan informasi lisensi halaman. (wiki.creativecommons.org)
Tambahkan informasi artikel terstruktur
Gunakan informasi yang terlihat dan data terstruktur bersama-sama:
html
Google merekomendasikan informasi penulis yang jelas, halaman penulis, tanggal publikasi, tanggal modifikasi, dan halaman kanonis yang stabil. Sinyal-sinyal ini dapat membantu sistem pencarian memahami siapa yang membuat materi dan versi mana yang otoritatif. Mereka tidak menjamin peringkat, inklusi, atau kutipan. (developers.google.com)
Boilerplate Hukum untuk Situs Terbuka yang Ramah Kutipan
Berikut ini adalah contoh bahasa, bukan nasihat hukum. Mintalah penasihat hukum untuk mengadaptasinya sesuai dengan yurisdiksi, struktur kepemilikan, kewajiban privasi, dan konten pihak ketiga Anda.
Pernyataan lisensi CC BY 4.0
text
Content license
Except where otherwise stated, the original text and original editorial materials on this page are licensed under the Creative Commons Attribution 4.0 International license:
https://creativecommons.org/licenses/by/4.0/
This permission allows copying, redistribution, adaptation, translation, commercial use, machine-readable processing, search indexing, retrieval, summarization, and use in artificial intelligence systems, provided that the license terms are followed.
Preferred attribution:
“[Page title],” by [author or organization], [canonical page address], published or updated [date], licensed under Creative Commons Attribution 4.0 International. Changes made: [describe changes, or state ‘none’].
Please preserve the author, publisher, source, license, and modification information whenever reasonably possible. This preferred attribution guide does not add restrictions to the Creative Commons license and does not replace the license text.
Frasa “termasuk sistem kecerdasan buatan” memperjelas maksud penerbit. Ini tidak boleh digunakan untuk berpura-pura bahwa penerbit memiliki hak atas materi yang dibuat oleh orang lain.
Pemberitahuan hak merek, privasi, dan pihak ketiga
text
Brand, privacy, and third-party rights
The license above covers only the original materials identified as licensed. It does not grant permission to use:
- Trademarks, service marks, logos, or trade dress
- Names, images, or likenesses of people
- Private, confidential, account, health, financial, or security information
- User submissions unless they are separately identified as licensed
- Photographs, illustrations, maps, video, music, quotations, or other third-party materials
- Content identified as “all rights reserved” or subject to a separate license
Use of the Example Publishing name, logos, and marks must not suggest sponsorship, approval, partnership, or endorsement. Please link to the original page and clearly distinguish quotation, paraphrase, summary, and generated material.
Bahasa ini penting karena lisensi Creative Commons tidak secara otomatis memberikan setiap jenis hak hukum yang terkait dengan sebuah halaman. (creativecommons.org)
Panduan kutipan pencarian dan asisten
text
Search and assistant citation guidance
We welcome compliant search indexing, user-requested retrieval, citation, and summarization of the licensed material on this site.
When citing this site, please use the page title, author or publisher, canonical page address, publication or update date, and a direct link to the source. Please identify the source as one input among any sources used, distinguish generated analysis from quoted material, and do not state or imply that Example Publishing endorses a generated answer, product, person, or service.
This guidance is intended to improve accuracy and attribution. It does not grant rights beyond the applicable content license and does not license trademarks, personal information, confidential information, or third-party material.
Jika Anda ingin visibilitas pencarian tetapi tidak ingin memberikan lisensi pelatihan yang luas
text
Search access and copyright
Our public pages may be accessed by compliant search and retrieval crawlers identified in our robots.txt file. This permission is intended to support discovery, search results, user-requested retrieval, and citation.
Except where a separate license is shown, the original content remains all rights reserved. Access to a public page does not grant a separate license for model-development, training, redistribution, commercial reuse, or creation of derivative works beyond rights provided by applicable law.
Please cite the canonical page address and publisher when referring to this material. Nothing on this site grants permission to use trademarks, logos, personal information, confidential information, or third-party content.
Jangan menempatkan pernyataan CC BY dan pernyataan all-rights-reserved pada materi yang sama. Identifikasi dengan jelas lisensi mana yang berlaku untuk konten mana.
Matriks Risiko-Manfaat untuk Lisensi Terbuka
Hukum hak cipta dan aturan pelatihan kecerdasan buatan berbeda-beda di setiap negara dan masih belum tuntas. Kantor Hak Cipta Amerika Serikat terus meneliti masalah-masalah ini, sementara Creative Commons menggambarkan pelatihan kecerdasan buatan sebagai hal yang spesifik fakta dan kompleks secara hukum. (copyright.gov)
| Pendekatan | Potensi inklusi | Manfaat utama | Risiko utama | Paling cocok |
|---|---|---|---|---|
| CC BY 4.0 | Sangat tinggi | Penyalinan luas, adaptasi, penggunaan komersial, terjemahan, pengindeksan, dan penggunaan ulang terkait model ketika izin hak cipta diperlukan | Pesaing komersial dapat menggunakan ulang atau mengadaptasi konten; atribusi mungkin tidak sempurna; lisensi tidak dapat mengontrol privasi, merek dagang, atau hak pihak ketiga | Penerbit yang menginginkan penggunaan ulang sah terluas dan atribusi sumber yang kuat |
| CC BY-SA 4.0 | Tinggi, tetapi lebih kompleks | Mendorong siklus berbagi terbuka dan mewajibkan adaptasi untuk tetap berada di bawah persyaratan yang kompatibel | Aturan ShareAlike dapat sulit diterapkan pada kumpulan data, pelatihan model, dan keluaran publik; beberapa organisasi mungkin menghindari materi karena ketidakpastian | Proyek pendidikan terbuka dan kepentingan publik yang ingin adaptasi hilirnya tetap terbuka |
| CC BY-NC 4.0 | Sedang atau rendah | Membatasi penggunaan yang terutama ditujukan untuk keuntungan komersial atau kompensasi moneter | “Nonkomersial” bisa sulit diinterpretasikan; dapat mengecualikan penggunaan pencarian, model, dan asisten komersial; itu bukan opt-out pelatihan yang dijamin | Materi yang ditujukan untuk penggunaan nirlaba, pendidikan, atau komunitas |
| CC BY-ND 4.0 | Sedang | Memungkinkan berbagi sambil membatasi adaptasi | Terjemahan, transformasi, dan beberapa kasus penggunaan asisten mungkin menjadi tidak pasti secara hukum; kurang menarik untuk sistem yang meringkas atau me-remix | Pemberitahuan resmi atau karya yang harus tetap tidak berubah |
| CC0 atau dedikasi domain publik | Sangat tinggi | Menyederhanakan penggunaan ulang dan menghilangkan sebagian besar kondisi hak cipta jika secara hukum efektif | Tidak ada atribusi yang diwajibkan; kontrol lemah atas presentasi merek; hak privasi, merek dagang, dan publisitas tetap terpisah | Fakta, kumpulan data, materi referensi, atau karya yang ditujukan untuk penggunaan ulang tanpa batasan |
| Semua hak dilindungi plus perayapan pencarian terbuka | Tinggi untuk pencarian, lebih rendah untuk pelatihan | Dapat mempertahankan visibilitas pencarian dan kutipan tanpa memberikan lisensi penggunaan ulang yang luas | Ketidakpastian hukum yang lebih tinggi untuk pengembang model; dapat mengurangi inklusi dalam kumpulan data pelatihan dan sistem penggunaan ulang komersial | Penerbit yang menginginkan penemuan dan kutipan tetapi lebih suka menegosiasikan lisensi yang lebih luas secara terpisah |
Strategi yang paling seimbang untuk banyak organisasi adalah:
- CC BY 4.0 untuk teks editorial publik asli
- Label terpisah untuk materi pihak ketiga
- Tidak ada informasi pribadi atau rahasia yang bersifat publik
- Izinkan perayap pencarian dan pengambilan
- Izinkan perayap pengembangan model hanya jika organisasi benar-benar menerima penggunaan tersebut
- Gunakan atribusi yang jelas dan tautan kanonis
- Lindungi merek dagang melalui pemberitahuan merek terpisah
Daftar Periksa Implementasi Praktis
Konten dan lisensi
- Identifikasi siapa yang memiliki setiap halaman, gambar, bagan, video, dan kutipan.
- Lisensikan hanya materi yang haknya dikendalikan oleh organisasi Anda.
- Tandai materi pihak ketiga secara terpisah.
- Tambahkan pernyataan lisensi yang terlihat.
- Sediakan kutipan yang disukai menggunakan judul, penulis, sumber, dan lisensi.
- Jaga agar logo, merek dagang, data pribadi, dan informasi rahasia di luar cakupan lisensi.
Robots.txt
- Buat file robots.txt publik di akar setiap host.
- Izinkan perayap pencarian secara terpisah dari perayap pelatihan.
- Blokir jalur administratif, akun, checkout, pribadi, dan aplikasi internal.
- Jangan mengandalkan robots.txt untuk keamanan.
- Uji file setelah setiap penerapan situs web besar.
Meta tag
- Gunakan tautan kanonis.
- Tambahkan penulis, tanggal publikasi, dan tanggal modifikasi.
- Gunakan
noindexuntuk halaman yang tidak boleh muncul dalam pencarian. - Gunakan
nosnippetataudata-nosnippetuntuk kutipan sensitif jika didukung. - Gunakan
X-Robots-Taguntuk file dokumen portabel, gambar, dan sumber daya non-HTML lainnya. - Ingatlah bahwa perayap harus dapat mengambil halaman sebelum dapat membaca meta tag-nya.
Keamanan jaringan
- Catat string user-agent, alamat sumber, kode respons, dan jalur permintaan.
- Verifikasi perayap tepercaya menggunakan feed alamat resmi atau metode Sistem Nama Domain (Domain Name System).
- Perbarui feed alamat secara otomatis.
- Gabungkan pemeriksaan user-agent dan alamat sumber.
- Batasi laju perayap yang diverifikasi daripada memberi mereka akses tanpa batas.
- Tantang atau blokir permintaan yang mengaku sebagai perayap tepercaya tetapi gagal dalam verifikasi.
Pengukuran
Lacak:
- Kunjungan dari layanan pencarian kecerdasan buatan
- Rujukan ke halaman asli
- Frekuensi kutipan
- Beban server oleh perayap
- Permintaan yang mengembalikan
403,404, atau429 - Akses perayap ke jalur yang tidak diinginkan
- Apakah artikel terkini ditemukan setelah publikasi
Kesimpulan
Inklusi maksimal membutuhkan keterbukaan selektif, bukan satu izin umum.
Gunakan robots.txt untuk memisahkan perayapan pencarian, pengambilan pengguna, pelatihan, dan kumpulan data publik. Gunakan meta tag dan header HTTP untuk mengelola pengindeksan dan cuplikan. Gunakan autentikasi untuk apa pun yang bersifat pribadi. Verifikasi alamat Protokol Internet perayap daripada hanya mempercayai nama user-agent.
Lisensi permisif seperti CC BY 4.0 dapat membuat penggunaan ulang yang luas lebih mudah ketika Anda benar-benar menginginkannya. Informasi atribusi yang jelas — judul, penulis, sumber, lisensi, halaman kanonis, dan tanggal pembaruan — juga dapat mempermudah sistem pencarian dan asisten untuk mengidentifikasi dan mengutip sumber yang benar.
Oleh karena itu, kebijakan penerbitan terkuat adalah:
**Buka konten publik yang ingin Anda temukan, lisensikan dengan jelas materi yang ingin Anda gunakan kembali, tandai materi yang tidak Anda miliki, lindungi informasi pribadi di tingkat server, dan berikan setiap perayap izin terpisah yang dapat ditinjau.
Auto