Cấp phép và Robots để Tối đa hóa khả năng Tiếp cận: Cách Chào đón Trình thu thập dữ liệu Trí tuệ Nhân tạo
Cập nhật ngày 25 tháng 8 năm 2026
Các trang web hiện có nhiều cách để tiếp cận đối tượng. Một trang có thể được tìm thấy thông qua Google Search, được ChatGPT tóm tắt, được Perplexity trích dẫn, được sử dụng trong tìm kiếm của Claude, hiển thị thông qua các dịch vụ của Apple hoặc được thu thập bởi một kho lưu trữ web công cộng.
Những hệ thống này không phải tất cả đều sử dụng cùng một trình thu thập dữ liệu hoặc tuân theo cùng một quy tắc. Một trang web chặn GPTBot vẫn có thể xuất hiện trong tìm kiếm của ChatGPT nếu nó cho phép OAI-SearchBot. Một trang web cho phép Applebot có thể vẫn hiển thị trong Apple Search trong khi chặn Applebot-Extended khỏi việc đào tạo mô hình trí tuệ nhân tạo. Google-Extended của Google hoàn toàn không phải là một trình thu thập dữ liệu thông thường; nó là một mã kiểm soát robots.txt.
Do đó, chính sách tốt nhất không chỉ đơn giản là “cho phép trí tuệ nhân tạo” hoặc “chặn trí tuệ nhân tạo.” Mà là tạo các quyền riêng biệt cho:
- Tìm kiếm và khám phá
- Truy xuất theo yêu cầu của người dùng
- Phát triển và đào tạo mô hình
- Tập dữ liệu công khai
- Tài liệu nhạy cảm, riêng tư hoặc bị hạn chế
Bài viết này cung cấp một danh sách kiểm kê trình thu thập dữ liệu hiện tại, các ví dụ về robots.txt, hướng dẫn về thẻ meta, phương pháp xác minh địa chỉ Giao thức Internet, lời khuyên về cấp phép Creative Commons, ngôn ngữ pháp lý mẫu và ma trận rủi ro-lợi ích.
Bốn biện pháp kiểm soát mà mọi nhà xuất bản nên hiểu
1. robots.txt kiểm soát việc thu thập dữ liệu theo yêu cầu
Một tệp robots.txt cho các client tự động tuân thủ biết những trang nào họ có thể yêu cầu. Nó hữu ích cho việc quản lý lưu lượng truy cập của trình thu thập dữ liệu và thể hiện các tùy chọn của nhà xuất bản.
Tuy nhiên, robots.txt không phải là một hệ thống kiểm soát truy cập. Giao thức loại trừ Robots quy định rằng các quy tắc của nó không phải là ủy quyền truy cập. Google cũng cảnh báo rằng một địa chỉ bị chặn vẫn có thể xuất hiện trong kết quả tìm kiếm nếu các trang khác liên kết đến nó. Sử dụng mật khẩu, xác thực hoặc kiểm soát truy cập phía máy chủ cho thông tin bảo mật. (rfc-editor.org)
2. Thẻ meta kiểm soát lập chỉ mục và đoạn trích
Các thẻ meta robots và tiêu đề phản hồi X-Robots-Tag có thể kiểm soát liệu một trang có được lập chỉ mục hay liệu một công cụ tìm kiếm có thể hiển thị một đoạn trích hay không.
Những kiểm soát này thường chỉ hiển thị sau khi trình thu thập dữ liệu được phép tìm nạp trang. Nếu robots.txt chặn trang trước, trình thu thập dữ liệu có thể không bao giờ thấy thẻ meta. (developers.google.com)
3. Kiểm soát mạng xác minh trình thu thập dữ liệu
Tên user-agent rất dễ sao chép. Một kẻ tấn công có thể gửi yêu cầu tự nhận là GPTBot, Googlebot hoặc PerplexityBot.
Một phương pháp tiếp cận mạnh mẽ hơn kết hợp:
- User-agent được khai báo
- Một phạm vi địa chỉ Giao thức Internet được công bố
- Xác minh Hệ thống tên miền ngược
- Xác minh Hệ thống tên miền xuôi
- Giới hạn tốc độ và giám sát yêu cầu
4. Giấy phép cấp quyền tái sử dụng
Robots.txt nói về những gì một trình thu thập dữ liệu được yêu cầu thực hiện. Giấy phép nói về những gì cá nhân hoặc tổ chức có thể làm hợp pháp với tài liệu khi quyền tác giả được yêu cầu.
Đây là những công cụ khác nhau. Một giấy phép mở có thể giảm sự không chắc chắn về pháp lý, nhưng nó không đảm bảo rằng trình thu thập dữ liệu sẽ truy cập trang, rằng một mô hình sẽ sử dụng nó, hoặc rằng một trợ lý sẽ trích dẫn nó.
Danh sách kiểm kê các trình thu thập dữ liệu quan trọng
Danh sách kiểm kê sau đây đã được kiểm tra dựa trên tài liệu của nhà cung cấp có sẵn vào ngày 25 tháng 8 năm 2026. Tên user-agent, mục đích và phạm vi địa chỉ Giao thức Internet có thể thay đổi, vì vậy các hệ thống sản xuất nên sử dụng tài liệu hiện tại và nguồn cấp địa chỉ trực tiếp của nhà cung cấp.
| Nhà cung cấp | Trình thu thập dữ liệu hoặc mã robots.txt | Mục đích chính | Kiểm soát quan trọng |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Tìm và phân tích các trang cho tìm kiếm của ChatGPT | Cho phép để cải thiện cơ hội các trang xuất hiện trong kết quả tìm kiếm của ChatGPT. |
| OpenAI | GPTBot | Thu thập các trang có thể được sử dụng để đào tạo các mô hình trí tuệ nhân tạo tạo sinh của OpenAI | Cho phép hoặc không cho phép riêng biệt với tìm kiếm. |
| OpenAI | ChatGPT-User | Tìm nạp các trang sau khi người dùng yêu cầu ChatGPT hoặc một GPT tùy chỉnh truy cập chúng | Đây là hành động do người dùng kích hoạt chứ không phải trình thu thập dữ liệu web tự động, vì vậy các quy tắc robots.txt có thể không áp dụng. |
| OpenAI | OAI-AdsBot | Kiểm tra các trang web được gửi làm đích quảng cáo của ChatGPT | Chủ yếu liên quan đến nhà quảng cáo. Nội dung thu thập không được sử dụng để đào tạo các mô hình nền tảng trí tuệ nhân tạo tạo sinh. |
Googlebot | Trình thu thập dữ liệu chính của Google Search | Kiểm soát việc thu thập dữ liệu tìm kiếm Google thông thường. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Hình ảnh, video và Google News | Chúng có các mã robots.txt riêng biệt và có thể được kiểm soát độc lập. | |
GoogleOther | Thu thập dữ liệu Google đa năng cho các nhóm sản phẩm khác nhau, bao gồm nghiên cứu và phát triển | Nó không đại diện cho một sản phẩm Google cụ thể nào. | |
Google-Extended | Kiểm soát liệu nội dung được Google thu thập có thể được sử dụng để đào tạo mô hình Gemini và một số hệ thống nền tảng hay không | Đây là một mã kiểm soát robots.txt, không phải là một user-agent yêu cầu riêng biệt. Nó không ảnh hưởng đến việc đưa vào Google Search thông thường. | |
| Anthropic | ClaudeBot | Thu thập nội dung web công khai có thể đóng góp vào việc phát triển mô hình Claude | Không cho phép để báo hiệu rằng tài liệu trong tương lai nên được loại trừ khỏi tập dữ liệu đào tạo của Anthropic. |
| Anthropic | Claude-SearchBot | Cải thiện chất lượng kết quả tìm kiếm của Claude | Cho phép để hiển thị trên tìm kiếm của Claude. |
| Anthropic | Claude-User | Tìm nạp các trang theo phản hồi yêu cầu của người dùng đối với Claude | Riêng biệt với việc thu thập dữ liệu tự động. |
| Perplexity | PerplexityBot | Lập chỉ mục các trang cho kết quả tìm kiếm của Perplexity | Perplexity cho biết trình thu thập dữ liệu này không được sử dụng để thu thập nội dung cho việc đào tạo mô hình nền tảng trí tuệ nhân tạo. |
| Perplexity | Perplexity-User | Tìm nạp một trang sau khi người dùng yêu cầu | Tài liệu của Perplexity nói rằng trình tìm nạp này thường bỏ qua robots.txt vì yêu cầu được người dùng khởi tạo. |
| Apple | Applebot | Hỗ trợ Apple Search, Spotlight, Siri, Safari và các trải nghiệm Apple khác | Cho phép để khám phá trên Apple. |
| Apple | Applebot-Extended | Kiểm soát liệu nội dung được Applebot thu thập có thể được sử dụng để đào tạo các mô hình nền tảng của Apple hay không | Nó không tự thu thập dữ liệu các trang. Nó là một kiểm soát việc sử dụng dữ liệu. |
| Common Crawl | CCBot | Thu thập dữ liệu web công cộng cho kho lưu trữ web mở của Common Crawl | Nó không phải là một trợ lý, nhưng các tập dữ liệu của nó có thể được sử dụng bởi các nhà nghiên cứu và nhà phát triển trí tuệ nhân tạo. |
| Microsoft | Bingbot | Trình thu thập dữ liệu chính của Bing search | Cho phép để khám phá trên Bing và hiển thị trong tìm kiếm. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Xem trước trang và video cho các sản phẩm của Microsoft | Những trình này có thể được kiểm soát riêng biệt với Bingbot. |
| Amazon | Amzn-SearchBot | Tìm kiếm và khám phá nội dung của Amazon | Amazon cho biết họ không thu thập nội dung để đào tạo mô hình trí tuệ nhân tạo tạo sinh. |
| Amazon | Amzn-User | Tìm nạp thông tin hiện tại theo phản hồi các hành động của người dùng, bao gồm các yêu cầu của Alexa | Do người dùng kích hoạt và riêng biệt với việc thu thập dữ liệu tìm kiếm tự động. |
OpenAI ghi lại các trình thu thập dữ liệu tìm kiếm, đào tạo, quảng cáo và do người dùng kích hoạt của mình dưới dạng các kiểm soát riêng biệt. Tài liệu của họ đặc biệt khuyến nghị cho phép OAI-SearchBot cho tìm kiếm của ChatGPT trong khi sử dụng GPTBot riêng biệt cho các tùy chọn đào tạo. (developers.openai.com)
Google cũng tương tự tách Googlebot, GoogleOther và Google-Extended. Google-Extended không có user-agent yêu cầu HTTP riêng, và việc chặn nó không loại bỏ một trang khỏi Google Search. (developers.google.com)
Anthropic ghi lại các vai trò riêng biệt cho ClaudeBot, Claude-SearchBot và Claude-User. Anthropic cũng tuyên bố rằng các bot của họ tuân theo robots.txt và hỗ trợ chỉ thị Crawl-delay không chuẩn. (support.anthropic.com)
Perplexity phân biệt giữa thu thập dữ liệu tìm kiếm tự động và tìm nạp theo yêu cầu của người dùng. Tài liệu hiện tại của họ nói rằng PerplexityBot tôn trọng robots.txt, trong khi Perplexity-User thường không tuân theo vì nó phản hồi một yêu cầu của người dùng. (docs.perplexity.ai)
Tài liệu hiện tại của Apple cũng có sự phân biệt tương tự giữa tìm kiếm và đào tạo: Applebot hỗ trợ khám phá, trong khi Applebot-Extended cho phép các nhà xuất bản kiểm soát việc sử dụng cho đào tạo mà không loại bỏ các trang khỏi Apple Search. (support.apple.com)
Các cấu hình robots.txt được đề xuất
Đặt robots.txt tại gốc của mỗi máy chủ, ví dụ:
text https://www.example.org/robots.txt
Các quy tắc áp dụng cho máy chủ, giao thức và cổng cụ thể nơi tệp được phục vụ. Một tên miền phụ riêng có thể cần tệp riêng của nó. (developers.google.com)
Cấu hình 1: Khả năng tiếp cận tối đa
Sử dụng cấu hình này khi nội dung biên tập công cộng có thể được tìm thấy, tóm tắt, trích dẫn, lập chỉ mục và thu thập bởi các trình thu thập dữ liệu tuân thủ.
text
Các trang công cộng có sẵn cho các trình thu thập dữ liệu tuân thủ.
User-agent: * Allow: /
Giữ các đường dẫn riêng tư, giao dịch và quản trị bên ngoài.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Điều này cho phép các trình thu thập dữ liệu được đặt tên, bao gồm OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft và Amazon, trừ khi có một quy tắc cụ thể khác chặn chúng.
Không đặt một quy tắc chung như User-agent: * Disallow: / bên dưới cấu hình này. Một nhóm sau hoặc cụ thể hơn có thể thay đổi cách trình thu thập dữ liệu diễn giải tệp.
Cấu hình 2: Cho phép tìm kiếm nhưng chặn các trình thu thập dữ liệu phát triển mô hình
Đây thường là sự thỏa hiệp tốt nhất cho các nhà xuất bản muốn có trích dẫn và lưu lượng tìm kiếm nhưng không muốn ra hiệu cho phép thu thập để phát triển mô hình.
text
Chặn việc thu thập dữ liệu phát triển mô hình của OpenAI.
User-agent: GPTBot Disallow: /
Chặn việc thu thập dữ liệu phát triển mô hình của Anthropic.
User-agent: ClaudeBot Disallow: /
Chặn việc đào tạo mô hình của Google và việc sử dụng để căn cứ liên quan.
User-agent: Google-Extended Disallow: /
Chặn việc sử dụng để đào tạo mô hình nền tảng của Apple.
User-agent: Applebot-Extended Disallow: /
Tùy chọn: chặn thu thập tập dữ liệu của Common Crawl.
User-agent: CCBot
Disallow: /
Cho phép thu thập dữ liệu tìm kiếm và truy xuất thông thường, ngoại trừ các đường dẫn nhạy cảm.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Cấu hình này để OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot và Applebot được bao phủ bởi nhóm ký tự đại diện. Nó cũng giữ các quyền tìm kiếm và đào tạo riêng biệt.
Đối với Apple, việc chặn Applebot-Extended trong khi cho phép Applebot vẫn bảo toàn khả năng khám phá thông qua các dịch vụ của Apple. Đối với Google, việc chặn Google-Extended không chặn tìm kiếm Google thông thường. (developers.google.com)
Cấu hình 3: Cho phép rõ ràng các trình thu thập dữ liệu tìm kiếm được chọn
Nếu một tệp robots.txt hiện có chặn tất cả các trình thu thập dữ liệu, hãy thêm các nhóm riêng biệt cho các trình thu thập dữ liệu tìm kiếm mà bạn muốn chào đón.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Giữ tất cả các trình thu thập dữ liệu khác bên ngoài.
User-agent: * Disallow: /
Khi sử dụng các nhóm cụ thể, hãy lặp lại các quy tắc đường dẫn nhạy cảm bên trong mỗi nhóm. Một số trình thu thập dữ liệu sử dụng nhóm khớp cụ thể nhất thay vì kết hợp nó với nhóm ký tự đại diện. Bing ghi lại hành vi này trực tiếp, và Google cung cấp hướng dẫn riêng về các nhóm cụ thể cho trình thu thập dữ liệu. (bing.com)
Các hạn chế quan trọng của robots.txt
- Một trình thu thập dữ liệu có thể bỏ qua robots.txt.
- Một trình thu thập dữ liệu độc hại có thể giả vờ là một trình thu thập dữ liệu đáng tin cậy.
- Một trang bị chặn vẫn có thể được biết đến qua tiêu đề hoặc địa chỉ web của nó.
- Robots.txt không bảo vệ mật khẩu, tệp riêng tư, hồ sơ khách hàng hoặc giao diện lập trình ứng dụng bảo mật.
- Một chỉ thị
Crawl-delaykhông phải là một phần của Giao thức loại trừ Robots cốt lõi và không được mọi trình thu thập dữ liệu hỗ trợ. Anthropic và Bing ghi lại sự hỗ trợ, trong khi Apple nói rằng Applebot không tuân theo crawl-delay. (rfc-editor.org)
Thẻ Meta và Tiêu đề HTTP
Ví dụ về trang công khai
Đối với một bài viết công khai, hãy sử dụng tiêu đề rõ ràng, tác giả, địa chỉ web chuẩn hóa, ngày xuất bản và ngày sửa đổi.
html
Chỉ thị max-snippet chủ yếu được ghi lại cho Google. Đừng cho rằng mọi trình thu thập dữ liệu trí tuệ nhân tạo đều hỗ trợ mọi chỉ thị meta.
Ví dụ về trang riêng tư hoặc nhạy cảm
html
Sử dụng điều này cho các trang không nên xuất hiện trong kết quả tìm kiếm. Trang phải duy trì khả năng thu thập dữ liệu đủ lâu để trình thu thập dữ liệu thấy chỉ thị. Nếu trang thực sự phải duy trì riêng tư, hãy sử dụng xác thực hoặc bảo vệ bằng mật khẩu thay thế. (developers.google.com)
Chỉ ẩn các phần nhạy cảm khỏi đoạn trích tìm kiếm
Google hỗ trợ data-nosnippet cho các phần cụ thể của trang HTML:
html
Đoạn văn này có thể được hiển thị trong kết quả tìm kiếm.
Điều này hữu ích cho các chi tiết liên hệ, ghi chú nội bộ hoặc thông tin do người dùng tạo. Nó không phải là một hướng dẫn chung cho mọi hệ thống trí tuệ nhân tạo. (developers.google.com)
Sử dụng tiêu đề X-Robots-Tag cho các tệp
Thẻ meta không thể được đặt bên trong tệp tài liệu di động, hình ảnh hoặc tệp video. Thay vào đó, hãy sử dụng tiêu đề phản hồi HTTP:
text X-Robots-Tag: noindex, nosnippet
Đối với một trang nên vẫn có thể tìm kiếm được nhưng không nên cung cấp văn bản cho đoạn trích hoặc câu trả lời trí tuệ nhân tạo, hãy sử dụng:
text X-Robots-Tag: nosnippet
Google ghi lại X-Robots-Tag cho các tài nguyên không phải HTML, và Apple cũng hỗ trợ nó cho Applebot. (developers.google.com)
Kiểm soát dành riêng cho Apple
Apple hỗ trợ:
html
Apple cho biết nosnippet ngăn trang được sử dụng làm ngữ cảnh bổ sung và nội dung hiện tại khi các mô hình của Apple tạo ra đầu ra. Trang vẫn có thể được khám phá thông qua Apple Search, Spotlight, Siri và Safari. (support.apple.com)
Đối với các trang có tường phí, Apple cũng hỗ trợ dữ liệu có cấu trúc bằng cách sử dụng:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple cho biết các trang như vậy có thể vẫn đủ điều kiện cho kết quả tìm kiếm nhưng sẽ không được sử dụng làm ngữ cảnh bổ sung cho các câu trả lời trí tuệ nhân tạo. (support.apple.com)
Cách xác minh địa chỉ Giao thức Internet của trình thu thập dữ liệu
Tại sao việc khớp user-agent là chưa đủ
Một quy tắc như thế này là yếu:
text if User-Agent contains "GPTBot": allow
Bất cứ ai cũng có thể gửi văn bản đó. Một quy tắc tốt hơn là:
text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block
Đừng tin tưởng tiêu đề X-Forwarded-For trừ khi nó đến từ một proxy hoặc mạng phân phối nội dung mà tổ chức của bạn kiểm soát.
Phương pháp xác minh của nhà cung cấp
| Nhà cung cấp | Phương pháp xác minh được đề xuất |
|---|---|
| OpenAI | Sử dụng nguồn cấp địa chỉ Giao thức Internet trực tiếp được công bố trong tài liệu trình thu thập dữ liệu của OpenAI cho OAI-SearchBot, GPTBot và OAI-AdsBot. Làm mới chúng tự động thay vì sao chép các phạm vi cố định vào tường lửa. |
| Sử dụng các phạm vi trình thu thập dữ liệu được Google công bố hoặc thực hiện kiểm tra Hệ thống tên miền ngược và xuôi. Một trình thu thập dữ liệu Google chính hãng phải phân giải thành tên máy chủ Google được phê duyệt và phân giải ngược lại thành địa chỉ gốc. | |
| Anthropic | Sử dụng nguồn cấp địa chỉ trình thu thập dữ liệu được công bố hiện tại làm kiểm tra mạng phụ. Phương pháp từ chối chính của Anthropic vẫn là robots.txt. |
| Perplexity | Kết hợp user-agent với nguồn cấp địa chỉ PerplexityBot hoặc Perplexity-User hiện tại. Perplexity đặc biệt khuyến nghị kết hợp cả hai điều kiện trong một quy tắc Tường lửa ứng dụng web. |
| Apple | Sử dụng xác minh Hệ thống tên miền ngược dưới applebot.apple.com, sau đó thực hiện tra cứu xuôi. Apple cũng công bố các phạm vi địa chỉ hiện tại trong một nguồn cấp dữ liệu JSON. |
| Common Crawl | Sử dụng xác minh Hệ thống tên miền ngược dưới crawl.commoncrawl.org và nguồn cấp địa chỉ CCBot hiện tại. Common Crawl lưu ý rằng xác minh ngược vẫn chưa có sẵn cho một số lưu lượng IPv6. |
| Microsoft | Sử dụng công cụ Verify Bingbot chính thức hoặc các phương pháp tra cứu ngược và xuôi được Microsoft ghi lại. |
| Amazon | Sử dụng danh sách địa chỉ trình thu thập dữ liệu được Amazon công bố và khớp chúng với user-agent Amazon thích hợp. |
Google, Apple, Common Crawl, OpenAI, Anthropic và Perplexity đều công bố các phương pháp hoặc nguồn cấp địa chỉ cụ thể của nhà cung cấp. Những danh sách này có thể thay đổi, vì vậy một quy trình cập nhật theo lịch trình an toàn hơn danh sách được sao chép thủ công vĩnh viễn. (developers.google.com)
Một thiết kế tường lửa đơn giản có thể trông như thế này:
text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match
rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers
Đừng áp dụng một quy tắc cho phép rộng rãi cho toàn bộ nhà cung cấp đám mây. Một trình thu thập dữ liệu hợp pháp có thể sử dụng cơ sở hạ tầng đám mây, nhưng hầu hết lưu lượng từ nhà cung cấp đám mây đó không nhất thiết là trình thu thập dữ liệu.
Cách Cấp phép Mở ảnh hưởng đến Khả năng tiếp cận
CC BY 4.0 bằng ngôn ngữ đơn giản
Giấy phép Creative Commons Ghi công 4.0 Quốc tế, thường được gọi là CC BY 4.0, cho phép mọi người:
- Sao chép và phân phối lại tác phẩm
- Điều chỉnh, dịch, phối lại và xây dựng dựa trên nó
- Sử dụng nó cho mục đích thương mại
Các điều kiện chính là:
- Ghi công thích hợp
- Liên kết đến giấy phép
- Cho biết liệu có thay đổi nào được thực hiện hay không
- Không gợi ý rằng người tạo ban đầu xác nhận việc tái sử dụng
- Không thêm các hạn chế pháp lý hoặc kỹ thuật ngăn cản việc sử dụng được giấy phép cho phép
Creative Commons cũng cảnh báo rằng giấy phép có thể không bao gồm quyền riêng tư, quyền công khai, quyền nhân thân, quyền nhãn hiệu, quyền bằng sáng chế hoặc tài liệu của bên thứ ba. (creativecommons.org)
Bản thân giấy phép không phải là lời mời trình thu thập dữ liệu
Việc đặt “CC BY 4.0” trên một trang không đảm bảo rằng một tổ chức sẽ thu thập dữ liệu trang đó. Một trình thu thập dữ liệu vẫn có thể bị chặn bởi:
- robots.txt
- Mạng phân phối nội dung
- Tường lửa ứng dụng web
- Giới hạn tốc độ
- Thử thách JavaScript
- Tường đăng nhập
- Phản hồi máy chủ kém
- Sơ đồ trang web không thể truy cập
Ngược lại, việc cho phép trình thu thập dữ liệu không tự động cấp mọi quyền tác giả cần thiết cho mọi mục đích sử dụng sau này. Robots.txt và việc cấp phép nên được thiết kế cùng nhau.
Tại sao CC BY có thể hỗ trợ khả năng tiếp cận rộng hơn
Một giấy phép mở rõ ràng có thể làm cho chính sách của nhà xuất bản dễ hiểu hơn đối với các nhóm dữ liệu, hệ thống tìm kiếm và người vận hành trợ lý. Nó có thể giảm sự không chắc chắn về việc sao chép, điều chỉnh, sử dụng thương mại, dịch thuật và phân phối lại khi các hoạt động đó yêu cầu quyền tác giả.
Tuy nhiên, Creative Commons giải thích rằng việc đào tạo trí tuệ nhân tạo rất phức tạp về mặt pháp lý. Một giấy phép hạn chế không phải lúc nào cũng là một cách hiệu quả để ngăn chặn việc đào tạo, bởi vì một số mục đích sử dụng cho đào tạo có thể được phép theo các ngoại lệ hoặc giới hạn về bản quyền. Creative Commons cũng lưu ý rằng các điều kiện giấy phép có thể khó áp dụng cho đào tạo máy và đầu ra mô hình. (creativecommons.org)
Bài học thực tiễn là:
Sử dụng CC BY khi bạn thực sự muốn tái sử dụng hợp pháp rộng rãi. Đừng sử dụng giấy phép Creative Commons hạn chế như một sự từ chối đào tạo trí tuệ nhân tạo được đảm bảo.
Ghi công cải thiện sự rõ ràng của nguồn
Creative Commons khuyến nghị phương pháp TASL:
- Tiêu đề
- Tác giả
- Nguồn
- Giấy phép
Ví dụ:
“Cấp phép và Robots để Tối đa hóa khả năng Tiếp cận,” Example Publishing, https://www.example.org/articles/ai-crawlers, được cấp phép theo Creative Commons Ghi công 4.0 Quốc tế. Thay đổi đã thực hiện: cập nhật danh sách kiểm kê trình thu thập dữ liệu.
Ghi công rõ ràng không buộc mọi trợ lý phải trích dẫn một trang. Nó làm cho việc trích dẫn chính xác dễ dàng hơn khi một hệ thống trích xuất tiêu đề, tác giả, nguồn và thông tin cấp phép của trang. (wiki.creativecommons.org)
Thêm thông tin bài viết có cấu trúc
Sử dụng thông tin hiển thị và dữ liệu có cấu trúc cùng nhau:
html
Google khuyến nghị thông tin tác giả rõ ràng, trang tác giả, ngày xuất bản, ngày sửa đổi và các trang chuẩn hóa ổn định. Những tín hiệu này có thể giúp các hệ thống tìm kiếm hiểu ai đã tạo ra tài liệu và phiên bản nào là có thẩm quyền. Chúng không đảm bảo xếp hạng, khả năng tiếp cận hoặc trích dẫn. (developers.google.com)
Ngôn ngữ pháp lý mẫu cho một trang web mở, thân thiện với trích dẫn
Những điều sau đây là ngôn ngữ mẫu, không phải lời khuyên pháp lý. Hãy để luật sư điều chỉnh cho phù hợp với khu vực pháp lý, cấu trúc sở hữu, nghĩa vụ bảo mật quyền riêng tư và nội dung của bên thứ ba của bạn.
Tuyên bố cấp phép CC BY 4.0
text
Giấy phép nội dung
Trừ khi có quy định khác, văn bản gốc và tài liệu biên tập gốc trên trang này được cấp phép theo giấy phép Creative Commons Ghi công 4.0 Quốc tế:
https://creativecommons.org/licenses/by/4.0/
Sự cho phép này cho phép sao chép, phân phối lại, điều chỉnh, dịch thuật, sử dụng thương mại, xử lý có thể đọc được bằng máy, lập chỉ mục tìm kiếm, truy xuất, tóm tắt và sử dụng trong các hệ thống trí tuệ nhân tạo, với điều kiện tuân thủ các điều khoản giấy phép.
Ghi công ưu tiên:
“[Tiêu đề trang],” bởi [tác giả hoặc tổ chức], [địa chỉ trang chuẩn hóa], xuất bản hoặc cập nhật [ngày], được cấp phép theo Creative Commons Ghi công 4.0 Quốc tế. Thay đổi đã thực hiện: [mô tả các thay đổi, hoặc ghi ‘không’].
Vui lòng giữ nguyên thông tin tác giả, nhà xuất bản, nguồn, giấy phép và sửa đổi bất cứ khi nào có thể. Hướng dẫn ghi công ưu tiên này không bổ sung hạn chế vào giấy phép Creative Commons và không thay thế văn bản giấy phép.
Cụm từ “bao gồm các hệ thống trí tuệ nhân tạo” làm rõ ý định của nhà xuất bản. Nó không nên được sử dụng để giả vờ rằng nhà xuất bản sở hữu quyền đối với tài liệu được tạo bởi người khác.
Thông báo về thương hiệu, quyền riêng tư và quyền của bên thứ ba
text
Thương hiệu, quyền riêng tư và quyền của bên thứ ba
Giấy phép trên chỉ bao gồm các tài liệu gốc được xác định là có giấy phép. Nó không cấp quyền sử dụng:
- Nhãn hiệu, nhãn hiệu dịch vụ, logo hoặc bao bì thương mại
- Tên, hình ảnh hoặc chân dung của người
- Thông tin riêng tư, bảo mật, tài khoản, sức khỏe, tài chính hoặc bảo mật
- Nội dung do người dùng gửi trừ khi chúng được xác định riêng là có giấy phép
- Ảnh, minh họa, bản đồ, video, nhạc, trích dẫn hoặc các tài liệu khác của bên thứ ba
- Nội dung được xác định là “bảo lưu mọi quyền” hoặc tuân theo một giấy phép riêng biệt
Việc sử dụng tên, logo và nhãn hiệu của Example Publishing không được gợi ý sự tài trợ, chấp thuận, hợp tác hoặc xác nhận. Vui lòng liên kết đến trang gốc và phân biệt rõ ràng trích dẫn, diễn giải, tóm tắt và tài liệu được tạo.
Ngôn ngữ này rất quan trọng vì các giấy phép Creative Commons không tự động cấp mọi loại quyền pháp lý liên quan đến một trang. (creativecommons.org)
Hướng dẫn trích dẫn tìm kiếm và trợ lý
text
Hướng dẫn trích dẫn tìm kiếm và trợ lý
Chúng tôi hoan nghênh việc lập chỉ mục tìm kiếm tuân thủ, truy xuất theo yêu cầu của người dùng, trích dẫn và tóm tắt tài liệu được cấp phép trên trang web này.
Khi trích dẫn trang web này, vui lòng sử dụng tiêu đề trang, tác giả hoặc nhà xuất bản, địa chỉ trang chuẩn hóa, ngày xuất bản hoặc cập nhật, và liên kết trực tiếp đến nguồn. Vui lòng xác định nguồn là một trong số các nguồn đã sử dụng, phân biệt phân tích được tạo ra với tài liệu được trích dẫn, và không nêu hoặc ngụ ý rằng Example Publishing xác nhận một câu trả lời, sản phẩm, người hoặc dịch vụ được tạo.
Hướng dẫn này nhằm mục đích cải thiện độ chính xác và ghi công. Nó không cấp quyền vượt quá giấy phép nội dung áp dụng và không cấp phép nhãn hiệu, thông tin cá nhân, thông tin bảo mật hoặc tài liệu của bên thứ ba.
Nếu bạn muốn hiển thị trong tìm kiếm nhưng không muốn cấp giấy phép đào tạo rộng rãi
text
Truy cập tìm kiếm và bản quyền
Các trang công khai của chúng tôi có thể được truy cập bởi các trình thu thập dữ liệu tìm kiếm và truy xuất tuân thủ được xác định trong tệp robots.txt của chúng tôi. Quyền này nhằm mục đích hỗ trợ khám phá, kết quả tìm kiếm, truy xuất theo yêu cầu của người dùng và trích dẫn.
Trừ khi có giấy phép riêng được hiển thị, nội dung gốc vẫn bảo lưu mọi quyền. Việc truy cập một trang công khai không cấp giấy phép riêng cho việc phát triển mô hình, đào tạo, phân phối lại, tái sử dụng thương mại hoặc tạo ra các tác phẩm phái sinh vượt quá quyền được cung cấp bởi luật pháp hiện hành.
Vui lòng trích dẫn địa chỉ trang chuẩn hóa và nhà xuất bản khi đề cập đến tài liệu này. Không có gì trên trang web này cấp quyền sử dụng nhãn hiệu, logo, thông tin cá nhân, thông tin bảo mật hoặc nội dung của bên thứ ba.
Không đặt tuyên bố CC BY và tuyên bố bảo lưu mọi quyền trên cùng một tài liệu. Xác định rõ ràng giấy phép nào áp dụng cho nội dung nào.
Ma trận Rủi ro-Lợi ích cho Cấp phép Mở
Luật bản quyền và các quy tắc đào tạo trí tuệ nhân tạo khác nhau tùy theo quốc gia và vẫn chưa được giải quyết. Văn phòng Bản quyền Hoa Kỳ tiếp tục xem xét các vấn đề này, trong khi Creative Commons mô tả việc đào tạo trí tuệ nhân tạo là đặc thù theo từng trường hợp và phức tạp về mặt pháp lý. (copyright.gov)
| Cách tiếp cận | Tiềm năng tiếp cận | Lợi ích chính | Rủi ro chính | Phù hợp nhất |
|---|---|---|---|---|
| CC BY 4.0 | Rất cao | Sao chép, điều chỉnh, sử dụng thương mại, dịch thuật, lập chỉ mục và tái sử dụng liên quan đến mô hình rộng rãi khi quyền tác giả được yêu cầu | Các đối thủ cạnh tranh thương mại có thể tái sử dụng hoặc điều chỉnh nội dung; việc ghi công có thể không hoàn hảo; giấy phép không thể kiểm soát quyền riêng tư, nhãn hiệu hoặc quyền của bên thứ ba | Các nhà xuất bản muốn tái sử dụng hợp pháp rộng rãi nhất và ghi công nguồn mạnh mẽ |
| CC BY-SA 4.0 | Cao, nhưng phức tạp hơn | Khuyến khích chu trình chia sẻ mở và yêu cầu các bản điều chỉnh phải tuân theo các điều khoản tương thích | Các quy tắc Chia sẻ tương tự có thể khó áp dụng cho tập dữ liệu, đào tạo mô hình và đầu ra công khai; một số tổ chức có thể tránh tài liệu vì sự không chắc chắn | Các dự án giáo dục mở và vì lợi ích công cộng muốn các bản điều chỉnh hạ nguồn vẫn mở |
| CC BY-NC 4.0 | Trung bình hoặc thấp | Giới hạn các mục đích sử dụng chủ yếu nhằm mục đích lợi thế thương mại hoặc bồi thường tiền tệ | “Phi thương mại” có thể khó hiểu; có thể loại trừ các mục đích sử dụng thương mại cho tìm kiếm, mô hình và trợ lý; nó không phải là sự từ chối đào tạo được đảm bảo | Tài liệu dành cho mục đích phi lợi nhuận, giáo dục hoặc cộng đồng |
| CC BY-ND 4.0 | Trung bình | Cho phép chia sẻ trong khi giới hạn các bản điều chỉnh | Dịch thuật, chuyển đổi và một số trường hợp sử dụng trợ lý có thể trở nên không chắc chắn về mặt pháp lý; ít hấp dẫn hơn đối với các hệ thống tóm tắt hoặc phối lại | Thông báo chính thức hoặc các tác phẩm phải giữ nguyên không thay đổi |
| CC0 hoặc hiến tặng vào phạm vi công cộng | Rất cao | Đơn giản hóa việc tái sử dụng và loại bỏ hầu hết các điều kiện bản quyền nếu có hiệu lực pháp lý | Không yêu cầu ghi công; kiểm soát yếu đối với việc trình bày thương hiệu; quyền riêng tư, nhãn hiệu và quyền công khai vẫn riêng biệt | Sự kiện, tập dữ liệu, tài liệu tham khảo hoặc các tác phẩm dành cho việc tái sử dụng không hạn chế |
| Bảo lưu mọi quyền cộng với thu thập dữ liệu tìm kiếm mở | Cao cho tìm kiếm, thấp hơn cho đào tạo | Có thể bảo toàn khả năng hiển thị tìm kiếm và trích dẫn mà không cần cấp giấy phép tái sử dụng rộng rãi | Sự không chắc chắn về pháp lý hơn cho các nhà phát triển mô hình; có thể làm giảm khả năng đưa vào tập dữ liệu đào tạo và hệ thống tái sử dụng thương mại | Các nhà xuất bản muốn khám phá và trích dẫn nhưng muốn đàm phán các giấy phép rộng hơn một cách riêng biệt |
Chiến lược cân bằng nhất cho nhiều tổ chức là:
- CC BY 4.0 cho văn bản biên tập công khai gốc
- Nhãn riêng cho tài liệu của bên thứ ba
- Không có thông tin cá nhân hoặc bảo mật công khai
- Cho phép các trình thu thập dữ liệu tìm kiếm và truy xuất
- Chỉ cho phép các trình thu thập dữ liệu phát triển mô hình nếu tổ chức thực sự chấp nhận việc sử dụng đó
- Sử dụng ghi công rõ ràng và các liên kết chuẩn hóa
- Bảo vệ nhãn hiệu thông qua một thông báo thương hiệu riêng biệt
Danh sách kiểm tra triển khai thực tế
Nội dung và cấp phép
- Xác định chủ sở hữu của từng trang, hình ảnh, biểu đồ, video và trích dẫn.
- Chỉ cấp phép cho tài liệu mà tổ chức của bạn kiểm soát quyền.
- Đánh dấu riêng tài liệu của bên thứ ba.
- Thêm tuyên bố cấp phép hiển thị rõ ràng.
- Cung cấp trích dẫn ưu tiên bằng cách sử dụng tiêu đề, tác giả, nguồn và giấy phép.
- Giữ logo, nhãn hiệu, dữ liệu cá nhân và thông tin bảo mật nằm ngoài phạm vi được cấp phép.
Robots.txt
- Tạo một tệp robots.txt công khai tại gốc của mỗi máy chủ.
- Cho phép các trình thu thập dữ liệu tìm kiếm riêng biệt với các trình thu thập dữ liệu đào tạo.
- Chặn các đường dẫn quản trị, tài khoản, thanh toán, riêng tư và ứng dụng nội bộ.
- Không dựa vào robots.txt để bảo mật.
- Kiểm tra tệp sau mỗi lần triển khai trang web lớn.
Thẻ meta
- Sử dụng các liên kết chuẩn hóa.
- Thêm tác giả, ngày xuất bản và ngày sửa đổi.
- Sử dụng
noindexcho các trang không nên xuất hiện trong tìm kiếm. - Sử dụng
nosnippethoặcdata-nosnippetcho các đoạn trích nhạy cảm (nếu được hỗ trợ). - Sử dụng
X-Robots-Tagcho các tệp tài liệu di động, hình ảnh và các tài nguyên không phải HTML khác. - Hãy nhớ rằng trình thu thập dữ liệu phải có khả năng tìm nạp một trang trước khi nó có thể đọc các thẻ meta của trang đó.
Bảo mật mạng
- Ghi lại chuỗi user-agent, địa chỉ nguồn, mã phản hồi và đường dẫn yêu cầu.
- Xác minh các trình thu thập dữ liệu đáng tin cậy bằng cách sử dụng nguồn cấp địa chỉ chính thức hoặc các phương pháp Hệ thống tên miền.
- Làm mới nguồn cấp địa chỉ tự động.
- Kết hợp kiểm tra user-agent và địa chỉ nguồn.
- Giới hạn tốc độ các trình thu thập dữ liệu đã xác minh thay vì cấp cho chúng quyền truy cập không giới hạn.
- Thách thức hoặc chặn các yêu cầu tự nhận là trình thu thập dữ liệu đáng tin cậy nhưng không vượt qua xác minh.
Đo lường
Theo dõi:
- Lượt truy cập từ các dịch vụ tìm kiếm trí tuệ nhân tạo
- Lượt giới thiệu đến trang gốc
- Tần suất trích dẫn
- Tải máy chủ theo trình thu thập dữ liệu
- Các yêu cầu trả về
403,404hoặc429 - Truy cập của trình thu thập dữ liệu vào các đường dẫn không mong muốn
- Liệu các bài viết hiện tại có được tìm thấy sau khi xuất bản hay không
Kết luận
Khả năng tiếp cận tối đa đòi hỏi sự cởi mở có chọn lọc, không phải một quyền cho phép chung chung duy nhất.
Sử dụng robots.txt để tách biệt việc thu thập dữ liệu tìm kiếm, truy xuất của người dùng, đào tạo và tập dữ liệu công khai. Sử dụng các thẻ meta và tiêu đề HTTP để quản lý lập chỉ mục và đoạn trích. Sử dụng xác thực cho bất kỳ điều gì riêng tư. Xác minh địa chỉ Giao thức Internet của trình thu thập dữ liệu thay vì chỉ tin tưởng vào tên user-agent.
Một giấy phép mở như CC BY 4.0 có thể làm cho việc tái sử dụng rộng rãi dễ dàng hơn khi bạn thực sự muốn nó. Thông tin ghi công rõ ràng—tiêu đề, tác giả, nguồn, giấy phép, trang chuẩn hóa và ngày cập nhật—cũng có thể giúp các hệ thống tìm kiếm và trợ lý dễ dàng xác định và trích dẫn nguồn chính xác hơn.
Do đó, chính sách xuất bản mạnh mẽ nhất là:
**Mở nội dung công khai bạn muốn được khám phá, cấp phép rõ ràng tài liệu bạn muốn tái sử dụng, đánh dấu tài liệu bạn không sở hữu, bảo vệ thông tin riêng tư ở cấp độ máy chủ và cấp cho mọi trình thu thập dữ liệu một quyền riêng biệt, có thể xem xét.
Auto