AutoPodAutoPod

Cấp phép và Robots để Tối đa hóa khả năng Tiếp cận: Cách Chào đón Trình thu thập dữ liệu AI

36 phút đọc
Bài viết âm thanh
Cấp phép và Robots để Tối đa hóa khả năng Tiếp cận: Cách Chào đón Trình thu thập dữ liệu AI
0:000:00
Cấp phép và Robots để Tối đa hóa khả năng Tiếp cận: Cách Chào đón Trình thu thập dữ liệu AI

Cấp phép và Robots để Tối đa hóa khả năng Tiếp cận: Cách Chào đón Trình thu thập dữ liệu Trí tuệ Nhân tạo

Cập nhật ngày 25 tháng 8 năm 2026

Các trang web hiện có nhiều cách để tiếp cận đối tượng. Một trang có thể được tìm thấy thông qua Google Search, được ChatGPT tóm tắt, được Perplexity trích dẫn, được sử dụng trong tìm kiếm của Claude, hiển thị thông qua các dịch vụ của Apple hoặc được thu thập bởi một kho lưu trữ web công cộng.

Những hệ thống này không phải tất cả đều sử dụng cùng một trình thu thập dữ liệu hoặc tuân theo cùng một quy tắc. Một trang web chặn GPTBot vẫn có thể xuất hiện trong tìm kiếm của ChatGPT nếu nó cho phép OAI-SearchBot. Một trang web cho phép Applebot có thể vẫn hiển thị trong Apple Search trong khi chặn Applebot-Extended khỏi việc đào tạo mô hình trí tuệ nhân tạo. Google-Extended của Google hoàn toàn không phải là một trình thu thập dữ liệu thông thường; nó là một mã kiểm soát robots.txt.

Do đó, chính sách tốt nhất không chỉ đơn giản là “cho phép trí tuệ nhân tạo” hoặc “chặn trí tuệ nhân tạo.” Mà là tạo các quyền riêng biệt cho:

  1. Tìm kiếm và khám phá
  2. Truy xuất theo yêu cầu của người dùng
  3. Phát triển và đào tạo mô hình
  4. Tập dữ liệu công khai
  5. Tài liệu nhạy cảm, riêng tư hoặc bị hạn chế

Bài viết này cung cấp một danh sách kiểm kê trình thu thập dữ liệu hiện tại, các ví dụ về robots.txt, hướng dẫn về thẻ meta, phương pháp xác minh địa chỉ Giao thức Internet, lời khuyên về cấp phép Creative Commons, ngôn ngữ pháp lý mẫu và ma trận rủi ro-lợi ích.

Bốn biện pháp kiểm soát mà mọi nhà xuất bản nên hiểu

1. robots.txt kiểm soát việc thu thập dữ liệu theo yêu cầu

Một tệp robots.txt cho các client tự động tuân thủ biết những trang nào họ có thể yêu cầu. Nó hữu ích cho việc quản lý lưu lượng truy cập của trình thu thập dữ liệu và thể hiện các tùy chọn của nhà xuất bản.

Tuy nhiên, robots.txt không phải là một hệ thống kiểm soát truy cập. Giao thức loại trừ Robots quy định rằng các quy tắc của nó không phải là ủy quyền truy cập. Google cũng cảnh báo rằng một địa chỉ bị chặn vẫn có thể xuất hiện trong kết quả tìm kiếm nếu các trang khác liên kết đến nó. Sử dụng mật khẩu, xác thực hoặc kiểm soát truy cập phía máy chủ cho thông tin bảo mật. (rfc-editor.org)

2. Thẻ meta kiểm soát lập chỉ mục và đoạn trích

Các thẻ meta robots và tiêu đề phản hồi X-Robots-Tag có thể kiểm soát liệu một trang có được lập chỉ mục hay liệu một công cụ tìm kiếm có thể hiển thị một đoạn trích hay không.

Những kiểm soát này thường chỉ hiển thị sau khi trình thu thập dữ liệu được phép tìm nạp trang. Nếu robots.txt chặn trang trước, trình thu thập dữ liệu có thể không bao giờ thấy thẻ meta. (developers.google.com)

3. Kiểm soát mạng xác minh trình thu thập dữ liệu

Tên user-agent rất dễ sao chép. Một kẻ tấn công có thể gửi yêu cầu tự nhận là GPTBot, Googlebot hoặc PerplexityBot.

Một phương pháp tiếp cận mạnh mẽ hơn kết hợp:

  • User-agent được khai báo
  • Một phạm vi địa chỉ Giao thức Internet được công bố
  • Xác minh Hệ thống tên miền ngược
  • Xác minh Hệ thống tên miền xuôi
  • Giới hạn tốc độ và giám sát yêu cầu

4. Giấy phép cấp quyền tái sử dụng

Robots.txt nói về những gì một trình thu thập dữ liệu được yêu cầu thực hiện. Giấy phép nói về những gì cá nhân hoặc tổ chức có thể làm hợp pháp với tài liệu khi quyền tác giả được yêu cầu.

Đây là những công cụ khác nhau. Một giấy phép mở có thể giảm sự không chắc chắn về pháp lý, nhưng nó không đảm bảo rằng trình thu thập dữ liệu sẽ truy cập trang, rằng một mô hình sẽ sử dụng nó, hoặc rằng một trợ lý sẽ trích dẫn nó.

Danh sách kiểm kê các trình thu thập dữ liệu quan trọng

Danh sách kiểm kê sau đây đã được kiểm tra dựa trên tài liệu của nhà cung cấp có sẵn vào ngày 25 tháng 8 năm 2026. Tên user-agent, mục đích và phạm vi địa chỉ Giao thức Internet có thể thay đổi, vì vậy các hệ thống sản xuất nên sử dụng tài liệu hiện tại và nguồn cấp địa chỉ trực tiếp của nhà cung cấp.

Nhà cung cấpTrình thu thập dữ liệu hoặc mã robots.txtMục đích chínhKiểm soát quan trọng
OpenAIOAI-SearchBotTìm và phân tích các trang cho tìm kiếm của ChatGPTCho phép để cải thiện cơ hội các trang xuất hiện trong kết quả tìm kiếm của ChatGPT.
OpenAIGPTBotThu thập các trang có thể được sử dụng để đào tạo các mô hình trí tuệ nhân tạo tạo sinh của OpenAICho phép hoặc không cho phép riêng biệt với tìm kiếm.
OpenAIChatGPT-UserTìm nạp các trang sau khi người dùng yêu cầu ChatGPT hoặc một GPT tùy chỉnh truy cập chúngĐây là hành động do người dùng kích hoạt chứ không phải trình thu thập dữ liệu web tự động, vì vậy các quy tắc robots.txt có thể không áp dụng.
OpenAIOAI-AdsBotKiểm tra các trang web được gửi làm đích quảng cáo của ChatGPTChủ yếu liên quan đến nhà quảng cáo. Nội dung thu thập không được sử dụng để đào tạo các mô hình nền tảng trí tuệ nhân tạo tạo sinh.
GoogleGooglebotTrình thu thập dữ liệu chính của Google SearchKiểm soát việc thu thập dữ liệu tìm kiếm Google thông thường.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-NewsHình ảnh, video và Google NewsChúng có các mã robots.txt riêng biệt và có thể được kiểm soát độc lập.
GoogleGoogleOtherThu thập dữ liệu Google đa năng cho các nhóm sản phẩm khác nhau, bao gồm nghiên cứu và phát triểnNó không đại diện cho một sản phẩm Google cụ thể nào.
GoogleGoogle-ExtendedKiểm soát liệu nội dung được Google thu thập có thể được sử dụng để đào tạo mô hình Gemini và một số hệ thống nền tảng hay khôngĐây là một mã kiểm soát robots.txt, không phải là một user-agent yêu cầu riêng biệt. Nó không ảnh hưởng đến việc đưa vào Google Search thông thường.
AnthropicClaudeBotThu thập nội dung web công khai có thể đóng góp vào việc phát triển mô hình ClaudeKhông cho phép để báo hiệu rằng tài liệu trong tương lai nên được loại trừ khỏi tập dữ liệu đào tạo của Anthropic.
AnthropicClaude-SearchBotCải thiện chất lượng kết quả tìm kiếm của ClaudeCho phép để hiển thị trên tìm kiếm của Claude.
AnthropicClaude-UserTìm nạp các trang theo phản hồi yêu cầu của người dùng đối với ClaudeRiêng biệt với việc thu thập dữ liệu tự động.
PerplexityPerplexityBotLập chỉ mục các trang cho kết quả tìm kiếm của PerplexityPerplexity cho biết trình thu thập dữ liệu này không được sử dụng để thu thập nội dung cho việc đào tạo mô hình nền tảng trí tuệ nhân tạo.
PerplexityPerplexity-UserTìm nạp một trang sau khi người dùng yêu cầuTài liệu của Perplexity nói rằng trình tìm nạp này thường bỏ qua robots.txt vì yêu cầu được người dùng khởi tạo.
AppleApplebotHỗ trợ Apple Search, Spotlight, Siri, Safari và các trải nghiệm Apple khácCho phép để khám phá trên Apple.
AppleApplebot-ExtendedKiểm soát liệu nội dung được Applebot thu thập có thể được sử dụng để đào tạo các mô hình nền tảng của Apple hay khôngNó không tự thu thập dữ liệu các trang. Nó là một kiểm soát việc sử dụng dữ liệu.
Common CrawlCCBotThu thập dữ liệu web công cộng cho kho lưu trữ web mở của Common CrawlNó không phải là một trợ lý, nhưng các tập dữ liệu của nó có thể được sử dụng bởi các nhà nghiên cứu và nhà phát triển trí tuệ nhân tạo.
MicrosoftBingbotTrình thu thập dữ liệu chính của Bing searchCho phép để khám phá trên Bing và hiển thị trong tìm kiếm.
MicrosoftMicrosoftPreview, BingVideoPreviewXem trước trang và video cho các sản phẩm của MicrosoftNhững trình này có thể được kiểm soát riêng biệt với Bingbot.
AmazonAmzn-SearchBotTìm kiếm và khám phá nội dung của AmazonAmazon cho biết họ không thu thập nội dung để đào tạo mô hình trí tuệ nhân tạo tạo sinh.
AmazonAmzn-UserTìm nạp thông tin hiện tại theo phản hồi các hành động của người dùng, bao gồm các yêu cầu của AlexaDo người dùng kích hoạt và riêng biệt với việc thu thập dữ liệu tìm kiếm tự động.

OpenAI ghi lại các trình thu thập dữ liệu tìm kiếm, đào tạo, quảng cáo và do người dùng kích hoạt của mình dưới dạng các kiểm soát riêng biệt. Tài liệu của họ đặc biệt khuyến nghị cho phép OAI-SearchBot cho tìm kiếm của ChatGPT trong khi sử dụng GPTBot riêng biệt cho các tùy chọn đào tạo. (developers.openai.com)

Google cũng tương tự tách Googlebot, GoogleOtherGoogle-Extended. Google-Extended không có user-agent yêu cầu HTTP riêng, và việc chặn nó không loại bỏ một trang khỏi Google Search. (developers.google.com)

Anthropic ghi lại các vai trò riêng biệt cho ClaudeBot, Claude-SearchBot và Claude-User. Anthropic cũng tuyên bố rằng các bot của họ tuân theo robots.txt và hỗ trợ chỉ thị Crawl-delay không chuẩn. (support.anthropic.com)

Perplexity phân biệt giữa thu thập dữ liệu tìm kiếm tự động và tìm nạp theo yêu cầu của người dùng. Tài liệu hiện tại của họ nói rằng PerplexityBot tôn trọng robots.txt, trong khi Perplexity-User thường không tuân theo vì nó phản hồi một yêu cầu của người dùng. (docs.perplexity.ai)

Tài liệu hiện tại của Apple cũng có sự phân biệt tương tự giữa tìm kiếm và đào tạo: Applebot hỗ trợ khám phá, trong khi Applebot-Extended cho phép các nhà xuất bản kiểm soát việc sử dụng cho đào tạo mà không loại bỏ các trang khỏi Apple Search. (support.apple.com)

Các cấu hình robots.txt được đề xuất

Đặt robots.txt tại gốc của mỗi máy chủ, ví dụ:

text https://www.example.org/robots.txt

Các quy tắc áp dụng cho máy chủ, giao thức và cổng cụ thể nơi tệp được phục vụ. Một tên miền phụ riêng có thể cần tệp riêng của nó. (developers.google.com)

Cấu hình 1: Khả năng tiếp cận tối đa

Sử dụng cấu hình này khi nội dung biên tập công cộng có thể được tìm thấy, tóm tắt, trích dẫn, lập chỉ mục và thu thập bởi các trình thu thập dữ liệu tuân thủ.

text

Các trang công cộng có sẵn cho các trình thu thập dữ liệu tuân thủ.

User-agent: * Allow: /

Giữ các đường dẫn riêng tư, giao dịch và quản trị bên ngoài.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Điều này cho phép các trình thu thập dữ liệu được đặt tên, bao gồm OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft và Amazon, trừ khi có một quy tắc cụ thể khác chặn chúng.

Không đặt một quy tắc chung như User-agent: * Disallow: / bên dưới cấu hình này. Một nhóm sau hoặc cụ thể hơn có thể thay đổi cách trình thu thập dữ liệu diễn giải tệp.

Cấu hình 2: Cho phép tìm kiếm nhưng chặn các trình thu thập dữ liệu phát triển mô hình

Đây thường là sự thỏa hiệp tốt nhất cho các nhà xuất bản muốn có trích dẫn và lưu lượng tìm kiếm nhưng không muốn ra hiệu cho phép thu thập để phát triển mô hình.

text

Chặn việc thu thập dữ liệu phát triển mô hình của OpenAI.

User-agent: GPTBot Disallow: /

Chặn việc thu thập dữ liệu phát triển mô hình của Anthropic.

User-agent: ClaudeBot Disallow: /

Chặn việc đào tạo mô hình của Google và việc sử dụng để căn cứ liên quan.

User-agent: Google-Extended Disallow: /

Chặn việc sử dụng để đào tạo mô hình nền tảng của Apple.

User-agent: Applebot-Extended Disallow: /

Tùy chọn: chặn thu thập tập dữ liệu của Common Crawl.

User-agent: CCBot

Disallow: /

Cho phép thu thập dữ liệu tìm kiếm và truy xuất thông thường, ngoại trừ các đường dẫn nhạy cảm.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

Cấu hình này để OAI-SearchBot, Claude-SearchBot, PerplexityBot, GooglebotApplebot được bao phủ bởi nhóm ký tự đại diện. Nó cũng giữ các quyền tìm kiếm và đào tạo riêng biệt.

Đối với Apple, việc chặn Applebot-Extended trong khi cho phép Applebot vẫn bảo toàn khả năng khám phá thông qua các dịch vụ của Apple. Đối với Google, việc chặn Google-Extended không chặn tìm kiếm Google thông thường. (developers.google.com)

Cấu hình 3: Cho phép rõ ràng các trình thu thập dữ liệu tìm kiếm được chọn

Nếu một tệp robots.txt hiện có chặn tất cả các trình thu thập dữ liệu, hãy thêm các nhóm riêng biệt cho các trình thu thập dữ liệu tìm kiếm mà bạn muốn chào đón.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Giữ tất cả các trình thu thập dữ liệu khác bên ngoài.

User-agent: * Disallow: /

Khi sử dụng các nhóm cụ thể, hãy lặp lại các quy tắc đường dẫn nhạy cảm bên trong mỗi nhóm. Một số trình thu thập dữ liệu sử dụng nhóm khớp cụ thể nhất thay vì kết hợp nó với nhóm ký tự đại diện. Bing ghi lại hành vi này trực tiếp, và Google cung cấp hướng dẫn riêng về các nhóm cụ thể cho trình thu thập dữ liệu. (bing.com)

Các hạn chế quan trọng của robots.txt

  • Một trình thu thập dữ liệu có thể bỏ qua robots.txt.
  • Một trình thu thập dữ liệu độc hại có thể giả vờ là một trình thu thập dữ liệu đáng tin cậy.
  • Một trang bị chặn vẫn có thể được biết đến qua tiêu đề hoặc địa chỉ web của nó.
  • Robots.txt không bảo vệ mật khẩu, tệp riêng tư, hồ sơ khách hàng hoặc giao diện lập trình ứng dụng bảo mật.
  • Một chỉ thị Crawl-delay không phải là một phần của Giao thức loại trừ Robots cốt lõi và không được mọi trình thu thập dữ liệu hỗ trợ. Anthropic và Bing ghi lại sự hỗ trợ, trong khi Apple nói rằng Applebot không tuân theo crawl-delay. (rfc-editor.org)

Thẻ Meta và Tiêu đề HTTP

Ví dụ về trang công khai

Đối với một bài viết công khai, hãy sử dụng tiêu đề rõ ràng, tác giả, địa chỉ web chuẩn hóa, ngày xuất bản và ngày sửa đổi.

html

Chỉ thị max-snippet chủ yếu được ghi lại cho Google. Đừng cho rằng mọi trình thu thập dữ liệu trí tuệ nhân tạo đều hỗ trợ mọi chỉ thị meta.

Ví dụ về trang riêng tư hoặc nhạy cảm

html

Sử dụng điều này cho các trang không nên xuất hiện trong kết quả tìm kiếm. Trang phải duy trì khả năng thu thập dữ liệu đủ lâu để trình thu thập dữ liệu thấy chỉ thị. Nếu trang thực sự phải duy trì riêng tư, hãy sử dụng xác thực hoặc bảo vệ bằng mật khẩu thay thế. (developers.google.com)

Chỉ ẩn các phần nhạy cảm khỏi đoạn trích tìm kiếm

Google hỗ trợ data-nosnippet cho các phần cụ thể của trang HTML:

html

Đoạn văn này có thể được hiển thị trong kết quả tìm kiếm.

Số điện thoại cá nhân, địa chỉ email riêng tư hoặc ghi chú nội bộ đặt ở đây.

Điều này hữu ích cho các chi tiết liên hệ, ghi chú nội bộ hoặc thông tin do người dùng tạo. Nó không phải là một hướng dẫn chung cho mọi hệ thống trí tuệ nhân tạo. (developers.google.com)

Sử dụng tiêu đề X-Robots-Tag cho các tệp

Thẻ meta không thể được đặt bên trong tệp tài liệu di động, hình ảnh hoặc tệp video. Thay vào đó, hãy sử dụng tiêu đề phản hồi HTTP:

text X-Robots-Tag: noindex, nosnippet

Đối với một trang nên vẫn có thể tìm kiếm được nhưng không nên cung cấp văn bản cho đoạn trích hoặc câu trả lời trí tuệ nhân tạo, hãy sử dụng:

text X-Robots-Tag: nosnippet

Google ghi lại X-Robots-Tag cho các tài nguyên không phải HTML, và Apple cũng hỗ trợ nó cho Applebot. (developers.google.com)

Kiểm soát dành riêng cho Apple

Apple hỗ trợ:

html

Apple cho biết nosnippet ngăn trang được sử dụng làm ngữ cảnh bổ sung và nội dung hiện tại khi các mô hình của Apple tạo ra đầu ra. Trang vẫn có thể được khám phá thông qua Apple Search, Spotlight, Siri và Safari. (support.apple.com)

Đối với các trang có tường phí, Apple cũng hỗ trợ dữ liệu có cấu trúc bằng cách sử dụng:

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Apple cho biết các trang như vậy có thể vẫn đủ điều kiện cho kết quả tìm kiếm nhưng sẽ không được sử dụng làm ngữ cảnh bổ sung cho các câu trả lời trí tuệ nhân tạo. (support.apple.com)

Cách xác minh địa chỉ Giao thức Internet của trình thu thập dữ liệu

Tại sao việc khớp user-agent là chưa đủ

Một quy tắc như thế này là yếu:

text if User-Agent contains "GPTBot": allow

Bất cứ ai cũng có thể gửi văn bản đó. Một quy tắc tốt hơn là:

text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block

Đừng tin tưởng tiêu đề X-Forwarded-For trừ khi nó đến từ một proxy hoặc mạng phân phối nội dung mà tổ chức của bạn kiểm soát.

Phương pháp xác minh của nhà cung cấp

Nhà cung cấpPhương pháp xác minh được đề xuất
OpenAISử dụng nguồn cấp địa chỉ Giao thức Internet trực tiếp được công bố trong tài liệu trình thu thập dữ liệu của OpenAI cho OAI-SearchBot, GPTBot và OAI-AdsBot. Làm mới chúng tự động thay vì sao chép các phạm vi cố định vào tường lửa.
GoogleSử dụng các phạm vi trình thu thập dữ liệu được Google công bố hoặc thực hiện kiểm tra Hệ thống tên miền ngược và xuôi. Một trình thu thập dữ liệu Google chính hãng phải phân giải thành tên máy chủ Google được phê duyệt và phân giải ngược lại thành địa chỉ gốc.
AnthropicSử dụng nguồn cấp địa chỉ trình thu thập dữ liệu được công bố hiện tại làm kiểm tra mạng phụ. Phương pháp từ chối chính của Anthropic vẫn là robots.txt.
PerplexityKết hợp user-agent với nguồn cấp địa chỉ PerplexityBot hoặc Perplexity-User hiện tại. Perplexity đặc biệt khuyến nghị kết hợp cả hai điều kiện trong một quy tắc Tường lửa ứng dụng web.
AppleSử dụng xác minh Hệ thống tên miền ngược dưới applebot.apple.com, sau đó thực hiện tra cứu xuôi. Apple cũng công bố các phạm vi địa chỉ hiện tại trong một nguồn cấp dữ liệu JSON.
Common CrawlSử dụng xác minh Hệ thống tên miền ngược dưới crawl.commoncrawl.org và nguồn cấp địa chỉ CCBot hiện tại. Common Crawl lưu ý rằng xác minh ngược vẫn chưa có sẵn cho một số lưu lượng IPv6.
MicrosoftSử dụng công cụ Verify Bingbot chính thức hoặc các phương pháp tra cứu ngược và xuôi được Microsoft ghi lại.
AmazonSử dụng danh sách địa chỉ trình thu thập dữ liệu được Amazon công bố và khớp chúng với user-agent Amazon thích hợp.

Google, Apple, Common Crawl, OpenAI, Anthropic và Perplexity đều công bố các phương pháp hoặc nguồn cấp địa chỉ cụ thể của nhà cung cấp. Những danh sách này có thể thay đổi, vì vậy một quy trình cập nhật theo lịch trình an toàn hơn danh sách được sao chép thủ công vĩnh viễn. (developers.google.com)

Một thiết kế tường lửa đơn giản có thể trông như thế này:

text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match

rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers

Đừng áp dụng một quy tắc cho phép rộng rãi cho toàn bộ nhà cung cấp đám mây. Một trình thu thập dữ liệu hợp pháp có thể sử dụng cơ sở hạ tầng đám mây, nhưng hầu hết lưu lượng từ nhà cung cấp đám mây đó không nhất thiết là trình thu thập dữ liệu.

Cách Cấp phép Mở ảnh hưởng đến Khả năng tiếp cận

CC BY 4.0 bằng ngôn ngữ đơn giản

Giấy phép Creative Commons Ghi công 4.0 Quốc tế, thường được gọi là CC BY 4.0, cho phép mọi người:

  • Sao chép và phân phối lại tác phẩm
  • Điều chỉnh, dịch, phối lại và xây dựng dựa trên nó
  • Sử dụng nó cho mục đích thương mại

Các điều kiện chính là:

  • Ghi công thích hợp
  • Liên kết đến giấy phép
  • Cho biết liệu có thay đổi nào được thực hiện hay không
  • Không gợi ý rằng người tạo ban đầu xác nhận việc tái sử dụng
  • Không thêm các hạn chế pháp lý hoặc kỹ thuật ngăn cản việc sử dụng được giấy phép cho phép

Creative Commons cũng cảnh báo rằng giấy phép có thể không bao gồm quyền riêng tư, quyền công khai, quyền nhân thân, quyền nhãn hiệu, quyền bằng sáng chế hoặc tài liệu của bên thứ ba. (creativecommons.org)

Bản thân giấy phép không phải là lời mời trình thu thập dữ liệu

Việc đặt “CC BY 4.0” trên một trang không đảm bảo rằng một tổ chức sẽ thu thập dữ liệu trang đó. Một trình thu thập dữ liệu vẫn có thể bị chặn bởi:

  • robots.txt
  • Mạng phân phối nội dung
  • Tường lửa ứng dụng web
  • Giới hạn tốc độ
  • Thử thách JavaScript
  • Tường đăng nhập
  • Phản hồi máy chủ kém
  • Sơ đồ trang web không thể truy cập

Ngược lại, việc cho phép trình thu thập dữ liệu không tự động cấp mọi quyền tác giả cần thiết cho mọi mục đích sử dụng sau này. Robots.txt và việc cấp phép nên được thiết kế cùng nhau.

Tại sao CC BY có thể hỗ trợ khả năng tiếp cận rộng hơn

Một giấy phép mở rõ ràng có thể làm cho chính sách của nhà xuất bản dễ hiểu hơn đối với các nhóm dữ liệu, hệ thống tìm kiếm và người vận hành trợ lý. Nó có thể giảm sự không chắc chắn về việc sao chép, điều chỉnh, sử dụng thương mại, dịch thuật và phân phối lại khi các hoạt động đó yêu cầu quyền tác giả.

Tuy nhiên, Creative Commons giải thích rằng việc đào tạo trí tuệ nhân tạo rất phức tạp về mặt pháp lý. Một giấy phép hạn chế không phải lúc nào cũng là một cách hiệu quả để ngăn chặn việc đào tạo, bởi vì một số mục đích sử dụng cho đào tạo có thể được phép theo các ngoại lệ hoặc giới hạn về bản quyền. Creative Commons cũng lưu ý rằng các điều kiện giấy phép có thể khó áp dụng cho đào tạo máy và đầu ra mô hình. (creativecommons.org)

Bài học thực tiễn là:

Sử dụng CC BY khi bạn thực sự muốn tái sử dụng hợp pháp rộng rãi. Đừng sử dụng giấy phép Creative Commons hạn chế như một sự từ chối đào tạo trí tuệ nhân tạo được đảm bảo.

Ghi công cải thiện sự rõ ràng của nguồn

Creative Commons khuyến nghị phương pháp TASL:

  • Tiêu đề
  • Tác giả
  • Nguồn
  • Giấy phép

Ví dụ:

“Cấp phép và Robots để Tối đa hóa khả năng Tiếp cận,” Example Publishing, https://www.example.org/articles/ai-crawlers, được cấp phép theo Creative Commons Ghi công 4.0 Quốc tế. Thay đổi đã thực hiện: cập nhật danh sách kiểm kê trình thu thập dữ liệu.

Ghi công rõ ràng không buộc mọi trợ lý phải trích dẫn một trang. Nó làm cho việc trích dẫn chính xác dễ dàng hơn khi một hệ thống trích xuất tiêu đề, tác giả, nguồn và thông tin cấp phép của trang. (wiki.creativecommons.org)

Thêm thông tin bài viết có cấu trúc

Sử dụng thông tin hiển thị và dữ liệu có cấu trúc cùng nhau:

html

Google khuyến nghị thông tin tác giả rõ ràng, trang tác giả, ngày xuất bản, ngày sửa đổi và các trang chuẩn hóa ổn định. Những tín hiệu này có thể giúp các hệ thống tìm kiếm hiểu ai đã tạo ra tài liệu và phiên bản nào là có thẩm quyền. Chúng không đảm bảo xếp hạng, khả năng tiếp cận hoặc trích dẫn. (developers.google.com)

Ngôn ngữ pháp lý mẫu cho một trang web mở, thân thiện với trích dẫn

Những điều sau đây là ngôn ngữ mẫu, không phải lời khuyên pháp lý. Hãy để luật sư điều chỉnh cho phù hợp với khu vực pháp lý, cấu trúc sở hữu, nghĩa vụ bảo mật quyền riêng tư và nội dung của bên thứ ba của bạn.

Tuyên bố cấp phép CC BY 4.0

text

Giấy phép nội dung

Trừ khi có quy định khác, văn bản gốc và tài liệu biên tập gốc trên trang này được cấp phép theo giấy phép Creative Commons Ghi công 4.0 Quốc tế:

https://creativecommons.org/licenses/by/4.0/

Sự cho phép này cho phép sao chép, phân phối lại, điều chỉnh, dịch thuật, sử dụng thương mại, xử lý có thể đọc được bằng máy, lập chỉ mục tìm kiếm, truy xuất, tóm tắt và sử dụng trong các hệ thống trí tuệ nhân tạo, với điều kiện tuân thủ các điều khoản giấy phép.

Ghi công ưu tiên:

“[Tiêu đề trang],” bởi [tác giả hoặc tổ chức], [địa chỉ trang chuẩn hóa], xuất bản hoặc cập nhật [ngày], được cấp phép theo Creative Commons Ghi công 4.0 Quốc tế. Thay đổi đã thực hiện: [mô tả các thay đổi, hoặc ghi ‘không’].

Vui lòng giữ nguyên thông tin tác giả, nhà xuất bản, nguồn, giấy phép và sửa đổi bất cứ khi nào có thể. Hướng dẫn ghi công ưu tiên này không bổ sung hạn chế vào giấy phép Creative Commons và không thay thế văn bản giấy phép.

Cụm từ “bao gồm các hệ thống trí tuệ nhân tạo” làm rõ ý định của nhà xuất bản. Nó không nên được sử dụng để giả vờ rằng nhà xuất bản sở hữu quyền đối với tài liệu được tạo bởi người khác.

Thông báo về thương hiệu, quyền riêng tư và quyền của bên thứ ba

text

Thương hiệu, quyền riêng tư và quyền của bên thứ ba

Giấy phép trên chỉ bao gồm các tài liệu gốc được xác định là có giấy phép. Nó không cấp quyền sử dụng:

  • Nhãn hiệu, nhãn hiệu dịch vụ, logo hoặc bao bì thương mại
  • Tên, hình ảnh hoặc chân dung của người
  • Thông tin riêng tư, bảo mật, tài khoản, sức khỏe, tài chính hoặc bảo mật
  • Nội dung do người dùng gửi trừ khi chúng được xác định riêng là có giấy phép
  • Ảnh, minh họa, bản đồ, video, nhạc, trích dẫn hoặc các tài liệu khác của bên thứ ba
  • Nội dung được xác định là “bảo lưu mọi quyền” hoặc tuân theo một giấy phép riêng biệt

Việc sử dụng tên, logo và nhãn hiệu của Example Publishing không được gợi ý sự tài trợ, chấp thuận, hợp tác hoặc xác nhận. Vui lòng liên kết đến trang gốc và phân biệt rõ ràng trích dẫn, diễn giải, tóm tắt và tài liệu được tạo.

Ngôn ngữ này rất quan trọng vì các giấy phép Creative Commons không tự động cấp mọi loại quyền pháp lý liên quan đến một trang. (creativecommons.org)

Hướng dẫn trích dẫn tìm kiếm và trợ lý

text

Hướng dẫn trích dẫn tìm kiếm và trợ lý

Chúng tôi hoan nghênh việc lập chỉ mục tìm kiếm tuân thủ, truy xuất theo yêu cầu của người dùng, trích dẫn và tóm tắt tài liệu được cấp phép trên trang web này.

Khi trích dẫn trang web này, vui lòng sử dụng tiêu đề trang, tác giả hoặc nhà xuất bản, địa chỉ trang chuẩn hóa, ngày xuất bản hoặc cập nhật, và liên kết trực tiếp đến nguồn. Vui lòng xác định nguồn là một trong số các nguồn đã sử dụng, phân biệt phân tích được tạo ra với tài liệu được trích dẫn, và không nêu hoặc ngụ ý rằng Example Publishing xác nhận một câu trả lời, sản phẩm, người hoặc dịch vụ được tạo.

Hướng dẫn này nhằm mục đích cải thiện độ chính xác và ghi công. Nó không cấp quyền vượt quá giấy phép nội dung áp dụng và không cấp phép nhãn hiệu, thông tin cá nhân, thông tin bảo mật hoặc tài liệu của bên thứ ba.

Nếu bạn muốn hiển thị trong tìm kiếm nhưng không muốn cấp giấy phép đào tạo rộng rãi

text

Truy cập tìm kiếm và bản quyền

Các trang công khai của chúng tôi có thể được truy cập bởi các trình thu thập dữ liệu tìm kiếm và truy xuất tuân thủ được xác định trong tệp robots.txt của chúng tôi. Quyền này nhằm mục đích hỗ trợ khám phá, kết quả tìm kiếm, truy xuất theo yêu cầu của người dùng và trích dẫn.

Trừ khi có giấy phép riêng được hiển thị, nội dung gốc vẫn bảo lưu mọi quyền. Việc truy cập một trang công khai không cấp giấy phép riêng cho việc phát triển mô hình, đào tạo, phân phối lại, tái sử dụng thương mại hoặc tạo ra các tác phẩm phái sinh vượt quá quyền được cung cấp bởi luật pháp hiện hành.

Vui lòng trích dẫn địa chỉ trang chuẩn hóa và nhà xuất bản khi đề cập đến tài liệu này. Không có gì trên trang web này cấp quyền sử dụng nhãn hiệu, logo, thông tin cá nhân, thông tin bảo mật hoặc nội dung của bên thứ ba.

Không đặt tuyên bố CC BY và tuyên bố bảo lưu mọi quyền trên cùng một tài liệu. Xác định rõ ràng giấy phép nào áp dụng cho nội dung nào.

Ma trận Rủi ro-Lợi ích cho Cấp phép Mở

Luật bản quyền và các quy tắc đào tạo trí tuệ nhân tạo khác nhau tùy theo quốc gia và vẫn chưa được giải quyết. Văn phòng Bản quyền Hoa Kỳ tiếp tục xem xét các vấn đề này, trong khi Creative Commons mô tả việc đào tạo trí tuệ nhân tạo là đặc thù theo từng trường hợp và phức tạp về mặt pháp lý. (copyright.gov)

Cách tiếp cậnTiềm năng tiếp cậnLợi ích chínhRủi ro chínhPhù hợp nhất
CC BY 4.0Rất caoSao chép, điều chỉnh, sử dụng thương mại, dịch thuật, lập chỉ mục và tái sử dụng liên quan đến mô hình rộng rãi khi quyền tác giả được yêu cầuCác đối thủ cạnh tranh thương mại có thể tái sử dụng hoặc điều chỉnh nội dung; việc ghi công có thể không hoàn hảo; giấy phép không thể kiểm soát quyền riêng tư, nhãn hiệu hoặc quyền của bên thứ baCác nhà xuất bản muốn tái sử dụng hợp pháp rộng rãi nhất và ghi công nguồn mạnh mẽ
CC BY-SA 4.0Cao, nhưng phức tạp hơnKhuyến khích chu trình chia sẻ mở và yêu cầu các bản điều chỉnh phải tuân theo các điều khoản tương thíchCác quy tắc Chia sẻ tương tự có thể khó áp dụng cho tập dữ liệu, đào tạo mô hình và đầu ra công khai; một số tổ chức có thể tránh tài liệu vì sự không chắc chắnCác dự án giáo dục mở và vì lợi ích công cộng muốn các bản điều chỉnh hạ nguồn vẫn mở
CC BY-NC 4.0Trung bình hoặc thấpGiới hạn các mục đích sử dụng chủ yếu nhằm mục đích lợi thế thương mại hoặc bồi thường tiền tệ“Phi thương mại” có thể khó hiểu; có thể loại trừ các mục đích sử dụng thương mại cho tìm kiếm, mô hình và trợ lý; nó không phải là sự từ chối đào tạo được đảm bảoTài liệu dành cho mục đích phi lợi nhuận, giáo dục hoặc cộng đồng
CC BY-ND 4.0Trung bìnhCho phép chia sẻ trong khi giới hạn các bản điều chỉnhDịch thuật, chuyển đổi và một số trường hợp sử dụng trợ lý có thể trở nên không chắc chắn về mặt pháp lý; ít hấp dẫn hơn đối với các hệ thống tóm tắt hoặc phối lạiThông báo chính thức hoặc các tác phẩm phải giữ nguyên không thay đổi
CC0 hoặc hiến tặng vào phạm vi công cộngRất caoĐơn giản hóa việc tái sử dụng và loại bỏ hầu hết các điều kiện bản quyền nếu có hiệu lực pháp lýKhông yêu cầu ghi công; kiểm soát yếu đối với việc trình bày thương hiệu; quyền riêng tư, nhãn hiệu và quyền công khai vẫn riêng biệtSự kiện, tập dữ liệu, tài liệu tham khảo hoặc các tác phẩm dành cho việc tái sử dụng không hạn chế
Bảo lưu mọi quyền cộng với thu thập dữ liệu tìm kiếm mởCao cho tìm kiếm, thấp hơn cho đào tạoCó thể bảo toàn khả năng hiển thị tìm kiếm và trích dẫn mà không cần cấp giấy phép tái sử dụng rộng rãiSự không chắc chắn về pháp lý hơn cho các nhà phát triển mô hình; có thể làm giảm khả năng đưa vào tập dữ liệu đào tạo và hệ thống tái sử dụng thương mạiCác nhà xuất bản muốn khám phá và trích dẫn nhưng muốn đàm phán các giấy phép rộng hơn một cách riêng biệt

Chiến lược cân bằng nhất cho nhiều tổ chức là:

  • CC BY 4.0 cho văn bản biên tập công khai gốc
  • Nhãn riêng cho tài liệu của bên thứ ba
  • Không có thông tin cá nhân hoặc bảo mật công khai
  • Cho phép các trình thu thập dữ liệu tìm kiếm và truy xuất
  • Chỉ cho phép các trình thu thập dữ liệu phát triển mô hình nếu tổ chức thực sự chấp nhận việc sử dụng đó
  • Sử dụng ghi công rõ ràng và các liên kết chuẩn hóa
  • Bảo vệ nhãn hiệu thông qua một thông báo thương hiệu riêng biệt

Danh sách kiểm tra triển khai thực tế

Nội dung và cấp phép

  • Xác định chủ sở hữu của từng trang, hình ảnh, biểu đồ, video và trích dẫn.
  • Chỉ cấp phép cho tài liệu mà tổ chức của bạn kiểm soát quyền.
  • Đánh dấu riêng tài liệu của bên thứ ba.
  • Thêm tuyên bố cấp phép hiển thị rõ ràng.
  • Cung cấp trích dẫn ưu tiên bằng cách sử dụng tiêu đề, tác giả, nguồn và giấy phép.
  • Giữ logo, nhãn hiệu, dữ liệu cá nhân và thông tin bảo mật nằm ngoài phạm vi được cấp phép.

Robots.txt

  • Tạo một tệp robots.txt công khai tại gốc của mỗi máy chủ.
  • Cho phép các trình thu thập dữ liệu tìm kiếm riêng biệt với các trình thu thập dữ liệu đào tạo.
  • Chặn các đường dẫn quản trị, tài khoản, thanh toán, riêng tư và ứng dụng nội bộ.
  • Không dựa vào robots.txt để bảo mật.
  • Kiểm tra tệp sau mỗi lần triển khai trang web lớn.

Thẻ meta

  • Sử dụng các liên kết chuẩn hóa.
  • Thêm tác giả, ngày xuất bản và ngày sửa đổi.
  • Sử dụng noindex cho các trang không nên xuất hiện trong tìm kiếm.
  • Sử dụng nosnippet hoặc data-nosnippet cho các đoạn trích nhạy cảm (nếu được hỗ trợ).
  • Sử dụng X-Robots-Tag cho các tệp tài liệu di động, hình ảnh và các tài nguyên không phải HTML khác.
  • Hãy nhớ rằng trình thu thập dữ liệu phải có khả năng tìm nạp một trang trước khi nó có thể đọc các thẻ meta của trang đó.

Bảo mật mạng

  • Ghi lại chuỗi user-agent, địa chỉ nguồn, mã phản hồi và đường dẫn yêu cầu.
  • Xác minh các trình thu thập dữ liệu đáng tin cậy bằng cách sử dụng nguồn cấp địa chỉ chính thức hoặc các phương pháp Hệ thống tên miền.
  • Làm mới nguồn cấp địa chỉ tự động.
  • Kết hợp kiểm tra user-agent và địa chỉ nguồn.
  • Giới hạn tốc độ các trình thu thập dữ liệu đã xác minh thay vì cấp cho chúng quyền truy cập không giới hạn.
  • Thách thức hoặc chặn các yêu cầu tự nhận là trình thu thập dữ liệu đáng tin cậy nhưng không vượt qua xác minh.

Đo lường

Theo dõi:

  • Lượt truy cập từ các dịch vụ tìm kiếm trí tuệ nhân tạo
  • Lượt giới thiệu đến trang gốc
  • Tần suất trích dẫn
  • Tải máy chủ theo trình thu thập dữ liệu
  • Các yêu cầu trả về 403, 404 hoặc 429
  • Truy cập của trình thu thập dữ liệu vào các đường dẫn không mong muốn
  • Liệu các bài viết hiện tại có được tìm thấy sau khi xuất bản hay không

Kết luận

Khả năng tiếp cận tối đa đòi hỏi sự cởi mở có chọn lọc, không phải một quyền cho phép chung chung duy nhất.

Sử dụng robots.txt để tách biệt việc thu thập dữ liệu tìm kiếm, truy xuất của người dùng, đào tạo và tập dữ liệu công khai. Sử dụng các thẻ meta và tiêu đề HTTP để quản lý lập chỉ mục và đoạn trích. Sử dụng xác thực cho bất kỳ điều gì riêng tư. Xác minh địa chỉ Giao thức Internet của trình thu thập dữ liệu thay vì chỉ tin tưởng vào tên user-agent.

Một giấy phép mở như CC BY 4.0 có thể làm cho việc tái sử dụng rộng rãi dễ dàng hơn khi bạn thực sự muốn nó. Thông tin ghi công rõ ràng—tiêu đề, tác giả, nguồn, giấy phép, trang chuẩn hóa và ngày cập nhật—cũng có thể giúp các hệ thống tìm kiếm và trợ lý dễ dàng xác định và trích dẫn nguồn chính xác hơn.

Do đó, chính sách xuất bản mạnh mẽ nhất là:

**Mở nội dung công khai bạn muốn được khám phá, cấp phép rõ ràng tài liệu bạn muốn tái sử dụng, đánh dấu tài liệu bạn không sở hữu, bảo vệ thông tin riêng tư ở cấp độ máy chủ và cấp cho mọi trình thu thập dữ liệu một quyền riêng biệt, có thể xem xét.

Bài viết liên quan

Thích nội dung này?

Đăng ký nhận bản tin của chúng tôi để biết thông tin chi tiết về content marketing và hướng dẫn tăng trưởng mới nhất.

Bài viết này chỉ dành cho mục đích thông tin. Nội dung và chiến lược có thể thay đổi tùy theo nhu cầu cụ thể của bạn.
Cấp phép và Robots để Tối đa hóa khả năng Tiếp cận: Cách Chào đón Trình thu thập dữ liệu AI | AutoPod